人工智慧產業正在面臨一個新的矛盾。
模型越來越強。但讓模型運作的成本,也正在快速增加。
過去幾年的AI競賽建立在一個簡單假設:
只要投入更多GPU、更大的資料中心、更高昂資本,就能打造更強大的模型。
但當大型模型開始進入數千億甚至兆級參數規模後,問題開始改變。
現在真正困難的問題不是:「如何把模型做大?」
而是:「如何讓如此龐大的模型,在有限的晶片、能源與成本條件下運行?」
這也是Moonshot AI推出Kimi K3,以及DeepSeek系列模型受到關注的真正原因。
它們代表一個新的AI競爭方向:
Efficiency First(效率優先)。
未來AI領先者,不一定是擁有最多GPU的公司。
筆者透過 AIMochi 筆記工具,整理多方公開資訊和最新報導內容,發現未來可能是屬於:能讓每一顆GPU產生最高智慧密度的公司。
過去大型語言模型(Large Language Model, LLM)的進步,很大程度依靠擴大規模。
增加:模型參數、訓練資料
GPU數量
計算時間
通常可以提升模型能力。
但當模型規模持續增加後,一個新的問題浮現:
模型變強的速度,開始追不上成本增加的速度。
一個大型模型從訓練到部署,需要面對三個成本:
1. 訓練成本
需要大量GPU長時間運算。
包括:
模型訓練
參數更新
資料處理
2. 推論成本
模型真正商業化後,每一次使用都需要消耗計算資源。
例如,使用者要求AI:
撰寫報告
分析資料
生成程式
處理文件
背後都需要GPU運算。
3. 部署成本
大型模型通常需要分布在多張GPU甚至多個資料中心。
因此:模型越大,硬體配置越複雜。
這代表AI產業面臨一個核心矛盾:
如果未來所有AI能力提升,都只能依靠增加更多GPU,那麼AI的普及速度將受到成本限制。
Moonshot AI(中國人工智慧公司「月之暗面」)推出的Kimi系列,特別是Kimi K3,代表一種新的模型設計方向。
它的核心思想不是:「讓模型變小」。
而是:「讓大型模型不要每一次都使用全部能力。」
這個概念來自:Mixture of Experts(MoE,混合專家模型)
MoE並不是新概念。
但近年隨著大型模型需求增加,成為降低運算成本的重要方向。
傳統模型可以想像成:
一間公司所有員工同時參與每個決策。
無論問題是:寫程式、翻譯、還是數學推理,所有人都必須投入。
MoE模型則不同。
它建立許多不同能力的「專家」。
例如:
語言理解專家
程式專家
數學推理專家
知識檢索專家
當模型收到問題時,Router(路由機制)會判斷:
「這個問題需要哪些專家?」
然後只啟動相關部分。
因此,模型可以擁有非常大的總參數量,但實際運算只使用其中一部分。
這是AI產業正在改變的重要觀念。
過去:模型參數越多,
代表:成本越高。
但MoE架構改變了這個關係。
例如DeepSeek-V3,根據其技術報告:
總參數量:約6710億(671B)
每個token實際啟動參數:約370億(37B)
也就是:模型保留巨大知識容量,但每一次生成只使用部分能力。
這代表,未來AI模型可能同時追求兩件事:
更大的模型容量
更低的實際運算成本
這也是為什麼Kimi K3與DeepSeek值得放在一起討論。
它們共同代表:AI模型的下一階段,不是追求最大,而是追求最高「智慧密度」。
很多人以為MoE只是:「把模型切成很多小部分」。
但真正困難的是,如何決定:
哪個問題交給哪個專家?
這需要一個核心元件:
Router(路由器)
Router負責:
分析輸入資訊。
計算不同專家的適配程度。
選擇最佳組合。
但當專家數量增加:
問題也變得更複雜。
例如:Kimi K3類型模型可能包含大量專家。
如果Router判斷失誤:
可能造成:
某些專家過度使用
某些專家閒置
模型訓練不平衡
因此,MoE真正的技術競爭,不只是增加專家數量。
而是:如何建立更聰明、更穩定的專家分配機制。
這也是原始研究中提到的:
Expert balancing
Router optimization
Load balancing
等問題。
以上僅供參考與資訊分享之用!若想快速了解更多資訊,透過 AIMochi 台灣本土筆記工具,幫我們從海量資料中,梳理出關鍵資訊,讓我們精準掌握重要訊息!