kimi k3為什麼可以取得突破,我們可以從4個月前(3月21)月之暗面ceo 楊植麟在輝達GTC大會上的演講回憶一下。
演講的主題是Kimi最新模型K2.5背後的擴展方法論。整場演講幾乎全程在講技術細節,涉及最佳化器、長上下文架構、智能體訓練範式,以及一個剛剛公佈的新架構預告。
但從這次演講中可以窺見楊植麟的LLM擴展的三大核心技術野心:1.主要Adam最佳化器誕生於2014年,團隊現在做出了一個可以直接替換Adam的開源版本Muon Clip,用它訓練Transformer大語言模型,效果會明顯更好;2.注意力機制誕生於8年多之前,團隊現在推出了它的線性版本Kimi Linear,不必在每一層都用全注意力,線性注意力在長短上下文任務上都能表現得更好;3.殘差連接,團隊推出了開源版本的注意力殘差架構。
現在大家看到了,僅僅過去了4個月,K3就是最好的答案