太長不看
1.Kimi K3以KDA線性注意力與MLA全注意力按3∶1交錯,既保留全域建模能力,又壓縮歷史記憶,實現預填充線性擴展和解碼恆定複雜度。
2.逐通道遺忘門、Delta規則和FlashKDA分塊平行可穩定更新關聯記憶,減輕長上下文的計算與快取壓力;但MLA會增加預填充成本,智能體負載下仍有最佳化空間。
Kimi K3以KDA線性注意力與MLA全注意力按3∶1交錯,既保留全域建模能力,又壓縮歷史記憶,實現預填充線性擴展和解碼恆定複雜度。逐通道遺忘門、Delta規則和FlashKDA分塊平行可穩定更新關聯記憶,減輕長上下文的計算與快取壓力。