8 月 6 日,AMD 宣佈與加拿大 AI 晶片初創公司 Taalas 簽署最終收購協議。交易價格、支付方式和預計交割時間均未披露,收購仍需獲得監管批准並滿足其他慣常交割條件。AMD 給出的整合方向很明確:把 Taalas 的專用推理技術納入加速器路線,與 Instinct GPU 共同組成系統級方案。
這是一筆規模尚不清楚的交易,卻呈現了 AMD 對 AI 計算架構變化的判斷。過去幾年,晶片公司的競爭焦點主要集中在訓練:誰能連接更多 GPU、提供更大的視訊記憶體和更高的叢集頻寬。隨著模型投入實際應用,推理逐漸成為持續發生、反覆計費的計算負載。客戶開始追問每個 token 的成本、響應延遲和資料中心功耗,一種晶片覆蓋所有 AI 任務的效率越來越難令人滿意。
AMD 的業務重心也在向這裡移動。收購消息發佈前兩天,公司剛剛公佈 2026 年第二季度財報:營收達到 115 億美元,同比增長 50%;資料中心業務收入為 67 億美元,同比增長 107%,佔總收入的 58%。EPYC CPU 和 Instinct GPU 仍是主要增長來源,但 AMD 已經開始在這兩類通用計算產品周圍加入更多專用技術。
6 月,AMD 收購記憶體最佳化公司 MEXT,試圖降低資料中心的記憶體容量和成本壓力。7 月,AMD 與 Cerebras 達成合作,由 AMD 系統處理提示詞和長上下文,Cerebras 的晶圓級晶片負責低延遲 token 生成。蘇姿丰當時表示,AI 工作負載將出現更多拆分。
Taalas 補上的,是更靠近專用計算的一端。訓練、提示詞處理和經常變化的模型仍可運行在 GPU 上;呼叫量足夠大、模型相對穩定的推理任務,則可能轉移到為單個模型製造的晶片。AMD 正在搭建的產品體系,因而不再只有與輝達正面競爭的 GPU,還包括一組可以按照負載特點組合的計算單元。
Taalas 的技術路線十分激進。通常情況下,AI 模型以軟體形式存放在外部高頻寬記憶體(HBM)中,晶片執行階段不斷讀取參數並執行計算。資料需要在記憶體與計算單元之間反覆移動,帶來功耗、延遲和封裝成本。Taalas 直接把模型結構和大部分權重寫入晶片的掩模唯讀記憶體陣列,再使用片上靜態隨機記憶體器(SRAM)處理 KV Cache、上下文和模型介面卡。模型由此成為電路的一部分。
首款採用這種“硬編碼推理”(Hard Coded Inference)架構的晶片名為 HC1,由台積電採用 6 奈米製程生產,固化了 Meta 的 Llama 3.1 8B 模型。Taalas 稱,HC1 可以達到每位使用者約 1.7 萬個 token/秒,硬體成本約為其他方案的二十分之一,功耗約為十分之一;系統不需要 HBM、先進封裝和液冷。
不過,目前的性能數字主要來自 Taalas 自測。輝達 B200 的對比結果同樣由 Taalas 測量,Groq、SambaNova 和 Cerebras 的資料則來自第三方平台,測試條件並不完全一致。HC1 採用定製的 3 位元基礎資料格式,並混合使用 3 位元和 6 位元參數。Taalas 承認,激進量化會造成一定的模型質量損失。用於演示的 Llama 3.1 8B 體量較小,也無法代表當前前沿模型的計算難度。
HC1 因而更像一項架構驗證:當晶片放棄運行不同模型的能力,它在單一任務上能夠快到什麼程度。
這種效率也伴隨著直接的代價。模型結構或權重發生較大變化,客戶無法通過軟體升級完成切換,需要等待新版本晶片。Taalas 的應對方式是提前生產基礎晶圓,只在最後階段修改兩個金屬層。公司宣稱,從收到新模型到做出對應晶片可以縮短至兩個月。
兩個月遠短於傳統晶片的開發周期,卻依然慢於模型更新。客戶還需要管理更多伺服器型號、備件和部署流程。若一個模型呼叫量不夠大,節省下來的推理成本也未必能夠覆蓋專用晶片的設計、流片和維運支出。
因此,適合 Taalas 的場景也非常明確:模型穩定、請求量巨大、對延遲和成本極其敏感。例如語音互動、搜尋、程式碼補全或運行在後台的固定智能體模型,都可能產生足夠多的重複計算。頻繁迭代的前沿模型、長尾模型和訓練任務仍將依賴 GPU。Taalas 將會與 Instinct 形成分工,AMD 可以在一套系統中保留 GPU 的靈活性,再把成熟且昂貴的推理負載交給專用晶片。
除了架構,AMD 也買下了一支熟悉的團隊。Taalas 的 3 位創始人 Ljubisa Bajic、Drago Ignjatovic 和 Lejla Bajic 都曾在 AMD 和 Tenstorrent 工作。Ljubisa Bajic 參與過 AMD 的 CPU-GPU 混合晶片設計,後來創辦 Tenstorrent;Drago Ignjatovic 曾任 AMD 專用積體電路設計總監;Lejla Bajic 則從 ATI 進入 AMD,負責過系統工程。3 人於 2023 年在多倫多成立 Taalas。
2024 年,Taalas 以兩輪共計 5000 萬美元融資走出隱身狀態。2026 年 2 月,公司再融資 1.69 億美元,累計融資約 2.19 億美元。Taalas 稱,其 24 人團隊開發 HC1 隻投入了約 3000 萬美元。對 AMD 而言,這支已經完成實際流片、同時熟悉 GPU 與專用晶片的小型工程團隊,可能比一款尚未規模商用的產品更快產生價值。AMD 也表示,將保留並擴充 Taalas 的加拿大團隊。
收購之後仍有幾個問題沒有答案。AMD 尚未說明 Taalas 技術會進入那一代產品,也沒有披露兩類晶片如何連接、由那一套軟體調度,以及客戶能否在不增加維運複雜度的情況下獲得成本優勢。Taalas 原本計畫通過第二代 HC2 固化更大的前沿模型,但從 8B 模型擴展到混合專家模型和多晶片系統,需要新的實測結果。
AMD 買下 Taalas,是在押注推理市場最終會大到足以容納一批“只做一件事”的晶片。Taalas 已經展示了晶片失去選擇之後可以跑得多快;但它尚未證明,客戶願意為這種速度長期放棄同樣的選擇。 (問芯)
