阿里開源2.4兆參數大模型!性能比肩Fable 5

AI速讀
阿里千問首度開源 Max 等級旗艦模型 Qwen3.8-2.4T-A95B,憑藉 2.4 萬億參數在多項科研與程式設計基準測試中展現頂尖性能,部分數據領先於 Fable 5 及 GPT-5.6 Sol。該模型主打長週期自主工作能力,能獨立執行跨度數日的複雜任務。同時,第三方團隊 Unsloth AI 成功將模型體積壓縮 91% 以支持本地部署。此次更新與 Grok 4.6 及 DeepSeek-V4-Pro 同時登場,標誌著全球 AI 競爭重心已移至自主閉環的智能體(Agent)能力比拼。

阿里千問首次開源Max等級模型。

智東西8月13日報導,剛剛,阿里千問大模型團隊開放Qwen3.8-2.4T-A95B模型權重

Qwen3.8-Max是基於Qwen3.8-2.4T-A95B的官方版本,於8月3日發佈,擁有更多功能,例如視覺輸入功能、無需思考即可使用、默認支援1百萬上下文長度處理、內建官方工具等。

▲Qwen3.8-2.4T-A95B開源首頁(圖源:Hugging Face)

魔搭社區模型下載地址:

https://modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B

Hugging Face模型下載地址:

https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B

這也是阿里千問首次將Max等級的旗艦模型對外開放權重。根據魔搭社區的官方預告,更小杯Qwen3.8-27B已在路上

Qwen3.8-2.4T-A95B的模型總參數為2.4兆,每個Token啟動950億參數,原生支援262144 Token上下文,可擴展至101萬Token。該模型採用Qwen3.5的底層架構,在程式設計、辦公、科研工作、長周期智能體任務上實現性能提升。

Qwen3.8-2.4T-A95B模型可以通過SGLang、vLLM和TokenSpeed推理引擎部署,正式部署時需要使用各框架針對Qwen3.8的最新Recipe,並根據權重精度、GPU型號與數量選擇平行策略。

Qwen3.8模型默認以思考模式運行,在生成最終回答前,模型會先生成由<think>\n...</think>\n\n標記的思考內容。Qwen3.8-2.4T-A95B不支援關閉思考模式

與此同時,開源AI項目團隊Unsloth AI靠動態1‑bit分層選擇性量化技術,將Qwen3.8‑2.4T‑A95B原始4.9TB的模型體積壓縮至397GB,記憶體空間縮減91%

借助Unsloth‑Desktop工具,裝置記憶體+視訊記憶體總量達到410GB以上即可本地運行該模型。

▲Unsloth AI壓縮Qwen3.8-2.4T-A95B(圖源:X)

預告Qwen3.8發佈時,千問稱該模型“可能是除了Fable 5外最強大的模型”。

基準測試結果顯示,在論文復現基準PaperBench中,Qwen3.8-Max取得93.0分,高於GPT-5.6 Sol、Fable 5和Claude Opus 4.8。在評估電腦操作能力的OSWorld-Verified中,Qwen3.8-Max以86.1分位居參評模型首位;在參數化CAD基準中,其91.5分同樣超過Fable 5、GPT-5.6 Sol和Gemini 3.1 Pro。

不過,Qwen3.8-Max尚未在所有測試中取得領先。

在TerminalBench 2.1中,其成績為86.6分,略低於GPT-5.6 Sol的88.8分;在SWE-bench Pro中,Qwen3.8-Max獲得67.7分,落後於Fable 5的80.0分和Claude Opus 4.8的69.2分;在長視訊基準VideoMME v2中,其68.3分也低於GPT-5.6 Sol的71.1分。

▲Qwen3.8-Max基準測試結果(圖源:阿里)

Qwen3.8的重點是模型能否脫離人工持續陪伴,自己把一個跨度數小時、數天甚至數周的任務做完。

千問團隊讓Qwen3.8-Max連續自主程式設計約16天、獨立復現並改進一篇研究論文、參加真實演算法競賽,還讓它在超過2000輪互動中經營一家虛擬電商企業。

在連續自主程式設計16天的任務中,Qwen3.8-Max自主建構了自進化Harness,並持續完成社區需求收集、issue派發、程式碼生成、驗證與自我修復。

▲Qwen3.8-Max執行自主程式設計任務(圖源:阿里)

API價格方面,Qwen3.8-Max國內每百萬Tokens輸入12元、輸出36元,隱式快取命中1.5元;海外每百萬Tokens輸入2美元、輸出6美元,隱式快取命中0.25美元。

▲API價格對比表(智東西製圖)


結語:全球三大頂流模型齊更新!

均著重強化智能體能力

一夜之間,三家大模型頂流輪番炸場:先是馬斯克甩出自家最強模型Grok 4.6,其中Grok 4.6 high在其披露的多項智能體程式設計和知識工作基準測試中綜合性能與GPT-5.6 Sol Max、Claude Fable 5 Max相當;接著DeepSeek-V4-Pro正式版上線,綜合性能接近、部分指標超越Claude Fable 5;最後是Qwen3.8開放權重。

可以看出,這三家公司都著重強化了模型多步驟長周期自主工作能力,開始比拚模型獨立承接完整項目、自主閉環幹活的智能體水平。

此外,阿里千問團隊此次將2.4兆參數頂級旗艦模型正式開放權重,也是中國開源大模型佈局的關鍵落子。(智東西)