終於!Agent賽道,不再是自回歸(AR)模型一家獨大。
長期處於非主流位置的擴散模型,也開始有了一席之地。
這些年但凡叫得上名字的Agent,從ChatGPT到Claude,底層清一色因果自回歸LLM。
逐Token生成慢是慢了點,但行業默認,Agent的大腦只能如此。
螞蟻卻不這麼想。
旗下inclusionAI團隊陸續推出LLaDA系列模型,最新開源LLaDA2.2,實現擴散模型首次進入智能體長程任務!
精準來說,這是一款千億參數的MoE擴散語言模型,原生支援128K上下文,也是全球首個大規模Agentic擴散模型。
總之自回歸模型能幹的,它也能幹,自回歸模型跑得慢的痛點,它也能一刀切。
更關鍵的是,它第一次將Levenshtein編輯、面向環境反饋的強化學習,以及長上下文工程架構,整合進同一套擴散模型Agent系統——
模型不僅能平行生成,還能在生成過程中自我增刪、動態修正。
LLaDA2.2的出現同樣有跡可循,從2.0時期的規模化嘗試,到2.1版本的邊寫邊改,再到如今的智能體覺醒。
半年時間、三代模型,依次完成擴散架構從生成工具到行動架構的遞進。
擴散模型破局自回歸壟斷
其實自回歸模型能統治Agent賽道這麼久,也是有幾分道理在的。
多輪對話、工具呼叫、環境反饋處理,這些任務本身就天然要求模型具備序列因果性。
一個Token一個Token蹦,邏輯鏈條才不容易斷。
傳統擴散模型則可以同時處理一個block中的多個位置,速度是比自回歸快了,但代價就是Token之間彼此缺乏嚴格的序列條件約束。
放在普通文字生成場景裡,這些問題倒不算什麼,頂多影響一點可讀性,讀者看到兩句重複的話,笑一笑就算了。
但Agent場景不一樣。
Agent的輸出是要被真實執行的,再小的bug也會影響整個流程,一步錯步步錯,錯誤會在後續互動中被持續固化成硬約束,最終導致整體目標漂移。
所以擴散模型想在更複雜困難的Agent環境中和自回歸齊平,就須得邁過這一關。
對此,螞蟻團隊看得很清楚。
LLaDA2.0首先解決的,就是規模化問題。
它證明擴散模型並不是只能停留在小參數實驗階段,也能夠與MoE等架構結合,真正落地工程。
在驗證路線可信的前提下,螞蟻再順勢推舟給出LLaDA2.1,進一步證明擴散模型邊寫邊改的可用性。
LLaDA2.1引入Token-to-Token編輯機制,可以在生成過程中判斷哪些Token應該保留,哪些Token需要替換。
但到了Agent,這樣的局部修改還遠遠不夠,它需要的是根本性的結構調整,實現邊行動邊糾錯。
於是LLaDA2.2來了。
如何做到?三大技術拼圖集中發力
LLaDA2.2的變化集中在三個方面,每一項單點突破固然重要,螞蟻三合一系統整合在一起才是擴散模型拿到Agent入場券的重中之重。
讓模型學會自改自生
傳統擴散模型塊平行解碼的最大問題是結構剛性。生成完一個block,裡面的Token就被釘死了。
要是錯了,只能整段重來,長了也沒法刪,短了更沒法補。
LLaDA2.2採用Levenshtein編輯範式,在塊內支援四種原子操作:KEEP(保留)、SUBSTITUTE(替換)、DELETE(刪除)、INSERT(插入)。
然後通過LCS最長公共子序列將塊內草稿與目標序列對齊,動態生成編輯標籤。
翻譯一下就是,模型現在能對自己的生成結果修正了。
看到冗餘的內容,直接DELETE切掉,發現缺了關鍵資訊,INSERT可以在指定位置開一個口子,後續去噪輪次往裡填。
這也是業界第一次把Levenshtein編輯大規模整合到擴散模型的去噪過程中,效果立竿見影。
實驗顯示,在SWE-bench Verified上,僅開啟Levenshtein編輯這一項,就帶來了從35.8到44.4,整整8.6個百分點的絕對提升。
讓模型學會看環境反饋
除了結構剛性問題,擴散模型還有一個更為隱蔽的坑。
長程Agent互動中,早期block的微小偏差會被後續上下文不斷放大。一旦返回了錯誤結果,模型再用這個錯誤結果去規劃下一步,推理路徑就會越走越窄。
ICML 2026的最佳論文還專門討論過這個問題,它有一個專門的名字:模型崩潰(Model Collapse)。
常規修正方法是在錯誤外面包一層修正指令,顯然這樣做治標不治本。
LLaDA2.2提出的L-EBPO(Levenshtein Editing Evidence Lower Bound Policy Optimization),可以把多輪互動中的Levenshtein編輯決策建模為強化學習問題。
模型會根據環境反饋,自主決策什麼時候DELETE切除病灶、什麼時候INSERT填補缺失。
如果說Levenshtein編輯範式是給了擴散模型一雙手,L-EBPO就是添上了眼睛,讓模型能即時看到自己的錯誤,知道從哪裡做、做完效果如何。
讓模型支撐長程Agent任務
解決完質量問題後,擺在擴散模型面前的還有最後一道檻——工程應用。
Agent任務普遍需要處理超長上下文,上下文窗口不夠大,Agent就舉步維艱。
LLaDA2.2通過漸進式長上下文訓練,一步步把原生上下文窗口從8K、64K撐到了128K。
隨之而來的是另一重問題:標準MoE為Token級路由,每個Token獨立選擇專家,總啟動專家集合極大,HBM流量、通訊開銷暴漲,推理成本飆升。
LLaDA2.2的解法是BlockRouting。
先在block層面精準篩選top-C個專家形成固定專家池,再內部執行Token級top-k路由,遮蔽池外專家。
這樣每塊啟動專家上限恆定,HBM流量與專家平行通訊成本得以大幅降低。
由此,128K原生上下文+BlockRouting機制讓Agentic擴散模型真正具備了工程部署價值。
那麼效果如何呢?
且看七大Agent基準上,LLaDA 2.2-flash與頂尖自回歸模型Ling-2.6-flash正面競技,平均分為53.83 vs 55.74,差距縮小到2分以內。
嚴格來說,還沒有完全跑贏,但二者已處於相近水平。
進一步拆開看,LLaDA 2.2在τ²-Bench、PinchBench、MCP-Atlas三項互動式任務上實現反超,說明它在偏向真實互動的Agent場景中已經開始展現競爭力。
效率方面則更乾脆,在11類工作負載上,LLaDA2.2-flash的BF16平均吞吐量可達Ling-2.6-flash的1.64倍,量化至FP8後,平均吞吐量還可以額外提升18.6%。
同時結合此前已知的原生128K上下⽂窗⼝,LLaDA2.2的優勢在於,能力接近自回歸模型,速度更優。
而這才是LLaDA2.2最值得關注的地方,它證明擴散模型同樣可以和自回歸模型站在同一條起跑線上。
Agent時代,需要自回歸與擴散雙軌平行
誠然,LLaDA2.2並沒有終結自回歸模型統治。
在嚴格結構化輸出和複雜程式碼生成中,自回歸模型依然擁有更成熟的能力。
但LLaDA2.2的價值不在輸贏,它所拋出的行業觀察才是核心:純自回歸模型不是絕對選項。
過去Agent的主流架構幾乎被自回歸接管,但對Agent來說,當它真正進入物理世界,它需要的就不會只有更高的智力上限。
比如一個部署在工廠車間裡的Agent,響應延遲每多一秒,產線停擺的成本就多一分;再比如一個運行在端側裝置上的Agent,推理成本每高一點,大規模落地的門檻就高一截。
速度、成本,這些恰恰是擴散架構的優勢所在。
它和自回歸模型也不是非此即彼,相反後Agent時代可能同時需要它們:
需要生成嚴格工具參數、執行強因果流程時,可以由自回歸穩步推進;需要快速探索、平行生成時,可以讓擴散介入。
兩種機制融合,在同一個Agent系統裡各司其職,然後根據任務階段動態切換,這才是LLaDA2.2所預示的未來。
老話常說,兩條腿走路,才能走得更遠。
自回歸模型已經鋪好了一條成熟軌道,LLaDA2.2正在嘗試鋪設另一條:
最終雙軌平行。
技術報告:https://github.com/inclusionAI/LLaDA2.X/blob/main/LLaDA2_2_tech_report.pdf
GitHub連結:https://github.com/inclusionAI/LLaDA2.X
HuggingFace連結:https://huggingface.co/inclusionAI/LLaDA2.2-flash
(量子位)
