全球首個Agentic擴散模型來了:邊行動邊糾錯,128K上下文追平自回歸

AI速讀
螞蟻集團 inclusionAI 團隊發佈開源模型 LLaDA 2.2,打破自回歸模型在 Agent 賽道的壟斷。該模型採用千億參數 MoE 擴散架構,原生支援 128K 上下文,透過 Levenshtein 編輯與 L-EBPO 技術實現生成過程中的動態修正與環境反饋。測試顯示,LLaDA 2.2 在互動式任務中已接近甚至反超頂尖自回歸模型,且吞吐量顯著提升。此突破預示著未來 AI Agent 將採取「自回歸(處理強因果流程)+ 擴散(快速平行生成)」的雙軌並行模式,以兼顧智力上限與推理成本。

終於!Agent賽道,不再是自回歸(AR)模型一家獨大。

長期處於非主流位置的擴散模型,也開始有了一席之地。

這些年但凡叫得上名字的Agent,從ChatGPT到Claude,底層清一色因果自回歸LLM。

逐Token生成慢是慢了點,但行業默認,Agent的大腦只能如此。

螞蟻卻不這麼想。

旗下inclusionAI團隊陸續推出LLaDA系列模型,最新開源LLaDA2.2,實現擴散模型首次進入智能體長程任務!

精準來說,這是一款千億參數的MoE擴散語言模型,原生支援128K上下文,也是全球首個大規模Agentic擴散模型。

總之自回歸模型能幹的,它也能幹,自回歸模型跑得慢的痛點,它也能一刀切。

更關鍵的是,它第一次將Levenshtein編輯、面向環境反饋的強化學習,以及長上下文工程架構,整合進同一套擴散模型Agent系統——

模型不僅能平行生成,還能在生成過程中自我增刪動態修正

LLaDA2.2的出現同樣有跡可循,從2.0時期的規模化嘗試,到2.1版本的邊寫邊改,再到如今的智能體覺醒。

半年時間、三代模型,依次完成擴散架構從生成工具到行動架構的遞進。

擴散模型破局自回歸壟斷

其實自回歸模型能統治Agent賽道這麼久,也是有幾分道理在的。

多輪對話、工具呼叫、環境反饋處理,這些任務本身就天然要求模型具備序列因果性。

一個Token一個Token蹦,邏輯鏈條才不容易斷。

傳統擴散模型則可以同時處理一個block中的多個位置,速度是比自回歸快了,但代價就是Token之間彼此缺乏嚴格的序列條件約束

放在普通文字生成場景裡,這些問題倒不算什麼,頂多影響一點可讀性,讀者看到兩句重複的話,笑一笑就算了。

但Agent場景不一樣。

Agent的輸出是要被真實執行的,再小的bug也會影響整個流程,一步錯步步錯,錯誤會在後續互動中被持續固化成硬約束,最終導致整體目標漂移。

所以擴散模型想在更複雜困難的Agent環境中和自回歸齊平,就須得邁過這一關。

對此,螞蟻團隊看得很清楚。

LLaDA2.0首先解決的,就是規模化問題。

它證明擴散模型並不是只能停留在小參數實驗階段,也能夠與MoE等架構結合,真正落地工程。

在驗證路線可信的前提下,螞蟻再順勢推舟給出LLaDA2.1,進一步證明擴散模型邊寫邊改的可用性。

LLaDA2.1引入Token-to-Token編輯機制,可以在生成過程中判斷哪些Token應該保留,哪些Token需要替換。

但到了Agent,這樣的局部修改還遠遠不夠,它需要的是根本性的結構調整,實現邊行動邊糾錯

於是LLaDA2.2來了。

如何做到?三大技術拼圖集中發力

LLaDA2.2的變化集中在三個方面,每一項單點突破固然重要,螞蟻三合一系統整合在一起才是擴散模型拿到Agent入場券的重中之重。

讓模型學會自改自生

傳統擴散模型塊平行解碼的最大問題是結構剛性。生成完一個block,裡面的Token就被釘死了。

要是錯了,只能整段重來,長了也沒法刪,短了更沒法補。

LLaDA2.2採用Levenshtein編輯範式,在塊內支援四種原子操作:KEEP(保留)、SUBSTITUTE(替換)、DELETE(刪除)、INSERT(插入)。

然後通過LCS最長公共子序列將塊內草稿與目標序列對齊,動態生成編輯標籤。

翻譯一下就是,模型現在能對自己的生成結果修正了。

看到冗餘的內容,直接DELETE切掉,發現缺了關鍵資訊,INSERT可以在指定位置開一個口子,後續去噪輪次往裡填。

這也是業界第一次把Levenshtein編輯大規模整合到擴散模型的去噪過程中,效果立竿見影。

實驗顯示,在SWE-bench Verified上,僅開啟Levenshtein編輯這一項,就帶來了從35.8到44.4,整整8.6個百分點的絕對提升。

讓模型學會看環境反饋

除了結構剛性問題,擴散模型還有一個更為隱蔽的坑。

長程Agent互動中,早期block的微小偏差會被後續上下文不斷放大。一旦返回了錯誤結果,模型再用這個錯誤結果去規劃下一步,推理路徑就會越走越窄。

ICML 2026的最佳論文還專門討論過這個問題,它有一個專門的名字:模型崩潰(Model Collapse)。

常規修正方法是在錯誤外面包一層修正指令,顯然這樣做治標不治本。

LLaDA2.2提出的L-EBPO(Levenshtein Editing Evidence Lower Bound Policy Optimization),可以把多輪互動中的Levenshtein編輯決策建模為強化學習問題。

模型會根據環境反饋,自主決策什麼時候DELETE切除病灶、什麼時候INSERT填補缺失。

如果說Levenshtein編輯範式是給了擴散模型一雙手,L-EBPO就是添上了眼睛,讓模型能即時看到自己的錯誤,知道從哪裡做、做完效果如何。

讓模型支撐長程Agent任務

解決完質量問題後,擺在擴散模型面前的還有最後一道檻——工程應用

Agent任務普遍需要處理超長上下文,上下文窗口不夠大,Agent就舉步維艱。

LLaDA2.2通過漸進式長上下文訓練,一步步把原生上下文窗口從8K、64K撐到了128K

隨之而來的是另一重問題:標準MoE為Token級路由,每個Token獨立選擇專家,總啟動專家集合極大,HBM流量、通訊開銷暴漲,推理成本飆升。

LLaDA2.2的解法是BlockRouting

先在block層面精準篩選top-C個專家形成固定專家池,再內部執行Token級top-k路由,遮蔽池外專家。

這樣每塊啟動專家上限恆定,HBM流量與專家平行通訊成本得以大幅降低。

由此,128K原生上下文+BlockRouting機制讓Agentic擴散模型真正具備了工程部署價值。

那麼效果如何呢?

且看七大Agent基準上,LLaDA 2.2-flash與頂尖自回歸模型Ling-2.6-flash正面競技,平均分為53.83 vs 55.74,差距縮小到2分以內。

嚴格來說,還沒有完全跑贏,但二者已處於相近水平

進一步拆開看,LLaDA 2.2在τ²-Bench、PinchBench、MCP-Atlas三項互動式任務上實現反超,說明它在偏向真實互動的Agent場景中已經開始展現競爭力。

效率方面則更乾脆,在11類工作負載上,LLaDA2.2-flash的BF16平均吞吐量可達Ling-2.6-flash的1.64倍,量化至FP8後,平均吞吐量還可以額外提升18.6%

同時結合此前已知的原生128K上下⽂窗⼝,LLaDA2.2的優勢在於,能力接近自回歸模型,速度更優。

而這才是LLaDA2.2最值得關注的地方,它證明擴散模型同樣可以和自回歸模型站在同一條起跑線上。

Agent時代,需要自回歸與擴散雙軌平行

誠然,LLaDA2.2並沒有終結自回歸模型統治。

在嚴格結構化輸出和複雜程式碼生成中,自回歸模型依然擁有更成熟的能力。

但LLaDA2.2的價值不在輸贏,它所拋出的行業觀察才是核心:純自回歸模型不是絕對選項

過去Agent的主流架構幾乎被自回歸接管,但對Agent來說,當它真正進入物理世界,它需要的就不會只有更高的智力上限。

比如一個部署在工廠車間裡的Agent,響應延遲每多一秒,產線停擺的成本就多一分;再比如一個運行在端側裝置上的Agent,推理成本每高一點,大規模落地的門檻就高一截。

速度、成本,這些恰恰是擴散架構的優勢所在。

它和自回歸模型也不是非此即彼,相反後Agent時代可能同時需要它們:

需要生成嚴格工具參數、執行強因果流程時,可以由自回歸穩步推進;需要快速探索、平行生成時,可以讓擴散介入。

兩種機制融合,在同一個Agent系統裡各司其職,然後根據任務階段動態切換,這才是LLaDA2.2所預示的未來。

老話常說,兩條腿走路,才能走得更遠。

自回歸模型已經鋪好了一條成熟軌道,LLaDA2.2正在嘗試鋪設另一條:

最終雙軌平行

技術報告:https://github.com/inclusionAI/LLaDA2.X/blob/main/LLaDA2_2_tech_report.pdf
GitHub連結:https://github.com/inclusionAI/LLaDA2.X
HuggingFace連結:https://huggingface.co/inclusionAI/LLaDA2.2-flash

(量子位)