全球Token「印鈔流水線」大升級,幕後推手Agentic Infra首次曝光!

「你已達到使用上限,請等待額度重設。」

用過Claude Code、Codex 的人,大概都被這行字噎過。bug剛修到一半,彈窗一出,全停了。

如今你把活整件甩給Agent,它替你幹、也替你燒錢,每一次呼叫都在按Token結算。

Token,儼然成了這個時代最像「貨幣」的東西。

有意思的是,這「貨幣」還在瘋狂貶值:過去一年,單個Token的生產成本被硬生生打下來10倍。

是誰,在那兒,把它造得這麼便宜?答案藏在一層你從不打開、卻天天在用的地基裡。

就在今年的WAIC上,無問芯穹一口氣亮出了「前店後廠一中心」,一整套完整的Agentic Infra戰略佈局:

  • 算力集散中心(一中心):Agentic Infra自主式基礎設施平台;
  • Token工廠(後廠):Agentic MaaS大模型服務平台;
  • AI生產力商店(前店):Agentic Infra行業解決方案。


不是「Token 工廠」,是Agentic Infra

2025年,無問芯穹率先在業內喊出了Agentic Infra。不到一年時間,這個詞已經成了行業裡的「標配」。

可仔細看,如今多數廠商做的「Agentic」,不過是在傳統基礎設施上加了一個Agent入口。

但這樣做根本撐不起真正的智能體時代。當海量並行請求一擁而上,光靠一個新入口,底層系統很容易就崩了。

真正的解法,得往更深處走。今年6月,兩家海外Cloud公司各自提出的解法,與無問芯穹隔海共同呼應了「Agent時代到底需要怎樣的AI基礎設施」這個命題。

首先,是CoreWeave發佈了一款服務於「AI研究與迭代」的智能體——ARIA。它能夠自主分析實驗資料、提煉洞察並驅動持續改進。這意味著CoreWeave正式從單純的「算力提供商」升級為「算力+AI自動化研發」的綜合平台。

其次,是Fireworks AI發佈帶強化學習的端到端平台——Training Agent。使用者只需描述任務,智能體就能自動選模型、跑超參掃描、寫評估、部署模型。

而無問芯穹的解題思路是——讓整座基礎設施自己變成一個會幹活的Agent。

在他們看來,真正完整的Agentic Infra至少得同時邁過三道檻:

  • 全鏈路:撐得起從算力到Token再到生產力的整條鏈,用全端最佳化提升基礎設施系統性能;
  • AI原生:能用AI改進AI基礎設施本身,不僅服務人類使用者,還針對智能體這類數字使用者的需求做改造;
  • 全覆蓋:訓練、強化學習、推理全流程覆蓋,穩固更多樣化的技術優勢,同時攜手行業百業的客戶,賦能降本提效。

無問芯穹把這三件事,收進了一道乘法公式:

AI生產力 = 智能資源規模 × Token 轉化效率 × AI 生產力轉化效率。

公式裡的三個變數,正好對上「前店後廠一中心」三塊業務。並且在相乘之後,還首尾相接地成了一個閉環。

一中心:把散在各地的算力,聚成一股

第一個變數,是智能資源規模。

如今,算力的胃口,早就漲得比供給快。可光靠買卡、堆算力,既燒錢又追不上。

真正的出路,是把已經散在各地、型號不一的存量算力盤活,聚成一股能用的力量。

為此,無問芯穹的「算力集散中心」主要做了兩件事。

第一,是面向大模型的異構叢集跨域訓練系統。

超遠距離聚合:聯合中國電信,完成國內首例超4000公里距離的大模型跨域混訓,在新疆哈密與廣東深圳兩地叢集間,實現聯合訓練性能提升165%。

  • 多資料中心聚合:聯合4個不同代際、不同型號的GPU叢集,聯合訓練70B參數大模型,四叢集協同性能提升41%。
  • 混合雲算力聚合:實現本地私有叢集與公有雲算力的安全互通混訓,不僅將整體性能提升了68%,而且還治好了企業「自己的卡不夠用、雲上的卡卻閒得發慌」的問題。

到今天,這套系統已在全國部署觸達超37000P算力、覆蓋16種主流晶片。

第二,是跨叢集強化學習。

強化學習正成為這一輪智能躍遷的勝負手,所需要的算力規模顯著增大,動輒千卡甚至萬卡起步的體量,並不是每個機房都能塞得下的。

然而,想要同時利用多個叢集,就不得不面臨機房之間通訊和故障的瓶頸。

對此,無問芯穹的做法是從網路、平台到框架一層層最佳化,把跨域通訊的效率整整提高了三到四倍,實現通訊開銷100%全掩蓋。

再配一套故障無感的訓練機制,它硬是讓跨域強化學習訓練,連著跑了整整一周都沒斷。

無問芯穹聯合創始人兼CEO夏立雪今天在發佈會現場表示,隨著強化學習規模需求的持續提升,無問芯穹還將針對平行策略、通訊融合、智能算子、極致容錯等核心技術持續深耕,「未來會將跨域計算資源的支撐規模拓展至十萬卡級以上,支撐下一代Agentic AI 的線上進化。」

但把算力聚起來只是第一步。真正讓「一中心」配得上「自主式」三個字的,是它開始自己管自己。

無問芯穹今天發佈了一項與基礎設施自我最佳化和進化直接相關的「前店」解決方案:基礎設施智能體蜂群

首先看「平台管家智能體系統」和「智算叢集維運智能體系統」。

舉個例子,一個「平台管家」智能體如今成了整個基礎設施智能體蜂群的統一入口。

你直接交代一句「幫我看看昨天那些訓練任務失敗了」,它便會順著日誌、監控、任務事件一路查下去,並且獨立解決80%的日常問題。剩下20%的深度問題,則會再轉交對應的垂類智能體。

比如,碰到棘手的叢集維運難題,專門的智算叢集維運智能體系統就會接手。這是一個7×24小時全天候值守的「維運專家團」,能端到端地完成告警閉環處置。定位到根因後,它們會直接擬好修複方案,並問你要不要一鍵重建。

經過大規模生產環境驗證,這套維運智能體系統可實現維運人效提升5倍以上,關鍵故障處理效率提升6倍。

這不僅為大規模GPU訓練與推理業務提供了更加穩定、高效的基礎設施保障,也讓維運人力能夠被真正解放出來。

比維運更硬核的,是高性能算子生成智能體系統KernelMind。它直接用AI造出面向不同晶片的高性能算子,可在真實編譯試錯與知識沉澱中持續自迭代,穩定交付工業級算子。

在GLM 5.2模型的實測中,對比行業基線,KernelMind在NVIDIA旗艦卡中實現了端到端7.3%的性能提升,在AMD旗艦卡中更是帶來了39%的整體性能躍升。

放以前,這一步得靠頂尖專家一行行手搓才行。

後廠:把推理成本,一年打下來10倍

第二個變數,是Token轉化效率。

對於後廠來說,核心命題只有一個:極致效率服務Token的規模化、高品質生產。

這背後,其實是整個AI產業的一次重心轉移。

過去三年,大家拼的是誰堆的卡多、訓的模型大;可當Agent鋪開之後,戰場就從「訓練」大規模擴展到了「推理」。決定誰能真正賺錢的是海量呼叫之下,每個Token的成本能壓到多低。

模型推理時,不同階段對裝置的要求完全不同——Prefill瘋狂吃算力;Decode極度吃通訊和延遲。

對此,無問芯穹的答案,是它首創的「跨叢集異構PD分離架構」(Prefill-RelayDecode-MainDecode,PDD)

也就是,把Prefill和 Decode這兩步徹底拆開,分別丟到不同機房、不同廠商的晶片上去跑。誰擅長算就專心算,誰擅長低延遲輸出就專心輸出,各盡其能。

而基於乙太網路的KV Cache跨叢集傳輸,需要解決頻寬和延遲瓶頸兩大難題。

頻寬這一關,它靠一次技術遷移解決。通過把原本用於Decode實例重複前綴記憶體去重的Decode Radix Cache技術,創新性地遷移至跨叢集異構PD分離架構之中,將跨叢集的KV Cache傳輸資料量降低了一個數量級。

延遲這一關,它首創了PDD三級分離架構。遇到傳輸要耗上數十秒的請求,先由極少量機器上的RelayDecode搶先向使用者輸出Token,使用者端因此感受不到這段傳輸延遲;等資料傳輸完成,再把輸出任務無縫切換給MainDecode。

實測顯示,首Token延遲(TTFT)直接降低了51.5%,單Token成本再降37.5%。

結合一系列技術最佳化,無問芯穹的單位Token推理成本,硬是在一年內,整整降了10倍。未來,仍有10倍的下降空間。

正如夏立雪在現場所總結的:6月的GTC大會上,黃仁勳展示了輝達的「算力即收入」曲線。無問芯穹的Token工廠,則希望用「最佳化即利潤」的增長飛輪,向推理時代交出Token效率的答卷。

Token按量賣是收入,每一分技術最佳化省下的成本,不用降價讓利,直接沉澱成毛利;省得越狠,賺得越多。

如今他們深度合作的模型廠名單中,幾乎涵蓋了國產大模型的半壁江山——Kimi、智譜、MiniMax、階躍星辰等。

這些公司的模型能力在持續提升,模型越強,能接的任務就越多,推理呼叫量自然跟著指數級增長。

截止今年7月,無問芯穹Agentic MaaS平台日均Token呼叫量較年初增長約40倍。

飛輪,已經高速轉起。

前店:把能力,做成一套工業級方案

第三個變數,是AI生產力轉化效率。

在服務客戶的實踐中,無問芯穹發現了一條關乎AI落地生死的關鍵定律:

相同的業務效果,若置於不同的推理路徑、模型規模與晶片組合之下,Token成本竟天差地別——這一差距,正深刻制約著大模型從技術驗證走向真實生產力的躍遷。

為此,無問芯穹推出了 “AI生產力商店”——Agentic Infra行業解決方案,以底層智能基礎設施之力,助力行業客戶打通降本增效的“最後一公里”。

截至目前,無問芯穹已深入文娛遊戲、醫療健康、法律終端、能源電力等多個垂直行業,和Tripo AI、上海瑞金醫院、南方電網等夥伴共同打磨領域生產力方案,賦能千行百業重塑AI效能邊界。

當算力、Token、生產力,這條鏈到前店才算真正閉合——那些從晶片裡一點點擠出來、又被後廠壓到極便宜的Token,最終都在真實業務裡,變成了看得見的生產力。

下一站,是物理世界

講到這兒,都還是數字世界裡的事。

可當所有智能都跑在雲端的資料中心裡,AI基礎設施就真的到頭了嗎?

無問芯穹的答案是沒有。

因為在物理世界中,具身智能的Scaling Law同樣需要高效率、大規模的基礎設施支援。

於是無問芯穹今天公佈了首個面向大規模具身任務的雲邊端一體化管理與調度平台,首次把雲端GPU叢集、邊緣算力節點和機器人真機裝置統一接入,支援訓練、資料採集、評測和真機執行等多種具身任務的統一編排運行。

訓練側,是RLinf V0.3大規模真機強化學習框架。

由於訓練機器人,得靠一大批真機同時上場。但沒電、故障、掉網這些狀況,很容易讓某台裝置突然退出。而只要掉了一台,整場訓練就可能直接崩掉、從頭再來。

為瞭解決這個問題,RLinf首創了HotSwarm與端雲協同訓練模式。這就像給運行中的伺服器熱插拔硬碟,真機在訓練時因為意外或者故障導致反覆接進來、又掉出去,前後上下線超過1000次,訓練照樣零中斷。

推理側,則交給專攻機器人端側的Mizar-Robo。

機器人身上的算力和電量十分有限。大模型想跑得動、還得跑得快,只能從流水線調度、算子核心、量化壓縮到計算圖一層層榨。

在與自變數機器人WALL-OSS系列模型的聯合最佳化部署中,推理性能提升了7.14倍,端側推理時延從500ms壓縮至70ms,降幅達86%。

而這,正是「前店後廠一中心」最自然的延伸:從數字世界,一路走到物理世界。

他們要立的,是AI的地基

行業狂飆熱炒到今天,聚光燈幾乎全打在最聰明的那顆「大腦」上。

至於托著這一切的地基,反倒成了最沒人在意的一層。

可真正決定這場智能革命能走多遠、能滲透多深的,恰恰是這層地基。

大腦再聰明,如果底下的算力調不動、如果生成的Token太貴企業用不起、如果系統三天兩頭當機,再宏大的AGI願景也無法落地。

無問芯穹在WAIC 2026上交出的這份答卷,不是又一款產品,也不是又一項具體的API服務,而是一整套會自己迭代的地基。

它越是讓你感覺不到它的存在,說明它運轉得越完美。

而當同一套地基,能同時托住數字世界裡如洪流般飛奔的Token,和物理世界裡邁出第一步的機器人時,它就是整個智能時代前進的底盤。

所有的智能,最終都要從這樣一層地基上長出來。

正如夏立雪在現場說的:「讓智能無所不能,是AGI,而讓智能無處不在,是AGI Infra。」

他們在WAIC上按下的,正是讓這層地基自我最佳化與進化的那個開關。 (新智元)