華為22年老兵從AI終局倒推LPU,元川微完成新一輪數億元融資

AI速讀
AI晶片新創公司元川微近日宣布完成由IDG資本領投的Pre-A輪數億元融資。創始人楊濱憑藉在華為二十餘年的晶片研發經驗,主導開發原生LPU+架構,專攻Agentic AI時代的即時推理需求。不同於單純模仿Groq,元川微強調其架構支援多模態與MoE模型,並透過時空編譯器與硬流水架構實現低延遲與高穩定性。該公司旨在打破傳統GPU限制,構建一套能靈活擴展於雲端、邊緣與終端的算力工廠,為AI Agent的複雜任務鏈提供底層支撐。

“Agent時代,元川微用一套原生LPU架構同時覆蓋雲邊端。”

早在Groq LPU因為輝達的押注而名聲大噪前,元川微創始人兼CEO楊濱就已經開始了對推理晶片的構想。

雷峰網獨家獲悉,LPU創業公司元川微已完成Pre-A輪數億元融資。本輪融資由IDG資本領投,孚騰資本、九坤創投、尚頎資本、順禧基金、徐匯科創投聯合投資。

據瞭解,這也是元川微2026年以來完成的第四輪融資。

元川微透露,本輪融資資金將主要用於LPU+晶片研發、軟體生態建設及產品工程化推進。目前,元川微正與多家產業客戶及雲廠商開展產品驗證與合作。

元川微表示,公司下一輪融資已有序展開。

公開資料顯示,元川微成立於2025年9月,今年4月完成的數億元天使輪系列融資,就已獲得頭部VC、政府基金及產業鏈的聯合支援,投資陣容覆蓋從流片製造到終端應用的關鍵環節。

資本的持續加碼,反映了推理時代的新一輪晶片競爭,正從GPU延伸至推理專用架構。押注這一方向的元川微,如果只看其晶片形態一一時空編譯器、硬流水架構、大頻寬記憶體,確實像一家“中國版Groq”。

但楊濱並不認同這種簡單對應:“如果我們的目標只是模仿LPU,那麼能拓展的空間實際上並不多。”

在他看來,選擇何種晶片技術,只是在完成市場判斷後自然推導而出的結果,並非創業的起點。

這種思考方式與楊濱在華為過去二十多年的經歷密切相關——他曾赴美從零組建華為處理器團隊,回國後負責華為無線基帶演算法與晶片相關業務,長期主導大規模硬體調度、資料架構研發等任務。

“創業其實是你過去積累的所有資源的兌現。”楊濱總結。而這不僅指向對產業的理解、沉澱下來的技術能力,還包括積攢的口碑和資源組織能力等。

核心成員過去幾十年積累下來的技術能力、產業經驗和人才資源,也構成了元川微創業的底座。CTO孫博士對GPGPU、GPU、DSP等高性能計算架構的鑽研超過三十年,首席軟體工程師Will博士擁有20多年編譯器、EDA和異構系統軟體經驗。

相比起討論“國產替代”“性價比”等熱門議題,這支由行業老兵組成的新公司更關注的是——當AI進入Agent時代,推理計算究竟應該圍繞什麼來重新組織。

01. 從AI終局倒推確定LPU路線,只做最快的推理

2025年上半年,當楊濱和CTO在討論AI晶片賽道還有那些創業機會時,他們就已經意識到相比模型的能力,模型真正落地後才會產生價值。

彼時,Deepseek R1憑藉遠低於行業預期的成本,訓練出接近當時頂級模型的性能,加速AI應用走向低成本部署;Manus剛剛打開通用Agent的想像空間;黃仁勳首次將推理和Agent作為GTC大會的核心敘事,並推出面向推理時代的整體解決方案。

隨著推理的市場需求不斷釋放,楊濱將目光投向Vibe coding等生產力應用。“就像家庭頻寬從100兆升級到1G,收費並不呈線性增長。”在產業界摸爬滾打多年的他熟悉此類場景的商業邏輯——客戶願意為效率支付更高的溢價。

“主打性價比肯定有市場空間,但會被壓縮得很快。”因此,他們首先要做的不是幫客戶節省成本,而是創造更高的價值。“只做推理且只做最快的推理”開始成為楊濱所信奉的法則。

2025年底一份百兆Token實證研究顯示,推理模型已處理OpenRouter平台約一半的Token,而Agentic AI推理正成為增長最快的互動方式。這意味著低時延和高穩定性的價值正在被進一步放大。

楊濱指出,Agent完成一項任務往往需要經歷任務規劃、工具呼叫、結果驗證等多個環節,在這背後可能對應幾十次甚至上百次推理。而任何一次推理產生的延遲,都會沿著任務鏈不斷累積。

如果進一步發展為多個Agent協同,單Agent的響應變慢,還可能會像蝴蝶效應一樣在整個系統中層層傳導,最終拖慢任務執行。

除此之外,楊濱還注意到人與Agent互動中對高穩定的追求:人與人交流時的停頓本身暗含思考、組織語言等語義;但當Agent輸出Token的節奏忽快忽慢時,使用者感受到的反而是一種機械感。

當Agent時代的需求被一步步明確,重新思考推理晶片的設計便成為自然而然的選擇。在楊濱看來,傳統GPU建立在馮·諾依曼架構之上,並不完美匹配當下的計算模式;而完全ASIC化雖然能夠獲得極致性能,卻又難以適應模型快速演進帶來的變化。

因此,新的架構需要重新思考那些能力可以硬化,那些能力需要保持靈活,最大化算力、存力與運力的系統方案綜合效率。沿著這一思路,楊濱及其團隊最終確定了LPU的技術路線。

02. 不是複製Groq,做面向Agentic AI即時推理時代的原生LPU

楊濱並不認為元川微是在複製Groq。

他直言兩家公司雖然都關注低延遲、可預測的推理,但誕生於CNN時代的Groq LPU當時面臨的模型架構和應用需求都與今天並不相同。

儘管Groq後來將產品名稱從TSP(Tensor Streaming Processor,張量處理器)改為LPU(Language Processing Unit,語言處理單元),在他看來這並不意味著LPU只能處理語言模型。

同樣採用這一命名的元川微,將其架構命名為LPU+,從設計之初便支援多模態模型。此外,作為Transformer時代的原生架構,LPU+還針對MoE(Mixture of Experts,混合專家)模型的動態調度特徵進行最佳化。

但這並不意味著Groq過去的技術積累沒有含金量。“Groq真正值得借鑑的是其一直堅持的硬流水架構。”據楊濱的觀察,這在一定程度上避免了晶片運行過程中的資源競爭和不必要的資料等待,也為採用大容量SRAM創造了條件。

不過,要將這套架構與記憶體介質的協同優勢真正發揮出來,還有賴於編譯器的提前規劃。

楊濱將這一過程形容為制定高鐵運行圖:每一趟列車何時發車、何時停靠、停留多久,都已經提前安排妥當。直到真正執行階段,高鐵只需按照既定路線執行任務即可。

也正因為此,楊濱強調LPU的時空編譯器、硬流水架構、大頻寬記憶體這三大核心很難區分誰的優先順序更高,前兩者決定了晶片的理論性能,而時空編譯器則關係到這些能力在實際運行中能夠兌現多少

這些技術最終指向的,並不是一顆單獨的推理晶片。

楊濱告訴雷峰網,基於硬流水架構,元川微無需針對不同算力等級重新設計晶片,而是可以根據雲邊端不同場景靈活擴展算力規模。

在剛剛落幕的2026世界人工智慧大會上,這套技術路線首次以Agentic AI Token工廠的形式對外亮相,為企業級推理服務提供底層算力支撐。

這只是藍圖落地的第一步。在華為二十多年的經歷中,楊濱最大的收穫並非某項具體技術,而是一套從產業價值、商業閉環一路推導至技術選擇的系統工程思維。

元川微成立至今的每一步,都在驗證這一思維的有效性。而它也將繼續指引這家創企尋找下一階段的答案。 (雷峰網)