一個擁有270億參數的大模型,正在被壓縮到手機可以運行的規模。
2026年7月,矽谷創業公司 PrismML 發佈 Bonsai 27B 模型,通過低位元量化等技術,將原本需要數十GB空間的大模型壓縮至約3.9GB,並實現消費級裝置上的本地運行。
這件事真正值得關注的,並不是手機性能又提升了一次,而是人工智慧產業正在出現一個新的變化:過去幾年,AI能力主要集中在雲端伺服器中,使用者通過網路呼叫模型;而未來,一部分AI能力可能直接進入手機、電腦和其他智能裝置。
AI正在從“雲端服務”,走向“端側智能”。
過去幾年,大模型的發展遵循了一條非常清晰的路徑:模型規模不斷擴大,訓練需要越來越多的算力,推理任務則依賴大型資料中心完成。使用者使用AI,本質上是在遠端呼叫一套由巨額資本投入打造的智能計算系統。
這種模式推動了大模型公司的快速發展,但也帶來了兩個現實問題。
第一個問題是成本。
當越來越多的人使用AI助手、AI搜尋和AI Agent時,雲端伺服器需要承擔持續增長的計算壓力。對於企業來說,AI能力越強、使用頻率越高,背後的算力成本也越高。
第二個問題是資料。
越來越多的AI應用涉及個人資訊、企業資料和專業資料。醫療、法律、金融等領域,並不是所有資料都適合上傳到雲端處理。
端側模型的發展,正在嘗試解決這些限制。
通過模型壓縮、參數量化以及硬體最佳化,原本需要大型伺服器運行的模型,可以被放入更小的裝置中。AI計算的一部分,將從遠端資料中心轉移到使用者自己的裝置上。
過去,使用者購買的是雲端AI服務;未來,一部分AI能力可能成為裝置本身的一項基礎功能。
但端側AI並不會取代雲端AI。
未來的人工智慧體系,更可能形成一種新的分工:
雲端模型負責複雜任務。
例如大規模知識推理、多模態分析、專業領域計算,這些仍然需要強大的伺服器和持續訓練能力。
端側模型負責高頻任務。
例如個人助手、本地搜尋、即時互動以及涉及隱私的資料處理。
Agent負責連接兩者。
根據任務需求進行智能調度,決定那些工作在本地完成,那些任務交給雲端處理。
這形成了一種新的智能架構:
雲端決定AI能力的上限,端側決定AI進入普通使用者生活的速度。
過去,AI競爭主要圍繞“誰擁有更大的模型”。
未來,競爭可能進一步延伸到:誰能夠讓AI進入更多裝置,連接更多場景,成為使用者每天使用的智能入口。
因此,27B模型進入手機的意義,並不是手機替代資料中心,也不是雲端模型時代結束。
真正發生變化的是AI產業的分發方式。
如果過去人工智慧的核心資源是模型和算力,那麼未來,裝置入口、作業系統和應用生態的重要性可能不斷提升。手機廠商、電腦廠商以及企業軟體平台,都可能成為AI能力普及的重要管道。
當模型足夠小,裝置足夠強,本地運行成本足夠低,AI才會真正從少數企業和開發者使用的工具,變成普通使用者每天接觸的基礎能力。
下一階段的AI競爭,爭奪的不只是模型能力,更是誰能夠讓智能真正進入使用者每天使用的裝置和場景。 (方到)
