一台巴掌大的 Mac mini,到底能不能成為普通人的本地 AI 工作站 / Agent Server?
這個問題其實已經不用回答了:年初 OpenClaw 帶起來的 Agent 熱潮導致 Mac mini 脫銷,已經給出答案了。
現如今,它已經搖身一變變成了「AI PC」的代名詞,不僅價格隨著記憶體漲價水漲船高,性能也是最高支援 M5 Pro,64GB + 8TB 的組態讓 Mac mini 的最高價格來到了 51249 元……
這還是迷你電腦嗎?我已經不認識了!
就連伺服器市場都盯上了這個不起眼的小玩意:OpenAI 都要買上數萬台 Mac mini 和 Mac Studio 來進行模型的訓練,Anthropic 也在亞馬遜 AWS 上租賃大量的 Mac 伺服器。
大模型廠商們使用 Mac mini 來作為 Agent 的訓練場,讓 GPT/Claude 這些模型,可以讀取本地檔案、呼叫開發工具、操作專業軟體,甚至同時執行小時級甚至天級的長程任務。
這些情況的背後,是AI PC 競爭的變化,早已從「能不能跑模型」,轉向「能不能長期讓 Agent 在這台電腦上工作」。
也是在這個背景下,新一代 Mac mini 的定位開始發生變化。LM Studio Bionic、裝置端模型、AI 智能體、exo 叢集都成了 Mac mini 的主打。蘋果甚至乾脆直接把新 Mac mini 描述為一台可以「全天候」運行智能體的桌面電腦。
前幾天我們拿到了一台最新款 48GB + 2T 的 Mac mini,採用作為高配型號、與 M6 一同推出的 M5 Pro 處理器,搭載 18 核中央處理器、20 核圖形處理器、16 核神經網路引擎,以及 10Gb 乙太網路連接埠。
根據官網的售價,這台 Mac mini 到手需要 25749 元,或者免息分期 24 個月,每個月 1073 元。
這個價格,說實話一點都不 mini……
但如果看這一年的 PC 市場,幾乎所有主打 AI PC 的電腦,都在講統一記憶體,都在講算力,Windows 那邊有 AMD 和輝達,開始把一些高性能的算力晶片下放到筆記型電腦上,而不是一味地在追求 5090 顯示卡等。
對比同參數等級的電腦體積,又會覺得這個放在桌子上,小小的,幾乎是不佔據太多地方的小盒子,是真的很 mini。
所以,它到底可以做什麼呢?
用 Final Cut Pro 來剪視訊更快了,用 Blender 來做三維建模更流暢……這些專業軟體,本來就是高性能 Mac 最擅長的事情。
但現在發生的更有趣的變化,是 AI 開始成為呼叫這些能力的新入口。
寫程式碼不再只是打開 Xcode 自己敲;處理幾十份資料,也不一定需要一個個打開檔案;Blender、剪輯軟體、終端和本地模型,都已經、或者有可能在將來,變成讓自動化的 Agent 可以隨手呼叫的工具。
這台電腦屬於你,但又不只「屬於」你。
當然,與 AI 更直接相關的,還有最新的 M5 Pro 處理器和極致的記憶體組合,讓視訊剪輯軟體裡 AI 的畫質提升、照片和視訊中的 AI 增強都變得遊刃有餘。
更高的組態可以讓 Mac mini 擁有本地部署大模型的能力,但即便不拿它部署大模型,一台 6999 的 Mac mini 也會是當下適合給 Agent 使用的電腦,因為它很好地為 AI 提供了一個可以持續工作的地方。
我們手裡這台 25000 元多的 Mac mini,大機率不會是普通消費者的選擇;但它距離一台強大的桌上個人智能終端,越來越近了。
照著眼下 Mac mini 定位的變化,我們也從 AI 本身、AI 進入傳統軟體,還有支撐這一切的專業 GPU、神經網路引擎能力,來看看 Mac mini 在成為一台 AI PC 上都有些什麼優勢。
能裝下 270 億參數的 AI
首先,M6 處理器看起來擁有這一代最完整的 AI 組態:12 核 GPU 的每一個核心都有 Neural Accelerator(神經加速單元),同時還有雙 16 核 Neural Engine(神經引擎)。根據官方的對比顯示,相比 M4 Mac mini,M6 機型的 AI 性能最高提升 4 倍。
但如果我們真的想要在電腦上運行大模型,另外兩個經常被提起的數字可能更加重要:記憶體容量和記憶體頻寬。
蘋果官方提供的 M6 Mac mini 最高只有 32GB 統一記憶體,頻寬最高 170GB/s;而我們手裡的 M5 Pro 機型,則達到了 64GB 和 307GB/s。
隨著開源模型的能力逐步逼近 Fable 5、GPT-5.6 Sol 這類頂尖模型,開源實驗室也開始推出從 10 億參數到超過 700 億參數的大模型,本地化 AI 變成 AI PC 的主打。
我們準備了幾個不同尺寸的量化模型,從大約 8B、14B,一路增加到 30B 等級,再繼續挑戰接近機器記憶體極限的模型。
每個模型都執行同一組任務:給它一份長度固定的資料,要求閱讀、總結、回答問題,再進行幾輪連續追問。
記錄模型載入時間、首 Token 用時、預注入效率、推理 Token 速度,以及整個過程中佔用了多少統一記憶體。
一開始先是用了 GPT 的 20B 開源模型,然後問一下它是什麼模型,這一輪對話就處理了 72 個輸入 Token,生成了 178 個輸出 Token,整輪請求耗時約 3.64 秒,平均生成速度為 55.66 token/s。
繼續測試千問的 Qwen3.8 27B 參數,量化到 4 位元的模型,能看到回覆的速度還是很快,總用時 2.9s,生成的速度是 41.64 token/s。
當輸入一份超長的文件時,我們發了 Attention is all you need 那篇論文給它,可以看到最終的處理速度也有 32 token/s,對於一個 27B 的本地大模型來說,Mac mini 的速度基本上是可以接受的。
模型繼續變大,我們換上了 Meta 最新的開放模型,300 億參數。同樣的論文總結任務,能看到隨著模型參數變多,Mac mini 的讀入速度和生成速度都有變化,尤其是讀入的速度從 473 token/s 降到了 只有 32 token/s。
而當面對 70B 的 Llama 3.1 模型時,雖然也能跑,但我們只是發了一句你好,總用時 2 分鐘 48 秒,平均生成速度只有 0.05 Token/s。
對本地大模型來說,除了不同參數量和量化的區別,針對 Mac 還有 GGUF 和 MLX 兩種路線。
比如,同一個 Qwen 模型可以分別製作成 GGUF 版本和 MLX 版本。它們可以來自同一個模型,區別在於如何保存參數、如何量化,以及用什麼引擎運行。
GGUF 是模型檔案格式,MLX 是蘋果開發的機器學習框架。GGUF 路線的主要特點是支援多種硬體,跨平台使用方便,而 MLX 則是圍繞 Apple Silicon 設計,利用統一記憶體架構。
不過,雖然MLX 圍繞蘋果晶片設計,但具體哪個更快、更省記憶體,要看模型和執行階段版本。
我們的總體結論是:如果你只是希望進行問答的話,對於一個 48GB 運行記憶體的 M5 Pro Mac mini,舒適區就是 200 億到 300 億參數區間的中尺寸模型,也可以試試 330 億參數的 MiniMax H3,用來做視訊生成。
打造自己的智能體
接下來我們再看複雜 Agent 任務。
跑得動模型,距離跑得動 Agent 還差很遠。2026 年再測試一台所謂的「AI PC」,只讓大模型回答簡單問題明顯有些不夠了。
過去兩年,本地大模型最常見的形態仍然只是一個聊天框:模型下載到電腦裡,然後問問題、寫文章、總結文件。它證明了電腦「能跑 AI」,但還沒有真正改變電腦的使用方式。
今年我們看到的變化,是越來越多本地 AI 工具開始試圖跨出聊天框。
LM Studio Bionic 就是其中一個很典型的例子。它並不是單純再做一個本地模型的「對話殼」,而是讓模型獲得讀取項目檔案、運行命令、修改程式碼和連續執行多步任務的能力。
在 LM Studio Bionic 內,我們可以直接使用本地模型,也可以在處理較重任務時切換到雲端的付費開源模型。
其實我們手上的電腦,到底能安裝多大的大語言模型,在 LM Studio Bionic 內就能直接看到。
應用會主動識別裝置的可用記憶體,來推薦模型;以及針對每個模型,會顯示「Full GPU Offload Possible」(完全載入到 GPU 可行)或「Likely too large」(可能太大了)等提醒。
於是第二項測試,我們準備讓 Mac mini 真正幹活。還是選擇 Qwen 3.8 27B 模型來驅動 Agent,來處理一個裝有二三十份多模態資料的資料夾,看看如此龐大的上下文,它還能不能處理好。
經過了大約 14 分鐘,Agent 完成了梳理,給到了我們期待的答案。雖然用時的確有點長,但別忘了這是完全本地運行的——全程資料都沒有上傳。
想像一下在一個極度保密的工作環境裡,比如藥企的實驗室或者晶片公司的設計部門,用時長來換絕對的資料安全合規,是可以接受的。更別提這還只是 Mac mini,如果是 Mac Studio 的話只會顯著更快。
最近 Computer Use 比較火,我們也讓這個本地 Agent 操作 Blender 做了一個 3D 模型。我們注意到,模型決定直接呼叫 Blender 內建的 Python API 進行操作,而沒有採用 GUI 操作的「笨辦法」。
最後,也讓它利用這個生成的 3D 模型,搭建了一個果味的行銷網頁。
而用於視訊生成的 330 億參數 MiniMax H3 模型,官方 HuggingFace 的檔案是有 498G。
我們在 LM Studio Bionic 內找到了第三方壓縮後的 MiniMax H3 衍生模型,但 LM Studio 的內建推理引擎,主要支援語言模型及部分視覺理解模型——換言之,這個工具不太適合用來駕馭多模態模型。
於是我們換成了專門的開源模型視訊生成平台 ComfyUI,把之前 APPSO 已經搭建好的 MiniMax H3 工作流直接匯入完全本地化的環境。
實測下來,視訊生成的壓力還是很大,Mac mini 瞬間變燙了不少,內部的風扇轉動聲音也更加明顯。
最後的效果是,一個 15s 的視訊,Mac mini 跑了將近 90 分鐘之後才生成,而將時長切換到 5s,用時 18分鐘就能得到一段視訊。
這也基本能劃出這台 48GB M5 Pro Mac mini 做本地 AI 的能力邊界:
- 300 億規模左右的量化語言模型已經可以比較流暢地使用,本地模型常駐、處理文件、寫程式碼,以及驅動 Agent 完成一系列電腦任務,也都屬於它比較合適的工作負載。
- 但對於視訊生成這種需要長時間佔用大量記憶體和 GPU 算力的任務,它所需要的時間就會變多。
- 大尺寸的 48GB 統一記憶體能解決很多模型「裝不下」的問題,但並不是所有裝得下的模型,都能以實用的速度跑起來。
所以,如果只是把 Mac mini 當成本地大模型和 Agent 的主機,應付日常相對輕量的工作,它已經絕對夠用。
但如果希望它同時承擔大型視訊生成、訓練這類重型 AI 計算,它的定位很明顯不是一個單純的高性能 GPU 工作站。那應該是 Mac Studio 的工作。
一種新用法:你的專屬線上 Agent 伺服器
對大多數人來說,在自己的電腦上跑一個儘可能大的模型,本身也並不是剛需。
這次體驗下來,我們反而覺得更值得關注的是:當 Agent 開始真正接手寫程式碼、整理檔案、剪視訊、做 3D 這些工作之後,我們使用電腦的方式也在發生變化。
過去電腦的性能幾乎都服務於坐在它面前的人;現在,同一台電腦開始需要同時服務幾個在後台工作的 Agent。
這也是為什麼前面我們說,這台電腦屬於你,但又不只屬於你。
在性能和組態之外,這台 Mac mini 讓我們感興趣的地方,依舊來自它的形態和蘋果生態,它沒有電池,不需要帶出門,體積又足夠小,通過接力還能讓我的 MacBook Air 當做它的鍵盤和觸控板。
這讓它天然就適合一件筆記本不太適合長期做的事:一直開著。
蘋果官網的原話是這麼說的:
無論將 Mac mini 用作主力台式電腦還是全天候桌面智能體計算工具,使用者都能利用其升級性能輕鬆駕馭各類工作任務。
說白了,就是你可以把它當成伺服器來用。
於是,我們把它作為 Codex 的 Agent 伺服器,讓那些 Mac mini 原本就擅長的任務,現在通過另一台遠端裝置上的 Codex 遙控完成。
例如使用蘋果開發者的 Xcode 來編譯大型工程,甚至是Android開發的 Android Studio + iOS Simulator + Docker +IDE,再加上瀏覽器幾十上百個標籤頁一起打開。
其次是創意生產的工作,比如使用 Final Cut Pro、DaVinci Resolve 達文西,剪輯 4K/6K/8K、多機位、ProRes RAW,疊很多特效、降噪、調色節點的視訊。
再同時處理大型攝影/平面設計工作流,用 Lightroom 批次處理幾千張 RAW,打開 Photoshop 做幾十層甚至上百層的大尺寸 PSD/PSB。
還有 3D 製作、音樂創作等,幾百軌工程、大型場景的多高解析度貼圖、粒子,都需要大量的統一記憶體。
而 M5 Pro 自帶 H.264、HEVC、ProRes、ProRes RAW 的硬體編解碼引擎、硬體光追等能力,幾乎在這塊市場是完勝。
雖然並非單個程序就需要 48GB,但現在我們可以讓這一大堆的任務,全部讓 AI 同時進行。
我們沒有讓 Codex 去操作 Xcode 做一個普通的 App,而是讓它儘可能同時去做工程管理、SwiftUI、資料庫、檔案系統、多執行緒等複雜任務,要求它實現一個「原生 Apple 全家桶素材管理器。」
與此同時,我們還能在手機上下命令,「我電腦上的某個資料夾裡有大約 100GB 的 4K 視訊、照片和錄音素材;請你幫我把它們整理並製作成一支 3~5 分鐘的 4K 視訊。你可以通過 Computer Use 使用電腦上的 Final Cut Pro 或者達文西進行處理。」
另一邊,它還能繼續處理「造一個大型 Blender 項目,再自己渲染。」
我們只是在 Codex 裡說了一句話,Mac mini 就能自己打開 Blender,建了一座城市,又把它渲染成了視訊。
而以上這一切發生的同時,我們在外面放假呢……
48GB 在這個大型 3D 項目下,要處理的大型 Geometry Nodes、紋理和 Cycles scene 等內容,就開始真正有意義。它需要給這些長期駐留、同時工作的 Agent 留出空間。
更好的情況是,開了這麼多 Agent,跑這麼多工,這台電腦仍然是「能用」的:
過去我們衡量一台電腦的多工能力,看的是它能同時打開多少軟體;瀏覽器、Photoshop、Xcode、剪輯軟體一起在後台使用,電腦還能不能保持流暢。
但到了 Agent 時代,「多工」正在變成另一件事。
一個 Codex Agent 在 Xcode 裡寫 App,一個在後台編譯 Chromium 核心,一個處理 100GB 資料,另一個控制 Blender 建模和渲染。與此同時,輕量化的本地模型還可以常駐記憶體,等待隨時呼叫。
這或許也是 AI PC 真正發生變化的地方:電腦不再只是等著人去操作的一台工具,它開始變成一個可以一直開著、一直有人替你幹活的工作場所。
是的,這台電腦的操作權限不只「屬於」你,因為它是一個專屬於你的「伺服器」。 (愛范兒)
