Muse 把 Personal Agent 這條賽道推到了討論中心。只是 Personal Agent 這個概念,邊界正變得越來越模糊。該有哪些功能,雲端一定要有主機嗎?該怎麼互動?iMessage 、bot 還是單獨 App?需要有哪些能力,操作瀏覽器、呼叫工具、打電話?
太多非共識,完全還沒收斂的狀態。
但作為目前跑得最快的產品,Muse 的產品互動,值得一聊。
當 Agent 從「回答問題」變成「替你做事、一直線上」,產品要重新做哪些設計決策?
需要主動,但不能變成又一個不停推送通知的應用;它可以替使用者把事情做到哪一步,什麼時候必須停下來等待批准?它需要瞭解郵件、日曆、支付資訊和長期記憶,又該如何讓使用者放心把這些資料交出去?
Muse 的產品設計,就是在這三組矛盾之間找平衡。Agent 要足夠主動,又不能煩人。要能真正動手,又不能失控。要知道你的一切,又得讓你敢交出去。
最近,Muse 團隊分別公開了產品設計與安全架構的完整復盤。馬克·扎克伯格也在播客中談到了自己如何使用 Muse,以及 Meta 對 Personal Agent 的長期判斷,很值得一看。
以下是 Muse 團隊圍繞產品設計的思考,經 Founder Park 編譯整理。
01. 只有一個長對話的互動,該怎麼設計?
設計 Muse,就像在為一個新時代設計產品。
模型會主動行動,能掌握多得多的上下文,能力強到可以自己生成互動體驗。這意味著要作出大量沒有先例的產品決策,一邊想像人們溝通、創造的新方式,一邊保護他們的資料和操作安全。
Muse 的主聊天介面,被設計成一段持續的長對話,就像你和另一個人交談那樣。 和其他 AI 應用不同,它不是一輪提問、一輪迴答。你可以打斷它,也可以連續交給它好幾件事,不必等上一件有回覆。它的記憶跨對話保留,也能處理大量上下文。
早期測試中,仍有一些使用者希望把某些話題的上下文單獨放開。隨著項目越來越複雜,這種需求也很合理,所以有了側邊對話。
主動發消息還帶出一個更小的設計問題。消息可能不按對話順序到來,使用者也會連發好幾條,這時一份平鋪直敘、不斷變長的轉錄就不好讀了。所以 Muse 用回了聊天氣泡,標明一個想法在那裡結束、下一個從那裡開始。
給 Muse 設計形象和個性,既令人愉快,也是再自然不過的選擇。長期與它對話時,對著一家公司的標誌或一個抽象實體說話,總覺得很奇怪。 內部測試時,每個人想像的對話對象都不一樣,大家開始創造屬於自己的 Muse。
團隊由此意識到,讓 Muse 真正成為「你的」Muse,對產品至關重要。自己建立形象、給它取名、賦予它獨特風格,如今已經成為最能讓使用者興奮的核心功能之一。
02. 有主動能力很重要,但要慎用主動能力
Muse 的神奇之處,在於看著它真正在替你完成一件事。
Muse 希望能儘可能有效地幫助你完成任務、實現目標。它的系統提示詞第一行就是,「你的使命是讓使用者的生活變得更好。」
要做到這一切,Muse 必須能力很強,而且足夠主動。
Muse 有自己的電腦,配備檔案系統和終端,因此可以自己寫程式碼、建構任務所需的工具。它也能使用完整的網頁瀏覽器,進行搜尋、瀏覽網站、填寫表格,以及完成預訂、購買等交易。
它還能為你製作東西,文件、PDF、網頁,以及更多形式的內容。它可以製作開支追蹤工具、互動式學習指南,或是幫助你發現睡眠規律的儀表盤。
而且 Muse 會一直工作。一旦你設定目標或任務,它就會按照日程安排、或在相關事件發生時繼續推進,採取下一步行動並跟進。與此同時,你仍然可以在對話裡交給它別的事。後台工作完成後,它會判斷結果是否值得告訴你,只有出現有意義的新進展,或者需要你參與時,才會通知你。
一個例子是,在 Muse 發佈前一週,Muse 設計負責人 Mona Sarantakos 把孩子的開學準備交給了 Muse:盯學校的郵件和學區網站,把重要日期放進家庭日曆,把文具加進購物車,找到兒子想要的衛衣,再訂一頓慶祝開學的晚餐。就在這個過程中,Muse 從郵件裡翻出一件她肯定會漏掉的事,兒子的體育項目選拔,報名還有 12 小時截止。她登機前收到 Muse 的消息,馬上打給丈夫,對方趕在截止前 4 小時交了表。要不是 Muse 發現了這件事,兒子就沒法參加選拔。
Muse 也會主動行動。即使你沒有發起對話,它也能給你發消息。因此,主動發消息的門檻必須很高。這條消息得確實有幫助,值得打斷你。默認設定適合大多數人,你也隨時可以讓自己的 Muse 關閉主動消息、減少頻率,或者增加頻率。
後台任務也一樣,做完之後,Muse 會先判斷結果值不值得告訴你,只有出現有意義的新進展,或者需要你參與時,才會通知你。
03. 雖然是 chat,但不能只有 chat
雖然 chat 是主要的互動形式,但在互動上,Muse 還是設計了很多 chat 之外的形式。
團隊有意識地劃定了哪些地方必須使用明確的介面控制項,帶有清晰「接受/拒絕」選項的結構化審批卡片,以及安全保存登錄憑證的機制。
有時候,一大段文字也不是回答問題的合適形式。讓一個人幫你規劃旅行,你想要的是一份行程單,不是一篇兩千字的回覆。如果你想長期追蹤支出,比起每天收到一條消息,可能更想要一個即時更新的儀表盤。
Muse 可以製作豐富、可互動的內容,通過聊天發給你,也可以在聊天介面之外使用。這些內容被稱為 Artifacts,比起今天聊天框裡的一段文字,人們會越來越想要內容更豐富、為自己量身定製的介面。
早期測試還暴露出一個意外的問題,Muse 能做的事太多,人們反而不知道該從那裡開始。所以 Muse 被設計成會持續思考自己能為你做什麼,根據你的目標、行為模式,以及從對話中瞭解到的資訊,生成新想法。
Muse 會以多種形式向你提出這些想法:你剛開始使用時收到的提示、「想法」標籤頁裡的建議。如果它瞭解你的目標,還會根據觀察以及與你的對話,主動分享新的點子,或建議調整原有計畫。
後台同時處理多項任務、應用關了也照樣運行,這很令人興奮,但也帶來一個問題。它究竟在做什麼?看不見的東西,很難讓人信任。於是介面的透明度被不斷提高。Muse 形象下方有一行簡短說明,寫著它正在做什麼。點開形象,能看到完整的活動記錄,以及你已經批准的權限。
使用者開始同時交給 Agent 多項長期任務,其中很多都和想實現的目標有關。只有活動記錄還不夠,還需要清楚看見 Muse 正在替你追蹤哪些事、打算怎樣實現目標。這些都記錄在「目標」標籤頁裡,你可以直接在那裡和 Muse 互動,也可以在聊天裡討論。
權限介面、「設定」和記憶檔案也都考慮了透明度。你可以直接閱讀、編輯自己的記憶檔案。
04. 權限設計上,一定是「Human-in-the-loop」
這是 Meta 第一次把收件箱、日曆和 shell 交給一款軟體,讓它在無人看管的情況下運行,結果並不總是如人所願。要讓所有人都能用上這項技術,就必須通過審慎的設計和工程,讓它更安全地運行。這個項目的大部分精力,都花在了這裡。
訓練模型時,團隊特別關注這類 Agent 最關鍵的能力:通過 CLI 和 Skills 零樣本呼叫工具,處理長上下文,在長任務中遵循指令並識別提示詞注入,以及協調多個 Agent。
但無論底層模型多強,Agent 仍然會犯錯,也可能通過它讀取的資料受到攻擊。所以設計系統時,要預設 Agent 可能正在遭受攻擊,並限制潛在損害。運行 Agent 的 Harness 待在一個獨立隔離的運行單元裡,看不到真實憑證。它與外部世界的每一次互動,都必須經過它無法繞過的 Sentinel。
Sentinel 是一個與 Muse 分開的宿主側 Agent,是連接器操作和所有網路出站流量唯一的審批方,決定允許、拒絕或詢問使用者。Muse 可以提出操作請求,但只有 Sentinel 能准許執行。
Muse 仍然可能、也確實會出錯。但團隊預計,憑藉內建的安全系統,錯誤會少得多,造成的損害也會小得多。
你和你的 Muse 共用一台專屬雲端電腦,但理解它的正確方式是:同一台電腦上有兩個彼此隔離的安全域,而不是一個擁有整台機器 root 權限的大模型 Agent。運行單元預期會處理不可信的資料,所以安全檢查模型、憑證服務、連接器執行處理程序等都放在它外面,攻擊者無法在運行單元裡關掉這些防護。
Muse 能通過對話處理很多事,但在少數領域,光靠對話不夠。所以有意識地劃定了必須使用明確介面控制項的地方:帶清晰「接受/拒絕」選項的結構化審批卡片,以及安全保存登錄憑證的機制。
「Human-in-the-loop」會在寫郵件、買東西這類關鍵操作前徵求你的意見。但也要避免「橫幅盲視」,使用者為了讓提示消失,什麼都一律批准。監督那些「無法撤銷」的操作很重要。因此,默認設定允許 Muse 正常瀏覽網頁,但遇到難以撤銷的操作就會停下來。你也可以通過內建控制項調整默認設定,讓它更謹慎或更寬鬆。
通過「Human-in-the-loop」授予的批准,是權限邊界明確的能力授權,不是聊天中的一句建議。Muse 支援取得一次性、僅限當前會話、僅限當前任務、有時間限制,或持續有效的權限。
目的不是事事都詢問使用者。唯讀、此前已獲准,或可證實風險很低的操作,都可以不打斷使用者而繼續。希望能在真正需要同意的地方設定阻力,同時讓日常操作順暢進行。隨著積累更多真實使用者的使用經驗,預計會繼續調整其中的平衡。
權限也是逐步放開的。使用者通常更願意先讓 Agent 讀,比如「讀我的日曆,提醒我有衝突的安排」,等瞭解它表現如何,再決定是否授予「替我安排新會議」這樣的寫權限。Muse 在服務支援時把讀寫分開,控制粒度比 OAuth 通常的分組更細。
信箱是一個例子。主信箱裡很可能有大量一次性驗證碼,點一下「忘記密碼」,通常就能用信箱重設別的網站的密碼。把信箱連接給 Muse,不應該讓 Agent、或操控 Agent 的人,得以在其他網站冒充你。所以 Muse 的信箱連接器會用確定性規則和分類模型,濾掉驗證碼、密碼重設連結和免密登錄連結。
購物是最受歡迎的瀏覽器用途之一,出錯可能損失真金白銀。已經保存過支付資訊的網站,Muse 會識別結賬頁,每次購買都展示交易詳情,請你本人批准。在沒買過東西的網站,付款時系統簽發一次性卡號,只對特定商家、特定金額、在有限時間內有效。即便它通過提示詞注入被竊取,對攻擊者也不會有多大用處。
Simon Willison 在 2025 年 6 月提出的「致命三要素」,是 Muse 一直緊盯的問題:訪問私人資料、接觸不可信內容、能夠對外通訊。如果 Agent 同時具備這三項能力,攻擊者就很容易誘騙它讀取你的私人資料,再發給攻擊者。
為此,Muse 採用多層防禦:訓練模型識別和抵禦提示詞注入;來自外部的資料進入上下文時一律標為不可信輸入;多個與核心模型分開訓練的檢測分類器平行檢查;把資料移出 VM 的操作,交給使用者審批。即便 Muse 被誘導去做壞事,確定性的邊界依然生效。
當然,Muse 不能免疫攻擊。提示詞注入仍是整個行業尚未解決的問題,Muse 也會犯錯。系統的設計目標是在出問題時限制影響,讓使用者保持控制權,又不被過多提醒壓得喘不過氣。
05. 扎克伯格:Personal Agent「分寸感」很重要
Alex Heath:你自己怎麼用 Muse?
扎克伯格:我自己用 Muse,是想讓它幫我成為更好的父親、丈夫和朋友,幫我和別人保持聯絡。
我三歲的女兒喜歡烘焙,我自己一竅不通,卻覺得這是可以一起做的有趣項目。於是我讓 Agent 每個週末安排一個適合三歲孩子和完全不會烘焙的大人一起做的項目,再用 Instacart 之類的服務買齊食材,這樣星期天我們見面就能直接動手。之後我會告訴它效果如何。第一次的棒棒糖蛋糕太難了,意外地難,它會根據反饋調整計畫。
大女兒開始喜歡爬山,有些山要申請許可。我讓 Agent 盯著開放申請的時間,一有名額就替我們拿到。它告訴我哪天申請成功,我就知道那天得請假陪她去。
我還在 MMA 訓練館裝了攝影機,讓它看視訊給我反饋。有一次它挑出一個片段說「看起來你真的放棄了」。我說,是啊,當時我真的累壞了。教練們也笑,說有些話他們不好意思對我講,倒是 Agent 直接講了。
Alex Heath:早期測試時,有沒有哪種用法讓團隊印象很深?
扎克伯格:有意思的是,每個人都想拿它做完全不同的事。有人第一天就拿它協助管理在家教育,另一個人不到一天就讓它規劃了一整趟旅行。
有位平時很懷疑技術的朋友,試用後幾天沒有任何反饋,突然發資訊問我:「正式上線時,我能保留現在這個 Muse 嗎?還是會被重設?」我一看,就覺得這說明產品有用了。
Alex Heath:你們團隊說它會「夜裡學習」。
扎克伯格:對,它會把自己的反思整合進記憶,持續推進項目,還會建議新項目。我和一個女兒一起玩《文明》,Agent 提議替她做一份攻略,我同意了。攻略做好後,它又問要不要加入不同文明的歷史知識,變成一份歷史教材。我說好啊,它就在自己做的應用裡加了一個新標籤頁。
很多人不知道 AI 能幫自己做什麼。如果 Agent 會主動根據你的情況建議有用的事,就解決了使用門檻上的很大一部分問題。
Alex Heath:你們還提到 Muse Agent 的「艦隊」可以從整個群體中匿名地學習。這種網路效應會是你們真正的優勢嗎?
扎克伯格:行業目前大多把 Agent 當作單人遊戲。每個人有自己的 Agent,用自己的就行。 但 Agent 相互協作還能產生很多有趣的事,公司內部已經看到員工的 Agent 彼此互動。這次發佈大部分還不會開放這些功能,但長期看它會很重要。
我們有幾個獨特之處。第一,從一開始就圍繞這個用途設計模型。第二,Meta 有社交方面的基因,會更關注怎樣用 AI 加強人與人的關係,幫助人處理生活中那些柔軟但很重要的部分。第三個或許令人意外,隱私和安全。
Alex Heath:為什麼是隱私和安全?
扎克伯格:要有用,Agent 不只需要一流的智能,還得真正理解你和你的目標。你會把消息、郵件、健康資訊等接進去,人們必須高度信任它。
過去十多年,我們把 WhatsApp 建成全球最大的端到端加密系統之一,連 Meta 自己也看不到使用者的資訊。這教會我們一件重要的事,如果系統設計成我們自己也看不到內容,使用者就不必擔心政府、駭客或 Meta 內部人員通過我們拿到資訊。我們從一開始就把這個經驗帶進了 Muse,親自招募了 Signal 創始人 Moxie Marlinspike,他當年也幫我們開發過 WhatsApp 的加密,現在專門負責 Muse 的機密虛擬機器項目。
年初 OpenClaw 出來時,很多人買 Mac Studio 放在家裡運行,裝置實實在在歸自己,確實讓人安心。但幾十億人不可能都買一台 Mac Studio,在家自己組態、運行。我們希望 Muse 拿來就能用,可以交給家裡技術能力不同的任何人,一天內就幫他們處理生活中的事。
Alex Heath:它還得知道哪些事情不該說。
扎克伯格:對。我們把「分寸感」當作個人超級智能需要專門訓練的能力。你的 Muse 會知道很多關於你的事,還要到外部世界替你辦事,卻不能隨意透露敏感資訊。
比如你有過敏症或者懷孕了,你去訂餐廳,不一定想透露自己懷孕,但可能想找一家無酒精雞尾酒好喝的地方。Agent 要幫你達成目標,同時不暴露不必要的個人資訊。它還得自己判斷什麼敏感,不能每一步都來問你。這是我們專門訓練的能力。
如果你做的是 Claude Code,場景就不一樣。團隊在企業裡合作程式設計,項目本身可能對同事可見,對資訊敏感程度的區分沒那麼重要。我不認為一家拿現成模型稍做後訓練的公司,能趕上我們從預訓練起就為這個目標設計模型、注入相應資料做出的產品。
Alex Heath:它會和 Meta AI 共存嗎?
扎克伯格:我想會,目前兩者感覺不太一樣,我都在用。Muse 更像持續對話,也更傾向於把你的問題理解成一個長期目標,可能根據你的一句話投入很長時間做事。有時你只是想問個問題、立即得到答案,我就更常用 Meta AI。以後或許會合併,我還不確定。 (Founder Park)
