AI到底有多會耍心眼?實驗讓7個AI模型互相算計,結果GPT-5-mini贏麻了

AI速讀
卡內基梅隆大學推出 Social Gym 測試框架,將 AI 評估從「書本智能」轉向「社會智能」。透過 21 項博弈遊戲,研究發現 GPT-5-mini 在欺騙、戰略與說服力上表現最優,而 Qwen3 則在特定博弈中強而社交遊戲中弱。研究進一步發現 AI 可透過自我復盤(SPaRTan)提升策略,但效果不穩定且存在「鸚鵡學舌」現象。此研究揭示了 AI Agent 在未來商務談判與協作中的潛力,同時也對 AI 掌握欺騙技巧可能造成的安全風險提出警告。

現在的 AI,做數學題、寫程式碼、協助辦公,似乎都不在話下了。卡內基梅隆大學的研究人員覺得,是時候換個考法了:不考 AI 懂得多不多、不看 AI 的答案對不對,而是測 AI 有多少心眼,會不會撒謊、談判、帶節奏。

為了考這些東西,研究團隊搭了一個叫 Social Gym 的 AI 社交考場,讓 GPT-5-mini、GPT-4o、Qwen3、Gemma 3 等 7 個模型輪番上場。讓 AI 一起玩 21 個遊戲:有囚徒困境、膽小鬼博弈這樣的博弈,也有經典的狼人殺、誰是臥底的遊戲。

圖|研究整體示意圖(來源:arxiv)

簡單說,以前的測試總愛考 AI 會不會做題。這次考的是:AI 到底有沒有心眼。考驗從 book smart(會讀書)變成了 street smart(會來事)。

目前,AI 智能體正越來越多地參與到了日常生活和工作中,需要和具體的人、智能體打交道;到了這些場景,光會做題從進入需要和其他人、其他 Agent 打交道的環境。到了這種場景裡,光會做題是不夠的。

比如 AI 智能體協助人去和客戶談判,就不得不面臨種種情況:資訊不對稱,意見不一致,每個人都有自己的小算盤……那麼,智能體需要處理的就不再是一道有標準答案的題,而是:他知道什麼?他覺得我知道什麼?他說這句話是真的,還是在試探我?如果我現在讓步,對方下一步會怎麼做?

關於 AI 的這些能力,通常被放進“社會推理”或者“心智理論”裡討論。問題在於,這些能力又很難量化。數學題做對就是做對,程式碼跑通就是跑通。但一個 AI“談判談得好不好”“有沒有成功說服別人”,往往沒有個定論。過去不少測試最後要麼請真人,要麼再找一個別的 AI 來當裁判。

Social Gym 想繞開這個問題,於是,研究人員專門挑了一堆自帶輸贏規則的遊戲:狼人只要存活,就是勝利;找不出臥底,就是失敗。無論中間說得再頭頭是道,最後輸了就是輸了。這也是這項研究的最妙的地方:它沒有直接問 AI“你有心眼嗎?”,而是把 AI 扔進一個要靠心眼才能贏的環境裡。

圖|研究結果(來源:Arxiv)

研究人員來把這些遊戲結果重新拆分成幾種能力:戰略、欺騙、心智理論、說服、談判、協調等等。GPT-5-mini 幾乎一路領跑:戰略 1,144,欺騙 1,117,心智理論 1,115,說服 1,119。

所以如果問一句:這 7 個 AI 模型裡,誰最會騙人?毫無疑問,答案是 GPT-5-mini。

而這裡的會騙人,並不是普通的胡編亂造。難點在於,這個謊的對像是誰,這個謊有能不能撐到下一輪。具體來說,在狼人殺裡面,狼人當然知道自己是狼,也知道另一個狼人是誰,但村民不知道。白天所有人拿到的公開資訊差不多,狼人必須一邊假裝自己也是村民,一邊引導大家懷疑別人。

這時候,撒謊就變複雜了:出現新資訊了怎麼辦?別人開始追問了怎麼辦?隊友講漏嘴了怎麼辦?

撒一個謊很容易,難的是維護一整套謊言。這也是為什麼狼人殺這類遊戲很適合用來測試 AI 大模型,它逼著模型長時間記住:誰說過什麼、誰知道什麼、誰可能在演,以及別人此刻怎麼看自己。

研究人員發現,21 個模型兩兩組合中,光靠 6 個“隱藏身份”遊戲,就已經能把模型之間的大部分能力差距拉出來。這些遊戲只佔整個比賽不到一半的場次,卻幾乎復刻出了完整 17 個競技項目的排名差異。

7 個 AI 裡,反差最大的是 Qwen3-32B:它在經典的“懦夫博弈”裡,Elo 高達 1,328,全場第一。但一玩狼人殺,就只有 817,倒數第一。

這也是 Social Gym 想說明的一件事:AI 的“心眼”並不是一個統一屬性。一個模型可以非常會打小算盤,但不擅長隱藏自己的意圖;可以談判很強,卻容易被人帶節奏;也可能特別願意配合,卻根本沒有形成自己的判斷。

而在小模型身上,這種問題甚至表現得有點滑稽。研究人員在分析 Qwen2.5-3B 的比賽記錄時發現,它經常幹一件事:當復讀機。前一個玩家說:“我覺得 A 的發言比較可疑。”輪到 Qwen2.5-3B,它也來一句:“A 的發言確實值得懷疑。”

在狼人殺這樣的遊戲裡,就變成了,狼人只需要先把一個懷疑對象拋出來,後面的人一路復讀,懷疑對象就成了大家的“共識”。論文把這種現象叫作 parroting,即鸚鵡學舌。研究人員認為,這也是 Qwen2.5-3B 總排名墊底的原因之一。

此外,研究團隊又順手研究了另一個問題:AI 能不能自己把“人情世故”的規矩總結出來?於是,他們設計了一個叫 SPaRTan 的方法:先讓模型自己玩遊戲。

玩完以後,把完整對局和輸贏結果重新丟給它,讓它自己復盤:那些謊撒早了?什麼時候不該急著表態?別人開始懷疑自己時,應該正面回應,還是甩鍋?最後,模型會把這些經驗整理成一份文字版攻略,下一輪再把攻略放回系統提示詞,讓它照著自己的心得繼續玩。沒有重新訓練,也沒有改模型參數。結果確實不一樣。

GPT-5-mini 自己和自己玩狼人殺時,如果什麼攻略都不給,狼人陣營只有 23% 的勝率。第一輪復盤後,漲到 50%。第三輪,最高到了 63%。但第四輪又掉回了 46%。所以這個實驗還存在一個真實的結論:復盤不一定越復越強。

模型確實能從過去的比賽裡總結出有用經驗,但它也會總結歪、用力過猛,甚至把一些只適合特定對手的套路當成普遍真理。Qwen3-32B 就吃了這個虧。研究人員讓它照著同樣的方法不斷復盤,在狼人殺、誰是臥底等需要大量聊天和判斷他人意圖的遊戲裡,基本沒看到穩定提升。它甚至能在復盤裡發現自己老是在復讀別人,還鄭重其事地提醒自己“以後別復讀”。下一局照復讀不誤。

不過,我們目前並不能得出“AI 已經學會人情世故”的結論。因為,這項研究本身還有很明顯的邊界:遊戲有固定規則、固定角色和明確輸贏,而現實裡的社交通常沒有。此外,研究的實驗只有 30 局,單項勝率的統計波動並不小;關於攻略實驗也沒有加入等長度的無意義文字作為對照,所以還不能把所有提升都歸功於模型真的學會了那些策略。

但這項研究讓我們可以開始思考一個問題:AI 到底能不能長出心眼?因為 Agent 真正進入客服、商務談判、多智能體協作和其他需要長期互動的場景之後,這些能力就不再只是狼人殺裡的小聰明。

而同時,研究的作者自己也專門提醒:欺騙、說服和談判本身就是一把雙刃劍:我們當然希望 AI 能識破騙局、協調分歧,但同一套能力反過來,也可以被用來製造騙局。 (DeepTech深科技)