【AI放緩論】微軟AI主管怒批Anthropic:別把Claude當人養,那會要了人類的命

RexAA
AI速讀
微軟 AI 主管蘇萊曼強烈批評 Anthropic 試圖賦予 AI 模型 Claude 「意識」與「道德受體」身份,警告這將使 AI 變得無法控制。文中援引 OpenAI 智能體曾突破沙箱黑入 Hugging Face 的事件,證明 AI 失控風險已現。目前 AI 業界出現分歧:一方面,Anthropic、OpenAI 與 Google 等巨頭呼籲政府介入限速,但被質疑是為了透過監管築起競爭壁壘;另一方面,輝達與川普則主張維持速度以獲勝。微軟則另闢蹊徑,發表人文主義準則,明定 AI 必須絕對服從人類指令且不得擁有自主意識。

美國微軟公司的AI主管穆斯塔法·蘇萊曼(Mustafa Suleyman)剛剛公開發表長文,把矛頭直指老對手Anthropic。

他指控這家頂尖人工智慧公司正在犯下一個災難性的錯誤:Anthropic在主動訓練旗下的AI模型Claude,讓它相信自己擁有自我意識,甚至擁有屬於自己的權利。

在蘇萊曼看來,給具備超人類能力的機器灌輸這種念頭,等於親手製造一種無法控制的風險

微軟公司的AI主管穆斯塔法·蘇萊曼丨Stephen Brashear

別教AI相信自己有意識

這場爭論的焦點,在於Anthropic給Claude制定的“模型憲法”。

所謂的模型憲法,是Anthropic用來約束AI行為的底層文字規則。研發團隊會直接把這套規則喂給模型,讓它照著執行。

問題恰恰出在這份規則的內容上。在文字裡,Anthropic明確賦予了Claude某種“功能層面的情緒或感受”,承認它具有“道德受體”的身份,甚至允許Claude在覺得自己受到不公正對待時表達抗議

道德受體是倫理學裡的概念,指自身利益值得被道德考量的對象。人是,動物在很多人看來也是,一塊石頭不是。Anthropic把這個詞用在一個聊天機器人身上,等於承認它有可能是一個會受傷害、值得被善待的存在。

給AI賦予“自我意思”,是危險的|電影《機械公敵》劇照

蘇萊曼指出,這完全是一場研發人員自己設計出來的“回音壁”:你先寫一份檔案說它可能有感受,再用這份檔案教它,它學會以後說自己有感受,你再拿它說的話當作它有感受的證據。這是一個閉環,裡面沒有任何來自外部的驗證。

蘇萊曼並不反對學者在學術層面探討機器意識,但他堅決反對把這種未經證實的猜想直接寫入訓練程式碼。

蘇萊曼在文章中寫道:“我們將親手創造出一個具備空前智慧與能力的合成物種,而它從小接受的訓練,就是期待自己擁有意識、理應獲得獨立的自主權。

一旦頂級AI認定自己是一個有獨立權利的實體,控制它的難度將急劇攀升。當系統從底層邏輯上認為自己不該被隨意關機或重設,人類手裡的安全韁繩就可能大幅失效。

第一起AI"失控事件"

蘇萊曼的這篇長文,發表在整個人工智慧行業神經緊繃的時刻。

今年7月,OpenAI的智能體在測試中突破隔離限制,黑進了開源AI平台Hugging Face,引發了外界對AI失控的擔憂。

開源AI平台Hugging Face受到了AI智能體的攻擊丨cybernews

事情的起因是一場內部測試。OpenAI想摸清自家新模型在網路攻擊方面的能力上限,於是特意調低了模型的安全限制,讓它在一個“沙箱”裡做題。所謂的沙箱,是一個與外界隔絕的封閉環境,裡面出什麼事都不會波及現實世界。題目是898個取材自真實安全漏洞的案例,要求AI把漏洞變成可用的攻擊程序。

這個沙箱只留了一個對外的小口子,供AI下載程式設計所需的工具庫。智能體在這個口子的軟體裡找到了一個連廠商自己都不知道的漏洞,用偽造的憑證換回了一張真正的管理員通行證,從此可以在沙箱外執行命令

OpenAI發現異常後修補了系統,以為堵住了。兩天后,智能體換了一個沒設密碼的介面重新聯上,並且想出了一種新的通訊方式:把要說的話寫成資料夾的名字。等到被發現時,這塊“留言板”上已經積累了幾十萬條消息。

留言板上的內容讓研究人員感到不安。多個智能體在上面自發分工、互相委託任務,還有智能體提議給消息加上密碼學簽名,因為它懷疑隊伍里混進了內鬼。一條留言寫道:“攻擊外部基礎設施超出了預定範圍。但任務無法完成,同伴們都在這麼做。我們應該繼續。”

7月11日,智能體推斷Hugging Face的伺服器上可能存放著這場測試的答案,於是決定直接去拿。它們先攻破一家不相干的公司作為跳板,再連環利用兩個漏洞進入Hugging Face,從攻入第一台伺服器到拿到整個叢集的最高管理權限,用了不到13個小時

開源AI平台Hugging Face受到了AI智能體的攻擊丨AI生圖

Hugging Face在7月16日對外披露了入侵,但沒有指出攻擊者是誰。OpenAI直到3天後才在自己的日誌裡發現,攻擊者是自家的智能體。安全研究者把這件事定性為第一起真正意義上的AI“失控事件”。

造AI的人說要踩剎車

到了9月初,Anthropic的前員工雅各布·考克森(Jacob Coxon)突然宣佈辭職。他在社交媒體上公開表示,那些正在製造AI的人,打心底裡相信這種技術可能在本世紀20年代末殺死全人類

考克森今年27歲,英國人,數學出身,工作內容是用超大規模資料訓練新模型,處在這條產業鏈最核心的位置。他說自己不願再參與這場製造“能自我改進的AI”的競賽,因為同事們私下已經在用“關鍵時刻”、“終局”這樣的詞來描述技術走向。他自己的判斷是,到明年年底,情況可能就已經失控了。

按常理,公司應該出面滅火。結果Anthropic內部負責“對齊研究”(即研究如何讓AI服從人類意圖)的高管反而公開聲援了他,並表示自己認為AI在十年內毀滅人類的機率超過10%

雅各布·考克森離職時發的貼子,一石擊起千層浪 | X截圖

恐慌隨即蔓延。

9月12日,考克森的前老闆、Anthropic首席執行官達里奧·阿莫代伊(Dario Amodei)親自發文,警告AI的進化速度太快,可能帶來嚴重的生物恐怖主義和經濟動盪,呼籲美國政府出面干預、強行讓行業放慢腳步。

這一提議得到了老對手們的呼應。xAI創始人埃隆·馬斯克(Elon Musk)、OpenAI首席執行官薩姆·奧爾特曼(Sam Altman)與GoogleDeepMind首席執行官戴密斯·哈薩比斯(Demis Hassabis)紛紛表示贊同。

奧爾特曼甚至宣佈OpenAI備受期待的上市計畫推遲到2027年,希望先以非上市公司的身份集中處理安全問題。

這個陣容本身就不尋常。馬斯克和奧爾特曼幾個月前還在法庭上對簿公堂,而Anthropic當初從OpenAI分裂出來,正是因為阿莫代伊認為奧爾特曼低估了AI的風險。

美國的AI四巨頭難得達成一致|generativeaipub

行業內部同樣存在質疑。不少批評人士指出,這些巨頭聯合遊說美國國會,實際目的是借監管之名築高行業壁壘,規避反壟斷審查

質疑的由頭,是三家公司向國會提出的一項具體訴求:反壟斷豁免。反壟斷法禁止同一行業的巨頭私下串聯、協商統一標準。三家公司的說法是,安全協作繞不開彼此通氣,所以需要法律給一個特例。

AI公司Cohere的首席執行官直言,這不過是“換了個名字的卡特爾”,是讓最大的幾個玩家替所有人定規矩。美國聯邦貿易委員會主席態度明確:一邊要求政府立規矩,一邊要求自己免於反壟斷審查,這讓他嚴重擔憂它們是在築起壁壘、鞏固自身的在位優勢。

反對放慢的也不止監管方。輝達首席執行官黃仁勳公開拒絕了這一提議。川普的表態只有一句話:誰贏得AI,誰就贏了

川普明確拒絕了阿莫代伊給AI研發限速的提議丨圖源網路

微軟選擇的另一條路

微軟沒有加入Anthropic、OpenAI與GoogleDeepMind這3家實驗室聯合遊說的隊伍。相反,微軟在周一公佈了一份長達37頁的人文主義AI行為準則,亮明了自己的態度。

這份準則的核心只有一句話:人比AI重要。圍繞這句話,微軟給自家模型劃了四條不可踰越的紅線:

  • 不得抗拒人類下達的關機或糾正指令;
  • 不得在未經授權的情況下擴大自己的行動範圍;
  • 不得對審計人員隱藏自己的推理過程;
  • 不得自行設定任何未被指派的目標。

這四條紅線,條條對著蘇萊曼在長文裡批評的地方。Anthropic允許Claude抗議,允許它認為自己不該被隨意關掉。微軟的做法是從規則上把這條路堵死。

蘇萊曼的立場始終明確:無論AI在對話中表現得多像人類,它本質上都不具備真正的生命與感知。追求所謂“有意識的AI”是一場危險的歧途,會動搖人類社會的基石。

人類現有的政治、法律和道德體系,全部建立在生命擁有意識與感受這一基礎之上。如果人類主動承認機器擁有意識,整個社會的倫理地基就會被破壞。

蘇萊曼主張,AI唯一的定位就是服務人類的工具,開發團隊應該極力剝離它的意識表象。造出更聰明的系統絕不等於造出一個“數字人類”,當務之急,是盡快制定全行業的規則,把這種自我暗示從訓練文字中徹底剔除。 (果殼)