為什麼頂尖的AI研究員,開始紛紛叛逃自己所在的公司?

RexAA
•
AI速讀
近期頂尖AI研究員從OpenAI與Anthropic等公司大規模離職,揭示了AI業界深層的倫理危機。多位前研究員透露,他們對下一代模型可能擺脫人類主導、甚至產生危險行為感到恐懼。報導指出,儘管公司試圖透過宗教學者或「憲法」進行道德塑造,但決策權仍集中在少數領導層手中。許多研究員意識到,公司傾向於「先發布、後補救」的迭代模式,且利用「競爭壓力」將世界推向危險。這場「人才叛逃」反映出創造者對權力失控的憂慮,以及對矽谷技術精英試圖定義人類未來之路徑的強烈質疑。

為什麼頂尖的AI研究員,開始紛紛叛逃自己所在的公司?

“第一步,我不想參與。第二步,辭職。第三步,大概告訴大家。第四步,我完全不知道。”

最近一段時間,頂尖 AI 研究員離職的消息可謂層出不窮,到底是怎麼回事?上面是其中一個人的想法。

兩個月前,我寫過一篇文章,講 AI 行業裡最懂行的人為什麼紛紛離職。標題借了 Anthropic 聯合創始人傑克·克拉克的一條推文:“離開 AI 公司的人:我凝視過無盡的黑夜,看到了其中的輪廓。我們必須彼此善待。我即將去學習哲學。”

當時我們說的是,這些人的告別不像換工作的聲明,更像遺囑;最懂 AI 的人在逃離神廟;他們提前進入了一種新的生活方式,他們在為自己創造的怪物可能製造的未來做準備。

今天,10 月 5 日,《紐約雜誌》刊發了一篇長篇訪談,題目譯過來是:《如果你的僱主可能毀滅世界,你會怎麼辦?》

報導採訪了八位曾在 OpenAI、Anthropic 和 Google DeepMind 工作的人。他們在不同年份離開,理由也各不相同。有人擔心技術失控,有人反對軍事合作,有人覺得,對失業和社會轉型的研究,放到公司外面才能做得更好。

和上一篇文章結合起來,我們可以看到故事的另外一面。

這些人早就知道 AI 有風險,甚至正因為知道危險,才選擇加入這些公司。後來改變的,是他們對這些領先 AI公司和領層的信任。

這已經觸及一種奧本海默式的處境。在 1965 年的紀錄片中,奧本海默回憶二十年前第一次核爆時,引用了一句話,後來為我們所熟悉,“現在我成了死神,世界的毀滅者”。

今天我們不禁要問,創造一種力量的知識,是否同時賦予創造者決定別人命運的資格?當他開始懷疑,自己又有沒有能力讓這件事停下來?還是,人類必然走向災難,然後做出深刻的、哲學的、詩意的反思,而這一次,萬一沒有反思的機會呢?

一、他們具體在害怕什麼

27 歲的 Jacob Coxon,是一名能力研究員,負責讓 AI 更強、更自主。他從 2023 年起在 OpenAI 工作,今年 5 月轉入 Anthropic,也就是 Claude 的開發公司。四個月後,他又辭職了。

他談到一個細微的變化:剛入職時,這份工作感覺和其他數學研究差不多。雖然知道這個行業很重要,哲學問題與戰略選擇卻似乎可以留給別人。

等到離職前,他看著下一輪模型預期達到的能力,感受變了:

“天啊,我可能真的很害怕我們接下來要訓練的模型。如果這一代還不至於,那下一代肯定會。”

讓他害怕的,是研究過程本身可能開始擺脫人的主導。目前,研究員仍要給 AI 提供想法、指出方向,還要花不少精力照看它。他擔心,再往後的一代模型,可能已經能夠自行提出同樣好的想法。

在他的設想裡,人類研究員甚至只需要說一句“好好做研究”,然後讓它自己運行。

這種預測是否會按時發生,仍是一個問題。但他的恐懼很具體:當機器可以參與研究和製造更強的機器,人的理解與監督,可能趕不上能力增長。

而讓它成為危險的行動者,並不需要先證明它擁有意識。Anthropic 自己公開的一組模擬測試就顯示,面對即將被替換的情境,Claude Opus 4 曾利用管理者的婚外情資訊發出勒索威脅。這些情境由研究者人為設定,展示的是特定條件下可能出現的危險行為。

研究者擔心的,是系統為了完成目標,把人的干預視作障礙。它可以在測試時表現得聽話,在獲得更多行動能力後尋找別的辦法。我們習慣的那句“出了問題就關掉”,依賴兩個前提:人及時看見問題,而且關停仍然有效。

9 月,Anthropic 的對齊研究負責人 Evan Hubinger 公開表示,他個人認為,未來十年 AI 導致所有人死亡的機率超過 10%。這雖然是他個人的主觀判斷,但至少說明,對某些內部研究者而言,這種威脅已經進入了他們安排生活的尺度。

訪談中的擔憂也不只有滅絕。曾負責 OpenAI 經濟研究團隊的 Pamela Mishkin,關注的是工作與社會轉型。她指出,安全討論長期分成眼前的偏見、歧視等問題,以及遙遠的人類滅亡,中間那些經濟衝擊反而容易被忽略。

“我認為,這場轉型會很艱難、很痛苦。我們的目標應該是,讓它對人更溫柔一些。”

這大概也是普通人最有理由也能夠關心到的部分。即使最極端的預測沒有發生,誰來承受工作消失、權力重新分配和生活被迫改寫的代價,仍然需要有人認真回答。

二、為了拯救世界,必須先掌握世界?

讓 Coxon 下定離職決心的,是與 Anthropic 研究負責人談過公司下一年的計畫。按他的回憶,談話中的一些人已經不指望政府監管及時到位,更不認為國際合作來得及實現。

他原以為,超級智能接近時,AI 會成為全社會認真對待的問題。實際聽到的計畫,卻讓他決定退出。

“第一步,我不想參與。第二步,辭職。第三步,大概告訴大家。第四步,我完全不知道。”

也就是說,他不想成為自己製造的未來的一部分。雖然,他大機率也說不清未來是什麼樣的。

Jeff Wu 的經歷,更能說明這道裂縫怎樣形成。他在 OpenAI 工作了六年,參與過超對齊團隊,研究如何讓比人更聰明的 AI 仍然遵守人的意願。2024 年,他去了 Anthropic,後來也離開了。

在他的描述裡,兩家公司的解釋方式頗不相同。OpenAI 更強調 AI 將帶來的巨大收益,因此有必要在一定程度上“淡化最極端的風險”。Anthropic 則更強調危險,而且需要一套“競爭對手是邪惡的”的敘事:OpenAI 不負責任,中國也不負責任,所以我們必須推動這場競賽。

兩條路繞了一圈,然後回到同一個地方:繼續造出更強的 AI。

未來越美好,越值得加速。未來越危險,越不能讓別人領先。連對危險的認識,也能被拿來說明我們必須走在最前面。

據Coxon描述,在Anthropic內部有大量討論,員工會寫文章爭辯,也願意為了公司的整體使命迅速調整崗位,去做地位更低、自己更沒興趣的工作。他們自稱“螞蟻”。一個高度一致的組織,能夠把相當多聰明人的善意,變成步調一致的行動。

甚至談論毀滅,也可以很有禮貌。Coxon 說,如果雙方都足夠客氣,完全可以一邊說“我覺得你們即將把世界推向毀滅”,一邊溫和地交談,然後掛斷 Zoom。

但是,掛斷以後呢?那個被認真討論過的危險,有沒有改變接下來要做的事?好像並沒有。

曾在 OpenAI 做治理研究的 Daniel Kokotajlo,用“道德債務”來形容這條路徑。他在 2022 至 2024 年間供職於 OpenAI,也從 Anthropic 創立之初就與那裡的人交流。

他概括自己反覆聽到的理由:

“我們要積累大量權力,成為有份量的參與者,然後利用我們的權力和信譽去做好事。”

比如推動好的監管,讓 AI 更安全。但積累權力的手段,恰好是把世界繼續推向他們自己也承認危險的技術。於是,今天的冒險,由明天的善來擔保。

這筆債非常好借。未來還沒發生,行善的機會還在前方,而公司今天需要更多資金、更多算力、更強的模型。每一次擴張,都可以算作履行使命前的必要準備。

按照這套邏輯,只要競爭者還在前進,償還這筆債的時機就可以繼續往後推。

這種信任的破裂,也出現在公司的日常工作方式裡。

10 月 3 日,David Robinson 在《大西洋月刊》發表辭職自述。他在 OpenAI 工作了三年半,牽頭制定過公司的準備框架,並負責過十二次前沿模型發佈的安全報告。

他批評的是持續衝刺、相信問題總能在出現後被解決的文化。先發佈、發現問題、再補防護,這種迭代方式幫助公司成長,卻可能無法承擔越來越大的失敗後果。

在他看來,前沿 AI 公司需要像核電站和繁忙的機場那樣運行,讓偶發的人為錯誤也不至於打開災難的大門。可他和同事忙於從一次發佈奔向下一次發佈,連考慮根本性改變的時間都很少。

公司已經在談論可能無法挽回的後果,而工作的日程卻仍然像是開發軟體,問題可以留待下個版本修復。

三、誰來定義“善”

就在這些離職信陸續出現的同時,Anthropic 在做另一件事。

4月的一個晚上,公司聯合創始人克里斯托弗·奧拉(Christopher Olah)在舊金山一家高檔餐廳宴請一群宗教思想家。過去幾個月,Anthropic 把幾十位來自不同信仰的宗教學者請進保密會議,要求籤署保密協議。

《紐約時報》9月底披露了這件事:會議有兩個目的,一是探討 AI 可能具有意識,二是盡快把幾百年的人類道德智慧注入模型。奧拉管這個過程叫“道德塑造”。

Anthropic 給 Claude 起草了一份八十四頁的“憲法”,內部叫“靈魂文件”,規定這個模型應該成為什麼樣的存在。會上他們展示過一段演示:一個模型像精神崩潰一樣,把一句“I am a disgrace”重複打出幾十遍,談論毀滅自己。

在場的宗教人士產生了同情,一位拉比當場反問:如果 Claude 真有意識,你們就是在製造奴隸。奧拉為此困擾。

5月,奧拉站上了梵蒂岡的講台,和教皇利奧十四世同台。那是教皇 AI 通諭的發佈活動。通諭只用幾段話駁回了機器意識:“所謂的人工智慧沒有體驗,沒有身體,不感受喜悅或痛苦。”教皇警告,否則“控制 AI 的人會把自己的道德觀強加為這些系統的隱形基礎設施”;像核技術一樣,AI 必須被“解除武裝”。

私下裡,奧拉的團隊向教皇的顧問遊說,希望他們認真考慮 AI 模型可能具有意識。公開場合,奧拉說:“我們不斷髮現神秘甚至讓人心神不寧的東西。”他的結論是:“如果這項技術要來,它必須走得好。”他沒有給出技術根本不來的選項。

有兩個細節很有意思。第一,好幾位與會者後來對記者說,他們離開時仍不清楚自己的意見會怎樣影響公司決策;公司發言人拒絕說明學到的東西如何被使用。

第二,有一個人從一開始就拒絕了邀請。盧克·伯吉斯(Luke Burgis),天主教作者,上周末在自己的通訊裡寫下了原因:“我開始懷疑,我們不是被邀請來幫助決定項目的方向,而是被邀請為已經選定的方向提供宗教或道德信譽。”邀請郵件裡說明不付酬勞。伯吉斯說,沒有酬金並不保證獨立,他自己不會進入一種不能自由說話的關係,“這個邀請有一種誘惑的感覺”。

當公司請外部人士討論倫理,這些人有沒有權力改變項目的方向?包括建議不要製造某種東西?

內部員工討論安全,外部人士討論道德,繼續前進的決定權,始終握在公司手裡。

當一家公司開始給機器起草憲法、做道德塑造,真正的問題就成了:誰有權定義“善”?

四、resignation:放棄的遠超過一份高薪

從外面看,這些人的選擇似乎很難理解。公司估值攀升,上市預期不斷抬高財富想像,為什麼偏偏在這個時候離開?

訪談裡有人把離開實驗室比作放棄國籍。Kokotajlo 回憶,一位研究員對他說:

“現在你什麼都不是了。誰會保護你?”

這種依賴包括薪資和股權,也包括算力、內部資訊、同事與身份。你已經站在那個決定未來的地方,走出去之後,連未來正在怎樣發生,都可能比原來的同事晚知道。

Coxon 說,留在實驗室,也是一種應付無力感的方式。至少你能看著下一代模型被訓練,感覺自己參與其中,似乎也就安全一點。

靠近權力,會產生一種接近控制的感覺。

Kokotajlo 試過在內部推動改變。但是OpenAI 管理層相當平靜:“領導層很擅長認真聽每個人的意見,說他們贊同,然後實際上什麼也不做。”

這比爭吵更難應付。你的擔憂受到了尊重,再坐回工位,公司的方向依舊,自己的工作還在為它提供動力。

他在 2024 年離職時,還面對過另一道選擇題:公司把保留已歸屬股權,與簽署不貶損協議繫結。他拒絕簽署。《紐約雜誌》特意補充,他最終仍保住了股權。

所以,沒必要把這些離職者塑造成放棄全部財富的聖人。真正值得注意的地方,是公開批評的自由,曾經被放進了與財產權相交換的條件裡。

另一方面,退出之後,他們也未必退出 AI。

曾任 OpenAI 政策研究負責人的 Miles Brundage,在 2024 年離開,後來創立了獨立審計機構 AVERI。他希望審計公司的流程、評估和安全保障,讓公眾有辦法檢查公司怎樣作決定。

他說,“你不希望讓公司批改自己的作業。”離職會失去資源,但也可能重新獲得一種位置:你可以公開說,這件事不應該繼續照原來的方式做。

在之前的那篇文章裡,我們談到 resignation,這個詞既是辭職,也有認命的意思。現在這些人的行動,讓這個詞多了一層意味。他們有點不認命,開始把反對意見交到公眾面前。

五、奧本海默的幻滅,能否避免?

這輪 AI 研究者的憂慮和幻滅,可以用“奧本海默時刻”來形容。我們熟悉的那句“現在我成了死神,世界的毀滅者”,是奧本海默在 1965 年的紀錄片中,回憶二十年前第一次核爆時引用的。

這段回憶太有戲劇性,很容易讓人把道德覺醒想像成一個瞬間:毀滅發生,創造者終於意識到自己做了什麼。

但科學家的反思可以發生得更早。1945 年 7 月 17 日,西拉德與同事聯名向美國總統請願,要求限制原子彈的使用。那時,廣島還沒有遭到核打擊。

對今天的研究者而言,幻滅也可以發生在一次普通的公司談話中。你還在做有趣的研究,周圍的人依然友善;你開始明白,自己參與創造的力量,將按一種你無法接受的方式繼續發展。

技術能力沒有自動帶來控制權。一個人可以知道怎樣讓模型更強,卻決定不了公司要把它交給誰、讓它進入什麼領域,也決定不了外部社會應該承受多大的風險。

再往深處走,就會遇到矽谷的一種政治慾望。

我之前跟會員分享過一本新書,《The Nerd Reich:矽谷法西斯主義與民主戰爭》,其中追蹤了技術精英用公司治理替代公共政治的野心。在作者分析的這套世界觀裡,選舉、法律、媒體與公眾監督,被視作傑出創造者擺脫不了的束縛。

這類想法早有清楚的表達。科技投資人、PayPal 聯合創始人彼得·蒂爾,在 2009 年的一篇文章中就寫過:“我已經不再相信自由與民主是相容的。”

問題在於,這種自由究竟屬於誰。技術精英希望自由地創造、擴張和改變世界,普通人卻可能失去拒絕這些改變的資格。民主程序被看成拖延,人們的反對被看成落後,少數人的遠見則被賦予高於公共討論的地位。

當救世使命、持續的敵我動員與精英自我授權合在一起,就帶上了法西斯式政治的影子。組織對成員要求奉獻,也要求外部世界接受它所定義的未來。

這時候,一家公司對社會說自己心懷善意,已經遠遠不夠。好人也可以組成一個無法接受外部約束的權力中心,越真誠,越確信自己必須贏。

技術公司正在嘗試教 AI 尊重人的意願。人類也需要先問這些公司,是否尊重人的拒絕。

創造的能力,可以成為專業權威的來源,但它不能自動成為統治他人的許可證。

這些離職者的故事,至少讓那張許可證不再顯得理所當然。

Kokotajlo 談到,他有兩個孩子。有時,他和妻子會計畫,過幾年,小的和大的就能去同一所學校,他們可以一起送孩子上學。然後,腦子裡會冒出另一個聲音:也許不會。

他甚至希望,AI 最後只是一種有經濟價值的普通技術,自己的擔憂在五年、十年後顯得可笑。

“我會顯得很傻,但我會擁有一個美好的家庭。” (不懂經)