他是ChatGPT的共同創造者。兩年後他造了一個一個字都不會寫的模型。
九月十五號,一家叫 TypeSafe AI 的公司從隱身狀態出來,他們發佈的那個模型,一個字都不會寫。
模型叫 Jev。你給它一段上下文,它不跟你聊天,不寫程式碼,不解釋理由。它從你事先定好的選項裡挑一個,再告訴你它有多確定。
你問它這筆交易該不該放行,它返回:拒絕,0.87。
沒了。
造它的人叫 Diogo Almeida。前 OpenAI 研究員,ChatGPT 背後那套方法的共同創造者之一。他在 LinkedIn 上的自我介紹寫著:co-created ChatGPT。
01
你現在用的所有大模型,不管多聰明,底層都在干同一件事:猜下一個字。
所以當你讓它做判斷的時候,事情就變得有點奇怪。
你問“這個客戶風險高不高”,它必須先把答案寫成一段話,你再從那段話裡把答案摳出來。
這像你問醫生要不要開刀,他不能說要或者不要,得先給你寫一篇八百字散文,你自己從散文裡讀他的意思。
過去三年,整個行業就是這麼幹的。我們還為此發明了一個職業叫提示詞工程師,工作內容說穿了就是想辦法讓那篇散文寫得規整點,好摳。
TypeSafe 的說法很直白,表達和判斷是兩回事,我們卻一直拿表達能力換判斷能力,還付了天價。
Jev 比前沿大模型快 40 到 200 倍,便宜 40 到 400 倍。峰值測試做到過 193.6 倍快、444.6 倍便宜。單次決策延遲壓在 500 毫秒以內,一百萬輸入 token 成本 0.042 美元。
這個量級放進一個每天要做幾百萬次判斷的系統裡,省錢是次要的。主要是讓一整類業務從“這帳算不過來”變成“算得過來”。
02
TypeSafe 管 Jev 叫 System One Model。
這詞從卡尼曼那兒借的。《思考,快與慢》把人的思維拆成兩套。
System 1 快、自動、憑直覺。你看一張臉就知道對方在生氣,不用推理。
System 2 慢、費勁、講邏輯。你算 17×24,得一步一步來。
人絕大多數決定是 System 1 做的,System 2 隻負責事後編個像樣的理由。
現在的大模型全是 System 2。什麼事都要先想一遍、推一遍、寫出來。你只是問它一句話是褒是貶,它也要在心裡打一遍草稿。
Jev 做的是 System 1。看一眼,給結論,附帶置信度,不解釋。
訓練方法也換了。ChatGPT 那套叫 RLHF,基於人類反饋的強化學習,最佳化的是“人類覺得這個回答好不好”。Jev 這套叫 RLCD,面向校準決策的強化學習,最佳化的是另一件事:
你說 80% 的時候,是不是真有 80% 會發生。
做投資的人一秒就懂這個區別。
一個分析師天天說“我強烈看好”,聽著特別有底氣,你拿它沒用。另一個說“我看漲,65%”,而且他歷史上報 65% 的那批判斷,真的兌現了大約 65%。
後面這個人的話,你可以直接拿去下注。
前一個卷的是表達力。過去三年 AI 圈拚命卷的也是這個。
03
Jev 出來之後質疑很多
第一條,所謂“不會幻覺”,是因為它輸出的根本就不是自然語言。你把選項限死在 255 個裡面選一個,它編不出來是結構決定的,跟它更誠實沒關係。這個比較不公平。
第二條,格式合法的答案照樣可以是錯答案。它老老實實從你給的選項裡挑了一個,格式完美,結論可以完全錯。
第三條,它只給你數字,不給你理由。你不知道它憑什麼打 0.87 而不是 0.62。
第四條,有評測指出在綜合工作流的基準上,Jev 落後於目前最好的對手。公開證據還撐不起最強的那套敘事。
我的判斷是,Jev 沒打算取代大模型,它把一件被放錯位置的事挪回了正確的地方。
寫文章、解釋、推理、對話,那是大模型的活。
判斷、分類、打分、給置信度,這活兒本來就不該交給大模型。
04
我看到 Jev 的第一反應不是“來新東西了”。
是“終於有人在模型層把這事做出來了”。
AlphaGBM 內部這套分工已經跑了很久,只不過我們是在系統層硬拚出來的。
做投研 AI 有個特別容易踩的坑。你讓大模型給一個判斷,它總能還你一段漂亮話。邏輯順,論據齊,讀著讓人想點頭。
然後你把錢投進去,才發現那段漂亮話跟它背後究竟有幾分把握,沒有關係。
所以我們從一開始就立了條規矩:機率由純程式碼生成,大模型一個字都不許改。
具體拆成五件事。
第一件,把算機率和講人話物理隔離。方向機率、波動率區間這類東西,全部交給確定性程式碼算,GARCH 加蒙特卡洛,輸入一樣輸出必然一樣。大模型只在最後一步把數字翻譯成人話,它沒有權限碰那個數字。
跟 Jev 是一個思路。決策歸決策,表達歸表達。
第二件,評分不看勝率,看校準度。
這條反直覺。我們不用“猜對了多少次”打分,因為命中率能作弊:你只賭高確定性的事,勝率刷得極漂亮,一分錢賺不到。
我們用 Brier 分數、區間損失、分位數損失這一套。它們衡量的是同一件事,你說 80% 的時候是不是真的 80%。
跟 RLCD 最佳化的目標,是同一個東西。
第三件,允許它說我不知道。
資料缺了、訊號沒有邊際、還在冷卻期,系統就記一條棄權,不硬湊數字。棄權必須留痕。
一個從不棄權的系統不是厲害,是在撒謊。
第四件,帳本只能追加不能改。所有預測寫進去之後,資料庫層面物理禁止修改和刪除。一個能改歷史的記分牌等於沒有記分牌。
第五件,資料來源降級必須報警。即時行情拉不到就自動退回備用源,這種事絕對不能悄悄發生。每次降級都落盤,都報警。
悄悄降級是自動化系統裡最陰險的一種失敗。它不報錯。它只是慢慢開始騙你。
05
TypeSafe 干的是模型層的硬活,兩年隱身,四千萬美元,重新設計訓練方法。這不是誰都能幹的。
兩條毫不相干的路走到了同一個結論。
他們從“AI 該怎麼被機器呼叫”出發。我們從“真金白銀的判斷不能靠一段漂亮話”出發。
把判斷和表達拆開。判斷要可校驗,表達只負責好懂。
這個結論指向一個正在發生的轉折。
過去三年 AI 競賽的核心指標是像不像人。說話像不像,寫文章像不像,聊天順不順。
可你真要把 AI 放進關鍵流程,放進風控,放進投研,放進任何一個錯了要付真代價的地方,像人根本不是你需要的。
你需要的是它說八成的時候,真的是八成。
一個是表演。一個是工程。
06
AlphaGBM 內嵌的這套東西,機率純程式碼生成、大模型不許碰數字、校準度評分而非勝率、棄權留痕、帳本只追加、降級必報警,我打算開源。
理由很簡單。
這套東西最值錢的部分,恰好是它最不好看的那部分。它會告訴你那次棄權了,那次資料來源降級了,把所有歷史預測釘死在帳本上沒法美化。
一套演算法你可以藏著。
一套紀律藏著就沒意義了。紀律的價值在於能被人檢驗,沒人能檢驗的紀律和沒有紀律是一回事。
再說做投研 AI 的人大多踩過同一批坑。模型說得頭頭是道結果沒有校準,記分牌能改所以永遠好看,資料來源悄悄退化三個月才發現。
這些坑我們一個一個踩過來,程式碼裡每一條約束背後都躺著一次真實的失敗。
與其讓下一個人再踩一遍,不如掛出來。 (曾敏敏)
