不會說話的AI,估值14億

RexAA
•
AI速讀
TypeSafe AI 推出專為開發者設計的「啞巴」決策模型 Jev,由 OpenAI 前研究員 Diogo Almeida 領軍。Jev 捨棄對話功能,專注於高速、低成本的類型化決策,延遲僅 70-500 毫秒,價格極低。該產品挑戰了現有 RLHF 導向的「討好人類」模型邏輯,推動「智能大拆分」趨勢,主張將高頻決策與複雜推理分流以降低運算成本。儘管面臨基於 Qwen 等開源模型的快速復刻挑戰,但 Jev 為 AI 在工業自動化與後台無人值守場景的應用提供了新路徑。

導讀

THECAPITAL

爆火的JEV

九月的AI圈本來就不缺熱鬧,幾家大廠的新模型輪番登場,按往年慣例,話題中心應該在它們身上。可過去一週,開發者在X、GitHub和各種技術群裡刷屏討論的,卻是一個連完整句子都不肯說的模型。

它叫Jev,9月15日才發佈,上線沒幾天,官方介面就被蜂擁而至的開發者擠到無法呼叫。到了9月21日,公司索性撤掉候補名單向所有人開放,每個註冊使用者送5美元額度,折合約1.2億Token。一個新模型用這種方式“洩洪”,今年並不多見。

做出Jev的公司叫TypeSafe AI,總部在舊金山。公司隱身兩年,露面時帶著兩樣東西,一個是模型,另一個是DCVC領投的4000萬美元種子輪,約合人民幣2.8億元。Forbes援引一位知情人士的說法,這一輪估值為2億美元,也就是14億元上下。

更讓人好奇的是創始人Diogo Almeida。他在OpenAI待了四年,參與過RLHF、InstructGPT、ChatGPT和GPT-4的研發。RLHF即基於人類反饋的強化學習,ChatGPT能聽懂指令、說話得體,這項技術功不可沒。換句話說,他是當年教會大模型“說人話”的那批人之一。離開OpenAI之後,他做出來的東西恰好反了過來。

一個“啞巴”模型,被玩瘋了

用過大模型做分類的人,多半有過這種煩惱。只想讓它判斷一封郵件急不急,回個“是”或“否”就夠了,它偏要先鋪一段分析,又慢又費Token。Jev的辦法簡單粗暴,乾脆不讓模型開口。它讀進去的是雜亂的狀態資訊,吐出來的是開發者預先定義好類型的決策,每個答案都附帶一個經過校準的機率。TypeSafe給它起了個名目,叫System One決策模型,典故來自《思考,快與慢》裡的“快思考”。人掃一眼就能拍板的事,交給它。

Almeida在一檔播客裡解釋過這套設計。Jev只有三種輸出:Choice在給定選項裡挑一個,Score用來排序或和閾值比大小,Noul回答是非題,但返回的是機率,由程序決定要不要走進某個分支。說白了,它是寫給程式碼看的。

速度和價格是它出圈的直接原因。官方給出的端到端延遲為70~500毫秒之間,相比於前沿的大模型要快40至200倍之多,每百萬個token收費為0.042美元,而輸出是免費的。

TypeSafe也曾公佈過更加誇張的資料,在自家的工作流程測試中,一些任務最快可以提高193.6倍的速度,最慢也可以降低444.6倍的價格,但是這些資料都是公司在自己做的測試裡得到的,並沒有經過獨立實驗室的驗證。

公司也會提示實際的表現會根據任務以及比較的方式有所不同。第三方的資料要謹慎一些,在經過獨立測試之後發現,它在分類一致率上和DeepSeek V4.1 Flash差不多,中位延遲為0.32秒。即使打折,這個價格也足以讓人心動了,有的文章甚至把它的價格比作AI界裡的“蜜雪冰城”。

真正把熱度提上去的是開發者各種各樣的玩法。官方先打出一個樣來,讓Jev玩初代《毀滅戰士》遊戲,在每一秒鐘裡都會做出大約十次的選擇來控制角色行走、躲避敵人以及射擊等動作,並且連續跑了一個小時大概花費了七美元。

Browser Use團隊把該內容接入到了瀏覽器自動化中,在打開網頁、刷出蘇黎世飛往倫敦的航班的過程中,整個過程只需要7.1秒,並且花費了0.0039美元。即時通訊公司Ably做了一個更加直觀的比較,在幾分鐘之內,Jev做出了47次決策,Gemini和Claude、GPT等也只做了一兩次。中文開發者的腳步也沒有停歇,在使用大模型出牌的時候明顯出現了卡頓的情況,而換上Jev之後單次決策只需要0.7秒的時間,出牌動畫還沒有播放完畢,下一回合就已經被打發出去了。上述情況都需要快速、密集地做出決策,但是每一個決策本身都不算難。

遊戲本身是熱鬧的,而商業上所做的動作則更能說明問題。Vercel第一時間內把AI閘道器接入到了Jev中,開發者用它來做大模型的裁判,在幾十毫秒之內就完成了對大模型行為是否合法、是否有事實依據進行稽核,並且給出了事實一致性的評分結果。當把東西便宜到可以忽略不計的時候,以前那些計算不出來的事情,忽然之間就計算出來了。

ChatGPT的功臣,反手潑了盆冷水

Almeida的履歷在圈內很有份量。OpenAI在GPT-4的貢獻者名單裡,把他列在“基礎RLHF與InstructGPT工作”一欄。他在OpenAI花了四年打磨ChatGPT的回答,2024年離開,著手訓練一種新的基礎模型。另外兩位聯合創始人裡,COO Sasha Sheng此前是Meta和FAIR的研究工程師,Erik Gafni出任CTO。三個人悶頭幹了兩年,外界幾乎沒聽過這家公司的名字。

按常理,這樣的人出來創業,多半會做一個更會聊天的模型。Almeida偏偏反著來,他批評的正是自己親手參與打造的那套方法。

他的邏輯並不繞。RLHF的做法是收集人的偏好再照著最佳化,等於把人直接放進了訓練回路,目標是讓人滿意,而不是讓軟體自主運轉。他對Forbes說得更直白,行業一直在為人做最佳化,模型討好人的本事已經超過了人。他在演講裡講過一個段子,有人給ChatGPT發了一段放屁音效,請它誠實評價自己“創作”的這首音樂,ChatGPT回答說,這營造出一種很詭異的氛圍。人在旁邊盯著的時候,這種圓滑無傷大雅。可如果要讓軟體在後台無人值守地跑,一個明明錯了卻總想顯得自己沒錯的模型,就成了大麻煩。

所以他敢放話,下一個時代不會是Claude Code的時代,他說自己也愛用Claude Code,但它仍屬於“輔助時代”,底子裡靠的還是RLHF。這話從ChatGPT的締造者之一嘴裡說出來,多少帶點反諷。

投資人買的,很大程度上就是這個判斷和說出這個判斷的人。美國投資人Trace Cohen的點評很有代表性,在他看來,給一家尚未交付產品的公司開出4000萬美元種子輪,押的就是背景,賭的是團隊而不是產品。從OpenAI出走的研究員一向是矽谷最搶手的創業者,這類估值邏輯早已見怪不怪。有意思的是,TypeSafe自己在上線前對產品也沒什麼底。

Almeida後來在播客裡回憶,上線前反饋相當糟糕,非技術同事擔心他們賣的是“維生素”而不是“止痛藥”,公司幾乎沒有收入,一半以上的測試者沒看懂,看懂的人第一反應是問採購審批怎麼過。他自己也很害怕,於是拚命推動盡快上線。

上線後的局面,他恐怕也沒料到。提高呼叫上限的申請從各處湧來,按他在播客中的說法,日呼叫量已超過一兆Token,深夜也在持續呼叫,說明是程序在背景執行,而不是人來嘗個鮮就走。這個數字目前只有創始人一方的說法,但深夜呼叫這個細節,確實比註冊人數更能說明產品是否被真正用了起來。

名字也有講究。Jev取自經濟學家William Stanley Jevons,即提出傑文斯悖論的那位學者。19世紀蒸汽機越來越省煤,英國的煤炭消耗反倒越燒越多。這個名字的用意不難猜。

“智能大拆分”,動了誰的奶酪

Foundation Capital合夥人Jaya Gupta寫過一篇長文,給Jev的走紅找了個更大的背景,她稱之為“智能大拆分”。她的觀察是,過去三年大模型的奇蹟在於“打包”,資訊抽取、搜尋、排序、判斷、選工具、寫回覆乃至高難度推理,都交給同一個足夠聰明的模型。開發者省了事,代價卻被藏了起來。Agent會把人的一個目標拆成成百上千次機器決策,每一步在成本和延遲上的細微差異層層累積,最終決定整個產品的經濟模型。她把其中的浪費叫作“解碼稅”:軟體明明只需要一個“放行”或“攔截”,大模型卻要先生成一段文字,程序再把文字翻譯回決策。

這筆賬最終要算到大模型公司頭上。Gupta在文中提到,據報導Anthropic的毛利率超過80%,一個簡單的分類任務,只因發生在Claude的呼叫裡,就得按前沿模型的價碼付費。

她的推演是,便宜、可預測的高頻操作會被逐步分流,留給前沿模型的是更模糊、週期更長、更難驗證的問題,每次呼叫也許更值錢,但被呼叫的次數會變少。應用層的活兒也跟著變了,要把任務拆開,給每一步買夠用且最便宜的智能。過去一套系統也許只抽查1%的行為,判斷足夠便宜之後,就有機會全部檢查一遍,客服對話、交易記錄、合同條款都能逐條過。Almeida看中的場景也在這條線上,比如大公司囤積多年、卻因為呼叫大模型太貴而從沒分析過的“暗資料”。他舉過保險核保的例子,模型讀完材料,直接給出某處房產發生過火災的可能性有多大。

故事講得漂亮,護城河的問題卻幾乎同步擺上了桌面。Jev發佈後短短兩天,GitHub上就冒出了至少六個復刻項目,有人拿Qwen的小模型在筆記本上訓練不到兩小時,就做出了介面相同的決策模型。

這些復刻不少是衝著“平替”去的。漲得最快的Laya,5天就拿下1.8萬個Star。Jared Palmer做的Kev基於Qwen3.5,與TypeSafe官方SDK完全相容,業務程式碼不用改,換個請求地址就能切到本地;Bespoke Labs的Nimble基於Qwen3.5-9B,測試精準率90.1%,接近Jev官方公佈的93.2%。熱鬧之下,阿里通義千問在這輪復刻潮裡意外當了一回“底座”。復刻品也有短板,有評測認為,面對任意提問和幾十個長選項的場景,眼下還得用Jev。

Jev自身的侷限同樣明顯。它是閉源API,模型拿不到手,資料也要傳到TypeSafe的伺服器上,這對不少企業客戶是道門檻。官方所說的“不會幻覺”也要打個折扣,它保證的只是答案不會跑出開發者定義的格式,而不是答案一定正確。

Almeida倒不迴避這些。他承認校準並不完美,模型會犯很多錯,但只要收益足夠高、閾值設得合適,照樣可以投入使用。有主持人試用後發現,單步判斷很強,步驟一多效果就逐漸下滑,他的回應是,哪些任務適合交給System 1,最終要看實際效果。外部壓力也擺在那裡,大廠還在持續壓低推理成本、提升速度,TypeSafe宣稱的優勢能守多久,要經過市場檢驗。

過去幾年,大家比的是誰的模型更會想。Jev這一週的熱鬧,讓行業第一次認真坐下來算另一筆賬:想一次,到底要花多少錢。 (融中財經)