老黃剛砸60億,要造一個地表最強開源模型。
沒想到OpenAI的親兒子等不及了,已經拿K3把自己的模型給練出來了!
你敢信?
OpenAI親手投的公司,第一次自己訓模型,底座沒用GPT,用的是中國模型!
就在上周,矽谷明星中的明星,估值110億美元的法律AI公司Harvey,官宣了他們首個自有模型Harvey Tenet。
這事最大的看點是,Tenet的底座用的是中國開源模型Kimi K3!
這就有意思了。
要知道,OpenAI可是Harvey的重要投資人,但他們的第一個自研模型,底座卻來自中國。
Harvey是目前全球估值最高的法律AI公司。服務1300家機構、超過10萬名律師,覆蓋60個國家。Latham & Watkins、A&O Shearman、匯豐、普華永道、橋水、KKR都是它的客戶。
去年底,估值就已經幹到了80億美元。今年3月衝到110億,最新一輪的155億估值融資已經在談了。
最有故事感的是它的出身。
2022 年,27 歲的前訴訟律師 Winston Weinberg 和前 Google DeepMind 研究員 Gabe Pereyra 靠一封發給 Sam Altman 的郵件起家。
Altman回了郵件,他們坐上了與Altman及OpenAI高管團隊的電話會。從此,OpenAI 創業基金領投了 Harvey 的種子輪。
一個律師加一個研究員,一封郵件,四年幹到 110 億。
這本身就足夠傳奇了。
但現在這個劇本多了一個反轉——OpenAI 投錢養大的公司,第一個自研模型選了中國底座。
這事還得從帳單說起
Harvey 過去的打法很標準:拿 OpenAI、Anthropic、Google 的閉源模型做路由,客戶不同的需求分發給不同的模型。
每呼叫一次,就付一筆錢。
本來這也正常,做應用層嘛,底層能力花錢買就是了。
但問題是,賣你東西的人開始惦記你的生意了。
OpenAI 挖走了合同管理公司 Ironclad 的創始人 Jason Boehmig,讓他去領導 OpenAI 自己的法律業務。Anthropic 推出了面向律師的文件審查外掛。
今天賣你 API 的人,明天就坐在了你客戶的會議室裡。用 Harvey 聯合創始人 Pereyra 的話說,這不是「供應商」,這是「未來的競爭對手」。
Harvey 每月要處理 13 兆 token,每一個 token 都是從別人那裡買的。成本根本不受控。
這簡直太可怕了。模型廠說漲價就漲價,根本毫無還手之力。
於是 Harvey 做了一個決定:自己訓一個模型。
手裡有一個自己能改、能部署、成本可控的模型,再回去談 API 價格,底氣就完全不一樣。
150 塊卡,兩個月
Tenet的底座是Kimi K3。2.8兆參數MoE(混合專家架構),100萬token 上下文,原生多模態,目前全球最大的開放權重模型。
訓練過程值得說一下,它展示了一種全新的「造模型」方式。Harvey 聯合創始人 Pereyra還專門發了一篇長文介紹。
Tenet 的訓練只用了約 150 塊 NVIDIA B300,跑了兩個月。
從頭開始預訓練一個前沿模型動輒要幾萬張卡燒上好幾個月,花費數億美元以上。
150 塊卡兩個月,相當於是在別人蓋好的摩天大樓上做精裝修。直接入住了。
主要方法是非同步強化學習:Harvey 不是教模型更多法律知識,而是教它怎麼像一個資深律師一樣完成工作。
怎麼教?找真律師來當教練。
Harvey 請了一幫執業律師,讓他們編案子:虛構一樁併購糾紛、湊一堆合同檔案,然後讓模型上手干。
幹完了,律師一條一條地審:關鍵風險漏沒漏?判例引對沒有?結論邏輯站不站得住?列出幾十條硬槓槓,每條只有「過」和「沒過」,全過才算完成,差一條整個任務直接判零。
這是教模型合夥人等級的活。
在Harvey自建並已開放原始碼的法律基準LAB上,Tenet 相對 K3 底座全通過率提升 82%,任務完成數接近翻倍;Contracts 子榜達到 SOTA,總榜排第二。
合作方 Mercor 拿公司法任務測了一輪,Tenet 比基座 K3 高出 15 分,直接拿了第一。跑起來還便宜——推理成本不到主流前沿模型的四分之一。
一句話:用四分之一的錢,幹出了最強模型的活。
最懂行的買家
為什麼選了 K3?
法律服務是全球客單價最高、對錯誤最零容忍的行業之一。
Harvey可不是什麼網際網路小團隊圖便宜,它服務的是全世界最貴的律師。一份盡調備忘錄漏了一條風險,後果可能是幾千萬美元的訴訟。
這樣的玩家第一次造自己的模型,選了Kimi K3。
這絕不是拍腦袋定的。而且 Harvey 不是第一個。
幾個月前,AI 程式設計一哥 Cursor 發佈「自研」模型 Composer 2,三天後被開發者從 API 裡扒出模型 ID:kimi-k2p5-rl-0317,底座是 Kimi K2.5。聯創後來認了,說發佈時沒提基座「是一個失誤」。
AI 搜尋龍頭 Perplexity 更早。K2 一開源,CEO Aravind 就在 X 上說內部評測表現搶眼,隨即啟動後訓練。
這家公司在開源圈有個外號叫「驗貨官」。它用不用你,是模型能不能扛住真實產業環境的風向標。
連 OpenAI 前 CTO Mira Murati 創辦的 Thinking Machines,都把 Kimi K2 Thinking 接進了自家微調產品 Tinker 。
程式設計、搜尋、法律,一路排下來,Kimi 已經成了當之無愧的「基模之光」。
K3 是目前全球參數量最大的開放權重模型。在 Artificial Analysis 獨立評測的 Harvey LAB-AA 法律基準上,最嚴格的全通過率口徑,K3 拿了 26.7%,幾乎是 Fable 5(14.2%)的兩倍。
也就是說,在 Harvey 自己出題的那場法律考試裡,裸考成績最好的就是 K3。
但光成績好不夠,Harvey 需要的是一個能拆開改的底座。閉源模型再強,權重鎖在 API 後面,你只能調參數、寫提示詞,碰不到模型骨架。
K3 的權重是公開的,Harvey 可以拿 LoRA 深入到 50 萬個專家張量裡做手術。
100 萬 token 的上下文窗口,又天然適合法律場景。一個併購案的資料動輒幾千萬 token,窗口不夠長的模型連捲宗都塞不進去。
而且便宜。成本差了很多倍,但在法律任務上性能還更好。對一家月處理 13 兆 token 的公司來說,這筆帳根本都不用算。
當然,Harvey 的平台仍然接可以入 Claude Opus 5 和 GPT-5.6 Sol,Tenet 是多一個自有選項,不是替代。
但這個選項本身就是籌碼。手裡有一個自己能改、成本只有四分之一的模型,再去和 API 提供商談價格,底氣完全不同。
這也不是 Harvey 一家的判斷。
OpenAI 7 月 30 日就把 GPT-5.6 Luna 降價 80%,發佈才三周就打了八折。
CNBC 報導稱,中國模型在 OpenRouter 上的美國企業 token 用量一度佔到 46%。DoorDash、Airbnb 都在用中國模型控成本。
美國科技圈頂流 David Sacks 轉發了這條消息。他說得很直白:你禁開源模型,中國那邊該發 Kimi 還是照樣發,倒霉的只有 Harvey 這種美國創業公司。
每家公司都能有自己的模型
Harvey 演示的其實是一條可以被覆制的路徑:拿一個開放權重底座,加上行業專家資料,再加後訓練,任何垂直領域的公司都能煉出自己的前沿模型。
這才是真正值錢的部分。
底座模型越來越像工業原材料,真正的競爭壁壘在行業環境、專家反饋、後訓練方法和部署經濟性上。
Harvey 說下一步要把算力從 1000 卡擴到 10000 卡,做全參數微調,還要嘗試更多開放底座。目標是讓每家律所都能擁有自己的專有模型。
全球客單價最高、對錯誤最零容忍的行業,第一個拿到了造自己模型的入場券。醫療、金融、工程行業都在看著。
底座是一個中國模型。(新智元)
