Jev 這周徹底爆火。創始人 Diogo Almeida 是前 OpenAI 研究員,參與過 InstructGPT 和 RLHF,也就是 ChatGPT 早期對齊技術的核心成員。他這次做出來的 Jev,不寫長文、不聊天、不寫複雜程式碼,只做一件事,幫你做快速決策。玩遊戲時挑下一步往那走,跑流程時判斷那條規則適用。每百萬輸入 token 0.042 美元,輸出 token 免費,有人叫它 AI 界的蜜雪冰城。
發佈不到一周,社區已經跑出二十多種用法。看著很多,底層邏輯完全一致,把眼前的情況拆成有限幾個選項,交給 Jev 挑一個,程序拿了結果接著跑。
01. 爆火的Jev 到底是什麼
傳統的文字大模型是生成式的,拋出一個問題,它一個詞一個詞往外蹦。這種機制適合創作、推理、寫程式碼,但遇到選擇題就顯得太重、太貴、太慢。
Jev 走的是另一個路子,它是一個輕量的系統一分類與打分模型。每次呼叫,你給它一段上下文和一組明確的選項,它直接輸出每個選項的機率分佈,並選出置信度最高的一個。延遲在幾十毫秒到幾百毫秒之間,成本只有主流大模型的幾十分之一。
創始人 Diogo Almeida 的公告帖在 X 上拿下了 3620 萬瀏覽,大家看重的不只是便宜,而是它補齊了 Agent 工作流裡最缺的一塊低延遲決策控製麵。
02. 社區整理的 20+ 個玩法
我們把官方示例和社區開發者探索出來的玩法全盤梳理了一遍,按照從好玩的玩具到真正進生產的光譜,逐個列在下面。
1. 官方:Doom 即時遊戲操控
官方在發佈博文裡演示了讓 Jev 玩初代《毀滅戰士》(Doom)。Jev 每秒大約做 10 次動作決策,即時控制角色走位和開火。連續跑一小時花費大約 7 美元,比工程師預期的還要低,驗證了高頻即時決策的可行性。
2. 官方:Wikiracing 超長列表跳轉
從一個維基百科詞條,只靠點選頁面裡的超連結跳到目標詞條。每一步面臨幾百甚至幾千個候選連結,Jev 需要挑出離目標語義最近的那一個。這個測試用來驗證模型在高基數選項下不會產生幻覺。
3. 同時跑 50 局地鐵跑酷
開發者 @_MaxBlade 搭建了自動化環境,讓 Jev 同時控制 50 局《地鐵跑酷》。換道、跳躍、下滑都是單次小判斷,高並行下呼叫次數迅速疊加,但 50 局跑完總費用不到 1 美分。
4. 超級馬里奧開源控製器
開發者 @faadilhshaik 為經典《超級馬里奧》開發了 Jev 驅動的控製器。它直接讀取結構化的遊戲記憶體狀態,由 Jev 決定起跳和加速時機,項目已經在 GitHub 開源。
5. 殺戮尖塔 2 極速代打
中文開發者 paulwei 拿 Jev 跑策略卡牌遊戲《殺戮尖塔 2》。此前用大模型打牌,單步思考明顯示卡頓;換成 Jev 之後,單次出牌決策僅需 0.7 秒,人類還沒看清出牌動畫,下一步指令已經給出。
6. 3D 城市自動駕駛模擬
開發者 @jpschroeder 在 3D 城市模擬環境裡接入 Jev。車在虛擬街道中行駛,Jev 根據前方感測器和路況判定行駛方向,車輛移動後再把新狀態傳回,整個系統不到一小時就搭建完成。
7. MuJoCo 物理模擬火箭回收
開發者 @uttkarsh_42 在 MuJoCo 物理引擎中訓練火箭垂直起降。何時點火、開啟幾台發動機、何時切換著陸姿態完全交由 Jev 判斷。經過 12 次試驗後成功著陸,單次完整試驗消耗 245 次呼叫,成本僅約 0.04 美元。
8. 逐像素機率選色拼圖
開發者 @anshuc 把圖像生成拆解為逐像素的分類選擇。給每個像素位置分配顏色選項與機率,程序按照 Jev 給出的高機率顏色逐步塗抹,拼成完整的低保真圖像。
9. Browser Use 官方整合 jev-ultrafast
Browser Use 團隊在 Jev 發佈三天內推出了官方整合庫 jev-ultrafast,兩天狂攬 2700 顆 Star。它把網頁操作抽象為操作和目標兩組選擇題,全程無截圖、不消耗多模態 token,單次往返輸出兩個決策。
10. 真實航班查詢 7 秒實測
Browser Use 創始人 Gregor Zunic 放出一段無剪輯實測視訊。Jev 驅動瀏覽器在真實航司官網完成一次完整的單程航班查詢,耗時 7 秒,呼叫花費僅 0.0039 美元。
11. Vercel 命令安全審查分類器
Vercel 工程師 Pranit Sharma 將內部運行的 Shell 命令安全審查分類器從 OpenAI 大模型取代為 Jev。處理速度提升了 5 到 18 倍,由於誤判率下降,實際精準率反而更高。
12. BryoAI 商業郵件高頻分類
BryoAI CTO Nikhil Mudholkar 拿 Jev 與 Gemini 跑商業郵件意圖分類測試。Gemini 在絕對準確率上略有優勢,但單次呼叫成本貴了 10 到 20 倍;更重要的是,Jev 輸出的是經過校準的真實機率分佈,便於下游業務系統設定置信度閾值。
13. 工單分派與自動化路由
面向客戶支援場景,系統將每條新進工單的關鍵描述提取出來,由 Jev 從十幾個業務小組中選擇最合適的主管團隊,取代了之前脆弱的手寫正則匹配。
14. 自動化 PR 合併資格預審
在持續整合(CI)流水線中,Jev 讀取改動檔案清單和自動化測試報告,快速對該 PR 是否具備合併資格給出初步判斷,高風險 PR 直接打上待人工複查標籤。
15. 重複扣費與緊急客服分類
針對金融和電商業務,Jev 被用來快速識別重複扣費等高危客訴。遇到客戶情緒激動或涉及退款申請,系統在 100 毫秒內打上緊急度標籤,優先推送人工客服坐席。
16. jev-mcp 事實核驗與注入檢測
社區開源了基於模型上下文協議(MCP)的擴展包 jev-mcp。開發者可以呼叫 Jev 完成多來源事實交叉核驗、檢測使用者 Prompt 中潛藏的 Prompt Injection 越獄攻擊,並為檢索召回內容打語義相關度分。
17. fast-jev-compaction 長上下文壓縮
在 Coding Agent 運行長任務時,上下文會迅速膨脹。fast-jev-compaction 利用 Jev 快速判斷每一輪工具呼叫的保留價值,剔除無效日誌,僅保留關鍵狀態,該項目獲得了 Jev 官方團隊的轉發讚賞。
18. Jev Codex Router 任務難度分流
一個多模型路由項目,在任務發起前由 Jev 預判該程式碼編輯任務的邏輯複雜度,簡單改動直接路由到便宜的小模型,複雜跨檔案重構才啟動大模型,整體呼叫開銷壓降 60% 以上。
19. Armin Ronacher 評價的大模型前置分流
Earendil CTO、Sentry 創始人 Armin Ronacher 指出,用主流生成式大模型自己來做分流決策在經濟上不合算。Jev 的極低延遲和極低成本,讓應用在入口層部署高密度的即時流量路由成為可能。
20. LangChain 部落格:Agent 外掛決策框架
LangChain 官方發表專題部落格《Building a Harness with Jev》。文章指出,以往 Agent 框架的分類決策邏輯往往深埋在閉源系統的定製邏輯中,現在有了通用、便宜且確定性極高的分類模型,這套 Harness 決策層可以推廣到每一個開源 Agent。
21. 鏈上訂單簿自動化交易
部分 Web3 開發者將 Jev 接入去中心化交易所。模型高頻讀取買賣訂單簿深度資料,僅輸出買入、賣出或觀望三個動作。社區普遍評價這是目前最具噱頭、但在真實行情裡風險最高的用法。
22. PrimeLine 預註冊對比測試:置信度決定勝負
在獨立測試機構 PrimeLine 開展的雙盲預註冊評測中,兩項真實任務上,Claude Opus 5 和 Haiku 4.5 的初始絕對準確率原本追平甚至領先 Jev。然而,一旦規則允許模型跳過自身最不確定的樣本,Jev 在兩項任務上全部實現逆轉。原因在於 Jev 輸出的置信度具備數學統計意義,而通用生成大模型自我評估的機率常常存在嚴重過自信。
03. 如何用上Jev
不少開發者看了一圈,最關心的是去那裡才能直接上手呼叫,以及官方有那些現成的開發者工具。目前官方和主流聚合閘道器都已經在第一周內開通了入口:
官方控制台與文件入口
TypeSafe 官方提供了線上控制台(Playground)與完整的開發者文件,支援通過 HTTP API、Python SDK 和 JavaScript SDK 直接發起呼叫。輸入價格統一為每百萬 token 0.042 美元,輸出免費。
官方文件:https://docs.typesafe.ai/introduction官方控制台:https://console.typesafe.ai/playground
OpenRouter 與 Vercel AI Gateway 聚合平台
如果你已經在使用現有的模型聚合層,不需要重新申請專屬 SDK:
OpenRouter:已在官方模型庫上線,模型標識為 typesafe/jev,現有接入 OpenRouter 的程式碼只需修改模型名稱即可切換。
- Vercel AI Gateway:在發佈 72 小時內完成了直連整合,支援全球邊緣低延遲分發。
官方 Skills 技能包:教 Agent 一次多問
除了基礎呼叫介面,TypeSafe 官方還在 GitHub 開源了 `typesafe-ai/skills` 倉庫。這是一套專門注入給 Coding Agent 的能力規範,重點糾正 Agent 喜歡一次只問一個問題的低效模式,指導它在拿到模糊需求時一次性將歧義點列清並附帶候選選項。
04. 寫在最後
Jev 從上線第一天引發的推特狂歡,到一周內被塞進各種生產級流水線,給整個開發者生態上了一堂關於分工的課。
對日常做 Agent 開發的人來說,能帶走的啟發很明確。一是別指望小模型擁有天馬行空的推理能力,它的長處在於把判斷壓縮成有限選項後的確定性與高吞吐;二是當業務需要接入安全攔截、分流路由、工單分揀這類非生成式任務時,把重型大模型換成輕量決策器,往往既能省下真金白銀,又能把響應延遲拉回可用的毫秒級水平。 (Datawhale)
