震撼!OpenAI全面開源Codex Harness

AI速讀
OpenAI 宣布開源 Codex Harness,將 AI Agent 的底層執行邏輯交付開發者。此次行動旨在終結「通用聊天框」的單一互動模式,允許 AI 直接集成到專業業務看板中。通過提供 CLI、SDK 與 app-server,開發者可精準控制介面、上下文與工具權限。實測顯示,優化 Harness 可使模型在 ARC-AGI-3 測試中得分從 13.3% 飆升至 38.3%,並大幅減少 Token 消耗。Cisco 與 Thrive Holdings 等企業已將其應用於雲端管理與稅務申報,標誌著 AI 應用進入「原生集成」的新時代。

就在昨天,OpenAI又完成一次升級。

這不是什麼全新的模型發佈,但它對開發者的影響力,甚至超過了模型本身的迭代。

OpenAI正式宣佈:將大名鼎鼎的Codex底層核心框架(Harness),作為平台全面開源!



也就是說,OpenAI把驅動自家頂級AI智能體的發動機,免費送給大家。

開發者再也不需要去把業務流程硬塞進一個通用聊天框了!

你可以你直接把最強大的AI 智能體循環,無縫鑲嵌進你自有的產品、工程工具、營運看板,甚至是最枯燥的財務報表軟體中。

OpenAI總裁Greg Brockman在X上激動轉發說:「Codex 能驅動的遠不止程式設計工具!」

你可以在Codex Harness上,直接建構自己的產品。


從此,你的地盤你做主,介面、資料、權限審批都是你的,AI只負責在底層做「牛馬」。

OpenAI這次的「開源大動作」,會如何徹底顛覆以後的軟體開發範式?

天下苦「通用聊天框」久矣

回想一下,我們現在是如何使用AI的?

不管是寫程式碼、做資料分析,還是處理客戶投訴,標準動作似乎都是:打開一個網頁/側邊欄,面對一個單調的聊天輸入框,敲下一段背景說明,然後期待AI能給出完美的答案。

如果答案不對,就繼續在聊天框裡「拉扯」。


大多數人通過App、命令列介面(CLI)或IDE擴展認識了Codex。

但在OpenAI看來,這種單一的互動體驗,實在是太狹隘了!

OpenAI在官方部落格中一針見血地指出:

與其要求每一個團隊都把他們原本熟悉的工作流程,強行搬到一個通用的程式碼助手中去,不如把Agent直接帶入那些圍繞實際工作設計的軟體裡。

畢竟,安全分析師看的是預警佇列、受影響的服務狀態;客服工程師看的是帳戶歷史、產品日誌;產品經理看的是需求看板。

對於這些真實的打工人來說,重要的不是那個「聊天框」,而是他們眼前的業務看板。介面的存在是有意義的,它本身就是最重要的「上下文」。

現在,隨著Codex Harness的開源,這場「反套殼」的革命,正式打響了。

揭秘 Harness:AI Agent的「最強外骨骼」

那麼,這次開放原始碼的主角——Harness,到底是個什麼?

很多人誤以為,一個強大的AI Agent = 好模型 + 好Prompt。

大錯特錯!

一個真正能在業務中跑起來的智能體,需要一套極其複雜的底層執行系統。

它需要理解任務、在漫長的對話中保持記憶、審查相關資訊、熟練呼叫各種工具、對外展示進度、處理崩潰和失敗、在關鍵時刻停下來請求人類的審批,最後再返回有用的結果。

這個包攬了所有髒活累活的「執行系統」和「智能體循環」,就是 Harness。


這次開源,OpenAI向外界證明了一件事:好的Harness設計,甚至能讓模型脫胎換骨。

OpenAI給出非常有說服力的資料,來證明harness設計有多關鍵。

在難度極高的ARC-AGI-3基準測試中,他們僅僅對Harness進行了兩項關鍵調整——保留推理與上下文壓縮。

結果,GPT-5.6 Sol 模型的得分居然瞬間從 13.3% 飆升到了38.3%!更驚人的是,輸出的Token數量竟然減少了六倍!

也就是說,在Harness的加持下,AI不僅變得聰明了三倍,還幫你省下了海量的API呼叫成本。

事實證明,模型能力固然重要,但如何管理這個模型(即Harness的設計),才是決定Agent最終表現的關鍵。

三大開源元件,零門檻整合

為了讓開發者能夠真正做到「拿來即用」,OpenAI在Apache-2.0許可下,一口氣放出了完整的三大開源元件。

只要去GitHub上的 openai/codex 倉庫,你就能解鎖這個強大的武器庫。

https://github.com/openai/codex

首先是CLI工具codex exec,它能運行自動化的流水線。

如果你只需要讓AI跑一個指令碼、執行一個CI(持續整合)任務,或者跑一個後台一次性任務,直接用CLI。

它能運行一個有邊界的Agent工作流,並返回結構化的輸出結果。簡單、粗暴、高效。

第二個,就是官方 Codex SDK,它是程式設計師的終極操縱桿。

如果你正在寫應用程式,需要用程式碼來啟動、恢復或者流式傳輸Codex任務,官方SDK(支援TypeScript / Python)提供了直接的程式設計式介面。

你可以用程式碼精準控制線程與任務的生命周期。

第三個,也是本次開源中最耀眼的明星,就是是Codex app-server了。它是徹底融入產品的核心引擎。

當Agent需要成為你產品的一部分時,app-server 是最佳選擇。它通過記錄詳細的客戶端協議(JSON-RPC),讓你的應用可以連接到本地Codex處理程序。

你可以用它:

保持持久的對話狀態;

流式傳輸事件(即時看到AI在幹嘛);

中途打斷AI的工作;

將你自己應用的工具暴露給AI使用;

處理人類的審批請求(Human-in-the-loop)。

正如知名開發者 @ClusterProtocol 所感嘆的:

將前端的審批介面,與底層的執行循環分離開來,讓把Agent嵌入到業務儀表盤變得前所未有的簡單!

絕不僅僅是寫程式碼!

各行各業的「提效核武器」

如果你覺得Codex只是用來寫程式碼的,那你就大錯特錯了。

正如Brockman所言,Codex 能驅動的遠不止程式設計工具。

讓我們來看看那些首批吃螃蟹的人,都在用它創造什麼奇蹟:

案例一:稅務申報的「神級輔助」

你能想像AI去報稅嗎?財務工作最怕的就是出錯,容錯率極低。

合作夥伴 Thrive Holdings 和 Crete 利用這套開源Harness,將其嵌入到了專業的稅務準備工作流中。

系統不僅能處理複雜的稅務邏輯,還能完美融合稅務師的反饋。

結果非常震撼, 這個試點項目成功處理了高達 7,000份 申報表,並將稅務準備時間硬生生縮短了約三分之一!

這就是將AI嵌入垂直專業工具的巨大威力。

案例二:巨頭Cisco的雲端管家

科技巨頭 Cisco (思科) 使用Codex SDK在其雲控制平台內建構了App Builder。

現在,Cisco的客戶可以直接使用自然語言來建立自訂的應用程式,而複雜的底層邏輯流轉,全部由Codex Harness在幕後默默擺平。

官方演示範本:物流看板「Relay」

為了讓大家更直觀地理解,OpenAI官方展示了一個名為 Relay 的虛擬物流營運看板應用。

在這個看板裡,沒有任何讓人出戲的「ChatGPT聊天框」。

1.互動巨變:使用者不需要從零手寫Prompt。他們只需選中一個延誤的貨單,點選「比較恢復方案」。

2.上下文無縫對接:應用會自動將當前介面的貨單詳情、物流資料作為上下文喂給AI。

3.MCP整合:Codex會自動呼叫應用自有的MCP工具,獲取最新的即時營運資料。

4.人類把關:Agent分析出最優的重新訂艙方案後,必須彈出審批框。只有當業務員點選「同意」,AI才會執行寫入操作。

5.狀態同步:操作完成後,業務看板自動刷新。


在這個過程中,Harness包攬了Agent循環、記憶維持、工具互動和即時反饋;而你的產品,依然掌控著屬於它的儀表盤、資料記錄和控制權。這才是真正的「人機協同」。

重塑邊界,把權力和靈魂還給應用開發者

為什麼我們說這次開源改變了軟體建構的範式?

因為在過去的一年裡,很多開發者陷入了「套殼」 的怪圈。大家都在做ChatBot,產品越來越像,護城河越來越淺。

Codex作為平台的開放,給了開發者三個維度的「最高控制權」:

Codex給使用者絕對的介面控制權,不要再強迫使用者去適應聊天框了!

讓你的使用者繼續使用他們熟悉的儀表盤、編輯器、地圖和列表。AI應該是一個隱形的幫手,而不是一個霸佔螢幕的主角。

絕對的上下文與工具控制權讓你安心把公司最核心的系統、機密文件、內部API,通過MCP服務直接開放給Agent。

AI不再是「不知道公司規章制度」的門外漢,而是精通你業務系統的專家。

最後,絕對的營運邊界與安全控制權,這對企業級應用至關重要。宿主應用可以決定Agent在那裡運行、能訪問什麼檔案。

最重要的是,你可以設定那些危險動作(如修改資料庫、傳送給客戶的郵件)必須經過人類的點選能放行。

這種「前端業務規則歸你,底層Agent循環歸OpenAI」的模式,徹底打通了AI落地企業級場景的最後一公里。

Codex harness的Apache-2.0許可,意味著任何人都能修改和商用。

真正的考驗是:有多少開發者會放棄舒適的聊天框,把智能體拆成零件裝進自己的產品。

Codex harness背後,深深體現了這種產品哲學——

我們要做的,絕不是用一個萬能的聊天框去幹掉所有專業介面;而是給這些介面裝上一個聰明的大腦。

當通用聊天框消失,原生AI應用將蓬勃發展。

AI Agent的零門檻時代,已經來臨了。(新智元)