OpenAI 最新發佈了一份面向 GPT-5.6 的官方 Prompt 指南。它不僅能讓你的 Agent 更能幹,也能直接幫你省 Token!
如果你正在用 GPT-5.6 開發應用或搭建 Agent,這份指南解決的是一個非常現實的問題:模型越來越強,Prompt 卻越寫越長。舊模型留下的補丁、重複規則,以及層層疊加的工具和權限說明,不僅持續消耗 Token,還可能互相衝突,反而讓新模型發揮不出來。
在 OpenAI 的一組內部 Coding Agent 任務中,更精簡的 System Prompt 讓評分提高了約 10%~15%,同時將總 Token 減少了 41%~66%,成本降低了 33%~67%。
這位是指南的作者,Eric Provencher:
他目前在 OpenAI 做 Codex 開發者體驗(DX),此前打造過 RepoPrompt,長期折騰的正是程式碼庫上下文、Prompt 設計和 Agent 工作流。
這份指南到底講了什麼?先給 Prompt 做減法!
這份指南首先建議開發者重新檢查現有 Prompt,而不是直接增加新規則。
很多 System Prompt 都是在長期迭代中逐漸變長的。模型漏掉過一個步驟,就增加一條 MUST;工具呼叫出過一次問題,就補上一條 NEVER。模型更新之後,這些為舊版本加入的規則往往還會繼續保留。時間一長,重複、過時甚至互相矛盾的指令就會越來越多。
OpenAI 建議從一套已經能夠正常工作的 Prompt 和工具集開始,每次只刪除一組重複指令、無效示例或無關工具,再用同一批評測檢查結果。這樣既能控制改動範圍,也能判斷具體是那項修改影響了模型表現。
需要刪除的是那些已經不再影響模型行為、卻仍在消耗上下文的內容。需要保留的則是任務目標、成功標準、權限邊界、證據要求和交付前的驗證方式。
Prompt 做減法,刪的是無效資訊,不是必要要求。
比起規定模型的每一步,更重要的是寫清最終結果
指南的另一個重點,是減少不必要的過程指令。
過去的 Prompt 經常會規定模型先搜尋、再讀取檔案、接著呼叫工具,最後按照固定順序輸出。但對於 GPT-5.6,OpenAI 更建議開發者寫清最終目標、可用證據、行動邊界和驗收標準,讓模型根據任務情況選擇執行路徑。
這並不意味著 ALWAYS、NEVER、MUST 不能使用。安全限制、必填欄位和禁止執行的操作,仍然需要明確說明。但是否繼續搜尋、何時呼叫工具、資訊不足時是否追問,通常更適合提供判斷標準,而不是固定成一套適用於所有情況的流程。
停止條件也需要提前寫清。
證據已經足夠時,模型應該進入交付;如果仍缺少關鍵事實,就說明缺少什麼,並選擇成本較低的方式補充。這樣可以減少重複搜尋和無效的 Token 消耗。
讓 Agent 做事之前,先明確它可以做什麼
當 Agent 接入工具後,Prompt 還需要說明任務授權的範圍。
如果使用者要求分析、審查或制定計畫,通常只表示模型可以檢查材料並報告結論;如果使用者要求修改、建構或修復,才表示模型可以執行範圍內的本地變更和非破壞性驗證。涉及外部寫入、刪除、購買或明顯擴大任務範圍的操作,則應該再次確認。
能夠判斷下一步該做什麼,不代表已經獲得執行這一步的權限。
工具也應當按任務需要提供。工具描述需要說明它的用途、適用時機、關鍵返回欄位以及失敗後的處理方式。工具數量過多或說明不清,都會增加模型選擇工具時的負擔。
檢索同樣需要設定範圍和停止條件。普通問答可以先進行一次範圍較廣的搜尋,獲得核心證據後直接回答;只有缺少關鍵事實、日期、來源或必要引用時,再進行有針對性的補充檢索。沒有搜到某項資訊,不應直接推斷這項資訊不存在;來源相互衝突時,也應該如實說明。
長任務要及時更新狀態,也要控制推理成本
對於持續時間較長、工具呼叫較多的任務,指南建議只在重要階段發生變化時更新進度,不必向使用者逐次說明常規工具呼叫。上下文壓縮適合放在關鍵里程碑之後;之前保存的推理,也只有在目標、假設和優先順序仍然有效時才應該繼續使用。
Reasoning Effort 也不是越高越好。官方建議先保留當前設定作為基線,再測試相同檔位和更低檔位。只有評測結果證明 high 或 xhigh 確實帶來收益,才有必要承擔更高的推理成本;max 更適合難度最高、質量優先的任務。
在提高推理強度之前,還應該先檢查 Prompt 是否寫清了成功標準、依賴關係、工具使用條件和驗證要求。如果這些資訊不明確,單純提高 Reasoning Effort 未必能解決問題。
生成結果之後,還需要驗證
指南反覆強調的一項原則是:模型生成了結果,不代表任務已經完成。
程式碼修改完成後,如果條件允許,應繼續運行測試、類型檢查、Lint、建構檢查或最小冒煙測試。前端和視覺任務也需要查看實際渲染結果,檢查佈局、裁切、間距和內容是否完整。
如果當前環境無法完成驗證,也應該說明原因,並給出下一步的檢查方法,而不是直接把結果表述為已經完成。
指南最後還提供了一套 Prompt 結構,包括 Role、Personality、Goal、Success criteria、Constraints、Tools、Output 和 Stop rules。這套結構並不是要求開發者把每一項都寫得很長,而是幫助他們確認 Prompt 中的每條資訊是否真的會影響模型行為。
只有確實會影響模型行為的資訊,才有必要寫進 Prompt。
誰最值得看,怎麼讀最省時間
這份指南最適合正在遷移 GPT-5.6 的開發者,以及維護複雜 System Prompt、工具描述、Agent 指令和 Prompt Stack 的團隊。
如果你的 Prompt 中已經積累了大量 Always、Never、舊模型補丁和固定流程,或者你的應用涉及搜尋、工具呼叫、程式碼修改、外部操作和長任務狀態,這份指南尤其值得完整閱讀。
如果你只是使用 ChatGPT 進行普通問答、寫作和總結,則不必逐節閱讀。理解“先做減法、結果優先、明確邊界、完成前驗證”這幾個核心判斷,基本就能抓住整份指南的主線。
時間有限的話,可以優先閱讀官方原文中的 Simplify prompts first、Outcome-first prompts and stopping conditions、Suggested prompt structure 和 Prompt migration workflow。前兩部分幫助你判斷 Prompt 應該刪什麼、保留什麼,後兩部分則可以直接用於整理現有 Prompt 和制定遷移步驟。 (Datawhale)
