AI Agent 的下一步是什麼?
史丹佛的答案是:讓 AI 學會自己改進自己。
這門課是 CS329A《Self-Improving AI Agents(自改進 AI 智能體)》,於 2025 年秋季學期開設。課程不再只討論如何把 Agent 做出來,而是追問一個更難的問題:模型訓完以後,能不能通過搜尋、驗證和環境反饋,繼續變強?
現在,課程首頁、論文閱讀清單和官方錄影都已經線上公開!
課程首頁:https://cs329a.stanford.edu/官方視訊列表:https://www.youtube.com/playlist?list=PLangBM27OtEA
Aakanksha Chowdhery 是史丹佛大學兼職教授。在Google期間,她曾任 540B 參數 PaLM 模型的技術負責人,並參與 Gemini、PaLM-E、Med-PaLM 和 Pathways 等項目。她的研究橫跨大模型訓練、擴展律與分佈式系統。
Azalia Mirhoseini 是史丹佛大學電腦科學助理教授,負責 Scaling Intelligence Lab。她曾在 Google Brain、Google DeepMind 和 Anthropic 工作,參與過 Gemini 和 Claude 的開發。
課程還邀請了多位學界和產業界講者,主題落在 LLM 推理、編碼 Agent、數學證明、自主系統和機器人等方向。公開課表中包括 Google DeepMind 的 Melvin Johnson、Denny Zhou 和 Thang Luong,Reflection AI 的 Misha Laskin,以及 Physical Intelligence 的 Danny Driess 等一眾行業大佬!
從大模型講起,首個教「自改進 Agent」的課
過去幾年,大模型的進步主要靠更多資料、更大參數和更多訓練算力。CS329A 關心的是另一個問題:模型已經訓完之後,能不能通過搜尋、驗證、工具呼叫、環境反饋和強化學習,在任務中繼續變強?
這裡的「自改進」不是讓 Agent 隨意改自己的程式碼。CS329A課程更關心一個可操作的閉環:模型先生成多個候選答案,用驗證器或環境反饋找出更好的結果,再把這些結果變成新的訓練訊號。它既可以發生在推理時,也可以發生在訓練時。
課程從 LLM 自改進方法講起,包括 Constitutional AI、驗證器、測試時算力擴展、搜尋與 LLM 的結合,以及通過強化學習擴展訓練。後半程轉向工具、程式碼、記憶、多模態互動、多步規劃和 Agent 評估。
課程內容
CS329A 持續約 10 周,課程表共有 20 次課。
前半程從測試時算力擴展開始。模型一次生成的答案不夠好,那就多採樣幾次,再用驗證器篩選。數學題可以檢查答案,程式碼可以運行測試,開放式任務卻很少有現成標準。所以,課程會專門講結果驗證、過程驗證和弱驗證器。
接下來,Agent 開始呼叫搜尋、運行程式碼、讀取環境狀態,並利用執行結果修正下一步。課程會講到 ReAct、樹搜尋、多步規劃和基於程式碼反饋的強化學習。
後半程進入訓練時擴展。模型在搜尋和驗證過程中產生的高品質軌跡,可以被用來繼續訓練模型。這部分會讀 STaR、DeepSeekMath 和 DAPO,也會討論 AI Scientist、AlphaEvolve 與深度研究 Agent。
最後,課程把這套方法放到更長、更真實的任務中:編碼 Agent 如何在程式碼庫裡工作,長時間任務如何管理記憶,怎樣評估數小時甚至數天的 Agent 任務,以及這些方法如何用到多模態機器人上。
課程地址
課程首頁:https://cs329a.stanford.edu/
從閱讀材料、作業目標和研究項目看,CS329A 但這不是一門面向零基礎讀者的 Agent 產品課。
至少需要熟悉 Python 和 PyTorch,理解 Transformer、監督微調和基本的強化學習概念,並且能夠閱讀機器學習論文。如果還想完整復現課中方法,最好再補一些搜尋、規劃、分佈式訓練和模型評估的知識。
「自改進」這個詞很大,CS329A 做的卻是很具體的拆解。所以它適合當成 Agent 進階課程。(Datawhale)
