登入
關鍵字
#大模型安全
官方認證
RexAA
昨天 11:37
•
AI 6小時幹過28名研究員!Anthropic公開:自動化對齊神器AAR!
如果你嘗試過用大模型幫你做實驗或者寫程式碼,大機率經歷過這種無奈:一旦離開螢幕幾分鐘,程序要麼因為小報錯直接中斷,要麼模型在幻覺裡反覆橫跳,最後你還是得守在終端前,一步都不敢離開。 最新,Anthropic 發佈了一篇長達 51 頁的技術報告,聯合其前沿研究團隊與訪問學者,正式公開了內部被稱為“自動化對齊研究員”(Automated Alignment Researcher,簡稱 AAR)的完整系統。這篇文章展示了一套不需要人類步步盯梢、能夠自主提出假說、編寫訓練程式碼、單卡執行真實微調並由獨立評測環境打分的閉環科研工程體系。 論文標題:Automated Researchers Can Reliably Mitigate Alignment Failures論文連結:https://arxiv.org/abs/2608.28945 01
科技
#Anthropic
#AAR
#大模型安全
35人
讚
留言
分享