GPT-6刷到99.9%,ARC AGI考卷被迫重做!下一關考「發明」

AI速讀
OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 測試中以 99.9% 的得分造成基準飽和,但分析顯示此成績更多源於工程介面(Harness)的優化而非純粹智能提升。ARC Prize 創始人 François Chollet 因此被迫重新擬題,將推出 ARC-AGI-4 與 ARC-AGI-5,後者將直接挑戰 AI 的「開放式發明」能力。這場人機競賽顯示 AI 的進步速度正極速壓縮評測工具的生命週期,當人類無法再設計出「人能做而 AI 不能做」的題目時,即將迎來真正的 AGI 時刻。

AI把考卷刷到接近滿分,下一張,還能考什麼?

GPT-6 Astra一出世,在ARC-AGI-3半私有測試集上,拿下了99.9%的成績。

用OpenAI自己的話說:已經完全「飽和」了。


沒想到,它的出現,直接讓ARC-AGI原定方案全盤作廢。

提前規劃好的ARC系列,需要重新擬題了。

就在今天,ARC Prize創始人François Chollet,正式披露了下一代評測藍圖:

ARC-AGI-4確認將於明年Q1如期登場,而真正具有顛覆性、甚至被稱為「人類最後考卷」的ARC-AGI-5已全面提上日程。

ARC 4將聚焦更長尺度下,持續學習與課程學習;ARC 5完全圍繞「發明」展開。

他甚至表示,「當AI的學習效率與人類再無客觀測量差距時,那便是真正的AGI時刻」。

GPT-6刷爆ARC-AGI-3

全靠工程學

GPT-6 Astra在ARC-AGI-3上的表現,是2026年AI圈最具戲劇性的一幕。

在ARC Prize的「標準測試框架」下,Astra拿到62.7%。

這個成績當然已經是歷史最高,但距離滿分還很遠。

然而,當OpenAI接入自家的Provider Adapter,同一個模型的得分直接飆到99.9%。

這是一種能在多次呼叫之間保留模型隱藏推理狀態的上下文管理介面卡,可以讓AI以更接近生產環境的方式接入能力外掛。

結果就是:同一套權重,同一組題目,得分差出36個百分點。

ARC-AGI-3的排行榜含金量因此被重新審視,爭論焦點從「那家模型泛化能力更強」,變成了「那個harness更公平」。

這不是孤例。Claude Opus的同一套權重,在ARC-AGI-3私有集上驗證為30%,換用更好的harness後達到95.5%。

輝達的AVO,甚至在公開演示集上拿到100%。

ARC-AGI-3的「飽和」,更像是一個評測工程學事件。

ARC-AGI 3在測什麼

前兩代ARC-AGI-1和ARC-AGI-2,核心還是「看圖找規律」。

系統給幾組「輸入→輸出」的小方格圖,AI猜規則,再畫出新一組的輸出。

這是靜態題,答案唯一,靠的是「看幾個例子就能歸納出規則」的能力。

到了ARC-AGI-3,考法被徹底換掉了。

它直接把AI丟到一個遊戲世界裡,在1000多個關卡中,讓它自己玩、自己試、自己找規則。

每個遊戲有自己的內在邏輯、隱藏規則和通關條件。

沒有說明文件,沒有自然語言提示,沒有人告訴你「收集三個紅色方塊就能過關」。

AI只能看到當前畫面,選擇一個動作,觀察結果,再決定下一步。

像盲人摸像一樣,一步一步試探,在大腦裡拼湊出「這個世界可能是這樣運作的」的模型。

ARC Prize團隊明確列出了這個基準要測的四件事:探索;建模;目標獲取;規劃與執行。

GPT-6 Astra在96%的關卡上用比人類中位數更少的步數完成了任務,平均每關少用51.7%的動作。

ARC Prize稱這是「階躍式的能力變化」,但同時強調了一句:基準飽和並不等於證明了AGI。

因為這些環境是「有界」且確定性的,不是開放式的 。

下一張考卷

開始逼AI「發明」

按照原計畫,ARC 4將延續ARC 3的精神,但更偏向更長時間尺度上的持續學習和課程學習。

每個遊戲的關卡多得多,而且關卡是「複利」的,每一關都得復用前面關卡學到的東西。

現在,Chollet把「開放式發明」,放進了ARC 4和ARC 5共同的研發基礎。

那麼,「考發明」到底怎麼出題?

ARC 1到3都有一個共同前提:存在一個「對」的答案或一個「贏」的狀態,而且人類第一次上手就能做到,這樣才能用人類當尺子。

ARC 3的整套人類基線,就是那486個人、2893次嘗試量出來的。

發明的定義裡就包含「以前沒有」,沒有標準答案,也就沒有現成的人類基線可以除。

你沒法說「人類發明這個東西用了多少步」。那接下來,具體該怎麼量?

一條可能的路是回到Chollet對智能的「定義」:智能不是會多少技能,是獲取新技能的效率。

如果沿著這條線,發明可以量成——AI造出來的那個新工具、新規則、新記號,有沒有後面的問題解得更快。

Astra給遊戲編速記符號,其實已經是這個動作的雛形。它發明了一個中間表示,然後靠它省了一半的步數。

下一張考卷,ARC 5大機率是把這件事變成「考題本身」。

ARC 5直奔終極

人類還能出幾張考卷?

值得一提的是,ARC系列的考題,大概會在第6代、7代終結了。

Cholle曾表示,只要還能提出「人類能做、AI 不能做」的事,就繼續出題;

等到提不出來了,等到人類的學習效率和前沿AI之間的差距已經無法測量,那個時刻就是AGI。

AI進步太快,留給一張評測證明自己「足夠難」的時間,正在被壓縮。

一道難關剛被攻克,出題人就得尋找下一道。

分數逼近天花板後,原來的考卷也越來越難分辨:AI究竟又強了多少,人類還領先在那裡?

沿著這條趨勢看,ARC 5瞄準「發明」,很可能是在提前尋找一道更難被刷穿的考題:

讓AI走出預設解法,創造出能被驗證、能繼續復用的新東西。

這道題能守住多久,現在沒人知道。

但如果連開放式發明也無法再拉開人機差距,「考無可考」就會從一句感嘆,變成AGI討論中繞不開的問題。

AI還在加速,人類還能出幾張考卷?(新智元)