ARC Prize公開ARC-AGI-3人類實測數據 驗證AI通用智能基準



非營利組織 ARC Prize 今年 4 月公開一份人類作答紀錄,想回答一個很直覺的問題:他們用來衡量「通用智能」的新測驗,普通人第一次看到,到底解不解得出來。這套測驗叫 ARC-AGI-3,3 月下旬在舊金山發表。和前兩代不一樣,題目不是靜態圖形配對,而是一百多個沒有說明書的小遊戲。畫面上沒有文字目標,也沒有關卡攻略,受測者只能按、看畫面變什麼、再猜規則。基金會的說法是:系統什麼時候算達到 AGI,要看它能不能像人一樣,碰到沒見過的狀況自己學會。


為了證明題目不是專門刁難機器,他們找來 458 名一般民眾,職業、學歷、年齡都沒有特別篩選,每週在舊金山一處測驗中心面對面進行,單場約 90 分鐘。底薪大約 130 美元,每解完一個環境再加 5 美元。規則刻意跟給 AI 的條件對齊:同一段系統提示、同一組可執行動作,現場不提這是 ARC Prize,也不說這跟 AGI 評比有關。每個人對每個環境只有一次機會,測的是第一次接觸,不是練過之後的熟練度。題目若被判定太難,就會改或拿掉,最後留下的,都必須至少兩名互不相識的人能從頭通關。

公開示範的 25 個環境,一共留下 342 筆逐步重播,其中 145 筆是完整通關。每關至少兩人解完,多數關卡超過五人。有的環境幾乎人人過,例如代號 r11l 的 10 人都解完;有的入場較陡,像 cd82,11 人裡有 2 人卡在第 2 關,但跨過那關的人多半能打完。基金會會長 Greg Kamradt 在報告裡寫,這份資料就是收據:人類解得完,而當時的 AI 還差一截,所以他們不認為 AGI 已經到來。

計分後來也改過。原本每一關的人類基準,取「第二好」的玩家,用意是去掉極端值、又把門檻維持得高。實務上有些關卡帶一點運氣,開頭選錯路就很難追,基準太緊,連人類好手都難拿滿分。他們改成用該關的中位數玩家當基準,單關上限從 100% 放寬到 115%,避免一關拖垮整場。兩項調整合計,人類和 AI 分數大約都多 0.5 個百分點。AI 若拿到 100%,意思是每一關的動作效率都達到或超過人類中位數。


這份公開資料可以下載,包含每關解出率、按鍵次數和效率分布。後續幾個月,模型在這套題上進步很快,9 月 GPT-6 Astra 在不同測試介面分別來到約六成與接近滿分,但出題單位仍把「人類第一次就能學會」當成標尺,沒有因為單一高分就改口宣布通用智能已到。有興趣的人可以直接上官網玩公開關卡,對照一般民眾當時怎麼走。

  • ARC Prize 原文
    https://arcprize.org/blog/arc-agi-3-human-dataset

  • ARC Prize 測驗說明與榜單
    https://arcprize.org/arc-agi/3
    https://arcprize.org/results