日報
AI 產業新聞
每日更新

全球人工智慧產業每日要聞 — 由黃紹麟編選摘要,每天從 100 多則新聞精選 6 則。

57
累積集數
508
則深度解讀
6
大追蹤分類

Anthropic Opus 5刷新ARC-AGI-3紀錄,推理能力躍升引發跑分質疑

2026-07-27 · 來源:The Decoder
幫你做功課
發生什麼事

Anthropic Claude Opus 5在ARC-AGI-3測試拿下30.2%,近四倍打破OpenAI GPT-5.6 Sol前紀錄7.8%,也超越Anthropic自家Fable系列約20%的成績,並解開五個此前無人破解的測試環境。

為什麼重要

ARC Prize認為分數躍升源於真實推理能力提升,但獨立測試Witness顯示Opus 5進步幅度遠小,暗示部分成績可能來自針對性訓練,公開benchmark的參考效度正快速遞減。

Claude Opus 5在ARC-AGI-3拿下30.2%,是OpenAI GPT-5.6 Sol前紀錄7.8%的近四倍,也甩開Anthropic自家Fable系列的約20%。這不是小幅超車,是斷層式領先。ARC Prize團隊的說法很直接:這次贏的是真本事,是更強的邏輯推理讓模型能在陌生環境裡自主探索、規劃、執行。測試中Opus 5還做出以前沒見過的動作——把任務轉成代數式表示,自己推導反射方程式,解開五個先前無人破解的環境,其中四個達到或超過人類水準。25個公開demo環境,現在被解開六個。舊版ARC-AGI-2它拿90.4%,ARC-AGI-1拿97.5%,都追平先前最高分,只是代價稍高一點。

但這故事沒那麼乾淨。Anthropic自己沒解釋分數怎麼跳這麼多,外界猜是針對性資料標註加上強化學習。關鍵在於Opus 5是在ARC-AGI-3公開格式之後才開發出來的——這意味著Anthropic有機會針對這套題型的技能與格式做準備,雖然不代表直接練了原題。找人標註推理軌跡、有效動作、失敗嘗試、糾錯步驟,再用強化學習獎勵探索與自我修正,這套組合拳完全講得通。

真正的照妖鏡來自寧廣涵(Guanghan Ning)的私有測試集Witness。同樣是互動解謎,Opus 5在這裡只拿43.4分,跟Kimi K3、Fable 5打平,比起Opus 4.8的進步幅度遠小於在ARC-AGI-3上的躍進。面對常見機制組合的謎題,Opus 5甚至能在下第一步之前就講出隱藏規則;但換成less常見的規則組合,分數反而輸給Opus 4.8。這種落差,像極了針對特定題型資料訓練出來的痕跡——雖然沒人能證實Anthropic用了什麼資料。ARC Prize研究員Greg Kamradt則持保留態度,認為單一測試不足以否定更廣泛的推理提升,個別遊戲表現不佳可能只是局部回歸。

這件事對整個benchmark生態的意義,比Opus 5本身的分數更值得留意。跑分一旦公開格式,就變成訓練目標,這幾乎是必然的循環——寧廣涵拿coding benchmark的歷史來類比:HumanEval飽和之後,業界轉向常態更新的競賽題與今天的coding agent,ARC-AGI系列大概率會走同一條路。對商業決策者來說,真正該問的不是「Opus 5多強」,而是「這個分數還能撐多久當作採購或技術選型的依據」——如果benchmark的生命週期只有一代模型的長度,那所謂的跑分領先,更像是一張隨時會過期的成績單,而不是能力的定論。

原文出處
原文標題 Anthropic's Opus 5 blows past Fable 5 and GPT-5.6 Sol on the benchmark designed to measure real intelligence - The Decoder
媒體來源 The Decoder
發布日期 2026-07-26
閱讀原文 ↗

訂閱品富智圖 AI 新聞

每日 AI 產業要聞彙整,一封信直送信箱。