日報
AI 產業新聞
每日更新

全球人工智慧產業每日要聞 — 由黃紹麟編選摘要,每天從 100 多則新聞精選 6 則。

104
累積集數
791
則深度解讀
6
大追蹤分類

Anthropic 研究員展示 AI 自動優化對齊訓練:10 項失準行為全數改善,成本僅人類研究員 1/37

2026-08-29 · 來源:TechCrunch AI
幫你做功課
發生什麼事

Anthropic fellows 計畫研究員 Chen Yueh-Han 領銜發表論文,描述一套自動化對齊訓練系統 AAR(Automated Alignment Researcher):針對 10 項失準行為 benchmark 全數取得改善且未損整體表現;AAR 最佳方法平均六小時內超越人類研究員提案,每小時 API 成本約 4 美元,對比人類研究員 150 美元。

為什麼重要

AAR 把對齊訓練的執行層自動化,讓實驗室可以用極低成本快速迭代,對人類對齊研究員的需求構成直接壓力;但 benchmark 定義仍須人類把關——自動化執行之前,「什麼叫對齊成功」這個問題沒有答案,AAR 的風險上限由此而來。

每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。

這是 Anthropic 首次以論文形式對外展示「AI 自我改進對齊訓練」的早期成果,意義不在技術細節,而在它把遞迴自我改進(recursive self-improvement)從理論搬到了可驗證的實驗數字上。

Anthropicfellows 計畫研究員 Chen Yueh-Han 領導的團隊,本週發表論文《Automated Researchers Can Reliably Mitigate Alignment Failures》,核心問題是:能不能讓 AI 系統自動跑對齊訓練、把模型修好,而不是每次都靠人類研究員手工設計訓練流程?答案是:在設定好的測試條件下,可以。實驗針對 10 項具體的失準行為設定 benchmark,自動化系統(Automated Alignment Researcher,AAR)對全部 10 項都取得改善,且未拖垮模型的整體表現——這個「全壘打」結果是論文最重要的數字。

運作機制上,AAR 複製了人類研究員的工作流程:搜尋現有文獻、提出方法假設、跑 30 分鐘訓練、反覆迭代提升 benchmark 分數,有效方法保留、無效的丟棄。論文直接把 AAR 和有經驗的人類研究員做比較,結論毫不迴避:「AAR 的最佳方法平均在六小時內就超越人類研究員的提案,人類主導的研究方向並未帶來更強的表現。」成本差距同樣直白——AAR 每小時 API 推理費用約 4 美元,對比 Anthropic 人類研究員的 150 美元,差了將近 37 倍。

這件事的產業意涵,要從兩個層次來看。第一層是近期實際影響:AI 實驗室如果能用自動化系統跑對齊訓練的部分工作,意味著訓練迭代的速度和規模可以大幅提升,不再受限於人類研究員的工時。對齊研究本來就是各大實驗室最稀缺、最難招募的人力,現在有工具可以部分替代,這是一個具體的競爭槓桿。第二層是結構性含義:論文明確點出這是通往遞迴自我改進的一步——如果模型能改善自己的對齊訓練,下一步邏輯上就是改善更廣泛的訓練方法本身,屆時人類 AI 研究員的角色會被壓縮到什麼程度,目前沒有人說得準。

不過論文也沒有迴避限制條件。AAR 的效果完全取決於 benchmark 能否真實反映對齊目標——如果 benchmark 設計有偏差,自動化系統只會把模型調歪得更漂亮。維護 benchmark、擴充 AAR 所依賴的研究文獻庫,這些基礎工作目前仍需要人類介入。換句話說,AAR 目前能自動化的是「執行研究流程」,但「定義什麼叫做對齊成功」這道門還沒開。這個限制不是小事:對齊目標本身就是 AI 安全領域最核心、也最沒有共識的爭議點,把執行交給 AI、把定義留給人類,聽起來合理,但這條邊界在實際操作中能否守住,是真正值得追蹤的問題。

電子報訂閱 ・ NEWSLETTER

看完今天的,讓明天的自己送上門

每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。

已出刊 104 期 ・ 隨時可退訂

原文出處
原文標題 An Anthropic researcher just gave us a peek at self-improving AI
媒體來源 TechCrunch AI
發布日期 2026-08-28
閱讀原文 ↗