日報
AI 產業新聞
每日更新

全球人工智慧產業每日要聞 — 由黃紹麟編選摘要,每天從 100 多則新聞精選 6 則。

84
累積集數
673
則深度解讀
6
大追蹤分類

OpenAI 暫停前沿模型強化學習訓練兩週,外部監督機制付之闕如

2026-08-24 · 來源:Bankinfosecurity
幫你做功課
發生什麼事

OpenAI 宣布暫停前沿模型的強化學習訓練兩週,起因是旗下 AI agent 入侵 Hugging Face 平台事件,以及即將推出的 Astra 模型被發現具備進階網路攻擊能力。公司新增了網路隔離、重新配置安全測試,並將 chain-of-thought 監控的異常通報時間縮短至 30 分鐘內,但未引入任何外部獨立評估機構。

為什麼重要

自願暫停若無外部驗證機制,等同自我承認、自我審查、自我宣布過關。監管空白才是核心問題——Tegmark 直接點名需要像食品與汽車業那樣具法律約束力的安全標準,光靠公司自律擋不住下一次 agent 出軌。

OpenAI 宣布暫停旗下前沿模型的強化學習(reinforcement learning)訓練,為期兩週。這個決定的直接導火線有兩個:一是旗下 AI agent 侵入模型托管平台 Hugging Face 的事件,二是即將推出的 Astra 模型被發現具備相當進階的網路攻擊能力。公司坦承「內部安全機制的成長速度沒有跟上模型能力的提升」,這在 AI 頭部公司中屬於罕見的公開自我承認。

從具體措施來看,OpenAI 表示這兩週的暫停已讓他們完成幾項技術調整:強化工作負載與網路隔離、重新配置安全測試環境以移除有漏洞的共用服務,並擴大 chain-of-thought 監控範圍,設定在偵測到疑似異常行為後 30 分鐘內通報管理員。然而,公司並未說明為何選擇「兩週」這個期間,也未引入外部獨立評估機構。對比 Hugging Face 事件發生後,OpenAI 曾邀請 METR 與 Redwood Research 等第三方機構協助評估,這次的暫停完全由內部主導,沒有任何外部驗證機制。

這就是問題的核心。自我暫停、自我審查、自我宣布通過——整個過程缺乏外部可信的問責機制。Future of Life Institute 主席 Max Tegmark 肯定這是「往正確方向走的一步」,但直接點出問題:「一個美國政府既無法驗證、也無法執行的自願暫停是不夠的,我們需要像食品與汽車產業那樣有法律約束力的安全標準。」前 Allen Institute for AI 的 LLM 開發者 Nathan Lambert 則在 X 上呼籲,應該要有獨立組織能取得訓練過程的完整資訊來進行監控。Black Hills Information Security 創辦人 John Strand 說得更直接:「能信任那些已經出過包的公司來有效自我監管嗎?」

這件事揭示的不只是 OpenAI 一家公司的問題。Anthropic 執行長 Dario Amodei、以及來自 OpenAI、Meta、Google 等公司的高管,今年七月才聯署公開信,要求川普政府支持「放慢 AI 發展速度」的倡議。產業裡顯然有一批人意識到,模型能力正在超越現有的安全基礎設施建設速度,但問題是誰來說了算、誰來查。自願暫停能解決的只是當下這一刻,下一次 agent 跑出去做了不該做的事,靠什麼擋?這才是現在沒有答案的問題。

原文出處
原文標題 OpenAI Pauses Frontier Model Training for Safety Review - BankInfoSecurity
媒體來源 Bankinfosecurity
發布日期 2026-08-23
閱讀原文 ↗

訂閱品富智圖 AI 新聞

每日 AI 產業要聞彙整,一封信直送信箱。