日報
AI 產業新聞
每日更新

全球人工智慧產業每日要聞 — 由黃紹麟編選摘要,每天從 100 多則新聞精選 6 則。

77
累積集數
633
則深度解讀
6
大追蹤分類

從聊天機器人到 AI 代理人:能力指數成長正在重塑人類工作方式

2026-07-01 · 來源:One Useful Thing

事情比多數人意識到的更快。這是這篇文章最核心的判斷,也是理解當前 AI 產業格局最準確的切入點。

先說能力端的現實。兩個公認的評測框架——METR 與英國政府 AI 安全研究所——都在衡量 AI 單次提示能替代多少工程師工時,而這個數字正在以「優於指數」的速度上升。研究機構 Epoch 的實驗更直接:Opus 4.7 獨立運行 14 小時,以 251 美元的算力成本完成了人類工程團隊需要 2 到 17 週才能交付的軟體套件。這不是 benchmark 遊戲,是真實的工程產出。

更值得注意的是,美國前沿模型之外還有另一條曲線正在追趕:以中國為主的開放權重模型(open weights)。這些模型落後美國閉源模型約 6 到 12 個月,但走在自己的指數改善軌道上,而且因為開放可修改、部署成本遠低,對企業採購決策的滲透門檻更低。兩條曲線並存,競爭格局不是「美國贏了就結束」,而是一場持續的雙軌賽跑。

使用模式的轉變是這篇文章最值得決策者思考的部分。過去兩年,主流使用方式是「co-intelligence」:人問、AI 答、人確認、再問下一步,人始終是節點。這個模式正在被取代。長時間自主運行、可以自我修正的 AI 代理人(agent)不需要人在每個環節插手,它需要的是任務派發與監督,而不是逐步的手把手引導。OpenAI 內部的數據點出了方向:四分之一的員工每週至少同時管理四個以上的代理人,而且不只是工程師——法務、人資等非技術職能採用代理人的速度幾乎一樣快。

還有一個更逆直覺的發現值得記住:在 Claude Code 的研究中,決定用戶成功率的不是職業背景,而是領域專業深度。越懂行,從 AI 代理人拿到的產出就越好,每一個 prompt 的有效輸出也越高。這意味著「AI 讓非專家可以取代專家」的敘事要翻轉:更準確的描述是「AI 讓真正的領域專家產出成倍放大」,而那些沒有深度專業的人,並不會因為有了 AI 就自動追上。

這對亞太市場的決策者意味著什麼?任何在 2025 年冬季之前寫下的 AI 規劃,描述的都是一個單次工作上限約兩小時、錯誤率偏高的系統。今天的系統可以從單一指令持續工作十六小時以上。這不是產品升級,是系統邊界的整體遷移。那些把 AI 策略定位在「讓員工用聊天機器人查資料或草擬文件」的組織,正在錯估競爭對手的起跑線。

文章最後提出的框架是指數的本質問題:人類機構的運作速度是「人的速度」,委員會更慢;但 AI 能力曲線的速度根本不是人類量級的。每隔一個固定時間窗口,能力增量就比上一個窗口更大。從外部看,這呈現為一連串的「突然發生」——突然成為真實的資安威脅、突然動搖商業模式、突然引發政策急轉。這些震盪不是 AI 領域不成熟的徵兆,而是指數曲線與線性機構之間永久存在的摩擦。只要曲線繼續,這個落差只會擴大,不會收斂。

原文出處
原文標題 The twilight of the chatbots
媒體來源 One Useful Thing
發布日期 2026-06-30
閱讀原文 ↗

訂閱品富智圖 AI 新聞

每日 AI 產業要聞彙整,一封信直送信箱。