日報
AI 產業新聞
每日更新

全球人工智慧產業每日要聞 — 由黃紹麟編選摘要,每天從 100 多則新聞精選 6 則。

84
累積集數
673
則深度解讀
6
大追蹤分類

跑分不等於帳單:Qwen 3.8-Max測試揭穿AI模型評測的時間陷阱

2026-08-07 · 來源:VentureBeat AI
幫你做功課
發生什麼事

阿里巴巴本週發布Qwen 3.8-Max,官方跑分稱僅次Claude Fable 5;獨立測試機構VulcanBench的實測結果相反,該模型最佳設定僅排中段、預設設定墊底,原因是雙方給的時間預算差達5到16倍。

為什麼重要

跑分高低取決於時間/token預算設定,單價與跑分都不能預測真實帳單;正確指標應是「每個成功任務的實際花費」,團隊也該檢查AI模型的預設推理強度是否正在浪費錢。

阿里巴巴這週發布Qwen 3.8-Max,官方跑分表把自己吹成僅次於Claude Fable 5的agentic能力王者。獨立測試機構VulcanBench跑出來的結果幾乎是反的:同一個Preview版本,最佳設定只排中段,預設設定墊底。兩邊都沒造假,問題出在時間和token預算——阿里巴巴自家的coding測試給5小時逾時,PaperBench甚至給到12小時;VulcanBench只給45到60分鐘。預算差5到16倍,結果自然天差地別。這不是誰的測試有問題,是跑分這個東西本身沒把預算算進去。

更麻煩的是,單價已經不能告訴你真實成本了。DeepSeek-V4-Flash-0731每百萬輸入token只要14美分,Qwen 3.8-Max要2美元,Kimi K3更貴到3美元。但推理模型的問題在於:錢燒在「想」上面,不是燒在「答」上面。Artificial Analysis量到DeepSeek-V4-Flash在最高努力設定下,跑一次Intelligence Index要吃2.1億輸出token,是同級模型中位數的兩倍多——單價便宜救不了你,想太久一樣燒錢燒時間。VulcanBench抓到最赤裸的案例:Claude Opus 5用最低努力設定反而戰績最好,23題解出20題;拉到最高努力設定只解出18題,不是答錯變多——它答錯最少,只錯一題——而是想太久被計時器判死。三次失手兩次是被算逾時,同樣不設時限它也頂多打平最便宜的設定,但代價是貴3.1倍。

這對所有做模型路由(routing)的團隊是個警訊。業界標準做法是:便宜模型答不出來就往上升級到更強的推理設定,賭的是「貴一點但一定更好」。VulcanBench的數據說這個賭注常常是錯的——升級升到的不是更好的答案,是更貴的逾時。真正該看的指標不是準確率,是「每個成功任務的實際花費」:把失敗嘗試的錢也算進去,除以真正過關的任務數。這個算法已經有人在用真金白銀驗證——HubSpot四月把Breeze客服代理從每次對話收1美元改成每次解決收50美分,Zendesk按自動解決案件收費,Intercom的Fin按結果收99美分。這些公司不是在做學術研究,是真的按「做成一件事」收錢,倒逼供應商把浪費藏起來的空間全部擠掉。

對正在評估或部署agentic模型的技術團隊,這篇報導給了一個立刻能做的檢查清單:每次跑agent都要記錄失敗原因,區分「預算耗盡」「驗證失敗」「系統錯誤」三種,不能只有一個失敗旗標;按token而非時鐘計算預算上限,除非延遲真的寫進你的服務指標;最重要的一條——去查現在部署的模型預設是什麼努力設定。Qwen 3.8-Max如果不特別設定,預設跑最高推理強度,而這正是獨立測試裡表現最差的那一檔。換句話說,如果團隊從沒動過這個參數,可能正用著每個成功任務成本最高的設定在燒錢。

原文出處
原文標題 Qwen 3.8-Max and Claude Opus 5 show why raw benchmark scores don't predict the bill
媒體來源 VentureBeat AI
發布日期 2026-08-06
閱讀原文 ↗

訂閱品富智圖 AI 新聞

每日 AI 產業要聞彙整,一封信直送信箱。