跑分不等於帳單:Qwen 3.8-Max測試揭穿AI模型評測的時間陷阱
阿里巴巴本週發布Qwen 3.8-Max,官方跑分稱僅次Claude Fable 5;獨立測試機構VulcanBench的實測結果相反,該模型最佳設定僅排中段、預設設定墊底,原因是雙方給的時間預算差達5到16倍。
跑分高低取決於時間/token預算設定,單價與跑分都不能預測真實帳單;正確指標應是「每個成功任務的實際花費」,團隊也該檢查AI模型的預設推理強度是否正在浪費錢。
阿里巴巴這週發布Qwen 3.8-Max,官方跑分表把自己吹成僅次於Claude Fable 5的agentic能力王者。獨立測試機構VulcanBench跑出來的結果幾乎是反的:同一個Preview版本,最佳設定只排中段,預設設定墊底。兩邊都沒造假,問題出在時間和token預算——阿里巴巴自家的coding測試給5小時逾時,PaperBench甚至給到12小時;VulcanBench只給45到60分鐘。預算差5到16倍,結果自然天差地別。這不是誰的測試有問題,是跑分這個東西本身沒把預算算進去。
更麻煩的是,單價已經不能告訴你真實成本了。DeepSeek-V4-Flash-0731每百萬輸入token只要14美分,Qwen 3.8-Max要2美元,Kimi K3更貴到3美元。但推理模型的問題在於:錢燒在「想」上面,不是燒在「答」上面。Artificial Analysis量到DeepSeek-V4-Flash在最高努力設定下,跑一次Intelligence Index要吃2.1億輸出token,是同級模型中位數的兩倍多——單價便宜救不了你,想太久一樣燒錢燒時間。VulcanBench抓到最赤裸的案例:Claude Opus 5用最低努力設定反而戰績最好,23題解出20題;拉到最高努力設定只解出18題,不是答錯變多——它答錯最少,只錯一題——而是想太久被計時器判死。三次失手兩次是被算逾時,同樣不設時限它也頂多打平最便宜的設定,但代價是貴3.1倍。
這對所有做模型路由(routing)的團隊是個警訊。業界標準做法是:便宜模型答不出來就往上升級到更強的推理設定,賭的是「貴一點但一定更好」。VulcanBench的數據說這個賭注常常是錯的——升級升到的不是更好的答案,是更貴的逾時。真正該看的指標不是準確率,是「每個成功任務的實際花費」:把失敗嘗試的錢也算進去,除以真正過關的任務數。這個算法已經有人在用真金白銀驗證——HubSpot四月把Breeze客服代理從每次對話收1美元改成每次解決收50美分,Zendesk按自動解決案件收費,Intercom的Fin按結果收99美分。這些公司不是在做學術研究,是真的按「做成一件事」收錢,倒逼供應商把浪費藏起來的空間全部擠掉。
對正在評估或部署agentic模型的技術團隊,這篇報導給了一個立刻能做的檢查清單:每次跑agent都要記錄失敗原因,區分「預算耗盡」「驗證失敗」「系統錯誤」三種,不能只有一個失敗旗標;按token而非時鐘計算預算上限,除非延遲真的寫進你的服務指標;最重要的一條——去查現在部署的模型預設是什麼努力設定。Qwen 3.8-Max如果不特別設定,預設跑最高推理強度,而這正是獨立測試裡表現最差的那一檔。換句話說,如果團隊從沒動過這個參數,可能正用著每個成功任務成本最高的設定在燒錢。
訂閱品富智圖 AI 新聞
每日 AI 產業要聞彙整,一封信直送信箱。
