DeepSeek V4 Flash排行第一卻實測失手,同時大幅漲價
Composio用8套agent框架跑DeepSeek V4 Flash處理30個複雜任務,240次運行僅129次成功,完成率53.8%,只有6個任務全框架皆過關;同期DeepSeek宣布V4 Flash與Pro漲價,尖峰時段最高漲1100%。
模型排行榜第一名不代表企業能直接用,orchestration、框架穩定性、權限控管才是能否落地的關鍵;DeepSeek漲價雖傷及低價優勢,但比起OpenAI等對手仍便宜得多,企業採用的真正門檻在於能否拿出可查的實際部署案例。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
榜單第一名不等於能用。DeepSeek V4 Flash上線後衝上OpenRouter使用量冠軍,開發者喊它「total monster」,但Composio用八套agent框架(Claude Code、Codex、OpenCode等)跑30個涉及Gmail、GitHub、Slack、Google Sheets的真實多步驟任務,240次運行只過129次,完成率53.8%,30個工作流裡只有6個在所有框架下都成功。同一個模型,換個框架、換個工具配置,結果差一大截——這說明決定企業能不能用起來的,是orchestration,不是模型本身多聰明。
更打臉的是價格。DeepSeek同時宣布V4 Flash與Pro漲價,漲幅視模型、token類型、尖離峰時段不同,最高達1100%。Flash離峰每百萬輸入token 22美分、輸出66美分,尖峰翻倍到44美分和1.32美元;Pro離峰66美分起、尖峰最高3.96美元。連快取命中的價格都漲了52%到1100%。分析師Sanchit vir Gogia說得直白:這不是單純漲價,是把推論的「時間點」變成一個經濟變數——能等的工作(批次評估、合成資料、夜間跑批)擠進便宜時段,即時互動的agent躲不掉。值得注意的是,新結構讓DeepSeek自己的本土市場(尖峰對應中國白天)反而付最貴的價錢。
漲價會不會傷了DeepSeek靠低價圈粉的立身之本?分析師Carmi Levy說乍看像「自殺式操作」,但DeepSeek對比OpenAI、Anthropic、Google這些對手,價格優勢依然巨大,只是算盤要打得更緊。真正的問題不在漲價本身,在DeepSeek連基本的企業採用證據都還拿不出來——Gogia指出,Flash的API還在公測階段,沒有已具名的企業客戶、沒有落地案例可查。DeepSeek自己的文件甚至寫明,某個熱門agent環境下,V4的內建設定不足以穩定運作、需要額外相容性調整——等於官方自己承認:benchmark分數高,不代表上生產線就能用。
這才是這篇報導真正的重點:企業現在該問的不是「哪個模型分數最高」,而是「哪個模型+框架+服務商的組合,能用最低成本把活安全做完」。Meta工程師Naman Ahuja用DeepSeek V4 Flash做居家自動化agent測試後得出同一個結論——一旦模型能真的採取行動,可靠性、驗證、權限控管、失敗重試,重要性不輸模型聰不聰明。一個聊天回錯了,頂多尷尬;一個agent在企業系統裡執行錯了動作,是真金白銀的代價。DeepSeek這次漲價,等於逼所有人從「便宜的中國模型」這個舊敘事裡走出來,認真回答一個更硬的問題:這模型到底能不能扛得住真實世界的工作流。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 104 期 ・ 隨時可退訂
