DeepSeek V4 Flash排行第一卻實測失手,同時大幅漲價
發生什麼事Composio用8套agent框架跑DeepSeek V4 Flash處理30個複雜任務,240次運行僅129次成功,完成率53.8%,只有6個任務全框架皆過關;同期DeepSeek宣布V4 Flash與Pro漲價,尖峰時段最高漲1100%。
為什麼重要模型排行榜第一名不代表企業能直接用,orchestration、框架穩定性、權限控管才是能否落地的關鍵;DeepSeek漲價雖傷及低價優勢,但比起OpenAI等對手仍便宜得多,企業採用的真正門檻在於能否拿出可查的實際部署案例。
