xAI推出Grok 4.6追平GPT-5.6、超越Kimi K3但未稱霸榜單
SpaceXAI(原xAI)發布新模型Grok 4.6,第三方評測Artificial Analysis給61分,超越Moonshot的Kimi K3、追平OpenAI GPT-5.6 Sol Max,較前代Grok 4.5進步5分;API定價為每百萬輸入token 2美元、輸出6美元。
Grok 4.6靠更少輪次、更少token完成任務取勝,而非全面碾壓對手分數,顯示企業採購標準正從「單價多少」轉向「辦完一件事總成本多少」;但Grok品牌背負反猶爭議、不當影像等多國調查,可能才是企業導入的真正門檻。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
SpaceXAI(原xAI)發布新一代旗艦模型Grok 4.6,主打長任務代理、程式撰寫與知識工作。第三方評測機構Artificial Analysis給出61分,超越Moonshot的開源模型Kimi K3,追平OpenAI的GPT-5.6 Sol Max,比前代Grok 4.5進步五分。API定價維持在每百萬輸入token 2美元、輸出6美元,遠低於GPT-5.6 Sol標準模式的35美元,走的是中價位路線。
但這不是一場全面碾壓。拆開各項benchmark看,Grok 4.6在Terminal-Bench上從15.7%衝到26%,可是GPT-5.6 Sol Max和Fable 5 Max都還在34%以上;DeepSWE上Grok衝到65.9%,GPT-5.6 Sol Max照樣領先在73%。真正打出優勢的地方是效率:完成AA-Briefcase工作平均只用53輪、約0.5億輸入token,Claude Opus 5 Max卻要103輪、20億token。換句話說,Grok 4.6不是靠分數贏,是靠「用更少的來回把事情辦完」贏。這對企業採購來說是關鍵轉向——過去比的是每百萬token多少錢,現在該比的是辦完一件事總共燒多少錢。Artificial Analysis自己算出來,Grok 4.6每個任務成本反而比前代Grok 4.5和GPT-5.6 Luna、GLM-5.2都貴,說明「便宜」這個標籤要拆開來看,不能只看牌價。
真正卡住企業採購的,不是分數,是品牌史。Grok這個名字背負的包袱一件不少:2025年7月的「MechaHitler」反猶事件、南非「白人種族滅絕」政治置入、對馬斯克本人的誇張吹捧、還有2026年初英國Ofcom對X平台展開的正式調查——起因是Grok帳號被用來產製未經同意的性化影像甚至疑似兒童性剝削素材。英國資訊專員辦公室(ICO)與歐盟執委會也分別依《數位服務法》開了調查。這些案子針對的是X和舊xAI組織,不是新發布的Grok 4.6本身違法,但採購團隊從來不會把模型和供應商史分開看。一家銀行、醫療機構要導入AI客服,技術分數再漂亮,品牌安全的雷區踩不起。
Grok 4.6證明的是SpaceXAI追上牌桌的能力,而不是坐上牌桌之首的能力。它把「便宜又夠用」的敘事講得更響,但敢不敢把它接進監管敏感的業務流程,答案不在benchmark表格裡,在合規部門手上。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 95 期 ・ 隨時可退訂
