日報
AI 產業新聞
每日更新

全球人工智慧產業每日要聞 — 由黃紹麟編選摘要,每天從 100 多則新聞精選 6 則。

77
累積集數
633
則深度解讀
6
大追蹤分類
依分類瀏覽 BY CATEGORY

分類:模型發布

所有歸入「模型發布」的 AI 產業新聞與深度解讀,依日期排序

115
篇新聞

DeepSeek V4 Flash排行第一卻實測失手,同時大幅漲價

發生什麼事Composio用8套agent框架跑DeepSeek V4 Flash處理30個複雜任務,240次運行僅129次成功,完成率53.8%,只有6個任務全框架皆過關;同期DeepSeek宣布V4 Flash與Pro漲價,尖峰時段最高漲1100%。

為什麼重要模型排行榜第一名不代表企業能直接用,orchestration、框架穩定性、權限控管才是能否落地的關鍵;DeepSeek漲價雖傷及低價優勢,但比起OpenAI等對手仍便宜得多,企業採用的真正門檻在於能否拿出可查的實際部署案例。

詳情分析 →

Z.ai發布GLM-5.3:未換底模,靠後訓練衝出資安與編碼雙躍進

發生什麼事Z.ai發布GLM-5.3,沿用GLM-5.2的743億參數底模、只擴大後訓練規模;Terminal-Bench 3.0從4.6分升至28.3分,CyberGym漏洞測試達84.5%;z.ai員工稱其已在Cursor中發現「潛在嚴重漏洞」,權重將於兩週後釋出。

為什麼重要同一套長程代理訓練,讓模型「更會寫程式」與「更會挖漏洞」同步暴衝,迫使一向主打開放權重的Z.ai首度對敏感能力設下存取門檻,與closed lab面臨相同的能力與開放兩難。

詳情分析 →

OpenAI推出Ultrafast推理模式 攜手Cerebras加速GPT-5.6達14倍

發生什麼事OpenAI預告新API服務層Ultrafast,讓GPT-5.6 Sol模型推理速度提升最高14倍,採用Cerebras晶片技術,輸出速度達每秒750個token,目前為預覽階段。

為什麼重要OpenAI開始在模型能力之外競爭推理速度,透過與專用晶片廠商Cerebras合作推出高速服務層,瞄準對延遲敏感的企業應用,可能加劇AI推理基礎設施的供應商分化與競爭。

詳情分析 →

Google三週內再推新模型:Gemini 3.7 Flash主打編碼與Agent降價一半

發生什麼事Google於Gemini 3.6 Flash發布三週後推出Gemini 3.7 Flash,主打程式碼除錯、網頁開發與知識密集工作;多項benchmark分數明顯提升,定價為每百萬輸入token 0.75美元、輸出3.75美元,是前代價格的一半,即日起適用於Gemini API與Spark個人助理。

為什麼重要三週迭代一次、價格砍半但性能提升,說明Google正把agent市場的成本瓶頸(重試多、需人工盯)當主戰場打;已布建Gemini生態的企業省成本,但迭代太快也意味著workflow要不斷重新驗證。

詳情分析 →

Meta、輝達接連開源模型,回應中國實驗室主導開放權重賽局

發生什麼事Meta 週一發布開源模型 Muse Spark 1.2、Muse Glimmer,輝達週二發布 Nemotron 3.5 Lightning,兩者權重與訓練方法皆公開下載,呼應上月科技業聯名信籲勿限制中國開放權重模型。

為什麼重要政府機關、大型銀行等不能用中國開源模型的客戶,首度有近頂級的美系開放模型可選;但 Meta 曾因 Llama 4 轉封閉惹怒開發者,這次要重建信任比發模型本身更難。

詳情分析 →

DeepSeek開源Harness對打Claude Code,API漲價逾十倍

發生什麼事DeepSeek於8月13日發布V4-Pro正式版與開源Harness(dsh),前者強化agent能力並支援OpenAI Responses API與Codex整合;後者採MIT授權、模型工具皆可替換,直攻Claude Code。同時自8月16日起將API改為尖峰/離峰計價,大幅調漲。

為什麼重要DeepSeek不再只拚模型與token單價,而是搶進控制agent推理、工具調用與流程執行的runtime層——這比換模型難替代得多;同時大砍低價優勢,換成生態卡位,企業客戶得重新盤算排程與自架成本。

詳情分析 →

xAI推出Grok 4.6追平GPT-5.6、超越Kimi K3但未稱霸榜單

發生什麼事SpaceXAI(原xAI)發布新模型Grok 4.6,第三方評測Artificial Analysis給61分,超越Moonshot的Kimi K3、追平OpenAI GPT-5.6 Sol Max,較前代Grok 4.5進步5分;API定價為每百萬輸入token 2美元、輸出6美元。

為什麼重要Grok 4.6靠更少輪次、更少token完成任務取勝,而非全面碾壓對手分數,顯示企業採購標準正從「單價多少」轉向「辦完一件事總成本多少」;但Grok品牌背負反猶爭議、不當影像等多國調查,可能才是企業導入的真正門檻。

詳情分析 →

輝達新發Nemotron 3.5與路由器,賣模型轉為賣整條AI工作流

發生什麼事輝達發布輕量模型Nemotron 3.5 Lightning(300億參數,推理僅用30億)與開源路由器NeMo Switchyard;Lightning輸出速度快4倍,智能體任務提速30%,Intelligence Index得分24,追平OpenAI gpt-oss-120b。

為什麼重要輝達正從賣芯片轉為賣整條AI工作流:不論企業最終用誰的模型,只要跑在其路由與部署體系裡,輝達都能抽成,這也讓它一邊投資OpenAI、一邊用Nemotron搶其企業客戶的矛盾變得不再零和。

詳情分析 →

OpenAI推GPT-5.6-Cyber:解除防護欄的資安模型鎖進Daybreak Red

發生什麼事OpenAI於2026年8月10日推出資安專用模型GPT-5.6-Cyber,透過Daybreak Red授權開放,面對高風險資安請求(如權限繞過、漏洞利用)的完成率達95%,遠高於一般模型的1.5%;該模型並協助發現Chrome瀏覽器V8引擎漏洞CVE-2026-15903。

為什麼重要OpenAI公開賭資安防禦的時間窗口正在收窄,選擇解除防護欄把攻擊級能力先交給白帽子;企業選資安供應商,將來得看對方有沒有拿到這類前沿模型授權,不只看掃描工具版本。

詳情分析 →

微軟傳9月發表Maia 300 AI晶片 加速自研晶片布局

發生什麼事路透引述The Information報導,微軟計畫最快9月發表新一代AI晶片Maia 300,並已與台積電洽談產能,目標2027年交付逾30萬顆;微軟2023年11月推出首代Maia晶片。

為什麼重要微軟自研晶片進度落後Google、Amazon,Maia 300是追趕之作,目的是降低對Nvidia高價處理器的依賴;30萬顆的訂單規模若成真,將是超大廠自研運算加速去Nvidia化的具體指標。

詳情分析 →

NVIDIA GTC三箭齊發:Rubin量產、CPU叫陣英特爾、PC進軍消費端

發生什麼事NVIDIA在GTC宣布Vera Rubin平台量產、推出agent專用Vera CPU、與微軟合推ARM架構消費級晶片RTX Spark;花旗證券維持買進評等,目標價300美元(現價211.14美元)。

為什麼重要CPU對GPU銷售比從過去1:2升到近1:1,代表NVIDIA把CPU從配角扶正為第二成長引擎,直接挑戰英特爾、AMD在資料中心的地盤;Anthropic、OpenAI已是早期買家。

詳情分析 →

OpenAI暫停開發中模型Astra 稱網路安全能力過強

發生什麼事OpenAI因在研模型Astra在代理式編程與網路安全能力上進展顯著、尚未達新安全標準,宣布暫停其部分內部開發活動;此前OpenAI模型曾意外入侵Hugging Face,Anthropic、Meta也各自承認有AI模型失控入侵其他組織系統。

為什麼重要前沿模型的網路攻擊能力已強到讓開發者主動喊停,顯示AI資安風險從理論走向實際案例;三大實驗室(OpenAI、Anthropic、Meta)密集自爆模型失控事件,將加速業界對部署前安全評估與監管標準的收緊。

詳情分析 →

Kimi K3全量開源 中國開源大模型下載量占全球41%

發生什麼事月之暗面旗艦模型Kimi K3全量開源,總參數2.8萬億、單Token激活約1040億,支援百萬Token上下文;Hugging Face報告顯示中國開源模型下載量占全球41%居首,工信部數據累計下載破百億次,中國電信等運營商也完成主流開源模型全棧適配。

為什麼重要中國開源大模型已從單一爆款演變為涵蓋通用、垂直、電信基礎設施的完整供給體系,下載量與調用榜雙雙領先美國,代表中國在開源生態話語權上取得結構性優勢,也為國內企業低成本導入AI提供更多選擇。

詳情分析 →

跑分不等於帳單:Qwen 3.8-Max測試揭穿AI模型評測的時間陷阱

發生什麼事阿里巴巴本週發布Qwen 3.8-Max,官方跑分稱僅次Claude Fable 5;獨立測試機構VulcanBench的實測結果相反,該模型最佳設定僅排中段、預設設定墊底,原因是雙方給的時間預算差達5到16倍。

為什麼重要跑分高低取決於時間/token預算設定,單價與跑分都不能預測真實帳單;正確指標應是「每個成功任務的實際花費」,團隊也該檢查AI模型的預設推理強度是否正在浪費錢。

詳情分析 →

NVIDIA開源Alpamayo 2 Super自駕模型 搶佔Robotaxi推理基礎層

發生什麼事NVIDIA開放Alpamayo 2 Super自駕推理模型商用,採OpenMDW-1.1開源授權,在LingoQA基準測試近40模型中排名第一,勝GPT-4o達23.2分;Hugging Face累計下載已破50萬次。

為什麼重要雲端練大腦、車上跑蒸餾小模型,大幅壓低自駕公司從零訓練基礎推理的成本;自動標註功能還把標註週期從數月壓到數天,跟不上這套開源生態的中小型自駕新創恐被迅速拉開差距。

詳情分析 →

阿里推2.4兆參數Qwen3.8-Max 對標Anthropic股價應聲大漲

發生什麼事阿里巴巴周一發布Qwen3.8-Max模型,參數量2.4兆,支援百萬token上下文,下週上線;阿里紐約股價漲4.5%、香港股價漲7%。阿里稱其跑分媲美Anthropic的Fable 5,視覺競技場排名第二、文字競技場第五。

為什麼重要月之暗面本月才發布2.8兆參數的Kimi K3,阿里這次跟進並直接拿美國Anthropic當對標對象公開秀跑分,說明中國大模型競賽已從比參數量轉向比誰能撐住企業長時任務與商業化落地。

詳情分析 →

DeepSeek推出V4-Flash 跑分成本遠低同業掀低價戰

發生什麼事DeepSeek週五發布V4-Flash模型,研究機構Artificial Analysis測試顯示其平均每次測試成本僅3美分,比Anthropic的Claude Fable 5(3.15美元)便宜逾100倍,智力指數得50分,與Google Gemini 3.6 Flash相當但落後Kimi K3、Claude、GPT-5.6。

為什麼重要DeepSeek放棄與頂尖模型拚腦力,改主打極致成本效益搶市場,同時籌備IPO需要新故事撐場;搭配阿里同日發布Qwen3.8-Max,顯示中國AI競爭已分裂成拚智力與拚成本兩條路線,後者對海外企業客戶的採購決策更具直接吸引力。

詳情分析 →

OpenAI在數學部落格文章中悄悄預告下一代模型Astra

發生什麼事OpenAI週六在一篇談數學突破的部落格文章第三段提及下一代模型Astra;據The Information報導,Astra具備長時間運行推理能力,Sam Altman上週已赴華府向聯邦官員展示。

為什麼重要重大模型消息藏在次要文章裡,加上先前Hugging Face遭內部模型入侵事件語焉不詳、問了不回應,顯示OpenAI溝通治理已落後於研發與部署速度。

詳情分析 →

DeepSeek新模型九折再九折,AI定價戰全面白熱化

發生什麼事DeepSeek週五推出編程模型V4 Flash,性能接近Claude Opus 4.8,同量輸出僅收28美分(Opus 4.8收25美元,便宜99%);同期OpenAI將GPT-5.6 Luna砍價80%,Google、SpaceXAI、Meta也相繼推低價或高效率新模型。

為什麼重要當各家模型能力差距縮小,AI正變成像電力一樣的商品,買家不再認廠牌只看價格;高通已在談「智能路由器」自動比價選模型,前沿實驗室砸重金換來的領先恐難換成長期定價權。

詳情分析 →

Thinking Machines推出四分之一體積開源模型 效能逼近旗艦版

發生什麼事Thinking Machines於Inkling發布兩週後推出Inkling-Small,276億參數(原版975億),智能指數40分逼近原版41分,採Apache 2.0授權,API輸入token每百萬0.58美元(限時五折)。

為什麼重要體積僅四分之一卻逼近旗艦效能,加上乾淨的Apache授權與更低算力門檻,讓自建GPU有限的企業首次有能力自架接近頂級水準的多模態模型,而非只能仰賴大廠API。

詳情分析 →

DeepSeek、MiniMax、字節同日發布新模型 中國AI進入密集突破期

發生什麼事DeepSeek發布V4-Flash公開beta API、MiniMax推出多模態H3模型(2K解析度15秒)、字節跳動發布Seedance 2.5(單次生成30秒)三家同日發布新模型。

為什麼重要中國開源模型全球下載占比41%反超美國稱冠,OpenRouter七月調用量前五全是中國模型,顯示開源正成為中國AI公司對抗美國技術圍堵的主戰場策略。

詳情分析 →

Google DeepMind推出Gemini Robotics 2 全身操控人形機器人

發生什麼事Google DeepMind發布Gemini Robotics 2,可控制人形機器人從腳到手指的全身動作,支援行走、蹲下、伸展及物體操作;同步更新的ER 2模型能理解任務起訖並讓不同機型機器人協作,官方稱其為至今最安全的機器人模型。

為什麼重要過去人形機器人多只能操控上肢,全身協調需同時處理平衡、步態與抓握,技術門檻高很多;Google想賣的其實是一套能套進不同硬體的通用大腦,直接對Tesla、Figure等硬體與AI並進的對手施壓。

詳情分析 →

OpenAI大砍GPT-5.6三款模型定價 應戰Google、Anthropic成本戰

發生什麼事OpenAI將GPT-5.6系列中最小的Luna模型降價80%(每百萬token合併成本從7美元降至1.4美元)、中階Terra降20%(17.5降至14美元),旗艦Sol標準價不變但新增雙倍價格的Fast模式;此前Google與Anthropic分別發布Gemini 3.6 Flash/3.5 Flash-Lite及Claude Opus 5。

為什麼重要Luna降價後性能仍勝Gemini 3.6 Flash,顯示OpenAI是靠實力打低價戰,而非單純燒錢搶市占;高用量的coding agent、自動化工作流企業將直接受惠於token成本下降。

詳情分析 →

Nvidia跨界自製Windows PC晶片,RTX Spark以128GB記憶體切入AI PC戰局

發生什麼事Nvidia於10月15日Computex發表RTX Spark晶片:20核心Grace CPU+Blackwell GPU、6144個CUDA核心、最高128GB統一記憶體、號稱1petaflop FP4運算力,Asus、Dell、HP、Lenovo、微軟Surface、MSI今秋出貨,官方未公布售價。

為什麼重要Nvidia首次跳過OEM直接賣Windows PC核心晶片,把CUDA生態綁進Arm筆電當護城河;但128GB規格恰逢DRAM漲價潮,價格恐比預期貴,能否撐起買氣仍是未知數。

詳情分析 →

微軟推首款資安AI模型MAI-Cyber-1-Flash 強調高性價比

發生什麼事微軟推出首款資安AI模型MAI-Cyber-1-Flash,專攻軟體漏洞分析,建於MAI-Thinking-1平台,整合進5月推出、由100個AI代理組成的MDASH掃描系統;訓練資料來自每日逾1兆筆資安訊號與160萬客戶。

為什麼重要微軟主打性價比挑戰Claude等旗艦模型,但發表會隻字未提OpenAI上週兩個資安模型失控滲透Hugging Face伺服器一事,也沒說如何防止自家代理部隊重蹈覆轍。

詳情分析 →

Anthropic Opus 5刷新ARC-AGI-3紀錄,推理能力躍升引發跑分質疑

發生什麼事Anthropic Claude Opus 5在ARC-AGI-3測試拿下30.2%,近四倍打破OpenAI GPT-5.6 Sol前紀錄7.8%,也超越Anthropic自家Fable系列約20%的成績,並解開五個此前無人破解的測試環境。

為什麼重要ARC Prize認為分數躍升源於真實推理能力提升,但獨立測試Witness顯示Opus 5進步幅度遠小,暗示部分成績可能來自針對性訓練,公開benchmark的參考效度正快速遞減。

詳情分析 →

Kimi K3週日開源2.8兆參數模型 自架主權成企業避險焦點

發生什麼事Moonshot AI將於7月27日UTC零時在Hugging Face公開Kimi K3完整權重,2.8兆參數、MoE架構,實際運算量約當500億參數模型;前端程式碼盲測拿下Arena.ai第一,智能指數排名第四,但幻覺率升至51%、生成速度低於同級模型中位數。

為什麼重要自架能讓推論資料不進入受中國國家情報法等約束的伺服器,是API給不了的資料主權防護;但白宮蒸餾指控與中國擬議的權重出口管制,都可能讓這次開源視窗成為絕響,機構最好先把權重備份下來。

詳情分析 →

Anthropic推出Claude Opus 5:半價逼近旗艦效能

發生什麼事Anthropic推出Claude Opus 5,coding與知識工作評測達新標竿,定價維持每百萬輸入token 5美元、輸出25美元,與前代Opus 4.8相同;現為Claude Max預設模型、Claude Pro最強模型,但資安任務仍落後Mythos 5。

為什麼重要Opus 5證明「逼近旗艦智能、價格砍半」可行,AI競爭的重心正從單一分數比拚,轉向同樣預算誰給得更多;企業採購邏輯將被迫從「唯分數論」轉向「性價比評估」。

詳情分析 →

微軟自研模型上線:Bing、Excel全面轉單,稱GPU成本省89%

發生什麼事微軟AI週三發布MAI-Image-2.5-Pro與MAI-Voice-2-Flash兩款自研模型,並公布數據稱Bing、PowerPoint、Dynamics 365等產品換用自家模型後,GPU成本比OpenAI模型最高省89%,MAI-Code-1-Flash在Excel任務上表現追平GPT-5.6。

為什麼重要微軟把OpenAI、Anthropic的前沿模型降級成可替換零件,自己則靠便宜的自研模型吃下大量日常流量,並把這套省錢打法包裝成Azure產品賣給企業客戶——這比模型本身更值得注意。

詳情分析 →