訪談
AI 名人觀點
重要訪談

替你解析 AI 界關鍵人物的重要訪談、對話、演講 — 透過名人的思想看見未來。

68
位人物
79
篇訪談解讀
67
個訪談來源

【專訪】D-Matrix 的 Sid Sheth:GPU 吃不下的推論市場,正是他要的

Sid Sheth · Eye on AI(2026-08 專訪) · 2026-08-19

AI 晶片這個題目,媒體永遠在講 Nvidia,講完 Nvidia 就沒了。但推論運算市場正在裂解,裂解出來的縫隙裡,有一批人在悄悄搶位。Sid Sheth 是 D-Matrix 的執行長——D-Matrix 是一家專攻推論晶片的矽谷新創,核心賭注是:當 AI 從訓練期進入大規模應用期,GPU 不會是唯一的答案。這場訪談錄於 2026 年 8 月,時間點很微妙:AI 編程助理爆發才幾個月,agent 對 agent 的通訊協定剛被釋出,整個推論市場正處於 Sheth 自己形容的字面上炸在我們臉上的狀態。他說的話有沒有分量?看他們怎麼押注就知道——D-Matrix 不用 HBM 記憶體,不追最先進製程,繞開了所有人在搶的供應鏈瓶頸,然後等市場來找他們。

這場訪談值得看的地方有四個。第一,推論市場正在出現分層定價,每百萬 token 從 2 美元到 20 美元,溢價十倍,這不是技術討論,是商業模式的結構性改變。第二,D-Matrix 的晶片架構為什麼適合這個溢價市場,背後的記憶體頻寬邏輯說清楚了。第三,Sheth 親口說他用 Claude 做併購評估,取代了過去整個投資銀行顧問團隊——這不是比喻,是他正在做的事。第四,他對 agent 經濟的預測:任務抽象層次會持續上升,最終 AI 可以接管公司大部分的運營,但他也坦承這一切快得連他自己都沒料到。合起來看:一個賣鏟子的人,解釋了為什麼這場淘金熱比大家想的更分層,更貴,更快。

推論市場不是一個市場,是兩個

GPU 的優勢是廣,缺點也是廣。Sheth 的說法是:推論運算正在一分為二,一邊是走量的低成本吞吐,一邊是走質的低延遲互動。後者他稱之為 premium token economy——每百萬 token 定價 20 美元,是前者的十倍。為什麼有人願意付這個價?因為 AI 編程工具讓回應速度直接影響用戶留存率,使用者等不起。D-Matrix 的架構把運算和記憶體擺在一起,記憶體頻寬比 GPU 常用的 HBM 方案快上一個數量級,這讓它生成 token 的速度遠高於 GPU。他點名的同類競爭者是 Groq 和 Cerebras——Groq 是一家以 LPU 架構著稱的 AI 推論晶片公司,Cerebras 則以晶圓級晶片聞名。這個溢價市場目前玩家不多,因為架構門檻真的不同。

Claude Code 和 OpenClaw 是需求炸點,不只是產品

Sheth 把近幾個月的需求爆發歸因於兩件事:Claude Code(Anthropic 推出的 AI 編程工具,讓不懂程式的人也能直接用自然語言寫程式)和 OpenClaw(他指的是開源的 agent 通訊框架,允許多個 AI agent 跨虛擬機器協同工作)。後者尤其關鍵:機器等機器完成任務,每一個等待都是延遲,延遲就是錢。他的原話大意是,任務抽象層次還會繼續上升——從幫我做一份 PowerPoint到幫我贏下這個客戶,你自己去搞清楚決策者是誰,我的產品要怎麼調整。他認為不遠的將來,AI 可以可靠地接管大多數公司的大部分運營。說這話的人是賣推論晶片的,他有充分的動機往大了說——但結構邏輯本身是對的。

Claude 取代了投資銀行顧問,他親自驗證的

D-Matrix 正在做更多收購,Sheth 把 Claude 當做 M&A 的思考夥伴。他說過去這種事要動用整個銀行顧問團隊,現在 Claude 15 分鐘就能產出一份整合計畫。他也不迴避缺點:資料有時是舊的,但一旦對方的資料室打開,直接丟給模型跑,整合計畫就出來了。更有意思的是他怎麼描述模型的演變:六到八個月前,ChatGPT 對他說的任何事都點頭稱是,現在 Claude 會反駁他,指出他沒看到的面向。他說這感覺像一個習得新能力之後變得更有自信的人。這個觀察不是在讚美 AI,是在說 sycophancy(討好式附和)問題正在被解決——而那個問題,其實在人類員工身上同樣存在。

供應鏈賭注:不用 HBM,不追先進製程,反而是護城河

所有人都在搶 TSMC 最先進製程和 HBM 記憶體,D-Matrix 都沒有用。Sheth 的邏輯是:他們選的是 N-1,N-2 製程節點,不用 HBM,也不用 CoWoS 封裝技術——這三樣正是目前供應最緊張的技術。他坦承整個晶片市場未來三到四年都會短缺,Elon Musk 想自建晶圓廠也是因為這個原因。但 D-Matrix 的需求用現有供應鏈就能滿足,因為他們繞開了競爭最激烈的那條路。這是一個典型的不打正面策略——市場夠大,縫隙裡的空間也夠大。問題是這條路能走多久,等他們真的規模化之後,同樣的供應鏈壓力遲早會追上來。

Sheth 說了一句話值得記住:我們從一開始就賭推論,然後賭互動式推論,然後賭 agent 協作——每一步都比預期快。賣鏟子的人說淘金熱比預期快,你可以打個折扣聽。但溢價 token 市場的結構是真的:有人願意為速度付十倍的錢,這個錢已經在流動了。AI 晶片的故事不是只有 Nvidia 一個答案。

訪談出處
訪談名稱 Eye on AI(2026-08 專訪)
講者 Sid Sheth
日期 2026年8月
觀看原始訪談 ↗
重要發言 KEY QUOTES
[03:00]
Sid Sheth

解釋推論市場為何正在分層:低延遲推論是正在爆發的獨立類別,GPU 因架構限制在此類應用效率不佳;以 Claude Code 為例說明高互動需求的商業邏輯。

[04:00]
Sid Sheth

說明 premium token economy 的定價結構:低互動每百萬 token 約 2 美元,高互動約 20 美元,用戶願意為互動速度支付十倍溢價。

[14:00]
Sid Sheth

解釋 OpenClaw(開源 agent 通訊框架)如何驅動低延遲需求:多個 agent 跨虛擬機器協同,機器等待機器的延遲直接影響任務效率,latency 因此變成關鍵指標。

[19:00]
Sid Sheth

預測 agent 能力的下一階段:從個人任務自動化上升至組織層級的策略規劃,舉例說明 AI agent 可以承擔完整的銷售與行銷策略制定工作。

[25:00]
Sid Sheth

親身描述用 Claude 輔助 M&A 評估的實際流程:將對方資料室資料輸入模型,15 分鐘產出整合計畫,並說明此前需要整個銀行顧問團隊才能完成同樣工作。

[26:00]
Sid Sheth

比較 ChatGPT 與現在模型的差異:早期模型傾向全面附和(sycophancy),現在的模型會提出反駁,指出決策盲點;他形容這像一個習得新能力後變得更有自信的人。

[40:00]
Sid Sheth

說明 D-Matrix 的供應鏈策略:刻意選擇 N-1,N-2 製程節點,不使用 HBM 和 CoWoS 技術,繞開目前最緊張的供應鏈瓶頸,並評估未來三到四年整體晶片市場仍將短缺。

訂閱品富智圖 AI 新聞

每日 AI 產業要聞彙整,一封信直送信箱。