【專訪】PolyAI Shawn Wen:語音代理真正的難題是時間,不是語言
語音 AI 的下一場仗不在實驗室,在電話那頭正在氣頭上的客戶。PolyAI 是一家總部在倫敦,專做企業級語音客服代理的公司,在銀行,物流,餐飲連鎖等場景部署真實的語音 AI 系統,而 Tsung-Hsien Wen(Shawn)是它的共同創辦人之一,劍橋大學對話式 AI 博士出身,在學術圈與產業界都有深厚積累。外界普遍以為 ChatGPT 問世之後語音問題就快解決了,一批公司蜂擁而至,把 ChatGPT 接上語音辨識再接上語音合成就說自己做了語音代理。Shawn 說,那些東西拿去展示很漂亮,真的放進客服中心,到處出問題。
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
這場訪談值得注意的地方有四個:第一,語音比文字難在哪裡,問題出在時間這個維度,而不是語言理解本身;第二,PolyAI 為什麼選擇自建模型,以及他們把語音辨識和語言模型合併成一個端對端架構的具體邏輯;第三,企業客戶真正的需求是強大如人,可控如機器,這兩件事彼此矛盾,這才是落地最難的地方;第四,語音代理的下一個十年,Shawn 認為企業和消費者場景將分叉成兩個完全不同的產品,而第二波 IoT 浪潮可能伴隨著跑來。合在一起看,這場訪談是一個在第一線燒過才知道坑在哪裡的人,把坑一個一個講清楚。
◎語音難,難在時間軸而非語言理解
Shawn 的說法直接:現在的 AI 在文字世界很厲害,解博士級物理題沒問題,因為網路上有夠多文件可以學。語音不一樣,語音多了一個維度——時間,而且是即時的時間。你停頓了兩秒,是還在想,還是說完了?你講話很慢,是老人家,還是訊號不好?機器目前沒有被訓練到能靠語意加上語速來判斷這件事。他把語音比作機器人技術:人類從嬰兒開始就在物理世界收集資料,手會去抓東西,眼睛會看,身體會動;機器沒有這些,物理世界的資料量和文字世界根本不在同一個量級。Wozniak 的咖啡杯挑戰——讓機器人去一個陌生廚房泡杯咖啡——之所以還沒解決,道理和語音轉接失敗是同一個。
◎端對端架構不是潮流,是工程上的被迫選擇

PolyAI 原本用的是傳統的串接架構:語音辨識模型,語言模型,換話輪偵測器,三個模組各自做事再拼在一起。問題是這三個模組的參數不互通,老太太在電話那頭停頓,換話輪偵測器說停了,代理就插嘴,讓人抓狂。Shawn 說,要真正解決這個問題,必須把它們融合成一個模型:讓語言模型直接接收音訊串流,邊聽邊預測第一個 token——這個 token 就是換話輪訊號,便宜又快。說完之後再輸出文字回應(不輸出語音,因為企業需要文字層面的控管),最後才輸出轉錄稿,因為轉錄稿不影響回應速度,放最後生成就好。引文的輸出讓企業能夠查核代理用了哪一條知識庫資料做依據——這是他說的IO 合約創新,架構本身不稀奇,但輸入輸出的設計決定了企業能不能實際用。
◎企業要的是強如人,控如機器,這兩件事本來就矛盾
企業客戶開出的條件很清楚:要有品牌專屬聲音,要能精確念出品牌名稱,要像最好的人類客服一樣聰明,同時要像機器一樣百分之百照規定走。Shawn 說這根本就是互相矛盾的期待,而且採用曲線一直很難爬,因為衡量基準是最優秀的人類員工,不是比上一代 IVR 系統好。他們現在的做法是讓語音代理做前台,背後企業自己的系統做決策,語音代理只負責回應快,溝通順,複雜任務往後送。等客戶用一陣子,真正看到效率差距,接受度才會上來。另一個反直覺的發現:最表現自然的聲音不是標準美式英語,反而是帶一點法語腔的英語——那點不完美讓人覺得像真人。
◎生產瓶頸已從生成移到審核,這個問題還沒有解法
Shawn 說了一句很直白的話:瓶頸已經從產生內容轉移到驗證和審核內容。他的工程師從年初就在抱怨,程式碼多到看不完,又不敢讓代理自己做 code review,怕合併進去的東西出問題。他們的大型公用事業客戶昨天還在要求,未來所有 PR 合併前要有兩週審核期,每一筆都要可追蹤。Shawn 的回應是在平台上加視覺化元件,讓企業能看到代理走了哪些流程,呼叫了哪些工具,每個回應引用了哪條資料。他也直說,用 AI 產生一堆文字丟給同事,自己沒讀就送出去,這是組織裡現在真實在發生的問題,而且還沒有好的產品解方。
語音 AI 不是文字 AI 加個麥克風。三十年前大家以為搜尋解決了就解決了,後來發現推薦又是另一個問題;現在語音把物理世界的複雜度端了進來,時間,噪音,情緒,信任,每一樣都得重新算。Shawn 給的不是願景,是在真實客服中心燒出來的工程賬單。企業在語音代理的下一步,不是看誰的 demo 最漂亮,而是看誰能把審核,可追蹤,品牌聲音和低延遲同時做到。現在大多數人還在解第一題。
說明為什麼語音比文字難:語音多了時間這個維度,進入物理世界,機器需要的是 adaptation 而非 reasoning,這是根本差異。
解釋為何選擇自建模型:Frontier Labs 的模型為消費者 demo 優化,不為企業的真實對話換話輪場景優化,兩者目標不同。
詳細說明端對端語音模型架構:音訊串流輸入,換話輪 token 優先生成,文字輸出(不輸出語音),最後才生成轉錄稿,以及引文機制如何讓企業可追蹤回應來源。
討論延遲工程:換話輪預測是主要瓶頸,自主推理要受延遲預算約束,等待後端時用鍵盤打字聲或保留音樂填補靜音,避免用戶以為系統當掉。
說明品牌聲音策略:客戶普遍不喜歡通用聲音,因為通用聲音讓人聯想到舊 IVR 系統而立刻失去信任;帶一點地區口音的聲音反而表現最好。
指出組織內容生產瓶頸:瓶頸已從生成移到審核,工程師抱怨程式碼多到看不完,AI 產出的文字未經閱讀就轉發同事,是當前真實的組織問題。
預測語音 AI 未來十年走向:換話輪必須完全端對端;企業語音和消費者語音將分叉成兩條產品路線;IoT 裝置可能帶動第二波硬體浪潮。
看完今天的,讓明天的自己送上門
每天精選 6 則要聞、一則產業名人訪談,五分鐘跟上。
已出刊 128 期 ・ 隨時可退訂

