PolyAI CTO:語音 AI 尚未迎來 ChatGPT 時刻
企業語音 AI 平台 PolyAI 的 CTO Shawn Wen 在 HumanX 大會上表示,儘管全雙工語音模型已經問世,語音 AI 仍未迎來自己的「ChatGPT 時刻」,下一步挑戰是讓推理足夠快、對話足夠自然。Otter 的 CMO Alex Gay 認為說話人識別、意圖捕捉並結合組織知識是走向自動化的關鍵,Otter 還在研發可代表個人參會的數字分身,其輸出語音需具備與人對話時的情感表達。
依意思最接近的 24 筆
企業語音 AI 平台 PolyAI 的 CTO Shawn Wen 在 HumanX 大會上表示,儘管全雙工語音模型已經問世,語音 AI 仍未迎來自己的「ChatGPT 時刻」,下一步挑戰是讓推理足夠快、對話足夠自然。Otter 的 CMO Alex Gay 認為說話人識別、意圖捕捉並結合組織知識是走向自動化的關鍵,Otter 還在研發可代表個人參會的數字分身,其輸出語音需具備與人對話時的情感表達。
Splice CEO Kakul Srivastava 認為 AI 生成的郵件正在扼殺對話。她曾任職於 Flickr、Yahoo、GitHub 和 Adobe,目前執掌為音樂製作人提供取樣素材的 Splice,該平台的取樣曾出現在 Lisa 的《Money》和 Sabrina Carpenter 的《Espresso》等熱門歌曲中。她還主導了 Splice 收購 Spitfire Audio 並推動平台向新領域拓展。
Whistle 是一個 16.9 MB 的單檔案端側語音識別模型,無依賴、在 CPU 上執行,與 Needle 共用同一套 C++ 引擎。它支援英語、德語、法語、西班牙語、義大利語、荷蘭語和波蘭語,單次最多處理 30 秒 16 kHz 單聲道音訊,可自動檢測語種,並輸出逐詞時間戳與語音嵌入。
阿布扎比技術創新研究院(TII)發布 1.6B 引數的語音識別模型 Falcon-ASR,主打阿拉伯語與阿聯酋方言,同一套權重還支援英語、法語、西班牙語和葡萄牙語。在六個阿拉伯語測試集上,它取得 20.92% 的平均詞錯率,比其所用榜單快照中最佳公開結果 23.17% 低 2.25 個百分點;內部阿聯酋方言評測為 22.73% WER、10.19% CER,比次優的 Qwen3-Omni 低 4.07 個百分點。
越來越多 AI 助手不再需要單獨下載 App,直接用 iMessage、RCS 或簡訊就能對話並代辦任務。其中 Instinct 於 2026 年 9 月完成 10 億美元融資、估值達 100 億美元,並開始給使用者分配助手專屬信箱地址、上線代打電話功能,目前仍處私測。其餘選項裡,Folk 免費、Pro 訂閱 8.33 美元/月,Comma 開源且免費起步,Fambot 主打家庭日程並每晚推送次日摘要,Martin 訂閱 21 美元/月起。
ElevenLabs 正式上線 OpenRouter,提供 9 個文字轉語音模型和 2 個語音轉文字模型。已通過 OpenRouter 呼叫語言模型的應用,用同一個 OpenRouter API key 呼叫 POST /api/v1/audio/speech 與 POST /api/v1/audio/transcriptions 即可獲得語音能力,無需另購 ElevenLabs 套餐。
Google DeepMind 宣布 SynthID Detector 現已向所有人開放,可用來判斷網上內容是否由 AI 生成。該工具除 Google AI 外,還支援檢測 OpenAI、NVIDIA、Kakao 等行業夥伴工具生成的內容,Apple 即將加入。使用者可通過 synthid.com 試用。
Napster 聯合創始人 Sean Parker 正把 Stability AI 重塑為面向音樂專業人士的 AI 工具公司。兩年前他參與 8000 萬美元救助這家瀕臨崩潰的影像生成初創公司,如今與 CEO Prem Akkaraju 公布新方向。8 月底公司宣布獲得 7600 萬美元融資,投資方包括索尼、華納和環球,三家還授權曲庫用於訓練。
Google 週二上線 SynthID 驗證網站,任何人可上傳圖片、影片或音訊,檢查是否為 AI 生成。該工具此前只向部分記者、媒體從業者和研究人員開放測試,現已全面開放,支援 JPG、PNG、HEIC、MP4、MP3、WAV 等十餘種格式。SynthID 自 2023 年推出,Google 的 Nano Banana、Veo、Lyria 模型以及 Gemini、Flow、Vids 等生成工具都會為產出加水印,OpenAI、Nvidia、Kakao 也已支援。
The Verge 刊文指出,隨著 AI 硬體的出現,科技公司正在重新定義什麼才算「錄製」。過去帶麥克風或攝像頭的裝置基本只有開與關兩種狀態:麥克風採集聲音、攝像頭採集影像,資料先儲存在裝置上,有時再上傳雲端處理,這些被保留下來的時間切片就是錄製。文章認為這一定義正被打破,並援引 Bloomberg 記者 Mark Gurman 上週的報導,稱 Apple 正在開發一款智慧家居產品。
Cal AI 聯合創始人 Zach Yadegari 為其新 AI agent 公司 Persona 融資 1000 萬美元,Vine Ventures 領投。Persona 是一款個人 AI 助理,配套 179 美元的可穿戴手環,靠按鍵或甩腕啟用而非全程錄音,預計 12 月發售;目前已免費 beta 形式在 iMessage 上執行,積累了數千名使用者,手環預售收入達五位數。
ChatGPT 現已支援上傳音訊檔案,可生成轉寫文字、總結錄音內容,並針對音訊內容提問,例如把會議、訪談或講座整理成結構化筆記或跟進郵件草稿。使用方式是在對話中附上受支援的音訊檔案並說明需求。該功能面向付費 ChatGPT 訂閱與工作空間開放,可用性受工作空間設定、地區、客戶端版本和模型影響;轉寫可能出錯,不同語言表現也會有差異。
a16z 合夥人 Olivia Moore 發布消費者 AI 百強應用報告:ChatGPT 仍遙遙領先,Suno、ElevenLabs 等中小產品展現出持久力。報告發現社交、約會、電商、旅遊、金融、健康等類別在百強榜上完全沒有產品入選,美國也僅 2.2% 的家庭為 AI 付費。
美國北卡羅萊納州 54 歲的 Michael Smith 用 AI 生成歌曲並配合上萬機器人刷量,從音樂流媒體平台竊取數百萬美元,被判 18 個月監禁。美國司法部稱,他是首位因 AI 輔助流媒體欺詐被刑事起訴的美國人。該騙局在 2024 年首次被起訴前已執行七年未被發現,Smith 已認罪。
美國總統川普本週召集扎克伯格、貝索斯、馬斯克、Dario Amodei 等 AI 高管,簽署《前沿責任聯合承諾》,並以行政令方式將官方用語從「人工智慧」改為「超級智慧」。該承諾完全自願、不具法律約束力,川普稱其「道德上有約束力」,協議文字還把 United States 拼錯。播客嘉賓認為這更像一次 AI 的重新包裝,而非實質監管。
一篇 10 月 10 日發布的評論文章認為,當前前沿生成式 AI 仍只是被高度增強的隨機鸚鵡,無法具備智慧判斷,因此應拒絕「AI」這一命名及其被兜售的敘事。作者從美國視角批評 Anthropic、OpenAI 等公司誇大能力,把「威脅人類」與「必須領先中國」的話術捆綁,用於自我牟利。文章還稱該技術至多是既有風險的加速器,例如病原體研究與威權監控,真正危險來自使用者而非模型本身。
BBC 報導稱,AI 生成內容激增正催生所謂「人類溢價」,即人們更看重由人創作的藝術。音樂平台 Deezer 表示,其上傳曲目中 44% 由 AI 生成,調查顯示 97% 的聽眾無法分辨 AI 與人類作品,但超過半數受訪者仍在意創作者是不是人。學界正推動設立類似「公平貿易」的「人類製造」統一標識,已有書籍、電影和專輯封面標註「AI-free」。
OpenAI CEO Sam Altman 在 2026 年 10 月 1 日發帖表示,使用者應當能夠在任何需要的地方使用自己的 AI 訂閱。該表態未說明具體產品、實施方式或時間表,也未提及是否涉及跨平台或第三方應用。
Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。
Anthropic 宣布投入 1 億美元,通過 Claude Frontier Academy 培養 10000 名 Frontier Deployed Engineers,目標在 2027 年底前完成。首批學員來自埃森哲、貝恩、凱捷、澳大利亞聯邦銀行、德勤、麥肯錫、摩根士丹利和諾和諾德等企業。按人數計算,人均培訓投入約 1 萬美元。
過去幾週,川普試圖給人工智慧改寫稱呼:把 artificial 變成貶義標籤,把他希望加速發展的技術稱為 super,並把反對者稱作 THE ENEMY,一些 AI 界知名人物已跟隨這一說法。他此前曾靠 Little Marco、Crooked Hillary 等綽號打擊對手,並把 fake news 變成對整個媒體的貶稱。The Verge 的報導認為,這次改名嘗試看上去相當做作,在語言上難以成立。
Artificial Analysis 最新文生影片榜單中,影視公司 Utopai Studios 的模型 Utopai X 以 1150 分位列第二,與第一名阿里 Wan 3.0 僅差 7 分,據福布斯估算其估值約 10 億美元。該榜單由評審在不知道模型名字的情況下盲投產生;Utopai X 以 MiniMax 開源的影片模型 H3 為底子做後訓練,10 項能力中有 7 項比基座更接近頂尖水平,音訊同步、運鏡控制與物理提升最明顯。
企業一度鼓勵員工儘可能多地使用 AI,即所謂的 #tokenmaxxing,隨後賬單隨之而來。報導援引一項針對近 400 家企業的調查稱,其中只有 11% 能準確預測自己的 AI 支出。AI 使用量以 token 計量,而企業發現 token 很難統計,這讓 AI 預算幾乎無法編制。
白宮本週召集扎克伯格、貝索斯、馬斯克與 Anthropic 的 Dario Amodei 等主要科技公司 CEO,簽署了一份被川普稱為“道德約束力”的 AI 安全承諾。川普同時簽署行政令,正式將 AI 重新命名為“超級智慧”。與此同時,Meta 與 OpenAI 正在為各自的 AI 產品塑造更友好的形象。