強化語種判別可縮小多語言語音模型的單語差距
多語言自監督語音模型在總預訓練資料預算相同的情況下,表現仍不如單語模型。研究發現,在預訓練階段強化模型區分語言的能力,可縮小這一多語言差距,並在部分連續語音學與更高層語言學指標上將其消除,同時保留大量跨語言資訊共享。實驗採用受控的英語/法語 HuBERT 設定,測試了兩種強化語言判別的干預手段,其中一種是輔助語言任務。
找到 5 筆
多語言自監督語音模型在總預訓練資料預算相同的情況下,表現仍不如單語模型。研究發現,在預訓練階段強化模型區分語言的能力,可縮小這一多語言差距,並在部分連續語音學與更高層語言學指標上將其消除,同時保留大量跨語言資訊共享。實驗採用受控的英語/法語 HuBERT 設定,測試了兩種強化語言判別的干預手段,其中一種是輔助語言任務。
Gemini API 於 2026 年 9 月 15 日讓兩款音訊到音訊模型正式可用(GA):gemini-3.8-live 與 gemini-3.8-live-extended-thinking,均通過 Live API 服務即時語音應用。前者是低延遲語音代理與即時對話的預設選擇,無推理延遲,支援交錯推理、預設非同步函式呼叫和完整會話客戶端內容更新。後者是高推理模型,可在即時音訊互動中做後臺推理,適合需要更強後臺推理的場景。
Google 推出 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS 兩款文字轉語音模型,是 Gemini 迄今最有表現力的音訊生成模型,已在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids 上線。
Google 在 2026 年 9 月 22 日的 Gemini API 更新中,將 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS 兩款文字轉語音模型正式 GA,並新增 /v1beta/voices 端點。旗艦款 gemini-3.8-flash-tts 主打錄音棚級音質、細膩表演、地區口音與長時多輪穩定;
Google 9 月發布新前沿模型 Gemini 4 Argon,擁有業界領先的 100 萬 token 輸出上限,面向編碼、網路安全防禦、金融研究與法律起草等重負載任務;目前僅通過 Fairwind Program 向受信任的網路安全防禦者開放,尚未放開給開發者、企業和消費者。