AISpot

搜尋

找到 5 筆

Apple Machine Learning Research10/2 01:00AI 評分33

強化語種判別可縮小多語言語音模型的單語差距

多語言自監督語音模型在總預訓練資料預算相同的情況下,表現仍不如單語模型。研究發現,在預訓練階段強化模型區分語言的能力,可縮小這一多語言差距,並在部分連續語音學與更高層語言學指標上將其消除,同時保留大量跨語言資訊共享。實驗採用受控的英語/法語 HuBERT 設定,測試了兩種強化語言判別的干預手段,其中一種是輔助語言任務。

Gemini API release notes● 精選9/15 01:00AI 評分61

Gemini API 兩款即時語音模型正式可用

Gemini API 於 2026 年 9 月 15 日讓兩款音訊到音訊模型正式可用(GA):gemini-3.8-live 與 gemini-3.8-live-extended-thinking,均通過 Live API 服務即時語音應用。前者是低延遲語音代理與即時對話的預設選擇,無推理延遲,支援交錯推理、預設非同步函式呼叫和完整會話客戶端內容更新。後者是高推理模型,可在即時音訊互動中做後臺推理,適合需要更強後臺推理的場景。

Google AI blog● 精選10/2 16:00AI 評分68

Google 發布 Gemini 4 Argon,100 萬 token 輸出上限

Google 9 月發布新前沿模型 Gemini 4 Argon,擁有業界領先的 100 萬 token 輸出上限,面向編碼、網路安全防禦、金融研究與法律起草等重負載任務;目前僅通過 Fairwind Program 向受信任的網路安全防禦者開放,尚未放開給開發者、企業和消費者。