搜尋 關鍵字 語意 找到 16 筆
Google DeepMind blog● 精選 9/23 16:25 AI 評分75
Google 推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 兩款文字轉語音模型,可在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids 中使用。Flash TTS 支援用自然語言從零設計音色、30 秒樣本復刻聲音,覆蓋 100 多種語言,並可在 Hume AI 語音設計基準上以 71.4 分居首;Flash-Lite TTS 面向高併發、低成本場景。
X @karpathy7/21 17:53 AI 評分38
Karpathy 表示,與 LLM 協作時一個有用的模式是進行長時間語音漫談。當 LLM 需要更多資訊才能理解目標、而打字又太麻煩時,他會切換到 /voice 語音模式,用約 10 分鐘進行雜亂無章的意識流表達,有時會提前宣告「切換到語音識別,抱歉有錯別字」,有時則變成幾輪小訪談。他認為 LLM 很擅長重構冗長不連貫的漫談,其回顯往往比原始想法更清晰,從而改善心智融合、減少後續糾正。
Gemini API release notes● 精選 9/15 01:00 AI 評分85
Google 於 2026 年 9 月 15 日宣布 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款音訊到音訊模型正式可用(GA),面向 Live API 的即時語音應用。前者是低延遲語音代理與即時對話的預設選項,支援交錯推理、預設非同步函式呼叫和完整會話客戶端內容更新;後者支援即時音訊互動中的後臺推理,適合需要更高後臺推理能力的場景。
Apple Machine Learning Research10/2 01:00 AI 評分55
研究顯示,在相同預訓練資料預算下,多語言自監督語音模型仍落後於單語模型。作者在英語/法語 HuBERT 受控設定中測試兩種強化語言判別的干預,發現可縮小甚至在某些指標上消除這一差距,同時保留大量跨語言共享。
Gemini API release notes● 精選 9/22 01:00 AI 評分75
Google 於 2026 年 9 月 22 日宣布 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS 兩款語音模型正式可用,同時上線 Gemini API Voices 端點(/v1beta/voices)。旗艦版 gemini-3.8-flash-tts 面向工作室級音質、細膩表演、地區方言與長文字多輪穩定性;
X @OpenAIDevs10/5 23:51 AI 評分37
OpenAI 開發者帳號發布 Codex CLI 演示影片,展示三種終端內用法:用語音啟動任務、跨多個專案管理 agent,以及在獨立 worktree 中並行探索另一條實現方向。推文未提及這些能力的上線時間、版本號或可用範圍。
Google DeepMind blog● 精選 9/24 17:20 AI 評分85
Google 推出 Gemini 3.8 Live with Live Avatar,在原生即時對話模型上加入近即時影片生成,讓 AI 能聽、能看、能說並帶動態虛擬形象。該功能即日起在 Gemini Enterprise 上線,支援 97 種語言的原生語音到語音同步,唇形與表情可隨語言切換自適應。它支援非同步工具呼叫,可在對話不中斷的情況下後臺取數,輸出內容統一嵌入 SynthID 水印;自訂虛擬形象目前僅通過企業白名單開放。
r/LocalLLaMA top of the day10/3 05:10 AI 評分43
開源工具 mlsubgen 可在本機為影片生成 45 種語言字幕,僅支援 Linux 與 NVIDIA 顯示卡。它按每段語音檢測語言而非整檔案,同時執行兩個語音識別器並用本地 LLM 調和,且優先使用內嵌字幕軌(含藍光 PGS 點陣圖 OCR),無字幕時才聽音訊。模型佔用 30–65 GB 儲存,需 16–32 GB 記憶體,作者在 24 GB RTX A5000 上實測,純聽音訊時約每個目標語言耗時接近即時。
OpenAI Codex changelog9/18 01:00 AI 評分45
ChatGPT for iOS 發布 1.2026.251 版本,新增在檔案選擇器中直接建立資料夾,並加入寫作塊功能,支援草稿備選與複製操作。任務方面,新建任務會記住每個專案的 worktree 模式與設定環境,排隊提示改為緊湊預覽、點選展開,並修復了重開任務後排隊提示丟失或過時的問題。此外還改進了語音通話在連線中斷時的穩定性,以及 iPad 上專案、環境和 Git 控制元件的對齊。
Google AI blog● 精選 10/2 16:00 AI 評分85
Google 在 9 月發布新一代前沿模型 Gemini 4 Argon,具備先進推理能力與 100 萬 token 輸出上限,目前通過 Fairwind Program 向受信任的網路安全防禦方分階段開放。
Hacker News front page10/3 13:02 AI 評分20
Great Question 正在招聘首位加拿大遠端產品工程師,年薪 15 萬至 18 萬加元,要求 6 年以上經驗。該崗位負責全棧開發,涵蓋 Rails API、React/TypeScript 前端、即時語音 agent 與 agentic 搜尋,需日常使用 Claude Code、Codex 或 Cursor 等 agentic 編碼工具。
Hugging Face blog● 精選 9/30 01:00 AI 評分75
Hugging Face 於 2026 年 9 月 30 日發布 Open TTS Leaderboard,用 WER/CER、RTFx、TTFA 和說話人相似度等客觀指標評估開源 TTS 模型,評估耗時從數週縮短到數小時。榜單覆蓋多語言與聲音克隆,英文 WER 領先的是 Kokoro-82M、supertonic-3 和 s2-pro,多語言表現較強的是 OmniVoice、s2-pro 和 Fun-CosyVoice3-0.5B-2512。
Qwen blog● 精選 9/18 10:30 AI 評分79
Qwen3.8-LiveTranslate 採用 Interleave 架構,將同傳平均延遲(LAAL)從上一代的 2.8 秒降至 2.3 秒,並新增即時說話人分離、雙語同屏同步輸出與長上下文消歧三項能力。模型基於 Hybrid-MoE 的 Thinker–Talker 雙模組設計,支援 60 種語言的音訊輸入與文字輸出、29 種語言的語音輸出,可通過 DashScope API 接入,會話配置即可啟用說話人分離與原文譯文同步返回,無需單獨呼叫 ASR 介面。
r/LocalLLaMA top of the day10/3 00:18 AI 評分27
r/LocalLLaMA 社群討論過去一週的 jev 模型熱潮是否該翻篇,並分享實際用例。有使用者用 jev 做論文證據定位和倉庫惡意行為掃描,也有使用者將其接入語音桌遊引擎,用 decider 4b 替代 Gemma 雙階段流程後延遲從 4-8 秒降至 2-3 秒。但有人實測 jev 及同類模型準確率持續低於 80%,而 Qwen 3.8 27B 達 95%、100b+ 模型達 100%。
Hacker News front page10/3 14:34 AI 評分73
美國亞利桑那州一名路怒殺人犯的 10 年刑期被上訴法院撤銷,原因是量刑時播放了受害者家屬用 AI 生成的受害者影片。2021 年 Gabriel Paul Horcasitas 在紅燈口槍殺 37 歲的 Christopher Pelkey,其家人用語音、影片和照片合成 AI 版 Pelkey 在法庭上發言。上訴法院認為該 AI 影片呈現的是受害者妹妹的想像,而非記錄真實事件,因此越界,55 歲的 Horcasitas 須重新量刑。
Meta AI blog10/2 22:11 AI 評分42
匹茲堡大學人類工程研究實驗室(HERL)在 ARPA-H 最高 4150 萬美元資助下推進 RAMMP 輔助機器人專案,採用 Meta 開源視覺模型 DINO 與 SAM。團隊將 DINOv3 和 SAM 部署到電池供電的邊緣裝置上,通過降低記憶體佔用、使用低精度和高效批處理來保證即時執行,原型已能識別自動門按鈕、杯子和路緣。該功能面向美國約 550 萬輪椅使用者,目前正進入真實環境測試,並加入語音與觸控互動。