AISpot

搜尋

找到 16 筆

Google DeepMind blog● 精選9/23 16:25AI 評分75

Google 發布 Gemini 3.8 Flash TTS 語音模型

Google 推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 兩款文字轉語音模型,可在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids 中使用。Flash TTS 支援用自然語言從零設計音色、30 秒樣本復刻聲音,覆蓋 100 多種語言,並可在 Hume AI 語音設計基準上以 71.4 分居首;Flash-Lite TTS 面向高併發、低成本場景。

X @karpathy7/21 17:53AI 評分38

Karpathy 分享用 LLM 的語音長談技巧

Karpathy 表示,與 LLM 協作時一個有用的模式是進行長時間語音漫談。當 LLM 需要更多資訊才能理解目標、而打字又太麻煩時,他會切換到 /voice 語音模式,用約 10 分鐘進行雜亂無章的意識流表達,有時會提前宣告「切換到語音識別,抱歉有錯別字」,有時則變成幾輪小訪談。他認為 LLM 很擅長重構冗長不連貫的漫談,其回顯往往比原始想法更清晰,從而改善心智融合、減少後續糾正。

Gemini API release notes● 精選9/15 01:00AI 評分85

Gemini 3.8 Live 兩款即時語音模型正式可用

Google 於 2026 年 9 月 15 日宣布 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款音訊到音訊模型正式可用(GA),面向 Live API 的即時語音應用。前者是低延遲語音代理與即時對話的預設選項,支援交錯推理、預設非同步函式呼叫和完整會話客戶端內容更新;後者支援即時音訊互動中的後臺推理,適合需要更高後臺推理能力的場景。

Google DeepMind blog● 精選9/24 17:20AI 評分85

Introducing Gemini 3.8 Live with Live Avatar

Google 推出 Gemini 3.8 Live with Live Avatar,在原生即時對話模型上加入近即時影片生成,讓 AI 能聽、能看、能說並帶動態虛擬形象。該功能即日起在 Gemini Enterprise 上線,支援 97 種語言的原生語音到語音同步,唇形與表情可隨語言切換自適應。它支援非同步工具呼叫,可在對話不中斷的情況下後臺取數,輸出內容統一嵌入 SynthID 水印;自訂虛擬形象目前僅通過企業白名單開放。

r/LocalLLaMA top of the day10/3 05:10AI 評分43

mlsubgen 本地生成 45 種語言字幕,僅支援 Linux 與 NVIDIA

開源工具 mlsubgen 可在本機為影片生成 45 種語言字幕,僅支援 Linux 與 NVIDIA 顯示卡。它按每段語音檢測語言而非整檔案,同時執行兩個語音識別器並用本地 LLM 調和,且優先使用內嵌字幕軌(含藍光 PGS 點陣圖 OCR),無字幕時才聽音訊。模型佔用 30–65 GB 儲存,需 16–32 GB 記憶體,作者在 24 GB RTX A5000 上實測,純聽音訊時約每個目標語言耗時接近即時。

OpenAI Codex changelog9/18 01:00AI 評分45

ChatGPT iOS 版更新:支援資料夾與寫作塊

ChatGPT for iOS 發布 1.2026.251 版本,新增在檔案選擇器中直接建立資料夾,並加入寫作塊功能,支援草稿備選與複製操作。任務方面,新建任務會記住每個專案的 worktree 模式與設定環境,排隊提示改為緊湊預覽、點選展開,並修復了重開任務後排隊提示丟失或過時的問題。此外還改進了語音通話在連線中斷時的穩定性,以及 iPad 上專案、環境和 Git 控制元件的對齊。

Hacker News front page10/3 13:02AI 評分20

YC 系 AI 使用者研究平台 Great Question 招聘加拿大遠端產品工程師

Great Question 正在招聘首位加拿大遠端產品工程師,年薪 15 萬至 18 萬加元,要求 6 年以上經驗。該崗位負責全棧開發,涵蓋 Rails API、React/TypeScript 前端、即時語音 agent 與 agentic 搜尋,需日常使用 Claude Code、Codex 或 Cursor 等 agentic 編碼工具。

Hugging Face blog● 精選9/30 01:00AI 評分75

Hugging Face 推出開源 TTS 排行榜,用客觀指標評估多語言與聲音克隆

Hugging Face 於 2026 年 9 月 30 日發布 Open TTS Leaderboard,用 WER/CER、RTFx、TTFA 和說話人相似度等客觀指標評估開源 TTS 模型,評估耗時從數週縮短到數小時。榜單覆蓋多語言與聲音克隆,英文 WER 領先的是 Kokoro-82M、supertonic-3 和 s2-pro,多語言表現較強的是 OmniVoice、s2-pro 和 Fun-CosyVoice3-0.5B-2512。

Qwen blog● 精選9/18 10:30AI 評分79

Qwen3.8-LiveTranslate: Names the speaker. Carries the meaning.

Qwen3.8-LiveTranslate 採用 Interleave 架構,將同傳平均延遲(LAAL)從上一代的 2.8 秒降至 2.3 秒,並新增即時說話人分離、雙語同屏同步輸出與長上下文消歧三項能力。模型基於 Hybrid-MoE 的 Thinker–Talker 雙模組設計,支援 60 種語言的音訊輸入與文字輸出、29 種語言的語音輸出,可通過 DashScope API 接入,會話配置即可啟用說話人分離與原文譯文同步返回,無需單獨呼叫 ASR 介面。

r/LocalLLaMA top of the day10/3 00:18AI 評分27

LocalLLaMA 討論 jev 分類模型的實際使用體驗

r/LocalLLaMA 社群討論過去一週的 jev 模型熱潮是否該翻篇,並分享實際用例。有使用者用 jev 做論文證據定位和倉庫惡意行為掃描,也有使用者將其接入語音桌遊引擎,用 decider 4b 替代 Gemma 雙階段流程後延遲從 4-8 秒降至 2-3 秒。但有人實測 jev 及同類模型準確率持續低於 80%,而 Qwen 3.8 27B 達 95%、100b+ 模型達 100%。

Hacker News front page10/3 14:34AI 評分73

美法院因 AI 受害者影片撤銷路怒殺人犯刑期

美國亞利桑那州一名路怒殺人犯的 10 年刑期被上訴法院撤銷,原因是量刑時播放了受害者家屬用 AI 生成的受害者影片。2021 年 Gabriel Paul Horcasitas 在紅燈口槍殺 37 歲的 Christopher Pelkey,其家人用語音、影片和照片合成 AI 版 Pelkey 在法庭上發言。上訴法院認為該 AI 影片呈現的是受害者妹妹的想像,而非記錄真實事件,因此越界,55 歲的 Horcasitas 須重新量刑。

Meta AI blog10/2 22:11AI 評分42

Meta 開源視覺模型 DINO 與 SAM 用於匹茲堡大學輔助機器人

匹茲堡大學人類工程研究實驗室(HERL)在 ARPA-H 最高 4150 萬美元資助下推進 RAMMP 輔助機器人專案,採用 Meta 開源視覺模型 DINO 與 SAM。團隊將 DINOv3 和 SAM 部署到電池供電的邊緣裝置上,通過降低記憶體佔用、使用低精度和高效批處理來保證即時執行,原型已能識別自動門按鈕、杯子和路緣。該功能面向美國約 550 萬輪椅使用者,目前正進入真實環境測試,並加入語音與觸控互動。