Google 將音樂生成模型 Lyria 3.5 正式開放
Google 於 2026 年 9 月 3 日把下一代音樂生成模型 lyria-3.5 轉為正式可用(GA)。它支援文字與影像輸入,可生成整首歌曲,音樂連貫性與人聲自然度提升,並支援對時長和結構的細粒度控制,輸出 44.1 kHz 立體聲。開發者可在 Gemini API 的 Music generation 指南中檢視詳情與程式碼示例。
找到 5 筆
Google 於 2026 年 9 月 3 日把下一代音樂生成模型 lyria-3.5 轉為正式可用(GA)。它支援文字與影像輸入,可生成整首歌曲,音樂連貫性與人聲自然度提升,並支援對時長和結構的細粒度控制,輸出 44.1 kHz 立體聲。開發者可在 Gemini API 的 Music generation 指南中檢視詳情與程式碼示例。
Ai2 開源了 8B 的科學報告生成模型 AstaBrief,可把研究問題和檢索到的文獻片段直接寫成帶引用的報告。它已在 Asta 的 Generate a report 功能中以 Fast mode 上線,與 Claude 驅動的 Thinking mode 並列:Fast mode 平均 51.1 秒生成一份報告,Thinking mode 為 178.5 秒,快約 3.5 倍。模型基於 Qwen3-8B,用 SFT 加 DPO 訓練,一次成稿,跳過了片段摘要與聚類環節。
Google 推出 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS 兩款文字轉語音模型,是 Gemini 迄今最有表現力的音訊生成模型,已在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids 上線。
Meta Superintelligence Labs 發布首個媒體生成模型 Muse Image,並預覽 Muse Video。Muse Image 今天已在 Meta AI app、meta.ai、美國 Instagram Stories 和部分國家 WhatsApp 上線,Facebook 即將推出;它能呼叫搜尋與編碼工具、自我反思改進,並隨測試時計算提升質量。
研究證明,離散擴散(含 remasking 與 uniform-state 取樣器)的某一步只有在所寫入位置在已固定 token 條件下相互獨立時,才與訓練分佈一致;任何 per-position 分佈的乘積都無法匹配存在依賴的一組 token。文中指出畫素、音素、詞等常見領域的 token 之間存在固有依賴,而這類取樣器每步會寫入多個 token 位置,每個位置從各自的 per-position 分佈取樣,並依據同一批分佈決定寫入哪些位置。