Google 於 10 月 6 日在 Gemini API release notes 宣布 Nano Banana 2.1(gemini-nano-banana-2.1)正式 GA,機器之心與量子位分別在 10 月 7 日、10 月 10 日報導。該模型定位高效率影像生成與對話式編輯,是 gemini-3.1-fla… 看完整事件
Google 發布 Nano Banana 2.1 生圖模型,4K 直出並降價
Google 發布新一代生圖模型 Nano Banana 2.1,可 4K 直出,並升級蒙版編輯、背景替換與主體一致性。據 Arena 評測,其文生圖、多圖編輯與單圖編輯三項功能平均提升約 61.7 分,文生圖排名第四,僅次於 GPT。API 價格上,1K、2K 圖片生成價格減半,4K 降價約 25%;已上線 Gemini App、Google AI Studio,每天贈送 50 積分,開發者可用 gemini-nano-banana-2.1 接入付費 API。
官方確認 4K 直出與 API 降價,Arena 三項編輯能力平均提升約 61.7 分,中文渲染明顯改善;對用生圖 API 做商單的設計師與開發者最有用,水印疊加 Bug 則是連續改圖前需知的限制。
原標題:Nano Banana终于2.1了!4K直出,中文进步太明显
閱讀原文
| 評分 | 90 / 85(平均 87,門檻 65) |
|---|---|
| 狀態 | 精選 |
相關報導
阿里開源 Qwen-Image-2.1-Turbo:8 步去噪出圖與編輯
阿里發布 Qwen-Image-2.1-Turbo,這是基於 Qwen-Image-2.1 的加速 checkpoint,只需 8 步去噪即可生成和編輯影像,權重已在 ModelScope 與 Hugging Face 開放。它沿用同一 7B 視覺生成架構,官方稱步數減少不犧牲品質,仍可從文字生成 2K 影像,並支援用自然語言繼續編輯,例如新增配飾或更換場景。Diffusers 中載入 QwenImage21Pipeline 即可使用推薦的 8 步取樣;
Google 取消 Gemini Flash 與 Pro 模型免費使用
Google 將停止 Gemini Flash 和 Pro 模型的免費使用,使用者需付費訂閱才能繼續使用。此舉在 r/GeminiAI 社群引發大量討論,使用者對 Flash 被納入付費範圍尤為不滿,認為 Flash-Lite 能力不足。部分使用者表示將轉向 ChatGPT、Claude 或 DeepSeek 等替代方案。
Vidu Q4 Preview 發布:0.09 元/秒起,支援 15 張參考圖
生數科技推出影片模型 Vidu Q4 Preview,是其面向創作者的首個預覽版本,首發價格 0.09 元/秒起,同樣預算最高可生成 5 倍內容。該版本主打人物演繹、鏡頭語言與複雜視效,支援最多 15 張參考圖、3 段參考音訊輸入,以及 2K、4K 畫質輸出。官方資料顯示其圖生影片速度約為同類模型的 2 倍,5 秒影片最快約 110 秒完成,正式版上線時間尚未公布。
Google 發布 EmbeddingGemma 2,740M 引數開源端側多模態嵌入模型
Google DeepMind 發布 EmbeddingGemma 2,一個 Apache 2.0 許可、740M 引數的開源端側多模態嵌入模型,基於 Gemma 4 架構,把文字、程式碼、影像、音訊與影片對映到同一嵌入空間。它按需模組化:純文字最低 270M 引數,另有 170M 視覺與 300M 音訊編碼器;MRL 支援把 768 維向量截斷到 128 維,本地儲存最多省 6 倍。
Google 上線 SynthID 網站,任何人都能驗證 AI 生成內容
Google 週二上線 SynthID 驗證網站,任何人可上傳圖片、影片或音訊,檢查是否為 AI 生成。該工具此前只向部分記者、媒體從業者和研究人員開放測試,現已全面開放,支援 JPG、PNG、HEIC、MP4、MP3、WAV 等十餘種格式。SynthID 自 2023 年推出,Google 的 Nano Banana、Veo、Lyria 模型以及 Gemini、Flow、Vids 等生成工具都會為產出加水印,OpenAI、Nvidia、Kakao 也已支援。