DeepSeek 宣布與開源社群合作支援 V4.1-Flash 推理
DeepSeek 表示將與開源社群緊密合作,為 V4.1-Flash 提供推理支援,並探索更多部署選項。官方同時放出模型與論文連結,並稱可承接 2000 塊 GPU 加儲存叢集的大規模部署需求。
DeepSeek 表示將與開源社群緊密合作,為 V4.1-Flash 提供推理支援,並探索更多部署選項。官方同時放出模型與論文連結,並稱可承接 2000 塊 GPU 加儲存叢集的大規模部署需求。
DeepSeek 發布 V4.1-Flash,採用更高效架構,API 價格下調,新價格於 2026 年 9 月 10 日 04:00 UTC 生效。繼續實行峰谷定價,低谷費率為高峰的 50%,彈性工作負載可安排在低谷時段以節省成本。
DeepSeek 在 API 上線 V4.1-Flash,原生支援多模態,模型名設為 deepseek-flash。V4-Flash 與 V4-Flash-Vision-Exp 已退役,舊名暫時路由到新模型;多方測試稱 V4.1-Flash 在效能、成本、速度和總執行時間上均超過 V4-Pro,V4-Pro 正被淘汰。
DeepSeek 發布 V4.1-Flash,其 KV cache 相比上一代只需 1/4 的 HBM 和 1/8 的 SSD 儲存。官方指出快取命中費用常佔 agent 成本很大比例,壓縮快取可顯著降低這部分開銷。
Mistral AI 在 2026 年 9 月 8 日發文稱,其開放權重模型、產品與基礎設施讓組織能自主選擇 AI 的執行方式和位置,而不只是獲得模型訪問權。Mistral 表示這能帶來前沿效能,同時避免供應商鎖定。完整內容見其官網新聞頁。
Awni Hannun 稱 Qwen 27B dense 模型在 M5 Max 上輸出速度達 105 tok/s,並形容這一表現相當驚人。他同時表示這是在“一塊磚一塊磚地”突破記憶體牆。原文未說明所用推理框架、量化精度與上下文長度。
Google 於 2026 年 9 月 3 日把下一代音樂生成模型 lyria-3.5 轉為正式可用(GA)。它支援文字與影像輸入,可生成整首歌曲,音樂連貫性與人聲自然度提升,並支援對時長和結構的細粒度控制,輸出 44.1 kHz 立體聲。開發者可在 Gemini API 的 Music generation 指南中檢視詳情與程式碼範例。
智譜(Zai)宣布 GLM-5.3 開放權重,可下載、本地執行並自行定製,官方稱這是其面向 agentic coding 與網路防禦能力最強的模型。權重已發布在 Hugging Face 的 zai-org/GLM-5.3 頁面,技術細節見 z.ai/blog/glm-5.3。原文未公布引數規模、許可證型別與硬體要求。
智譜(Zai_org)宣布 GLM-5.3 的模型權重將於 2026 年 8 月 28 日發布,Hugging Face 頁面已給出下載地址。這是繼此前訊息之後的又一進展,權重開放意味著可以本地部署與自行量化。目前官方只給出發布時間和連結,未說明許可證、引數規模與硬體要求。
月之暗面的 Kimi K3 模型現已在 Databricks 平台上線。這是該模型在 Databricks 上的正式可用狀態,具體呼叫方式、定價與區域限制原文未披露。
NVIDIA 的 30B 總引數(3B 啟用)開源模型 Nemotron 3.5 Lightning 已上線 Ollama,可完全在本地裝置執行。它採用混合 MoE 架構,支援最長 1M token 上下文,並用多 token 預測、DFlash 或 DSpark 投機解碼,吞吐達同類開源模型 4 倍、任務完成時間快 30%,面向呼叫工具、跑測試、檢索程式碼庫等長時 agent 任務。
Muse Glimmer 現已在 Ollama 上線,這是 Meta Superintelligence Labs 發布的首個開放模型。它是 30B 多模態模型,專為本地執行的 agent 工作負載設計,上下文 128K 以上,採用 Apache 2.0 許可,可直接驅動 Claude Code、Codex、Pi、OpenClaw 等。
Meta 發布 30B 開源模型 Muse Glimmer,Apache 2.0 許可,即日起可在 LM Studio Bionic 本地執行,Mac 與 PC 均可。它支援多步 agent 任務、工具呼叫與影像輸入,在 LM Studio 內部評測 BionicBench v0.1 的 18 項任務中完成率 83.3%,高於 Gemma 4 31B 和 Qwen 3.6 27B 的 77.7%。
Karpathy 給 Opus 5 輸入《魔戒》第一段、100 萬 token 預算(約 10 美元),讓它用 three.js 渲染這個故事。Opus 5 執行約 2 小時,寫出 5500 行程式碼,程式化生成了粗糙但可玩的 3D 場景。他指出這類任務沒人願意手工做,但 LLM 有無限耐心,成本近乎免費;同時也暴露 LLM 無法原生高效感知影片或玩遊戲,只能緩慢截圖自查,導致不少瑕疵。
Awni Hannun 指出,蘋果每年向 Google 支付約十億美元使用 Gemini,而他認為可以免費獲得更好的模型,即 GLM 5.2 以及即將發布的 Kimi K3。這條推文只對比了付費與免費模型,未說明蘋果為何選擇 Gemini,也未給出效能資料或發布時間。
2026 年 2 月 12 日發布的 v0.30.7 修復了 Kimi Linear 與 DeepSeek V3.2 的 indexer 和權重載入問題,並加快 DSV32 生成速度。這一版新增 GLM5、不含視覺能力的 Qwen3.5 系列與 LongCat MLA 支援,LFM2 模型可用 Pythonic 方式呼叫工具,另加入 Mistral 工具解析器。訓練流程中的驗證集改為可選,還有一項為下一版本提號的版本號變更。
MLX LM 發布 v0.30.6,新增 Kimi-K2.5、LongCat Flash/Lite 和 Step 3.5 Flash 等模型支援,並引入 Transformers v5。服務端加入分散式推理,支援 chat_template_kwargs、top_logprobs 與載入自訂模型,同時新增 CLI。