DeepSeek V4.1-Flash 將 KV cache 壓縮至前代四分之一
DeepSeek 公布 V4.1-Flash 的 KV cache 相比上一代只需 1/4 的 HBM 和 1/8 的 SSD 儲存。官方指出快取命中費用常佔 agent 成本很大比例,壓縮快取可顯著降低這部分開銷。
找到 11 筆
DeepSeek 公布 V4.1-Flash 的 KV cache 相比上一代只需 1/4 的 HBM 和 1/8 的 SSD 儲存。官方指出快取命中費用常佔 agent 成本很大比例,壓縮快取可顯著降低這部分開銷。
DeepSeek 上線 V4.1-Flash,採用 552B 引數 MoE 與新的因果編解碼架構,輸入僅 8B、輸出 16B 啟用引數,原生支援視覺理解。官方稱其基準成績超過旗艦 V4-Pro,KV cache 只需上代 1/4 的 HBM 和 1/8 的 SSD 儲存。
Mistral AI 稱 Mistral Large 4 在 AutomationBench 上完成 657 個業務工作流,成績領先 Kimi K3、MiMo-V2.6-Pro 與 DeepSeek V4 Pro。該基準的任務跑在模擬辦公應用中,涵蓋 Gmail、Google Sheets、Slack 與 Salesforce 四個工具。帖文未披露具體分數、評測日期與配置細節。
DeepSeek 於 2026 年 9 月 10 日 04:00 UTC 起啟用 V4.1-Flash 的新 API 價格,官方稱其架構更高效,能以更低成本服務更多使用者並把節省讓利給使用者。定價繼續區分高峰與非高峰時段,非高峰費率為高峰的 50%,彈性任務可安排到非高峰時段以節省成本。
位元組 Seed 團隊發現,DeepSeek-V4 系列在 128K 長上下文檢索中的準確率會隨目標資訊的位置以 4 個 Token 為週期起伏,同一條資訊換個位置最多相差 40.2 個百分點,V4-Pro-Base 也有 34.8 個百分點。原因指向其為省記憶體採用的分塊 KV Cache 壓縮:資訊在壓縮視窗內所處相位不同,檢索能力就出現系統性差異,團隊稱之為相位敏感性,並用基於 Qwen3-0.6B 自訓的多種分塊壓縮模型復現了同樣的週期。
聯想天禧 AI 自研程式碼智慧體框架 TianxiCode 配合 DeepSeek-v4.1-Flash,在 SWE-bench-Live(Lite 分榜)以 71% 的問題解決率位列全球第一,並通過官方 Verified 核驗。該評測基於真實 GitHub 專案問題與可復現執行環境,官方會審查全鏈路智慧體執行軌跡並排查答案、測試用例洩露。
Pi 1.0.3 發布,Azure 提供商從 azure-openai-responses 更名為 azure,並開始支援 Azure Foundry Chat Completions 部署,首個模型為 azure/deepseek-v4-pro。
DeepSeek 官方表示將與開源社群緊密合作,為 V4.1-Flash 提供推理支援,並探索更多部署方案。官方同時提出可承接 2000 塊 GPU 加儲存叢集的大規模部署需求,並附上模型與論文連結。
DeepSeek 在 API 上線 V4.1-Flash,原生支援多模態,呼叫時把模型設為 deepseek-flash 即可。V4-Flash 與 V4-Flash-Vision-Exp 已退役,舊模型名暫時路由到 V4.1-Flash 以保持相容。多方測試顯示 V4.1-Flash 在效能、成本、速度和總執行時間上均優於 V4-Pro,V4-Pro 正被淘汰;
輝達援引 SemiAnalysis AgentX 資料稱,Vera Rubin NVL72 每兆瓦吞吐量超過 GB300 NVL72 的 30 倍,在 DeepSeek V4 Pro 上每百萬 token 成本最多低 45 倍。輝達以「高產、耐用、通用」概括 AI 工廠回報邏輯:每兆瓦 token 數決定收益,A100 出貨六年後仍在商用,CoreWeave 已將 2020 年首批裝置的預訂延長至 2029 年。
DeepSeek 彈性計算團隊大量招聘,尤其需要資深工程師,併發布技術報告《DeepSeek 彈性計算(DSec):面向大規模 Agent 訓練的沙盒基礎設施》。DSec 支撐 DeepSeek-V4 全部訓練、評測和資料預處理,單個分片約 160 臺伺服器、3 萬 CPU 核心、250TB 記憶體,每天服務約 300 萬個沙盒,高峰線上超 38 萬個,每秒建立 5000 多個。團隊接下來要把 Agent 執行環境的數量和種類擴充成百上千倍。