位元組 Seed 發現 DeepSeek-V4 準確率隨輸入位置週期性波動
位元組 Seed 團隊發現,DeepSeek-V4 系列在 128K 長上下文檢索中的準確率會隨目標資訊的位置以 4 個 Token 為週期起伏,同一條資訊換個位置最多相差 40.2 個百分點,V4-Pro-Base 也有 34.8 個百分點。原因指向其為省記憶體採用的分塊 KV Cache 壓縮:資訊在壓縮視窗內所處相位不同,檢索能力就出現系統性差異,團隊稱之為相位敏感性,並用基於 Qwen3-0.6B 自訓的多種分塊壓縮模型復現了同樣的週期。
首次給出 DeepSeek-V4 表現隨輸入位置週期性波動的機制解釋,並提出按壓縮相位分別評測的方法,對使用或評測其長上下文能力的開發者最有用。
原標題:字节找到了DeepSeek时强时弱的原因
閱讀原文
| 評分 | 84 / 78(平均 81,門檻 65) |
|---|---|
| 狀態 | 精選 |
相關報導
DeepSeek 4.1 Flash 為何未引業界震動,HN 熱議
有文章提出疑問:DeepSeek 4.1 Flash 為何沒有讓業界感到震動。該文在 Hacker News 上獲得 158 分、127 條評論,討論熱度並不低。原文未披露該模型的引數、定價、基準測試等具體資訊。
DeepSeek 彈性計算團隊擴招,披露 DSec 沙盒基礎設施
DeepSeek 彈性計算團隊大量招聘,尤其需要資深工程師,併發布技術報告《DeepSeek 彈性計算(DSec):面向大規模 Agent 訓練的沙盒基礎設施》。DSec 支撐 DeepSeek-V4 全部訓練、評測和資料預處理,單個分片約 160 臺伺服器、3 萬 CPU 核心、250TB 記憶體,每天服務約 300 萬個沙盒,高峰線上超 38 萬個,每秒建立 5000 多個。團隊接下來要把 Agent 執行環境的數量和種類擴充成百上千倍。
DeepSeek Harness 更新,加入 Claude Code Mods 相容層
DeepSeek Harness 發布 v0.2.1-alpha.1,新增實驗性 Claude Code Mods 相容層,讓按 Claude Code Mods 介面編寫的擴充套件有機會接入 DSH 外掛系統執行。官方稱該相容層主要用於驗證 Mods API 能力,大致屬於 DSH 外掛能力的子集,暫不提供完整實用相容性;diff、agents-md、sec-default 和 telemetry 仍標註為不可執行。
Mistral Large 4 在 AutomationBench 領先 Kimi K3、DeepSeek V4 Pro
Mistral AI 稱 Mistral Large 4 在 AutomationBench 上完成 657 個業務工作流,成績領先 Kimi K3、MiMo-V2.6-Pro 與 DeepSeek V4 Pro。該基準的任務跑在模擬辦公應用中,涵蓋 Gmail、Google Sheets、Slack 與 Salesforce 四個工具。帖文未披露具體分數、評測日期與配置細節。
DeepSeek 發布 Harness 桌面版,支援 macOS 與 Windows
DeepSeek 官方推出 DeepSeekHarness 的打包桌面版本,覆蓋 macOS 與 Windows 兩個平台。Linux 使用者可通過 npm 上的 @deepseek-ai/dsh 包獲取。官方在社交帳號上公布了這一訊息,並給出下載地址 deepseek.com/harness。