AISpot

Kimi

10月4日星期日 · 1 則

  1. 量子位AI 評分43

    AI 崗位 FDE 走紅:月薪 5 萬,海外年薪中位 134 萬

    FDE(前線部署工程師)成為當下最火的 AI 崗位,國內大廠開出月薪三五萬,海外公開薪資中位數約 20 萬美元(約 134 萬元人民幣)。Anthropic 計劃投資 1 億美元到 2027 年底培訓 1 萬名 FDE,OpenAI 投 40 億美元成立部署公司,AWS 拿出 10 億美元組建 FDE 部門。從業者稱溝通需求佔工作時間七成以上,開發僅約三成,核心工作是把企業業務梳理成 Ontology 再開發應用。

10月3日星期六 · 3 則

  1. Hugging Face blogAI 評分55

    微軟發布 ThinkingBox,按資料庫終態給 AI agent 打分

    微軟與 Hugging Face 聯合發布 ThinkingBox,通過 Hugging Face 提供,用 507 個有狀態業務流程、每個任務重複 20 次來評測 agent 留下的後端狀態與副作用,而非只看工具呼叫和最終回覆。在 121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨結束並呼叫了改狀態的工具、未報錯。

  2. r/LocalLLaMA top of the dayAI 評分53

    r/LocalLLaMA 熱議低位元量化對編碼任務的影響

    r/LocalLLaMA 上一則帖子引發討論:FP8/BF16 使用者看到有人跑 IQ1_S 量化感到震驚。多位使用者指出,IQ1/IQ2 這類極端量化只適合創意寫作或閒聊,用於編碼、複雜邏輯推理或結構化 JSON 提取時困惑度飆升、語法和邏輯明顯崩壞;而 Q4_K_M 或 Q5_K_M 通常是多數模型的甜點區,困惑度曲線相對平坦、視訊記憶體佔用大幅下降且推理能力幾乎無損。

  3. r/LocalLLaMA top of the dayAI 評分22

    使用者討論對 Kimi K3.5 的期待

    有使用者在 Reddit 發帖討論對 Kimi K3.5 的期待,並回顧了 Kimi 系列模型的進展。發帖人稱 Kimi K2 已經不錯,K2.5 通過持續學習階段提升到全新水平,據其記憶使用了超過 20-25T tokens;他同時表示 K3 是令人驚歎的模型,因此好奇 K3.5 會有多強。帖子未給出 K3.5 的發布時間、引數或功能細節。

10月2日星期五 · 7 則

  1. Kimi blog● 精選AI 評分83

    Kimi K2.6 開源,主打長程編碼與 agent swarm

    Kimi K2.6 已開源,可通過 Kimi.ai、Kimi App、API 和 Kimi Code 使用,主打長程編碼、長時間執行與 agent swarm。官方稱其在內部 Kimi Code Bench 上較 K2.5 顯著提升:一個案例是在 Mac 上用 Zig 實現並最佳化推理,4000+ 次工具呼叫、連續執行 12 小時、14 輪迭代後吞吐從約 15 升至約 193 tokens/sec,比 LM Studio 快約 20%;

  2. Kimi blog● 精選AI 評分82

    Kimi K3 發布:2.8T 引數開放模型,支援 100 萬 token 上下文

    Kimi K3 是首個開放的 3T 級模型,2.8T 引數,帶原生視覺能力和 100 萬 token 上下文視窗,今日已在 Kimi.ai、Kimi Work、Kimi Code 和 Kimi API 上線,預設使用 max thinking effort,低/高 effort 模式後續推出。完整模型權重將於 2026 年 7 月 27 日前發布。官方稱其整體效能仍落後於 Claude Fable 5 和 GPT 5.6 Sol,但在自家評測套件上達到前沿水平;

  3. Kimi blog● 精選AI 評分65

    Kimi 團隊開源 WorldVQA 多模態視覺世界知識基準

    Kimi 團隊開源 WorldVQA,一個用 3500 組影像-問題對衡量多模態大模型視覺世界知識事實正確性的基準。資料分 9 大類,36% 中文、64% 英文,並區分常見(Head)與長尾(Tail)知識,全部經過多階段人工校驗。測試顯示前沿模型長尾題準確率常低於 50%,且普遍過度自信:表現最好的 Kimi-K2.5 校準誤差 ECE 為 37.9%、斜率 0.550,距理想值仍有明顯差距。資料集與評測指令碼已開源。

  4. Kimi blog● 精選AI 評分65

    Kimi 推出 Agent Swarm,最多並行排程 100 個子代理

    Kimi 發布 Agent Swarm,Kimi K2.5 最多可並行部署 100 個子代理、執行 1500 次以上工具呼叫,出結果比序列執行快 4.5 倍。它不只是多代理協作,而是讓模型自行組建有分工的組織:自己決定何時並行、招誰、如何委派,適合大規模檢索、批次下載、多檔案處理與多視角分析。

  5. Kimi blog● 精選AI 評分65

    Kimi Team 發布 PerceptionBench,評估 MLLM 原子視覺感知

    Kimi Team 發布 PerceptionBench,一個把視覺感知拆成原子能力來評估的 MLLM 基準。它從 42 個基準的前沿模型失敗中歸納出 10 類原子感知能力,構造併發布 3,000 道已驗證題(內部池 17,000+),60% 來自模型失敗分解,40% 新寫,覆蓋視覺關係、計數、屬性、深度與 3D、定位、比較、細粒度識別、上下文整合、OCR、幻覺。測試 16 個前沿 MLLM,無一達到 60% 準確率,幻覺平均是最弱能力;總分接近的模型在具體感知上可能差異很大。

  6. 量子位AI 評分52

    openJiuwen 首發 X-Router 自演進模型路由,實測省 50%+ Token

    openJiuwen 首發 X-Router 自演進模型路由技術,按任務複雜度在本地與雲端模型池中動態選模型,實測減少 50%+ Token 消耗。該平台由華為 2012 實驗室、華為雲等團隊聯合高校與企業建置,主打昇騰親和,路由分三層:優於 1 分鐘重新整理的模型能力畫像、結合 KV 快取親和與即時負載的啟發式決策、用 Contextual Bandit 與輕量強化學習做反饋自演進,樣本不足時保留原判定。

  7. Latent Space● 精選AI 評分67

    Latent Space 播客:MIT 的 Alex Zhang 談 RLM 與 agent swarm

    Latent Space 最新一期播客請到 MIT 的 Alex Zhang,聊遞迴語言模型(RLM)、AI 寫 GPU kernel 與多智慧體 swarm。據他介紹,基於 RLM 的 harness 是首個接近解出 ARC-AGI-3 的方案,早於 OpenAI 的 Astra;他還談到 OpenAI 的 1 萬 agent、1300 億輸出 token、約合 4000 萬美元的問題求解實驗。

9月22日星期二 · 2 則

9月9日星期三 · 1 則

8月19日星期三 · 1 則

8月11日星期二 · 1 則

7月21日星期二 · 1 則

2月12日星期四 · 1 則

  1. MLX LM releases● 精選AI 評分84

    v0.30.7 發布:修復 Kimi Linear、DeepSeek V3.2,新增 GLM5 與 Qwen3.5

    2026 年 2 月 12 日發布的 v0.30.7 修復了 Kimi Linear 與 DeepSeek V3.2 的 indexer 和權重載入問題,並加快 DSV32 生成速度。這一版新增 GLM5、不含視覺能力的 Qwen3.5 系列與 LongCat MLA 支援,LFM2 模型可用 Pythonic 方式呼叫工具,另加入 Mistral 工具解析器。訓練流程中的驗證集改為可選,還有一項為下一版本提號的版本號變更。

2月4日星期三 · 1 則