Kimi 瀏覽器擴充套件發布,可錄製步驟存為技能
Kimi 將原 Kimi WebBridge 更名為 Kimi Browser Extension,現已在 Chrome Web Store 和官網開放使用。使用者在瀏覽器側邊欄可與 Kimi 對話,讓它瀏覽網站、填寫表單並完成任務;重複性任務可錄製一次操作步驟並儲存為技能,下次由 Kimi 自動執行。
找到 13 筆
Kimi 將原 Kimi WebBridge 更名為 Kimi Browser Extension,現已在 Chrome Web Store 和官網開放使用。使用者在瀏覽器側邊欄可與 Kimi 對話,讓它瀏覽網站、填寫表單並完成任務;重複性任務可錄製一次操作步驟並儲存為技能,下次由 Kimi 自動執行。
月之暗面的 Kimi K3 模型現已在 Databricks 平台上線。這是該模型在 Databricks 上的正式可用狀態,具體呼叫方式、定價與區域限制原文未披露。
月之暗面的 Kimi K3 已在 Amazon Bedrock 上線,可用於編碼、文件分析和長時 agent 工作流,並支援顯式 prompt caching。使用者可沿用 Bedrock 的訪問、加密與審計控制,通過 AWS 官方模型卡文件開始接入。
Kimi Work 現已上線 Remote Control 功能。使用者只需讓 Kimi Work 在電腦上保持執行,就能通過手機繼續推進任務,實現隨時隨地工作。目前官方未公布支援的具體平台、連線方式與使用限制。
Moonshot 旗下 Kimi Work 發布第二期教程,演示三類投資研究任務:搭建即時投資者儀表盤、在電子表格中更新財務模型、批次處理並生成報告。教程由官方帳號 @Kimi_Moonshot 於 2026 年 8 月 19 日發布,官方表示後續還會推出更多 Kimi Work 工作流。
Kimi K2.6 已開源,可通過 Kimi.ai、Kimi App、API 和 Kimi Code 使用,主打長程編碼、長時間執行與 agent swarm。官方稱其在內部 Kimi Code Bench 上較 K2.5 顯著提升:一個案例是在 Mac 上用 Zig 實現並最佳化推理,4000+ 次工具呼叫、連續執行 12 小時、14 輪迭代後吞吐從約 15 升至約 193 tokens/sec,比 LM Studio 快約 20%;
Kimi K3 是首個開放的 3T 級模型,2.8T 引數,帶原生視覺能力和 100 萬 token 上下文視窗,今日已在 Kimi.ai、Kimi Work、Kimi Code 和 Kimi API 上線,預設使用 max thinking effort,低/高 effort 模式後續推出。完整模型權重將於 2026 年 7 月 27 日前發布。官方稱其整體效能仍落後於 Claude Fable 5 和 GPT 5.6 Sol,但在自家評測套件上達到前沿水平;
Kimi 發布 Agent Swarm,Kimi K2.5 最多可並行部署 100 個子代理、執行 1500 次以上工具呼叫,出結果比序列執行快 4.5 倍。它不只是多代理協作,而是讓模型自行組建有分工的組織:自己決定何時並行、招誰、如何委派,適合大規模檢索、批次下載、多檔案處理與多視角分析。
MLX LM 發布 v0.30.6,新增 Kimi-K2.5、LongCat Flash/Lite 和 Step 3.5 Flash 等模型支援,並引入 Transformers v5。服務端加入分散式推理,支援 chat_template_kwargs、top_logprobs 與載入自訂模型,同時新增 CLI。
Kimi 團隊開源 WorldVQA,一個用 3500 組影像-問題對衡量多模態大模型視覺世界知識事實正確性的基準。資料分 9 大類,36% 中文、64% 英文,並區分常見(Head)與長尾(Tail)知識,全部經過多階段人工校驗。測試顯示前沿模型長尾題準確率常低於 50%,且普遍過度自信:表現最好的 Kimi-K2.5 校準誤差 ECE 為 37.9%、斜率 0.550,距理想值仍有明顯差距。資料集與評測指令碼已開源。
2026 年 2 月 12 日發布的 v0.30.7 修復了 Kimi Linear 與 DeepSeek V3.2 的 indexer 和權重載入問題,並加快 DSV32 生成速度。這一版新增 GLM5、不含視覺能力的 Qwen3.5 系列與 LongCat MLA 支援,LFM2 模型可用 Pythonic 方式呼叫工具,另加入 Mistral 工具解析器。訓練流程中的驗證集改為可選,還有一項為下一版本提號的版本號變更。
Kimi Team 發布 PerceptionBench,一個把視覺感知拆成原子能力來評估的 MLLM 基準。它從 42 個基準的前沿模型失敗中歸納出 10 類原子感知能力,構造併發布 3,000 道已驗證題(內部池 17,000+),60% 來自模型失敗分解,40% 新寫,覆蓋視覺關係、計數、屬性、深度與 3D、定位、比較、細粒度識別、上下文整合、OCR、幻覺。測試 16 個前沿 MLLM,無一達到 60% 準確率,幻覺平均是最弱能力;總分接近的模型在具體感知上可能差異很大。
Awni Hannun 指出,蘋果每年向 Google 支付約十億美元使用 Gemini,而他認為可以免費獲得更好的模型,即 GLM 5.2 以及即將發布的 Kimi K3。這條推文只對比了付費與免費模型,未說明蘋果為何選擇 Gemini,也未給出效能資料或發布時間。