AI 崗位 FDE 走紅:月薪 5 萬,海外年薪中位 134 萬
FDE(前線部署工程師)成為當下最火的 AI 崗位,國內大廠開出月薪三五萬,海外公開薪資中位數約 20 萬美元(約 134 萬元人民幣)。Anthropic 計劃投資 1 億美元到 2027 年底培訓 1 萬名 FDE,OpenAI 投 40 億美元成立部署公司,AWS 拿出 10 億美元組建 FDE 部門。從業者稱溝通需求佔工作時間七成以上,開發僅約三成,核心工作是把企業業務梳理成 Ontology 再開發應用。
FDE(前線部署工程師)成為當下最火的 AI 崗位,國內大廠開出月薪三五萬,海外公開薪資中位數約 20 萬美元(約 134 萬元人民幣)。Anthropic 計劃投資 1 億美元到 2027 年底培訓 1 萬名 FDE,OpenAI 投 40 億美元成立部署公司,AWS 拿出 10 億美元組建 FDE 部門。從業者稱溝通需求佔工作時間七成以上,開發僅約三成,核心工作是把企業業務梳理成 Ontology 再開發應用。
微軟與 Hugging Face 聯合發布 ThinkingBox,通過 Hugging Face 提供,用 507 個有狀態業務流程、每個任務重複 20 次來評測 agent 留下的後端狀態與副作用,而非只看工具呼叫和最終回覆。在 121,680 次有效試驗中,79,853 次未通過可執行檢查,其中 67.24% 仍乾淨結束並呼叫了改狀態的工具、未報錯。
r/LocalLLaMA 上一則帖子引發討論:FP8/BF16 使用者看到有人跑 IQ1_S 量化感到震驚。多位使用者指出,IQ1/IQ2 這類極端量化只適合創意寫作或閒聊,用於編碼、複雜邏輯推理或結構化 JSON 提取時困惑度飆升、語法和邏輯明顯崩壞;而 Q4_K_M 或 Q5_K_M 通常是多數模型的甜點區,困惑度曲線相對平坦、視訊記憶體佔用大幅下降且推理能力幾乎無損。
有使用者在 Reddit 發帖討論對 Kimi K3.5 的期待,並回顧了 Kimi 系列模型的進展。發帖人稱 Kimi K2 已經不錯,K2.5 通過持續學習階段提升到全新水平,據其記憶使用了超過 20-25T tokens;他同時表示 K3 是令人驚歎的模型,因此好奇 K3.5 會有多強。帖子未給出 K3.5 的發布時間、引數或功能細節。
Kimi K2.6 已開源,可通過 Kimi.ai、Kimi App、API 和 Kimi Code 使用,主打長程編碼、長時間執行與 agent swarm。官方稱其在內部 Kimi Code Bench 上較 K2.5 顯著提升:一個案例是在 Mac 上用 Zig 實現並最佳化推理,4000+ 次工具呼叫、連續執行 12 小時、14 輪迭代後吞吐從約 15 升至約 193 tokens/sec,比 LM Studio 快約 20%;
Kimi K3 是首個開放的 3T 級模型,2.8T 引數,帶原生視覺能力和 100 萬 token 上下文視窗,今日已在 Kimi.ai、Kimi Work、Kimi Code 和 Kimi API 上線,預設使用 max thinking effort,低/高 effort 模式後續推出。完整模型權重將於 2026 年 7 月 27 日前發布。官方稱其整體效能仍落後於 Claude Fable 5 和 GPT 5.6 Sol,但在自家評測套件上達到前沿水平;
Kimi 團隊開源 WorldVQA,一個用 3500 組影像-問題對衡量多模態大模型視覺世界知識事實正確性的基準。資料分 9 大類,36% 中文、64% 英文,並區分常見(Head)與長尾(Tail)知識,全部經過多階段人工校驗。測試顯示前沿模型長尾題準確率常低於 50%,且普遍過度自信:表現最好的 Kimi-K2.5 校準誤差 ECE 為 37.9%、斜率 0.550,距理想值仍有明顯差距。資料集與評測指令碼已開源。
Kimi 發布 Agent Swarm,Kimi K2.5 最多可並行部署 100 個子代理、執行 1500 次以上工具呼叫,出結果比序列執行快 4.5 倍。它不只是多代理協作,而是讓模型自行組建有分工的組織:自己決定何時並行、招誰、如何委派,適合大規模檢索、批次下載、多檔案處理與多視角分析。
Kimi Team 發布 PerceptionBench,一個把視覺感知拆成原子能力來評估的 MLLM 基準。它從 42 個基準的前沿模型失敗中歸納出 10 類原子感知能力,構造併發布 3,000 道已驗證題(內部池 17,000+),60% 來自模型失敗分解,40% 新寫,覆蓋視覺關係、計數、屬性、深度與 3D、定位、比較、細粒度識別、上下文整合、OCR、幻覺。測試 16 個前沿 MLLM,無一達到 60% 準確率,幻覺平均是最弱能力;總分接近的模型在具體感知上可能差異很大。
openJiuwen 首發 X-Router 自演進模型路由技術,按任務複雜度在本地與雲端模型池中動態選模型,實測減少 50%+ Token 消耗。該平台由華為 2012 實驗室、華為雲等團隊聯合高校與企業建置,主打昇騰親和,路由分三層:優於 1 分鐘重新整理的模型能力畫像、結合 KV 快取親和與即時負載的啟發式決策、用 Contextual Bandit 與輕量強化學習做反饋自演進,樣本不足時保留原判定。
Latent Space 最新一期播客請到 MIT 的 Alex Zhang,聊遞迴語言模型(RLM)、AI 寫 GPU kernel 與多智慧體 swarm。據他介紹,基於 RLM 的 harness 是首個接近解出 ARC-AGI-3 的方案,早於 OpenAI 的 Astra;他還談到 OpenAI 的 1 萬 agent、1300 億輸出 token、約合 4000 萬美元的問題求解實驗。
Kimi 將原 Kimi WebBridge 更名為 Kimi Browser Extension,現已在 Chrome Web Store 和官網開放使用。使用者在瀏覽器側邊欄可與 Kimi 對話,讓它瀏覽網站、填寫表單並完成任務;重複性任務可錄製一次操作步驟並儲存為技能,下次由 Kimi 自動執行。
月之暗面的 Kimi K3 已在 Amazon Bedrock 上線,可用於編碼、文件分析和長時 agent 工作流,並支援顯式 prompt caching。使用者可沿用 Bedrock 的訪問、加密與審計控制,通過 AWS 官方模型卡文件開始接入。
Kimi Work 現已上線 Remote Control 功能。使用者只需讓 Kimi Work 在電腦上保持執行,就能通過手機繼續推進任務,實現隨時隨地工作。目前官方未公布支援的具體平台、連線方式與使用限制。
Moonshot 旗下 Kimi Work 發布第二期教程,演示三類投資研究任務:搭建即時投資者儀表盤、在電子表格中更新財務模型、批次處理並生成報告。教程由官方帳號 @Kimi_Moonshot 於 2026 年 8 月 19 日發布,官方表示後續還會推出更多 Kimi Work 工作流。
月之暗面的 Kimi K3 模型現已在 Databricks 平台上線。這是該模型在 Databricks 上的正式可用狀態,具體呼叫方式、定價與區域限制原文未披露。
Awni Hannun 指出,蘋果每年向 Google 支付約十億美元使用 Gemini,而他認為可以免費獲得更好的模型,即 GLM 5.2 以及即將發布的 Kimi K3。這條推文只對比了付費與免費模型,未說明蘋果為何選擇 Gemini,也未給出效能資料或發布時間。
2026 年 2 月 12 日發布的 v0.30.7 修復了 Kimi Linear 與 DeepSeek V3.2 的 indexer 和權重載入問題,並加快 DSV32 生成速度。這一版新增 GLM5、不含視覺能力的 Qwen3.5 系列與 LongCat MLA 支援,LFM2 模型可用 Pythonic 方式呼叫工具,另加入 Mistral 工具解析器。訓練流程中的驗證集改為可選,還有一項為下一版本提號的版本號變更。
MLX LM 發布 v0.30.6,新增 Kimi-K2.5、LongCat Flash/Lite 和 Step 3.5 Flash 等模型支援,並引入 Transformers v5。服務端加入分散式推理,支援 chat_template_kwargs、top_logprobs 與載入自訂模型,同時新增 CLI。