Mistral 發布企業級程式設計助手 Mistral Code,開放私有測試
Mistral AI 於 6 月 4 日發布企業級 AI 程式設計助手 Mistral Code,基於開源專案 Continue 建置,現已面向 JetBrains IDE 和 VSCode 開放私有測試,正式版即將推出。
找到 30 筆
Mistral AI 於 6 月 4 日發布企業級 AI 程式設計助手 Mistral Code,基於開源專案 Continue 建置,現已面向 JetBrains IDE 和 VSCode 開放私有測試,正式版即將推出。
據 The Information 報導,Meta 和微軟正在減少員工對 Claude 的依賴,推動開發者轉向自家 AI 工具。Meta 內部 Claude Code 活躍使用者從 6 萬降至 3 萬,減少 50%,由自研的 Muse Code 和 MetaCode 補位,最近一個 28 天週期在 Claude Code 上花費超 1.05 億美元。
微軟推出 FrogNano-4B-2609,一個面向低視訊記憶體裝置的程式設計智慧體模型,基於 Qwen3.5-4B 後訓練而來。其額外訓練為純文字、聚焦倉庫級軟體工程,用約 1500 個合成 SWE 任務環境和基於可執行測試的獎勵做強化學習,不依賴更強模型的解題軌跡蒸餾。模型需配合 Leaf 工具框架生成結構化工具呼叫,產出的補丁須經人工審查、迴歸測試與安全驗證後才能使用。
一位有基礎程式設計經驗的使用者稱,用 Opus 5.5 在約兩打提示詞內完成了一整款遊戲,包括玩法、畫面、音效與音樂,全程未寫一行程式碼;模型還能自寫測試、最佳化速度並修復觀察到的 bug。在室內導航對比中,Opus 5.5 的掃描與追蹤準確,Astra 開箱即用效果差,評分約 2/10 對 9/10。該使用者也指出 Claude 常提示工具使用過多或任務未完成,且超出額度後無法繼續使用。
量子位發文吐槽,Fable、Sol 等與 Coding 沾邊的模型普遍輸出「15/15 全綠」「單腿啞火」這類黑話。文中分析,除 Coding 過擬合外,更主要的原因是廠商為省 Token 把思維鏈壓縮成「穴居人語」,OpenAI 最早這麼做,同樣一句話的 Token 消耗比白話文少 70%;Claude 自 Opus 4.6 起也開始如此。作者稱最新 Opus 5.5 語言能力回升明顯,而 Gemini 因輸出風格正常、排版層級清晰,被社群視為少數還能正常溝通的 AI。
@Zai_org 宣布 GLM-5.3 已在 Amazon Bedrock 上線,企業使用者可通過該平台呼叫。官方稱其為企業帶來更強的程式設計與 agentic 能力,並附上 AWS 文件中的模型卡連結作為接入入口。除上線渠道與能力定位外,本次未披露定價、上下文長度、可用區域等細節。
一位開發者撰文稱,AI 輔助程式設計(vibecoding)只把樂趣前置:能快速做出可用原型,但重構和維護階段不再有趣,也缺少手寫程式碼帶來的成就感。他把建造的樂趣分為六種,認為 vibecoding 只能滿足「想到點子」「把點子變成現實」和「解決自己的問題」三類,攻堅後的成就感、作品完成的滿足感與學習樂趣都不會自然產生。他仍用 AI 做出了一些手工做不出來的東西,包括即時野火預警系統、Kobo 資料庫遷移助手和即時音準訓練應用,但表示過程不像自己寫小指令碼那樣好玩。
OpenAI 開發者官方帳號 @OpenAIDevs 發布推文,展示了一個在 DevDay 期間做出的復古太空遊戲。推文正文只有這一句描述,未說明使用的模型、開發工具、實現方式,也未提到是否可試玩或開源。
LLM 從零將 TypeScript 編譯器移植為 Rust 版 tsc-rs 併發布,Claude Opus 5.5 用兩週、約 24,047 美元 API 費用完成;此前用 OpenAI 的 GPT-5.6 Sol 與 GPT 6 Astra 花掉逾 40 萬美元仍未突破約 84% 相容度。
Anthropic 官方帳號宣布推出 Claude Haiku 5.5。官方稱該模型在編碼、computer use 與知識工作三類任務上,相比 Haiku 4.5 有顯著提升。目前公布的資訊僅此一句對比結論,未提及價格、上下文長度、開放平台或具體評測資料。
一名 Reddit 使用者反映其非程式設計團隊每月 Claude 賬單高達數千美元,認為同事在模型選擇和上下文組織上效率低下。該使用者預算有限、自身花費不高,希望找到最佳化 Claude 用法的參考資料,並打算為團隊製作一份簡短速查表。
Artcraft 宣布從可控 AI 影像編輯轉向,一次推出七款開源應用,復刻 Adobe 的 Photoshop、Illustrator、Premiere、Lightroom、After Effects、InDesign 與 Acrobat Pro 的介面和工具。開發者 Brandon Thomas 稱這些「淨室替代品」由 Anthropic 的 Claude Opus 5.5 生成,用 Rust 編寫,並提供可在瀏覽器執行的 WebAssembly 版本。
一位寫了 18 年程式碼的開發者表示,自去年在 Claude Code 中使用 Opus 4.5 後,用自然語言描述需求比手寫程式碼更快,於是徹底停止了手寫程式碼。他所在的 Filestage 團隊月合併 PR 從約 200 增至 300,bug 報告未增加,每位開發者每月 AI 訂閱費 20 美元,工具可自選 Codex、Claude Code 或 Cursor。
Meta Superintelligence Labs 於 2026 年 7 月 9 日發布 Muse Spark 1.1,這是 Muse Spark 的升級版多模態推理模型,面向 agentic 任務,在工具與電腦操作、程式設計和多模態理解上有明顯提升。模型支援 100 萬 token 上下文視窗,可編排多智慧體系統,並已在 Meta AI 應用和 meta.ai 的 Thinking 模式上線。
馬斯克在 X 上表示,Grok 4.7 在處理大型程式碼倉庫方面表現出色。該表述未給出任何基準測試資料、上下文視窗或倉庫規模的量化說明,也未提及上線時間與可用範圍。這是目前關於 Grok 4.7 程式碼能力為數不多的公開資訊。
有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上執行 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話可達 14-15 tok/s。一次長程式設計提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。
Google Labs 推出 AI 遊戲創作平台 Playground,用文字提示就能生成可在瀏覽器執行的遊戲,無需程式設計能力。使用者可選擇問答、競速等型別,指定 2D 或 3D、單人或多人玩法,還能上傳圖片讓 AI 轉成符合美術風格的遊戲資產;成品支援手機與電腦遊玩、連結分享或發布到 Explore 畫廊,並可持續修改。
據 The Information 10 月 5 日報導,Meta 與 Microsoft 正大幅減少員工對 Anthropic Claude 的使用,轉向自研編碼工具。Microsoft 內部對 Anthropic 技術的年支出預估原超 10 億美元,管理層要求員工改用 GitHub Copilot 與 OpenAI 框架後下調逾三分之一,雲與 AI 部門員工的月度 AI 支出上限從 10 萬美元降至多數約 1 萬美元。
月之暗面開源最新模型 Kimi K2.6,主打編碼、長程執行與 Agent 叢集能力,已上線 Kimi.ai、Kimi App、API 和 Kimi Code。官方稱其在內部基準 Kimi Code Bench 上較 K2.5 明顯提升,並給出兩個長程案例:在 Mac 上用 Zig 實現 Qwen3.5-0.8B 本地推理,經 4000+ 次工具呼叫、12 小時以上執行、14 輪迭代,吞吐從約 15 提升到約 193 tokens/秒,比 LM Studio 快約 20%;
一位開發者用 Claude 每月 200 美元方案和 GPT 每月 100 美元方案,在一週內做出了一款類似 FTL 的奇幻飛艇策略遊戲,可免費試玩,幾週後登陸 Steam。遊戲包含船員下地牢、貨運任務、法師招募等系統,已本地化為 7 種語言、接入 100 個 Steam 成就並支援 Linux 和 Mac。他還讓 Claude 編寫 AI 測試員反覆試玩以調整難度,並自動生成預告片。
Reflection 發布首個開放權重模型 Beam:稀疏 MoE,總引數 501B、啟用 23B,面向程式設計、推理與 agentic 負載。預訓練使用 23.8 萬億 token,RL 階段動用 10.5K 塊 NVIDIA GB300 訓練 4 周、生成超 1 億條 rollout、約 13 億個沙箱,官方稱是開放實驗室中規模最大的 RL 訓練之一。評測中其與 GLM 5.2 相當但推理算力少 3–4 倍,接近 Qwen 3.8-Max,原始能力仍落後 Kimi K3;
Google 發布實驗性遊戲平台 Playground,使用者無需程式設計經驗,用簡單文字提示即可在幾分鐘內做出自訂遊戲。平台提供 Trivia、Tower Defense、Racing 等熱門型別,也可從零開始,採用對話式介面;Discover 板塊展示他人作品,涵蓋平台跳躍、問答、街機射擊、文字解謎與體育等型別。頁面提示訪問可能需要訂閱,僅在部分國家開放,且限 18 歲以上使用者。
Google DeepMind 發布 Gemini 4 Argon,主打程式設計、企業知識工作與網路防禦,在 19 項基準中 13 項達到 SOTA,並首次實現最高 1M token 輸出(Long Decode Continuation 跨呼叫續寫)。目前僅面向政府使用者與 Fairwind 計劃中的可信網路安全人員開放,開發者、企業與消費者訪問時間未定。標準定價為每百萬輸入/輸出 token 4/20 美元,五折優惠後 2/10 美元,快取輸入再降 95%。
Mistral 發布 1 萬億引數的 Mistral Large 4,暱稱 Le Chonk,任何人都可以自由使用和定製,目前處於預覽階段,最終版本將在本月底前推出。該模型定位是與領先的通用模型競爭,但專門針對程式設計和網路防禦,以及製造、金融、電氣工程等細分領域做了最佳化。Mistral 聯合創始人兼首席科學家 Guillaume Lample 表示,許多其他實驗室不會重點投入的領域還有很大改進空間。
在 Criteo 任職的初級工程師 Elise Baturone 認為,AI 不會讓軟體工程師消失,真正的風險是資深工程師消失、所有人永遠停在 Junior 階段。她把自己的 agent 調教成導師,用蘇格拉底式提問做理解檢查,並把「提問」和「review」當成需要自己練的技能:追問 agent 解釋設計選擇、引用來源、論證可疑方案,常能讓它自己發現錯誤。她承認這更費 token,但先弄懂再上線更省事;
Airbnb CTO Ahmad Al-Dahle 披露,公司目前 60% 的程式碼由 AI 生成,功能交付量同比增加近 80%,工程師人均 PR 吞吐量提升約 1.6 倍;約一半客服工單已完全由 AI 處理,與 Q2 財報中近 45% 的數字一致。內部上下文圖譜 Everest 幫助雜貨配送服務在 8 至 9 個月內上線,機場接送僅用約 6 周。Airbnb 採用多模型策略,至少部署 10 個定製模型,主要在開源模型上做後訓練和強化學習。
Vx 是一門面向異構計算的系統程式語言,把 CPU、GPU、NPU 與加速器記憶體納入型別系統,主機執行緒解引用裝置指標會直接編譯報錯而非執行時崩潰。它要求跨記憶體空間的資料移動顯式呼叫 transfer(),並用機器檔案描述 H100、H200、B200、A100、MI300X、Apple M4 等真實硬體的記憶體層級與互連,編譯期據此接受或拒絕放置方案。
Google 10 月 7 日推出實驗性遊戲平台 Playground,使用者通過對話式介面輸入文字提示即可建立、試玩和分享自訂遊戲,無需程式設計經驗。Playground 基於瀏覽器,手機和筆記本都能玩,作品可保持私密、生成分享連結或發布到 Explore 畫廊,畫廊遊戲經安全稽核,並支援排行榜與部分品類的多人玩法。該平台今日面向美國 18 歲以上使用者開放,建立權限按 Google One 會員等級分級放開;與 Unity Spark 的整合正在測試,封閉 beta 即將推出。
在 Capcom Open Conference RE: 2026 上,程式設計師 Satoshi Ishida 以「REX 專案的前景與未來」為題演講,稱制作《生化危機》級別遊戲時連簡單任務都極其耗時,解決方案是把 AI 技術成功整合進開發流程。他表示為「與 AI 共同創造遊戲的未來」做準備。Capcom 此前曾稱不會使用 AI。
一篇觀點文章主張,LLM 讓寫程式碼不再耗時,瓶頸轉為編譯重啟的反饋迴圈,基於映象的 Common Lisp 因此成為最佳語言。作者稱 Common Lisp 可即時替換函式而無需重啟,出錯時進入保留完整棧與變數的偵錯程式而非崩潰,LLM 可據此修復並繼續執行。他稱自己用 Common Lisp 寫的應用比 Python 版本短約 6 到 7 倍,token 更少;代價是 Quicklisp 僅數千個專案,標準自 1994 年未更新。