Airbnb 稱 60% 程式碼由 AI 編寫,靠內部工具 Everest 加速開發
Airbnb CTO Ahmad Al-Dahle(前 Meta 生成式 AI 負責人、Llama 系列發布負責人)披露,Airbnb 目前約 60% 的程式碼由 AI 編寫,功能交付量同比增加近 80%,工程師的 PR 吞吐量提升約 1.6 倍。約一半客服工單已由 AI 獨立解決(Q2 財報為近 45%),但安全類問題仍轉人工,上線前用合成資料做測試。
Airbnb CTO Ahmad Al-Dahle(前 Meta 生成式 AI 負責人、Llama 系列發布負責人)披露,Airbnb 目前約 60% 的程式碼由 AI 編寫,功能交付量同比增加近 80%,工程師的 PR 吞吐量提升約 1.6 倍。約一半客服工單已由 AI 獨立解決(Q2 財報為近 45%),但安全類問題仍轉人工,上線前用合成資料做測試。
llama.cpp 發布建置 b11346,本次改動是修復 qwen4exp 的測試(PR #29819)。該版本繼續提供 macOS Apple Silicon(arm64)與 Intel(x64)、iOS XCFramework 預編譯包,Linux 與 Windows 覆蓋 CPU、Vulkan、CUDA 12.8/13.4、ROCm 10.0、OpenVINO、SYCL 等後端,另有 Android arm64 與 openEuler 版本。
llama.cpp b11345 為 Hexagon 後端新增 Q2_K 和 Q3_K 量化型別支援,對應 PR #29717,並統一了 src1_row_size 的分配;改動由 Max Krasnyansky(maxk@qti.qualcomm.com)參與提交。
openJiuwen 首發 X-Router 自演進模型路由技術,按任務複雜度在本地與雲端模型池中動態選模型,實測減少 50%+ Token 消耗。該平台由華為 2012 實驗室、華為雲等團隊聯合高校與企業建置,主打昇騰親和,路由分三層:優於 1 分鐘重新整理的模型能力畫像、結合 KV 快取親和與即時負載的啟發式決策、用 Contextual Bandit 與輕量強化學習做反饋自演進,樣本不足時保留原判定。
Cloudflare 在 Workers AI 上發布自研決策模型 Clef 與 Clef-flash,並以 Apache 2.0 許可在 Hugging Face 完全開源、可本地執行,同時推出可把 Clef 微調到自家場景的強化學習產品。
Cloudflare 在 Workers AI 上線兩款由歐洲公共機構訓練的開源模型:覆蓋全部 24 種歐盟官方語言的 EuroLLM,以及瑞士 ETH Zurich、EPFL 等打造的 Apertus,今天即可申請訪問。Apertus 用逾 15 萬億 token、1500 多種語言訓練,40% 訓練資料非英語,架構、權重、資料與方法全部公開,並按 EU AI Act 與 GDPR 處理訓練退出與個人資料。
Cloudflare OS 開放全託管部署的等待名單:企業只需在 Cloudflare 控制台指定自訂域名、Access 策略與 AI Gateway,其餘配置與運維由 Cloudflare 負責。該產品上月開源,已有數千家組織用它處理公司資料、生成文件幻燈片和自動化任務。
Google DeepMind 發布了一套可快速驗證生物設計是否內建安全防護的工具,並以開放方式供研究使用。該工具面向科研人員,目的是在 AI 加速科學發現的同時,不拖慢關鍵研究進度。官方未披露具體模型名稱、效能資料或使用限制,僅提供研究用途的開放獲取連結。
理論物理學家 Matthew Schwartz 發布開源工具 BootLoops,把 Claude 當作 LLM 的"挽具",專攻適合當前 AI 的"Claude 形狀"問題。他用 Claude Fable 5 移植並改進散射振幅計算方法,還借 BootLoops 把數學物理技術帶到生態學、群體遺傳學、地質、經濟、語言學等領域,並與各領域專家合作篩選真正有價值的問題。BootLoops 開源,可搭配任意模型使用,但當前 AI 仍無法解決科學中的大多數問題。
Hugging Face 於 2026 年 9 月 30 日上線 Open TTS Leaderboard,用客觀指標評測開源與多語言 TTS 模型,單次評測從收集投票的數週縮短到數小時。指標包括 WER/CER(用 Qwen3 ASR 轉寫)、H200 批次離線推理的 RTFx、H200 與 CPU 上的流式首音訊延遲 TTFA,以及 WavLM 說話人嵌入的餘弦相似度 SIM。
v0.35.1-rc0 為 create 請求新增可疊加的 capabilities 欄位,Modelfile 也可直接寫 CAPABILITY 宣告,且這些宣告會在 GGUF 與 safetensors 的建立、繼承和 Modelfile 匯出中保留。排程 System One 請求前改為要求 decision capability,不再靠匹配 Qwen 的架構/renderer 後設資料。
NVIDIA 發布 Kumo Tabular,一個面向表格分類與迴歸的開源基礎模型,權重已上線 Hugging Face,程式碼開源於 GitHub。給定一張帶標籤行的表格,它在單次前向傳播中直接輸出新行的類別機率或數值預測,無需訓練、調參和特徵工程;模型僅用人工合成表格預訓練,提供 28M 到 215M 三種引數規模,採用 OpenMDW-1.1 許可證,可商用。
MLX 發布 v0.32.3,一批修復覆蓋 Metal、CUDA 與 CPU 後端,並新增面向 M5 的非量化 matmul 調優。Metal 側加入 gated delta nets 核心與 fast.cross_entropy 融合核心,降低 SDPA D256/D512 記憶體佔用,同時修復 fp 量化 matmul 在量化維度非 32 倍數時的結果損壞、GGUF 張量維度校驗與零尺寸軸的 scan/sort。
OpenCode 發布 v1.18.33:Cloudflare AI Gateway 上的模型現在會遵循 provider 的回應與流超時,Gemini 的 thinking 預設值與 effort 選項也與各代模型支援的控制對齊。同版本還讓 MCP 瀏覽器啟動失敗在啟動器立即退出時被報告,並讓除錯配置輸出遮蔽憑據與敏感 header。
Mistral 於 2026 年 9 月 28 日在慕尼黑開設德國中心,內設 Physics AI 與 Industrial AI 研究團隊及直接服務企業客戶的應用工程師,並已在當地招聘。合作方包括 BMW(碰撞模擬與工程 AI)、Siemens Energy(工業 AI),以及與慕尼黑工業大學(TUM)用其風洞設施開發汽車空氣動力學數字孿生。
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行,無需手動切換。用法與以往一致,例如 ollama pull qwen3.8 後 ollama run qwen3.8。該版本目前為預發布版(v0.40.0-rc0,變更範圍 v0.34.4 到 v0.40.0-rc0),官方稱預發布期間會測試並啟用更多模型,尚未說明具體支援清單與效能差異。
ggml 作者 ggerganov 宣布,transformers 現在可以直接執行 GGUF 模型。這項工作把 ggml 的 Metal 核心引入 transformers 生態,提升了相容性與效能。更多細節見其後續說明。
LM Studio 宣布其 Splash 引擎已開源,程式碼託管在 GitHub 的 incoai/splash 倉庫。原文只給出這一條資訊和倉庫連結,沒有說明 Splash 的具體功能、支援的模型格式、效能資料或與 MLX、llama.cpp 的關係。想了解它能否用於本地跑開源模型,需要直接檢視該倉庫。
LM Studio 與 inco_ai 合作,在發布當天(day 0)就把 Splash 推理引擎接入 LM Studio。官方給出的資料是:在 M5 Max 上執行 Qwen3.8-27B,速度最高可達 144 tok/sec。想試的話可通過 LM Studio 官方部落格的連結直接跑起來。
Inco AI 發布開源推理引擎 Splash,專為在 Apple Silicon 上本地執行 Qwen3.6-35B-A3B 與 Qwen3.8-27B 最佳化,已整合進 LM Studio Bionic 1.1.5 及以上版本。在 48GB M5 Pro 測試中,Qwen3.8-27B 短提示解碼約 74 tokens/s、32K 上下文 54 tokens/s,約為次快引擎的兩倍;四個併發請求合計吞吐 170 tokens/s,是次快引擎的 3.9 倍。
Mistral 與 Mozilla 於 2026 年 9 月 16 日宣布合作,Firefox 的 AI 瀏覽助手 Smart Window(測試版)改由 Mistral 模型驅動。該功能先面向法國和北美使用者,英國和德國預計今年晚些時候跟進。Smart Window 可解讀複雜搜尋、找回此前點開的頁面,並基於瀏覽器標籤頁整理資訊;Mozilla 表示對話預設不儲存在其伺服器上,Mistral 也同意零資料保留。
DeepSeek 表示將與開源社群緊密合作,為 V4.1-Flash 提供推理支援,並探索更多部署選項。官方同時放出模型與論文連結,並稱可承接 2000 塊 GPU 加儲存叢集的大規模部署需求。
Mistral 與 Cloudera 於 2026 年 9 月 10 日宣布合作,把 Mistral 模型整合進 Cloudera 混合資料平台,企業可在私有云、公有云、本地乃至完全氣隙環境中執行推理。企業還能在受控環境裡用自有專有資料訓練定製模型,並以開放權重方式擁有模型與資料。Cloudera 稱其平台上執行著客戶自管的 30 EB 資料,合作面向金融、製造、電信等受監管行業,核心是讓資料、智慧、算力與運營留在客戶手中。
Mistral AI 在 2026 年 9 月 8 日發文稱,其開放權重模型、產品與基礎設施讓組織能自主選擇 AI 的執行方式和位置,而不只是獲得模型訪問權。Mistral 表示這能帶來前沿效能,同時避免供應商鎖定。完整內容見其官網新聞頁。
Mistral 宣布完成 30 億歐元 D 輪融資,投後估值超過 210 億歐元,是歐洲科技公司史上最大股權融資;本輪由三星電子領投,EQT 管理的 Scaleup Europe Fund 與現有投資方 PSG Equity 共同領投。新投資方包括 Advent、貝萊德管理的基金及盧森堡大公國,a16z、ASML、NVIDIA、Salesforce Ventures 等老股東跟投。資金將用於擴充套件前沿研究、擴大算力與基礎設施、加速商業增長和國際佈局;
NVIDIA 已收購 Hugging Face,llama.cpp 作者 ggerganov 確認這一訊息。NVIDIA 工程師已為 llama.cpp 貢獻程式碼、協作社群並提供開發測試硬體超過一年。ggerganov 表示 llama.cpp/ggml 將繼續堅持硬體無關原則,所有後端的開發與支援仍由社群驅動,向所有人開放。
智譜(Zai)宣布 GLM-5.3 開放權重,可下載、本地執行並自行定製,官方稱這是其面向 agentic coding 與網路防禦能力最強的模型。權重已發布在 Hugging Face 的 zai-org/GLM-5.3 頁面,技術細節見 z.ai/blog/glm-5.3。原文未公布引數規模、許可證型別與硬體要求。
智譜(Zai_org)宣布 GLM-5.3 的模型權重將於 2026 年 8 月 28 日發布,Hugging Face 頁面已給出下載地址。這是繼此前訊息之後的又一進展,權重開放意味著可以本地部署與自行量化。目前官方只給出發布時間和連結,未說明許可證、引數規模與硬體要求。
該開源張量框架的 v0.32.2 版本發布,內容以 bug 修復和核心效能最佳化為主,未附基準數字。修復包括量化切片陣列、float divmod 商被截斷、median 丟棄 NaN、einsum 丟失尾部空下標、轉 bool 時丟失 subnormal 浮點值等。
Apple 的 MLX 框架發布 v0.32.1,集中修復 Metal 與 CUDA 後端的推理、量化與文件問題,並加入多項效能最佳化。Metal 側新增 gemv_wide 加速 fp16/bf16 少行矩陣乘,全注意力支援 head dimension 96,統一記憶體上可用 mx.array(host_buffer, copy=False) 零複製匯入。
NVIDIA 的 30B 總引數(3B 啟用)開源模型 Nemotron 3.5 Lightning 已上線 Ollama,可完全在本地裝置執行。它採用混合 MoE 架構,支援最長 1M token 上下文,並用多 token 預測、DFlash 或 DSpark 投機解碼,吞吐達同類開源模型 4 倍、任務完成時間快 30%,面向呼叫工具、跑測試、檢索程式碼庫等長時 agent 任務。
Muse Glimmer 現已在 Ollama 上線,這是 Meta Superintelligence Labs 發布的首個開放模型。它是 30B 多模態模型,專為本地執行的 agent 工作負載設計,上下文 128K 以上,採用 Apache 2.0 許可,可直接驅動 Claude Code、Codex、Pi、OpenClaw 等。
Meta 發布 30B 開源模型 Muse Glimmer,Apache 2.0 許可,即日起可在 LM Studio Bionic 本地執行,Mac 與 PC 均可。它支援多步 agent 任務、工具呼叫與影像輸入,在 LM Studio 內部評測 BionicBench v0.1 的 18 項任務中完成率 83.3%,高於 Gemma 4 31B 和 Qwen 3.6 27B 的 77.7%。
Apple 的 MLX 發布 v0.32.0,包含大量修復與改進。iOS 上 Metal 後端預設啟用;CUDA kernel 新增 JIT 編譯快取,qmm_naive 也改為 JIT 編譯;mlx.core.linalg 新增 determinant 與 sign-log-determinant,mx.asarray 增加 copy 關鍵字,finfo 增加 bits 與 smallest_normal。
MLX 在 2026-04-22 發布補丁版 v0.31.3,以大量 bug 修復為主,並新增執行緒本地生成流(thread local generation stream),配合 MLX v0.31.2。修復覆蓋 BatchKVCache、BatchRotatingKVCache 與 ArraysCache 的 batch 維度不匹配,以及服務端並行工具呼叫、MiniMax M2 並行工具呼叫和 Mistral 空 tool_call_end 導致的工具呼叫中斷。
MLX 發布 v0.31.2,把 CUDA 後端的量化矩陣乘擴充套件到了 3/5/6-bit、int4 與浮點量化(qmm_naive、qmm_sm80),並新增 GatherQMM 和 CUDA FFT。框架現在支援多執行緒執行獨立計算:CommandEncoder、ThreadLocalStream 改為執行緒本地,Scheduler::enqueue 執行緒安全,JACCL 拆分為獨立庫。
MLX 生態的 mlx_lm 發布 v0.31.2(上一版為 v0.31.0),重點是新增 Gemma 4 支援,包括工具呼叫解析器、多 token 的 think 與工具起止標記,並修復其量化逐層投影載入。此次還重構了 BatchGenerator、為非裁剪型快取快取系統提示與使用者訊息,批處理生成器恢復 max-kv-size 引數,伺服器新增 --allowed-origins 選項,並加入 Nemotron super 支援。
v0.31.0 發布,從 v0.30.7 升級而來,新增 JoyAI LLM Flash 模型支援,併為 Qwen 3.5 加入張量並行;同時允許共享模型,修復 CacheList 儲存與載入、MLA 模型混合量化判斷、Qwen3.5 轉 fp32 與 sanitize、MiniMax M2.5 分片 RMS norm。
2026 年 2 月 12 日發布的 v0.30.7 修復了 Kimi Linear 與 DeepSeek V3.2 的 indexer 和權重載入問題,並加快 DSV32 生成速度。這一版新增 GLM5、不含視覺能力的 Qwen3.5 系列與 LongCat MLA 支援,LFM2 模型可用 Pythonic 方式呼叫工具,另加入 Mistral 工具解析器。訓練流程中的驗證集改為可選,還有一項為下一版本提號的版本號變更。