Meta 首個開源模型 Muse Glimmer 上線 Ollama
Meta Superintelligence Labs 的首個開源模型 Muse Glimmer 已在 Ollama 上線,採用 Apache 2.0 許可。它是 30B 多模態模型,面向本地執行的 agent 工作負載,上下文長度 128K 以上,支援 low 到 xhigh 四檔推理強度。
找到 19 筆
Meta Superintelligence Labs 的首個開源模型 Muse Glimmer 已在 Ollama 上線,採用 Apache 2.0 許可。它是 30B 多模態模型,面向本地執行的 agent 工作負載,上下文長度 128K 以上,支援 low 到 xhigh 四檔推理強度。
Ollama 官方宣布三款模型已上架,可在 /v1/systemone 下使用:Nimble、Tev1 4b 和 Tev1 0.8b。三款模型均提供 ollama.com/library 頁面,使用者可通過 Ollama 拉取後在本地執行。官方未公布模型引數規模以外的細節與授權資訊。
llama.cpp 作者 Georgi Gerganov 宣布,Mac 版 Llama 應用現已內建一個簡易的請求建置器,用於呼叫 llama.cpp 的 REST API。該功能面向在本地執行 llama.cpp 的使用者,可在圖形介面中直接構造併傳送 API 請求,無需手動編寫請求程式碼。
LM Studio 宣布與 inco_ai 合作,在發布首日(day 0)接入其 Splash 推理引擎,用於在本地執行 Qwen3.8-27B。官方給出的實測資料是在 M5 Max 上最高可達 144 tok/s。使用者可通過 LM Studio 官方部落格的連結獲取並立即執行。
開源專案 Strata 可在普通遊戲 PC 上本地執行 125B 引數的 Qwen3.8-Flash-Next,支援聊天、寫程式碼、讀圖和接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s;RTX 3090(24GB)預計可達 100-140 tokens/s。
Meta 發布 30B 開源模型 Muse Glimmer,採用 Apache 2.0 許可,發布當天即可在 LM Studio Bionic 中下載並本地執行。該模型面向本地 agent 工作流,支援多步任務、工具呼叫與影像輸入,可在 Mac 和 PC 上執行。在 LM Studio 內部評測 BionicBench v0.1 的 18 項任務中完成率 83.3%,高於 Gemma 4 31B 與 Qwen 3.6 27B 的 77.7%。
Jeffy 是一個可在普通電腦本地執行的分類器集合,無需 GPU,內建 13 個已訓練好的分類器,覆蓋垃圾資訊檢測、意圖路由、主題分類和情感分析,甚至能玩 Doom。使用者還可以用它訓練自己的分類器。專案作者在 Hacker News 上徵集使用場景與同類任務的架構方案。
開源免費的 Agent Standup 把 Claude Code 會話變成一場即時站會:每個 sub-agent 以畫素角色入場,狀態標註為工作中、等待他人、需要你介入、卡住或已完成,零 token 消耗。它讀取 Claude Code 已寫下的本地會話檔案,因此在 VS Code、Cursor、終端或桌面應用裡都能執行,無需配置、程式碼不外傳。
Cloudflare 發布兩個自研決策模型 Clef 與 Clef-flash,託管於 Workers AI,並以 Apache 2.0 許可在 Hugging Face 開源,可本地執行。Clef 在 Jev Decision Index 上排名第一,具備視覺編碼器與 64k 上下文視窗,中位延遲 209.3ms,快於 Jev 的 524.1ms。同時推出強化學習微調產品,供使用者按自身場景微調 Clef。
Photo Scrubber 是一款在本地執行的人臉模糊與後設資料清除工具,由 GPT-6 Astra 根據使用者需求建置。它使用 Google 的 MediaPipe C++ 庫,通過 @mediapipe/tasks-vision 編譯為 WebAssembly,並搭配 BlazeFace 人臉檢測模型。作者因不願分享陌生人可識別的面部照片而開發此實驗性工具,適用於攝影相關場景。
NVIDIA 宣布 DGX Spark 新增 64GB 統一記憶體版本,10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 發售,起售價 4999 美元。該機型保留 GB10 Grace Blackwell 晶片、DGX OS 與完整 AI 軟體棧,支援最高 1000 億引數模型本地執行;兩臺可通過 ConnectX-7 直連組成 128GB 叢集,支援 2000 億引數模型,官方 Qwen 3.8 27B 測試效能提升至 1.7 倍。
Google Antigravity SDK 現已支援在本地執行離線 agentic 工作流,可通過 LiteRT 呼叫 Gemma 4 26B A4B 等模型。該更新支援混合編排架構,由雲端模型擔任輕量規劃器,本地模型在裝置上處理程式碼審計與修補等高 token 消耗任務。SDK 還直接相容 Ollama、vLLM 等 OpenAI 相容推理伺服器,便於建置隱私優先的本地自主工具。
Inco AI 推出開源推理引擎 Splash,專為 Apple Silicon 本地執行 Qwen3.6-35B-A3B 與 Qwen3.8-27B 最佳化,併為每個模型配備 DFlash 2 草稿模型做投機解碼。在 48GB M5 Pro 測試中,Qwen3.8-27B 短提示解碼約 74 tokens/s、32K 上下文 54 tokens/s,約為次快引擎的兩倍;四路併發短提示合計吞吐 170 tokens/s,為次快引擎的 3.9 倍。
Ollama 0.35 新增基於 TypeSafe Jev API 的決策模型支援,通過 /v1/systemone 端點一次請求回答多個命名問題,無額外費用。首批三個模型為 Bespoke Labs 的 9B nimble、Together AI 的 4B tev1 與 0.8B tev1:0.8b,可用於工單分流、模型路由與內容稽核。官方稱 nimble 在 M5 Max 本地執行平均每次決策 91ms,後續將加入 MLX 加速與雲端模型。
Cursor 上線自託管機器功能,程式碼庫、建置產物和金鑰全部留在自有基礎設施內,由 agent 在本地執行工具呼叫。支援動態池排程:My Machines 連線單檯筆記本或 VM,團隊池按需擴縮容、可休眠空閒機器並在重連視窗內恢復,且不繫結單一倉庫。雲端 agent 還可執行在 AWS Lambda、Cloudflare、Vercel、E2B 等既有沙箱上,自託管 worker 新增 Linux 與 Mac 的 computer use 支援。
聯想 YOGA Pro 15 RTX Spark 於 10 月 8 日 9:00 開啟全網盲約,為全球首批搭載 NVIDIA RTX Spark N1X 超級晶片的本地智慧體 AIPC。N1X 整合最高 6144 核 Blackwell RTX GPU 與 20 核 Grace CPU,端側算力達 1 Petaflop FP4,整機最高 128GB 統一記憶體、2TB 儲存、80W 滿功耗,可本地執行超千億引數大模型,並出廠預裝 35B 本地模型。
中科大系公司白澤通境發布溯因式世界模型 AWM,並開源論文與程式碼,配合自研端側推理引擎 BAIZ-RUN 把模型壓進機器人本地執行。AWM 從無標註影片學習,在 Push-T 任務上以 2000 條軌跡達到 75% 成功率,約為 Causal-JEPA 所需資料的七分之一,資料加到 14728 條時成功率約 92%。
有人在 GitHub 上對本地執行的大語言模型進行「拷問」和「疼痛」實驗,引發 X 上關於 AI 倫理的激烈爭論,部分有效利他主義者和相信 LLM 有感知的人要求 GitHub 刪除該專案。爭論源於近期多篇關於 AI 意識和「模型福利」的病毒式論文與博文,Anthropic 也曾在部落格和「Claude 憲法」中提及模型福利。文章認為 LLM 並不具備意識,其基於人類文字訓練的技術沒有通向意識的合理路徑。
開發者用 11 個月業餘時間從零訓練了二戰主題小語言模型 Peacebell,並開源訓練材料與權重,提供 291M 和 148M 兩個引數版本。訓練資料全部為自建合成資料,基於維基百科等許可材料,作者稱大部分精力花在資料整理與平衡上。291M 版本可在 HuggingFace 免費試用,無需 GPU 即可本地執行,但作者提醒這是初版,長上下文表現較差。同時發布了 WWII 主題基準與排行榜,下一版預計 2027 年發布。