llama.cpp b11346:qwen4exp 修復測試
llama.cpp b11346 修復 qwen4exp 測試,並提供多平台構建。
找到 15 筆
llama.cpp b11346 修復 qwen4exp 測試,並提供多平台構建。
llama.cpp 合併 PR #29828,為 Hexagon 安裝重建的 HTP skels 並修復目錄依賴。
llama.cpp 發布 b11349,為 Vulkan 管線編譯問題新增日誌,並覆蓋 macOS、Linux、Windows、Android 等多平台構建。
MLX 發布 v0.30.7。本次新增 GLM5 與 Qwen3.5(無視覺版)支援、LongCat MLA、Mistral 與 LFM2 的工具呼叫解析,修復 Kimi Linear 和 DeepSeek V3.2 的索引器與權重載入,並加快 DeepSeek V3.2 生成。
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行。示例命令為 ollama pull qwen3.8 與 ollama run qwen3.8。預發布階段還會繼續測試並啟用更多模型。
MLX 發布 v0.31.2,帶來 Gemma 4 支援(含 tool call parser 與量化逐層載入修復)和 Nemotron-H 支援。此版本還加入不可裁剪快取的系統提示與使用者訊息快取,並重構了批次生成。
Google Antigravity SDK 現可通過 LiteRT 在本地離線執行 Gemma 4 26B A4B 等模型。它同時支援 Ollama、vLLM 等 OpenAI 相容推理服務,可讓雲端模型做規劃,本地模型在裝置上處理程式碼審計與修補。
Muse Glimmer 是 Meta Superintelligence Labs 的首個開源模型,30B 多模態、Apache 2.0 許可、128K+ 上下文,現已在 Ollama 上線。Apple Silicon 上可通過 Ollama 的 MLX 引擎執行,DFlash 帶來 1.5–1.8 倍提速,並新增影像輸入支援。
Ollama v0.35.1 通過 /v1/systemone 接入 Cloudflare 開源的決策模型 Clef(27B)與 Clef Flash(9B),兩者均為多模態,請求可同時帶圖片和文字狀態。本次更新還把聯網搜尋上限從每次回答 3 次提升到 10 次,並更新了 llama.cpp 與 MLX 引擎。
微軟推出 FrogNano-4B,基於 Qwen3.5-4B 做後訓練,專注倉庫級軟體工程。它用強化學習在約 1500 個合成 SWE 任務環境中訓練,配合五工具 Leaf harness。訓練資料偏 Python 和英文,生成的 patch 需人工審查與測試。
Meta 推出 30B 開源模型 Muse Glimmer,Apache 2.0 許可,今日起可在 LM Studio Bionic 下載並本地執行,支援工具呼叫和影像輸入。在該平台 BionicBench v0.1 評測中,它完成 83.3% 的任務,高於 Gemma 4 31B 和 Qwen 3.6 27B 的 77.7%。
Ollama v0.35.0 支援決策模型,經 /v1/systemone 呼叫,返回選擇、機率和分數而非文字。首批可用模型為 Bespoke Labs 的 Nimble 和 Together AI 的 Tev1。支援 choice、noul、score 三種問題型別,適用於工單分類、模型路由和內容分類。
NVIDIA 的 30B 開源模型 Nemotron 3.5 Lightning 已在 Ollama 上線,可完全在本地裝置執行,每 token 僅啟用 3B 引數。它支援最長 1M token 上下文,靠推測解碼實現最高 4 倍吞吐。用 ollama launch 即可接入 Claude Code、OpenCode,Apple Silicon 對應 30b-mlx 版本。
博主 basnijholt 發文論證自託管 AI 不能省錢,但他依然堅持自託管。他明確表示不會把 200 GB 郵件、訊息和位置歷史交給 API,無論是否零資料保留。他還指出,拿 200 美元訂閱與 Qwen 3.8 27B 相比並不對等。
Ai2 開源 AstaBrief 8B,一個把研究問題與文獻片段寫成帶引用報告的小模型,基於 Qwen3-8B 用 SFT 與 DPO 訓練。它已在 Asta 中作為 Fast 模式上線,平均 51.1 秒生成一份報告,比 Claude 驅動的 Thinking 模式(178.5 秒)快約 3.5 倍。模型權重、訓練資料和示例工作流同時開放,可在自有基礎設施本地執行。