Inco AI 開源 Splash 引擎,Apple Silicon 跑 Qwen3.8 提速約 2 倍
Inco AI 開源了面向 Apple Silicon 的推理引擎 Splash,專門最佳化 Qwen3.6-35B-A3B 與 Qwen3.8-27B。在 48 GB M5 Pro 上,Qwen3.8-27B 短提示解碼 74 tokens/s、32K 上下文 54 tokens/s,約為實測次快引擎的 2 倍,四路併發合計 170 tokens/s。
找到 8 筆
Inco AI 開源了面向 Apple Silicon 的推理引擎 Splash,專門最佳化 Qwen3.6-35B-A3B 與 Qwen3.8-27B。在 48 GB M5 Pro 上,Qwen3.8-27B 短提示解碼 74 tokens/s、32K 上下文 54 tokens/s,約為實測次快引擎的 2 倍,四路併發合計 170 tokens/s。
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行。示例命令為 ollama pull qwen3.8 與 ollama run qwen3.8。預發布階段還會繼續測試並啟用更多模型。
v0.34.4 已發布。思考模型的結構化輸出改為單次通過,更快更可靠,並修復本地大模型庫間歇性報 model not found 及 macOS 應用檢查 ChatGPT、Codex 時卡死的問題。Qwen 3.8 在 Apple Silicon 上提示處理更快,Gemma 4 會按圖選最佳解析度以保留更多細節。
llama.cpp 發布 b11352,主要改動是最佳化 Qwen4 的 mask 構建(#29824),並把同一改動應用到 GLM5-next。構建產物覆蓋 macOS Apple Silicon、Linux、Windows、Android 等平台。其中 macOS Apple Silicon 的 KleidiAI enabled 版本標記為 DISABLED。
llama.cpp 構建 b11345 為 Hexagon NPU 後端新增 q2_k 和 q3_k 量化型別支援(#29717),並統一了 src1_row_size 的分配。該版本產物覆蓋 macOS Apple Silicon、Linux、Android、Windows 等平台,其中 macOS Apple Silicon 的 KleidiAI 版本為 DISABLED。
MLX v0.32.0 發布。Windows 新增 JIT 編譯器支援,iOS 預設啟用 Metal 後端,CUDA kernel 加入 JIT 快取。mlx.core.linalg 新增行列式與 sign-log-determinant 函式。
Muse Glimmer 是 Meta Superintelligence Labs 的首個開源模型,30B 多模態、Apache 2.0 許可、128K+ 上下文,現已在 Ollama 上線。Apple Silicon 上可通過 Ollama 的 MLX 引擎執行,DFlash 帶來 1.5–1.8 倍提速,並新增影像輸入支援。
NVIDIA 的 30B 開源模型 Nemotron 3.5 Lightning 已在 Ollama 上線,可完全在本地裝置執行,每 token 僅啟用 3B 引數。它支援最長 1M token 上下文,靠推測解碼實現最高 4 倍吞吐。用 ollama launch 即可接入 Claude Code、OpenCode,Apple Silicon 對應 30b-mlx 版本。