Inco AI 開源 Splash 引擎,Apple Silicon 跑 Qwen3.8 提速約 2 倍
Inco AI 開源了面向 Apple Silicon 的推理引擎 Splash,專門最佳化 Qwen3.6-35B-A3B 與 Qwen3.8-27B。在 48 GB M5 Pro 上,Qwen3.8-27B 短提示解碼 74 tokens/s、32K 上下文 54 tokens/s,約為實測次快引擎的 2 倍,四路併發合計 170 tokens/s。
找到 9 筆
Inco AI 開源了面向 Apple Silicon 的推理引擎 Splash,專門最佳化 Qwen3.6-35B-A3B 與 Qwen3.8-27B。在 48 GB M5 Pro 上,Qwen3.8-27B 短提示解碼 74 tokens/s、32K 上下文 54 tokens/s,約為實測次快引擎的 2 倍,四路併發合計 170 tokens/s。
Apple 將在 Mac 上為"完全磁碟訪問"權限增加新的限制,原因是 AI agent 帶來的風險上升。新控制元件要求只有使用者做出非常明確的動作,才能把這一"特殊級別"的訪問權授予某個應用。此前 Inc 的 Jason Aten 發現,Meta 的 Muse AI 在他未明確授權的情況下知道了他資訊的內容。
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行。示例命令為 ollama pull qwen3.8 與 ollama run qwen3.8。預發布階段還會繼續測試並啟用更多模型。
v0.34.4 已發布。思考模型的結構化輸出改為單次通過,更快更可靠,並修復本地大模型庫間歇性報 model not found 及 macOS 應用檢查 ChatGPT、Codex 時卡死的問題。Qwen 3.8 在 Apple Silicon 上提示處理更快,Gemma 4 會按圖選最佳解析度以保留更多細節。
蘋果宣布將收緊 macOS 的完全磁碟訪問權限,使用者需以非常明確的操作才能授予應用。蘋果稱 AI agent 越來越自主,這類訪問帶來的風險會顯著上升。此前有記者稱 Meta 的 Muse 未經許可讀到了其私信,Meta 否認。
llama.cpp 構建 b11345 為 Hexagon NPU 後端新增 q2_k 和 q3_k 量化型別支援(#29717),並統一了 src1_row_size 的分配。該版本產物覆蓋 macOS Apple Silicon、Linux、Android、Windows 等平台,其中 macOS Apple Silicon 的 KleidiAI 版本為 DISABLED。
MLX v0.32.0 發布。Windows 新增 JIT 編譯器支援,iOS 預設啟用 Metal 後端,CUDA kernel 加入 JIT 快取。mlx.core.linalg 新增行列式與 sign-log-determinant 函式。
Muse Glimmer 是 Meta Superintelligence Labs 的首個開源模型,30B 多模態、Apache 2.0 許可、128K+ 上下文,現已在 Ollama 上線。Apple Silicon 上可通過 Ollama 的 MLX 引擎執行,DFlash 帶來 1.5–1.8 倍提速,並新增影像輸入支援。
NVIDIA 的 30B 開源模型 Nemotron 3.5 Lightning 已在 Ollama 上線,可完全在本地裝置執行,每 token 僅啟用 3B 引數。它支援最長 1M token 上下文,靠推測解碼實現最高 4 倍吞吐。用 ollama launch 即可接入 Claude Code、OpenCode,Apple Silicon 對應 30b-mlx 版本。