LM Studio 首發 Splash 引擎,M5 Max 跑 Qwen3.8-27B 達 144 tok/s
LM Studio 與 inco_ai 合作,在發布當天(day 0)就把 Splash 推理引擎接入 LM Studio。官方給出的資料是:在 M5 Max 上執行 Qwen3.8-27B,速度最高可達 144 tok/sec。想試的話可通過 LM Studio 官方部落格的連結直接跑起來。
你正準備買 Mac Studio 本地跑開源模型,這條給出了 Apple Silicon 上 27B 級模型的具體推理速度參考,也說明 LM Studio 已支援新的 Splash 引擎,可以直接上手對比 MLX、llama.cpp 的表現。
原標題:@lmstudio: Qwen3.8-27B, up to 144 tok/sec on M5 Max.
閱讀原文
| 評分 | 82 / 85(平均 83,門檻 60) |
|---|---|
| 狀態 | 精選(舊聞,已歸檔) |