@lmstudio: The Splash engine is open source, check it out:
LM Studio 宣布其 Splash 引擎已開源,程式碼託管在 GitHub 的 incoai/splash 倉庫。原文只給出這一條資訊和倉庫連結,沒有說明 Splash 的具體功能、支援的模型格式、效能資料或與 MLX、llama.cpp 的關係。想了解它能否用於本地跑開源模型,需要直接檢視該倉庫。
找到 6 筆
LM Studio 宣布其 Splash 引擎已開源,程式碼託管在 GitHub 的 incoai/splash 倉庫。原文只給出這一條資訊和倉庫連結,沒有說明 Splash 的具體功能、支援的模型格式、效能資料或與 MLX、llama.cpp 的關係。想了解它能否用於本地跑開源模型,需要直接檢視該倉庫。
Inco AI 發布開源推理引擎 Splash,專為在 Apple Silicon 上本地執行 Qwen3.6-35B-A3B 與 Qwen3.8-27B 最佳化,已整合進 LM Studio Bionic 1.1.5 及以上版本。在 48GB M5 Pro 測試中,Qwen3.8-27B 短提示解碼約 74 tokens/s、32K 上下文 54 tokens/s,約為次快引擎的兩倍;四個併發請求合計吞吐 170 tokens/s,是次快引擎的 3.9 倍。
LM Studio 新增 Splash 引擎,可在 Settings > Runtime > Experimental backends 中開啟。官方建議使用 macOS 26.4 及以上的 M3 或更新 Mac,記憶體至少 36GB,並可在模型搜尋中查詢 incoai 下載受支援模型。
LM Studio 與 inco_ai 合作,在發布當天(day 0)就把 Splash 推理引擎接入 LM Studio。官方給出的資料是:在 M5 Max 上執行 Qwen3.8-27B,速度最高可達 144 tok/sec。想試的話可通過 LM Studio 官方部落格的連結直接跑起來。
開發者用 Sparse VideoGen(SVG)把注意力頭動態路由到高度結構化的空間或時間稀疏掩碼,並在 TPU 上最佳化 Splash Attention 核心,使 1440p 影片生成的端到端推理最高提速 1.69 倍。核心側的具體改動是:跳過空記憶體 tile、把精確座標掩碼嚴格限制在邊界 tile、將 token 記憶體佈局改成時間優先(temporal-major)以獲得連續訪問。目的是把演算法層的稀疏真正對齊到硬體 tile 執行,顯著減少被浪費的矩陣運算。
一批極窄用途的推理執行時正在出現,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 和 vLLM 擅長的通用性,只針對少數模型、有時甚至只針對一個硬體家族(如 Strix Halo)做最佳化。作者認為未來通用執行時負責相容性、一次性專精執行時負責最大效能將成為常態,這也有助於智慧的民主化與去中心化,並壓榨現有硬體的更多產出。