AISpot

搜尋

依意思最接近的 2 筆

r/LocalLLaMA top of the day10/3 21:06AI 評分75

TensorSharp 讓 176B MoE 模型跑在 16GB 視訊記憶體筆記本上

開源推理引擎 TensorSharp 在 RTX 3080 Laptop(16GB 視訊記憶體)、32GB 記憶體加 SSD 的普通筆記本上跑起了 Qwen3.8 Flash Next 176B,無需 128GB 以上記憶體工作站或多 GPU。它靠量化加 MoE 感知的統一排程,協調視訊記憶體、記憶體、SSD 與快取分層。

r/LocalLLaMA top of the day10/3 19:24AI 評分65

專精推理引擎興起,放棄通用性換極致效能

一批極窄用途的推理執行時正在出現,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 和 vLLM 擅長的通用性,只針對少數模型、有時甚至只針對一個硬體家族(如 Strix Halo)做最佳化。作者認為未來通用執行時負責相容性、一次性專精執行時負責最大效能將成為常態,這也有助於智慧的民主化與去中心化,並壓榨現有硬體的更多產出。