AISpot

搜尋

找到 1 筆;也可以試試 語意搜尋

r/LocalLLaMA top of the day10/3 19:58AI 評分49

開發者發布 Ninfer 4080,16GB 顯示卡可跑 100k 上下文

開發者 roofkid 發布 Ninfer 4080,讓 RTX 4080 16GB 顯示卡以 100k 上下文執行 ISTA-DASLab-Qwen-3.8-27B-GSQ,最高預填充 2720 tok/s、生成 262 tok/s,程式碼已在 GitHub 開源並提供 Docker 映象。它採用 DFlash2 投機解碼,作者稱預填充與生成速度明顯優於 llama.cpp、vllm 等通用推理引擎,代價是 KV 量化帶來輕微精度損失。