搜尋
找到 5 筆
llama.cpp releases10/4 21:07AI 評分45
llama.cpp 的 ggml-cpu 後端在 x86 上為 tinyBLAS 增加了 BF16、FP16、FP32 的 K 尾部支援並做了向量化,同時讓 CPU 測試在啟用 use_ref 時跳過 tinyBLAS,以便與 vec_dot 路徑對比。改動以 PR #29806 合入,隨 b11398 建置發布,覆蓋 macOS、Linux、Windows、Android 等多平台 CPU 與 GPU 後端。
llama.cpp releases10/5 06:24AI 評分42
llama.cpp 合併 PR #29633,在 CUDA 後端針對小批次場景的 thin f16/bf16 mul_mat 改用 MMVF 指令,並調整了核心選擇邏輯。該改動由 NVIDIA 工程師提交,影響 Ubuntu 與 Windows 的 CUDA 12/13 建置,面向在 NVIDIA GPU 上執行本地推理的使用者。
r/LocalLLaMA top of the day10/3 12:47AI 評分38
r/LocalLLaMA 上一則帖子以「FP8/BF16 使用者看到有人跑 IQ1_S」為題引發討論。多位使用者認為量化影響取決於用途:創意寫作、閒聊可容忍 IQ1/IQ2,但編碼、複雜推理和結構化 JSON 提取會明顯崩壞。有人實測 Qwen 3.8 27b 後稱 mxfp4/nvfp4 品質接近 Q6,GSQ-RCO 在 IQ3_S、IQ3_XXS 仍可用;也有人認為 Q4_K_M 或 Q5_K_M 是多數模型的甜點區。
r/LocalLLaMA top of the day● 精選10/2 22:47AI 評分80
有人在單張 RTX PRO 6000 上對三個 Qwen3.8 檢查點做了 10 項測試:RadixArk 27B NVFP4、orcarouter 27B Uncensored NVFP4 和 Flash-Next NVFP4。27B 配 DFlash2 草稿模型後 Spec-Bench 從 75 提到 210 tok/s,約 2.8 倍;SGLang 整體快於 vLLM,但同一匯出上 vLLM 快 16%。
r/LocalLLaMA top of the day10/3 02:33AI 評分42
作者發布專為 RTX5090 打造的推理引擎 MegaCapybara,聚焦 Qwen3.8 27B,解碼速度約為此前 SOTA 引擎 Ninfer 的兩倍:單任務編碼可達 500+ t/s,12 個 agent 併發、800k 上下文時可達 2000+ t/s。引擎具備 VRAM-RAM-DISC 快取管理、雙層 Loop Guard、帶後設資料的自研權重格式(可對比 BF16 顯示 KL 與 top-1% 損失)以及圖形介面,採用 MIT 許可,原始碼與權重建置器後續發布。