AISpot

搜尋

找到 5 筆

llama.cpp releases10/7 23:56AI 評分41

llama.cpp 為 Hexagon NPU 支援 Q4_K/Q6_K tiled GET_ROWS

llama.cpp 的 Hexagon 後端新增 tiled Q4_K 與 Q6_K 的 GET_ROWS 支援,使驍龍 Hexagon NPU 能對這兩種量化格式執行嵌入查表,同一提交還修正了 Q4_K 檢視的校驗邏輯。改動由 OpenCode 協助完成,已隨本次建置發布,覆蓋 Android arm64 與 Linux arm64 的 Snapdragon CPU、Adreno GPU、Hexagon NPU 組合包。

llama.cpp releases10/2 21:58AI 評分40

llama.cpp 修復 qkx3 量化縮放搜尋的非法舍入

llama.cpp 合併 PR #29817,修復 ggml-quants 中 qkx3 量化縮放搜尋的非法舍入問題:當 imatrix 擬合的最小值塌縮為最大值或範圍極小時,會產生無窮、NaN 或越界值,傳入 nearest_int 後可能觸發 Debug 建置斷言。修復方式是在舍入前把量化級別鉗制到 [0, nmax],並新增 q2_K、q4_K、q5_K、q4_1、q5_1 的退化 imatrix 組迴歸測試,對應 issue #29804。

Simon Willison● 精選10/4 19:34AI 評分66

Qwen3.8 27B 在 DGX Spark 復現文字加法實驗,169 題答對 167

有人在本地 DGX Spark 上覆現了兩年前用 GPT-4o 做過的實驗:讓模型算出大數之和、但把答案寫成英文單詞。他用 Qwen3.8-27B-Q4_K_M.gguf,經 Codex Remote(GPT-6 Astra)執行,關閉推理時每組組合跑 30 次嘗試,開啟推理後每組只跑一次,169 次裡答對 167 次。作者也公開了部分大數計算的推理過程。

r/LocalLLaMA top of the day10/3 07:47AI 評分38

LocalLLaMA 討論:大模型用 IQ1_S 量化到底行不行

r/LocalLLaMA 上一則帖子以「FP8/BF16 使用者看到有人跑 IQ1_S」為題引發討論。多位使用者認為量化影響取決於用途:創意寫作、閒聊可容忍 IQ1/IQ2,但編碼、複雜推理和結構化 JSON 提取會明顯崩壞。有人實測 Qwen 3.8 27b 後稱 mxfp4/nvfp4 品質接近 Q6,GSQ-RCO 在 IQ3_S、IQ3_XXS 仍可用;也有人認為 Q4_K_M 或 Q5_K_M 是多數模型的甜點區。