LittleBit 開源亞 1-bit 量化官方實現,LittleBit-2 新增 Joint-ITQ 初始化
LittleBit 專案放出論文官方實現,可把 LLM 權重壓縮到 1.0 至 0.1 bits-per-weight,推理時保持原模型結構不變。ICML 2026 的 LittleBit-2 新增 Joint-ITQ 初始化,通過 --use_itq 開啟,只改初始化、不增加推理開銷,並支援 SmoothSign 量化感知訓練與可選殘差分解。
依意思最接近的 5 筆
LittleBit 專案放出論文官方實現,可把 LLM 權重壓縮到 1.0 至 0.1 bits-per-weight,推理時保持原模型結構不變。ICML 2026 的 LittleBit-2 新增 Joint-ITQ 初始化,通過 --use_itq 開啟,只改初始化、不增加推理開銷,並支援 SmoothSign 量化感知訓練與可選殘差分解。
r/LocalLLaMA 上一則帖子以「FP8/BF16 使用者看到有人跑 IQ1_S」為題引發討論。多位使用者認為量化影響取決於用途:創意寫作、閒聊可容忍 IQ1/IQ2,但編碼、複雜推理和結構化 JSON 提取會明顯崩壞。有人實測 Qwen 3.8 27b 後稱 mxfp4/nvfp4 品質接近 Q6,GSQ-RCO 在 IQ3_S、IQ3_XXS 仍可用;也有人認為 Q4_K_M 或 Q5_K_M 是多數模型的甜點區。
哈工大(深圳)與新加坡國立大學團隊提出免訓練 2-bit KV Cache 量化框架 QuantWM,面向影片世界模型,實際壓縮最高 6.20 倍。研究指出,現有量化方法在 VBench 等指標上接近 BF16,畫面卻仍有閃爍、模糊和失真,原因是 Key 的量化誤差改變了注意力分數排序,使模型選中不同的歷史幀或影像塊。
企業一度鼓勵員工儘可能多地使用 AI,即所謂的 #tokenmaxxing,隨後賬單隨之而來。報導援引一項針對近 400 家企業的調查稱,其中只有 11% 能準確預測自己的 AI 支出。AI 使用量以 token 計量,而企業發現 token 很難統計,這讓 AI 預算幾乎無法編制。
llama.cpp 合併 PR #29717,為 Hexagon 後端新增 q2_k 和 q3_k 兩種量化型別支援,並統一了 src1_row_size 的分配方式。該改動由高通工程師 Max Krasnyansky 參與提交,面向在驍龍 Hexagon NPU 上執行本地推理的使用者,相關建置覆蓋 Linux arm64 與 Android arm64 的 Snapdragon CPU、Adreno GPU、Hexagon NPU 組合。