AISpot

llama.cpp

近期事件

  1. 1
    熱度 1.02 個來源 · 2 則10/3 12:28
  2. 2
    熱度 0.82 個來源 · 2 則10/3 07:27
  3. 3
    熱度 0.83 個來源 · 4 則10/3 01:56
  4. 4
    熱度 0.72 個來源 · 2 則10/3 00:57
  5. 5
    熱度 0.61 個來源 · 2 則10/3 22:35

10月4日星期日 · 1 則

  1. llama.cpp releases● 精選AI 評分63

    llama.cpp 為 WebGPU 後端加入 f16 支援

    llama.cpp 在 WebGPU 後端為 fill/set_rows 操作加入 f16 支援(PR #29897),併發布 b11382 版本。該版本覆蓋 macOS Apple Silicon、iOS、Linux、Android、Windows 等平台,其中 macOS Apple Silicon 的 KleidiAI 建置被停用。對使用 WebGPU 推理的使用者,f16 支援可減少視訊記憶體佔用並提升相容性。

10月3日星期六 · 26 則

  1. llama.cpp releasesAI 評分32

    llama.cpp 修復 Windows 下 mtmd 棄用警告

    llama.cpp 發布 b11381 版本,修復了 mtmd 在 Windows 上觸發的 strdup 棄用警告(#29863),由 Hugging Face 的 Adrien Gallouët 提交。該版本繼續提供 macOS Apple Silicon(arm64)、Linux、Windows、Android 等多平台預編譯包,其中 macOS Apple Silicon 的 KleidiAI 加速版被標記為 DISABLED。

  2. r/LocalLLaMA top of the dayAI 評分75

    TensorSharp 讓 176B MoE 模型跑在 16GB 視訊記憶體筆記本上

    開源推理引擎 TensorSharp 在 RTX 3080 Laptop(16GB 視訊記憶體)、32GB 記憶體加 SSD 的普通筆記本上跑起了 Qwen3.8 Flash Next 176B,無需 128GB 以上記憶體工作站或多 GPU。它靠量化加 MoE 感知的統一排程,協調視訊記憶體、記憶體、SSD 與快取分層。

  3. r/LocalLLaMA top of the dayAI 評分49

    開發者發布 Ninfer 4080,16GB 顯示卡可跑 100k 上下文

    開發者 roofkid 發布 Ninfer 4080,讓 RTX 4080 16GB 顯示卡以 100k 上下文執行 ISTA-DASLab-Qwen-3.8-27B-GSQ,最高預填充 2720 tok/s、生成 262 tok/s,程式碼已在 GitHub 開源並提供 Docker 映象。它採用 DFlash2 投機解碼,作者稱預填充與生成速度明顯優於 llama.cpp、vllm 等通用推理引擎,代價是 KV 量化帶來輕微精度損失。

  4. r/LocalLLaMA top of the dayAI 評分65

    專精推理引擎興起,放棄通用性換極致效能

    一批極窄用途的推理執行時正在出現,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 和 vLLM 擅長的通用性,只針對少數模型、有時甚至只針對一個硬體家族(如 Strix Halo)做最佳化。作者認為未來通用執行時負責相容性、一次性專精執行時負責最大效能將成為常態,這也有助於智慧的民主化與去中心化,並壓榨現有硬體的更多產出。

  5. llama.cpp releasesAI 評分44

    llama.cpp 新增 common_is_tty() 並修復 Windows 棄用警告

    llama.cpp 合併 PR #29860,新增 common_is_tty() 輔助函式並修復 Windows 上的棄用警告,作者為 Hugging Face 的 Adrien Gallouët。該提交同時更新了各平台預編譯產物,macOS Apple Silicon(arm64)正常提供,但啟用 KleidiAI 的 arm64 版本被標記為 DISABLED,openEuler 也處於 DISABLED 狀態。

  6. llama.cpp releases● 精選AI 評分78

    llama.cpp 修復 Ling 3.0 解析器對 json_schema 的支援

    llama.cpp 合併 PR #29813,讓 Ling 3.0 解析器支援 inputs.json_schema,此前 response_format 請求不受約束。新邏輯為回應格式語法路徑優先於工具呼叫,啟用思考時要求 JSON 前有 think 塊,且 JSON 後不允許尾隨文字。該修復對應 issue #29652,由 Claude Opus 5.5 輔助完成。

  7. llama.cpp releases● 精選AI 評分72

    llama.cpp 最佳化 lightning indexer 視訊記憶體與多後端支援

    llama.cpp 合併了 qwen4exp 的 lightning indexer 最佳化,把索引器打分視訊記憶體減半:原先同時存在兩個 [n_pool, n_idx_h, n_tokens] f32 張量,現在每個 head 單獨計算並原地累加進一個 [n_pool, n_tokens] 分數。同時 CUDA 支援 4 heads、Metal 用函式常量傳 head 數、Vulkan 按 keys×tokens 分塊並向量化 fp16 點積。

  8. r/LocalLLaMA top of the dayAI 評分40

    Anyworld:本地 LLM 當 DM 的自託管多人文字 RPG

    Anyworld 是一個開源的瀏覽器多人文字冒險遊戲,由房主用 llama.cpp 本地跑模型充當 DM,也支援 OpenAI 等雲 API,玩家只需點連結加入。它支援整輪統一結算、Python 真實骰子、自訂劇本、隱藏觸發器和結構化記憶壓縮,但房主需要 Python 與網路配置能力,本地後端目前只輸出英文,重啟伺服器會丟失當前會話。作者推薦 Gemma 4-26B-A4B Q4、128k 上下文,在 RTX 5070 Ti 16GB 上每輪約 5 秒,採用 MIT 許可。

  9. r/LocalLLaMA top of the dayAI 評分62

    LiquidAI 發布 LFM2.5-Encoder 350M 多語言編碼器

    LiquidAI 發布 LFM2.5-Encoder,含 350M 與 230M 兩個版本,基於 LFM2 架構的雙向掩碼語言模型,支援 15 種語言、8k 上下文,可微呼叫於分類、檢索、重排與語義相似度任務。官方稱其吞吐量追平或超過 ModernBERT,CPU 長上下文更強,並可通過 WebGPU 在瀏覽器執行;GGUF 權重已發布,llama.cpp 支援 PR 已提交。

  10. r/LocalLLaMA top of the dayAI 評分51

    Qwen3.8-Flash-Next 177B 在單張 RTX 5070 12GB 上跑到 11–15 tok/s

    有人在 Windows 上用 llama.cpp 的專家流式方案,在單張 RTX 5070 12GB 加 32GB DDR4-2400 記憶體上跑 Qwen3.8-Flash-Next 177B(UD-IQ3_XXS),基準約 11.5 tok/s,日常對話 14–15 tok/s,比原方案約 7 tok/s 提升明顯。一次長編碼提示以 10.15 tok/s 生成 4,892 個 token,產出一個可執行的單檔案貪吃蛇遊戲。

  11. r/LocalLLaMA top of the day● 精選AI 評分79

    llama.cpp 新 PR 將 Qwen 索引器視訊記憶體減半

    llama.cpp 的 PR #29825 把 Qwen Flash Next 的 indexer score 視訊記憶體佔用減半,例如 131072 上下文、ub 2048 時從 3.0 GiB 降到 1.5 GiB,262144 上下文、ub 4096 時從 11.7 GiB 降到 5.6 GiB。作者稱 logits 完全一致,僅分數因 fp32 舍入有差異,pp/tg 速度不變,test-llama-archs 通過。

  12. r/LocalLLaMA top of the dayAI 評分61

    Strata 搭配 Qwen3.8 Next 讓慢記憶體跑出 45-70t/s

    有使用者用 Strata 加 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 加 7900XTX 的慢速記憶體機器上穩定跑到 45-70t/s,編碼時偶爾更高;同樣配置下調優後的 llama.cpp 最高只有約 22.5t/s。12GB 和 16GB 顯示卡使用者反饋結果相近,DDR5 使用者則明顯更快。作者建議讓 LLM 按自己的硬體配置來設定,並提醒不要用 Q2 權重。

  13. llama.cpp releases● 精選AI 評分80

    llama.cpp 為投機解碼加入機率取樣與拒絕取樣

    llama.cpp 合併 PR #27694,把 simple draft 與 MTP 的投機解碼改為機率取樣,目標模型用拒絕取樣驗證草稿 token。新增開關控制機率草稿取樣,預設仍為貪心;語法約束請求回退到 argmax,並支援在拒絕取樣中處理語法約束。同時修復了草稿取樣器與目標模型共用 rng 流、掩碼後分布未重歸一化等問題,並隨草稿一起截斷候選。

  14. llama.cpp releasesAI 評分58

    llama.cpp 修復 qkx3 量化縮放搜尋的非法舍入

    llama.cpp 合併 PR #29817,在 qkx3 量化級別送入 nearest_int 前先鉗制到 [0, nmax],避免 imatrix 縮放搜尋產生無窮、NaN 或越界值時觸發 Debug 建置斷言。該問題由 #29804 報告,修復同時為 q2_K、q4_K、q5_K、q4_1、q5_1 的退化 imatrix 分組補充迴歸測試。合法範圍內的取值行為不變,macOS Apple Silicon(arm64)等預編譯包已隨本次發布更新。

  15. r/LocalLLaMA top of the dayAI 評分32

    LocalLLaMA 網友曬本地跑模型硬體方案

    r/LocalLLaMA 使用者 pmarsh 發帖稱自己已接近本地推理硬體投入的中間水平,評論區隨即給出多種低成本方案:2014 至 2018 年的 2 至 4 路 DDR3 CPU 伺服器可跑 qwen 3.8 flash 超 15 tok/s;雙 7900XTX 不到 2000 美元可跑 27B Q8 超 220k 上下文;CMP 170HX 視訊記憶體超頻可達 2TB/s,單流解碼約 60 tok/s。

  16. llama.cpp releases● 精選AI 評分68

    llama.cpp 新增 /v1/systemone API,支援 laya 等 5 個模型

    llama.cpp 發布 b11361,在 server 中新增 /v1/systemone API,支援 laya、julia-1、lev、openjev、kev 五個模型,並附帶模型轉換指令碼。該版本加入了共享 prompt 字首與視覺輸入支援,新增用於測試的小模型 openjev tiny,文件中明確說明不支援 date_facts。macOS Apple Silicon(arm64)建置正常,但啟用 KleidiAI 的 arm64 版本被標記為 DISABLED;

10月2日星期五 · 10 則

  1. llama.cpp releasesAI 評分50

    llama.cpp 為 ggml 緩衝區介面新增 alloc_buffer_n 與 get_alloc_size_n

    llama.cpp 的 ggml 後端緩衝區型別介面新增 alloc_buffer_n 與 get_alloc_size_n 方法,並公開 ggml_backend_buft_alloc_buffer_n、ggml_backend_buft_get_alloc_size_n 兩個 API。預設實現負責多緩衝區分割與張量分配,Meta buffer type 提供自訂實現,按裝置建立子上下文並委託給 simple buffer type;

  2. r/LocalLLaMA top of the dayAI 評分59

    llama.cpp 新 PR 把共享專家融合進 CUDA MMVQ

    llama.cpp 的 PR #29184(作者 am17an)提出在 CUDA 後端把 MoE 的共享專家融合進 MMVQ 運算元,為部分 MoE 架構(例如 Qwen 35B A3B)帶來推理加速。評論區給出的初步結論是 token 生成速度最多提升約 5%,屬於穩步積累而非革命性改動。該改動僅針對 CUDA 後端、且只對部分 MoE 架構生效,Metal 等其他後端不受影響。

  3. NVIDIA blog● 精選AI 評分72

    NVIDIA DGX Spark 增 64GB 版,10 月 23 日 4999 美元起

    NVIDIA DGX Spark 將新增 64GB 統一記憶體版本,10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 開賣,起價 4999 美元,保留 GB10 Grace Blackwell 晶片、DGX OS 與完整 NVIDIA AI 軟體棧,可完全本地執行最高 1000 億引數模型。兩臺機器可用 QSFP 線經 ConnectX-7 直連,記憶體池化到 128GB,模型上限提到 2000 億引數;

9月24日星期四 · 1 則

  1. Ollama releases● 精選AI 評分70

    v0.34.4 發布:Qwen 3.8 與 Gemma 4 在 Apple Silicon 上提速

    v0.34.4 發布,更新了 llama.cpp、MLX 和 XGrammar,Qwen 3.8 的提示處理在 Apple Silicon 上更快,Gemma 4 會為每張圖片自動選擇最佳解析度以保留更多高畫質細節。思考模型的結構化輸出改為單次推理完成,速度更快也更可靠;同時修復了本地模型庫很大時偶發的 model not found 報錯,以及 macOS 應用在檢測 ChatGPT 或 Codex 是否執行時無回應的問題。

9月22日星期二 · 1 則

9月21日星期一 · 1 則

更早的內容