AISpot

搜尋

依意思最接近的 7 筆

機器之心● 精選10/7 13:35AI 評分73

哈工大深圳與 NUS 提出 QuantWM,2-bit KV Cache 壓縮 6.2 倍

哈工大(深圳)與新加坡國立大學團隊提出免訓練 2-bit KV Cache 量化框架 QuantWM,面向影片世界模型,實際壓縮最高 6.20 倍。研究指出,現有量化方法在 VBench 等指標上接近 BF16,畫面卻仍有閃爍、模糊和失真,原因是 Key 的量化誤差改變了注意力分數排序,使模型選中不同的歷史幀或影像塊。

llama.cpp releases10/2 14:11AI 評分43

llama.cpp 為 Hexagon NPU 增加 q2_k 與 q3_k 量化支援

llama.cpp 合併 PR #29717,為 Hexagon 後端新增 q2_k 和 q3_k 兩種量化型別支援,並統一了 src1_row_size 的分配方式。該改動由高通工程師 Max Krasnyansky 參與提交,面向在驍龍 Hexagon NPU 上執行本地推理的使用者,相關建置覆蓋 Linux arm64 與 Android arm64 的 Snapdragon CPU、Adreno GPU、Hexagon NPU 組合。

OpenAI News10/6 13:00AI 評分44

Jump Trading 用 GPT-6 Astra 讓 agent 承擔數天級量化研究

Jump Trading 的 LLM 研發負責人 Lucas Baker 表示,引入 OpenAI GPT-6 Astra 後,可交給 agent 的量化研究工作流在規模與複雜度上大幅提升,從日常寫程式碼擴充套件到需要執行數天、跨多資料來源的完整分析。過去需要頻繁人工指導與干預,現在團隊只需定義安全、可監控的環境與明確目標,讓 agent 自行尋找路徑,並在長任務中自我評估、遞迴改進。在受監管的金融行業,agent 產出的交易訊號仍按普通訊號處理,需人工稽核並納入嚴格控制的執行環境。

Hacker News front page10/4 13:51AI 評分62

Strata 讓 125B 的 Qwen3.8-Flash-Next 在消費級顯示卡上執行

開源專案 Strata 可在普通遊戲 PC 上本地執行 125B 引數的 Qwen3.8-Flash-Next,支援聊天、寫程式碼、讀圖和接入 coding agent,資料不出本機。官方實測 RTX 5070(12GB)在 Q2_0 量化下寫答案 94 tokens/s、讀 32K 提示 2650 tokens/s;RTX 3090(24GB)預計可達 100-140 tokens/s。

r/LocalLLaMA top of the day10/3 15:16AI 評分11

r/LocalLLaMA 熱議 8GB 視訊記憶體跑本地模型的困境

Reddit 的 r/LocalLLaMA 版塊一則帖子被版主以違反第 3 條規則為由刪除,評論區仍在討論 8GB 視訊記憶體加 16GB 記憶體的低配硬體如何跑本地模型。有使用者提到 32GB 記憶體加 12GB 視訊記憶體可執行 LFM2.5,也有人建議 Ling 3.0 tiny 或 Gemma 配合 mmap。另有評論稱專家快取即將進入 llama.cpp,未來或支援從磁碟流式載入專家。