r/LocalLLaMA top of the day10/2 18:47AI 評分65
Percepta 發布 Spotlight 架構:智慧與記憶分離
Percepta 發布新架構 Spotlight,用可讀寫記憶取代 attention,宣稱是首個記憶無限增長而訪問成本不上升的架構。它把做計算的智慧模組與存知識、技能和狀態的記憶分開,記憶增長時模型權重不變。模型逐 token 決定載入與覆蓋哪些記憶單元,因此無需重訓練即可獲得新能力。
找到 4 筆
Percepta 發布新架構 Spotlight,用可讀寫記憶取代 attention,宣稱是首個記憶無限增長而訪問成本不上升的架構。它把做計算的智慧模組與存知識、技能和狀態的記憶分開,記憶增長時模型權重不變。模型逐 token 決定載入與覆蓋哪些記憶單元,因此無需重訓練即可獲得新能力。
llama.cpp 的 PR #29184 在 CUDA 後端把共享專家融合進 MMVQ,為部分 MoE 架構提速。評論區稱 token 生成速度最多提升約 5%,且只對 Qwen 35B A3B 這類 MoE 架構有效。
Ollama 發布 v0.40.0,在 Apple Silicon 裝置上,MLX 執行時支援的模型架構會自動改用 MLX 執行。示例命令為 ollama pull qwen3.8 與 ollama run qwen3.8。預發布階段還會繼續測試並啟用更多模型。
v0.35.1-rc0 允許在 Modelfile 中宣告 CAPABILITY,並在 create 請求中增加 capabilities 欄位。這些宣告會在 GGUF、safetensors 的建立、繼承與 Modelfile 匯出中保留。排程 System One 請求前須先判定 capability,不再依賴 Qwen 架構與渲染器後設資料匹配;評分仍限 GGUF,MLX 執行時改動另行處理。