港科大等發布首篇自迴歸影片生成 Memory 綜述,110 頁
香港科技大學、香港城市大學、復旦、CMU、NYU、NTU 等機構聯合發布 110 頁綜述《The Past Frames the Future: Memory for Autoregressive Video Generation》,系統梳理自迴歸影片生成中的 Memory 機制。
找到 9 筆
香港科技大學、香港城市大學、復旦、CMU、NYU、NTU 等機構聯合發布 110 頁綜述《The Past Frames the Future: Memory for Autoregressive Video Generation》,系統梳理自迴歸影片生成中的 Memory 機制。
2026 年 10 月 3 日,一篇技術文章批評市面上的 agent 記憶外掛本質都是 RAG:把會話切成片段存入向量庫,每次提示注入最相似的 5 條,存在相似度不等於正確、片段脫離上下文、舊記憶被當作事實、無法審計等問題。作者主張改用文件式記憶,讓 agent 工作前查閱 Markdown 文件、工作後更新,並稱已把這一思路做成外掛 Operator Memory,不使用向量資料庫和嵌入。
llama.cpp 的 PR #29825 通過最佳化索引器分數記憶體,把 Qwen Flash Next 等 Qwen4 模型的視訊記憶體佔用減半。實測在上下文 131072、ub 2048 時從 3.0 GiB 降至 1.5 GiB,262144、ub 4096 時從 11.7 GiB 降至 5.6 GiB。作者稱 logits 逐位一致、pp/tg 速度不變,僅分數因 fp32 舍入有差異;有使用者反饋解碼速度約降 10%。
有使用者報告,用 Strata 執行 Qwen3.8 Next 的 IQ3_XXS 權重(接近 80GB),在 DDR4 記憶體加 7900XTX 的慢速平台上穩定達到 45-70 token/s,編碼時因 mtp 有時更高。同一臺機器上經調優的 llama.cpp 最高約 22.5t/s,且該使用者認為品質明顯更好,但不推薦 Q2 權重。12GB 和 16GB 顯示卡使用者有類似結果,DDR5 平台則顯著更快。
Percepta 公布新架構 Spotlight,用可讀寫記憶取代注意力機制,宣稱是首個實現記憶無限增長而不增加訪問成本的架構。每個 token 只讀寫少量記憶單元,稀疏度可任意調節,不像 MoE 那樣固定啟用比例。該架構把負責計算的智慧模組與存放知識、流程和狀態的記憶分離,模型權重不隨記憶增長而改變,可自行決定載入與覆寫,從而無需重訓練即可獲得新能力。
Google 公布 Private AI Compute 新架構,將在雲端加入持久化記憶層,實現跨裝置連續 AI 助手體驗,同時保持端側級別的隱私標準。資料加密存放在雲端專用儲存中,解密金鑰僅保留在使用者裝置上,Google 自身也無法讀取;模型需要呼叫時通過端到端加密通道進入硬體隔離的安全飛地,臨時解密、寫入新上下文後立即重新加密。此前該平台及業界同類方案均為無狀態,任務結束即清除上下文。
llama.cpp 發布 b11446,Metal 後端修復量化 flash attention 中 threadgroup memory 超額佔用的問題,對應 PR #29340。
Docker 發布 docker-agent,一個 Docker CLI 外掛,可用宣告式 YAML 配置建置、執行和分享 AI 智慧體,無需寫程式碼。它支援多智慧體協作、內建工具與任意 MCP server,模型側相容 OpenAI、Anthropic、Gemini、AWS Bedrock、Mistral、xAI 與 Docker Model Runner,並自帶 think、todo、memory 工具和基於 BM25、嵌入與重排序的 RAG。
一份 50 篇材料、約 1300 題的新基準(Telegraph Test,程式碼與資料已開源)顯示,只需一句小寫指令讓模型用 1866 年跨大西洋電纜時代的電報體(cablese)撰寫壓縮記錄,輸出 token 可省 40%–49%,而下游模型讀取這些記錄的準確率不低於明文(恢復比 0.99–1.10)。GLM-5.3-Flash 自身省 48.4%,qwen3.8-27b 省 48.9%,gemma-4-31b 省 40.4%;