AISpot

搜尋

依意思最接近的 17 筆

r/LocalLLaMA top of the dayAI 評分70

llama.cpp 新 PR 將 Qwen4 索引器視訊記憶體減半

llama.cpp 的 PR #29825 通過最佳化索引器分數記憶體,把 Qwen Flash Next 等 Qwen4 模型的視訊記憶體佔用減半。實測在上下文 131072、ub 2048 時從 3.0 GiB 降至 1.5 GiB,262144、ub 4096 時從 11.7 GiB 降至 5.6 GiB。作者稱 logits 逐位一致、pp/tg 速度不變,僅分數因 fp32 舍入有差異;有使用者反饋解碼速度約降 10%。

Hacker News front pageAI 評分49

隨筆:AI 瓦解知識社群,私人知識活動難以為繼

一篇隨筆主張,AI 正在瓦解支撐個人智力活動的知識社群,使長期、複雜的私人思考越來越難維持。作者以軟體工程為例:Claude Code 發布一年多,行業討論從編譯器、型別系統轉向 prompt、harness、loop,變得狹窄膚淺;寫部落格、開源庫或設計新程式語言也不再有人類讀者,內容只會被下一代模型消化。文章稱數學領域正經歷類似過程,並認為持續的知識活動需要共享成果與他人認可這兩種無法獨自獲得的輸入。

llama.cpp releasesAI 評分47

llama.cpp b11411 修復 KV cache 旋轉後設資料不匹配問題

llama.cpp 發布 b11411,修復恢復 KV cache 時 rotation 後設資料不匹配的問題:現在會儲存精確的 rotation 後設資料,並拒絕恢復與之不匹配的快取。原先的 state rotation 測試被移入 test-save-load-state,納入儲存/載入測試矩陣,對所有受測模型執行,並探測模型支援的 KV cache 型別組合,不使用 attention rotation 的模型視為空通過。

llama.cpp releasesAI 評分46

llama.cpp 修復繁忙 slot 被載入錯誤上下文的問題

llama.cpp 新版修復了請求指定繁忙 id_slot 時的上下文錯亂問題。此前這類請求仍會先在該 slot 上執行 prompt cache 更新,若 RAM 快取命中更好的匹配,就會把新上下文載入仍在生成中的 slot,導致生成在錯誤上下文上繼續;現在繁忙 slot 會原樣返回,請求排隊等待(#30295)。

Hacker News front pageAI 評分42

文章稱 agent 不需要記憶外掛,應改用文件式記憶

2026 年 10 月 3 日,一篇技術文章批評市面上的 agent 記憶外掛本質都是 RAG:把會話切成片段存入向量庫,每次提示注入最相似的 5 條,存在相似度不等於正確、片段脫離上下文、舊記憶被當作事實、無法審計等問題。作者主張改用文件式記憶,讓 agent 工作前查閱 Markdown 文件、工作後更新,並稱已把這一思路做成外掛 Operator Memory,不使用向量資料庫和嵌入。

機器之心AI 評分42

OpenAI 將 RSI 列為戰略目標,MemoraX 展示記憶驅動自進化

OpenAI 於 9 月 21 日發布官方戰略宣告,把自動化 AI 研究員與遞迴自我改進(RSI)列為下一階段重要目標,並計劃在 2028 年 3 月前打造真正的自動化 AI 研究員;Anthropic 同期披露,截至 8 月 Claude 已在約 26% 的內部 AI 研發工作中承擔主導角色。

Claude Code releasesAI 評分45

v2.1.294

Claude Code 發布 v2.1.294,修復了以自然語言指令編寫的 prompt 與 agent hooks 會放行本應被攔截操作的問題——使用者寫「攔截某類命令」時,這些命令此前可能照常執行。該版本還改進了 Stop 與 SubagentStop 上同類指令式 prompt hooks 的判斷,例如「建置失敗也繼續」這類寫法,讓 Claude 更不容易提前停止。更新說明未列出其他改動。

Hacker News front pageAI 評分53

Claude Code 新增建議訊息功能,作者稱真正客戶是模型

Claude Code 會在任務完成後於輸入框預填一條建議的下一條訊息,例如 run the tests 或 commit this,使用者可直接傳送或先行編輯。作者認為該功能的真正受益方是模型:原樣傳送等於正樣本,編輯後的原文與改後版本構成偏好對,diff 顯示出預測錯在哪裡,從而在使用者正常工作中低成本產出 RLHF 所需資料,且來自真實程式碼庫而非合成基準。作者同時宣告這只是猜測,Anthropic 如何使用該訊號、會話是否用於訓練取決於套餐與隱私設定。

r/LocalLLaMA top of the dayAI 評分42

專用推理引擎興起,放棄通用性換極致效能

近期出現一批極窄用途的推理執行時,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 與 vLLM 擅長的通用性,只針對少數模型甚至單一硬體家族(如 Strix Halo)做最佳化。作者認為通用執行時負責相容、過擬合執行時負責極致效能將成為常態,並有助於智慧的民主化與去中心化,讓現有硬體在特定配置下榨出最大輸出。

量子位● 精選AI 評分68

Aether AI 公布 CRIS-0:0.2 秒急停、秒級重規劃

因果智慧公司 Aether AI 公布機器人系統 CRIS-0 的官方 Demo,靠提取物理因果變數而非端到端擬合驅動機械臂。在咖啡製作測試中遭遇人為移位與光照突變,系統平均 2 秒內完成重規劃,10 次隨機擾動有 9 次有效恢復;客廳長程整理可連續執行數十步,20 條模糊指令完成 18 次精準抓放,危險變數出現時 0.2 秒急停。

r/LocalLLaMA top of the dayAI 評分68

Percepta 發布 Spotlight 架構,記憶可無限增長

Percepta 公布新架構 Spotlight,用可讀寫記憶取代注意力機制,宣稱是首個實現記憶無限增長而不增加訪問成本的架構。每個 token 只讀寫少量記憶單元,稀疏度可任意調節,不像 MoE 那樣固定啟用比例。該架構把負責計算的智慧模組與存放知識、流程和狀態的記憶分離,模型權重不隨記憶增長而改變,可自行決定載入與覆寫,從而無需重訓練即可獲得新能力。

llama.cpp releases● 精選AI 評分69

llama.cpp b11507 支援 MoE 快取跨多 GPU

llama.cpp 發布 b11507 版本,新增 MoE 快取跨多張 GPU 的支援(PR #30112),可讓混合專家模型在多 GPU 環境下更充分地利用視訊記憶體。該版本同時更新了各平台預編譯產物,覆蓋 macOS Apple Silicon、iOS、Linux(CUDA 12/13、Vulkan、ROCm 10.0、SYCL、OpenVINO)、Windows、Android 以及 openEuler 等平台。

機器之心AI 評分50

OpenAI 預告 Astra 6.1,主打刪減屎山程式碼

OpenAI 產品負責人 Tibo Sottiaux 發帖預告未來模型會更擅長刪除和簡化程式碼,並在評論中確認 Astra 6.1「coming soon」。負責 coding post-training 的研究員 Rajan Agarwal 轉發該帖,並公開徵集使用者遇到的 sloppy code 與程式碼品質問題。《華爾街日報》此前報導,Astra 6.1 原計劃 10 月發布,因內部安全測試中在權限邊界上表現不穩而被臨時叫停。

Hugging Face blogAI 評分58

ServiceNow 發布 AutoSynthData,為企業 agent 自動生成訓練資料

ServiceNow CoreAI 團隊發布 AutoSynthData,用目標模型的失敗案例和更強教師模型的成功軌跡定位能力缺口,再自動生成並驗證新任務用於後訓練。任務由系統規範、使用者提示和驗證器三部分組成,需滿足可行性、真實性與難度要求,驗證器則要求一致、可靠且不繫結單一參考軌跡。團隊在 EnterpriseOps Gym 資料集上演示了該流程,模型提升後課程會轉向仍難完成的任務。