October 7, 2026
Anthropic 發布 Claude Haiku 5.5,面向高併發與低延遲場景,支援 1M token 上下文、128k 最大輸出,預設開啟可用 effort 引數調節的 adaptive thinking,已在 Claude API、Amazon Bedrock、AWS、Google Cloud 與 Microsoft Foundry 上線。
依意思最接近的 17 筆
Anthropic 發布 Claude Haiku 5.5,面向高併發與低延遲場景,支援 1M token 上下文、128k 最大輸出,預設開啟可用 effort 引數調節的 adaptive thinking,已在 Claude API、Amazon Bedrock、AWS、Google Cloud 與 Microsoft Foundry 上線。
llama.cpp 的 PR #29825 通過最佳化索引器分數記憶體,把 Qwen Flash Next 等 Qwen4 模型的視訊記憶體佔用減半。實測在上下文 131072、ub 2048 時從 3.0 GiB 降至 1.5 GiB,262144、ub 4096 時從 11.7 GiB 降至 5.6 GiB。作者稱 logits 逐位一致、pp/tg 速度不變,僅分數因 fp32 舍入有差異;有使用者反饋解碼速度約降 10%。
一篇隨筆主張,AI 正在瓦解支撐個人智力活動的知識社群,使長期、複雜的私人思考越來越難維持。作者以軟體工程為例:Claude Code 發布一年多,行業討論從編譯器、型別系統轉向 prompt、harness、loop,變得狹窄膚淺;寫部落格、開源庫或設計新程式語言也不再有人類讀者,內容只會被下一代模型消化。文章稱數學領域正經歷類似過程,並認為持續的知識活動需要共享成果與他人認可這兩種無法獨自獲得的輸入。
llama.cpp 發布 b11411,修復恢復 KV cache 時 rotation 後設資料不匹配的問題:現在會儲存精確的 rotation 後設資料,並拒絕恢復與之不匹配的快取。原先的 state rotation 測試被移入 test-save-load-state,納入儲存/載入測試矩陣,對所有受測模型執行,並探測模型支援的 KV cache 型別組合,不使用 attention rotation 的模型視為空通過。
llama.cpp 新版修復了請求指定繁忙 id_slot 時的上下文錯亂問題。此前這類請求仍會先在該 slot 上執行 prompt cache 更新,若 RAM 快取命中更好的匹配,就會把新上下文載入仍在生成中的 slot,導致生成在錯誤上下文上繼續;現在繁忙 slot 會原樣返回,請求排隊等待(#30295)。
2026 年 10 月 3 日,一篇技術文章批評市面上的 agent 記憶外掛本質都是 RAG:把會話切成片段存入向量庫,每次提示注入最相似的 5 條,存在相似度不等於正確、片段脫離上下文、舊記憶被當作事實、無法審計等問題。作者主張改用文件式記憶,讓 agent 工作前查閱 Markdown 文件、工作後更新,並稱已把這一思路做成外掛 Operator Memory,不使用向量資料庫和嵌入。
OpenAI 於 9 月 21 日發布官方戰略宣告,把自動化 AI 研究員與遞迴自我改進(RSI)列為下一階段重要目標,並計劃在 2028 年 3 月前打造真正的自動化 AI 研究員;Anthropic 同期披露,截至 8 月 Claude 已在約 26% 的內部 AI 研發工作中承擔主導角色。
Claude Code 發布 v2.1.294,修復了以自然語言指令編寫的 prompt 與 agent hooks 會放行本應被攔截操作的問題——使用者寫「攔截某類命令」時,這些命令此前可能照常執行。該版本還改進了 Stop 與 SubagentStop 上同類指令式 prompt hooks 的判斷,例如「建置失敗也繼續」這類寫法,讓 Claude 更不容易提前停止。更新說明未列出其他改動。
OpenAI 官方帳號發布提示,邀請使用者試用互動式回答(interactive answers)來定製自己的回覆。原文僅有這一句,未說明該功能出現在哪個產品、如何進入、開放範圍與上線時間。
Claude Code 會在任務完成後於輸入框預填一條建議的下一條訊息,例如 run the tests 或 commit this,使用者可直接傳送或先行編輯。作者認為該功能的真正受益方是模型:原樣傳送等於正樣本,編輯後的原文與改後版本構成偏好對,diff 顯示出預測錯在哪裡,從而在使用者正常工作中低成本產出 RLHF 所需資料,且來自真實程式碼庫而非合成基準。作者同時宣告這只是猜測,Anthropic 如何使用該訊號、會話是否用於訓練取決於套餐與隱私設定。
近期出現一批極窄用途的推理執行時,包括 Strata、ninfer、DwarfStar、Splash、llamAmpere、gufo 等。它們刻意放棄 llama.cpp 與 vLLM 擅長的通用性,只針對少數模型甚至單一硬體家族(如 Strix Halo)做最佳化。作者認為通用執行時負責相容、過擬合執行時負責極致效能將成為常態,並有助於智慧的民主化與去中心化,讓現有硬體在特定配置下榨出最大輸出。
因果智慧公司 Aether AI 公布機器人系統 CRIS-0 的官方 Demo,靠提取物理因果變數而非端到端擬合驅動機械臂。在咖啡製作測試中遭遇人為移位與光照突變,系統平均 2 秒內完成重規劃,10 次隨機擾動有 9 次有效恢復;客廳長程整理可連續執行數十步,20 條模糊指令完成 18 次精準抓放,危險變數出現時 0.2 秒急停。
Percepta 公布新架構 Spotlight,用可讀寫記憶取代注意力機制,宣稱是首個實現記憶無限增長而不增加訪問成本的架構。每個 token 只讀寫少量記憶單元,稀疏度可任意調節,不像 MoE 那樣固定啟用比例。該架構把負責計算的智慧模組與存放知識、流程和狀態的記憶分離,模型權重不隨記憶增長而改變,可自行決定載入與覆寫,從而無需重訓練即可獲得新能力。
llama.cpp 發布 b11507 版本,新增 MoE 快取跨多張 GPU 的支援(PR #30112),可讓混合專家模型在多 GPU 環境下更充分地利用視訊記憶體。該版本同時更新了各平台預編譯產物,覆蓋 macOS Apple Silicon、iOS、Linux(CUDA 12/13、Vulkan、ROCm 10.0、SYCL、OpenVINO)、Windows、Android 以及 openEuler 等平台。
llama.cpp 發布 b11402 版本,CUDA 後端改為優先採用整塊(whole-tile)FlashAttention 排程,以提升兩階段核心效率。
OpenAI 產品負責人 Tibo Sottiaux 發帖預告未來模型會更擅長刪除和簡化程式碼,並在評論中確認 Astra 6.1「coming soon」。負責 coding post-training 的研究員 Rajan Agarwal 轉發該帖,並公開徵集使用者遇到的 sloppy code 與程式碼品質問題。《華爾街日報》此前報導,Astra 6.1 原計劃 10 月發布,因內部安全測試中在權限邊界上表現不穩而被臨時叫停。
ServiceNow CoreAI 團隊發布 AutoSynthData,用目標模型的失敗案例和更強教師模型的成功軌跡定位能力缺口,再自動生成並驗證新任務用於後訓練。任務由系統規範、使用者提示和驗證器三部分組成,需滿足可行性、真實性與難度要求,驗證器則要求一致、可靠且不繫結單一參考軌跡。團隊在 EnterpriseOps Gym 資料集上演示了該流程,模型提升後課程會轉向仍難完成的任務。