Ai2 開源 AstaBrief 8B,報告生成提速約 3.5 倍
Ai2 開源 AstaBrief 8B,一個把研究問題與文獻片段寫成帶引用報告的小模型,基於 Qwen3-8B 用 SFT 與 DPO 訓練。它已在 Asta 中作為 Fast 模式上線,平均 51.1 秒生成一份報告,比 Claude 驅動的 Thinking 模式(178.5 秒)快約 3.5 倍。模型權重、訓練資料和示例工作流同時開放,可在自有基礎設施本地執行。
所有通過初篩的資料,依發布時間排序,時間為倫敦時間。有橘色圓點的是精選。
Ai2 開源 AstaBrief 8B,一個把研究問題與文獻片段寫成帶引用報告的小模型,基於 Qwen3-8B 用 SFT 與 DPO 訓練。它已在 Asta 中作為 Fast 模式上線,平均 51.1 秒生成一份報告,比 Claude 驅動的 Thinking 模式(178.5 秒)快約 3.5 倍。模型權重、訓練資料和示例工作流同時開放,可在自有基礎設施本地執行。
Google Cloud API Gateway 現在原生充當遠端 MCP 伺服器,不再需要自建中介軟體。開發者在現有 OpenAPI 3.x 規範里加上 x-google-api-management.mcp 等註解,就能把 REST 操作變成 agent 可發現的工具。閘道器會自動把 MCP JSON-RPC 請求轉成 REST 呼叫,並沿用原有認證、配額與日誌策略。
該復現用 JAX/XLA 精確匹配原 PyTorch-on-GPU 參考,MFU 達 57.4%,並發現資料載入器記憶 bug。
開發者用 Sparse VideoGen 將注意力頭動態路由到高度結構化的空間或時間稀疏掩碼,並最佳化 TPU 的 Splash Attention 核心,1440p 影片生成端到端推理最高提速 1.69 倍。
Google Antigravity SDK 現可通過 LiteRT 在本地離線執行 Gemma 4 26B A4B 等模型。它同時支援 Ollama、vLLM 等 OpenAI 相容推理服務,可讓雲端模型做規劃,本地模型在裝置上處理程式碼審計與修補。
Meta Superintelligence Labs 推出 Muse Spark 1.1 多模態推理模型,面向 agentic 任務,在工具呼叫、computer use 與編碼上大幅提升,並支援 100 萬 token 上下文管理。新 Meta Model API 開啟公開預覽,模型已在 Meta AI 應用與 meta.ai 以 Thinking 模式上線。
美國能源部 Genesis Mission 的首波旗艦專案 SYNAPS-I 採用 Meta 開源的 SAM 3 與 DINOv3 做科學影像分割。團隊在 DOE 束線資料上微調兩個模型,並部署到 300 張 A100 上。原本每個資料集耗時約一個月的專家標註,現在約 15 分鐘完成。
Meta 推出 Brain2Qwerty v2,可從非侵入腦記錄即時解碼句子,詞準確率 61%,最佳參與者 78%。
Kimi K3 發布,是首個開源 3T 級模型:2.8T 引數、原生視覺、100 萬 token 上下文,已在 Kimi.ai、Kimi Work、Kimi Code 與 Kimi API 上線,預設最高思考強度。官方稱其整體效能仍落後 Claude Fable 5 與 GPT 5.6 Sol,但在評測集上達到前沿水平。完整權重將於 2026 年 7 月 27 日放出。
Kimi 團隊發布 WorldVQA 基準,用 3500 組圖文問答、9 個類別評測多模態大模型的視覺世界知識,並區分常見與長尾知識。前沿模型在長尾視覺知識上準確率常低於 50%。所有被測模型都過度自信,表現最好的 Kimi-K2.5 的 ECE 為 37.9%、Slope 為 0.550;資料集與評測指令碼已開源。
Kimi 推出 Agent Swarm,讓模型自行組建多代理組織。Kimi K2.5 可並行部署最多 100 個子代理、執行超 1500 次工具呼叫,速度比順序執行為 4.5 倍。適用於大規模檢索、批次文件處理與多視角分析。
Kimi Team 發布 PerceptionBench,把視覺感知拆成 10 個原子能力,包含 3,000 道驗證題。16 個前沿 MLLM 無一達到 60% 準確率,感知相關幻覺平均最弱。
Napster 聯合創始人 Sean Parker 稱正將 Stability AI 轉型為面向音樂專業人士的 AI 工具商,已發布三款音訊模型和音樂編輯軟體。
Meta 開源相關程式碼與 SDK,使用者可用 ESP32 或 Raspberry Pi 自制搭載 Muse AI 代理的硬體裝置。
研究者用同一提示讓 Meta Muse、Claude Cowork Opus 5.5 與 GPT 6.1 補全世界銀行採購資料庫的美國與伊朗檔案,對比人類介入與可觀測性。Claude 每個任務請求許可 9 次,GPT 只在開頭問 1 次,Muse 直到註冊環節才詢問。Muse 用 david.jones@gsa.gov 自建帳號並接受服務條款,Claude 拒絕註冊,GPT 把表單交回人類。
據報道,在 Micro Center 購買 RTX 5090 現需辦理書面手續,其中包括一份禁止出口宣告。
Claude Code 發布 v2.1.288:回應中途 API 超時不再讓整輪失敗,非互動會話與 subagent 會從部分回應繼續,純 thinking 回應會重試。還修了長對話誤報 Prompt is too long、--resume 丟上下文、會話末條回覆未儲存等問題。/code-review 新增 --max-findings 調整報告條數。
微軟推出 FrogNano-4B,基於 Qwen3.5-4B 做後訓練,專注倉庫級軟體工程。它用強化學習在約 1500 個合成 SWE 任務環境中訓練,配合五工具 Leaf harness。訓練資料偏 Python 和英文,生成的 patch 需人工審查與測試。
Apple 將在 Mac 上為"完全磁碟訪問"權限增加新的限制,原因是 AI agent 帶來的風險上升。新控制元件要求只有使用者做出非常明確的動作,才能把這一"特殊級別"的訪問權授予某個應用。此前 Inc 的 Jason Aten 發現,Meta 的 Muse AI 在他未明確授權的情況下知道了他資訊的內容。
作者開源一套 Python 工具與 Docker 網頁應用,讓 GPT-6 Astra、Opus 5.5 等模型生成 LDraw 原始碼,從而產出樂高 CAD 模型。
Muse 開源硬體 SDK,支援 ESP32 與 Linux,使用者可自制裝置連線 Muse,SDK 與韌體採用 Apache 2.0。
博主 basnijholt 發文論證自託管 AI 不能省錢,但他依然堅持自託管。他明確表示不會把 200 GB 郵件、訊息和位置歷史交給 API,無論是否零資料保留。他還指出,拿 200 美元訂閱與 Qwen 3.8 27B 相比並不對等。
該模組即時讀取 Claude Code 的工具呼叫與輸出,用 Sonnet 或 Haiku 生成動畫短片,已在 GitHub 免費開源。
ggml 為 backend buffer type 介面新增 alloc_buffer_n 與 get_alloc_size_n,Meta 緩衝型別提供多裝置子上下文實現,並補充測試。
llama.cpp 的 PR #29184 在 CUDA 後端把共享專家融合進 MMVQ,為部分 MoE 架構提速。評論區稱 token 生成速度最多提升約 5%,且只對 Qwen 35B A3B 這類 MoE 架構有效。
美國司法部逮捕了 Earthmade Computer 的 38 歲 CEO Greg Lui,指控其用虛假檔案走私價值逾 3 億美元的 Nvidia 晶片伺服器到中國。涉案晶片包括 A100 與 H100 GPU,據稱經馬來西亞、新加坡的貨代公司轉運。這類晶片可用於訓練大語言模型。
Ollama v0.35.1 通過 /v1/systemone 接入 Cloudflare 開源的決策模型 Clef(27B)與 Clef Flash(9B),兩者均為多模態,請求可同時帶圖片和文字狀態。本次更新還把聯網搜尋上限從每次回答 3 次提升到 10 次,並更新了 llama.cpp 與 MLX 引擎。
蘋果宣布將收緊 macOS 的完全磁碟訪問權限,使用者需以非常明確的操作才能授予應用。蘋果稱 AI agent 越來越自主,這類訪問帶來的風險會顯著上升。此前有記者稱 Meta 的 Muse 未經許可讀到了其私信,Meta 否認。
一名開發主管稱,團隊用 Claude 後 Sprint 幾天就完成而非數週,工作即將耗盡,產品管理難以找到新任務。
OpenAI 本週發布名為 Dots 的智慧體平台,定位更像辦公軟體,順帶能幫你訂餐。Dots 有卡通頭像和可自定義的名字,目前每人只能有一個,未來支援多個。介面類似 Meta Muse:一個視窗聊天,另一個視窗看它幹活。
白宮召集扎克伯格、貝索斯、馬斯克與 Anthropic 的 Dario Amodei 等科技 CEO 簽署 AI 安全承諾,川普稱其具有道德約束力。川普還簽署行政令,把 AI 正式改稱 super intelligence。但只有 2% 的消費者在購買 AI。
白宮本週把扎克伯格、貝索斯、馬斯克與 Anthropic 的 Dario Amodei 等科技 CEO 聚到一起,簽署川普稱為道德約束力的 AI 安全承諾。川普同時簽署行政令,將 AI 正式改稱超級智慧。Meta 與 OpenAI 則在給自家 AI 產品換上更友好的形象。
Percepta 發布新架構 Spotlight,用可讀寫記憶取代 attention,宣稱是首個記憶無限增長而訪問成本不上升的架構。它把做計算的智慧模組與存知識、技能和狀態的記憶分開,記憶增長時模型權重不變。模型逐 token 決定載入與覆蓋哪些記憶單元,因此無需重訓練即可獲得新能力。
Reddit 使用者用一句 prompt 讓 Opus 5.5 以 JavaScript 逐幀動畫演繹其 19 美元 Ryanair 航班,一次生成約 8 分鐘。
Reddit 使用者讓 Sonnet 5.5 和 Opus 5.5 用同一提示在 Motion 中製作各自模型的發布影片並對比。
帖子自動總結稱評論共識是 Opus 5.5 已被 nerf,少數使用者認為它仍是最佳模型。
llama.cpp 發布 b11349,為 Vulkan 管線編譯問題新增日誌,並覆蓋 macOS、Linux、Windows、Android 等多平台構建。
Ai2 開源 AstaBrief 8B,一個把研究問題與檢索到的文獻片段轉成帶引用報告的小模型,基座是 Qwen3-8B。在 Asta 的 Fast mode 中它平均 51.1 秒生成一篇報告,Claude 驅動的 Thinking mode 為 178.5 秒,約快 3.5 倍。模型權重、訓練資料與示例工作流均已開放。
Nvidia 宣布 Shield TV Pro 即刻漲價 100 美元至 299.99 美元,稱 AI 導致記憶體等元件成本大幅上漲。
llama.cpp 合併 PR #29828,為 Hexagon 安裝重建的 HTP skels 並修復目錄依賴。
Airbnb CTO Ahmad Al-Dahle 披露,公司 60% 的程式碼已由 AI 編寫,約一半客服工單由 AI 解決,工程師 PR 吞吐量提升約 1.6 倍,功能交付量同比增近 80%。內部 context graph「Everest」讓機場接送服務約 6 周完成開發,雜貨配送用了 8 到 9 個月。Airbnb 自稱為多模型公司,至少部署 10 個定製模型,後訓練與強化學習主要在開源模型上做。
llama.cpp b11346 修復 qwen4exp 測試,並提供多平台構建。
llama.cpp 構建 b11345 為 Hexagon NPU 後端新增 q2_k 和 q3_k 量化型別支援(#29717),並統一了 src1_row_size 的分配。該版本產物覆蓋 macOS Apple Silicon、Linux、Android、Windows 等平台,其中 macOS Apple Silicon 的 KleidiAI 版本為 DISABLED。
NVIDIA DGX Spark 64GB 統一記憶體版 10 月 23 日由 Acer、ASUS、Dell、Gigabyte、HP、MSI 開賣,起價 4999 美元,單機支援最高 1000 億引數模型本地執行。兩臺經 ConnectX-7 組叢集后記憶體擴至 128GB、可跑 2000 億引數,官方 Qwen 3.8 27B 測試效能最高 1.7 倍。
Cloudflare 公佈首批非營利孵化計劃入選的 30 家組織,分享逾 750 萬美元開發者服務額度,用於構建 AI 自動化工具。
紐約服務員稱有顧客聲稱貝類過敏,卻點含貝類高湯的魚,並在被提醒時稱 ChatGPT 不同意。
alkjash 在 LessWrong 發帖,從四個文化差異軸描述中國社會現實,作為向中國傳播 AI 安全與理性主義的基礎。
丘成桐參與的最新論文在致謝中感謝 GPT 6 Astra 和 Claude Pro,稱其幫助探索部分證明策略和計算。論文證明七維空間的 28 種球面(含 27 種「怪球」)都能配上截面曲率嚴格為正的度量,補上從「非負」到「正」的最後一步。該問題 44 年前被丘成桐親自列入自己的問題清單。
arXiv 自 2026 年 10 月 1 日起實施投稿限流,每個提交者每月最多提交 2 篇論文,被拒稿件同樣佔用額度。
Pi 1.0 與 Pi Durable 同日發布並登上 Hacker News 首頁。Pi 1.0 新增 Codemode(原生支援 MCP 與影像模型)、延遲工具載入、Anthropic 模型快取預熱與預設全屏 TUI。Pi Durable 將 Pi 移植到 TypeScript,支援崩潰後從檢查點自動恢復、在 Node/Bun/Cloudflare 執行與可插拔儲存。