LIBERO-MAX 評測機器人執行中途的環境變化,成功率最多降 25.7 個百分點
斯坦福、CMU、MIT 等機構的研究者發布機器人評測基準 LIBERO-MAX,專門檢驗機器人在任務執行途中遭遇環境變化後能否繼續完成,論文入選 NeurIPS'26 Robotics World Modeling Workshop 口頭報告。它用共享初始狀態、指令與隨機種子的配對執行,建置 8,000 組案例和 8 類中途變化,涵蓋目標移動、容器移動、相機視角改變、感測器噪聲等;
依意思最接近的 13 筆
斯坦福、CMU、MIT 等機構的研究者發布機器人評測基準 LIBERO-MAX,專門檢驗機器人在任務執行途中遭遇環境變化後能否繼續完成,論文入選 NeurIPS'26 Robotics World Modeling Workshop 口頭報告。它用共享初始狀態、指令與隨機種子的配對執行,建置 8,000 組案例和 8 類中途變化,涵蓋目標移動、容器移動、相機視角改變、感測器噪聲等;
LibreOffice 背後的非營利組織 Document Foundation 表示,在可預見的未來不會把 AI 加入這款開源辦公軟體。8 月底發布的最新版已重申軟體不含任何生成式 AI 功能,這是刻意設計,以確保使用者文件不被上傳伺服器處理、軟體不依賴網路連線即可執行。該組織稱目前沒有能滿足其全部要求的 AI 整合方案,希望使用 AI 的使用者可自行安裝擴充套件,連線本地 AI 模型。
Anthropic 宣布 Claude Max 與 Team 套餐現在每月附帶 API 額度,訂閱使用者可按月領取並用於 API 呼叫。公告未給出具體額度數值、適用模型或有效期,只說明領取方式見幫助文件「API credits for Max and Team plans」。該資訊發布於 2026 年 10 月 7 日。
EventMaxxer 是一個開源專案,讓 coding agent 根據使用者設定的活動目標自動搜尋 Meetup、會議、工作坊、駭客松等各類活動,並批次申請符合條件的免費活動。它會用 Google Sheets 或 CSV 記錄活動詳情、報名狀態和出席決定,支援複用個人資料、自動等待限流後重試。使用需 agent 具備瀏覽器操作能力,可選本地 runner 要求 Python 3.9+ 的 macOS/Linux,Google Sheets 需聯結器。
Mistral AI 官方帳號宣布,Mistral Large 4 在 Harvey 的 Legal Agent Benchmark(LAB)中位列開源模型第一。該推文以「金球獎·法律組」的說法公布這一排名,LAB 是面向法律場景智慧體能力的評測基準。原文未給出具體分數、參評模型數量與評測細節。
阿里 Qwen 宣布,Qwen3.8-Max、Qwen3.8-Flash 與 Wan3.0 在 GMI Cloud 上限時免費開放一週,活動已經上線。開發者可在此期間免費呼叫這三款模型進行建置與測試,官方在推文中邀請開發者探索可行的用法。
德國 AI 公司 Aleph Alpha 於 2026 年 10 月 3 日發布開源權重模型 Kolibri,總引數 78B、啟用引數 3B,支援最長 1M token 上下文,權重已在 Hugging Face 開放下載,採用 Apache 2.0 許可。該模型為英德雙語 MoE Transformer,面向公共管理、工業與航空航天等受監管領域,在 AIME 2025 上得分 96.9,官方稱其效能可對標啟用引數四倍於己的模型。
OpenAI 於 9 月 21 日發布官方戰略宣告,把自動化 AI 研究員與遞迴自我改進(RSI)列為下一階段重要目標,並計劃在 2028 年 3 月前打造真正的自動化 AI 研究員;Anthropic 同期披露,截至 8 月 Claude 已在約 26% 的內部 AI 研發工作中承擔主導角色。
Latent Space 播客本期嘉賓為 MIT 的 Alex Zhang,他是 Recursive Language Models(RLM)的作者,也是 GPU Mode 社群成員。
OpenAI CEO Sam Altman 在 2026 年 10 月 1 日發帖表示,使用者應當能夠在任何需要的地方使用自己的 AI 訂閱。該表態未說明具體產品、實施方式或時間表,也未提及是否涉及跨平台或第三方應用。
德國 Aleph Alpha 於 2026 年 10 月 3 日發布開源權重模型 Kolibri,Apache 2.0 許可,權重已上 Hugging Face。它採用 MoE 架構,總引數 78.1B,每 token 僅啟用 3.46B,支援德語和英語,原生上下文 262,144 token,知識截止 2026 年 6 月 18 日。模型在德國和芬蘭基礎設施上從零訓練,使用 768 塊 NVIDIA B200,訓練約 24 萬億 token,其中德語佔比超五分之一。
OpenAI 把 API 的付費使用檔位從五個合併為三個:Build、Launch 和 Grow。新的最高檔 Grow 准入門檻為累計 API 付款 500 美元,此前最高檔需要 1000 美元。OpenAI 表示這讓開發者更容易達到更高的 API 速率限制。該訊息由 @OpenAIDevs 於 2026 年 10 月 6 日發布。
OpenAI 公布與 AI 合同平台 Ironclad 的研究合作,GPT-6 Astra 成為首個用 Ironclad 任務訓練的前沿模型。雙方與 Ironclad 使用者共同定義了 11 項法律、商務與採購任務,如搭建保密協議、採購審批流程和可複用條款,每項任務熟練使用者約需 30 到 40 分鐘,評估標準為 8 到 50 條。