新論文 RLTL;DR:失敗後自寫 TL;DR 反饋做自我改進
新論文 RLTL;DR 提出一種自我改進方法:模型每次嘗試失敗後,把驗證器輸出展示給它,讓它自己寫一條 TL;DR 式反饋,下一次 rollout 以這條反饋為條件。它針對 RLVR 的侷限——RLVR 要求多次嘗試並只向成功樣本最佳化,當任務難到成功率接近零、又沒有教師模型或範例解可蒸餾時就失效。論文發布於 2026-10-01,原文摘要未給出基準或具體數字。
依意思最接近的 5 筆
新論文 RLTL;DR 提出一種自我改進方法:模型每次嘗試失敗後,把驗證器輸出展示給它,讓它自己寫一條 TL;DR 式反饋,下一次 rollout 以這條反饋為條件。它針對 RLVR 的侷限——RLVR 要求多次嘗試並只向成功樣本最佳化,當任務難到成功率接近零、又沒有教師模型或範例解可蒸餾時就失效。論文發布於 2026-10-01,原文摘要未給出基準或具體數字。
Latent Space 最新一期播客請到 MIT 的 Alex Zhang,聊遞迴語言模型(RLM)、AI 寫 GPU kernel 與多智慧體 swarm。據他介紹,基於 RLM 的 harness 是首個接近解出 ARC-AGI-3 的方案,早於 OpenAI 的 Astra;他還談到 OpenAI 的 1 萬 agent、1300 億輸出 token、約合 4000 萬美元的問題求解實驗。
Capcom 在 RE: 2026 開放會議上表示,正為“與 AI 共同製作遊戲的未來”做準備,計劃把 AI 技術整合進開發工作流。程式設計師 Satoshi Ishida 在演講中稱,製作《生化危機》這一量級的遊戲時,連簡單任務都極其耗時,AI 是應對方案。但 Capcom 此前曾表示不會使用 AI。
Hugging Face 後訓練團隊用 TRL 和 Harbor 框架,開源了一套在多種 coding harness 中訓練開放模型的完整指南。指南針對每個人自有的定製 harness(如 Pi 加擴充套件),給出用任意開放模型榨取最佳效能的配方,連結已公開在 Hugging Face Spaces。
NVIDIA 提出衡量 AI 工廠投資回報的三個變數:產能(每兆瓦吞吐與每 token 成本)、使用壽命和需求。它援引 SemiAnalysis AgentX 資料稱,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百萬 token 成本最多低 45 倍;每兆瓦 AI 工廠造價約 6000 萬美元。