AISpot

新論文 RLTL;DR:失敗後自寫 TL;DR 反饋做自我改進

Apple Machine Learning Research10/1 01:00官方公告研究

新論文 RLTL;DR 提出一種自我改進方法:模型每次嘗試失敗後,把驗證器輸出展示給它,讓它自己寫一條 TL;DR 式反饋,下一次 rollout 以這條反饋為條件。它針對 RLVR 的侷限——RLVR 要求多次嘗試並只向成功樣本最佳化,當任務難到成功率接近零、又沒有教師模型或示例解可蒸餾時就失效。論文發布於 2026-10-01,原文摘要未給出基準或具體數字。

對關心 coding agent 與本地開源模型後訓練的讀者,這是一種在既無教師模型也無成功樣本時仍能自我改進的 RLVR 替代思路,可作為評估本地模型訓練路線的參考。

原標題:RLTL;DR: Self-Improvement by Internalizing Self-Generated Feedback
閱讀原文

評分60 / 58(平均 59,門檻 60)
狀態未入選