新論文 RLTL;DR:失敗後自寫 TL;DR 反饋做自我改進
新論文 RLTL;DR 提出一種自我改進方法:模型每次嘗試失敗後,把驗證器輸出展示給它,讓它自己寫一條 TL;DR 式反饋,下一次 rollout 以這條反饋為條件。它針對 RLVR 的侷限——RLVR 要求多次嘗試並只向成功樣本最佳化,當任務難到成功率接近零、又沒有教師模型或示例解可蒸餾時就失效。論文發布於 2026-10-01,原文摘要未給出基準或具體數字。
對關心 coding agent 與本地開源模型後訓練的讀者,這是一種在既無教師模型也無成功樣本時仍能自我改進的 RLVR 替代思路,可作為評估本地模型訓練路線的參考。
原標題:RLTL;DR: Self-Improvement by Internalizing Self-Generated Feedback
閱讀原文
| 評分 | 60 / 58(平均 59,門檻 60) |
|---|---|
| 狀態 | 未入選 |