RISED:多環境 agent 訓練的評分標準與自蒸餾方法
論文提出 RISED,用評分標準(rubrics)驅動多環境 agent 訓練的 prompt 組選擇與自蒸餾。作者指出現有課程與資料選擇策略多在環境層面分配訓練,或只依賴區域性 reward 訊號,沒有顯式利用不同環境當前 rollout 之間的關係來挑選 prompt 組。同時各環境學習速度不一,同一 batch 內會並存全失敗與全成功的 rollout 組,這批資料無法獲得 group-relative 獎勵訊號。
依意思最接近的 7 筆
論文提出 RISED,用評分標準(rubrics)驅動多環境 agent 訓練的 prompt 組選擇與自蒸餾。作者指出現有課程與資料選擇策略多在環境層面分配訓練,或只依賴區域性 reward 訊號,沒有顯式利用不同環境當前 rollout 之間的關係來挑選 prompt 組。同時各環境學習速度不一,同一 batch 內會並存全失敗與全成功的 rollout 組,這批資料無法獲得 group-relative 獎勵訊號。
ServiceNow CoreAI 團隊發布 AutoSynthData,用目標模型的失敗案例和更強教師模型的成功軌跡定位能力缺口,再自動生成並驗證新任務用於後訓練。任務由系統規範、使用者提示和驗證器三部分組成,需滿足可行性、真實性與難度要求,驗證器則要求一致、可靠且不繫結單一參考軌跡。團隊在 EnterpriseOps Gym 資料集上演示了該流程,模型提升後課程會轉向仍難完成的任務。
Anthropic 宣布投入 1 億美元,通過 Claude Frontier Academy 培養 10000 名 Frontier Deployed Engineers,目標在 2027 年底前完成。首批學員來自埃森哲、貝恩、凱捷、澳大利亞聯邦銀行、德勤、麥肯錫、摩根士丹利和諾和諾德等企業。按人數計算,人均培訓投入約 1 萬美元。
Hugging Face 後訓練團隊發布了一份多 harness 強化學習指南,介紹如何用 TRL 和 Harbor 等開源庫在不同 coding harness 中訓練開放模型。團隊稱,針對當前各人自建 harness(如 Pi 加擴充套件)的現狀,該方案給出了用任意開放模型在自訂 harness 上取得最佳效能的配方。指南已發布在 Hugging Face Spaces 上,作者歡迎反饋。
Google DeepMind 發布一期播客,討論 AI 生成內容日益逼真後如何驗證內容來自人類、機器還是自然。節目介紹內容溯源的作用,並講解不可感知水印如何保護數字媒體與生物設計,時間軸涵蓋水印概念、SynthID、影像與影片、SynthID Bio 及未來韌性等章節。
Anthropic 於 10 月 2 日推出 Claude Frontier Academy,投入 1 億美元,計劃到 2027 年底培訓 1 萬名 Frontier Deployed Engineer(FDE)。首批學員來自埃森哲、貝恩、凱捷、澳洲聯邦銀行、德勤、麥肯錫、摩根士丹利、諾和諾德等企業,在舊金山、紐約和倫敦開班。專案採用提名制,先參加數天線下培訓與模擬企業部署考核,通過後進入 12 周駐留期,在本組織內主導真實 Claude 用例,結業再考核,首批 FDE 認證預計 2027 年初頒發。
Latent Space 播客本期嘉賓為 MIT 的 Alex Zhang,他是 Recursive Language Models(RLM)的作者,也是 GPU Mode 社群成員。