AISpot

Hugging Face 發布多 harness RL 訓練指南

r/LocalLLaMA top of the day10/3 11:39教學研究開源開發工具

Hugging Face 後訓練團隊用 TRL 和 Harbor 框架,開源了一套在多種 coding harness 中訓練開放模型的完整指南。指南針對每個人自有的定製 harness(如 Pi 加擴充套件),給出用任意開放模型榨取最佳效能的配方,連結已公開在 Hugging Face Spaces。

你日常用 Claude Code、Codex、OpenCode 跑 coding agent,又準備本地跑開源模型,這套配方正好能幫你把本地模型接進自己的 harness 並調優。

原標題:The ultimate guide to multi-harness RL
閱讀原文

評分72 / 55(平均 63,門檻 76)
狀態未入選

相關報導

r/OpenAI top of the day● 精選10/3 16:36AI 評分80

OpenAI 發布 GPT-6 系列模型指南

OpenAI 發布了 GPT-6 系列的模型指南,內容涵蓋模型選擇、推理強度(reasoning effort)與工具使用。該指南面向使用 GPT-6 系列的開發者,幫助其在具體場景中決定選哪個模型、投入多少推理算力以及如何呼叫工具。原文未披露具體模型型號、引數或發布時間等細節。

Apple Machine Learning Research10/1 01:00AI 評分59

新論文 RLTL;DR:失敗後自寫 TL;DR 反饋做自我改進

新論文 RLTL;DR 提出一種自我改進方法:模型每次嘗試失敗後,把驗證器輸出展示給它,讓它自己寫一條 TL;DR 式反饋,下一次 rollout 以這條反饋為條件。它針對 RLVR 的侷限——RLVR 要求多次嘗試並只向成功樣本最佳化,當任務難到成功率接近零、又沒有教師模型或範例解可蒸餾時就失效。論文發布於 2026-10-01,原文摘要未給出基準或具體數字。

r/LocalLLaMA top of the day10/2 22:49AI 評分27

開發者開源二戰主題小模型 Peacebell,291M 與 148M 兩版

開發者 Wayne Workman 用 11 個月業餘時間從零訓練了專注二戰資訊的小語言模型 Peacebell,已開源權重與訓練材料,含 291M 和 148M 兩個引數版本。148M 版是為參加 HuggingFace 限制 150M 以內模型規模的榜單而做,同時發布了 WWII 主題基準 ww2bench,題目不公開以防進入訓練資料。模型可在 CPU 上執行,作者提供了定製 vLLM fork,並稱其長上下文表現較差,下一版預計 2027 年發布。

r/LocalLLaMA top of the day10/3 00:18AI 評分37

LocalLLaMA 討論 jev 分類模型的實際使用體驗

r/LocalLLaMA 使用者分享 jev 系列分類模型(classifier)的真實用例:有人用 jev-reviewer 定位論文證據、避免引用幻覺,有人用 is-malicious 掃描 GitHub 倉庫與 PR 的惡意行為,還有人用 decider 4b 替代 Gemma 雙階段流程,把語音 RPG 延遲從 4-8 秒降到 2-3 秒。