AISpot

Claude Code 的 claude-api skill 新增 build-eval 與 hillclimb 命令

claude.dev blog教學開發工具研究

Claude Code 的 claude-api skill 新增 build-eval 與 hillclimb 命令:前者在程式碼庫內搭建評測,後者針對該評測逐次改動應用,並用留出集防止過擬合。build-eval 會先訪談使用者,按生產記錄、bug 報告與支援工單、手寫案例的順序取樣輸入並生成頁面供確認,再挑選夠用的 grader——輸出受限時用程式化校驗,開放式輸出用 LLM-as-judge,評委模型不應是被測模型;

Anthropic 官方把評測設計與爬坡流程固化成 Claude Code 裡的兩條命令,涵蓋 grader 選擇、留出集防過擬合與帶置信區間的基線,對自建評測的 agent 開發者有直接參考價值。

原標題:Automating eval design and hillclimbing with Claude
閱讀原文

評分78 / 77(平均 77,門檻 60)
狀態精選(舊聞,已歸檔)