作者 Lance Martin 介绍了 Claude Code 的两项命令:/claude-api build-eval 从生产记录、故障工单或人工样本构建评测;用户先确认输入,再核对评分结果。确定性输出优先用程序验证,开放式回答使用模型裁判。基线报告包含置信区间。
/claude-api hillclimb 划分训练集与保留集,每轮只提交一项修改。训练集提升而保留集不变,或出现退步时,流程回滚;停滞后按根因梳理失败。提升落在噪声范围内时,作者建议不要合并。
Anthropic 报告,其客服试验包含44张工单,其中14张用于保留测试。通过清理提示词、调整模型与推理力度等步骤,最终保留集准确率从78.6%升至90.5%,成本降至约五分之一。这是厂商特定测试结果,不能直接外推到其他业务;评测仍须贴近真实任务,防止过拟合。