Skip to content

第 6 章:Agent Eval、回归测试与质量改进

本章完成后的效果

完成本章后,你不再只能说“这次 Demo 看起来不错”,而能回答:

  • 哪些任务成功,哪些失败;
  • 工具、RAG、模型或 Prompt 哪一层退化;
  • 改动是否提高成功率,同时是否增加成本和延迟;
  • LLM-as-Judge 的评分是否可信;
  • 如何在提交代码时自动阻止明显回归。

课程目录

  1. 第 35 课:建立 Golden Dataset
  2. 第 36 课:实现规则评测器
  3. 第 37 课:保存 Trace 并定位失败步骤
  4. 第 38 课:谨慎使用 LLM-as-Judge
  5. 第 39 课:回归测试和版本对比
  6. 第 40 课:创建 Eval Dashboard 和自动化入口

持续学习,持续交付。