Skip to content
AI Agent 101
搜索课程
K
Main Navigation
首页
学习地图
课程体系
逐课讲义
代码仓库
Appearance
Menu
Return to top
本页目录
第 6 章:Agent Eval、回归测试与质量改进
本章完成后的效果
完成本章后,你不再只能说“这次 Demo 看起来不错”,而能回答:
哪些任务成功,哪些失败;
工具、RAG、模型或 Prompt 哪一层退化;
改动是否提高成功率,同时是否增加成本和延迟;
LLM-as-Judge 的评分是否可信;
如何在提交代码时自动阻止明显回归。
课程目录
第 35 课:建立 Golden Dataset
第 36 课:实现规则评测器
第 37 课:保存 Trace 并定位失败步骤
第 38 课:谨慎使用 LLM-as-Judge
第 39 课:回归测试和版本对比
第 40 课:创建 Eval Dashboard 和自动化入口