- ✓
暂未采集到具体套餐,价格以官网为准
Agent-Eval
针对 LLM 智能体的统计回归测试
Agent-Eval 是什么?
Agent-Eval 是一款面向 LLM Agent 的统计回归测试工具,通过将版本 A 与 B 各运行 50 次来输出 p 值、Cohen's d 和 95% 置信区间,从而以严谨的统计方式判断 agent 行为是否发生了实质性变化。与 DeepEval、Braintrust、Promptfoo 等仅对比单次响应是否达标不同,它专注于衡量"分布漂移",能捕捉传统阈值测试遗漏的细微差异。工具以 Apache 2.0 协议完全支持自托管,原生兼容 LangGraph、OpenAI Agents SDK、CrewAI 和 LangChain LCEL 等主流框架。
产品详细介绍
针对 LLM 智能体的统计回归测试
Agent-Eval 是一款面向 LLM Agent 的统计回归测试工具,通过将版本 A 与 B 各运行 50 次来输出 p 值、Cohen's d 和 95% 置信区间,从而以严谨的统计方式判断 agent 行为是否发生了实质性变化。与 DeepEval、Braintrust、Promptfoo 等仅对比单次响应是否达标不同,它专注于衡量"分布漂移",能捕捉传统阈值测试遗漏的细微差异。工具以 Apache 2.0 协议完全支持自托管,原生兼容 LangGraph、OpenAI Agents SDK、CrewAI 和 LangChain LCEL 等主流框架。
定价方案
需要付费创始人评论
反复出现的失败模式令人沮丧地普遍存在:代理被更新后,标准评估仍保持通过,但性能在一周后会明显下降。两个真实案例推动了此工具的开发:
- LangGraph PR #4486:添加了节点级结果缓存,它悄悄掩盖了回归测试所依赖的重复采样方差——普通阈值检查根本无法捕获这种情况。
- CrewAI PR #6134:修复了一个 bug,即文件工具在响应中泄露了绝对文件系统路径。标准质量评分器从未标记此问题,因为它仅检查答案是否正确,而不检查有效负载中隐藏的内容。
这些示例是一个更大验证批次的一部分,涵盖 LangGraph、CrewAI 和 OpenAI Agents SDK 的 29 个 PR 和 239 行数据。完整的数据细分可在 GitHub 上的 pr-analysis.md 文档中找到。
agent-eval 不是对单个响应进行评分,而是统计地比较两整批运行结果。通过将版本 A 和 B 各运行 50 次,该工具执行:
- Mann-Whitney U 检验(不需要假设分数呈正态分布)。
- 自助法置信区间以确认变化是否真实。
- Cohen's d 以确定变化是否足够大以至于真正重要。
单凭 p 值低于 0.05 还不足以判定为回归。需要效应量才能作为决定性证据。
作为统计护栏的一部分,使用两个限制以确保数据完整性:
- 每个版本少于 30 次运行:由于统计功效下降而触发警告。
- 少于 10 次运行:返回 INSUFFICIENT_DATA 而不是猜测答案。
这是为生产代理设计的更大可观测性、测试和基准测试基础设施的一部分。我们已经在为下一个版本做规划。
接下来应该优先考虑 AutoGen 还是 Vercel AI SDK?您有什么建议?
创始团队
官网信息
用于 LLM 智能体的统计回归测试,以检测智能体行为在两个版本之间是否实际发生变化