AI工具导航

Agent-Eval

针对 LLM 智能体的统计回归测试

Agent-Eval 是什么?

Agent-Eval 是一款面向 LLM Agent 的统计回归测试工具,通过将版本 A 与 B 各运行 50 次来输出 p 值、Cohen's d 和 95% 置信区间,从而以严谨的统计方式判断 agent 行为是否发生了实质性变化。与 DeepEval、Braintrust、Promptfoo 等仅对比单次响应是否达标不同,它专注于衡量"分布漂移",能捕捉传统阈值测试遗漏的细微差异。工具以 Apache 2.0 协议完全支持自托管,原生兼容 LangGraph、OpenAI Agents SDK、CrewAI 和 LangChain LCEL 等主流框架。

产品详细介绍

针对 LLM 智能体的统计回归测试

Agent-Eval 是一款面向 LLM Agent 的统计回归测试工具,通过将版本 A 与 B 各运行 50 次来输出 p 值、Cohen's d 和 95% 置信区间,从而以严谨的统计方式判断 agent 行为是否发生了实质性变化。与 DeepEval、Braintrust、Promptfoo 等仅对比单次响应是否达标不同,它专注于衡量"分布漂移",能捕捉传统阈值测试遗漏的细微差异。工具以 Apache 2.0 协议完全支持自托管,原生兼容 LangGraph、OpenAI Agents SDK、CrewAI 和 LangChain LCEL 等主流框架。

定价方案

需要付费
官网查看
定制方案
  • 暂未采集到具体套餐,价格以官网为准

查看官网价格

创始人评论

Sourav Nandy
Sourav Nandy创始人

反复出现的失败模式令人沮丧地普遍存在:代理被更新后,标准评估仍保持通过,但性能在一周后会明显下降。两个真实案例推动了此工具的开发:

- LangGraph PR #4486:添加了节点级结果缓存,它悄悄掩盖了回归测试所依赖的重复采样方差——普通阈值检查根本无法捕获这种情况。

- CrewAI PR #6134:修复了一个 bug,即文件工具在响应中泄露了绝对文件系统路径。标准质量评分器从未标记此问题,因为它仅检查答案是否正确,而不检查有效负载中隐藏的内容。

这些示例是一个更大验证批次的一部分,涵盖 LangGraph、CrewAI 和 OpenAI Agents SDK 的 29 个 PR 和 239 行数据。完整的数据细分可在 GitHub 上的 pr-analysis.md 文档中找到。

agent-eval 不是对单个响应进行评分,而是统计地比较两整批运行结果。通过将版本 A 和 B 各运行 50 次,该工具执行:

- Mann-Whitney U 检验(不需要假设分数呈正态分布)。

- 自助法置信区间以确认变化是否真实。

- Cohen's d 以确定变化是否足够大以至于真正重要。

单凭 p 值低于 0.05 还不足以判定为回归。需要效应量才能作为决定性证据。

作为统计护栏的一部分,使用两个限制以确保数据完整性:

- 每个版本少于 30 次运行:由于统计功效下降而触发警告。

- 少于 10 次运行:返回 INSUFFICIENT_DATA 而不是猜测答案。

这是为生产代理设计的更大可观测性、测试和基准测试基础设施的一部分。我们已经在为下一个版本做规划。

接下来应该优先考虑 AutoGen 还是 Vercel AI SDK?您有什么建议?

创始团队

Sourav Nandy
Sourav NandyEngineering Reliable AI Agents!
Rudrendu Paul
Rudrendu PaulBuilding Agent-Native B2A applications

官网信息

官网https://github.com/RudrenduPaul/agent-eval?ref=producthunt
公司使命

用于 LLM 智能体的统计回归测试,以检测智能体行为在两个版本之间是否实际发生变化