AI工具导航

APIEval-20

一个用于测试API的AI代理开放基准

APIEval-20 是什么?

APIEval-20是一个面向API测试代理的黑盒基准测试。每个代理仅获取一个JSON模式和一个示例有效载荷,随后生成测试套件。我们针对部署了预设错误的真实API运行这些测试,并根据错误检测率、API覆盖率和效率进行评分。与基于大语言模型作为评判的评估不同,该评分完全客观:错误要么被捕获,要么未被捕获。任务涵盖认证、错误处理、分页、模式及多步骤流程。基准测试已在Hugging Face上开源。

产品详细介绍

一个用于测试API的AI代理开放基准

APIEval-20是一个面向API测试代理的黑盒基准测试。每个代理仅获取一个JSON模式和一个示例有效载荷,随后生成测试套件。我们针对部署了预设错误的真实API运行这些测试,并根据错误检测率、API覆盖率和效率进行评分。与基于大语言模型作为评判的评估不同,该评分完全客观:错误要么被捕获,要么未被捕获。任务涵盖认证、错误处理、分页、模式及多步骤流程。基准测试已在Hugging Face上开源。

定价方案

有免费方案
Free/月付
开发者版
  • 最多50个API端点

  • API合同测试

  • 用户界面测试

Custom Pricing/custom
企业号
  • 无限API端点

  • 完整的CI/CD集成

  • SOC2和ISO27001认证的数据安全

查看官网价格

创始人评论

Abhishek Saikia
Abhishek Saikia创始人

嗨,Product Hunt,

我是 Abhishek,KushoAI 的首席执行官。

我们创建APIEval-20是因为API测试现在已成为AI代理间的普遍说法,但当时没有可靠的验证方法。

我们发现的评估通常有三个空白之一。他们假设能访问源代码,依赖详细文档,或者检查输出是否有效,而非测量实际发现的错误。

这感觉与大多数团队实际测试API的方式相去甚远。

所以我们建立了一个黑盒基准。

架构和有效载荷已输入。别无他物。

代理生成一个测试套件。我们会用带有植入漏洞的实时参考API进行测试。得分来自代理实际捕捉到的内容:漏洞检测、API覆盖率和效率。

没有LLM评委。没有主观判断。错误要么被发现,要么被漏掉。

我最自豪的是复杂度分类法。向每个字段发送空图很简单。真正的考验是代理是否能够推理字段关系、认证行为、分页、错误处理、模式约束和多步流程。这正是强力因子开始与弱因子区分开来的地方。

APIEval-20已在Hugging Face上开放。我们还在单独研究报告中整理一个排行榜,比较主要的人工智能代理。如果你在那之前让你的经纪人在基准测试中运行,我们很乐意把你的结果也包含进去。

给社区两个问题:

1. 接下来我们应该添加哪些域名或API模式?

2. 如果你正在构建测试工具或代理,你会希望你的结果被列入排行榜吗?

我会在这里待一整天。请留言或联系我们:

hello@kusho.ai

创始团队

Abhishek Saikia
Abhishek Saikia创始团队
Sourabh Gawande
Sourabh Gawande创始团队
Naveen Prasanth
Naveen Prasanth创始团队

官网信息

官网https://resources.kusho.ai/api-eval-20?ref=producthunt
公司使命

在生产前发现故障和安全漏洞