AI工具导航

whatbroke

对比两次 Agent 运行,精确查看所有变化

whatbroke 是什么?

whatbroke 是一款专为 AI Agent 调试打造的工具,可以对比两次 Agent 运行的差异,清晰展示触发了哪些工具调用、参数有何不同、各自消耗了多少成本,以及输出在哪里出现分歧。它支持读取 JSONL、OpenTelemetry、Langfuse 和 LangSmith 等格式的导出数据,还能集成到 CI 流程中,在关键的工具调用丢失时自动让构建失败。

产品详细介绍

对比两次 Agent 运行,精确查看所有变化

whatbroke 是一款专为 AI Agent 调试打造的工具,可以对比两次 Agent 运行的差异,清晰展示触发了哪些工具调用、参数有何不同、各自消耗了多少成本,以及输出在哪里出现分歧。它支持读取 JSONL、OpenTelemetry、Langfuse 和 LangSmith 等格式的导出数据,还能集成到 CI 流程中,在关键的工具调用丢失时自动让构建失败。

定价方案

需要付费
官网查看
定制方案
  • 暂未采集到具体套餐,价格以官网为准

查看官网价格

创始人评论

Arthi Arumugam
Arthi Arumugam创始人

几周前我改了系统提示里的一行,那个 agent 就悄无声息地不再发起退款调用了。它在最终消息里还是写着"您的退款已处理",所以文本看起来没问题,评测分数从 0.82 掉到了 0.79,这什么都看不出来。我是把两个 trace 文件开在分屏里来回滚动,直到眼睛发花才发现的。

这就是这个东西存在的全部原因。"agent 变差了"不是一句可以拿来调试的话。提示词修改、模型替换、框架升级都会悄悄改变行为,而分数下降只告诉你有什么东西动了,却没告诉你动的是什么。

whatbroke 接收两份导出的 trace 并对它们做 diff:每次运行分别触发了哪些工具调用、参数有什么不同、每次运行的花费和耗时、以及输出实际在哪里出现了分歧。它能读取普通 JSONL,以及 OpenTelemetry、Langfuse 和 LangSmith 的导出格式。还有一个 --fail-on 标志和一个 GitHub Action,你可以把它接入 CI,当某次运行丢失了原本会发起的调用时直接把构建打断。

它是一个 CLI,TypeScript 写的,MIT 协议,139 个测试。v0.5.0 昨天刚发布。

我想从你这里了解两件事。你现在用的是哪种 trace 格式,因为导入器目前只覆盖四种。还有,diff 输出对于没参与编写的人来说是否真的可读——我已经盯着它看了太久,已经判断不了了。

npm i -g whatbroke-cli

创始团队

Arthi Arumugam
Arthi ArumugamSerial Builder.

官网信息

官网https://github.com/arthi-arumugam-git/whatbroke?ref=producthunt
公司使命

对比你的 AI 代理在两次运行之间的行为差异。