- ✓
暂未采集到具体套餐,价格以官网为准
Token Forecaster
在按下回车前,预估 LLM 回复的运行时间
Token Forecaster 是什么?
Token Forecaster 能在你按下回车之前,预测 LLM 回复的长度区间——既给出常见长度,也给出覆盖 90.6% 极端情况的"最长预估"。回复流式生成时,它会实时提示是否已经超出预期;整个过程只在本地观察历史、不修改任何请求,开源且遵循 MIT 协议。
产品详细介绍
在按下回车前,预估 LLM 回复的运行时间
Token Forecaster 能在你按下回车之前,预测 LLM 回复的长度区间——既给出常见长度,也给出覆盖 90.6% 极端情况的"最长预估"。回复流式生成时,它会实时提示是否已经超出预期;整个过程只在本地观察历史、不修改任何请求,开源且遵循 MIT 协议。
定价方案
需要付费创始人评论
我们从一个简单的问题出发:在 LLM 回复开始生成之前,你能判断它会运行多久吗?
在一定范围内,可以。基于 4,146 次模型从未见过的调用,90.6% 的回复落在了我们设定的最坏情况基线之下。Extended thinking(扩展思考)使尾部拉长了 2.5 倍。提示词措辞的影响约为 1%。真正的驱动因素是代理循环(agent loop)会运行多久,而调用前没有任何可见信息能预知这一点。如果能预测循环长度,预测误差可降低 63%。
Token Forecaster 正是基于这些发现构建而成。在你按下回车之前,它会展示通常长度和最坏情况上限。在回复流式输出时,它会显示属于典型、运行偏长还是极长。它运行在终端状态栏、macOS 菜单栏应用、本地仪表盘以及 Chrome 扩展中。
它只负责观察。它从不修改请求,从不设置 max_tokens,也无法自行节省 token 或费用。它的用途是为上下文窗口预留空间、及时发现失控循环,以及判断何时应将任务拆分。
当前覆盖范围:以 Claude Code 历史数据完成校准,Codex 数据的导入仍处于实验阶段。自带的配置来自一位开发者的 16,687 次调用。守护进程会基于你自己的历史记录拟合一份个人配置,只有当它优于内置配置时才会切换启用。另一位用户在自己的留出测试调用上达到了 88.3% 的最坏情况覆盖率。所有处理均在本地完成:历史记录只读取,绝不修改,绝不上传。目前还没有安装包,需在 macOS(Apple 芯片)和 Windows 上从源码构建。
每一项未通过我们门槛的实验,都与通过的实验一并列在 README 中。如果你工作负载上的预测出现偏差,欢迎告诉我们。
由 Sumcap Research 的 Eduardo Nunes 打造。