- ✓
每月 10,000 次请求
- ✓
影子模式可显示潜在节省量
- ✓
精确匹配缓存
SemanticGuard
将您的 LLM API 成本降低 40-70%,仅需一行代码。
SemanticGuard 是什么?
SemanticGuard 是一款能帮你削减大语言模型 API 成本的工具,只需一行代码即可接入。它会对应用中重复的语义化 LLM 请求做缓存,介于你的应用和 OpenAI/Anthropic/Google 等服务商之间,缓存命中响应不到 50 毫秒,通常可以帮你降低 40-70% 的调用成本,还支持影子模式提前测算收益,并通过自有 AI 验证缓存结果的正确性。
产品详细介绍
将您的 LLM API 成本降低 40-70%,仅需一行代码。
SemanticGuard 是一款能帮你削减大语言模型 API 成本的工具,只需一行代码即可接入。它会对应用中重复的语义化 LLM 请求做缓存,介于你的应用和 OpenAI/Anthropic/Google 等服务商之间,缓存命中响应不到 50 毫秒,通常可以帮你降低 40-70% 的调用成本,还支持影子模式提前测算收益,并通过自有 AI 验证缓存结果的正确性。
定价方案
有免费方案- ✓
包含 50,000 次请求
- ✓
超出额度后每千次消耗 $0.50
- ✓
完整语义缓存
- ✓
每月最低消费 500 美元
- ✓
无限请求
- ✓
15% 的已确认节省
创始人评论
开发这个项目是因为我亲眼看着我们的大语言模型(LLM)账单不断上涨。我们的大部分流量都是重复请求:同一个问题换个表述,同一个内容生成提示词换不同输入,第二天又来一遍的相同查询。服务商侧的提示缓存只对几分钟内字节完全一致的前缀生效,所以大概只能拦截十分之一的冗余请求。
所以我做了这个网关,它能识别出两个请求实际上是同一个需求。语义缓存的关键点在于正确性:只要输出一次错误答案,用户信任就没了。因此每次缓存命中都会在输出前先用你手里成本最低的模型校验一遍。
校验失败会自动标记。
集成是另一个设计约束。如果要改超过一行代码,根本没人会用。所以它就是简单的接入:在你的AI SDK配置里加上withSemanticGuard()就行。影子模式让你可以在不实际输出缓存响应的情况下统计能省多少钱,等你对数据放心了再开启缓存功能。
欢迎任何在生产环境跑大语言模型的朋友提反馈,尤其是关于验证层还有哪些不足的意见。
创始团队
官网信息
SemanticGuard 缓存您的 LLM 响应,并使用您自己的 AI 验证每次缓存命中。仅需一行代码,支持 OpenAI、Anthropic、Google。