AI工具导航

GitHub

基于 Redis 的 LLM API 调用透明语义缓存

GitHub 是什么?

Khazad 是一款运行在 Redis 8 上的 LLM API 调用透明语义缓存工具。它在 httpx 传输层拦截 LLM HTTP 流量,无需修改代码就能从 Redis 向量缓存中返回语义等价的请求结果,支持 OpenAI、Anthropic、Gemini 等主流大模型服务。它提供模型感知、对话感知缓存,支持完整流式响应、TTL 配置和可调相似度阈值,开源免费(MIT 协议),能帮你避免为重复提示付费。

产品详细介绍

基于 Redis 的 LLM API 调用透明语义缓存

Khazad 是一款运行在 Redis 8 上的 LLM API 调用透明语义缓存工具。它在 httpx 传输层拦截 LLM HTTP 流量,无需修改代码就能从 Redis 向量缓存中返回语义等价的请求结果,支持 OpenAI、Anthropic、Gemini 等主流大模型服务。它提供模型感知、对话感知缓存,支持完整流式响应、TTL 配置和可调相似度阈值,开源免费(MIT 协议),能帮你避免为重复提示付费。

定价方案

有免费方案
Free/免费
huggingface
  • ✓

    本地嵌入模型

  • ✓

    首次使用时下载

Paid/custom
openai
  • ✓

    付费嵌入API

  • ✓

    uv 添加 khazad[openai-embeddings]

查看官网价格

创始人评论

Guglielmo Cerri
Guglielmo Cerri创始人

大家好,我是 Khazad 的开发者。

我一直遇到同一个问题:我在为完全相同的 LLM 提示词重复付费,哪怕在生产环境中,大量用户流量都是几乎一模一样的问题(常见问答机器人、RAG 前端)。传统缓存无能为力,因为没有两个提示词是字节完全相同的。

所以我打造了一个语义缓存,而且我希望它能做到真正透明。大多数缓存工具都要求你包装它们的 SDK 或将流量路由通过代理。而 Khazad 会在 httpx 传输层拦截出站 LLM HTTP 请求,因此它可以兼容 OpenAI、Anthropic、Gemini、Azure OpenAI 和 Mistral 的 SDK,完全不需要修改你的应用代码。只需调用一次 init(),它就开始运行了。

底层它使用 Redis 向量集:每个(提供商,模型)对都有独立的向量集,完整对话都会被嵌入(不只是最后一条消息),通过相似度搜索决定是重放缓存响应还是将请求发往上源。

改进最多的部分是对流式响应的正确处理:缓存命中会以真实 SSE 流的形式重放,流式未命中则会逐块捕获并重组为 JSON,因此流式回答之后可以服务非流式请求,反之亦然。

这个项目是开源的(MIT 协议),我真心希望得到大家的反馈,尤其是关于传输层方案这一块,以及大家希望如何处理误判控制的问题。

GitHub 地址:https://github.com/GuglielmoCerr...

创始团队

Guglielmo Cerri
Guglielmo CerriAI eng

官网信息

官网https://github.com/GuglielmoCerri/khazad
公司使命

由 Redis Vector Sets 提供支持,适用于大语言模型 API 调用的透明传输层语义缓存。