AI工具导航

oMLX

Mac LLM 服务器,将智能体等待时间从 90 秒缩短至 5 秒

oMLX 是什么?

oMLX 是一款基于 Mac 的本地 LLM 推理服务器,可直接从菜单栏一键启动,将 Claude Code 和 Cursor 等智能体的响应时间从约 90 秒压缩至 5 秒。它使用 Swift 原生开发(非 Electron),支持文本、视觉、OCR、嵌入与重排序等多种模型的连续批处理,并配备可在重启后保留的 RAM+SSD 分层 KV 缓存,同时原生兼容 OpenAI 与 Anthropic 的 API。项目遵循 Apache 2.0 开源协议。

产品详细介绍

Mac LLM 服务器,将智能体等待时间从 90 秒缩短至 5 秒

oMLX 是一款基于 Mac 的本地 LLM 推理服务器,可直接从菜单栏一键启动,将 Claude Code 和 Cursor 等智能体的响应时间从约 90 秒压缩至 5 秒。它使用 Swift 原生开发(非 Electron),支持文本、视觉、OCR、嵌入与重排序等多种模型的连续批处理,并配备可在重启后保留的 RAM+SSD 分层 KV 缓存,同时原生兼容 OpenAI 与 Anthropic 的 API。项目遵循 Apache 2.0 开源协议。

定价方案

需要付费
官网查看
定制方案
  • 暂未采集到具体套餐,价格以官网为准

创始人评论

M
Maker创始人

用本地模型一直撞同一堵墙:agent 反复回退,整个对话都要重算,90 秒啥也没有。

oMLX 把 KV 缓存写入 SSD,即便重启后,旧的上下文也能毫秒级恢复。在本地模型上跑 Claude Code,终于不再像拨号上网那样卡顿。

从二月起,Jun 几乎每天都在发版。已经有 21k 星标了,可他在 Show HN 上的帖子依然几乎没人看到。觉得不太对劲。

如果你在 Mac 上跑模型:你的技术栈长什么样?好奇大家把它搭配什么一起用。