- ✓
本地后端:Ollama、llama.cpp、MLX
- ✓
pass^k 就绪度评分
- ✓
原生工具调用与上下文衰减测试
QuantaMind
你的本地模型真的能运行代理吗?测试一下 - OSS。
QuantaMind 是什么?
QuantaMind 是一款开源桌面应用,能在你的本地硬件上真实跑一遍 agent 循环,判断模型是否真的能胜任你的编程任务,直接给出"可运行 / 不可运行"的结论,避免被公开榜单误导。它完全离线运行,兼容 Ollama、llama.cpp 和 MLX,并针对每个模型与量化版本分别给出判定结果。
产品详细介绍
你的本地模型真的能运行代理吗?测试一下 - OSS。
QuantaMind 是一款开源桌面应用,能在你的本地硬件上真实跑一遍 agent 循环,判断模型是否真的能胜任你的编程任务,直接给出"可运行 / 不可运行"的结论,避免被公开榜单误导。它完全离线运行,兼容 Ollama、llama.cpp 和 MLX,并针对每个模型与量化版本分别给出判定结果。
定价方案
有免费方案- ✓
生产后端:vLLM 与 SGLang
- ✓
CI/CD 流水线门禁与退出码
- ✓
共享运行历史与质量审计日志
- ✓
气隙隔离的安全离线命令行工具
- ✓
离线授权(无需联网激活)
- ✓
合规证据报告(MRM/HIPAA/EU AI 法案)
创始人评论
嗨,PH 👋
我之所以打造 QuantaMind,是因为我反复被那些"纸面参数很漂亮、一放进 agent 循环就崩"的本地模型坑过。
问题模式总是一样的:某个模型在公开排行榜上分数很高,我把它加载到本地跑,然后它就悄悄出问题了——比如第 7 步出现一个格式错误的工具调用,或者更糟的是,明明啥都没做,它却告诉你"任务完成"。公开基准测试跑的是云端环境,并不测试你的 GPU、显存或量化方案,而这三者的组合恰恰就是出问题的地方。
我(以及我自己也一直在问)到处听到的那个问题是:"我有 X GB 的统一内存/显存,到底哪个模型真的能用?"如今诚实的答案是:花上一个月一个一个去试。
QuantaMind 在你自己的硬件上跑真正的 agent 循环,完全离线,并针对每个模型和量化方案给出 Ready / Conditional / Not Ready 的判定——同时明确列出原因,永远不会只丢一个裸分数。它支持 Ollama、llama.cpp 和 MLX。
几个我在意的、也塑造了这款产品的原则:
- 它验证的是工具调用是否真的发生过,而不是模型自己声称的"完成"——一个啥都不做的 trivial agent 只会得到 ~0 分,而不是你在某些基准上看到的那种虚高数字。
- 它从不捏造指标。如果在你的后端上某个指标测不了,它会直接标注 N/A。
- 完全开源,全部在你的本机上运行。提示词和数据永远不会离开你的设备。
项目还处于早期,我真心希望能听到每天都在跑本地模型的朋友们的声音。如果你也撞上"塞得进显存但还是跑不起来"这堵墙,很想知道是什么模型 + 硬件组合坑过你,也非常欢迎你来贡献。
另外我很好奇的是:在真实的 agentic 工作流中,你实际敢用的最小量化是多少?
创始团队
官网信息
本地 AI 代理的就绪闸门:对即将部署的完整技术栈(模型、量化方式、运行时及硬件)进行资格审核,并对代理循环的每一步进行打分,最终给出一个清晰的判定结果:就绪、有条件就绪或未就绪,全程离线运行。