服都服了,又是哪家模型搞匿名啊,大过节的搁这儿杀出来冲榜?!
说的就是你,Space Bunny。
一个没留神,它在短短几天里经历了突然出现->突然热度飙升->突然干到OpenRouter、OpenCode双榜调用日榜第一->突然讨论热度也飙升。

扫了一眼,推特和Reddit上目前的整体风向是这样的:
有说unbelievable的(be like@CoderGeeta)。

不少用户反馈输出效果不错(be like@Fei2411)。

还有夸速度快,“打败了Astra”的(be like@marcthecreatorr)。

真的吗?
我不信。
所以在迷人又珍贵的中秋假期最后一天,我做了一个违背祖宗的决定——管他是谁家的匿名模型,先测了再说吧。
先跟大家说一声,我是从OpenRouter上拿的API,接到了DeepSeek Harness(为公平起见我用了之前我没用过的DSH,惭愧)里面,给Space Bunny随便取了个名字叫“tuerye”。
昨晚上和今天上午都在使劲蹬,然后随机抽取,最后放了4个case在这篇稿子里。
可能附带一些我自己的个人主观弹幕,但主要还是为了呈现。
欢迎大家给自己的判断。
我这个人吧有点执念,这个世界上的匿名模型,管他大王小王,通通都要给我拉来测coding能力。
最近最火的除了Astra操控Blender,还有的就是3D玩法了。
那就上强度吧,我让它“用Three.js构建一个详细的立方体风格天坛,包含交互式细节”。
任务一开始跑我就搁旁边看《花少2》8小时版本去了……大概一个多小时不到两个小时吧,想起来看了一眼居然就跑完了,比我预想中快很多。
效果见视频:

我给编辑部几位同事看了下,满足“交互”这个条件就不说了,它自己加了些我压根儿没提的细节,比如底部控制条里还有夜、黎明、正午三个时刻和雨、烟的天气开关;昼夜还会自行循环,一天约3.5分钟,时辰文字也随时间从子时走到亥时。
反正总体而言大家都觉得Space Bunny的初战效果比较令人满意。
而且说出来都丢脸,做完了我才想起来DSH它,没!长!眼!睛!

所以评分方面再给这兔子加一颗星,表达我的歉意。。。
OK,展示第二个任务,给咱做一个苹果系统的、更适合中国宝宝体质的闹钟。
这个功能其实iOS 27说是有了,但身在中秋假期在这儿为爱测评的我,脑子里啪一下就冒出了这个需求。
Space Bunny耗时共22分钟46秒。
做出来的闹钟,响铃时的界面是这样的,霸占整个Mac的屏幕。
很霸道但也很简洁:

一轮跑出来界面是这样的:

按理说一轮就够用,但我还是又让它加个每个月到底闹铃响不响的功能,起床时间也调到7:23。
我们早八人是这样的,能多睡一分钟就尽量多睡一分钟。。。

这任务吧实用性比较强,咱们主要来看看readme里面它记录的思考。

iOS的硬性限制它也考虑到了:

但你们要不要看下我在这里看到了什么。。。
这是什么。。。
晕倒了我已经。

怕自己贴截图的时候再次晕倒,所以赶紧来看第三个Coding任务吧,让Space Bunny做个App。
“做一个mac app,把dsh当前的思考像字幕一样打在屏幕上。”
好消息是这玩意儿做起来就很快,可能不到5分钟?
我在飞书页面写这篇稿子呢,非常短的时间里屏幕上就冒出来了个这个,给我吓一跳。

坏消息是这次它自己脑补的细节就没有天坛那个丰富,初次交差的版本确实一直在显示DSH的脑回路,但窗口不能拖动挪动,也没有关掉和最小化。
这个位置一度挡住了我和DSH的对话框,我沉默许久,终于想起来可以给窗口缩小咯(可能是还沉浸在中秋尾声,今天测试的诸多环节我好像都失了智,好在Space Bunny智商还挺在线的)。
但我还是无能地勃然小怒了一下:

不到15分钟,且是在我开了多个任务同时跑的前提下,它给改好了。
现在就是随便挪,任意挪,想咋挪就咋挪。
而且没有思考的时候它会变得小小只。
我觉得海星?还不错!
不过也有两个问题。
一个是它自己说的,“合成鼠标事件在这个环境里会被系统丢掉一部分,所以「拖动是否与指针1:1同步」我没法在无头环境里断言——我改成了直接跟指针的屏幕位移(两端都是AppKit坐标,不存在符号翻转),你手动拖一下最准。”
另外就是拖动的时候会像小星星一样一闪一闪的?
这个不是啥大问题,应该就是因为实时显示脑回路所以窗口忽大忽小的,我又在拿鼠标拖拽,两套操作有点打架。
回头再交互一轮简单打磨下就好了。
讲真最近测的好几个模型都这样,首轮出来总会有些小细节有bug,肯定是没有Astra这种惊艳你一跳又一跳的feel,但拿来干活跑跑代码肯定是没问题的。
也就是首轮结果出来过后自己要再手动提点小建议,一般一轮就能解决。
如果要增加新功能就再交互再跑。
Reddit上有老哥跟我体感是一样的:

我测试过程中几乎没有出现一轮解决不了的问题。
只有一次,跑了个“给GitHub某仓库的文章列表增加cursor分页和标签组合筛选,补全测试且保持旧接口可用”的任务,看到它声称“全部检查通过”,随后又说明lint仍有33个错误,有点bug。
但这个问题一说也马上就改了,我还让codex帮我审了一遍,人家也说没问题。
前前后后测了十几个coding任务都给我测累了,于是我的魔爪又伸向了多模态。
丢给它一个特斯拉擎天柱吧台优雅营业的视频,就是这个:

问Space Bunny(写到这里我脑子里有一瞬间无理由飘过“这兔子不会是Grok吧”):
这个机器人干嘛呢?

中间流程太复杂了,直接上最终结果:

讲道理这个任务不知道为什么缓存命中有点低?
我看了下,除了这个任务其余的缓存命率中都在95%以上⬇️

讲真,我是测完过后才开始认真去看开发者们分享的一手体感的。
好的坏的评价都有,初步目测是好评偏多。
什么说Space Bunny是个工具狂人啊:

速度快啊:
(好,原来大家都用GPT-6审代码,本菜狗放心了)

别慌,当然不可能全网好评!
也有说它思考得太多——这和第一个测试中它给的天坛的结果比prompt丰富得多对应上了。
但也要和大家李涛一下,速度快、最终结果ok,还能给出更多的信息量……
那么思考太多到底算好算坏呢?

Anyway。
如果你有自己的体会也欢迎分享在评论区,我们会在第一时间把留言放出来。
好,最后还是俗气地来到传统习俗——猜厂商——环节。
虽然说,现在每个月都有新匿名模型,已经快成模型发布固定伴侣了……
但因为使用体感没有拉胯,猜一猜也行吧!我看网友们的猜测都五花八门的。
有网友说,因为声音听起来和GPT的很像,所以OpenAI你别藏着掖着了,直接亮相吧小宝贝:

居然还看到有人跟我前面一样,从名字里的“space”来粗暴猜测,说Bunny同学就是Grok的船新版本。
xswl,谢谢兄弟姐妹告诉我这么神经的人不只有我一个。

然后国内头部模型们几乎都被猜了,猜Kimi的、GLM的、HY的、MiniMax的都有。

还有人觉得是Meta接下来会发布的Muse Spark。

先不说猜得对不对的,但猜想小扎看到这个猜测一定很欣慰,我们Meta也是真的靠Muse重新上桌了呜呜呜。
放几个月前,这种表现不错的匿名模型,谁会把Meta的模型拿出来说啊喂!
最后的最后,我俗气地和大家感慨一下,比起认领兔子更值得关注的应该是Space Bunny这么快在调用榜登顶的实质原因。
现在日常干活,除了搞算法的朋友们,大家的大模型挑选标准都趋向经济适用。
吾日三省吾身:这模型快不?准不?贵不?
正因如此,几乎所有的Flash高速模型就成了处理高频任务的主力工具。
就目前的信息而言,Space Bunny大概率也是想这样走花路的,不过,具体定价还是要等厂商认领公布咱们才知道了╮(╯▽╰)╭
参考链接:
[1]https://x.com/Fei2411/status/2104030913814515932
[2]https://x.com/CoderGeeta
[3]https://www.reddit.com/r/opencode/comments/1wocn5s/space_bunny_thoughts/
[4]https://OpenRouter.ai/rankings#natural-languages
[5]https://x.com/cb_doge/status/2032939247443882115?s=20
文章来自于微信公众号 “量子位”,作者 “量子位”
【免费】cursor-auto-free是一个能够让你无限免费使用cursor的项目。该项目通过cloudflare进行托管实现,请参考教程进行配置。
视频教程:https://www.bilibili.com/video/BV1WTKge6E7u/
项目地址:https://github.com/chengazhen/cursor-auto-free?tab=readme-ov-file
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0