匿名黑马Space Bunny登顶双榜 实测表现亮眼

近期又一款匿名大模型突然闯入公众视野,短短几天内热度迅速攀升,不仅登上了多个代码与自然语言调用榜单的日榜第一,相关讨论也在海外社区快速发酵。这款被用户称为Space Bunny的模型,让不少人好奇其背后的研发团队。
不少海外用户在社交平台分享了使用体验,有人直呼其表现令人惊喜,也有用户称赞其输出质量出色,还有人认为它的响应速度极快,甚至超过了此前热门的同类型模型。
出于对这款匿名模型的好奇,我在假期期间对其进行了实测。测试过程中使用了DeepSeek Harness工具,将模型接入API并临时命名为“tuerye”,最终筛选出四个典型测试案例进行展示,其中夹杂了一些个人测试时的主观感受,供读者参考。
首个测试:交互式3D天坛模型。我给模型下达的任务是使用Three.js构建一个带有交互细节的立方体风格天坛。任务启动后我暂时离开了测试环境,大约一个多小时后返回查看,发现任务已经完成,速度比预期快不少。最终生成的模型不仅满足了交互要求,还自动添加了不少我没有提及的细节:底部控制栏包含了夜晚、黎明、正午三个时段切换,以及雨、烟两种天气效果,场景还会自动循环昼夜变化,周期约3.5分钟,时辰文字也会从子时依次切换到亥时。编辑部的同事看过效果后都认为表现超出预期,考虑到测试工具本身存在的限制,我还额外给这个测试加了一颗星。
第二个测试:适配中国用户的苹果系统闹钟。参考了近期系统的相关更新,我提出了开发一款更贴合国内用户习惯的Mac闹钟的需求。这款模型总共耗时22分46秒完成初始版本,响铃界面会占据整个Mac屏幕,风格简洁且醒目。在初始版本完成后,我又提出添加月度闹钟开关和将起床时间调整为7:23的需求,以贴合早八群体的作息习惯。在项目的说明文档中,模型还考虑到了苹果系统的硬性限制,不过也存在一些细节上的小问题。
第三个测试:实时字幕Mac应用。我要求模型开发一个Mac应用,能够将DSH的思考内容以字幕形式显示在屏幕上。好消息是这个任务的完成速度极快,不到5分钟就生成了初始版本,不过初始版本的窗口无法拖动,也没有关闭和最小化按钮,一度遮挡了我的工作界面。在我提出修改要求后,不到15分钟就完成了优化,此时窗口可以自由拖动,且在没有思考内容时会自动缩小。不过该应用仍存在一些小瑕疵,比如鼠标拖动时窗口会轻微闪烁,不过这属于可以通过后续调整修复的细节。
整体来看,多数匿名模型在首轮测试中都会存在一些小细节瑕疵,经过一轮交互调整后基本都能解决,这和其他用户在社区分享的体验一致。我在测试过程中仅遇到过一次较为明显的问题:在为GitHub仓库添加分页和筛选功能时,模型最初声称全部检查通过,但后续又指出存在33个lint错误,不过在我提出反馈后很快就完成了修复,甚至经过第三方代码审核工具确认也没有问题。
多模态测试:视频内容分析。我还给模型发送了一段特斯拉擎天柱在吧台营业的视频,询问其正在进行的动作。该任务的缓存命中率较低,不过其余测试的缓存命中率都保持在95%以上。
测试结束后,我查看了社区内的一手用户反馈,整体好评居多。有用户称赞Space Bunny是高效的开发工具,也有用户提到它的响应速度很快,甚至调侃“大家都在用GPT-6级别的标准审代码,这下放心了”。当然也存在不同的声音,有用户认为模型的思考过程过长,这也对应了我在首个测试中发现的情况:模型生成的内容比原始prompt更加丰富,细节更多。关于“思考过多”的利弊,还需要结合具体使用场景来判断。
不少网友也对Space Bunny的背后研发团队进行了猜测:有人认为其对话风格和GPT相似,猜测是OpenAI的匿名新作;也有人从名字中的“space”联想到相关模型,认为是其新版本;国内多款主流大模型也被纳入猜测范围,还有人认为是Meta即将发布的相关新作。不过无论最终猜测是否准确,更值得关注的是这款模型快速登顶榜单背后的行业趋势。
如今多数日常使用大模型的用户,除了专业算法从业者外,挑选模型的标准已经转向经济实用,都会关注模型的响应速度、输出质量和使用成本。高速轻量化模型成为高频任务的首选,Space Bunny显然也瞄准了这一赛道,具体的定价和官方信息还需要等研发团队公开后才能确认。
如果你有关于这款模型的使用体验,欢迎在评论区分享。

