美团LongCat-2.5-Preview实测:免费好用 速度待提升

据行业观察9月30日消息,LongCat团队推出了新一代预览版模型LongCat-2.5-Preview,并开放了为期两周的限时免费体验渠道。我们通过实际测试,对这款模型的能力、性价比和实际表现进行了全方位验证,整体体验可以概括为:可用、性价比突出,但响应速度有待提升。
这款模型总参数达到1.6万亿,单次推理仅激活约480亿参数,支持100万Token的超长上下文窗口,同时具备原生多模态能力,能够适配终端操作、网页浏览、GUI交互、表格处理和设计工具调用等长周期任务。上一代LongCat-2.0就是基于国产算力集群完成大规模训练,实现了万亿参数MoE模型的稳定训练与推理。
在使用成本方面,LongCat API开放平台的新用户完成实名认证后,可免费领取1000万Token额度。同时平台还推出了售价9.9元的5000万Token新手资源包,该资源包可同时用于LongCat-2.0和LongCat-2.5-Preview两款模型。此外,LongCat-2.5-Preview的API还推出了限时折扣活动:缓存未命中的输入价格从5元每百万Token降至2元,缓存命中的输入从0.1元降至0.04元,输出价格则从20元降至8元。
我们最初在体验渠道进行测试时,由于同时在线用户较多,模型一度出现响应延迟的情况。社区评论区也出现了首批开发者的测试案例,比如让模型制作“鹈鹕骑自行车”的动画,成品在动作细节和姿势还原上存在一定瑕疵。因此我们后续改用API接口,将模型接入开发工具继续测试多步骤的代码开发任务。
复刻现象级应用界面:Meta Muse
我们首先选择复刻近期走红的Meta Muse App,这款应用上线仅10天就登顶美国应用商店免费应用总榜,热度一度超过主流AI聊天工具。该应用的核心设计亮点是采用极简聊天界面,Agent完成网页浏览、文件填写、付款审批等任务时,相关结果会以卡片形式嵌入聊天流中。我们要求LongCat参考该应用的界面风格,复刻主要视觉元素和交互逻辑,包括Chat、Ideas、Goals、Connectors等页面,以及Browser Card、File Card、Approval Card等组件,并完整跑通一次电影票预订流程。
从最终效果来看,Muse实机界面的核心设计元素基本得到保留:顶部有居中的Agent头像,左侧设置菜单按钮;聊天区域区分了灰色AI气泡和浅蓝色用户气泡;各类功能卡片直接嵌入对话流程,底部保留极简输入框。不仅视觉结构高度接近,主要页面也可以正常切换。在电影票预订测试中,用户确定场次后会弹出选座Browser Card,进入支付确认步骤,点击允许后Agent会返回最终订票结果,整个流程都在同一聊天界面内完成,和Muse的交互逻辑基本一致。不过这项任务的思考耗时较长,单次连续思考时间可达10分钟,整个项目最终完成耗时超过30分钟。
制作星舰升空实时动画
第二个测试任务是制作SpaceX星舰升空的实时动画,要求不使用预渲染的视频或GIF,仅通过Three.js、WebGL、Shader和粒子系统完成火箭、喷流、烟雾、动态光照和镜头运动的模拟。
最终项目中,LongCat通过程序化几何体搭建了Starship和Super Heavy助推器,同时还原了发射塔、发射台和地面配套设施。发动机部分使用多个喷流源模拟集群点火效果,并加入了火焰动态效果;烟雾部分则分为白色蒸汽、灰色烟雾和贴近地面的尘土三层。项目还实现了动态光照、镜头震动、镜头上仰、冲击波效果以及发射状态UI等细节。火箭会先在发射台保持静止,随后点火产生烟雾并缓慢离开发射台,之后逐渐加速,镜头同步向上抬升,完整还原了星舰发射的核心流程。不过和预期的视觉效果相比,成品在场景丰富度、烟雾层次和3D材质细节上仍有提升空间。
开发可游玩的3D赛车Demo
第三个测试任务是开发一款可实际游玩的3D赛车游戏Demo,我们要求项目包含3圈比赛模式、3辆AI赛车、WASD控制、漂移机制、氮气加速、碰撞反馈和Checkpoint通关机制,同时加入排名、速度、圈数、计时器等游戏UI元素。
最终Demo可以正常运行,玩家可以通过按键控制赛车完成加速、刹车和转向,AI车辆能够沿赛道自动参与比赛,漂移、氮气、圈数统计、排名和计时等基础机制均已实现。主观体验来看,这个任务的完成速度和成品质量略低于此前测试的另一款主流模型,但表现优于另一款轻量模型。测试过程中我们发现了一个控制bug:按D键时赛车实际向左转向,LongCat很快定位到问题出在Three.js坐标系与车辆朝向的逻辑冲突,并耗时3分钟修正了steer参数的符号逻辑。不过赛道设计相对简单,弯道较多,直道和坡道的区分度不够明显。
总结:国产AI模型赛道再添新选手
三项测试中,LongCat-2.5-Preview都完成了可实际运行的完整项目,本次测试总共使用798.56万Token,由于缓存命中不计入资源包消耗,实际仅扣除约78.98万Token,结合新用户免费领取的1000万Token额度,性价比优势十分明显。不过在速度方面,三个任务的耗时均超过30分钟,响应效率还有较大提升空间。
相比国内主流的AI模型,LongCat此前的市场声量并不算高,但这次的预览版不仅保留了原生多模态能力,在代码开发和长周期任务执行上也展现出了较为完整的落地能力。当前国产AI模型的竞争已经从参数规模、榜单排名延伸到代码开发、Agent应用、多模态和真实任务执行领域,LongCat-2.5-Preview交出了一份阶段性的答卷,后续正式版在响应速度、运行稳定性和复杂任务处理能力上的表现值得关注。

