AI大模型代码生成三维场景的突破与视觉感知短板

知名AI研究者Andrej Karpathy在加入新团队后发布了一篇详细的实验分享,核心探讨了当前大模型的能力边界与明显短板。他的测试对象是Opus 5模型,首先给出了《魔戒》开篇的第一段文本,并提供了约100万token的上下文预算,总成本约10美元,随后要求模型使用Three.js将这段文字描述的场景渲染为可交互的三维画面。
经过近两小时的运行,Opus 5最终生成了5500行代码,通过程序化的方式完整还原了故事中的场景。Karpathy提到,最终成品虽然略显粗糙,但这件事本身的意义远超效果本身:一个纯语言模型需要在三维坐标空间中调度多边形资源、编写动画逻辑,却成功完成了这项任务。
他进一步解释,这类定制化的开发工作在日常工作中极少有人会主动投入时间,但AI拥有无限的耐心且成本极低,这让原本属于“没人会去做”的任务,变成了“为什么不尝试”的选择。Karpathy还畅想了未来的应用场景:可以按需生成高度定制的虚拟世界,玩家既可以作为旁观者进入故事,也可以直接扮演其中的角色,类似“按需定制的开放世界叙事游戏”。
不过这次实验也暴露了当前大模型的明显缺陷:Opus 5无法自主验证生成的代码效果,既不能高效感知视频内容,也无法在生成的场景中直接交互测试,只能通过缓慢的截图来检查,最终留下了不少瑕疵。Karpathy认为,多模态感知能力和直接的游戏交互能力,仍是大模型目前亟待补齐的关键短板。
针对Karpathy的观点,笔者也进行了实际测试,对比了两款主流大模型的表现。测试任务是使用HTML和Three.js制作符合物理规则的火星登陆模拟场景,给出的提示词完全一致,分别使用DeepSeek v4 flash 0731和Kimi K3 max完成。
测试结果显示,Kimi K3 max耗时约1.5小时完成任务,而DeepSeek v4 flash 0731仅用了20分钟,作为一款284B总参数、仅激活13B参数的轻量化模型,其运行速度令人震撼。但由于缺乏原生视觉能力,DeepSeek无法在生成过程中同步截图验证效果,最终的成品效果与Kimi K3 max仍存在一定差距。
不过在不涉及视觉处理的场景中,DeepSeek v4 flash 0731的表现十分出色。笔者曾使用该模型爬取了相关创作者的全部散文作品,制作成中英文对照的电子书,全程仅耗时约1小时,总成本约10元,累计消耗1.5亿token,期间使用了辅助模型处理,整体效率非常可观。


