文章摘要
前沿大模型评测标准正迎来升级。8 月 2 日,Andrej Karpathy 公布用 Claude Opus 5 将《指环王》开篇文本渲染为三维场景的实验,虽成品粗糙但核心逻辑完整。这一模式变革了成本逻辑,实现基于用户需求即时定制。开发者也进行诸多测试,Opus 5 表现出色。不过模型调试代码方式存在不足,未来产品或融合代码生成与世界模型优势。

过去,我们常常用“生成一张鹈鹕骑自行车的矢量图”这样的趣味题目测试大模型的空间推理能力——这类任务看似简单,实则需要模型理解两种物体的结构、空间关系,再用图形元素组合出完整画面。而现在,前沿大模型的评测标准正在迎来新的升级。

8月2日,Andrej Karpathy在社交平台公布了一项突破性实验:他将《指环王》第一章的开篇文本交给Claude Opus 5,提供了100万Token的推理预算(按其估算约合10美元),并要求模型使用Three.js将这段故事渲染为可在浏览器中运行的三维场景。这条分享的浏览量很快突破了280万次。

Opus 5耗时约两小时,最终生成了约5500行代码。成品虽然有些粗糙,但核心逻辑完整:模型自主决定了场景中的角色、房屋、道路与植被,将多边形资产放置在三维坐标系中,编写了动画、镜头和时间轴逻辑,最终得到了一个可直接运行的交互式场景。这并非简单的文本转图像或视频,而是更接近传统游戏开发的路径:通过代码显式创建几何体、材质、灯光、摄像机与动画,而非直接生成像素画面。在这套系统中,每一棵树都是场景树中的可交互对象,道路、角色都有明确的坐标,镜头运动、角色移动和字幕 timing 都被写入了程序逻辑。

早在7月24日的Opus 5发布公告中,Anthropic就将视觉输出列为该版本的核心升级之一,展示了模型生成的交互式风洞与细胞结构,并将其定位为适合长周期、多步骤任务的模型,强调其具备反复校验结果、构建测试工具并在复杂任务中持续迭代的能力。而Karpathy的实验则将这种能力推向了更开放的场景:没有预设的功能列表、现成的美术资源,也没有逐一定义对象坐标,模型需要独立判断“一段小说如何转化为可运行的3D叙事”。

Karpathy真正关注的并非这个指环王场景本身,而是其背后的成本逻辑变革。传统流程中,为一段定制化的小说开篇制作3D动画,需要编剧拆分场景、美术制作资产、程序员开发交互逻辑,即便最终仅面向少数受众,整套流程的成本也不会显著降低,这类小众定制需求往往根本无法进入制作阶段。而大语言模型改变的不是作品质量,而是“是否值得开始”的门槛:模型不会在意任务是否琐碎,也不会在意5500行代码最终仅被播放一次。只要推理成本足够低,那些过去因个性化程度过高、投入产出比过低而无人问津的内容,都可以被临时生成出来。

Karpathy将这种模式形容为“按需生成的临时版GTA”:用户可以指定任意小说、历史事件或虚构设定,让模型快速搭建出一个微型世界,玩家既可以作为旁观者进入故事,也可以成为其中的角色,甚至改变原本的叙事走向。这意味着生成式AI正在将内容定制从“更换角色名、调整图片”的表层,推进到场景、交互规则、角色关系和叙事进程的结构层面,实现完全基于单个用户需求的即时定制。

Karpathy的实验并非孤例。Opus 5发布后,社交平台上的开发者迅速将三维游戏与物理模拟作为非正式的模型压力测试。开发者Matt Shumer展示了由Opus 5生成的第一人称射击游戏《Claude of Duty》,整个项目从场景到贴图均由代码生成,未使用任何外部美术资产;Alex Ermolov则让模型制作了滑雪板体验,他评价称在测试过的模型中,Opus 5处于领先位置,首次生成的版本就没有明显的视觉故障,滑行的物理反馈也相对自然。

另一位用户ChrisGPT对比了旧版Claude 4 Opus与新版Opus 5的输出:同样是生成泥路上行驶的汽车,旧版本仅由简单色块组成,而Opus 5已经能够自动添加车辙、植被、阴影和分层光照效果。更极端的测试来自Pankaj Kumar,他让Opus 5重建《我的世界》,最终得到了包含15种生物群系、支持创造与生存模式的程序化世界,图形、纹理和声音均在运行时生成,但此次任务消耗了约2500万Token,也说明随着世界规模扩大,成本与代码复杂度仍会快速增长。

atomic.chat团队则让多款模型生成龙卷风、摆锤撞击建筑等物理场景,该团队的测试显示Opus 5是少数能够同时处理多个场景的模型之一——不过这类演示通常没有统一的提示词控制、运行次数和评分标准,更适合作为开发者实验而非严格的模型基准。这些作品的共同特点是,它们告别了对传统游戏资产库的依赖,让模型直接将几何体、纹理、物理规则与交互逻辑写入代码。与单张图片测试不同,这类测试的对象变成了长时间运行的系统:需要验证角色能否移动、对象是否会穿模、碰撞逻辑是否正确,以及数十秒后场景状态是否仍保持一致。

尽管看起来像是生成式的微型世界,Karpathy的实验与谷歌DeepMind的Genie等真正的世界模型仍有明显区别。Opus 5生成的是一套显式程序,场景中的对象、坐标与行为都由Three.js代码定义,开发者可以阅读、修改和复用这些代码,优势是结构清晰、可控性强,但模型只能生成其能够用程序表达的对象与规则。而Genie 3则采用生成式视频路线,根据谷歌DeepMind的介绍,它可以根据文本实时生成720p、每秒24帧的可交互环境,并在数分钟内保持视觉一致性,无需显式创建每一个三维模型,而是直接根据玩家操作预测下一帧画面。

两条技术路线解决的是不同问题:代码生成的世界更像是“AI自动编写小型游戏引擎与关卡”,结果可编辑、可调试,但视觉表现容易粗糙;神经世界模型则更像是“实时生成可进入的视频”,画面表现可能更丰富,但缺少传统游戏引擎中明确的对象、状态与规则。未来的产品或许可以融合两者的优势:由大语言模型负责规划任务、设计规则与生成代码,由世界模型负责画面、物理直觉与环境反馈。

这项实验最值得关注的细节,是Opus 5调试代码的方式。Karpathy指出,当前的大模型无法高效、原生地观看连续视频,也无法像人类测试员一样进入游戏、持续移动、碰撞、观察场景来发现问题。它只能运行程序,在若干时间节点截取静态画面,再根据截图修改代码。这个循环不仅效率低下,还很容易遗漏仅在运动过程中出现的问题:比如角色可能在单帧画面中位置正确,但几秒后就会穿过地面;摄像机在静态截图中没有问题,但运动时可能突然转向;碰撞、速度与操作手感更是难以通过几张静态图片判断。因此,最终的场景中仍存在不少错位与粗糙之处。

Karpathy由此认为,视频理解、连续状态感知以及真正“玩游戏”的能力,仍是当前大模型明显欠缺的基础能力。这暴露出一个日益重要的矛盾:模型生成内容的能力,正在快于它验证内容的能力。对于普通代码,模型可以运行单元测试、查看错误日志、对比文本输出,但面对动画、游戏、机器人与复杂用户界面,正确性不再仅存在于文字与数值中,而是分布在连续时间、视觉状态与交互反馈里。如果模型无法亲自体验自己生成的系统,就很难形成完整的“生成—执行—观察—修正”闭环。

从鹈鹕骑自行车的简单测试,到指环王三维场景的复杂开发,大模型的评测标准正在发生微妙的变化。过去的问题是“模型能不能写出代码、画出图片、生成可运行的页面”,而现在的问题逐渐变成:它能不能连续工作数小时,组织数千行代码,保持对象、任务与目标的一致性;在完成任务后,它能不能主动进入系统,发现那些没有出现在错误日志中的隐性问题。

Opus 5生成的并非真正的《指环王》游戏,10美元也只是Token预算的估算,并未包含人工设计、运行环境、验收与修改的正式成本,但这个实验依然标志着一个重要的转折点:那些过去因“太麻烦、太小众、无人愿意做”而不存在的软件与内容,现在只需要一句描述和一笔极低的推理预算就可以被创造出来。模型已经开始具备搭建临时世界的耐力,而接下来的关键,是它何时能够真正看见、进入并理解自己搭建的世界。

以上内容不代表本平台立场,仅供读者参考