一段托尔金笔下的中土世界开篇文字,在AI手里能变成什么?前OpenAI联合创始人、现任Anthropic预训练研究员的安德烈·卡帕西(Andrej Karpathy)给出了一个让人眼前一亮的答案:大约10美元的成本、两小时的自主运行,外加5500行代码,一座可以在浏览器中漫游的《指环王》3D场景就诞生了。8月3日,这位AI大神在社交平台公开了完整实验过程,并把源代码一并开放,在AI圈引发热议。
这场实验之所以引人注目,在于它把大模型测试从单张图片的静态任务,推进到了持续约两小时的完整制作流程。卡帕西给Claude Opus 5下达的指令很简单:把《指环王》开篇故事用Three.js制作成3D动画,预算100万token。模型需要自己理解原文、拆解场景、创建多边形资产、把人物和物体放进三维坐标,再编写镜头与动画代码,并在运行过程中不断检查修正。最终交付的不是视频模型合成的画面,而是一个能在浏览器里运行的完整程序。
从实际效果看,Claude Opus 5的表现超出了多数人的预期。模型自主完成了资产建模、坐标摆放、镜头设计和动画编排,山川、道路和建筑的位置关系已经有了基本的空间逻辑,场景虽然粗糙但整体可玩。音频部分由ElevenLabs提供,最终呈现在浏览器里的中土世界,已经具备了一座可探索虚拟场景的基本骨架。卡帕西将这次实验定义为一次气氛检查,而非严肃的基准测试,但恰恰是这种轻松的定位,让更多人看到了大模型在长程创作任务上的真实潜力。
与传统测试相比,这次实验的含金量体现在任务复杂度上。过去测试大模型视觉编程能力,主流做法是让模型用SVG画一只骑自行车的鹈鹕,这类任务结果直观、生成时间短,但已接近能力上限。卡帕西把测试扩展到了需要持续迭代的3D场景制作:模型先读懂文本,再规划场景结构,随后动手写代码,最后还要自我检查修正。这种端到端的长流程任务,更接近真实的游戏开发工作,也更能暴露大模型的真实水平。
值得注意的是成本。整场实验消耗约100万token,花费约10美元,折合人民币不到70元。放在过去,让一个专业团队搭建同等规模的3D场景原型,动辄需要数天时间和数万元预算。卡帕西感慨,这种几乎零成本的生成能力,正在重塑人们对AI创作成本的想象。当模型能够以近乎免费的方式产出可交互的3D世界,游戏原型验证、场景概念设计等环节的成本结构将被彻底改变。
实验并非一帆风顺。卡帕西坦承,Claude Opus 5无法高效观看连续视频,也无法进入场景试玩,只能通过缓慢截取不同时点的画面逐张检查视觉效果。这种间接反馈机制造成了一些明显错误,模型需要反复调整才能让画面达到基本可用。他直言,这种方式的可靠性还远不足以打造真正的游戏产品,但若只论创造一种感觉,它已经及格。
这种短板恰恰揭示了当前大模型的共性瓶颈:生成能力与验证能力的脱节。模型可以快速写出大量代码,但缺乏实时感知自身产出的能力,只能依赖静态截图这类低效反馈。卡帕西将这一问题形象地比作人类写作时无法回看自己刚写的文字,只能凭记忆判断好坏。芬兰手游公司Supercell的创意AI主管提出,可以把程序化动画输入Seedance等视频模型提升画质,卡帕西赞同这一思路,认为程序化代码负责分镜和控制,视频模型负责纹理和最终视觉效果,两者结合或许能补上验证环节的短板。
从技术演进的角度看,这次实验还带出一个更深层的信号:模型能力正在从参数智能走向执行环境协同智能。过去评测大模型,看的是它能答对多少题;如今评测维度已扩展到模型能否在真实环境中自主规划、执行、纠错。卡帕西设想,未来大模型可以按需生成临时虚拟世界,用户说出需求即可获得可交互的空间。虽然这一天还有距离,但10美元成本下的这次尝试,已经让行业看到了通往那个方向的路径。
这场实验的更大意义,在于它重写了AI评测的方法论。过去一年多,科技圈流行用各种气氛测试检验模型能力,最著名的是Simon Willison设计的鹈鹕测试,让AI画一只骑自行车的鹈鹕。这个提示故意足够荒诞,确保训练数据中几乎不存在现成对应图像,既考验物体组合,也考验对结构关系的理解。这类测试的源头可以追溯到2023年微软发表的《Sparks of AGI》论文,当时研究者让GPT-4用TikZ画一只独角兽,并视其为模型具备空间推理能力的证据。
卡帕西认为,鹈鹕测试已经接近上限,各大模型都能交出令人满意的SVG,因此他把目光投向了更复杂的3D场景生成任务。从静态单图到动态长流程,测试难度的跃升背后,是模型能力边界的扩展。当单幅图像测试无法再区分模型优劣,行业需要设计更贴近真实生产的评测任务,而这正是卡帕西这次实验的探索方向。他选择《指环王》开篇作为输入,因为文本足够丰富,能考验模型的空间想象力与场景组织能力。
对于游戏行业而言,这次实验传递的信号同样清晰。当AI能以极低成本生成可交互的3D场景原型,游戏前期验证的试错成本将大幅下降。独立开发者可以先用AI快速搭建概念场景,再决定是否投入重金精细化制作。卡帕西把源代码完全公开的做法,也让更多开发者可以直接上手复现实验,验证模型在自身需求场景下的表现。可以预见,围绕长程创作任务的AI评测体系将加速成型,而10美元造出3D世界的这一天,只是一个开始。