
话不多说,直接开始每日瘫坐(doge)!
就在刚刚,大神卡帕西宣布,"我们" Anthropic 已经开始用一种全新的方式,给大模型上强度——
《指环王》。

据卡帕西介绍,这套"指环王基准",正在接替过去风靡一时的"鹈鹕骑自行车" SVG 测试。

具体来说,卡帕西直接把《指环王》的开头丢给 Opus 5,让模型用 Three.js 现场搓出一整个"中土世界"。
至于最终效果嘛,多少有点像上世纪 90 年代末、21 世纪初的国产 3D 动画片:很粗糙,也很抽象。
但客观来说,仔细看上一会儿,如果你又恰好熟悉坐落在新西兰的《指环王》取景地霍比屯,倒也确实能看出那么一丝味道~
不过,就是这么个看起来不太精致的玩意,却实打实地花掉了 Opus 5: 100 万 token,2 个小时以及5500 行代码。
当然,舞台上也并非只有 Claude 一模独自美丽。
最搞笑的,还得是网友新端上来的一碗 DeepSeek V4 Flash 版本。
直接一整个"中国人能飞",画面人物全员漂浮。
面对这些目前肉眼可见的穿帮,卡帕西倒也相当中肯。
他指出,Opus 5 目前还无法真正"进入"自己生成的世界,只能在不同时间点不断截图,再慢慢检查哪里出了问题。
而这恰恰暴露了当前大模型的一块明显短板:
它们已经能写代码、搭场景、生成游戏,却还不能真正看懂视频,也不会亲自玩一遍自己做出来的游戏。
两小时,手搓一个中土
咱们先来看这个"指环王"测试具体是怎么做的。
如果按照卡帕西推文的字面意思,这次输入给 Opus 5 的主要提示词,应该就是《指环王》正文第一章《期待已久的宴会》的开头。

袋底洞的比尔博 · 巴金斯宣布要举办盛大的 111 岁生日宴会,霍比屯立刻议论纷纷……
有兴趣的朋友可以自己试一下。

除此之外,卡帕西还在提示词里指定了 Three.js,也就是一个用代码搭建 3D 场景的 JavaScript 库。
由此,Opus 5 要完成的任务,就是先读懂《指环王》开头的文字,再把它翻译成一个能够在浏览器中实时运行的 3D 世界。

整个过程中,Opus 5 需要用多边形拼出人物、建筑和道具,把它们逐个放进 x、y、z 坐标系,再安排好摄像机、灯光和动画。
人物什么时候移动,镜头往哪里转,灯光如何变化,场景中的物体又该如何互动,全部需要模型用代码定义。
虽然最后的画面称不上精致,而且经常出现穿模、漂浮等问题,比如人物的身体和脑袋分离……但整套场景好歹被真正搭了起来。

需要注意的是,这和视频模型直接生成一帧帧像素并不是一回事。
Three.js 需要先把人物、物体和场景作为三维对象建立起来,再根据代码实时计算它们的位置、角度和运动状态。
所以,我们看到的 Demo 并不是一段普通的 AI 生成视频,而是一个 3D 网页场景运行时的录屏。
不过,卡帕西在评论区也提到,程序化 3D 和视频生成并不是二选一。
有网友提议,可以把这个粗糙的 Three.js 录屏交给 Seedance 充当参考视频,再让视频模型用更高的画质重新渲染一遍。

卡帕西很快表示赞同。
按照他的设想,程序化代码可以负责分镜和控制,先把人物站在哪里、镜头怎么运动、剧情如何推进这些骨架敲定。
接下来再把录屏交给 Video-to-Video 模型,让它补上纹理、光影和细节,把整个中土世界的"卖相"拉满。
至于音频,Opus 5 这次倒没有一起包圆。
卡帕西表示,出于个人对音质的要求,最终使用的是 ElevenLabs。

于是,开头那段有画面、有镜头、还有旁白的《指环王》Demo,就这么横空出世了。
卡帕西也已经将整个项目开源,具体链接可以参考文末。

网友比卡帕西有意思多了
就在卡帕西放出 Demo 后,不少网友也赶来测试了一番。
整体看下来,只能说:
这届网友比卡帕西有想象力多了。
有人用 Claude 启动了一个「Earth Online」项目,目标是靠一群 AI Agent,把整个地球一点点搭出来。
杠杆配资百科目前,Agent 还没造完整个地球,只搭出了一个低多边形风格的旧金山滨水区。但从现有画面来看,建筑比例、人物尺度和整体风格都保持得相当统一。
这个效果有点像那种乐高世界的动画片。画风不复杂,但人物、场景和动作能在同一个世界里稳定运行。
照这个方向继续走,简单画风的动画和轻量游戏,已经有了点 AI 原生的雏形。
还有网友用 Fable 5 和 GPT-5.6 Sol 搭出了纽约市的 3D 数字模型,并在其中接入实时数据。
模型不仅要把纽约的街道和建筑摆对,还要维持不同区域之间的空间关系。作者也因此提出,这种生成虚拟世界的任务,或许可以成为一种新的空间推理 Benchmark。
更夸张的还在后面。
有网友没买到 Kanye West 的演唱会门票,干脆用 AI 在浏览器里给自己补办了一场。
整个项目依旧由 Three.js 搭建。只有一个 HTML 文件,没有调用任何现成的 3D 模型,舞台、人物和灯光全部由代码生成。
整场演唱会一共准备了 14 首歌,每首歌都有独立的灯光设计和一套专属的球形舞台视觉。
普通用户可以试听片段,连接 Spotify Premium 后,还能播放完整曲目和整场演出。
没抢到票,直接给自己生成一个包场,太亏贼了!
还没完!!!
元股证券:ygzq.hk
卡帕西在原帖末尾还畅想,后续可以给这些 3D 世界加入玩法,让玩家以旁观者、NPC 甚至故事角色的身份进入其中。
结果游戏版本还没等卡帕西安排,网友已经做出来了。

这个项目同样使用 Opus 5 和 Three.js,不仅能运行和交互,连音频都配上了。
更多 3D 设计案例也在不断出现。从建筑比例、空间布局到场景风格,Opus 5 已经能在规模不小的项目里维持相对稳定的一致性。
类似实例还有很多,这里就不逐个展示了。
客观来讲,这些作品距离真正成熟的游戏仍有距离。
眼花缭乱的玩法是否有趣、长时间运行是否稳定、玩家会不会真的愿意在里面待上 15 分钟,目前都还没有答案。
但实时 3D 内容和可玩原型的制作门槛,确实被向下推了一大截。
更何况,能有一种新的方法测试模型能力,同时又足够有趣、好玩,岂不美哉?
鹈鹕,骑到头了
那么,为啥突然要让大模型生成《指环王》呢?
这还得从前几年爆火的"鹈鹕骑自行车"测试说起。
这道题最早来自开发者 Simon Willison,要求只有一句话:
生成一张鹈鹕骑自行车的 SVG 图片。

虽然这题目看起来简单,但其实它相当考验模型。
因为 SVG 看起来是一张图片,底层却是一串代码。
模型不仅要知道鹈鹕和自行车分别长什么样,还得把它们拆成线条、圆形和多边形,再用坐标安排好每个部件的位置关系。

更关键的是,鹈鹕和自行车本身就不怎么般配。
自行车的车架、轮胎和踏板必须保持正确的几何结构;鹈鹕则长着大嘴、短腿,以及一副怎么看都不像会蹬车的身材。

两者一组合,模型到底有没有理解空间关系,几乎一眼就能看出来:
轮子歪没歪、脚踩没踩到踏板、鸟到底是在骑车,还是被车架当场肢解。
看看上面这些 24 年年底的 demo 吧~
正因如此,"鹈鹕骑自行车"一度成了民间观察大模型空间理解、物体组合和代码生成能力的经典测试。

但随着模型越来越强,这只鹈鹕也快骑到头了。
看看下面 DeepSeek R1 和 DeepSeek V4 的表现就知道,如今的模型已经能把这道题完成得相当像样。

更重要的是,一张 SVG 只能考察模型的一次性输出。
它测不出模型能不能规划一个复杂项目、连续工作几个小时,并在几千行代码里反复检查和修正自己的错误。
于是,卡帕西把一道"画张图"的小题,换成了"搭个世界"的大工程——
鹈鹕可以下车了,中土世界正式接棒。

卡帕西的鹈鹕
很快,卡帕西准备给"鹈鹕测试"换题的消息,也传到了各大社区。
Hacker News 的高赞评论认为,虽然这些 Demo 的画面质量都很一般,但这恰恰说明,我们需要一个比生成单张图片更难的新测试。
新的基准不该只看模型能不能把图画对,还要考察它能不能理解一个世界。

毕竟,"鹈鹕骑自行车"已经用了太久。
模型不断针对这类任务刷榜,彼此之间的差距越来越难看出来。
相比之下,生成一个完整的 3D 世界,需要模型理解人物和物体之间的空间关系,处理镜头、动作和场景变化,而不是简单调用视频生成模型吐出一段画面。

当然,也有人提出反对意见。
鹈鹕测试足够简洁,成本低,结果也容易比较。
为了测一次模型,消耗那么多 Token 生成整个 3D 世界,多少有点拿算力放烟花的意思。

与此同时,Three.js 本身能不能衡量大模型的综合能力,也遭到了质疑。
有人认为,这类 Demo 最多只能证明 Anthropic 在 Three.js 代码上训练得不错,不能说明模型真的理解了空间和物理世界。
但很快就有网友反驳:
把一段抽象、含义模糊的文学文本转化成 3D 动画,模型需要同时处理空间关系、物理规律、日常物体,以及 3D 变换和计算机图形学中的数学问题。
如果这还只能算"会写 Three.js ",多少有点低估这 5500 行代码了。

还有网友提出了一个更开放的问题:
所谓"空间推理",真的和大模型平时处理文字、代码时的推理不同吗?
一种观点认为,画面能否成立,取决于模型是否理解"前后、内外、远近、遮挡"等空间关系,以及物体在不同视角下的距离、角度和相对大小。

但另一种观点认为,无论模型处理的是"石头旁边",还是"数组里面",做的可能都是同一件事:根据上下文逐个生成 Token,并在这个过程中完成推理。
如果是这样,那么,Opus 5 展示的就不只是一项突然冒出来的"空间能力"。
更可能的情况是,大语言模型原本用于理解文字和代码的通用推理能力,已经开始自然延伸到三维世界。
从画一只鹈鹕,到搭出一个中土世界,题目看起来变了,但背后测试的或许始终是同一个问题:
模型能不能把自己对世界的理解,转化成一套真正能够运行的结构。
而在最后,也许还有一个更加离谱的问题——
如果通用大模型已经能够自己写代码搭建 3D 世界,再调用 Seedance、ElevenLabs 等 API 完成画面和声音,那么用户还有多少必要,亲自打开一个专门的视频生成产品输入 Prompt?
参考链接
[ 1 ] https://karpathy.ai/lotr-movie/
[ 2 ] https://simonwillison.net/2025/Jun/6/six-months-in-llms/
[ 3 ] https://x.com/wizardbrainz/status/2083012159341203708
[ 4 ] https://x.com/aniketjart/status/2083645765097033845
[ 5 ] https://x.com/davidfromkansas/status/2075691129899528254
[ 6 ] https://x.com/MindaugasLT/status/2083488027343470939
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
� � 点亮星标 � �
科技前沿进展每日见互联网配资
元股证券炒股平台提示:本文来自互联网,不代表本网站观点。