产业 / 媒体
Karpathy用Claude Opus 5构建3D浏览器世界
Andrej Karpathy近日发布了一项引人关注的AI实验:他将《魔戒》开篇的一段文字输入Claude Opus 5,模型在约两小时内自动生成了5500行代码,并借助Three.js图形库在浏览器中渲染出一个完整的3D场景。整个过程消耗约100万个token,花费约10美元。模型自主完成了场景中物体的摆放与动画设计,音频部分由Eleven Labs提供。Karpathy将这一实验定性为「氛围测试」而非严格基准,认为此前广为人知的「鹈鹕测试」已接近饱和。他指出,这类实验展示了AI按需生成游戏世界的潜力,用户甚至可以作为角色被置入其中。不过,模型目前无法直接观看自己的视频输出,只能依赖截图进行校验,这导致了部分错误。Karpathy目前在Anthropic从事预训练研究,此次实验也折射出他对AI创作能力边界的持续探索。
Andrej Karpathy最近进行了一项颇具创意的AI实验:将《魔戒》开篇的单段文字输入Anthropic的Claude Opus 5模型,要求其生成一个可在浏览器中运行的3D场景。模型在约两小时内输出了5500行代码,使用Three.js图形库完成渲染,整体花费约10美元(对应约100万个token的预算)。Karpathy随后将源代码公开发布,供其他用户自行回放和修改。
在场景构建过程中,Claude Opus 5自主决定了物体的摆放位置与动画效果,音频部分则由Eleven Labs提供。Karpathy坦言结果「粗糙但有趣」,并强调没有人会手工搭建这样的世界,但借助AI模型,这一过程几乎可以零成本实现。他认为,这类技术具备打造「按需游戏世界」的潜力,用户可以作为配角或主角被直接置入场景之中。
此次实验也引发了Karpathy对AI评测方式的思考。他提到,此前广受关注的「鹈鹕测试」——由Simon Willison设计、要求模型绘制一只骑自行车的鹈鹕SVG图像——已接近能力上限,难以继续区分不同模型的表现。更早的先例来自2023年微软的AGI论文,彼时研究人员让GPT-4用TikZ语言绘制独角兽,以此论证模型的空间推理能力。
然而,这类实验目前仍存在明显局限。Claude Opus 5无法直接观看自己生成的视频输出,只能通过截图进行自我校验,这一限制导致场景中出现了若干错误。尽管如此,已有其他用户尝试让Opus 5编写完整的浏览器游戏,涵盖第一人称射击游戏乃至《我的世界》克隆版本,显示出模型在交互式内容生成方面的广泛潜力。
Karpathy明确将这类实验定性为「氛围测试」而非硬性基准,强调其价值在于直观感受模型能力,而非精确量化。他曾联合创立OpenAI,并担任特斯拉AI负责人,后创办教育初创公司Eureka Labs,自2026年5月起在Anthropic从事预训练研究。此次实验既是对AI创作边界的一次探索,也折射出业界对新型评测范式的持续思考。
要点
- Claude Opus 5仅凭一段《魔戒》文字,在约两小时内生成5500行Three.js代码,花费约10美元,展示了AI低成本生成复杂3D内容的能力。
- Karpathy认为「鹈鹕测试」等传统AI氛围测试已接近饱和,业界需要探索更能体现当前模型能力边界的新型评测方式。
- 模型目前无法直接观看自己的视频输出,只能依赖截图校验,这一感知局限导致生成场景中出现错误,是当前多模态能力的短板之一。
- 按需生成游戏世界的构想正逐步从概念走向实践,AI有望让个性化、低成本的交互式内容创作成为现实。
原始标题:Unicorn, pelican, Middle-earth: OpenAI co-founder Karpathy is looking for the next AI vibe test
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。