产业 / 媒体
Claude Opus 5耗时2小时生成5500行3D场景代码
OpenAI联合创始人安德烈·卡帕西于8月2日在X平台提出一种新的AI能力评估思路:向模型输入《指环王》开篇文字,要求其生成对应的可交互3D场景。此前业内常用「鹈鹕骑车SVG图」来测试大语言模型的空间推理与代码生成能力,但随着模型整体水平提升,这类任务已难以体现差异。卡帕西认为,更复杂的多模态创作任务才能真正考验模型的综合能力。他以Claude Opus 5为测试对象,使用three.js框架,设定100万Token上限(成本约10美元),最终模型在约2小时内输出约5500行代码,生成了包含比尔博告别宴会与藏宝洞穴的3D动画场景。尽管成品质量无法与人工精心制作的内容相媲美,但在自动化生成的时间与成本约束下,完成度仍属较高水准,展示了当前AI在跨领域综合创作方面的潜力边界。
AI基准测试的标准正在悄然迭代。过去,业界惯用生成「鹈鹕骑车」SVG图片的方式来衡量大语言模型的空间推理、几何逻辑与代码生成能力。这一方法曾在模型能力参差不齐的阶段发挥了重要的横向比较作用。然而随着主流模型整体水平快速提升,此类任务已逐渐失去区分度,难以真实反映模型之间的能力差距。
正是在这一背景下,OpenAI联合创始人安德烈·卡帕西于8月2日在X平台提出了一种新的评估思路。他建议将文学文本作为输入,要求模型据此构建可交互的3D场景,从而同时考察模型在代码生成、场景设计与多媒体内容制作三个维度上的综合表现。这一思路将测试难度从单一技能跃升至跨领域协同创作。
卡帕西选取《指环王》开篇首段文字作为输入素材,要求Claude Opus 5使用three.js框架创建对应的3D世界。测试设定的最高资源额度为100万Token,折合成本约10美元。在这一配置下,Claude Opus 5运行约2小时,最终输出了约5500行代码,完成了从文本理解到三维场景构建的全流程任务。
生成的3D动画场景以《指环王》开场情节为蓝本,呈现了霍比特人参加比尔博·巴金斯告别宴会的热闹场面,以及充满财宝的地下洞穴。场景具备一定的动态效果与交互性,在视觉层面初步还原了原著的奇幻氛围。尽管细节精度与人工制作的专业内容仍有明显差距,但整体完成度在自动化生成的语境下已属不俗。
这项非正式测试揭示了当前顶级AI模型在创意内容生成领域的真实边界:在有限的时间与成本约束内,模型已能将非结构化的文学描述转化为具备一定可用性的3D交互作品。卡帕西的提议或将推动社区形成新一代AI评估范式,将综合创作能力纳入模型能力考量的核心维度,为未来的基准测试设计提供新的参照方向。
要点
- 卡帕西提出以「文本转3D交互场景」替代传统SVG图生成测试,作为衡量AI综合创作能力的新基准思路
- Claude Opus 5在100万Token、约10美元成本的限制下,耗时约2小时生成约5500行three.js代码
- 生成场景包含《指环王》开场的告别宴会与藏宝洞穴,具备动态效果与基本交互性
- 成品质量与人工制作仍有差距,但在自动化生成的时间与成本约束下完成度较高
- 此测试思路将代码生成、场景设计与多媒体制作三项能力纳入统一评估框架,或推动新一代AI基准范式形成
原始标题:卡帕西提出测试 AI 能力新思路:100 万 Tokens 额度构建《指环王》3D 交互场景
本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。