卡帕西新基准:百万元素构建指环王3D世界
「OpenAI联合创始人卡帕西提出AI基准测试新思路:让模型根据《指环王》首段文字生成可交互3D场景。测试中,Claude Opus 5使用three.js在100万tokens额度下耗时约2小时输出5500行代码,生成比尔博告别宴会等场景,展示AI在代码生成与空间推理方面的综合能力。」
在人工智能模型能力飞速提升的当下,传统的基准测试方法正面临挑战。OpenAI联合创始人安德烈·卡帕西(Andrej Karpathy)于8月2日在X平台提出一项全新测试思路:让大语言模型基于文学文本构建可交互的3D世界,以此评估其综合能力。
此前,业内常用生成“鹈鹕骑车图”的SVG图片方式测试模型,该方法主要考察空间推理、几何逻辑和复杂代码生成能力。然而,随着模型水平不断提高,这类简单任务已无法有效区分模型优劣。卡帕西指出,需要更具挑战性的测试来推动模型进化。
卡帕西的新基准测试要求模型根据《指环王》开篇首段文字,使用three.js创建3D世界。在测试中,Claude Opus 5获得最高100万tokens的资源额度,成本约10美元。模型耗时约2小时,输出约5500行代码,成功生成了包括比尔博告别宴会和充满财宝的洞穴在内的3D动画场景。
尽管该作品在精细度上无法与人工数小时制作的成品相比,但考虑到AI仅用2小时便完成从文本理解到场景构建的全过程,其完成度已相当可观。这一测试不仅考察模型的代码生成能力,还涉及场景设计、空间布局和多媒体表现,是对模型综合能力的全面检验。
卡帕西的提议引发了业界对AI评估方法的重新思考。传统的基准测试多聚焦于单一任务,而新的3D场景生成任务则要求模型具备跨领域能力,包括自然语言理解、编程实现和创意设计。这种测试方式更贴近真实应用场景,可能成为未来AI能力评估的重要方向。
随着模型能力的持续提升,基准测试的难度和复杂度也在不断攀升。从简单的文本生成到复杂的3D世界构建,AI正在逐步拓展其能力边界。卡帕西提出的新思路,不仅为模型评估提供了新工具,也展示了AI在多媒体创作领域的巨大潜力。
来源:Heooo AI工具导航