看起来最愚蠢的人工智能提示刚刚击败了数月精心设计的游戏设计提示工程

CN
Decrypt
关注
12小时前

就在Claude Opus 5发货的两天后,人工智能投资者和前HyperWrite首席执行官马特·舒默发布了一段视频,展示了模型完全自主构建的可玩第一人称射击游戏。


“Claude Opus 5一击便完成了这个游戏,”他写道,并补充说没有任何外部资产出现在构建中。





现在,您可能会认为如此高质量的产出需要一个长篇、详细且小心的提示,以引导人工智能模型处理构建一个精良第一人称射击游戏的复杂性。


再想想。



其背后的提示只用了三个简短的段落,已在GitHub上完整发布。它告诉Opus 5构建一个与最新《使命召唤》游戏水平相当的射击游戏,派出子代理——每个都有自己的独立记忆和狭窄的工作——来分别解决各个部分,并持续循环每个部分,直到它能在与真实的《使命召唤》画面进行盲测时表现出色。根据提示,结果应该是“完全完美的”。





这与提示工程师教人工作的方式正好相反。通过氛围编码热潮提供的建议是要指定标准而非形容词:说明“好”的意思,而不仅仅是请求它。代码应考虑什么,而不是简单地说“AAA”。


舒默的版本与此几乎相反,要求其子代理“极度惊艳”,并将实际定义留给Opus 5为自己构建的评论者。


这几乎就是整个简要。舒默后来写道,他从未指定渲染器,列出游戏系统,或定义“AAA质量”需要包含什么。他开始称这种方法为高压循环:给一个代理一个真实的、可检查的标准,而不是模糊的指令,让它将工作分解成小部分,并通过一个评论者路由每个部分,该评论者永远看不到构建者自己对选择的推理。


两个Claude Code特性包含了这种循环。子代理在孤立的上下文窗口中启动,拥有自己的指令和工具访问,因此对武器模型进行评分的评论者不会继承构建者对于其外观的借口。Ultracode是一个Claude Code设置,推动模型达到其最高推理努力,让它编写自己的编排计划,同时分配多个工作给多达16个代理,并在每次运行中限制在1000个。


Anthropic内置的/loop技能,专为重复修复-测试-调整周期而构建,阻止了游戏在看起来体面时便停止运行。舒默从未指定轮数。他让评论者不断提出新的缺口,并让构建者为此追逐了几个小时,然后才自己结束了会议。


最终构建在Three.js和普通WebGL2上运行,代码大致包括55,000行,分布在11个子系统中。每个纹理、网格、动画和声音都在加载时在浏览器内生成——没有下载模型、HDRI、图像文件或音频文件。舒默自己发布的评论日志显示,分数从3.59分上升到略高于5,仍旧每一轮都落后于真实游戏。


怀疑人士推测进行了数小时的隐藏手动编码,因此舒默发布了完整的提示和代码库。就在那时,复制者开始出现。


同样的把戏,三个不同的构建者


詹姆斯·阿尔图切尔,前对冲基金经理和播客主持人,运行了相同的提示,并报告说在Opus 5上花了“稍微超过十小时”和大约130万个tokens来实现这一点。他的构建,黑暗行动,在浏览器中免费游玩,看起来非常不错。


您可以在这里玩这个游戏




Prompt Silo的开发者则将同样的请求指向OpenAI的竞争对手旗舰,而是发布了“Sol 5.6 Ultra与相同的提示”——Sol是OpenAI于7月9日发布的三模型GPT-5.6家族中的顶级版本,与便宜的Terra和Luna版本一起发布。



开发者莱昂·林尝试了相反的做法,选择了通常的详细提示。他没有复制舒默的短版本,而是设定了“逆向工程一个游戏的提示”,生成了一份大约20个部分的文档,详细说明了从布娃娃物理到级联阴影图的一切。他将其输入到Cursor中,使用普通的高强度Opus 5,没有子代理和无ultracode,结果是一个市场街射击游戏Dust Corridor,也可以在浏览器中玩,并且看起来也很棒。




后续的构建没有经历舒默在自己项目上进行的盲测。他的评论日志仍然显示真正的《使命召唤》在他记录的每一轮中获胜——阿尔图切尔和原子潭工作室用他完全相同的三段提示追逐的标准,而莱昂·林则追逐着他自己约20个部分的标准。


这到底有多少是新东西?


像Claude Code这样的代理编程工具像一个受监督的初级工程师那样编写软件:它们读取文件,运行代码,查看生成的屏幕截图,将工作的某些部分交给检查结果与声明目标相比的子代理和评论者。这个循环是真实的,而舒默的高压循环是一种真正的结构化方法。然而,单靠这些,并不能证明模型是从想象中设计出一个游戏,而不是对其已经吸收的代码模式进行重新组合。


Three.js随带自己的指针锁定相机控制作为官方示例,并且这个基本模式——鼠标视角、WASD移动、射击的射线投射——在GitHub、gists和开发者论坛上已经被分叉和教程化超过十年。一个经过公共代码库训练的编程模型几乎肯定在阅读舒默的提示之前已经见过成百上千个几乎完全相同的射击游戏。


这并不意味着《Claude of Duty》是假的,但这使得“从头开始构建”更难以完全认可,因此请对这些结果持谨慎态度。


研究代码生成模型的研究人员对这一更广泛的问题有一个名称:数据污染,即当一个模型在某项任务上表现良好,主要原因是在其训练数据中已经存在近似相同的示例,而不是因为它推理出了某种新东西。


没有任何一款发布的第一人称射击游戏对这种污染进行了检查。舒默自己的代码库确实包含了Claude自己的创造力,如果这样说是公平的话。这是将“一击便完成一个AAA游戏”理解为在编程中一个被详尽记录的类型内工作的能干代理的理由,而不是作为证明AI在没有任何先前艺术可依赖的情况下设计了一个射击游戏。


免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。

分享至:
APP下载

X

Telegram

Facebook

Reddit

复制链接