Anthropic旗下大模型Claude Opus 5发布仅两天,便出现了利用三段简短提示词生成浏览器端第一人称射击(FPS)Demo的案例,引发外界对AI编程中提示词设计方法的关注。
据加密货币媒体Decrypt当地时间28日报道,AI投资者、AI公司Hyperlight前CEO Matt Shumer公布了一段视频,称Claude Opus 5在未使用任何外部素材(asset)的情况下,“自行完成”了一款FPS游戏的制作。
Shumer展示的Demo可直接在浏览器中运行。他表示,这款游戏是在单轮提示下生成,画面中出现的所有元素均由定制代码实现,没有调用任何外部资源。
从GitHub公开内容看,这组提示词仅由三部分组成:首先要求模型制作一款以《Call of Duty》为对标对象的射击游戏;其次将整体任务拆分给多个子代理协同完成;最后再引入一个独立的“严苛批评代理”,将各项输出与真实游戏画面进行盲测对比,并要求最终结果必须达到“完美”。
这组提示词的重点,并不在于罗列冗长的功能清单,而在于先设定清晰的对标对象,再通过反复评测推动迭代。Shumer将这一方法概括为“gauntlet loop”:为代理设定可验证的标准、拆细任务流程,并避免由生成结果的一方自行评估。他同时表示,自己并未预先指定渲染器,也没有逐项列出游戏系统清单,或对所谓AAA级质量作细致定义。
在具体执行层面,流程调用了Claude Code相关能力。各子代理在彼此隔离的上下文和工具权限下工作;“Ultracode”设置允许模型先制定执行计划,再最多将任务分发给16个代理;Anthropic内置的“/loop”功能则用于让修改、测试和调整持续循环。Shumer称,自己并未限定迭代次数,而是由“批评代理”持续提出问题,推动系统不断改进。
最终生成的游戏基于Three.js和WebGL2运行,代码规模约为5.5万行,拆分为11个子系统。根据公开说明,纹理、网格、动画和声音均在浏览器加载过程中生成,未使用任何下载的模型、图片或音频文件。不过,从其公开的批评日志来看,系统评分虽在10分制下从3.59分提升至略高于5分,但在记录的全部轮次中,对标对象《Call of Duty》始终占优。
此后,围绕同一提示词也出现了多组复现案例。前对冲基金经理、播客主持人James Altucher表示,自己使用同样的提示词,耗时略超10小时、消耗约130万token,制作出一款名为“Operation Blackout”的作品。另有名为Prompt Silo的开发者将同一请求用于OpenAI高阶模型“Sol 5.6 Ultra”,并公开了结果。相比之下,开发者Leon Lin并未采用Shumer的短提示词,而是编写了一份约20章的详细文档,内容包括布娃娃物理和阴影贴图等要素,并在Cursor中进行测试,最终生成的“Dust Corridor”同样可以在浏览器中运行。
不过,这些后续案例并未按照Shumer所采用的盲测对比方式进行验证。三段提示词在不同模型、不同工作流下能否稳定复现类似结果,目前仍缺乏充分证据支持。
除技术表现外,外界也对这一案例的边界提出质疑。FPS本就是公开代码、教学材料和开发者论坛案例极为丰富的游戏品类。以Three.js为例,其本身就提供了指针锁定相机控制示例,而鼠标视角移动、WASD移动以及基于射线的射击处理等实现方式,也早已在公开社区中广泛传播。在这样的环境下,学习过公开代码仓库的代码生成模型,究竟是在独立构建新方案,还是仅仅重组已有结构,仍难以排除疑问。
研究者通常将这一问题归为“训练数据污染”:当高度相似的示例本就存在于训练数据中,模型输出更可能来自结构重构,而非全新的推理过程。此次FPS案例并未公开相应的核查流程。因此,与其将其视为AI在毫无先例的情况下从零设计射击游戏的证据,不如将其看作一次能力展示:在文档化程度较高、公开案例充足的成熟品类中,代理式编程工具或许已能释放出相当可观的开发能力。
Shumer在发布相关视频时写道,Claude Opus 5通过单轮提示完成了这款游戏,Demo中的所有内容均由定制代码生成,没有使用任何外部素材,并称“AI游戏将会非常惊人”。