8月3日消息,Anthropic研究员、OpenAI创始成员、前特斯拉AI负责人Andrej Karpathy,最近给自家刚发布的Opus 5出了一道怪题:只给《指环王》的第一段,让它用Three.js做成一个可以在浏览器里运行的场景。

他给了模型100万token预算。两小时后,Opus 5交出约5500行代码。Karpathy估算,成本约10美元。


(资料图片仅供参考)

页面能跑,人物、地形和动画也都有,只是处处透着“毛坯房”的感觉。更麻烦的是,模型不会进入自己造出的世界,只能慢慢截取不同位置的画面,靠截图检查哪里出了问题。

没人会为一个念头写5500行代码

Karpathy想做的,是把“骑自行车的鹈鹕”测试往前推一步。那是一道故意出得生僻的题:模型面对的组合越少见,能够直接借用的现成答案就越少。

跟帖里的@isweepyou说得很刻薄:“所谓鹈鹕测试,其实是在问,没有现成的Reddit帖子可抄时,它还能不能工作?”题目从一张怪图变成一段可以运行的三维场景,要调用的也不再只是画面生成,还包括空间安排、代码、动画和故事顺序。

Karpathy在意的并不是这5500行代码有多漂亮,而是模型肯花两小时干一件工程师通常不会接的活。一段文字、一个临时念头,不值得专门排期,更不值得花几天搭场景、调坐标、写交互。到了模型这里,过去的“没人会做这个”,变成了“几乎不要钱,为什么不做?”

他想到的也不是把这个页面继续打磨成商业游戏,而是阅后即焚的小世界:一次阅读可以有一个版本,一堂课可以有一个版本,一个玩家也可以拥有只为自己存在的版本。Karpathy把它叫作某个主题“按需生成的临时GTA”。

世界搭起来了,验收还靠截图

模型碰到的麻烦在交作业以后。按Karpathy的描述,Opus 5可以安排多边形资产的三维坐标,也能写出让它们动起来的代码,却不能高效观看动画,更不能像玩家一样在场景里走一遍。它反复截图、修改,最后还是留下了不少毛糙之处。

跟帖里的TeleLLM提了个办法:把玩家试玩时发现的问题,留作下一轮测试。有人发现一堵可以穿过去的墙,或一个失灵的菜单,模型下次就多一项必须修好的错误。玩家发现得越多,后续测试的检查项也就越完整。

Karpathy随后把试玩版挂到了网上。人可以点开页面,沿着模型搭好的路走进去。5500行代码把世界搭起来了,但最后那一圈路,还得有人替它走一遍。(易句)

(本文由AI翻译,网易编辑负责校对)

推荐内容