@karpathy Karpathy这个实验,可能是这周最有意思的AI demo了吧?
他扔给Claude Opus 5一段话,100万token预算、大概10美金。
两小时后,Claude自己写了5500行Three.js代码,把《魔戒》开篇变成了一个能跑的3D世界。
低多边形风格的夏尔,绿色丘陵、河流、树、比尔博的圆门、地下宝藏隧道、黄昏聚会、夜晚星空、甚至还有个发光的戒指。
镜头运动、资产布局、动画、字幕,全是代码程序化生成的,没有一张预先做好的贴图。
画面有点糙,动作有点janky,但它能流畅跑起来,
Karpathy说这个实验真正有意思的不是"AI又写了个demo",核心是两件事。
第一,LLM的"耐力"正在打开一种全新的东西。
没有任何一个人类程序员会花时间写5500行代码,就为了把《魔戒》第一段渲染成一个一次性的3D场景。
投入产出比太低了,但AI不在乎,它有近乎无限的耐心,10块钱,两小时,"为什么不?"
这不是把已有事情做得更快,这是把以前"根本不会有人做"的事情,变成了"几乎免费就能做"。
按需生成的、高度定制的、用完即弃的虚拟世界。
你喜欢哪本书?扔进去,它给你生成一个能走进去的3D场景。
你想在某个故事里当旁观者?给它一段话,它给你造一个临时的小世界。Karpathy管这叫ephemeral--短暂存在的互动体验。
以前这需要一个团队干几个月,现在10块钱。
第二,它暴露了当前AI最要命的短板。
AI能写5500行代码生成一个3D世界,但它看不见这个世界。
它不能高效地"看"视频,不能钻进自己生成的游戏里走两步、转个视角、检查一下比尔博的门是不是歪了、树是不是穿模了。
它只能非常慢地截个图,用文字描述给自己听,然后猜哪里有问题。
这就是为什么结果有点糙。写代码的能力已经到了,但自我审计的闭环--感知、交互、反馈--还远远没到。
写代码是一回事,看见自己写的东西是另一回事。
Karpathy做这个实验的真正意图,其实是在说:测试AI的方式该升级了。以前"画个骑自行车的鹈鹕SVG"就能测出模型水平,现在不行了。
真正拉开差距的,是这种长时程、高复杂度、需要持续自我纠错的任务--给它一个目标,让它自己干两小时,看它能走到哪。
从"画个SVG"到"生成一个世界",测试范式在变,AI能力的边界也在变。
10块钱,两小时,一个能跑的夏尔。
2026年了,我们还在习惯这件事有多离谱。