top of page

Andrej Karpathy 表示 Techmeme LLMs 预示着创作新时代,但审计缺口依然存在

Andrej Karpathy 表示,尽管 LLMs 仍存在一项基础弱点——无法可靠地检查自己构建的内容——但它们已经跨越了一个引人注目的门槛。最新的 techmeme llms 讨论聚焦于:系统能够根据简短指令创建定制化、可交互的世界。然而,这些系统往往仍需依赖人类来发现失效的物理效果、放错位置的物体、视觉瑕疵以及缺失的交互。

Karpathy 通过与一项较早的模型测试进行对比,来阐述这一转变。过去,要求 LLM 生成一幅“鹈鹕骑自行车”的 SVG,曾用于检验其对代码、几何和物体关系的理解。如今的挑战则大得多。模型现在可以生成可探索场景背后的软件,包括动画、镜头、光照和模拟行为。

这种规模改变了成功的定义。生成数千行看似合理的代码,并不等同于生成一个连贯的世界。如今的核心竞争在于生成与验证之间。模型扩展作品的速度,已经快于其感知、测试和修复最终体验的能力。

Techmeme LLMs 超越鹈鹕测试

Karpathy 的帖子标志着评估从孤立输出转向完整体验。

在他的原帖中,Karpathy 表示,该领域正在离开创建“鹈鹕骑自行车”SVG 等测试所代表的阶段。他将 LLMs 描述为正迈向可按需生成的高度定制化世界。

这篇帖子于 2026 年 8 月 2 日通过一场 Techmeme 讨论传播开来。随附材料展示了对一个虚构场景的动态三维诠释。它似乎结合了生成的代码、角色、环境元素、运动和镜头行为。

公开材料并不能证明这是一项受控基准测试。它没有披露其中涉及的每一条提示词、干预、重试或人工修正。因此,这一演示应被视为一种可能工作流的证据,而非自主世界创作的证明。

即使附带这一限定,这种变化仍具有重要意义。SVG 是一个边界明确、表面积相对较小的作品。基于浏览器的世界则包含众多相互作用的系统,而每个系统都可能分别失效。

模型必须选择物体的位置、比例、颜色、材质和运动路径。它必须管理渲染代码、时间控制、镜头布置、动画状态和用户控件。它还需要将模糊的文字描述转化为具体的视觉决策。

这正是鹈鹕测试最初变得有用的原因。自行车具有可辨识的机械关系。模型可以生成看起来像自行车的东西,却错误地连接车架、链条、踏板和转向装置。

软件也能以更宏大的视觉效果掩盖同类问题。一个生成场景在短暂录制中或许看起来令人印象深刻,却可能在不同镜头角度下失效。用户移动时,物体可能悬浮、消失、穿过墙壁,或改变大小。

这些失败比畸形的绘图更难概括。它们会在时间维度上的交互中显现,而非出现在单个静态画面里。审阅者必须探索这个世界、记住先前状态,并理解哪些结果违背了预期设计。

Simon Willison 持续更新的鹈鹕合集说明了视觉测试为何受到关注。不同模型可以编写有效的 SVG 代码,却对同一请求生成明显不同的诠释。输出暴露了常规编程基准往往遗漏的差距。

不过,基准测试也可能达到饱和。一旦模型能够复现熟悉的测试模式,提示词便不再能区分广泛能力与针对性训练或记忆化惯例。更大、可预测性更低的环境,为揭示错误创造了更多空间。

因此,最新的 techmeme llms 争论主要并非关于展示出的世界是否值得艺术赞誉。它关乎 AI 创作的单位是否已经扩大。现有证据表明,答案是肯定的。

用户不再只能请求一张图片、一段文字、一个组件或一份脚本。请求可以描述一种为个人量身打造的临时体验。模型可以在用户等待时,通过代码组装这种体验。

这与传统游戏开发不同。工作室面向广泛受众构建共享产品,并在发布前进行测试。按需生成则将软件视为临时、个性化且低成本可请求的事物。

教师可以请求一份对历史场景的交互式呈现。儿童可以请求一个基于睡前故事的小世界。产品团队可以在投入正式生产前,将书面场景转化为可导航的原型。

这些结果并不需要达到电影级真实感才具有价值。低保真生成世界依然可以传达空间关系、交互理念和叙事顺序。它们的价值可能来自具体性和速度,而非精致度。

因此,这一演示改变了问题。问题不再只是“LLM 能否画出所请求的物体?”更困难的问题是:“当这个系统被探索时,它能否保持连贯?”

按需世界给创意软件带来压力

眼下的压力主要落在那些默认每一段交互式体验都需要漫长、人工制作流程的工具上。

传统创意软件将写作、插画、建模、动画、编程和测试分开。专业人员通过文件、编辑器和审查流程推进工作。生成式系统则将多个阶段压缩进一个对话式界面。

这种压缩改变了原型的经济性。一个曾经只停留在文档里的概念,可以成为可运行的场景。团队能在投入成品资产前评估节奏、规模和交互。

最强的短期应用场景并不是取代一款完整的商业游戏,而是生成一次性的模拟、视觉说明、故事草图和界面实验。这些输出只需存活足够长的时间,以回答一个聚焦的问题。

游戏设计师可以测试某项机制是否易于理解。电影人可以审视一个场景的粗略走位。教育工作者可以制作符合某名学生兴趣的可探索课程。

知识工作者也可以将笔记转化为交互式呈现。个人AI 知识库可以保留这些请求背后的源材料。当生成体验需要可追溯性时,这些上下文尤为重要。

更大的机会在于个性化。传统媒体通常向每位观众提供相同的作品。生成式软件则可以针对每次会话改变角色、复杂度、节奏、语言或主题。

定制世界可以响应数分钟前提供的信息。它可能融入用户的项目、虚构角色、学习目标或偏好的视觉风格。这使输出更接近一个生成的应用程序,而不是静态媒体作品。

Google DeepMind 通过世界模型探索了相关方向,即模拟环境在动作发生后如何演变。其 Genie 3 研究描述了由文本生成、分辨率为 720p、每秒 24 帧的可导航世界。

DeepMind 表示,这些环境可以在数分钟内保持一致性。它也承认动作空间有限、难以模拟多个独立智能体,以及地理准确性并不完美。这些限制说明,仅有令人印象深刻的视频是不够的。

Karpathy 的案例代表了另一条技术路线。LLM 可以编写由浏览器执行的传统图形代码。专用世界模型则根据先前帧和用户动作,更直接地生成未来视觉状态。

两条路线都瞄准响应式环境,但暴露出不同的失效模式。生成代码提供了可检查的程序结构和确定性执行,但它仍可能包含关于几何、物理或叙事含义的错误假设。

世界模型可以在不显式构建每个物体的情况下生成更自然的图像。开发者可能更难检查其内部状态。当交互延续到超出模型有效记忆的范围时,一致性也可能下降。

这些方法最终可能会融合。一个智能体可以编写场景逻辑、调用生成式媒体模型、观察渲染输出,并修订两者。完成的系统将结合符号结构与视觉生成。

这一前景促使成熟的游戏引擎、设计工具和创意套件变得更易于智能体操作。它们的界面是为能够看见画布并理解细微视觉反馈的人类而设计的。

通过文本操作的 LLM 不会自动获得同样的体验。它可能知道源代码中的每个物体,却看不到最终场景的样子。工具制造商必须提供截图、场景图、测试控件和结构化诊断信息。

编程智能体已经表明,这一转变可能发生得多快。Anthropic 研究了约 40 万个 Claude Code 会话,这些会话发生在 2025 年 10 月至 2026 年 4 月之间。其编程智能体研究发现,验证指标在一定程度上仍依赖于对话中明确的确认。

这一细节的重要性不止于软件开发。如果成功取决于模型宣称任务已经完成,结果看起来可能比实际更可靠。交互式世界让这一测量问题变得显而易见。

一个生成的应用程序可以编译并启动,却仍然无法实现其目的。控件可能操作别扭。场景可能错误呈现源材料。最重要的交互可能根本无法运行。

因此,创意工具面临着提供智能体实际可用反馈的压力。成功的集成必须帮助模型检查行为,而不只是生成更多代码。

生成能力已超越原生感知能力

核心权衡很简单:模型能够创造的状态空间,已大于它们能够可靠探索和审计的范围。

状态空间是指系统通过不同动作可以进入的所有条件集合。即使是一个小型交互世界,也可能包含许多位置、镜头视角、物体状态和事件组合。测试每一条路径很快就会变得不切实际。

代码生成 LLMs 在反馈以文本形式到达时表现良好。编译器可以识别语法错误并指出对应行。测试可以返回明确的通过或失败结果。

视觉质量很少提供如此清晰的反馈。程序可能运行正确,却呈现出不可能或令人困惑的场景。当角色的双脚滑过地面时,不会出现异常。

模型需要感知能力来发现这类问题。它必须捕捉渲染输出、识别物体、将其与指令进行比较,并判断它们之间的关系是否合理。随后,它还需要将可见缺陷关联到正确的代码。

当前的多模态系统能够完成这一闭环中的部分环节。它们可以解读截图,并推理许多视觉元素。在收到用户对缺陷的描述后,它们也可以修改代码。

不过,这些能力并不能保证可靠的自我审查。生成错误布局的同一个模型,在审阅截图时可能会重复其原有假设。它可能忽略细微错误,或将其合理化为有意的设计。

关于多模态自反馈的研究既显示了机会,也揭示了局限性。Volcano research发现,视觉反馈可以帮助模型修订初始回答,从而减少幻觉。这需要经过设计的反馈流程,而不仅仅是生成本身。

这一区别正是 Karpathy 论点的核心。模型可以输出构成一个世界的要素,却并不具备对这个世界持续、原生的体验。它的访问往往依赖于捕捉特定画面或描述特定状态的工具。

人类开发者能够同时看到运动、时序、平衡和视觉层级。人可以移动镜头,尝试意料之外的控制方式,并察觉某些地方“不对劲”。这些观察发生在它们被转化为语言指令之前。

LLM 通常获得的是更稀薄的表征。它可能检查一张截图、一个控制台日志,或一个文本场景图。每种格式都会遗漏人类审阅者所能获得的部分信息。

截图冻结了时间。日志记录了已编程的事件,却不记录外观。场景图描述对象,却无法反映画面构图是否传达了预期含义。

视频可以保留运动,但审阅视频会带来另一项挑战。模型必须从大量帧中识别重要时刻,并将其与程序状态关联起来。长时间录制还会消耗大量上下文和计算资源。

这造成了一种不对称性。再生成一千行代码可能既便宜又快速。要在多种状态下仔细运行和检验结果,则可能需要反复进行渲染、感知、推理和修订。

因此,系统扩展复杂性的速度可能快于建立信心的速度。每个生成的交互都会增加一条可能隐藏缺陷的路径。输出越多,对更好评估的需求就越大。

这个问题类似于从自动补全向编程智能体转变的过程。自动补全提出一个小改动,开发者可以立即看到。智能体则可能修改许多文件并运行命令,之后人类才检查结果。

交互式生成放大了这种模式。模型可以在任何人验证镜头、物理效果、控制方式、叙事准确性或无障碍性之前,就构建出完整场景。输出表面上的完整性可能会阻碍细致审查。

这里需要谨慎理解“原生感知”这一术语。现代多模态模型可以处理图像、视频、音频和文本。差距在于,感知能否被可靠地整合进自主生产循环。

模型无需具有人类意识才能审查软件。它需要可靠地获取相关证据、合适的评估标准,以及在不引入新故障的情况下修订的能力。

这些要求依然困难,因为许多创意判断具有主观性。可能不存在唯一正确的镜头角度或动画速度。但另一些问题足够客观,可以进行测试。

对象不应意外穿插。控制方式应触发文档所述的动作。必需的角色应当出现。要求的序列应按正确顺序发生。

一个有用的审查系统必须将这些机械性检查与审美偏好区分开来。它可以自动测试碰撞和事件完成情况,同时请人类判断基调和构图。

未来的系统很可能结合多种评估器。静态分析可以检查代码。自动化测试可以运行交互。视觉模型可以审阅画面,而人类则处理含糊的创意选择。

在这套技术栈变得可靠之前,生成的世界仍更接近雄心勃勃的原型,而非成品。它们的价值是真实的,但不能从其规模推断其正确性。

该演示尚不是通用世界构建基准

一个令人印象深刻的生成场景,并不能证明模型理解物理空间、叙事意图或自身犯下的错误。

这个公开示例造成了若干验证缺口。观察者没有获得完整的提示过程记录,也无法判断展示结果出现之前经历了多少筛选。

一个出色的演示可能来自一次请求、多次重试,或大量人工指导。每种工作流揭示的能力都不同。缺乏这些背景时,关于自主性的明确结论都为时过早。

源材料似乎也与一个广为人知的虚构宇宙有关。知名故事在线上拥有大量文本、图像、评论和粉丝材料。这种训练暴露可以帮助模型推断预期的角色和场景。

更强的测试应使用陌生的源材料。评估者可以提供一个未出现在训练语料中的新场景。模型随后必须将其世界建立在所提供的描述之上。

测试还应保留完整的交互历史。研究人员需要获得提示、工具调用、生成文件、修正和失败尝试。短视频无法揭示输出是如何达成的。

最新的 Andrej Karpathy LLMs 讨论之所以同时包含热情与批评,原因正在于此。支持者看到了定制化创作的更大画布。批评者则看到了一场视觉上吸引人、但缺乏受控评估的演示。

两种反应都指出了重要之处。输出可以有用,却无需证明通用智能。即使需要人工审查,原型也可以节省时间。

将该系统称为“世界构建器”也可能模糊技术上的区别。通过 JavaScript 生成的浏览器场景,并不等同于一个学习型模拟器。它遵循的是编码在程序中的规则。

这些规则可以近似物理行为,却不代表具备物理理解。一个下落物体可能按照简单方程运动。这并不意味着模型能够预测模拟系统的每一种后果。

反过来说,编写连贯的图形代码确实需要有意义的能力。模型必须将语言映射为坐标、对象和变换。将结果斥为纯粹的自动补全,忽视了其中涉及的整合工作。

正确的解读介于这两个极端之间。LLM 世界生成展示了更广泛的软件综合能力,但尚未展现完整的视觉自我验证能力。

考虑采用这类工作流的团队应评估整个闭环。他们应衡量首次结果成功的频率、所需修订次数,以及哪些缺陷会逃过自动化检查。

他们还应测试变化性。一个在标志性场景中成功的模型,可能会在角色、镜头位置或约束条件变化时失败。可靠的系统必须能够应对在线上流传的热门示例之外的请求。

安全性带来了另一项担忧。生成的交互式软件可能包含依赖项、浏览器权限、网络调用或不安全代码。视觉上的成功无法说明这些组件是否恰当。

性能同样重要。一个场景可能在创作者的电脑上运行流畅,却在移动硬件上失败。生成的几何体、纹理和动画循环可能消耗内存或处理时间,而不会给出明显警告。

无障碍性很容易被忽略。键盘导航、可读标签、运动控制和替代性描述,很少会自动出现在炫目的演示中。这些品质需要明确的规范和测试。

版权和身份相关问题也仍未解决。用户可以请求基于受保护角色、可识别人物或现有游戏的世界。生成它们的技术能力并不能解决权利或分发问题。

这些弱点并不会否定 Karpathy 的观察。它们界定了将这一观察转化为可靠产品类别所需完成的工作。

一个可信的基准应采用隐藏提示、陌生参考资料和可重复的评分方式。它应评估空间一致性、交互完成度、视觉准确性、性能、安全性,以及从检测到的错误中恢复的能力。

最重要的是,它应测试自我修正。模型应能够访问正在运行的世界,识别一个被刻意引入的缺陷,定位其原因,并在无需详细人工指导的情况下修复它。

这衡量的不仅是产出能力,也将揭示生成与感知是否正在成为一个可靠的闭环。

Techmeme LLMs 时刻之后应关注什么

三个信号将表明,按需生成的世界正在成为可靠工具,还是仍停留在令人印象深刻的演示阶段。

第一个信号是可复现的世界构建评估出现。这些测试应公布提示、环境、评分规则和完整的智能体轨迹。隐藏测试用例将降低模型针对熟悉的病毒式示例进行优化的可能性。

一项有用的评估会同时衡量创建和审查表现。模型可以根据陌生描述构建一个场景,然后从多个镜头位置检查它。评估者可以引入缺陷,并衡量系统是否能够发现它们。

如果这类基准在彼此无关的任务上显示出稳定提升,Karpathy 的论点就会更有说服力。该领域可以证明,模型正在学习可迁移的空间与交互技能。在孤立的社交媒体帖子中取得成功将不再那么重要。

失败则会削弱这一主张。如果性能在可识别的故事或偏好的图形库之外大幅下降,表面上的转变可能反映的是专门化的编程流畅度,而非通用的按需世界创建能力。

第二个信号是将更紧密的感知能力纳入编程智能体。开发者应关注那些能够自动启动生成应用、遍历界面、记录画面、检查运动,并将可见错误关联到源代码的智能体。

仅支持截图还不够。智能体需要时间记忆和系统化探索。它必须知道自己已经测试了哪些状态,以及哪些状态仍未覆盖。

系统还应保留证据。审阅者需要查看日志,了解智能体观察到了什么、应用了哪些标准,以及为何认为结果已完成。这份记录可以加快审查,而无需用户盲目信任一份摘要。

如果领先的智能体引入可靠的视觉回归测试,审查缺口将会缩小。视觉回归测试会比较不同版本间的渲染输出,以识别非预期变化。智能体可以通过解释可能原因来扩展这一方法。

如果进展仍仅限于生成更复杂的代码,缺口将会扩大。用户会获得拥有更多隐藏状态的更大产物,信心却不会相应增加。

第三个信号是编码场景与学习型世界模型之间的融合。Google DeepMind 的工作展示了直接、实时的环境生成。基于 LLM 的编程则提供可编辑的结构,以及对成熟软件工具的访问。

一个结合型系统可以使用代码处理规则、界面和持久状态。世界模型可以提供视觉细节、变化和模拟行为。审查智能体则可以将两类输出与原始请求进行比较。

这种融合将支持娱乐之外的应用。训练模拟可以适应学习者。产品团队可以生成逼真的使用场景。机器人可以在进入物理空间之前,先在多样化环境中练习。

它也会提高犯错的代价。有缺陷的模拟可能让智能体学到错误行为。个性化课程可能会以具有说服力的视觉细节呈现错误关系。

因此,溯源信息必须伴随个性化而来。用户应能够追溯哪些源材料塑造了生成的世界,也应了解哪些组件是推断得出,而非检索获得。

知识融合工具有助于让生成的解释与来源上下文保持关联。它们不能取代验证,但可以缩短体验与其支撑材料之间的距离。

短期内的赢家未必会生成最惊艳的演示。他们将闭环打通:从请求、创建、观察、测试到纠正。

这一闭环也需要合理的停止规则。一个反复修改已可正常运行场景的智能体,可能在追求细微视觉改善时引入回归问题。它必须区分阻断性缺陷与审美偏好。

人工审核仍将十分重要,尤其是在意义与品味方面。目标并不是移除审核者,而是确保模型在请求批准之前就能发现明显的失败问题。

因此,更广泛的 Andrej Karpathy LLMs 论点并不像初看上去那样充满庆祝意味。生成能力已从单个产物扩展到系统,但评估能力并未以同样速度扩展。

这种失衡将在未来数月塑造产品设计。会有更多公司营销即时生成的应用、游戏、模拟和互动故事。它们真正具有决定性的特性,应当是能够证明这些体验确实经过了检查。

techmeme llms 这一时刻为开发者提供了一个实用测试,可用于衡量每个新演示:模型创建了什么?又有哪些证据表明它理解了结果?

不妨将同样的问题用于你自己的 AI 生成项目。让智能体列出它检查过的状态、发现的缺陷,以及完成背后的证据。然后测试一条它从未提及的路径。如果项目在那里失败,缺失的功能就不是又一个生成模型,而是一个可信的审计闭环。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page