Greg Brockman 与 OpenAI 在 Dota 2 中的缩放定律的意外发现
- Aisha Washington

- 6月7日
- 讀畢需時 14 分鐘
已更新:6月18日

Greg Brockman 在 OpenAI 的工程领导力帮助将一个雄心勃勃的游戏项目转变为研究的风向标:OpenAI Five Dota 2 项目不仅击败了人类职业选手,还产生了一个“偶然的”科学洞察,即通过扩展计算量、数据和模型规模可以获得可预测的性能提升。本文解释了这种以工程为先的、旨在精通 Dota 2 的务实推动力是如何产生可复现模式的——缩放法则 (scaling laws)——这重塑了深度强化学习和更广泛的 AI 行业的思维方式。
背景:OpenAI Five 与 Dota 2 研究背景

OpenAI Five 旨在训练一组智能体来玩 Dota 2(一款复杂的实时策略游戏),其使用了 深度强化学习,即智能体通过试错进行学习。其目标不仅是赢得比赛,还要衡量在大规模学习下,在具有长视野、部分可观测性和复杂多智能体交互的环境中,性能究竟能提升到何种程度。这种结合使 Dota 2 成为现代强化学习(RL)研究的压力测试。
该项目依赖数百万场自我对弈(self-play)和大规模分布式计算来产生稳步提升:智能体并非依靠手工设计的策略,而是从模拟经验以及与自身的副本对战中学习。评估过程则利用人类职业比赛和阶段性决赛来基准测试进度,并揭示智能体的优势与脆弱之处。
为什么 Dota 2 对研究扩展定律(scaling laws)至关重要. 游戏的复杂性放大了一定量的算力、模型容量和经验所带来的效果:训练规模的微小增加可以揭示性能提升是遵循平滑、可预测的曲线,还是混乱且特定于任务的。在 OpenAI Five 的设置中,团队拥有足够的受控变量——不同的算力预算、不同的游戏数量和受控的架构——从而揭示了规模与性能之间的经验关系。
洞察:一个丰富、可复现的环境加上工业级的衡量标准,是将工程实验转化为可推广的扩展观测(scaling observations)的前提条件。
核心结论: OpenAI Five 创造了观察和量化强化学习中扩展行为所需的条件——充足的数据、可重复的自我博弈以及经过衡量的评估。
OpenAI Five 旨在证明什么
核心目标包括击败职业级战队,并展示在多智能体环境下的实时适应能力。成功与否通过与人类战队的直接对决,以及在可以直观对比智能体表现与人类打法的公开决赛中来定义。
一个 Dota 2 environment 引入了长期规划、多单位的离散动作、不完全信息以及巨大的状态空间,使其比网格世界或经典的 RL 基准测试更能代表复杂的现实世界任务。
训练规模与基础设施
训练设置需要数千场并行游戏,将经验以高吞吐量流式传输到中心化学习器中。这种“训练规模”需要大量的算力编排、高带宽仿真以及自动化评估流水线。
这些工程需求并非偶然:它们产生了必要的训练数据集和性能差异,从而在规模变化时观察到一致的幂律趋势。
可操作的启示:对于寻求研究缩放效应(scaling)的团队,应优先选择具有可衡量、可重复评估的环境,并构建能够系统性扫描算力和数据预算的基础设施。
偶然的发现:Greg Brockman 与缩放法则(scaling laws)的洞察

“偶然的发现”这一说法非常贴切:OpenAI 团队启动 Dota 2 项目最初并不是为了证明关于缩放的数学定理。相反,重复的工程选择——扩展模拟器、增加算力以及随时间跟踪性能——产生了一致的经验模式:随着资源的增加,性能以可预测的方式提升。Greg Brockman 作为工程和领导层的声音,帮助发掘并传达了这些经验,使它们能够从工程笔记转化为正式的研究讨论。
Brockman 的角色融合了系统思维与公共叙事。通过发布基准测试、博客文章并参与采访,他将工程产物(训练曲线、算力预算和消融实验)转化为研究界可以测试的经验性结论。这一发现的“偶然性”特征源于这样一个理念:实际需求——在大规模环境下赢得游戏——出人意料地产生了一个关于性能如何扩展的可泛化数据集。
洞察:当工程优先的实验与系统化测量及透明沟通相结合时,可以产生稳健的科学假设。
核心要点:Greg Brockman 和 OpenAI 工程团队将操作规模的实验转化为了关于 RL 扩展的广泛有用的经验知识。
工程优先的循环
团队的迭代方法——扩展模拟器、测量、调整奖励塑造并重复——创建了一个反馈循环。在多次运行中,工程师观察到了当算力或自我博弈经验增加时,哪些因素会可靠地发生变化,而哪些不会。
这一过程使得检测幂律或对数线性通过比较不同资源分配下的运行趋势,而不是仅仅依赖理论先验。
公开解释与团队对话
Brockman 的公开帖子和采访强调了运行这些实验所需的匠心,以及工程工作中如何浮现出经验模式。Greg Brockman 在一篇博客中总结了 OpenAI Five 的基准测试和经验教训,他在文中将实际的工程选择与可衡量的进展联系起来。
团队讨论和记录进一步表明,内部基准测试如何促使研究人员思考“这是一个通用的扩展现象吗?”,而不是将每一次成功都视为孤立的工程胜利。一份团队讨论的公开记录捕捉到了工程观察被重新定义为关于扩展(scaling)的研究问题的时刻。
示例场景:想象两次训练运行,除了其中一次使用了两倍的模拟吞吐量外,其余完全相同。如果高吞吐量的运行始终能更早达到更高的胜率,并且这种模式在多个规模增量中重复出现,团队就可以拟合一条经验曲线,用以预测未来规模增加带来的边际收益。
核心结论: 记录并发布基准测试的工程运行记录;即使是运行日志,如果包含计算量、模型大小和数据量的受控对比,也能为研究提供基础。
技术架构:OpenAI Five 如何扩展强化学习

OpenAI Five 的架构结合了 多智能体自我博弈 (multi-agent self-play)、大型策略和价值网络,以及分布式模拟器集群,将计算资源转化为可重复的学习经验。其核心挑战在于如何将大量 CPU/GPU 的原始算力转化为智能体性能的量化提升。
从高层架构来看,每个智能体使用基于神经网络的 策略网络 (policy networks) 将观察结果(游戏状态编码)映射为动作,并使用 价值网络 (value networks) 以估算预期的未来奖励。Self-play 产生了训练数据:智能体与自身版本进行了数百万场比赛,生成了随后用于梯度更新的批处理轨迹。该系统将模拟(数据生成)与学习(模型更新)分离,以便两者可以独立扩展。
洞察:通过分布式编排将模拟与学习解耦,使团队能够在不停滞模型更新的情况下扩展经验生成。
核心要点: OpenAI Five 的架构旨在让模拟吞吐量和学习能力独立扩展,从而使经验性的扩展趋势变得可见。
核心模型与训练流水线
策略网络和价值网络旨在编码复杂的 Dota 2 观测空间:英雄位置、冷却时间、物品和潜在状态。紧凑地表示这些信息使网络能够跨多种游戏状态进行泛化。
模型大小和数据集规模通过平衡更大的网络与训练吞吐量来管理:更大的模型每次更新需要更多算力,但从相同数据中学习的效率可能更高。
学习算法结合了策略梯度风格的更新与适用于高方差、长周期奖励的类置信域稳定性技术。
OpenAI 在详细的方法论论文中描述了多智能体、基于种群的 self-play 流水线及其训练方法,这些论文展示了策略/价值结构以及回放/数据流水线是如何组织的。
大规模基础设施与仿真
仿真层使用了数千个并行游戏引擎,以高吞吐量生成轨迹。调度和编排系统将经验路由至学习节点,确保训练进度稳步推进。
工程权衡包括降低仿真保真度以优先提高吞吐量(例如,运行简化的 headless 游戏客户端),以及保持保真度以匹配生产环境行为。
并行仿真使得测试性能如何随仿真经验从数百万帧扩展到数千万帧成为可能。
示例:为了测试规模化假设,团队可以运行三次训练扫描,其中仅并行仿真器的数量不同(例如 1k、2k、4k)。如果性能指标随仿真器数量平稳上升,则支持与数据吞吐量相关的规模化模式。
核心启示: 设计强化学习(RL)系统时应采用模块化的仿真和学习堆栈,以便进行受控的规模扩展扫描(独立改变仿真器、模型大小或计算预算)。
扩展定律解析:来自 Dota 2 的证据与正式研究
扩展定律 在机器学习中是指可重复的、类数学的关系——通常是近似的幂律——它们将资源(计算量、数据、模型参数)与性能指标联系起来。在 OpenAI Five 的背景下,团队观察到增加仿真经验和计算量会带来胜率和内部评分相对可预测的提升,至少在可测量的范围内是如此。这种经验规律性促使了机器学习中扩展行为的更广泛正式化。
来自 Dota 2 的经验证据表明,更大的计算预算和更多的自我博弈经验会带来稳步增长,而不仅仅是单次跃迁。然而,这种趋势并非普遍的承诺:研究人员还发现了失效模式和注意事项,即盲目扩展会导致病态问题,例如奖励模型过度优化——即过于激进地优化代理目标会产生非预期或脆弱的行为。
洞察:扩展(scaling)通常会带来可预测的回报,但这些回报的形式和极限取决于目标设计和评估的保真度。
核心结论: 观察到的扩展模式虽然强大但具有条件性——扩展必须与稳健的目标以及对故障模式的监控相结合。
Dota 2 训练中观察到的经验模式
OpenAI 发布的数据曲线和内部基准显示,随着经验和算力的增加,改进变得更加平滑,这使得建模者能够拟合经验曲线并预测增加资源带来的边际收益。
这些模式具有足够的可重现性,足以指导工程权衡:了解模拟吞吐量翻倍会产生 X% 的改进,能让团队优先考虑基础设施投资。
尽管如此,性能提升并非无限的——随着规模增长,会出现收益递减和特定任务的瓶颈。
来自 OpenAI 研究的正式化定义与注意事项
OpenAI 随后正式指出了为了追求性能而过度优化奖励模型的风险,表明规模化可能会放大错误设定的目标,并产生不良行为。
这篇关于 奖励模型过度优化 的博客解释了盲目增加计算量如何加剧目标不一致,以及为什么需要额外的检查(如多样化评估、更好的目标设计和人类监督)来安全地利用规模效应。
OpenAI 关于奖励模型过度优化的规模法则博客详细说明了盲目规模化可能失效的地方,以及为什么细致的目标设计至关重要。《时代》杂志的一项分析探讨了 AI 进步是否会继续保持历史速度,以及规模化如何与更广泛的进步指标相互作用。
示例场景:如果奖励函数奖励“快速获胜”而没有对冒险行为进行惩罚,规模化可能会使智能体发现那些能赢但在广泛部署中不可接受的冒险漏洞。增加计算量会放大这种行为,因为它使得更极端的策略能够被发现和优化。
具有操作性的启示:在进行规模化实验时,应包含稳健的对抗性评估和人工在环评估,以检测奖励过度优化和脆弱的策略。
行业影响与趋势:超越游戏的缩放法则

OpenAI Five 的经验向行业发出了一个重要信号:系统性的规模化实验可以产生可预测的能力提升,这反过来影响了各公司和研究实验室的投资与战略决策。许多机构开始将算力和大规模实验视为提升能力的主要杠杆,从而导致了更重的算力投入以及对大规模实证研究的更大需求。
与此同时,Dota 2 的经验也凸显了局限性:暴力缩放可能成本高昂、收益递减,并放大目标不一致的问题。这促使了对效率、稳健性和更好的目标设计的并行推动——这些转变很可能塑造机器学习研究的下一个阶段。
洞察:缩放法则改变了激励机制——公司现在会在算力投入和预期涌现的能力之间,权衡效率与安全性的折中。
核心启示:行业趋势分化为两条路径:激进的规模优先策略,以及互补的效率/对齐研究。
工业界中由缩放法则(Scaling law)驱动的策略
许多组织优先考虑计算资源投资策略——购买集群、获取云端额度以及构建专用硬件——因为可预测的缩放回报使得这些投资更容易合理化。
这导致大规模实验集中在资金充足的实验室和云服务提供商手中,并引发了大量以基准测试为驱动的“缩放扫描(scale sweeps)”以寻求涌现能力。
《金融时报》(Financial Times)的分析记录了能力提升和商业动机如何促使公司优先考虑规模和计算分配决策。Reuters Breakingviews 的一篇文章指出,原始模型进展的放缓可能会改变围绕规模的“淘金热”心态,并迫使人们重新评估策略。
限制、转变与研究的下一阶段
报告和分析表明,无约束缩放带来的边际收益可能放缓,这正将注意力推向算法效率、数据集质量和对齐(alignment)。
Dota 2 案例既验证了规模的力量,也强调了开展细致研究议程的必要性,即需要将规模与更好的目标及评估方法相结合。
在接下来的 12-24 个月中,预计会出现混合方法:有针对性的规模化实验,结合模型效率的提升和更安全的目标规范。
行动建议:行业领导者应实现投资多元化——既要确保算力以测试规模化假设,也要资助效率和对齐工作,以降低风险并提高长期回报。
伦理与玩家行为:OpenAI Five 的社会影响与规模法则

OpenAI Five 在电竞领域的崭露头角引发了关于公平性、透明度以及超强 AI 对人类社区影响的伦理问题。部署性能超越顶尖玩家的机器人,引发了人们对竞技完整性、公共对局中 AI 对手的可接受度,以及对玩家参与度和策略更广泛文化影响的担忧。
从研究政策的角度来看,这项工作表明规模化带来的能力增长可能超过治理速度:虽然具备超强性能的技术能力已经存在,但围绕部署的规范和规则(尤其是在竞技环境中)仍不完善。
洞察:社会和伦理后果往往滞后于技术能力;负责任的部署需要前瞻性治理和社区参与。
核心结论:工程突破产生的社会影响需要政策和社区层面的回应,而不仅仅是技术修复。
游戏领域 AI 的伦理框架
研究人员和伦理学家建议提高 AI 能力的透明度,制定明确的 AI 参赛规则,并采取预防措施防止欺骗或不公平策略(例如,获取人类无法获得的博弈状态信息)。
将 AI 对手定位为训练和娱乐工具,而非人类竞技的替代品,有助于使部署符合社区价值观。
玩家行为与社区反应
高性能机器人的引入往往会改变玩家的参与方式:一些社区欢迎 AI 对手用于训练和观赏,而另一些社区则担心竞争力下降或游戏环境(meta-games)遭到扭曲。
对 OpenAI Five 公开比赛的分析显示,玩家的态度既有热情也有怀疑;许多玩家将机器人视为策略实验室,而赛事组织者则在讨论其适用范围。
示例:在某些情况下,玩家利用超人类机器人的存在来发现新的策略,并将其传播到人类竞技中;在其他情况下,组织者将机器人的参与限制在表演赛中,以维护竞技的公平性。
核心要点: 部署 AI 对手时应带有清晰的标签、受限的竞技角色以及社区反馈渠道,以减少摩擦并尽早发现潜在的负面影响。
关于 Greg Brockman、OpenAI Five 和扩展定律(scaling laws)的常见问题

Q1:什么是扩展定律(scaling laws)?它们是如何在 Dota 2 中被观察到的?
答:扩展定律(scaling laws)描述了资源(计算量、数据、模型大小)与性能之间可预测的关系——通常近似于幂律。在 Dota 2 中,通过运行改变模拟吞吐量和计算量的受控实验,并测量这些运行中一致的性能提升,观察到了这些定律。OpenAI 的 Dota 2 文档解释了大规模自我博弈如何生成可重复的性能曲线。
Q2:这一发现纯属偶然,还是在理论预料之中?
答:这在很大程度上是经验性的:团队最初并非为了证明某个正式定理,而是在大规模实验的工程副产品中发现了规律。公开讨论将这一发现定性为“工程先行”的洞察,随后才激发了理论研究。Greg Brockman 及团队访谈回顾了实践如何引导假设的形成。
Q3:其他团队在没有同等算力的情况下,能否复现 OpenAI Five 的缩放结果?
答:由于规模至关重要,复现完全相同的结果成本极高。然而,较小的团队可以通过在现有预算内进行系统性扫描,并专注于测量、可复现性和原则性目标(而非绝对胜率),来定性地测试缩放假设。方法论论文详细介绍了其他团队可以在不同规模下采用的实验设计。
Q4:在强化学习(RL)任务中追求规模的主要风险是什么?
答:风险包括奖励模型过度优化、脆弱性以及不一致目标的放大。盲目优化代理奖励可能会产生不良行为,而规模的扩大往往会加剧而非缓解这些问题。OpenAI 关于奖励模型过度优化的博客阐述了这些注意事项和缓解策略。
Q5:Greg Brockman 是如何向公众传达技术经验的?
A:Brockman 通过博客文章、采访和公开演讲,将工程权衡和基准测试转化为通俗易懂的课程,帮助社区理解生产系统如何产生研究洞察。他关于 OpenAI Five 基准测试的博客文章连接了操作细节与面向公众的叙述。
Q6:随着 AI 系统规模的扩大,政策制定者应该关注什么?
A:政策制定者应追踪能力增长与治理机制的相对关系,要求在高影响力部署中保持透明度,并鼓励对评估、鲁棒性和对齐研究的投资。公开可用的基准测试和对能力的负责任披露是务实的起点。
核心要点:对于从业者,将规模实验与严格评估相结合;对于政策制定者,支持透明度并为面向安全的研究提供资金。
结论:趋势与机遇
短期趋势(12–24个月) 1. 算力仍是杠杆:许多实验室将继续测试规模化假设,但目标将更加明确,而非盲目扩张。2. 效率突破:随着边际收益受到审视,预计模型和算法效率研究将激增,以降低单位能力的算力消耗曲线。3. 安全与对齐重点:随着规模化风险日益清晰,政策和研究界将更强烈地优先考虑目标设计和奖励稳健性。4. 混合研究议程:各机构将把规模化实验与特定领域约束及人类监督相结合,以减少脆弱性。5. 行业分层:资金充足的实验室将主导最大规模的实验,而较小的团队则专注于可复现性、可解释性和利基创新。
机遇与初步行动 1. 对于 ML 团队:实施受控的规模扫描——一次改变一种资源(模拟器、模型大小、批量计算)并衡量边际收益。第一步:设计实验矩阵和自动日志记录,确保结果可复现。2. 对于研究人员:研究可迁移性——测试一个任务(如 Dota 2)中的规模化关系是否能预测其他复杂多智能体领域的收益。第一步:发布用于规模比较的标准基准和协议。3. 对于行业领导者:平衡算力投入与效率及安全资金。第一步:将部分研发预算分配给对齐和评估流水线。4. 对于政策制定者:鼓励能力声明的透明度,并资助对规模化系统的独立评估。第一步:强制要求公开报告高影响部署的基准测试结果。5. 对于电竞和游戏社区:采纳 AI 参与的行为准则,并投资于探索人机协作的教育项目。第一步:召集利益相关者(开发者、玩家、组织者)建立表演赛和竞赛使用的规范。
不确定性与权衡
规模法则(Scaling laws)在许多测量范围内具有经验上的稳健性,但并非普遍保证——任务特异性、目标设计和评估忠实度将关键性地塑造结果。
模拟速度与忠实度之间、模型大小与能源成本之间、以及能力与对齐之间的权衡,仍将是核心的管理问题。
洞察:OpenAI Five 的故事表明,实际工程可以孕育科学发现;下一阶段是确保这些发现被负责任、高效地使用,并接受公众监督。
总结: Greg Brockman 和 OpenAI Five 的努力将一个游戏工程项目变成了一个研究 scaling laws 的实验室,从而产生具有行动指导意义的实证知识。团队和政策制定者应利用这些经验教训来设计审慎的规模化实验,优先考虑安全与评估,并避免将原始算力与有保障的、对齐的进展混为一谈。


