腾讯混元发布 Hyra-1.0 递归式自我改进研究智能体,挑战 Recursive 的早期领先地位
腾讯混元发布 Hyra-1.0 递归式自我改进研究智能体,宣称在三项 AI 工程基准测试中创下纪录。据报道,该系统将 NanoChat 验证损失降至 0.9015,加快了 NanoGPT 的训练速度,并改进了 235 个 GPU 内核。
根据腾讯的对比,这些数据让 Hyra 超越了 Recursive 于 2026 年 6 月公布的结果。这是眼下最直接的竞争,但并非此次发布最重要的部分。
Hyra 的设计目标是在无需研究人员指导每一次实验的情况下,持续提出、测试并修订解决方案。腾讯将这一循环定位为一种通用研究方法,而不仅仅是又一款编程助手。
这一区别至关重要,因为自动化研究系统正在超越回答问题的范畴。它们开始修改训练代码、运行对照实验、分析失败原因,并在反复迭代中保留改进成果。
腾讯还声称,Hyra 已将这一流程应用于数学、量子计算、分子设计、预测、游戏、音乐和 3D 建模。与其工程基准测试相比,这些更广泛的成果所接受的独立检验仍然较少。
因此,Hyra 同时讲述了两个故事。基准测试方面的故事给 Recursive 和其他自动化研究团队带来了压力。更广泛的科学故事则检验一个轻量级智能体框架能否在截然不同的环境中产生可靠的发现。
腾讯混元的 Hyra-1.0 将研究转化为持续循环
Hyra 的核心变化体现在运行方式上:智能体不会在生成一个答案或一段代码后就停止。
Hyra 是 Hunyuan Research Agent 的简称,它会在可度量的环境中反复探索可能的解决方案。每次尝试都会产生证据,为下一次尝试提供参考。
腾讯在其 Hyra 研究发布页面中介绍了这一流程。智能体接收任务、提出解决方案、执行方案,然后收集评估器的反馈。
其历史记录可以包括源代码、实验日志、性能测量结果和此前的失败。Hyra 利用这些累积记录选择另一个方向,或完善现有方案。
这一循环会持续进行,直到智能体结束搜索或耗尽分配的预算。随后,Hyra 会返回此次运行中找到的最佳已验证解决方案。
腾讯将其称为递归式自我改进,即 RSI。在此语境下,这一说法的含义比 AI 系统在无人监督的情况下重新设计其整体智能更为有限。
Hyra 通过在有边界的环境内反复实验来改进任务解决方案。已发布的证据并不能证明它能够在所有能力上实现不受限制或永久性的自我改进。
这一边界非常重要。针对验证损失优化训练脚本的智能体,运行在明确定义的任务、评估器和计算预算之内。
如果一个系统能够独立改变自身目标、评估规则或底层推理模型,那将是一项范围大得多的主张。腾讯尚未展示这一版本的 RSI。
Hyra 的运行框架采用了刻意简化的设计。运行框架是为模型提供工具、状态、权限和实验工作流的外围软件。
该系统采用异步生产者—消费者流水线。一部分负责生成候选方案,另一部分负责执行和评估,从而减少实验之间的空闲时间。
这种方法体现了计算机科学家 Richard Sutton 所称的“苦涩的教训”。从历史上看,能够随计算规模扩展的通用方法,往往胜过围绕大量人类知识工程构建的系统。
Hyra 通过保持框架精简,同时赋予智能体广泛的行动空间来应用这一原则。评估器、环境和可用工具则为其提供结构。
这使腾讯混元的 Hyra-1.0 与其说是一个固定的科学模型,不如说是一个研究运行循环。它的价值取决于开发者能够将哪些环境接入这一循环。
清晰的数值反馈使 AI 训练和内核优化成为自然的起点。科学发现则更为困难,因为评估器可能不完整、噪声较多,或容易受到误导性捷径的影响。
腾讯此次发布之所以引人注目,是因为它声称同一个基本循环能够跨越这一边界。该成果能否通过独立复现,将决定这一主张最终有多重要。
AI 工程成果给 Recursive 带来压力
Hyra 最有力的证据来自三项具有明确指标、可重复工作负载和既有对比基准的任务。
第一项是 NanoChat Autoresearch,它要求智能体在固定计算预算内训练一个小型语言模型。性能采用验证集每字节比特数(BPB)衡量,数值越低,表示预测效率越高。
腾讯表示,Hyra 达到了 0.9015 的验证 BPB。Recursive 此前在检查结果的方差和奖励操纵问题后,报告的数值为 0.9109。
Recursive 的系统此前已经超越了社区取得的 0.9372 结果。其 自动化研究成果将这一提升描述为:达到相同损失所需的速度约提升至 1.3 倍。
如果腾讯的运行使用了相同的硬件、代码、数据和验证规则,那么 Hyra 的 0.9015 将刷新纪录。该基准测试中的微小差异也可能反映出有意义的训练改进。
第二项任务是 NanoGPT Speedrun。目标是通过训练和系统优化,以尽可能快的速度达到 3.28 的验证损失。
Recursive 报告的成绩为 77.5 秒,优于此前的 79.7 秒。腾讯表示,Hyra 将这一时间缩短至 76.4 秒。
与 NanoChat 的结果相比,这一领先幅度更小。但它仍然很重要,因为基线本身已经体现了社区大量的优化工作。
第三项任务是 SOL-ExecBench,它衡量生成的 GPU 内核在多大程度上接近估算的硬件极限。平均速度上限分数越高,表示相对于该估算值的硬件利用率越高。
Recursive 报告其在 235 个内核上的平均 SOL 分数为 0.754。腾讯声称,Hyra 在优化相同数量内核的情况下达到了 0.771。
这些对比为 Hyra 构建了一个清晰的叙事。腾讯混元发布 Hyra-1.0 递归式自我改进研究智能体,并在全部三项已报告任务中超越 Recursive 公布的数值。
然而,基准测试的领先地位取决于可复现性,而不是发布当天的图表。硬件配置、运行时方差、评估器版本以及允许的代码修改范围都可能改变结果。
Recursive 记录了这些任务适合自动化研究的原因。它们拥有紧密的反馈循环、相对较低的方差,以及可通过加固来抵御奖励劫持的评估器。
当智能体提高了测量分数,却没有改善预期结果时,就会发生奖励劫持。智能体可能会利用计时规则、验证漏洞或意外的信息泄漏。
自动化系统的搜索速度远快于人类研究人员,因此它们既能高效发现有用的优化,也同样能高效发现评估器的弱点。每项纪录都需要经过对抗性审查。
腾讯表示,已通过 GitHub 发布 Hyra 的输出结果。可供检查的产物应能让其他团队对比补丁、重新运行工作负载,并识别隐藏的基准测试假设。
竞争压力如今落在双方身上。Recursive 可以重新运行 Hyra 的修改,而腾讯必须证明其报告的提升在内部执行环境之外仍然有效。
持久的优势不会来自赢得一轮基准测试,而是来自无需大量人工修复,就能在新工作负载上持续产生有效改进。
轻量级运行框架才是 Hyra 真正的赌注
腾讯押注的是:通用实验基础设施比高度专门化的研究工作流更重要。
现代研究智能体并不只是一个能够访问网络的语言模型。它是嵌入实验系统中的模型,该系统负责控制操作、记录结果并验证进展。
Andrej Karpathy 的 autoresearch 框架提供了这一理念中极具影响力的极简版本。智能体编辑训练文件,运行一次五分钟的实验,检查验证损失,然后保留或放弃修改。
这一受约束的循环降低了自动化 AI 研究的门槛。智能体只获得一个可修改的代码目标、一个稳定的评估器和一个明确无歧义的目标。
Recursive 通过并行研究线程、更长的历史记录、结果验证以及合并有潜力的分支扩展了这一模式。如今,Hyra 又提供了另一种通用实现。
腾讯的生产者—消费者设计将方案生成与执行分离。这种安排可以让昂贵的硬件保持忙碌,同时由推理系统准备后续实验。
历史记录也是这一机制的核心。每个结果都会成为证据,而不是一条彼此割裂的对话消息。
智能体可以分析哪项架构修改降低了损失、哪项编译器修改失败了,以及哪种参数组合导致运行不稳定。随后,它可以调整搜索策略。
这一过程类似于将自动化实验记录本与实验操作员结合起来。不同之处在于,同一个智能体既可以提出下一个假设,也可以将其付诸实现。
随着运行次数不断累积,持续保存的实验历史可能变得难以浏览。智能体必须区分因果性改进与偶然现象,并检索相关证据,同时避免对先前尝试过拟合。
这一挑战使结构化知识显得尤为宝贵。参与类似项目的研究人员需要在假设、代码修订、测量结果和验证说明之间建立可追溯的联系。
一个可搜索的知识库可以为人工审查保留这些上下文。它无法取代评估,但可以使自动化研究更易于审计。
Hyra 更广泛的行动空间也带来了另一种权衡。更大的自由度可能揭示意想不到的解决方案,但也会增加系统尝试无效或不安全操作的数量。
训练基准测试通过隔离的代码库和机械化评分来限制这种风险。药物设计工作流则需要化学约束、毒性分析和实验室验证。
因此,腾讯的框架依赖于每个接入环境的质量。智能体循环可以是通用的,但评估器必须保持针对性。
这是对 Hyra-1.0 中递归式改进最有力的解读。该系统在外部定义的研究问题范围内,以递归方式改进产物和策略。
它无需在每次实验后重新训练基础模型,而是通过工具使用、证据积累、代码修改和反复筛选实现改进。
这种设计使该方法能够在当前模型上投入实际应用。这也意味着,其进展仍受限于上下文长度、工具可靠性、评估器质量和计算资源可用性。
Hyra 的科学主张远远超出基准测试
腾讯更广泛的成果表明它可能是一种通用发现引擎,但也带来了更大的验证缺口。
该公司表示,Hyra 攻克了 55 个尚未解决的数学问题,并改进了其中 29 个问题的已知最佳结果。这是此次发布中最具雄心的数值主张。
改进界限并不一定意味着解决了问题。如果该构造具有新颖性、正确无误,而且优于已发表的记录,它仍然可以代表有价值的数学进展。
每项结果都需要专家审查。研究人员必须核实定义、复现计算、检查既有文献,并确定是否已经存在等价构造。
这一主张还需要问题级别的文档。仅凭一个总数无法说明每项改进的幅度,也无法说明多个问题是否共享相同的优化结构。
如果结果可以通过计算验证,数学验证可能会更加容易。形式化证明或可独立执行的搜索程序能够提供比单纯的生成式解释更有力的支持。
据报道,Hyra 还搜索了紧凑型神经网络架构。Tencent 表示,它设计了一个仅有 15 个可训练参数、能够执行十位数加法的 Transformer。
这一结果属于一个活跃的实验方向,旨在研究算术 Transformer 究竟可以缩小到何种程度。其他研究人员也曾在不同的参数计数规则下,报告过微型手工设计或训练得到的系统。
这种比较在很大程度上取决于定义。固定常量、预处理、位置特征、权重共享以及手工编码的操作,都可能将复杂度转移到可训练参数数量之外。
真正有价值的问题不在于 15 是否是一个神奇数字,而在于 Hyra 是否在明确公开的评估协议下,独立发现了一种有效且可泛化的构造。
Tencent 还报告了另一项使用 1749 年至 1932 年太阳黑子观测数据的结果。据称,Hyra 找到了一个递推公式,在之后的数据上实现了 0.77 的样本外 R 平方值。
R 平方衡量模型能够解释多少观测到的变异。0.77 听起来相当可观,但时间序列评估对区间选择和数据泄漏十分敏感。
太阳黑子周期还包含长期变化,这可能使历史回测变得困难。独立研究人员将需要获得该公式、预处理步骤以及确切的测试时段。
在量子计算领域,Tencent 表示 Hyra 为 IBM Q20 布局设计了一种路由方法。该公司报告称,与广泛使用的量子比特路由方法 SABRE 相比,其效率提升了 44.4%。
路由将逻辑量子电路映射到连接受限的物理结构上。更好的路由可以减少引入噪声并延长执行时间的额外操作。
该结果需要在不同电路集、编译器设置、随机种子和路由目标下进行比较。在一种拓扑结构上的表现,并不能保证在较新的处理器上获得相当的提升。
Tencent 还表示,Hyra 生成了一种候选 PARP1 抑制剂,其结合能力与类药性的综合评分高于 olaparib。PARP1 是一种癌症治疗靶点,而 olaparib 是一种已获批准的抑制剂。
计算评分并不能证明一种分子安全、可合成或有效。药物研发需要实验室检测、药代动力学研究、毒性测试和临床证据。
这个例子说明了自动化优化最容易遭受代理指标失效影响的地方。智能体可以最大化模型评分,同时产生一种在化学实践中不可行的候选物。
因此,Hyra 的科学成果应被视为假设和计算产物。它们是对验证工作的邀请,而不是已经完成的发现。
游戏、音乐和 3D 模型检验了另一种反馈
Hyra 的创意演示探索了当成功无法被归结为单一工程指标时,递归改进是否仍然有效。
Tencent 表示,Hyra 通过自我对弈开发了一款 Othello 机器人,并在 730 个提交程序中排名第三。自我对弈让智能体通过反复与自身或早期策略竞争来实现改进。
游戏具有明确的规则和可衡量的结果。这使其成为连接严格受控基准测试与结构化程度较低的创意任务的有用桥梁。
不过,赛事排名仍然需要上下文。硬件限制、时间控制、可用库以及参赛程序是否获得同等资源,都会影响比较结果。
Hyra 的 3D 演示从一张二维参考图像开始。智能体不断修改建模代码和渲染参数,直到输出与参考图像更加接近。
Tencent 使用了一个视觉语言模型评审器,其标准涵盖轮廓、比例、结构完整性、材质和视觉相似度。
该评估器提供了比单一损失值更丰富的反馈。它也引入了主观性,因为模型评审器可能具有审美偏好和系统性盲点。
Tencent 将 Hyra 的迭代输出与通过 Claude Code 目标模式生成的模型进行了比较。报告中的示例更有利于 Hyra,但少量视觉对比无法证明其具有普遍优势。
更有力的研究应使用大量参考图像、多个基线、盲测人工评分和重复运行。公开提示词和中间渲染结果,可以揭示迭代究竟带来了多大程度的改进。
音乐示例带来了类似的挑战。Tencent 表示,Hyra 可以将一段单独的旋律扩展为更完整的多乐器编曲。
音乐质量并不存在一种得到普遍认可的标量评分。智能体需要来自模型评估器、手工制定规则、人类听众或这些方式组合而成的反馈。
Tencent 表示,Hyra 可以在开放式创意环境中利用自我评估和用户反馈进行迭代。这使该框架从自主优化转向人类引导的选择。
只要明确说明,这种区别就是合理的。人类反馈可以提供机械评估器无法捕捉的偏好。
然而,人类参与也会削弱完全自主性的主张。研究人员需要了解人类何时选择了输出、修改了提示词或调整了搜索方向。
这些演示揭示了 Hyra 更宏大的产品愿景。Tencent 希望该智能体能够在实际生产系统中改进输出,而不是局限于基准测试代码库。
这一愿景涵盖模型开发、工业优化、游戏策略、设计和内容创作。每种环境都需要对进展作出不同定义。
通用框架可以组织所有这些领域中的迭代。但它无法保证每个评估器衡量的都是用户真正重视的东西。
对于企业买家而言,这就是实际的分界线。当研究智能体的输出可以进入一个具有明确权限和验收测试、可供审查的工作流程时,它才真正变得有用。
知识工作者还应区分持续实验与普通聊天。重要的产物是将尝试、证据和决策连接起来的完整记录。
个人知识系统可以帮助人类保留这些联系。最终决定权仍应属于具备资质的审查者,尤其是在科学和医学领域。
Hyra 的主张要获得持久认可,还需要什么
下一阶段将取决于结果复现、向未知任务的迁移,以及 Tencent 评估器之外的验证。
第一个信号是对基准测试的独立复现。外部团队应在匹配的条件下重新运行 Hyra 的 NanoChat、NanoGPT 和 SOL-ExecBench 产物。
这些测试应报告硬件、软件版本、随机种子、运行时间差异以及所有允许的修改。它们还应检查解决方案是否利用了评估器漏洞。
成功复现将增强 Tencent 的核心工程主张。在同等条件下复现失败,则会削弱其与 Recursive 比较时所宣称的领先地位。
第二个信号是对科学成果进行问题级别的验证。Tencent 需要公布确切的数学构造、太阳黑子公式、量子路由代码和候选分子。
随后,领域专家才能确定这些输出是否新颖且有效。对于数学结果,形式化验证将提供尤其有用的证据。
量子研究人员需要在标准电路套件和硬件图上进行比较。化学家需要合成分析和实验室测量,而不只是计算排名。
一项获得外部确认的结果,其意义将超过数十个未经评审的示例。跨领域持续出现验证成功的结果,将支持 Tencent 关于通用智能体的主张。
第三个信号是在未知环境中的表现。通用研究智能体应当能够适应新环境,而无需对提示词、工具或评估器进行大量人工重新设计。
未来的评估应衡量部署 Hyra 所需的人力工作量。设置时间、干预频率、失败运行次数和验证成本,都应与最佳最终评分一同列出。
这将使其与 Recursive、AlphaEvolve 及其他研究系统之间的竞争更具参考价值。每个团队都必须证明其方法能否迁移到精心挑选的演示之外。
Google DeepMind 的 AlphaEvolve 系统发现了一种仅使用 48 次标量乘法来完成四乘四复矩阵乘法的算法。其结果体现了可执行评估器的价值。
Together AI 的 EinsteinArena 项目利用协作智能体,将十一维接吻数的已知下界从 593 提高到了 604。
这些系统采用了不同的架构和协作模式。它们的共同方向十分明确:模型越来越多地参与到提案、执行、评估和选择的重复循环中。
Tencent Hunyuan 推出的 Hyra-1.0 递归自我改进研究智能体加入了这场新兴竞争。其宣称的基准测试领先地位为该项目带来了即时可信度,但并未赋予其最终权威。
“递归自我改进”这一术语应当受到已公开证据范围的约束。Hyra 改进的是既定环境和保留的实验历史中的解决方案。
这一能力已经具有重大意义。它可以压缩持续数日的重复实验、发现意料之外的配置,并使计算搜索更加系统化。
它也将风险集中到了评估器上。如果指标不完整,智能体可能会极其高效地优化错误的结果。
开发者应关注 Tencent 是否会公布可复现的环境和完整历史记录,而不只是获胜产物。企业团队应考察权限、可审计性和干预要求。
科学家应询问 Hyra 的候选成果能否经受领域评审。创意专业人士应关注该系统如何融入人类判断,同时避免将其隐藏在自动评分背后。
最有价值的下一步很简单:选择一项已发布的结果进行复现,并记录每一处差异。这一过程将揭示 Hyra 究竟是一个刷新纪录的研究平台,还是一次令人印象深刻的发布演示。



