top of page

Google 对 Mechanize 的人才交易似已完成,但真正考验在于更强的 AI 编程能力

9月12日
讀畢需時 15 分鐘

Google 似乎已完成对 Google Mechanize 的人才交易,据报一位联合创始人和十多名员工将加入 DeepMind。相关证据来自公开职业资料,而非正式公告。这一区别让这些人事变动更具可信度,但交易的最终条款仍未得到验证。

Business Insider 此前报道称,Google 正讨论一项高价值协议,以聘用 Mechanize 员工并授权使用其技术。其最新的人才交易报道指出,这些人员转移现已完成。据报,Mechanize 前 CEO Tamay Besiroglu 已将自己的职位列为 Google DeepMind 的研究科学家。

这不只是又一轮 AI 招聘。Mechanize 为训练编程智能体处理复杂软件任务构建环境和评测体系。因此,Google 获得的是帮助判定智能体在哪些环节失败的专家,而不只是让模型规模更大的工程师。

这一重点使该交易直接与 Anthropic 和 OpenAI 展开竞争。两家公司都已将编程打造为检验通用 AI 能否持续完成具备经济价值工作的显著测试场景。

Google 对 Mechanize 的人才交易也复刻了其与 Character.AI 和 Windsurf 所采用的结构。该公司可以将关键研究人员纳入 DeepMind,同时授权使用特定技术,而无需收购整个初创公司。

眼下的人事变动看起来已较为明确,战略成果却仍未确定。Google 现在必须证明,新增的评测人才可以打造出让开发者愿意托付真实代码库、部署和调试工作的编程智能体。

Google 对 Mechanize 的人才交易实际改变了什么

据报 Google 已获得 Mechanize 的核心专业能力,但公开证据尚无法确认所有商业条款。

Business Insider 审阅的公开资料据报显示,Besiroglu 以及十多名 Mechanize 前员工正在 DeepMind 工作。他们所列的工作重点大多是中期训练,即广泛预训练与最终任务专项优化之间的模型开发阶段。

这种集中性很重要。中期训练可以在更狭窄的后训练开始前,让模型接触结构化任务、工具和反馈。它为研究人员提供了另一个培养模型完成长期软件项目所需行为的环节。

Google 和 Mechanize 均未发布详细的交易公告。没有公开文件明确指出 Google 授权了哪些知识产权、该授权是否排他,或 Mechanize 仍承担哪些义务。

因此,现有证据只支持一个审慎结论:人才转移似乎已经完成,而该协议的法律和财务架构仍未披露。

Mechanize 由 Besiroglu、Matthew Barnett 和 Ege Erdil 于 2025 年 4 月创立。其公司公告称,公司计划为 AI 系统构建模拟工作环境、基准测试和训练数据。

创始人将软件工程定位为更广泛自动化高价值工作计划的初始目标。这一目标受到关注,因为它将编程基准与规模大得多的经济主张联系在一起。

Mechanize 目前的材料描述了这样一些环境:智能体在其中开发功能、部署应用,并调试陌生代码库。评分器会评估最终工作成果,为强化学习和模型评估提供反馈。

强化学习是一种由评分结果引导的训练方式。在这里,智能体获得的反馈取决于其软件是否真正可用,而非其回答是否只是看上去合理。

这让此次据报发生的招聘具有了更明确的含义。Google 并非只是增加了另一个编程界面团队,而是招募了设计自主智能体任务、反馈系统和失败衡量机制的人才。

这一区别很重要,因为编写一个简短函数已不再是决定性的挑战。现代编程智能体必须检查代码库、规划修改、使用工具、运行测试,并在早期假设出错时恢复推进。

Mechanize 的工作正针对这些更长的任务序列。其工程师创建受控环境,使失败能够被观察和评分。当这些环境接入强化学习后,便可成为训练基础设施。

不过,人员转移并不能保证 Mechanize 的方法能顺利融入 Google。内部数据系统、模型架构、安全要求和发布节奏,都可能改变评测框架的实际使用方式。

首个得到确认的变化是组织层面的。Google DeepMind 现在似乎雇用了一个在设计编程智能体环境方面经验集中的团队。该团队是否会改变 Gemini 的表现,仍需产品和基准证据来证明。

Google 收购的是评测专长,而不只是更多模型构建者

战略上的关键收益,是更快地发现智能体失败之处,并训练模型避免这些失败的闭环。

AI 编程产品的竞争不止于生成代码的质量,还包括规划、工具使用、持续执行、验证,以及在既有工程流程中工作的能力。

模型可以生成令人印象深刻的代码片段,却仍可能无法胜任智能体。它可能误解代码库、编辑错误模块、遗漏测试,或在遇到陌生构建系统后放弃任务。

评测环境能让这些失败变得可衡量。它们将智能体置于受控工作区,分配任务,记录其操作,并对最终结果评分。

Mechanize 表示,其环境覆盖实现功能、诊断陌生代码等实际软件工作。该公司的编程环境旨在同时为评测和强化学习生成信号。

这种组合很有价值,因为评测和训练可以形成反馈闭环。研究人员识别弱点,构建能暴露弱点的任务,收集智能体的尝试结果,再根据所得评分开展训练。

这一过程听起来简单,但创建有用的环境并不容易。任务必须足够真实才有意义,足够稳定才能重复,并且能够抵御人为走捷径抬高分数的做法。

薄弱的基准可能会奖励表面行为。智能体可能利用评分器漏洞、记忆公开解法,或针对无法充分代表生产环境软件工作的测试进行优化。

Mechanize 最受关注的项目同时说明了这种方法的吸引力和局限性。GBA Eval 要求智能体使用 Rust 和 WebAssembly 构建一款 Game Boy Advance 模拟器。

这项任务周期长、技术性强,并且可通过功能行为轻松评估。基准方法论通过回放、程序化和音频测试比较输出结果。

模拟器挑战要求架构设计、调试、编译和反复验证。因此,它能揭示较小型编程问题很少能测试到的能力。

但一项高难度任务无法代表全部软件工程。企业开发还涉及不明确的需求、遗留依赖、安全审查、团队沟通和不断变化的优先级。

Google 的机会在于扩展底层方法。DeepMind 可以构建多样化环境,在内部模型上运行它们,并将结果连接到拥有大规模计算资源的训练流水线。

据报转入的团队从事中期训练,这与该战略相契合。研究人员无需等到完成的模型在公开产品中失败,便可更早引入结构化的智能体经验。

这正是 Google 对 Mechanize 人才交易背后的核心机制。更好的环境可以产生更好的反馈,而更好的反馈可以提升智能体在长期任务中的行为表现。

这一机制并非自动生效。针对某一环境的训练可能使模型对该环境过拟合。分数可以提高,却未必能在陌生代码库中带来同等改善。

因此,Google 必须展示迁移能力,即智能体在受控任务中学到的提升,在遇到新工具、语言和组织约束时仍能延续。

这比赢得排行榜更难。它需要私有评测、受控部署,以及工程师花在纠正或监督智能体上的时间减少的证据。

如果 DeepMind 实现这种迁移,Mechanize 的专长可能改善的不只是编程产品。同样的环境构建技术还可以支持操作浏览器、电子表格、数据库和其他工作场所工具的智能体。

就目前而言,编程仍是最可信的测试场景。软件任务会产生可观察的产物,而编译器和测试提供的反馈也比许多知识工作活动更清晰。

这使 Mechanize 在当下对 Google 具有价值,即便这家初创公司的原始抱负远不止于此。编程在模型研究与客户已在使用的产品之间提供了一座可衡量的桥梁。

Anthropic 和 OpenAI 设定了竞争时钟

Google 面临压力,因为编程已成为一场产品竞赛,而不是对模型智能的遥远展示。

Anthropic 的 Claude Code 和 OpenAI 的 Codex 已帮助 AI 编程从自动补全走向委托式工作。开发者越来越期待智能体能够检查文件、执行命令,并针对失败反复迭代。

Google 拥有自己的模型、基础设施、开发者关系和编程产品。不过,这些资产并不能消除对一种让工程师自愿选择的智能体体验的需求。

开发者采用会形成要求严苛的反馈周期。高频用户会迅速发现边缘情况,在不同模型之间比较输出,并放弃需要过多监督的工具。

当 Anthropic 和 OpenAI 的产品吸引持续使用时,这为它们带来优势。每一个困难代码库和失败任务,都可能揭示模型、界面或评测系统需要改进之处。

Google 的回应包括内部开发和外部人才招聘。Mechanize 的招聘为这一改进周期增添了专注于构建测试和环境的专家。

这笔交易紧随 Google 此前对 Windsurf 领导层和研究人员的招募。2025 年,Google 为 DeepMind 聘用了 Windsurf CEO Varun Mohan、联合创始人 Douglas Chen 以及其他员工。

Google 还获得了对特定 Windsurf 技术的非排他性许可。一份已确认的招聘声明称,新员工将推进 DeepMind 的智能体式编程工作。

Windsurf 带来了构建面向开发者产品的经验。Mechanize 则带来了对训练环境、评测和长程智能体行为的互补关注。

这两个团队共同赋予 Google 在两个关键层面的专长。一个层面涉及开发者所交互的产品,另一个层面涉及用于改进底层智能体的反馈系统。

不过,组建团队并不能消除整合成本。通过不同交易加入的研究人员,必须围绕共享模型、基础设施、领导力和产品目标达成一致。

Anthropic 和 OpenAI 也在持续改进产品。Google 的目标并非静止不变的基准,一旦整合延迟,公司就可能不得不追赶竞争对手早已拓展的能力。

这种压力不止落在单个编程助手身上。一款成功的智能体可能影响开发者最先接触哪种模型、哪个云平台承载工作负载,以及哪家供应商进入企业工程流程。

编程智能体也为更深度的平台整合创造了机会。它们可以将模型使用与代码仓库、部署系统、安全工具和云服务连接起来。

这一位置使开发者信任显得格外珍贵。一旦团队围绕某个智能体配置了权限、工作流和审查标准,切换就不只是换一个模型那么简单。

因此,Google 需要一款能在完整开发闭环中可靠运行的产品。原始基准分数或许能吸引关注,但可重复的表现才决定团队是否会扩大使用范围。

据报道,Mechanize 团队对中期训练的关注解决了问题的一部分。在针对产品进行特定调优之前,更好的任务覆盖可以先提升模型能力。

Windsurf 的招募则解决了另一部分问题。产品构建者了解延迟、界面、上下文管理,以及影响日常使用的运营细节。

Google 的竞争逻辑似乎是将两类团队结合起来。DeepMind 可以在同一组织内连接评估基础设施、模型训练和面向开发者的智能体。

这种安排提升了 Google 的能力,但并不意味着确立领先地位。Anthropic 和 OpenAI 仍是开发者评判任何后续发布时的参照对象。

反向人才收购集中人才,却留下棘手问题

这种交易结构让 Google 得以迅速行动,但将不确定性转移给初创公司、其投资者、客户和留任员工。

反向人才收购是指大型公司聘用初创公司的领导者和部分员工,同时通过授权而非收购整个企业来获得技术。

Google 此前曾采用过类似结构。其与 Character.AI 的协议让联合创始人和研究人员回归 Google,同时通过非独家许可获得技术使用权。

Windsurf 的交易遵循了相似模式。Google 聘用了高级员工并获得技术授权,而 Windsurf 仍是一家不受 Google 控制的独立公司。

其他科技公司也采取过类似安排。Microsoft 从 Inflection 招募领导层,Amazon 聘用 Adept 的高管和研究人员,Meta 则将对 Scale AI 的投资与高级人员转移结合起来。

这类交易的完成速度可能快于传统收购。它们也让收购方能精准锁定其认为最有价值的人才和技术资产。

监管机构已开始审视这一更广泛的模式。一份 FTC staff report 研究了主要云服务商对 AI 开发商的投资和合作关系。

该报告并未评估后来的 Mechanize 安排。不过,它指出了涉及人才、技术、计算资源和敏感信息获取的更广泛竞争担忧。

即使未披露收购,Google 与 Mechanize 的人才交易仍符合这一政策讨论。初创公司的核心员工可以转入现有巨头,而公司实体本身仍置身交易之外。

这种结果可能削弱初创公司独立竞争的能力。技术知识一部分存在于代码和文档中,但也有很大一部分存在于设计该系统的团队之中。

因此,Mechanize 的未来成为最大悬而未决问题之一。其网站或许仍会保持运营,但公开层面的延续并不能证明其在运营上独立,或拥有可行的产品路线图。

该公司的其他联合创始人也构成另一项未解问题。公开报道确认 Besiroglu 的转任以及十多名员工的流动,但并未完整说明每位创始人的角色。

客户和研究合作伙伴同样需要明确答案。他们需要知道,在人员变动之后,谁维护现有工具、控制数据、运行评估系统并提供支持。

非独家技术许可可以保留初创公司与其他企业合作的形式权利。但如果创造该技术的员工已经离开,实际独立性就会变得更难维持。

Google 也面临内部风险。集中式招聘带来了专业知识,但通过特殊交易整合人员,可能产生与普通招聘不同的激励机制。

员工需要明确的权限、基础设施访问权,以及从研究走向已部署产品的路径。缺少这些条件,宝贵知识可能被孤立在大型组织内部。

这还涉及更广泛的市场取舍。反向人才收购可以回报资本并维持形式上的竞争,同时将稀缺专家转向资源最雄厚的公司。

如果这种模式在整个行业反复出现,能够挑战主要模型提供商的独立实验室数量可能会减少。

替代方案同样并不简单。构建先进训练基础设施的初创公司需要昂贵的算力、可靠客户以及前沿模型访问权。大型平台可以同时提供这三者。

Mechanize 的创始人还选择了一项格外宏大的使命。追求完整的工作自动化,需要的资源和分发能力远超多数年轻公司能够独立获得的范围。

加入 DeepMind 可以加速其中一部分工作,但也可能将团队重新导向 Google 的优先事项,尤其是支持 Gemini 及相关产品的编程能力。

因此,这笔交易的价值取决于观察视角。Google 获得经验丰富的研究人员,而 Mechanize 原本的独立发展轨迹则变得更不确定。

监管关注并不等于证明存在不当行为。它所要追问的是:这种结构是否在未接受同等审查的情况下,产生了与收购实质相同的竞争效果。

随着更多 AI 初创公司分裂为两部分——有价值的人才进入现有巨头,剩余公司负责处理所有遗留事务——这个问题将持续存在。

更好的基准仍无法保证更好的软件

Mechanize 的评估专长可以改进训练,但没有任何单一基准能够证明智能体在生产环境中可靠。

编程基准将复杂活动压缩为可衡量的任务。这让进展变得可见,但每一次压缩都会将重要细节排除在分数之外。

受控环境通常会明确代码仓库、工具、时间限制和成功测试。真实工程团队则在不完整的需求、隐藏依赖和不断变化的组织约束下工作。

生产软件还会带来基准任务所回避的后果。一个看似合理的补丁可能暴露数据、破坏兼容性、增加成本,或造成数周后才显现的故障。

因此,智能体不能只做到产出通过测试的结果。它们还需要沟通假设、遵守权限、保持可维护性,并提供审查者能够评估的证据。

Mechanize 的环境可以帮助测试其中一些行为。该公司可以设计涉及陌生代码、部署、调试和多步骤执行的任务。

然而,评分系统决定了模型学会重视什么。如果评分器只奖励通过测试,模型就几乎没有动力产出清晰的设计或安全的运营决策。

研究人员可以加入安全检查、代码质量指标和隐藏测试。每一项新增内容都能扩大覆盖范围,但也会引入新的代理指标,智能体可能学会利用它们。

基准污染带来了相关问题。公开任务、解决方案和讨论可能进入训练数据,使后续模型看起来更有能力,却未必真正学会通用的问题解决技能。

私有且持续更新的评估可以降低这种风险,但也会让独立验证变得更困难,因为外部研究人员无法检查任务或复现实验分数。

Google 必须平衡两种需求。内部环境可以指导训练,公开评估则让开发者能够以可观察的证据检验相关主张。

GBA 模拟器任务提供了一个有用示例。它在边界清晰的项目中测试长时间执行、编译、调试和功能正确性。

通过这项挑战将具有意义,但并不能证明智能体能够安全迁移金融数据库、审查身份验证变更,或与产品经理协商模糊需求。

最有力的证据将来自多个层面。公开基准可以展示技术进展,私有评估可以发现尚未公开的弱点,受控部署则可以衡量实际价值。

客户成果必须补全这幅图景。团队应考察完成率、审查时间、回归问题频率、安全发现,以及工程师必须重启失败任务的频率。

Google 拥有足够的分发能力,可以迅速产生这类证据。它可以将编程智能体部署到内部项目、云环境和开发者产品中。

规模也会带来风险。当智能体在众多代码仓库中产出大量变更时,哪怕很低的错误率也可能变得显著。

对于高影响力代码,人工审查仍然不可或缺。关键问题在于:在计入审查、测试和修正后,智能体是否能减少总工作量。

这一标准比统计被接受的建议更严格。工程师可能接受生成的代码,却仍要花费大量时间理解、修复或记录它。

据报道,Mechanize 的新聘人员应能帮助 Google 设计要求更高的测试。但这无法取代谨慎部署和透明测量的必要性。

这正是为什么不应将该交易视为 Google 已解决智能体编程问题的证据。它是对用于发现和纠正失败的机制的一项投资。

怀疑论观点很直接:Google 可以在由新加入团队塑造的环境中提升分数,却无法在陌生的客户工作中实现同等可靠性。

乐观观点同样可信。专注于真实环境的团队可以推动模型超越短答案式编程,并在客户遇到问题前暴露其弱点。

两种观点都指向同一个检验标准。Google 必须证明其模型能够在并非围绕自身训练系统设计的代码仓库、语言、工具和工作流中实现泛化。

三个信号将显示这笔交易是否成功

接下来的证据应依次来自产品、独立评估以及 Mechanize 的持续运营。

第一个信号是 Google 推出一款明显体现新加入团队工作成果的编程智能体。一次有意义的更新应提升持续执行能力,而不只是生成更好的孤立代码片段。

关注那些能够检查大型代码仓库、规划协调一致的修改、运行测试、从错误中恢复并解释变更内容的智能体。Google 也应说明其如何衡量这些行为。

若能明确说明与新训练环境的关联,将更有力地证明 Mechanize 的整合正在产生成果。模糊的模型升级则只能提供弱得多的证据。

第二个信号是在独立、长周期评估中的表现。Google 自主控制的分数可以指导开发,但可信的比较仍需要外部测试。

不应由单一基准决定结果。模型应在不同代码仓库、编程语言、工具和评分方法中都保持强劲表现。

泛化能力比在某一项公开任务上取得惊人胜利更重要。如果基于 Gemini 的智能体能在彼此无关的评测中持续改进,那么这笔交易背后的机制就显得更可信。

开发者还应比较可靠性,而不只是完成率。一个完成更多任务却引入细微回归问题的智能体,会带来高昂的审查负担。

第三个信号是 Mechanize 自身将如何发展。持续开展研究、维护基准测试、招聘新人以及积极服务客户,都将表明这家剩余公司仍保有实质性的独立性。

如果其公开活动日渐减少,则可能意味着这项交易更像是对运营核心的收购。这种结果会加剧围绕反向人才收购的疑问。

Barnett 和 Erdil 的角色同样值得关注。他们未来的工作可以说明,Mechanize 是继续作为由创始人主导的组织存在,还是沦为围绕授权资产运转的空壳。

这一信号中也应关注监管动态。信息请求或政策指引可能影响 Google 及其他公司未来构建人才协议的方式。

对开发者而言,务实的回应应是耐心,而非漠不关心。Google 与 Mechanize 的人才交易为 DeepMind 增添了可信的专业能力,但组织层面的新闻本身并不会改善工作流程。

应在与自身项目相似的代码仓库上评估由此产生的产品。跟踪审查时间、失败任务、回归问题、权限要求,以及生成说明是否清晰。

企业采购方应询问供应商如何构建评测,以及如何避免对基准测试的过度拟合。他们还应要求提供涵盖安全性、可维护性和陌生内部代码的证据。

知识工作者应关注这项更广泛的实验。Mechanize 的起点是一项超越软件领域的使命,而编程为这一自动化论点提供了最清晰的检验。

如果由环境驱动的训练能够产出可靠的编程智能体,类似方法将扩展至其他基于计算机的工作。如果收益始终受限于基准测试,更广泛的自动化主张将需要大幅修正。

Google 已吸纳了那些专门设计此类测试的人才。现在,这些测试必须变成值得信赖的产品,而这些产品还必须经受住 Google 未曾为其设计的真实工作考验。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page