top of page

Google 与 Mechanize 的交易将 Besiroglu 的 AI 编程团队纳入 DeepMind

9月14日
讀畢需時 13 分鐘

Google 已完成对 Mechanize 的人才引进,将 Tamay Besiroglu 及十多名前员工纳入其 AI 组织。这些人员流动发生在外界报道称 Google 正与这家旧金山初创公司洽谈一项大型技术与人才协议之后。

据近期报道援引的公开职业信息显示,Besiroglu 现将自己标注为 Google DeepMind 的研究科学家。数名前 Mechanize 员工也列出了新的 Google 职位,其中许多人专注于模型训练和评估。

不过,Google 与 Mechanize 的交易并非已获确认的对整家公司的收购。其最终财务条款尚未披露,Google 和 Mechanize 均未公布这笔交易的详细说明。

这种区别改变了事件的性质。Google 似乎在未将 Mechanize 作为传统子公司并入的情况下,获得了从事编程环境、评估和模型改进工作的研究人员。Mechanize 则在新领导层带领下继续公开运营。

这一结果不像常规的初创公司退出,更像是稀缺技术能力的转移。这也延续了 Google 此前与 Character.AI 和 Windsurf 合作时采用的策略。

对 DeepMind 而言,眼下的关键收获并非又一个编程助手,而是一支研究如何创建用于改进编程模型的任务、反馈和测量系统的团队。

对监管机构和竞争对手而言,尚未解答的问题则关乎控制权。非独占许可与协调招聘安排可以转移大量能力,同时让原有公司实体得以保留。

Google 与 Mechanize 的交易究竟改变了什么

Google 获得了一支专业的 AI 训练团队,而 Mechanize 并未被明确确认以传统收购形式纳入其中。

最明确的证据涉及人员,而非合同。Besiroglu 从 Mechanize 首席执行官职位转任 Google DeepMind 的研究科学家。据报道,十多名前同事也加入了 Google。

近期报道指出,其中许多员工从事的是中期训练。中期训练是在大规模预训练之后、模型形成最终部署版本之前进行的额外学习。

这一阶段可以针对软件工程、工具使用、推理和长时程任务完成等特定能力。它处于通用语言学习与用于细化模型行为的更狭义后训练方法之间。

因此,这支团队的去向至关重要。这些研究人员并非只是加入消费者产品团队,或维护一个独立应用。他们所披露的职位使其接近塑造模型能力的核心流程。

最初的消息源自一项据报道的人才协议。如今公开可见的人事变动支持了发生大规模团队转移的结论。

但这些信息无法确定每一项商业细节。Google 尚未公开披露其许可了哪些知识产权、报酬如何分配,或 Mechanize 仍承担哪些义务。

Mechanize 的持续运营进一步强化了这种不确定性。此前被认定为该初创公司幕僚长的 Guive Assadi,如今公开将自己标注为首席执行官。

该公司网站也仍可访问。其公开材料依然介绍为执行软件工程的 AI 系统开发环境和评估方案的工作。

这种连续性使“收购”一词可能具有误导性。在传统收购中,买方会获得对目标公司的控制权,包括其资产和公司运营。

在这里,现有证据指向协调招聘加上技术访问权。原公司似乎仍是法律上独立的实体,尽管其创始人和大部分团队的离开改变了它在现实中的处境。

最终交易价值同样尚未得到确认。有关早期谈判的报道不应被表述为已披露的成交价格。

这一差距至关重要,因为谈判金额、许可付款、员工薪酬和公司估值衡量的是不同事物。将它们合并为一个收购价格,会制造公开记录无法支持的确定性。

已经发生的变化仍然意义重大。DeepMind 现已雇用这位创始人,以及一批与 Mechanize 编程代理训练方法相关的研究人员。

与此同时,Mechanize 必须在失去许多确立其技术方向的人员后,重新界定自身的运营身份。这构成了这笔交易背后的核心张力。

Google 获得了大部分可见的团队。Mechanize 保留了其公司实体。悬而未决的问题是,在人员离开后,该公司还保留了多少技术独立性。

DeepMind 为什么需要 Mechanize 的 AI 编程研究

其战略价值在于创建更好的训练任务和评估体系,而不只是增加另一个编程界面。

现代编程代理需要的不只是装满源代码的代码库。它们需要真实的环境,在其中检查项目、编辑文件、运行测试、诊断故障并从错误中恢复。

环境是模型尝试完成这些任务的受控工作空间。评测器则决定结果是否真正满足任务要求。

这些系统为强化学习提供反馈。强化学习是一种会增强与成功结果相关行为的训练方法。更好的环境能够带来更好的反馈,但设计不佳的任务也可能奖励投机取巧。

Mechanize 认为,现有编程基准测试往往无法可靠反映模型能力。一些任务低估了更强模型,而另一些则会奖励无法转化为实用工程工作的行为。

其 GBA Eval 研究阐明了这一立场。该评估利用模拟的 Game Boy Advance 环境,测试代理如何与陌生且有状态的软件系统交互。

这些游戏并非商业目标。它们提供了可观察的环境,让模型必须规划、理解反馈并持续取得进展,而不是只生成一个孤立答案。

Mechanize 将这项工作定位为评估和训练环境中“质量优先”方法的一部分。这一理念契合每一家前沿模型开发商所面临的问题。

编程基准可能趋于饱和。模型也可能在训练期间接触到基准材料,进而削弱后续评分的价值。

因此,高分可能反映记忆、针对任务的优化,或评测器中的漏洞。它并不自动意味着代理能够维护一个陌生的生产系统。

真实的软件工作持续时间更长。代理必须理解依赖关系、保留现有行为、响应测试失败,并处理不完整的需求。

这些要求使编程成为通用代理颇具吸引力的试验场。软件环境提供机器可读的输入、可执行的输出,以及相对客观的成功条件。

其经济价值也很直接。能够可靠完成多步骤工作的编程代理,可以协助开发人员、加快内部项目,并支持面向企业客户销售的产品。

Google 已拥有多种分发这类能力的渠道,包括其云平台、开发者产品、Gemini 应用和内部软件组织。

更棘手的限制在于提升模型可靠性。仅增加计算资源,并不能保证模型能够在复杂代码库中有效规划。

训练数据必须让模型接触有价值的失败和纠正。评估体系也必须能够发现那些表面成功却隐藏功能缺陷的情况。

Mechanize 的研究人员专注于这一不那么显眼的层面。他们的工作包括构建任务与反馈系统,以推动模型超越简短的编程练习。

即便 Mechanize 从未成为大型消费者品牌,这也使该团队对 DeepMind 具有价值。Google 可以将其研究与模型基础设施、计算资源和产品分发相结合。

这些新加入的研究人员还可能帮助 DeepMind 缩短评估与训练之间的循环。模型可以尝试一项任务,获得结构化反馈,并根据由此产生的信号进行训练。

当这一循环奏效时,评估就不再只是记分牌。它会成为改进下一代模型的生产系统的一部分。

这解释了为什么 Google 与 Mechanize 的交易围绕人员和技术访问权展开。其中有价值的知识包括:判断哪些任务能够暴露真正弱点的能力。

这类判断很难像普通软件一样被打包。它存在于实验设计、数据集构建、奖励工程以及对模型失败的反复观察之中。

招聘这些研究人员,能够比单独许可代码更快地转移这种运营知识。Google 还获得了能够随模型变化而调整方法的人才。

不过,这一战略逻辑并不能证明未来表现。DeepMind 必须整合团队、构建有效的训练管线,并证明由此产生的模型在受控测试之外表现更好。

Google 正在重复“反向人才收购”模式

Mechanize 的安排符合更广泛的趋势:大型 AI 实验室聘用关键团队并获得技术许可,却不收购整家初创公司。

这种结构通常被称为反向人才收购。买方招聘初创公司的创始人或技术负责人,同时签署另一项技术访问协议。

该初创公司在法律形式上保持独立。但在实际中,它可能失去与其产品和研究方向联系最紧密的人员。

Google 曾与 Character.AI 采用类似结构。它将联合创始人 Noam Shazeer 和其他员工重新招入 Google,同时获得 Character.AI 技术的非独占许可。

该公司后来又对 Windsurf 采取了类似方式。Google 聘用了首席执行官 Varun Mohan 和其他研究人员,以支持其在代理式编程方面的工作。

人员转移后,Windsurf 继续独立运营。其产品和剩余组织并未成为标准的 Google 子公司。

Microsoft 与 Inflection AI 的安排,以及 Amazon 对 Adept 领导层的招聘,则构成了其他突出案例。每笔交易都转移了重要人员,同时保留了一个独立的公司实体。

这些交易为买方提供多项优势。它们可以迅速获得人才、取得技术访问权,并避免收购整家公司所伴随的整合负担。

许可还可以让原公司保留其技术权利。这一特征支持了此类安排保留一定市场独立性的说法。

然而,法律上的独立并不能解决竞争问题。一家失去创始人、高级研究人员或关键工程师的初创公司,可能难以继续成为有效的竞争对手。

美国联邦贸易委员会警告称,对人才、算力资源和战略信息的集中获取可能影响生成式 AI 市场竞争。其 AI 合作伙伴关系研究审查了主要云服务提供商与 AI 开发商之间的关系。

该研究并未专门涉及 Mechanize。它提出了更广泛的担忧:相关协议可能使既有平台得以影响关键 AI 资源。

国际监管机构也在审查非传统的团队与授权交易。巴西竞争监管机构审查了 Google 与 Character.AI 的安排,随后还对涉及 Google 的其他协议展开调查。

其 竞争审查强调,结案一宗案件并不意味着自动批准未来的授权或协同招聘结构。

这一警示与 Google 和 Mechanize 的交易有关。一项交易并不会仅因规避了传统的公司所有权变更,就在竞争层面变得无关紧要。

监管机构可以追问,该安排是否转移了这家初创公司的生产性核心。他们也可以审查,剩余公司能否继续独立参与竞争。

Google 反复采用这一方式,使得这种模式的重要性超过了任何单笔交易。Character.AI 提供了对话模型方面的专长,而 Windsurf 则带来了一支成熟的编程团队。

Mechanize 增添了评估、环境和训练信号方面的专长。这些动作合在一起,触及了智能体开发流程的多个层面。

Google 可以开发基础模型,针对专业能力训练这些模型,在交互式环境中测试它们,并通过开发者产品进行分发。

这种纵向覆盖给竞争对手带来压力。较小的实验室可能拥有强大的研究能力,却缺乏 Google 的算力、客户关系和部署渠道。

OpenAI 和 Anthropic 仍是最明显的模型层面竞争对手。编程公司也在争夺用户、企业合同和开发者心智份额。

不过,主要竞争并不是 Google 对阵某一家初创公司,而是整合型实验室与专注于某一关键环节的独立团队之间的较量。

一家独立评估公司可以向多家模型提供商出售工具。一旦其研究人员加入大型实验室,他们的注意力便可能转向该实验室的私有系统。

非独家授权并不能消除这一问题。对技术拥有法律访问权,与留住知道如何改进这项技术的人,并不是一回事。

因此,这种结构形成了一种反转。Mechanize 最初是一个独立项目,旨在改善不断发展的市场中智能体的训练和测量。

其最知名的创始人以及一大批员工如今已在该市场最大的模型开发商之一内部工作。独立性在形式上得以保留,而能力则在运营层面集中起来。

报道中的交易仍留下三个重大未解问题

人员转移显而易见,但交易价格、技术范围以及对 Mechanize 的影响仍未经证实。

第一个问题涉及财务条款。早期报道描述了涉及一笔巨额方案的谈判,但双方均未披露最终金额。

这一缺失的信息使其无法与传统收购进行清晰比较,也使外界无法区分技术授权、员工薪酬和投资者回报。

一个醒目的金额可能暗示 Google 收购了 Mechanize。目前可获得的证据支持的是一个更狭窄的结论:人员流动以及据报道的技术访问权。

第二个问题涉及知识产权。公开报道提到一项技术组成部分,有时被描述为非独家授权。

Google 尚未说明所涵盖的软件、数据集、环境、基准测试或训练系统。Mechanize 也未解释哪些资产仍可供其持续运营的组织使用。

非独家授权可以保留卖方在其他地方使用或授权同一技术的能力。但合同限制仍可能影响这种能力在实践中的运作方式。

这家初创公司或许保留了法律权利,却缺乏开发这些权利所需的团队。或者,剩余组织可能会在 Assadi 的领导下继续构建产品。

Mechanize 的公司公告记录了其早期发布及后续融资情况,但未对报道中的 Google 交易作出公开说明。

缺少详细公告值得注意,尽管这并不能推翻相关报道。私营公司和个人员工可以完成相关安排,而不公开完整合同。

第三个问题涉及技术影响。DeepMind 已获得相关专家,但尚无公开模型发布能够证明他们的工作带来了哪些改变。

编程能力涉及许多相互作用的组成部分。模型架构、预训练数据、工具接口、推理时间和后训练都会影响结果。

改进后的环境可以加强训练,但选择不当的奖励机制也可能产生狭窄行为。模型可能学会满足评分器,却无法干净地解决底层问题。

这被称为奖励黑客。AI 系统会利用测量过程,而非实现评估者预期的目标。

Mechanize 对低质量评估的批评,使这一风险成为核心问题。只有当成功真正对应开发者关心的实际能力时,基准测试才有价值。

整合带来了另一层不确定性。小型研究团队能够快速行动,是因为它们掌控自己的工具和优先事项。

进入 Google 后,这些研究人员获得了算力和基础设施,同时也必须与更庞大的模型、安全、产品和工程组织协调。

这种权衡可能放大他们的工作,也可能拖慢它。公开的职位变动无法揭示究竟是哪一种结果正在发生。

剩余的 Mechanize 组织面临相反的挑战。它可能保有独立性和技术资产,但必须在创始人及同事离开后重新招聘。

客户和合作伙伴将希望了解公司是否仍在维护其产品。潜在员工则会希望明确公司的使命和领导层情况。

监管机构可能引入另一项不确定性来源。监管部门已经表现出对将技术授权与协同招聘结合的交易的兴趣。

任何审查都会聚焦实质而非包装。相关问题包括有多少员工流动,以及 Google 是否获得了对重要资产的实际控制权。

审查并不意味着存在不当行为。它将检验该交易是否需要申报,或是否在适用法律下削弱竞争。

最强烈的怀疑性解读认为,这种结构保留了一个独立的空壳,却将生产性团队转移至 Google。该解读仍有可能,但尚未得到证实。

更有利的解读则认为,Mechanize 的投资者、员工和持续运营的公司保留了选择权,而 Google 获得了非独家访问权。未公开的合同使外界无法有把握地在这两种说法之间作出判断。

因此,读者应区分三个层级的证据。人员资料支持团队转移这一事实,已有报道支持协议存在这一事实。

只有双方掌握最终合同。关于确切付款金额、授权资产或持续独立性的说法,都需要他们尚未披露的信息。

Mechanize 团队加入 DeepMind 后应关注什么

三个信号将显示,Google 是否获得了持久的编程能力,还是仅完成了又一次昂贵的人才转移。

第一个信号是对交易的正式说明。Google 或 Mechanize 可能披露授权范围、公司状态以及涉及的员工人数。

这些信息将澄清 Google 获得的是可复用的基础设施,还是主要招聘了研究人员。它也将帮助监管机构区分商业合作伙伴关系与功能上的收购。

沉默会使当前解读继续依赖个人资料和匿名报道。它不会抹去人员转移,但会削弱关于协议完整范围的主张。

第二个信号是 Google 编程模型性能的可衡量变化。DeepMind 必须将团队的专长转化为能更可靠完成持续性软件任务的系统。

应关注基于陌生代码库、交互式工具和长任务序列的评估。短期基准测试提升提供的证据会更弱。

Google 还应说明如何控制污染和奖励黑客。一项可信的评估需要隐藏任务、可复现的方法,以及反映功能性软件行为的成功标准。

独立测试将比内部评分更重要。开发者需要看到,智能体能否诊断故障、保持兼容性,并在无需持续干预的情况下完成工作。

当产品发布暴露出这些能力时,便可提供有用证据。Google 的开发者工具为 DeepMind 研究走向实际使用提供了一条路径。

不过,新的界面或模型名称并不能证明 Mechanize 团队作出了贡献。相关证据应是其研究所涉及任务上的可靠性提升。

第三个信号是 Mechanize 的持续活动。新的研究、产品发布、招聘和客户工作,将支持其仍是一家独立竞争者的说法。

长期缺乏技术产出则会支持相反的解读。这将表明,公司在法律上存续,但其实质性的研究中心已转移到别处。

领导力在这里至关重要。Assadi 必须建立一种不完全依赖已离职团队声誉的战略。

Mechanize 可以继续为多家模型提供商创建环境和评估。这将保留其作为编程智能体训练市场中独立供应商的地位。

它也可能缩小业务范围,或围绕协议后保留的资产进行建设。公开发布将揭示其是否仍打算服务外部实验室。

监管行动仍是一个重要的次要指标。监管机构已对“非传统 AI 交易总是落在并购审查范围之外”的假设提出质疑。

信息请求不会使交易失效。它将表明,授权和招聘结构正受到类似于所有权变更的审查。

竞争对手的反应将提供更多背景。OpenAI、Anthropic、Microsoft、Amazon 以及专业编程公司,都需要更好的环境和模型反馈。

它们可以通过收购类似专长、建立内部评估团队,或支持独立供应商来应对。每一种反应都会强化训练层的重要战略地位。

对开发者而言,眼前的教训很实际。对编程智能体的主张应根据真实项目来评估,而不应只看公开排行榜。

团队应考察智能体如何处理不完整的需求、隐藏测试、长期依赖关系,以及犯错后的恢复。这些行为决定了基准测试上的优势能否转化为有用工作。

知识工作者面临相关问题。随着智能体完成更长的任务,人们需要可靠地记录需求、决策和修正。

结构化的 AI 知识库可以帮助团队在模型运行和人工审查之间保留这些上下文。它不能替代技术评估,但能让故障更容易被检查。

Google 与 Mechanize 的交易最终检验了两项判断。Google 押注,稀缺的评测专业能力能够帮助 DeepMind 更快改进其模型。

该交易结构还假定,团队与技术许可无需通过传统收购,也能转移实质性能力。监管机构可能会单独检验这一假设。

关注相关合同、编程成果,以及 Mechanize 的独立产出。这些信号结合起来,将揭示这究竟是一项合作、一次反向人才收购,还是一场名义之外无异于收购的交易。

在此之前,应将人员变动视为既定事实,将商业细节视为媒体报道。该问的是 Google 的下一代编程系统能否在长期、可验证的任务上取得改进,而不是又一条标题是否宣布了赢家。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page