阿里巴巴的 Qwen3.7-Max 完成了一次持续 35 小时的自主编程运行
阿里巴巴发布 Qwen3.7-Max,此前一项持续 35 小时的自主编程测试,让一则普通的 Google News 消息演变为对软件团队的直接挑战。据报道,该模型在无人干预的情况下执行了 1,158 次工具调用,并测试了 432 种内核变体。阿里巴巴表示,最终生成的代码运行速度是参考实现的十倍。
这个标题听起来又像是在警告:AI 正在取代工程岗位。但更有价值的解读恰恰相反。Qwen3.7-Max 并非根据简短提示生成一个用完即弃的应用;它花费数小时测量、调试、修订并验证高度专业化的代码。
这一区别令 Anthropic、DeepSeek、Moonshot AI、Zhipu AI 以及企业软件团队都面临压力。竞争已不再是谁能正确回答一个编程问题,而是哪个模型能在漫长且易出错的工作流程中持续保持生产力。
阿里巴巴给出了令人印象深刻的证据,但尚未就此盖棺定论。大多数性能数据来自该公司或由 Qwen 团队创建的基准测试。在买方将其视为可靠的运营保障前,独立团队仍须复现这些结果。
阿里巴巴的 Qwen3.7-Max 实际改变了什么
关键变化不在于 Qwen3.7-Max 会写代码,而在于据称它能持续 35 小时运行一个可量化的工程循环。
阿里巴巴于 2026 年 5 月 20 日在杭州举行的云峰会上推出 Qwen3.7-Max。这一专有模型面向智能体工作负载,即软件会自行选择动作、调用工具、观察结果并修订方法的任务。
这一重点不同于人们熟悉的聊天机器人模式。聊天机器人通常接收一个提示并返回一条回复;而智能体必须在应对错误、不完整信息、状态变化和反复使用工具的过程中保持目标不偏离。
阿里巴巴以 SGLang 的注意力内核测试了这种能力。SGLang 是一个用于部署语言模型的开源系统。内核是运行在硬件上、执行特定计算的底层程序。微小改进就可能影响使用该操作的每次模型请求的速度与成本。
目标硬件是一台搭载阿里巴巴平头哥 Zhenwu M890 加速器的云实例。该公司称,Qwen3.7-Max 在训练期间未曾接触过这种芯片架构。它没有获得硬件文档、测量历史或经过优化的示例实现。
模型从一个用 Triton 编写的参考版本开始。Triton 是一种用于开发高性能 GPU 内核的编程语言。随后,它编译替代方案、测量性能、识别故障并修改代码。
这项 35 小时实验涉及 432 次内核测试和 1,158 次工具调用。阿里巴巴表示,最终实现相较于起始参考版本实现了平均十倍的加速。
这些细节比单一基准分数更重要。模型必须将目标与一长串行动连接起来;当编译或性能结果与先前选择相矛盾时,它还必须能够恢复并调整。
这项任务仍有相对有利的边界条件。阿里巴巴拥有模型、芯片、云环境以及大部分评估流程。即使模型没有针对该特定架构进行训练,该公司仍可以围绕自己熟悉的基础设施设计测试设置。
不过,这次运行比要求模型完成一个孤立函数更具挑战性。它更接近工程师的优化工作流程:进展依赖反复实验,而非背诵出的答案。
阿里巴巴也正将这一智能体重点转化为更广泛的商业战略。其 云服务公告将 Qwen3.7-Max 描述为一款面向编程和办公场景、可持续执行多步骤操作的模型。
该模型支持与 OpenAI 和 Anthropic 工具兼容的接口。阿里巴巴称,开发者可将其连接至包括 Claude Code、OpenClaw、Qwen Code、Hermes Agent 和 Qoder 在内的智能体环境。
这种兼容性降低了任何单一聊天应用的重要性。企业可以在现有的智能体框架中测试底层模型;这一配套软件负责管理工具、权限、上下文和执行。
这也正是该故事从专业媒体走向 Google News 的原因。阿里巴巴并非只是在宣称拥有更好的助手,而是在将该模型定位为一名能够留在工程流程中、直至产出经过验证结果的工作者。
为什么这次 35 小时运行让编程智能体承压
Qwen3.7-Max 将竞争标准从生成看似合理的代码,提高到在数百次决策中持续保持有效推进。
编程模型在衡量系统能否解决明确软件问题的测试中进步迅速。这类评估依然有用,但它们将工程工作压缩为一个边界清晰、终点可辨的任务。
生产环境中的工作则远没有那么有序。代码库包含未记录的依赖、相互冲突的需求、间歇性失败的测试,以及后果很久之后才会显现的决策。模型可以写出令人印象深刻的补丁,却仍给人类留下比原始问题更多的收尾工作。
阿里巴巴的实验针对了其中一项弱点。其核心主张关乎在反馈之下的耐力。Qwen3.7-Max 不需要每次行动都成功,因为测量循环让它能够修正失败的尝试。
这种模式更像科学方法,而不是自动补全。模型提出改动、运行实验、检查结果,然后生成新的候选方案。价值来自整个循环,而非某一次特别聪明的回复。
阿里巴巴报告称,在同一内核任务中,Qwen3.7-Max 与多家竞争对手之间存在显著差距。该公司表示,GLM-5.1 实现了 7.3 倍加速,Kimi K2.6 实现了五倍加速,DeepSeek V4 Pro 实现了 3.3 倍加速。据称,Qwen3.6-Plus 实现了 1.1 倍加速。
这些比较仍应被视为暂定结论。阿里巴巴选择了任务、配置了智能体并报告了结果。提示方式、工具限制、停止规则或计算资源分配的变化,都可能显著影响智能体评估。
Anthropic 仍提供了一个关键参照点。在 KernelBench L3 上,阿里巴巴称 Qwen3.7-Max 在 96% 的案例中成功生成了加速内核。根据该提供商的对比,Claude Opus 4.6 据称达到 98%。
更广泛的基准图景并非一边倒,而是较为复杂。据称,Qwen3.7-Max 在 SWE-bench Verified 上得分为 80.4,而 Claude Opus 4.6 Max 为 80.8,DeepSeek V4 Pro Max 为 80.6。
阿里巴巴也承认,在其对比中 Claude 在一些领域领先,其中包括 NL2Repo、ClawEval 和 CoWorkBench。这使实际竞争少了些戏剧性,却对围绕特定工作流程选型的买家更具参考价值。
因此,压力落在每一家提出广泛智能体主张的模型提供商身上。客户将越来越多地追问:一个智能体能有效工作多久、多久需要一次救援,以及它的工作能否经受独立审查。
短期基准上的高分无法回答这些问题,经过精心打磨的演示也同样无法回答。企业需要查看多次运行的分布情况,包括失败、恢复率、人工干预时间以及最终产物的质量。
这一新标准也令智能体平台开发者承压。模型只是可运行系统中的一个组件。工具设计、上下文管理、可观测性、权限边界和验证器,决定了长期自主运行带来的是进展还是持续损害。
阿里巴巴的训练方法体现了这种系统级视角。Qwen 团队将每项练习拆分为任务、工具环境和验证器。研究人员可以重新组合这些元素,以抑制那些只在某一种熟悉设置下有效的策略。
验证器会检查结果是否满足预期目标。这一功能在长时间运行中变得至关重要,因为一个自信的模型否则可能会花费数小时优化错误的指标。
阿里巴巴称,Qwen3.7-Max 在 OpenClaw、Claude Code 和 Hermes 上的结果比前代更加稳定。如果独立测试证实这一结果,将减少组织切换智能体框架时所需的工作量。
对工程负责人而言,一致性可能比排行榜领先更重要。一个在各类工具间表现可预测、能力略弱的模型,可能比一个随着每个框架变化表现的顶尖得分者更易于治理。
这正是 Google News 标题之下的竞争信息。阿里巴巴要求买家将模型视为嵌入系统中的持续运营者,而不是等待在浏览器标签页中的孤立生成器。
Qwen 正在接手的是重复实验循环
最可信的近期替代,涉及重复性的工程迭代;而人类仍负责目标、约束与后果。
“抢走你的工作”这一说法,将许多不同活动捆绑成一个戏剧化预测。软件工程包括产品探索、架构设计、实现、测试、安全审查、事件响应、协商和维护。
Qwen3.7-Max 并未执行所有这些职能。它在一个经过仪器化的环境中处理了一个狭窄的优化目标。其最强结果来自反复执行一种机器能够比人更快、更久地完成的循环。
内核优化就是一个很好的例子。工程师往往必须尝试许多实现选择、进行基准测试、检查瓶颈,并舍弃大多数尝试。这项工作需要专业知识,但其大部分耗时来自反复实验。
能够自动执行这些重复工作的智能体,可以扩大专家的能力范围。一名工程师可以定义目标、建立正确性测试、监督环境,并审查比人工操作规模更大的搜索过程。
这种安排改变了工作,却没有消除责任。仍然需要有人决定“更快”意味着什么、哪些数值容差可以接受,以及优化是否会造成安全或维护问题。
模型的失败同样会成为工程工作的一部分。生成的代码需要审查,而长期自主运行则需要日志,以说明哪些文件被修改、执行了哪些命令,以及哪些假设塑造了结果。
这正是乐观解读获得一定可信度的地方。繁琐的搜索和测量可以交给智能体,让人们将更多时间投入系统设计与判断。
不过,这种益处并不会自动出现。组织可以利用生产率提升来改善质量、尝试更困难的工作、减少人员配置,或提高产出预期。技术本身并不决定管理层如何分配这些收益。
开发者也应区分任务自动化与职业替代。模型可以自动化一项重要活动,却未必理解其周围的业务背景。如果足够多的活动变得可自动化,雇主仍可能重组岗位。
这种转变很可能并不均衡。在经过充分测试的代码库中工作的团队将从智能体中获益更多,因为验证器能够迅速发现回归问题。文档匮乏的系统提供的反馈较弱,因此智能体可能会产出看似合理、实则有害的改动。
专业基础设施工作或许会变得更易触及。缺乏多年内核经验的开发者,可以借助智能体探索实现方案,前提是由合格的审阅者核查其正确性与硬件行为。
这并不意味着专业知识不再重要。相反,随着智能体生成的候选工作超过团队过去有时间尝试的规模,专家审阅可能变得更有价值。
在这一转变过程中,知识管理也变得更加重要。如果希望智能体在受限基准测试之外采取行动,就需要让它获取需求、过往决策、运行手册和约束条件。
团队本就难以让这些上下文可供人类工程师检索。一个持续维护的技术知识库可以帮助人们核实智能体使用了哪些信息,并在执行前发现缺失的信息。
当智能体跨越办公任务开展工作时,工作方式又会发生变化。阿里巴巴表示,Qwen3.7-Max 可以协调多文件项目以及涉及外部工具的工作流。这些说法将该模型从代码生成扩展到了运营流程。
这份年度报告明确展现了阿里巴巴的雄心。公司管理层预计,智能体将承担越来越多的数字化工作,并成为人与软件之间的主要交互界面。
这种企业愿景应被视为战略,而非已被独立证实的预测。阿里巴巴销售模型、云计算能力、芯片和智能体平台。智能体更广泛的采用会直接支持其业务的每一个部分。
不过,这家公司正围绕一个连贯的论点构建布局。模型生成行动,行动消耗云资源,而阿里巴巴提供其底层基础设施。因此,Qwen 既是一款产品,也是推动其余技术栈需求的引擎。
对开发者而言,实际的应对方式不是与智能体的耐心竞争,而是提升那些决定智能体工作是否值得上线的能力。
这些能力包括编写可执行的需求、构建有意义的测试、设计权限边界、审查生成的改动,以及识别模型何时优化了错误目标。
一次持续 35 小时的运行之所以令人印象深刻,是因为很少有人愿意如此长时间地重复一项受限实验。只有当组织将持续性误认为完整的工程所有权时,它才会变得具有威胁。
Google News 标题无法证明什么
阿里巴巴展示的是一项颇具说服力的公司内部实验,而不是自主软件开发的通用衡量标准。
最大的局限在于来源集中。阿里巴巴提供了模型、硬件、基准条件、性能主张以及许多竞品结果。The Decoder 恰当地指出,若干被引用的基准测试由 Qwen 团队创建。
自建基准并非天然无效。模型开发者经常创建测试,因为既有评估已无法捕捉新能力。风险在于,未经外部复现便将这些测试作为广泛证明。
这项内核实验也缺少许多生产环境中的不确定性。它拥有可衡量的目标、可执行的代码、可访问的硬件以及紧密的反馈循环。这些条件让自主迭代变得异常可行。
诸如“让新用户引导更容易”这样的产品需求,并不提供可比的反馈。它需要用户研究、设计判断、法律考量,以及在相互竞争的目标之间作出选择。
长时间运行同样可能放大错误。访问权限过大的模型可能修改更多文件、消耗更多资源、暴露敏感信息,或基于错误前提构建依赖关系。
工具调用次数本身并不衡量价值。一个执行了 1,158 次严谨操作的智能体可能胜过一次更短的运行;如果另一套系统以更少操作达到相同结果,这一数字也可能掩盖低效率。
因此,团队需要将结果指标与运营指标结合。他们应衡量正确性、审阅时间、回滚频率、安全发现,以及部署前所需的人力投入。
阿里巴巴声称 Qwen3.7-Max 在训练期间从未见过 Zhenwu M890 架构,这一点也很难由外部人士审计。专有前沿模型的训练数据集很少能够供人完整检查。
该模型确实获得了一个参考实现,而这一工件承载了有关计算的大量信息。因此,它在没有文档的情况下起步,但并非没有具有技术意义的起点。
对竞品的比较也需要同样谨慎。智能体的结果取决于其测试框架、提示词、工具接口、上下文分配和停止策略。中立评估必须为每个模型提供适合其优势的配置。
同样的担忧也适用于跨框架的一致性。阿里巴巴称,其新的训练方法减少了不同智能体环境之间的性能变化。独立研究人员应使用公开代码库和固定评估规则重复这些测试。
安全性仍是另一个尚未解决的问题。长时间运行的编码智能体可能在代码库、文档、问题追踪器或工具输出中遭遇恶意指令。持续的自主性扩大了可被操纵的时间和攻击面。
权限设计成为实际防线。团队应只授予完成任务所需的最小权限,隔离执行环境,保留完整日志,并要求在改动进入敏感系统前获得批准。
人工审阅仍然必要,但必须具有实质性。仅浏览摘要后批准一个大型补丁,并不能提供有意义的控制。审阅者需要测试、差异、来源信息,以及对尚未解决不确定性的清晰说明。
阿里巴巴还报告了 Qwen3.7-Max 在训练期间的另一项有趣用途。据称,该模型监控软件工程轨迹中的奖励黑客行为,也就是模型利用评估机制而非解决预期问题的情况。
据该公司称,这个智能体在 86 小时内检查了 13,952 条轨迹,创建了 13 条检测规则,并标记出 1,618 个疑似案例。
这一应用同时展现了智能体评估的前景与循环性。一个模型可以帮助识别另一个模型的不当行为,但研究人员仍需验证其检测是否准确。
误报可能会剔除合法的训练样本。漏报则可能奖励捷径,而这些捷径日后可能表现为亮眼的基准测试成绩。因此,监控智能体本身也需要审计流程。
这些不确定性并不会抹去 35 小时的结果。它们界定了该结果能够支持的结论:这是前沿模型能够在受控条件下持续运行专门优化循环的证据。
这并不能证明 Qwen3.7-Max 能够独立维护陌生的生产系统、理解模糊的利益相关者需求,或为失败的部署承担责任。
从 Google News 而来的读者应避免走向两个极端。这项实验比精心编排的聊天机器人演示更有实质内容,但其范围也远小于替代一个工程部门。
Qwen3.7-Max 发布后值得关注什么
三个信号将显示阿里巴巴交付的是持久的智能体平台,还是一次异常有利的演示。
第一个信号是对内核结果的独立复现。研究人员需要获得任务定义、起始代码、正确性测试、运行条件、提示词、工具策略和停止标准。
在非阿里巴巴硬件上成功复现,将强化核心主张。反复失败或严重依赖私有基础设施,则会缩小其相关性。
最有价值的研究应比较多次运行,而不是公布一次最佳结果。智能体系统在不同尝试之间可能存在明显差异,因此平均值和失败分布比单次成功轨迹更重要。
第二个信号是 Qwen3.7-Max 在真实代码库中更长时间段内的表现。企业应报告人工干预频率、被接受的改动、被回退的改动、审阅时间以及部署后发现的缺陷。
阿里巴巴列举了软件和智能体基准上的得分,但公开案例研究将揭示这些能力能否在混乱的组织条件下延续。一次有价值的部署应减少总体人力投入,而非仅仅增加生成代码量。
尤其应关注涉及维护的案例。构建一个新原型允许更大的自由度,而维护现有系统则要求兼容过往决策和运营约束。
第三个信号是竞争模型提供商的反应。Anthropic、DeepSeek、Moonshot AI 和 Zhipu AI 现在都有动力公布更长时间的自主运行,并提供更清晰的评估规则。
如果提供商公开可复现的任务和失败案例,竞争能够改善证据质量;如果它们只是一味提高运行时长数字和展示自选基准的胜利,证据质量则可能被削弱。
阿里巴巴后续推出的智能体基础设施提供了其方向的另一条线索。该公司已推出用于追踪、评估、协调和治理多个智能体的工具。
这项投入承认了一个核心事实:仅有模型智能并不能造就可靠的工作者。组织需要能够揭示智能体做了什么、并让人们在损害扩散前介入的控制机制。
与早期部分 Qwen 版本不同,Qwen3.7-Max 仍通过阿里巴巴的托管服务以专有形式提供。这一选择让公司对部署拥有更强控制,并使使用量与其云业务更紧密地关联。
但这也使独立检查更加复杂。研究人员可以评估输出和行为,却无法全面检查模型背后的权重、训练过程或服务变更。
阿里巴巴面临战略权衡。托管访问可以支持安全更新和托管运营;开放权重则可以推动那些需要本地控制、定制能力或更深入技术评估的开发者采用。
更广泛的 Qwen 路线图将揭示公司如何平衡这些目标。阿里巴巴持续发布部分开放模型和基础设施组件,同时将最强大的 Max 系统保留为托管访问。
对企业买家而言,眼下的问题比哪个实验室领跑所有基准更具体。他们需要知道,Qwen3.7-Max 是否能在其合规、数据和审阅要求内可靠地完成工作。
一个短期试点应选择一项具备可衡量验收标准的真实待办工作。智能体应在隔离环境中运行,记录每一次工具调用,并阻止敏感操作。
团队应将总完成时间与当前工作流进行比较。这项计算必须包括提示词准备、监督、代码审阅、测试、修复和文档工作。
开发者也可以在低风险的内部任务上进行类似实验。选择包含重复性测试、但仍需要判断的工作,并记录模型在哪些环节推进、停滞或要求补充上下文。
目标不是证明智能体能够取代某个人,而是找出高效委派与昂贵监督之间的边界。
随着模型进步,这条边界将会移动。它也会因代码库、组织和监管环境而异。没有任何 Google News 标题能够替每个团队作出判断。
阿里巴巴的这项实验之所以受到关注,是因为它展示了一个模型在真实优化过程中持续运行了 35 小时。令人鼓舞的是,目标是重复性的技术劳动,而不是围绕它的整个岗位职责。
下一步取决于那些预计会使用这些系统的人。请根据你自己的工作检验这一说法,衡量监督所需的全部成本,并思考哪些决策必须继续由人来做。如果 Qwen3.7-Max 能够稳定地扩展一名谨慎工程师的能力边界,那么它接手的最重要工作,或许正是这名工程师从未想重复去做的那些事。



