top of page

阿里巴巴称 Qwen 可匹敌 Claude,向 Anthropic 与 Google 加压

8月31日
讀畢需時 14 分鐘

阿里巴巴表示,Qwen3.8-Max 在一项持续五天的自主研究任务中完成了可与 Claude 媲美的表现,从而升级了与 Anthropic 和 Google 的模型竞争。这一说法将中国系统与领先的美国模型并列比较,重点不再仅是简短的基准测试问题,而是长时间运行的工作。不过,阿里巴巴自身的测试尚不足以证明 Qwen 在常规商业约束下也能同样可靠地运行。

这一发布之所以重要,是因为 Qwen 正在成为不止于阿里巴巴版聊天机器人的产品。该公司正将模型、智能体软件、云服务和芯片打造为一个相互连接的技术栈。Qwen3.8-Max 旨在规划、使用工具、处理反馈,并在有限监督下持续完成复杂任务。

Claude 仍是最明确的目标。Anthropic 已将编程和持续性的计算机工作塑造成 Claude 的核心定位,而 Google 则正将 Gemini 接入其庞大的云服务与生产力工具版图。阿里巴巴如今认为,这一层级的能力不再是美国实验室的专属。

这一论断具有战略分量,但基准测试上的对等并不等于实际运营中的对等。不同的时间限制、token 预算、工具和评分规则,可能带来截然不同的结果。真正的考验在于,Qwen 是否能以可预测的成本、速度和失败率完成有实际价值的工作。

阿里巴巴实际发布了什么

Qwen3.8 将阿里巴巴的叙事重点从回答难题转向完成长期任务。

阿里巴巴将 Qwen3.8 推出为一个面向编程、专业工作、研究和长程智能体任务的模型家族。长程任务要求模型在大量行动、工具调用、观察和修正过程中维持既定计划。

官方 Qwen3.8 repository 表示,该模型提升了自主规划能力以及对环境反馈的处理能力。它还支持可调节的推理强度,让开发者能够控制模型在响应前投入多少计算资源。

这一定位很重要。大多数常见 AI 评估会给出一个边界明确的提示,并期待得到一个答案。智能体则会接收更宽泛的目标,选择中间行动,检查结果,并在出现失败时调整方法。

据阿里巴巴介绍,一项内部实验要求 Qwen3.8-Max 复现一篇数学研究论文中的实验。据称,该模型在无人干预的情况下工作了约 125 小时,随后还对原始工作提出了改进建议。

另一项展示任务涉及芯片设计。这些案例旨在证明持久性与协调能力,而不只是事实记忆能力。它们也类似于 Anthropic 用来将 Claude 定位为严肃知识工作系统的复杂任务。

阿里巴巴将 Qwen3.8-Max 称为该系列中最强的模型。该公司还发布了 Qwen3.8-2.4T-A95B,这是一款开放权重的混合专家模型,拥有 2.4 万亿总参数,每个 token 激活其中的 950 亿参数。

混合专家模型会将每个输入路由到网络中经过选择的一部分。这样的设计可以提供极大的总体容量,同时避免在每一步激活所有参数。

开放发布使 Qwen 的战略区别于纯封闭式 API 路径。开发者可在适用的许可条款下检查、调整和运行已发布的权重。Qwen3.8-Max 本身也可通过阿里巴巴服务和兼容的 API 格式获取。

阿里巴巴此前发布的 Qwen3-Max 已经展现出这一方向。其官方 model overview 介绍了一款拥有超过一万亿参数、在 36 万亿 token 上训练的模型,并强调了编程、工具使用、长上下文和智能体性能。

Qwen3.8 进一步推进了这项战略。阿里巴巴正在就持续执行能力提出明确主张,而这一领域正是高端模型日益争夺企业需求的战场。

因此,与 Claude 的头条比较并不只建立在单一排行榜位置上。阿里巴巴希望开发者相信,Qwen 能够接手一个规模可观的项目,并在无需持续人工救场的情况下不断推进。

这正是此次新闻背后的关键变化。一家中国模型提供商不再只是宣称其系统能回答相同的问题,而是在宣称该系统能完成同一类工作。

为什么长时间运行的智能体会改变竞争格局

竞争如今围绕可靠的任务完成能力展开,这直接给 Anthropic 和 Google 的企业战略带来压力。

Anthropic 围绕软件开发和基于计算机的工作建立了 Claude 近期的大部分势头。接入智能体框架后,Claude 可以检查代码库、编辑文件、运行命令、分析错误,并持续完成多步骤编程任务。

Google 则通过 Gemini 模型、Google Cloud、Workspace 和开发者基础设施切入同一市场。它的优势在于覆盖企业已经在使用的各类工具,从文档和电子邮件到数据平台与云服务。

阿里巴巴带来了不同的组合。它运营大型中国云平台,开发 Qwen 模型,提供办公软件,并投资于自有的 AI 基础设施。这为其将模型能力转化为持续使用提供了多条路径。

这正是 Anthropic 与 Google 的比较为何比单独的基准胜利更重要。三家公司都希望其模型成为软件开发、研究、办公流程和企业运营中的推理层。

一个只能工作几分钟的模型可以协助完成任务。一个能可靠运行数小时甚至数天的模型,则能承担项目中具有实际意义的一部分责任。这一区别改变了企业可能自动化的范围。

设想一名开发者要求智能体更新一个成熟应用。工作可能需要阅读数百个文件、定位依赖项、修改代码、运行测试、追踪故障,并准备文档。成功取决于在整个流程中保持上下文。

研究工作也有类似需求。智能体可能需要寻找论文、复现实验计算、比较方法、记录相互冲突的证据,并修改报告。如果流程在数小时后悄然偏离方向,那么再流畅的初始回答也价值有限。

这些工作流奖励持久性,但持久性也会成倍放大风险。在流程开始阶段形成的错误假设,可能污染之后数十个步骤。更长的执行时间也会创造更多安全问题、计算浪费和看似可信却错误的输出机会。

这种张力赋予阿里巴巴发布的重要性。如果 Qwen 能在现实约束下实现类似 Claude 的完成率,采购方就会多一个可信的智能体系统供应商。如果它只能借助异常宽松的测试预算取得亮眼结果,这一比较就会被削弱。

由于阿里巴巴直接将 Claude 作为能力参照,Anthropic 面临的竞争压力最为直接。Google 同样承压,因为 Gemini 正在争夺相同的企业工作流和云服务支出。

开放权重还增加了另一层维度。一些组织希望在自身基础设施内运行模型、自定义行为,或对敏感数据保留更多控制权。接近封闭模型性能的 Qwen 模型,可能让这一选择更具可行性。

开发者仍需比较部署要求、治理控制、安全性和支持服务。开放权重不会自动带来更容易或更安全的系统。不过,它确实扩大了技术与商业选择的范围。

对于知识工作者而言,重要的发展并非一个新的聊天界面,而是多种模型家族都有可能管理大量延展性材料,并产出可审计的交付成果。

这使得来源组织变得愈发重要。知识融合 工作流可以在团队评估不同模型输出时,让内部材料保持可访问状态。模型可以更换,而组织的工作上下文仍由自身掌控。

Anthropic 与 Google 的领先地位如今面对阿里巴巴全栈挑战

阿里巴巴正以协调一致的模型、云、软件和半导体战略挑战美国领先者。

核心竞争是阿里巴巴与 Anthropic、Google 在长程智能体工作中的模型领先地位之争。Claude 和 Gemini 分别属于不同公司、是不同产品,但它们共同构成了阿里巴巴意图挑战的美国参照基准。

Anthropic 拥有专注的模型业务、强劲的开发者采用率,以及以高要求推理和编程任务为中心的声誉。Google 则拥有深厚的研究实力、全球基础设施、消费级分发渠道和成熟的企业客户关系。

阿里巴巴的回应是垂直整合。该公司可以将 Qwen 连接到 Alibaba Cloud、办公产品、消费者服务和本土开发的计算基础设施中。每一层都能强化其他层。

在 Qwen3.8 到来之前,这种全栈路径已变得更加清晰。5 月,阿里巴巴宣布推出 Qwen3.7-Max,同时发布新的云系统和 Zhenwu M890 AI 处理器。

阿里巴巴表示,一项内部测试让 Qwen3.7-Max 连续工作 35 小时,进行了超过 1,000 次工具调用,并开发出一个计算内核。该公司称,这一产出超过了芯片制造商的版本,但该结果尚未获得独立验证。

同一份 agent infrastructure 公告介绍了一台包含 128 个 AI 加速器的服务器。阿里巴巴还表示,其 Zhenwu M890 芯片配备 144 GB 片上内存,性能是前代产品的三倍。

这些数字表明阿里巴巴认为市场正走向何方。智能体会产生不规则但持续的需求,因为它们会反复调用模型、检索信息、运行工具并检查输出。为这类工作负载提供服务,需要的不只是训练出一个强大的模型。

垂直整合的供应商可以协同优化硬件、推理软件、模型行为和云调度。它还可以利用模型需求支持云业务增长,同时由云客户提供能改进智能体产品的工作负载。

Anthropic 采取更偏重合作伙伴的基础设施模式。Google 已经控制着自己的加速器和云平台,因此在结构上更接近阿里巴巴。关键区别在于,阿里巴巴可以针对中国市场及硬件限制进行优化。

美国出口管制限制了中国获得部分先进芯片的渠道。这种压力促使中国企业提升模型效率、丰富硬件来源,并开发本土半导体替代方案。

因此,阿里巴巴的模型发布传递了两层信息。第一层关乎能力:Qwen 可以与领先系统竞争。第二层关乎韧性:阿里巴巴能够在不依赖美国全部技术层的情况下,交付日益完整的 AI 技术栈。

这并不意味着这些技术栈已经等同。Anthropic 和 Google 受益于广泛的国际开发者社区、全球云区域、成熟的企业项目,以及与被广泛采用软件之间的集成。

阿里巴巴还面临着在本土市场之外赢得信任的挑战。企业采购方会在评估基准性能的同时,审视数据驻留、合规性、支持服务、采购风险和地缘政治风险。

然而,在中国,Alibaba 的分发能力可以迅速将技术进步转化为实际使用。云客户、商家、开发者和办公用户早已在其业务网络的不同环节中开展工作。

结果是一场双层竞争:模型实验室比拼编程和推理得分,科技集团则竞争谁能将这些能力大规模部署。

Alibaba 无需击败每一种 Claude 或 Gemini 配置,也能改变市场。它只需建立足够的可信度,让开发者愿意测试 Qwen、企业愿意在供应商之间展开谈判、竞争对手不得不回应其发布节奏。

这本身已经构成一种压力。当多个系统能够在不同的运行条件下完成相似任务时,“前沿”的定义就变得更加困难。

基准测试头条未能展现的内容

Alibaba 的说法仍属暂定结论,因为当评估者改变时间、token 和工具限制时,模型排名可能发生逆转。

基准测试是一种旨在让系统之间可比较的标准化测试。Agent 基准测试更难解读,因为模型的结果取决于其周边测试框架、获准使用的工具、推理预算和执行时间。

据报道,Alibaba 的发布材料为部分编程测试设置了五小时超时限制。用于衡量复现 AI 研究尝试的 PaperBench,则允许部分运行持续长达 12 小时。

一项在基准测试分析中讨论的独立评估,采用了 45 至 60 分钟的实际时间限制。在这一更严格的约束下,据报道,Qwen3.8-Max 在其最强设置下位列受测组中游。

两种结果都可能反映真实表现。获得更多时间的模型可以检查更多文件、尝试更多修复方案,并从早期错误中恢复。这并不意味着结果无效,但改变了测试所回答的问题。

五小时测试所问的是:在较宽松的执行额度下,模型最终能否完成任务。一小时测试所问的是:它能否在典型的运营期限内创造价值。

Token 预算也会带来同样的问题。推理模型在返回最终答案前,可能生成大量隐藏或中间计算。更高的预算能够提高准确性,但也会增加延迟和资源消耗。

因此,一款模型可能因公开访问条款而显得高效,却会在反复进行、推理密集的尝试中变得昂贵。更有意义的指标往往是每个被接受结果的总成本,其中包括失败运行和人工审查。

基准测试设计同样会影响结果。编程模型在获得熟悉的代码仓库结构、特定工具集,或与其训练相匹配的评估器时,可能表现出色;环境变化时,其性能可能下降。

厂商表格还会带来另一层不确定性。公司可以控制受测模型版本、提示格式、推理设置、采样参数,有时还会控制对比配置。细微的方法选择就可能改变接近的结果。

因此,应准确理解 Alibaba 的说法。该公司称,Qwen3.8-Max 在选定测试和延展演示中达到了类似 Claude 的能力。它尚未证明自己在编程、研究、安全、速度或生产可靠性方面实现普遍对等。

独立测试可以减少这种不确定性,但无法完全消除它。公开排行榜将诸多行为压缩成单一得分,而真实部署取决于具体任务和容错要求。

客服 Agent 必须遵循政策,并避免未经授权的操作。编程 Agent 必须保留测试并保护凭据。研究 Agent 必须区分证据与推断,并保留可用的引用。

适合一种工作流的最佳模型,对另一种工作流可能是糟糕选择。公司应基于具有代表性的任务构建评估,然后衡量完成质量、耗时、资源使用情况和所需的人工干预。

125 小时的研究案例同时说明了希望与担忧。持续自主工作听起来令人印象深刻,但五天时间也为代价高昂的绕路留下了巨大空间。采购方需要知道系统成功的频率,以及审查人员如何发现隐藏错误。

此外还存在安全问题。每一次额外工具调用,都会增加意外变更或敏感信息泄露的机会。长期运行的 Agent 需要权限边界、日志、检查点和停止规则。

这些限制并未抹去 Alibaba 的成就,而是澄清了尚未得到证明的内容。Qwen 已进入与 Claude 同级别的讨论范畴,但结果如今取决于运营层面的证据。

Alibaba 为何能持续参与 AI 竞赛

Alibaba 的云收入和基础设施支出表明,Qwen 关联的是一项大型商业战略,而非短暂的研究项目。

开发这种规模的模型,需要持续投资于芯片、数据中心、网络、能源和工程能力。Alibaba 的财务业绩表明,管理层愿意承受短期压力,以扩展这些能力。

在 2026 年 4 月至 6 月当季,Alibaba 报告称利润同比下降 75%。营收增长 9%,AI 云和算力服务收入增长 45%。

资本支出也增长 75%,至 677 亿元人民币。Alibaba 表示,这笔支出反映了额外算力容量、预期中的 Agent 需求以及更高的组件成本。

季度业绩为理解 Qwen3.8-Max 提供了重要背景。Alibaba 正在押注:AI Agent 将推动持续的云服务消耗。

这一判断使长时间运行的模型具有商业吸引力。跨越数百个步骤运行的 Agent,产生的推理需求远高于只回答一个提示的聊天机器人。如果客户采用这些工作流,Alibaba 可以同时从模型访问和底层基础设施中获利。

这一战略也解释了该公司为何强调完成完整任务。基准测试声望固然有帮助,但完成的工程、研究和办公工作为云客户带来了更清晰的商业案例。

Alibaba 此前承诺在三年内向云和 AI 基础设施投入至少 3800 亿元人民币。它还设定目标,要在五年内实现年 AI 和云收入超过 1000 亿美元。

这些雄心将 Qwen 置于一场更广泛的资本竞争之中。Anthropic 依赖大型基础设施合作关系和投资者支持。Google 则可以通过全球最大的广告和云业务之一为 Gemini 提供资金。

因此,Anthropic 与 Google 的竞争从来不只是技术竞争。算力、客户、分发能力和现金的可得性,决定了各实验室提升模型并将其转化为产品的速度。

Alibaba 拥有规模可观的这些资产。它面临的挑战,是将其转化为可靠的 AI 服务,同时避免基础设施成本压垮回报。

最新业绩揭示了这种张力。AI 云需求正在增长,但更高的投资正压低利润。管理层需要让 Qwen 工作负载变得足够持久,才能证明多年投入的合理性。

企业采用情况将决定这一计算是否成立。大型组织很少会因为一张发布日图表就更换模型。它们会测试安全性、数据处理、正常运行时间、集成工作量以及模型在内部任务上的表现。

开发者也会评估周边体验。API 兼容性能降低切换阻力,但文档、可观测性、工具支持和错误处理会影响模型能否持续留在生产环境中。

开放模型能够将 Qwen 的影响力扩展到 Alibaba 托管服务之外。该公司在 8 月发布了拥有 2.4 万亿参数的 Qwen3.8 模型权重,随后又发布了较小的 270 亿参数模型。

这一范围支持不同的采用路径。大型运营方可以考察高容量系统,而较小团队可以试验资源需求更低的模型。

工程知识库也能降低对单一供应商的依赖。团队可以保留文档和项目上下文,然后针对相同的内部材料测试多个模型。

这很重要,因为模型领先地位变化很快。完全围绕单一供应商独特接口构建的工作流,迁移成本可能很高。拥有受控数据和清晰评估的工作流,则能更容易地应对竞争变化。

Alibaba 的财务承诺表明,Qwen 将继续成为推动这些变化的系统之一。即使它与 Claude 的比较被证明过于宽泛,该公司仍拥有持续缩小差距的资源和商业动力。

将检验 Alibaba 的 Claude 说法的三项信号

下一轮判断应来自可比的 Agent 测试、生产环境采用情况,以及 Anthropic 或 Google 的直接回应。

第一个信号是匹配条件下的独立评估。Qwen3.8-Max、Claude 和 Gemini 需要面对相同任务、工具、时间限制、token 额度和重试政策。

这是检验 Alibaba 核心主张最快的方式。如果 Qwen 在受控的编程和研究工作负载中仍接近 Claude,对等说法就会更具可信度。如果它在更严格的限制下排名大幅下滑,发布叙事就会被削弱。

评估者不应只公布通过率,还应报告耗时、模型调用次数、总 token 数、失败类别,以及需要人工干预的任务数量。

尤其是长期运行的任务需要检查点分析。经过反复走错路后才完成最终任务的模型,与遵循稳定计划的模型并不相同。两者可能得到相同的通过标记。

第二个信号是持续的生产环境采用。Alibaba 需要证明,组织正在将 Qwen Agent 用于重复性工作,而不只是用于受控演示。

有价值的证据包括已完成的软件变更、研究工作流、办公流程和支持运营。最有说服力的案例将披露审查要求、错误率和可量化的时间节省。

云收入提供了另一个采用指标。AI 云业务持续增长,意味着客户可能正从模型试用转向消耗大量基础设施资源的工作负载。

投资者仍应区分总体云需求和 Qwen 特定采用情况。训练项目、存储和传统推理都可能增加收入,却无法证明长周期 Agent 能够可靠运行。

第三个信号是竞争回应。Anthropic 可以通过改进 Claude 的任务完成能力、安全控制或效率来巩固自身地位。Google 则可以通过 Gemini 更新,以及与其云和生产力产品更深入的整合来回应。

回应不必直接提及 Alibaba。新的 Agent 基准测试、更长的自主运行、较低的失败率或更广泛的企业控制能力,都将显示竞争正走向何方。

这正是 Anthropic 与 Google 之间压力变得可见的地方。当领先者在竞争对手发布后改变产品优先级时,即使竞争对手尚未赢得决定性的基准测试,它也已经影响了市场。

开发者应关注 Agent 框架是否让模型更易于替换。Qwen 支持常见 API 格式和流行部署工具,这可以降低并行测试的成本。

企业也应关注治理功能。随着 Agent 保持活跃的时间更长,权限、审计记录、执行限制和人工审批关卡将变得更加重要。

美中维度仍将持续存在,尤其是在芯片、模型访问和数据规则方面。不过,若只将这一事件视作国家之间的竞争,就会忽略采购方真正面临的实际问题。

眼下的问题是,另一套模型家族能否以可接受的可靠性完成具有重要影响的工作。Alibaba 表示,Qwen 现已进入这一评估范围。该说法究竟在多大程度上成立,仍需由独立证据来检验。

对开发者而言,下一步很明确:挑选若干具有代表性的项目,设定完全相同的约束条件,并比较被实际接受的成果,而非打磨精致的演示。还应纳入需要从缺失文件、错误假设和工具故障中恢复的任务。

对知识工作者而言,应保留每次长时间运行背后的资料来源和决策过程。相比附有透明证据、可供审查的较短结果,一份没有审查记录的长答案更难令人信服。

Alibaba 让 Anthropic 与 Google 之间的竞争更加拥挤,也更难用一张排行榜概括。Qwen3.8-Max 现在必须将雄心勃勃的主张转化为可重复验证的工作成果。

当时间、工具和推理预算保持一致时,独立测试能否复现 Alibaba 的结果?真正能说明 AI 格局是否已经发生转变的,是这个答案,而不是发布时的 headline。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page