Alibaba 将 DeepSeek V4 Pro 加入 Qianwen Office,但 GLM-5.3 仍未获验证
- Sophie Larsen

- 3天前
- 讀畢需時 13 分鐘
据报道,Alibaba 于 8 月 15 日向 Qianwen Office 添加了两款模型,在其前沿模型选择器中纳入 DeepSeek V4 Pro 和一款标注为 GLM-5.3 的模型。此举将该产品的旗舰模型阵容扩展至三种选择,其中包括 Alibaba 自家的 Qwen3.8-Max。
这看似只是一次常规的目录更新。但其影响更为深远,因为 Qianwen Office 是一款旨在完成工作的智能体产品,而非仅回答孤立提示词。模型选择因此会影响规划、文档生成、工具使用、可靠性以及整项任务的连续性。
此次发布也立即带来了验证问题。DeepSeek V4 Pro 有其开发者的文档支持,并出现在 Alibaba 自身的模型服务资料中。截至 8 月 16 日,GLM-5.3 尚未见到 Z.ai 发布的对应公开发布页面、技术报告或模型卡。
这一缺口并不能证明该模型名称有误或无法使用。但它意味着,读者目前尚无法确定 Qianwen Office 中的这一选项究竟代表一款新的公开模型、有限部署、合作伙伴预览,还是内部路由名称。
因此,核心竞争并非 Alibaba 对阵 DeepSeek 或 Z.ai,而是便捷模型选择的承诺与验证每项选择实际交付能力之间的运营现实之争。
Alibaba 在 Qianwen Office 中做了哪些调整
Qianwen Office 正在成为面向已完成工作的模型路由器,Alibaba 则掌控着用户与多个中国旗舰模型之间的界面。
根据一篇 Qianwen Office 报道,用户可在产品首页的前沿模型选项中选择 GLM-5.3 或 DeepSeek V4 Pro。据报道,此次更新于 8 月 15 日生效。
Alibaba 此前已通过同一产品引入 Qwen3.8-Max。新增两个外部模型家族后,报道中的前沿模型阵容达到三种。
面向用户的变化很简单:用户在一个工作空间中开始,选择模型,然后要求智能体完成任务。产品可在切换负责推理与生成的模型时,保留其周边工作流。
这一设计将聊天机器人界面常常混合在一起的两个层面分开。Qianwen Office 提供工作空间、工具、任务编排和呈现方式;所选模型则提供大部分底层语言与推理行为。
这种分离很重要,因为智能体不只是一个文本框。它能够理解源材料、规划步骤、调用工具、修订结果,并交付文档或其他工作成果。
一款模型即使能产出更出色的首个答案,也可能在长时间的工具调用序列中表现不佳。另一款模型的文笔或许没那么优雅,却可能更稳定地遵循约束。第三款模型则可能在处理大量源材料时不遗漏重要细节。
提供多个模型,让 Alibaba 能够吸收这些差异,而无需让用户离开其产品。它也让公司得以了解用户在特定任务中会选择哪些模型。
这些使用数据可以为路由、界面设计和未来集成提供参考。它们也能揭示用户何时更偏好外部模型,而非 Alibaba 自己的旗舰模型。
据报道的 GLM-5.3 选项是此次更新中最不寻常的部分。Z.ai 的公开资料将 GLM-5.2 记载为其最新公布的旗舰模型,而报道中的 Qianwen Office 选择器使用了一个更新的名称。
有限的合作伙伴发布是一种合理解释。分阶段推出或产品专用标识符则是另一种。Alibaba 和 Z.ai 均未公开确认这些解释。
DeepSeek V4 Pro 则是另一种情况。它拥有明确的公开身份、已发布的规格、开放权重和官方 API 文档。它的加入扩大了访问范围,但没有带来同样的命名不确定性。
因此,此次更新包含两个故事:Alibaba 正在办公智能体中拓宽模型选择,同时其界面在至少一款所列模型的公开文档之前走得更快。
Alibaba 为何将竞争对手模型置于 Qwen 之侧
Alibaba 正将模型访问视为一种分发策略,即使这意味着要把竞争对手放在 Qwen 旁边。
单模型助手要求用户接受一家公司对每项任务的判断。多模型产品则将这一决定更贴近用户,或者最终交由自动路由器完成。
这种方式更像云计算,而非传统软件套件。云平台销售第一方和第三方服务的访问权限,因为客户活动的价值可能高于对每个组件的独占控制。
Alibaba 已通过其更广泛的模型平台应用了这一逻辑。其官方团队模型目录包括 Qwen、DeepSeek、Kimi、GLM、MiniMax,以及多个媒体生成模型家族。
该目录确认支持 DeepSeek V4 Pro。截至撰写时,它也列出了 GLM-5.2、GLM-5.1 和 GLM-5,但没有 GLM-5.3。
Qianwen Office 将这种聚合策略延伸至面向终端用户的智能体。产品无需要求开发者配置端点,而是可将模型选择简化为一个可见控件。
这种便利性会给独立模型应用带来压力。能够在一个工作空间访问多个旗舰系统的用户,继续在多个网站上维护独立任务历史的理由会更少。
它也会给依赖单一模型提供商的办公软件厂商施压。如果模型性能每隔几周就发生变化,紧密耦合的产品便可能继承其唯一供应商的弱点。
Alibaba 的做法提供了一种对冲。当一款模型在编程方面提升,另一款在长上下文研究方面提升,还有一款在文档制作方面提升时,界面可以呈现各自的优势。
然而,长长的菜单并不等于有用的决策系统。多数知识工作者不想在起草报告前研究模型卡。他们希望产品能为任务推荐可靠的选项。
因此,Qianwen Office 最强的形态将是有选择地使用模型选择。专业用户可以手动选择,而其他用户则可依靠透明的路由和清晰的解释。
这种路由也带来自身责任。Alibaba 需要说明文件是否会离开其基础设施、由哪家提供商处理、数据如何保留,以及工具在不同模型之间是否表现一致。
该公司的模型服务文档称,其团队订阅不会使用对话数据进行训练。这一声明适用于已记录的服务,但用户仍需要了解 Qianwen Office 及每条路由路径的产品专属条款。
企业买家还会希望模型标识符保持稳定。他们需要知道底层版本何时变化、此前的输出是否仍可复现,以及一款模型将保持可用多久。
模型选择器可以让界面看起来很简单,却将复杂性转移到治理层面。Alibaba 支持的提供商越多,这些控制措施就越重要。
这正是此次更新给 Alibaba 带来与其竞争对手同等压力的原因。它主动承担了将不同模型行为转化为连贯工作体验的角色。
DeepSeek V4 Pro 带来了可验证的参考点
DeepSeek V4 Pro 为用户提供了一个有文档支持的基准,可据此评判 Alibaba 的其他前沿选项。
DeepSeek 于 4 月 24 日发布 V4 系列,其中包括 V4 Pro 和较小的 V4 Flash。该公司的 V4 发布说明将 V4 Pro 描述为一款混合专家模型,总参数量为 1.6 万亿,活跃参数量为 490 亿。
混合专家模型会为每个 token 仅激活其网络的一部分。该方法可以在每次计算不使用所有参数的情况下提高总容量。
DeepSeek 表示,V4 Pro 支持 100 万 token 的上下文窗口。上下文窗口是模型在一次请求中能够考虑的输入和生成材料总量。
该公司还提供思考和非思考模式。思考模式会在最终回答前为推理分配额外生成内容,而非思考模式则优先提供更直接的答案。
DeepSeek 的公开材料强调智能体编程、世界知识、数学和科学推理。除非有可比条件下的独立评估支持,否则这些仍属于公司声明。
该模型与办公工作的关联不止于写作。长上下文窗口可帮助智能体审阅大量文档、保留指令,并在复杂任务中维持状态。
这种容量并不保证长上下文表现可靠。模型可以接受大量输入,却仍可能忽略细节、遵循错误证据,或丢失早期约束。
工具使用又引入了另一个失败面。模型必须选择行动、正确格式化请求、理解结果,并判断是否需要进一步行动。
独立审查提供了有用的背景。美国人工智能标准与创新中心在审查 V4 Pro 后发布了一份 DeepSeek 评估。
该评估之所以重要,是因为它将访问与信任区分开来。一款模型可能足以胜任困难工作,但仍需要针对安全性、可靠性和部署风险进行测试。
对于 Qianwen Office 用户而言,DeepSeek V4 Pro 可以作为有文档支持的比较点。其开发者身份、架构概述、发布时间和公开材料均可供查验。
这种透明度并不能说明 Alibaba 如何提供该模型服务。Qianwen Office 可能应用自己的系统提示词、工具、检索层、安全策略和上下文管理机制。
这些周边组件能够显著改变结果。使用相同基础模型的两款产品可能表现不同,因为它们组装提示词、文件和工具的方式不同。
因此,用户不应将模型名称视为完整的性能保证。相关的评估单位是完整系统:模型、智能体循环、工具、文件处理和交付格式。
一种实用的评估方法是向三种选项提供相同的源材料包和任务要求。测试应检查事实准确性、引用质量、指令遵循情况、修订能力以及最终成果的实用性。
延迟同样重要,但速度不应主导办公工作比较。一个需要大量修正的快速答案,可能比一次较慢但可靠的运行消耗更多时间。
DeepSeek V4 Pro 为 Alibaba 提供了一款具有公开规格、广为人知的模型。它也提高了人们对每个相邻选项提供可比文档的期待。
GLM-5.3 这一名称造成了验证缺口
据报道的 GLM-5.3 列表应被视为访问证据,而非一款已有完整文档支持的公开模型发布证明。
Z.ai 已发布大量关于 GLM-5 系列的材料。其 2 月公告称,GLM-5 是一款为复杂工程和长周期智能体任务设计的开放模型。
该公司表示,GLM-5 拥有 7440 亿总参数和 400 亿活跃参数。它还将该模型定位于文档、电子表格、报告和教案等办公交付成果。
Z.ai 随后宣布了 GLM-5.1 和 GLM-5.2。其 GLM-5.2 公告称,该版本支持一百万 token 的上下文,并面向长时间运行的工程工作。
官方发布说明介绍了 IndexShare,这是一种可跨多组层复用稀疏注意力索引器的方法。Z.ai 表示,这能减少处理超长序列时的计算量。
这些细节勾勒出了从 GLM-5 到 GLM-5.2 的清晰发展路径,但并不能证明 GLM-5.3 的规格或发布状态。
截至 8 月 16 日,本文查阅的公开索引 Z.ai 发布说明中并未包含 GLM-5.3 的公告。阿里巴巴已公开记录的团队模型目录也止于 GLM-5.2。
仍存在多种可能的解释。Z.ai 可能向阿里巴巴提供了早期访问权限;阿里巴巴可能正在更广泛发布前测试该模型;界面也可能使用了合作伙伴专用别名。
目前尚无依据能将其中任何一种解释认定为事实。缺少文档应当被视为不确定性,而不应成为传言的证据。
这种区别很重要,因为版本号会形成预期。用户有理由认为,更高的版本号代表更新的模型,并具有可识别的变化。
没有模型卡,用户无法确定训练数据截止时间、架构、上下文限制、安全评估、许可证或预期用途,也无法将基准测试方法与早期版本进行比较。
对于商业使用而言,这种不确定性会更加严重。团队可能会将机密源材料交给智能体处理、依赖其结果,并在日后需要说明这些工作是如何产出的。
可见的模型名称,只有在它对应一个稳定且有文档记录的系统时才有帮助。否则,审计记录保存的只是一个标签,而非其含义。
阿里巴巴可以通过一份简明的发布说明弥补大部分缺口。说明应明确提供商、准确模型版本、可用范围、路由行为以及相关数据条款。
Z.ai 则可以通过模型卡或产品公告提供剩余的技术信息。这些材料应区分公司内部基准测试与独立测试结果。
这一缺口同样重要,因为 Z.ai 曾公开记录过真实的服务问题。今年 4 月,该公司描述了在高并发、长上下文工作负载下出现的 GLM 服务问题,包括乱码、重复内容和罕见字符。
Z.ai 将这些故障归因于基础设施中的竞态条件,而非模型习得的行为。该公司表示,已发现并修复了多个底层 bug。
这一披露很有价值。它表明,尤其是在智能体大规模处理长任务时,服务系统与模型检查点同样重要。
它也提醒我们,不能因为出现新的模型标签,就假定生产体验一定更好。新能力可能会暴露新的基础设施限制。
千问 Office 用户应将 GLM-5.3 视为一个据报道可供选择、但公开身份信息仍不完整的选项。测试能够揭示其行为,但不能取代正式披露。
模型选择将风险转移到智能体层
只有当周边产品能够让不同系统变得可预测、可比较且可治理时,多模型智能体才能成功。
模型多样性可以提升韧性。如果一家提供商发生故障或性能回退,产品可以将工作路由到其他服务。用户也可以让模型与任务相匹配。
但每增加一个模型,就会带来更多差异。对 Qwen 效果良好的指令,可能会让 DeepSeek 产生不同的工具调用。为 GLM 调优的工作流,也可能需要不同的上下文管理方式。
智能体层必须吸收这些差异。它应验证工具输入、保留任务状态、检测未完成的工作,并清晰呈现故障。
文档创建就是一个具体例子。用户可能提供会议纪要、财务报表和报告模板,然后要求生成一份董事会备忘录。
模型必须识别相关事实,并将其与观点区分开来。智能体则必须检索文件、管理上下文、创建文档并保留格式。
一份强有力的初稿还不够。系统应让引用可追溯、避免无依据的计算,并在用户要求修订时做出正确响应。
在该工作流中切换模型会带来棘手的问题。新模型是否获得完整的任务历史?它是否能看到之前的工具输出?它能否理解由早期模型创建的产物?
千问 Office 可以通过维护模型无关的任务状态来降低这些风险。该状态将在任一模型的对话之外,保留目标、源引用、已完成操作和未解决问题。
产品还需要一致的安全边界。模型切换不应悄然扩大文件访问范围或工具权限。
对于企业使用,管理员会希望能够控制获批准的模型和数据位置。法务团队可能允许某一家提供商处理公开研究,但禁止其处理客户文档。
采购团队会问,故障发生时应由阿里巴巴还是底层提供商负责。安全团队会问,每个文件被发送给了哪项服务,以及内容被保留了多久。
这些并非次要问题。它们决定了一个便捷的模型选择器能否从个人试验走向可重复的组织工作。
评估也必须在工作流层面进行。传统基准测试只隔离评估狭窄能力,而办公智能体结合了检索、推理、工具使用和呈现。
内部测试集应包含具有代表性的任务和已知答案。团队随后可以衡量事实错误、遗漏要求、无效引用、工具故障和修正时间。
对于重要输出,人工审查仍然必不可少。模型选择器应帮助用户选择起点,而不是鼓励他们将生成结果视为自动验证过的成果。
知识工作者可以通过让源材料与生成结论保持关联,改善自己的审查流程。结构化的 AI 知识库可以帮助跨工具保留这条证据链。
更大的教训很直接:当界面将差异转化为有用的专业化能力时,模型选择便能创造价值;当名称变化快于文档和控制机制时,它就会制造混乱。
阿里巴巴具备构建这一抽象层的有利条件,因为它既运营着重要的模型家族,也拥有广泛的云平台。其千问 Office 的推出将检验它能否让外部模型显得可靠,同时不掩盖重要差异。
三个信号将显示阿里巴巴的战略是否奏效
下一阶段取决于文档、可衡量的用户行为,以及三模型阵容中一致的结果。
第一个信号是 GLM-5.3 的官方披露。阿里巴巴或 Z.ai 应发布一份说明,将千问 Office 中的标签与具体模型及其可用状态关联起来。
公开模型卡将进一步增强这一判断。它应说明上下文容量、预期任务、评估方法、局限性,以及该模型是否已普遍可用。
如果这类文档很快出现,当前的缺口将更像是一次协调进行的早期发布;如果它持续缺失,企业应将该选项视为身份不稳定的实验性服务。
第二个信号是千问 Office 是否开始按任务推荐模型。静态菜单只能证明阿里巴巴能够整合多个端点,不能证明大多数用户能从这种选择中受益。
基于任务的推荐将表明,阿里巴巴已收集到足够证据来区分模型行为。透明的自动路由则代表更进一步的能力。
该公司应以实用的方式解释这些推荐。用户需要的是诸如更好的源材料综合、更可靠的文档创建,或更强的长时间工具使用能力等指导。
他们不需要无法解释的排名,也不需要某一模型在所有情况下都最佳的说法。模型行为会随提示词、工具、上下文长度和服务配置而变化。
第三个信号是生产环境的一致性。用户应关注工具调用失败、引用缺失、格式错误、长任务回退,以及模型更新后无法解释的变化。
阿里巴巴的模型目录显示,正式模型标识符可以更改,或路由至较新版本。这种做法可以简化升级,但会使可复现性变得更复杂。
千问 Office 应暴露足够的版本信息,使严肃用户能够重建重要工作。至少,导出内容应保留所选模型、日期、任务输入和源引用。
竞争对手的反应也将很重要。独立提供商可能会深化自己的办公智能体功能,其他平台则可能增加更广泛的模型菜单。
不过,决定性指标并非显示了多少模型,而是用户是否能以更少的修正完成更多工作,并留下更清晰的证据链。
据报道的 8 月 15 日更新,为阿里巴巴提供了一个早期机会来定义这一标准。DeepSeek V4 Pro 带来了具备长上下文和智能体能力、已有文档记录的旗舰模型。Qwen3.8-Max 则为阿里巴巴提供了第一方锚点。
GLM-5.3 仍是这一阵容中尚未解决的部分。它的出现可能意味着获得了即将发布模型的优先访问权,但公开证据尚不足以证明这一解释。
目前,用户应以相同的真实任务测试这三种选择,持续关注敏感数据政策,并记录每项结果由哪个系统生成。最有用的问题不是哪个模型的版本号最高,而是哪一套完整工作流能够产出可靠、可由人验证的工作。


