top of page

Alibaba 的 Qwen3.8 Preview 提振科技股,但其最大主张仍未经验证

8月12日
讀畢需時 15 分鐘

Alibaba 推出了拥有 2.4 万亿参数的 Qwen3.8-Max-Preview,Google News 很快转载报道称,该模型推动中国科技股走高。

市场报道,Alibaba 在香港上市的股票在公告后最高上涨 5.4%。其他报道则根据不同交易时段,将其收盘涨幅定在约 3% 至 4% 之间。受市场预期北京将推出更多经济支持措施带动,恒生指数也同步上涨。

该模型公告为这波上涨提供了一个颇具说服力的解释。Alibaba 称 Qwen3.8 是当前最强大的 AI 系统之一,据报道其排名仅次于 Anthropic 最新旗舰模型。然而,这一预览版并未提供足以独立验证该比较所需的技术证据。

这一缺口才是故事的核心。Google News 展现了 Alibaba 的模型主张如何迅速演变为市场叙事,但并未证明 Qwen3.8 能否在生产环境中维持其宣称的表现、吸引开发者,或带来可盈利的云服务需求。

眼前的对手不只是 Anthropic。Alibaba 还在应对市场对 AI 投资可量化回报的要求。大型模型可以吸引关注,但云收入、运营成本、开发者采用率和持续使用情况,决定了这些关注是否具有长期价值。

Alibaba 实际发布了什么

Alibaba 发布的是一款规模异常庞大的预览模型,而非一套完整的技术优越性论证。

Qwen3.8-Max-Preview 于 7 月亮相,成为 Alibaba Qwen 系列的最新旗舰产品。报道将其描述为多模态模型,这意味着它可处理包括文本、图像、视频和文档在内的多种数据格式。

其宣称的 2.4 万亿参数让标题数字很容易理解。参数是在训练期间调整的数值,但其总量并不能直接衡量智能程度或效率。模型架构、数据质量、训练方法、激活参数以及推理设计,同样会塑造模型表现。

据报道,Alibaba 在上海世界人工智能大会期间推出了该预览版。公司先通过部分编程和云服务提供访问,之后才会发布可下载的模型包。

公司将 Qwen3.8 定位为前沿系统,并表示后续将开放权重。开放权重允许外部开发者下载模型已学习到的数值,但须遵守最终许可证和使用条件。

这一承诺很重要,因为 Qwen 的影响力很大程度上来自开发者能够检查、适配和部署的模型。这也使 Qwen 的战略区别于那些仅通过托管接口提供其领先系统的供应商。

然而,开放权重承诺并不等于开放权重发布。在预览阶段,开发者尚未获得完整检查点、最终许可证、模型卡和可独立复现的评估包。

模型卡通常记录模型能力、测试方法、已知限制和适用场景。缺少模型卡会使比较变得困难,因为一个醒目的排名可能在未披露权重的情况下混合了互不相关的测试。

Alibaba 起初也没有公布足够的架构细节,来说明每次请求会激活多少参数。大型混合专家模型会将每个输入路由至选定组件,因此总参数量与激活参数量可能存在显著差异。

这种区别会影响速度、内存需求和运营成本。一款拥有数万亿总参数的模型,可能在每次响应中只使用其中一部分。缺乏这些信息时,标题数字对实际部署几乎说明不了什么。

开发者确实在 Alibaba 的生态系统内发现了该预览版。公开报道和问题讨论显示,它支持长上下文和侧重推理的运行方式,但这些观察不能替代受控的技术文档。

早期软件集成也暴露了兼容性问题。一项公开的 Qwen Code 问题描述称,当内部操作尝试在一款必须启用推理的模型上关闭推理时,操作会失败。这是预览阶段的常见问题,但也说明生产就绪不只是获得访问权限那么简单。

因此,这次发布改变了两件事。Alibaba 将一款更大的旗舰模型推向用户面前,并以广泛的性能主张向竞争对手发起挑战。

它没有改变的,则是举证责任。在可复现的基准测试和部署细节公布之前,Qwen3.8 仍是一款重要的预览模型,其性能表现尚待验证。

为什么 Google News 将预览版变成了市场事件

Google News 放大了一个简洁的投资叙事,尽管当时有多种力量同时推动中国股票上涨。

这一公告为交易者提供了一条熟悉的推理链。更强的 Qwen 模型可能吸引开发者、增加推理活动,并将更多工作负载带入 Alibaba Cloud。

推理是训练完成的模型生成答案时所使用的计算过程。每一次编程请求、文档分析或智能体操作都会消耗基础设施,从而在模型采用与云收入之间形成潜在联系。

Alibaba 已经拥有这些基础设施。它还在电商、支付、物流和消费者服务领域拥有分发渠道。因此,投资者可以想象一条从模型改进通向企业使用和消费者应用的路径。

相比没有云能力或客户触达渠道的公司发布模型,这一路径更具可信度。Alibaba 可以将 Qwen 与其云平台 Model Studio、编程工具和商业应用打包提供。

公司的财务动能也为这一解读增添了分量。Alibaba 报告称,Cloud Intelligence Group 在 1 月至 3 月季度的收入达到 416 亿元人民币,同比增长 38%。

根据 Alibaba 的财务文件,AI 相关产品收入连续第 11 个季度保持三位数年度增长。这一纪录为模型叙事提供了投资者可以衡量的趋势支撑。

但更广泛的财务状况仍然复杂。Alibaba 当季总收入仅增长 3%,至 2430 亿元人民币,同时录得 8.48 亿元人民币的经营亏损。

同一份季度业绩显示了为何 AI 热情与利润担忧可以并存。云需求加速增长,但技术投资也推高了支出。

Alibaba 还承诺将在三年内至少投入 3800 亿元人民币,用于云和 AI 基础设施。这项承诺带来更多产能,但也提高了未来获得可接受回报所需的收入规模。

投资者并非孤立地对 Qwen3.8 作出反应。中国股票同样受益于市场对政策制定者将推出支持经济增长措施的期待。利率决策以及围绕政治局会议的预期,也影响了同一交易时段。

这使归因变得困难。Alibaba 更大的涨幅表明模型确实发挥了作用,但整个市场的上涨也表明它并非唯一催化剂。

Google News 的聚合机制可能将这些相互作用的原因压缩成一个标题。模型出现,科技股上涨,这两个事实便形成了直接叙事。

这种叙事有用,但并不完整。市场往往会将一项显眼公告与由多重交叠预期推动的走势联系起来。

还有一个时间问题。被引用的 Finimize 标题在最初 7 月预览发布数周后,重新出现在 Google News 中。8 月 12 日看到它的读者,完全可能将其理解为一项新公告。

但底层事件已经发生了一段时间。这个延迟很重要,因为 Alibaba 的开放权重计划、许可报道和开发者反馈,都在最初市场反应之后发生了变化。

对于读者而言,教训并非 Google News 不可靠,而是聚合时间戳、发布时间戳和事件时间戳可能描述的是不同的时刻。

当一场短暂的股价波动构成文章的核心证据时,这一区别至关重要。模型发布可以影响一个交易时段,却不能解决随后的投资逻辑问题。

Qwen3.8 令 Alibaba 的云战略承压

这款更大的模型提高了市场对 Alibaba Cloud 的预期,但并未更快解答盈利能力问题。

Alibaba 希望投资者将 Qwen 视为不止于研究项目。该模型家族支撑着一项更广泛的战略,涵盖云基础设施、托管 AI 服务、开发者工具和应用。

这项战略已经带来可见增长。Alibaba 表示,其财年最后一个季度的云收入增长加速至 40%,其中 AI 相关产品占该收入的 30%。

公司预计,AI 模型和应用服务的年化经常性收入将在 6 月季度超过 100 亿元人民币。公司还设定了年底达到 300 亿元人民币的预期。

年化经常性收入将当前经常性销售的速度折算为年度数字。它表明增长动能,但并不等同于已确认的年度收入或利润。

Alibaba 设定了更大的目标,即五年内 AI 与云业务合计收入超过 1000 亿美元。CEO Eddie Wu 将这一目标与他所称的 AI 需求指数级增长联系起来。

这些目标使每一次 Qwen 发布都成为一项财务承诺的一部分。如果 Qwen3.8 吸引到有意义的使用量,Alibaba Cloud 最终应展现出更强的消费额、经常性收入或客户留存。

挑战在于,领先模型的训练和运行成本可能很高。更多需求可能提升收入,同时也需要更多处理器、网络设备、电力和数据中心容量。

Alibaba 的资本承诺表明,管理层接受了这一权衡。投资者仍需要看到收入能够比相关折旧和运营成本增长得更快的证据。

竞争又增加了一层复杂性。Baidu、ByteDance、Tencent、DeepSeek、Moonshot AI、Zhipu AI 和 MiniMax 都参与中国模型市场。其中多家公司可以通过成熟业务或投资者资金补贴 AI。

云服务商可以降低模型价格以吸引工作负载。开放权重模型的开发者可以在竞争对手的基础设施上运行模型。客户也可以将工作负载分配给多家供应商,以降低依赖风险。

因此,Qwen 的普及并不保证 Alibaba 能获取其采用所创造的每一美元价值。开发者可能在另一家云平台、私有服务器或本地硬件上使用 Qwen 权重。

这也解释了有关 Alibaba 考虑为最终开放权重模型的大型商业用户设置收入分成条件的报道。这类条款将是试图在 Alibaba Cloud 之外,通过模型采用实现变现的做法。

然而,更严格的商业条件可能削弱 Qwen 的一项优势。开发者重视开放权重模型,部分原因正是它们提供部署自由和可预测的控制权。

若许可证要求获取下游收入的一部分,就需要明确的定义、执行规则和门槛。在 Alibaba 公布最终条款之前,开发者无法计算这一风险。

这种张力很直接。广泛开放可以扩大 Qwen 生态系统,而更严格的商业化可以提高 Alibaba 的直接回报。要同时实现两者,需要一份开发者认为切实可行的许可证。

公司还必须将试验转化为持久的工作负载。预览访问或许能带来基准测试和社交媒体关注,却未必能形成长期的生产使用。

企业买家的决策速度更慢。在迁移关键应用前,他们会评估可靠性、安全性、合规性、支持、数据驻留和总体运营成本。

因此,Qwen3.8 必须赢得两场不同的竞争。它既需要具备足够好的表现来吸引开发者尝试,也需要足够稳定可靠地运行,让组织持续为其付费。

Alibaba 的云业务增长表明,这一路径已经存在。新模型扩大了机会的规模,但也抬高了市场对未来业绩的预期。

基准测试主张仍缺乏公开验证

由于预览版本缺少足够证据供外部人士复现,Alibaba 的核心性能主张仍只是公司自身的说法。

报道称,Alibaba 将 Qwen3.8 列为领先模型中仅次于 Anthropic 旗舰模型的产品。对于一个被定位为最终将以开放权重形式发布的系统而言,这是一项引人注目的断言。

然而,如果没有公开测试集、评分方法、模型配置和竞品设置,排名本身意义不大。细微的方法选择就可能显著改变结果。

推理模型尤其难以比较。性能可能会随着推理时间、token 预算、工具访问权限、采样设置以及允许尝试次数的不同而变化。

提供商可以通过让模型思考更久来提高分数。但这种提升也可能增加延迟和运营成本,而这些在真实应用中很重要。

多模态评估又带来了额外复杂性。文本、图像、视频和文档任务需要不同的基准测试。将它们合并为单一排名,需要主观权重分配。

独立测试还必须控制数据污染问题。模型可能在训练期间接触过基准测试题目或相近变体,从而产生高估其通用能力的分数。

Alibaba 最初没有为该预览版本提供详细模型卡、完整基准测试表或技术报告。因此,技术分析将其性能主张描述为难以验证。

这种缺失并不意味着该主张是错误的。预览模型常常会在完整文档发布前上线,外部评估者也需要时间来设计公平的比较。

但这意味着市场在技术验证到来前就已作出反应。股价变动衡量的是投资者预期,而非模型质量。

2.4 万亿参数这一数字同样需要放在背景中理解。参数数量可以表明容量,但并不能证明效率、可靠性或实用的推理能力。

规模较小的模型可以通过更好的数据、训练方法、架构和后训练表现优于更大的模型。用户还关心系统在长时间会话中遵循指令的一致性。

智能体工作提供了一项严苛测试。智能体模型会使用软件工具规划并执行多个步骤,而不是回答一个孤立的提示词。

强大的智能体必须保持目标、从错误中恢复、选择合适工具,并避免重复操作。单次回答基准测试可能遗漏这些失败情形。

编程任务提供了另一项有用的衡量标准。开发者需要 Qwen3.8 能编辑真实代码库、理解错误、运行测试,并在多个文件之间保持一致性。

Alibaba 的编程平台可以产生相关的使用数据,但该公司尚未发布足够的生产环境证据来回答这些问题。

预览标签本身也值得谨慎对待。提供商可能会在正式发布前改变模型行为、路由、限制或可用性。从某个预览端点收集的结果,未必能描述可下载模型。

最终的开放权重软件包也可能与托管版本不同。量化、部署配置、安全层和硬件都会影响输出质量。

地缘政治方面也存在不确定性。出口管制限制了中国获取部分先进处理器的能力,而国内供应商正竞相填补这一缺口。

Alibaba 一直在开发一个更广泛的技术栈,将其模型、云服务和自研芯片结合起来。这种整合可能提升独立性,但也使效率证据变得更为重要。

需要稀缺硬件的大型模型可能面临部署限制。采用更低活跃计算量的稀疏架构或许能缓解这些担忧,但 Alibaba 必须披露必要细节。

围绕模型开发的说法也受到审视。Anthropic 指称,与 Alibaba 有关联的运营者使用大量账户提取 Claude 的输出,用于模型蒸馏。

蒸馏是指使用另一个模型的输出训练一个模型。该指控并不能证明 Qwen3.8 是如何构建的,也不应被视为针对新模型的结论。

但它确实增加了对透明文档的需求。Alibaba 可以通过说明训练来源、评估保障措施、架构和独立测试来增强信心。

在这些证据出现之前,负责任的报道应当保留三种表述之间的区别:Alibaba 发布了预览版本,Alibaba 宣称具备前沿性能,以及独立评估者确认了该性能。

市场变动时,只有前两项得到了确认。

Alibaba 与前沿 AI 的经济学较量

Qwen3.8 最重要的对手,是将技术雄心转化为持久收益的成本。

与 Anthropic、OpenAI、Google 和 DeepSeek 的比较之所以吸引读者,是因为它们构成了一场简单的竞赛。然而,投资者最终关心的是每家提供商能够捕获多少经济价值。

Alibaba 带着优势进入这场竞争。它运营云基础设施,拥有企业客户关系,并可将 Qwen 整合到消费者和企业服务中。

它还拥有成熟的开发者生态系统。此前的 Qwen 版本为研究人员和企业提供了可适配的模型,鼓励了更广泛的试验。

开放权重可以加速采用,因为组织能够获得更多部署控制权。他们可以微调模型、在私有环境中运行模型,并调整周边软件。

这种灵活性对于拥有敏感信息的公司尤其重要。相比公共应用程序编程接口,它们可能更倾向于本地或私有云系统。

即使客户需要受控部署,Alibaba 也可能从中受益。它可以围绕模型销售基础设施、支持、托管推理和工具。

然而,每家提供商都希望获得类似地位。Amazon、Microsoft 和 Google 都提供包含多个模型家族的平台。中国云计算公司也在扩展其产品目录和基础设施。

这会对利润率形成压力。如果客户能够切换模型或云服务提供商,底层服务就更容易被议价。

模型改进会进一步加剧这种压力。今天被视为卓越的系统,在另一家提供商发布更便宜或更高效的替代方案后,可能变得普通。

DeepSeek 展示了成本叙事能够多快地重塑市场预期。它的崛起促使投资者质疑,前沿能力是否总是需要达到美国科技巨头所假定的投入规模。

Qwen3.8 则在一定程度上逆转了这一叙事。Alibaba 强调了极高的参数数量,将规模呈现为资产而非负担。

市场现在必须判断,这种规模是否产生了足够多的额外能力。如果性能提升有限、而运营成本大幅上升,那么更大的模型就会更难商业化。

答案会因工作负载而异。一些客户需要最好的推理能力来处理编程、科学分析或复杂智能体任务。另一些客户则可以使用较小模型完成分类、提取或客户支持。

因此,Alibaba 需要的是模型组合,而不是一个通用系统。旗舰模型可以展示雄心,而较小的 Qwen 模型则可承担对成本敏感的生产任务。

其云平台可以在这些选项之间为客户路由。商业价值在于为每项任务匹配准确性、延迟和成本之间恰当的平衡。

这正是为何不应将股价反应解读为对模型规模的裁决。投资者回应的是 Alibaba 有可能提供具备竞争力的完整技术栈。

公司接下来的财报将检验这一信念。云业务增长必须延续,AI 收入必须成为更大的贡献来源,投资成本也必须维持在可控范围。

单个季度无法解决这一问题。基础设施支出会在客户完全消耗产能前先形成容量,因此利润率可能在扩张期间走弱。

不过,投资者需要里程碑。没有这些里程碑,每次模型发布都可能成为与现金流脱节的短暂情绪事件。

Google News 可以在数分钟内呈现发布消息和股价上涨。它无法揭示企业客户数月后是否会续签合同。

这种较慢出现的证据,决定 Qwen3.8 是扩大 Alibaba 的经济地位,还是仅仅证明它仍是模型竞赛中的活跃参与者。

Google News 读者接下来应关注什么

三个信号将显示,Qwen3.8 是持久的平台转变,还是短暂的市场催化剂。

第一个信号是最终的开放权重发布。Alibaba 需要发布可下载权重、模型卡、架构细节、许可证和可复现的评估结果。

宽松且清晰的许可证将强化开发者广泛采用的理由。限制性的收入分成条款或不确定的商业定义则会削弱这一理由。

发布版本还需要与托管预览版本保持一致。开发者将比较输出质量、上下文行为、硬件要求和工具使用情况。

独立评估应随之展开。最有价值的测试将考察代码库、长程智能体工作流、多模态文档和重复运行的可靠性。

仅有排行榜位置还不够。评估者需要披露推理预算和竞品设置,让读者能够比较能力与成本。

第二个信号是 Alibaba Cloud 的财务表现。该公司已经报告了加速增长,以及 AI 相关产品收入连续实现三位数增长。

读者应关注这种势头是否会在预览期后延续。管理层对年度经常性收入的预期提供了一个具体的衡量基准。

云业务利润率同样值得关注。若收入增长需要不成比例的基础设施支出,投资逻辑的说服力将减弱。

AI 需求与公司整体业绩之间的关系也很重要。Alibaba 仍依赖面临激烈竞争和消费者需求波动的电商业务。

更强劲的云业务业绩可以分散这种风险敞口,但前提是其规模足以影响集团收益。

第三个信号是开发者和客户的持续使用。下载量、代码库活动、集成、支持请求和生产案例研究,能够揭示兴趣是否能延续到发布周期之后。

开发者应寻找团队在长任务中运行 Qwen3.8 的证据。稳定的工具使用和可预测的成本,比精心打磨的演示更重要。

企业买家应关注受监管或技术要求严苛行业中的部署参考案例。这些案例将表明 Alibaba 能够支持实验之外的工作负载。

竞争对手的反应将提供佐证。其他供应商若调整定价、加快模型发布,或推出迁移工具,都将表明其竞争对手认为 Qwen3.8 具有重要意义。

沉默则更难解读。竞争对手往往会先通过客户折扣或产品路线图私下应对,之后才会公开宣布相关动作。

这些信号应结合起来考量。强劲的基准测试成绩若没有可用的许可证,仍会限制采用。广泛下载若无法带来有利润的云端使用,也会限制 Alibaba 的回报。

缺乏透明技术证据的财务增长或许仍能回报股东,但并不能验证该公司在前沿模型领域的排名。

反过来也一样。优秀的开放模型能够影响行业,却可能带来的收入低于投资者预期。

对于知识工作者而言,实际问题在于 Qwen3.8 是否会成为分析文档、编写代码和协调多步骤工作的可靠选择。这些用途需要用真实信息进行测试,而不是依赖宣传性提示词。

评估该模型的团队应将源材料和决策保存在可搜索的系统中。当模型行为在预览版与正式版之间发生变化时,结构化的 AI knowledge base 能让比较工作更容易。

Google News 将持续报道每一次发布、基准测试声明、股价变动和竞争反应。读者应将这些更新区分为不同的证据类别。

此次发布本身已获验证。Alibaba 对其性能排名的表述仍属于声明。股价上涨记录了投资者的热情,而未来的云业务结果将检验其经济基础。

这一框架能将快速传播的头条转化为实用的观察清单。先查看最终许可证和技术报告,其次关注独立评估,再观察云业务增长和利润率。

若三者都得到改善,这轮上涨将更像是市场对更强大 AI 平台的提前反应。若文档缺失、采用受阻,或成本增速超过收入,它则会像又一次在证据到来前已被市场定价的预览。

与其关注下一条头条,不如关注其背后的进展顺序。当 Qwen3.8 的最终材料发布时,应当追问外部人士能否复现这些声明,并在可行条款下部署该模型。

随后关注 Alibaba 关于使用情况和云业务经济效益的报告。届时,这则 Google News 故事要么成为持久的业务变化,要么以短暂的科技股上涨收场。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page