top of page

PCMag 的 AI 订阅测试揭示了行业无法解释的价值难题

9月2日
讀畢需時 15 分鐘

PCMag 每天测试付费 AI 工具,但其最新报道得出了一个令人不安的结论:即使是专业用户,也很难弄清自己的订阅究竟保障了什么。

问题不只是 ChatGPT、Claude 和 Gemini 提供了太多套餐。在订阅仍然有效期间,它们的模型、限额、功能和促销额度都可能发生变化。用户购买的是一个不断变化的系统的访问权限,而不是一个稳定的产品。

这一差别至关重要,因为付费 AI 已经兼具软件订阅、按量计费公用服务和实验性产品的特征。一个套餐可能在某个项目中显得很慷慨,但当较新的模型以不同方式消耗额度时,又会让人感到限制重重。由此产生的不确定性,迫使 OpenAI、Anthropic 和 Google 必须以客户能够核实的方式解释其价值。

PCMag 发现,订阅内容会在客户使用期间发生变化

核心问题并非付费 AI 是否好用,而是客户能否预测持续访问将带来什么。

这份原始测试报告重点关注 Claude。作者使用 Max 订阅,并描述了多项相互交织的限制如何塑造实际体验。

Claude 会根据会话和每周额度衡量访问权限。模型选择、对话长度、文件大小、研究工具及其他功能,都会影响用户触及这些边界的速度。因此,名义上的额度并不能转化为可靠的提示次数或完成任务数量。

Anthropic 自身的使用指南确认,消息量会随这些因素而变化。较长的对话可能消耗更多容量,因为 Claude 必须再次处理此前的上下文。附件、工具和高要求模型会进一步提高消耗。

从工程角度看,这套系统可以理解。生成简短回答所需的计算量,低于阅读大型代码库、搜索网页或修改长文档。固定提示次数会掩盖这些差异。

但客户仍面临一个基本问题。订阅售卖的是访问权限,但访问权限取决于在开始任务前仍难以观察的变量。

这造成了产品营销单位与其运营单位之间的错配。客户购买的是月度套餐,服务内部衡量的却是 tokens、缓存上下文、工具调用、模型需求和计算强度。

Tokens 是模型处理的细小文本单位。对于使用应用程序接口,即 API 的开发者而言,它们是有用的计费指标;但在作为通用助手呈现的消费级产品中,它们就不那么直观了。

大多数用户不会在开始一次编程会话前,先估算一个 agent 将读取多少上下文。他们不会计算反复工具调用的成本,也不会预判模型是否会重新查看多个文件。他们只是要求系统完成一项工作。

如果 agent 沿着直接路径执行,这项工作可能只消耗少量容量;如果它搜索了不必要的文件夹、重复失败步骤,或丢失了指令脉络,消耗就可能大得多。

用户将两种会话都视为一次请求。提供商看到的却是截然不同的计算负载。

临时促销活动让这种关系更加复杂。PCMag 描述了一项 Anthropic 促销活动:它扩大了 Claude Code 每周额度中的一部分,却没有改变较短会话的限制。这项优惠提高了潜在使用量,但只对工作模式能够利用它的客户有效。

如果有人碰到会话边界后无法继续,更大的每周额度几乎没有帮助;而能够跨多个会话工作的人,可能获益更多。

因此,这项促销可以改变用户感知到的价值,却不会让底层套餐更容易理解。它还可能建立一种临时使用模式,而这种模式会在优惠结束后消失。

这是报道中的第一个重要反转:更多访问权限并不一定带来更高的清晰度,反而可能增加一项客户必须监控的条件。

PCMag 的体验不应被视为 Claude 的普遍衡量标准。不同工作负载差异很大,Anthropic 也表示,重复内容可能受益于缓存。不过,这种差异恰恰强化了文章的核心发现。

一项订阅可以很有价值,同时仍然不透明。事实上,重度用户可能体验到最大的​​不确定性,因为他们接触到更多模型、工具和相互重叠的限制。

为什么付费 AI 比普通软件更难衡量

传统软件订阅销售的是相对稳定的能力,而 AI 订阅销售的是包裹在熟悉月度界面中的可变计算资源。

传统写作应用通常不会限制用户能输入多少复杂段落。图片编辑器也通常不会因为一张图像需要不同寻常的创意判断而减少访问权限。客户购买的是软件许可,其行为在安装后大多保持可用。

生成式 AI 的运作方式不同。每次回答都需要提供商的基础设施。更长的输入、更深入的推理、图像生成、视频创作、研究和自主工具,都可能需要不同数量的计算资源。

提供商无法承诺每项功能都可以无限制使用,否则就要承担不可预测的成本。他们通过套餐边界、特定模型额度、回退系统和合理使用政策来管理需求。

这些控制措施将一个表面简单的订阅,变成一组附带条件的权益组合。客户可能对一个模型拥有广泛访问权限,对另一个模型的访问权限较窄,而研究或编程功能又有各自独立的边界。

套餐还可能包含并不共享同一额度的产品。聊天、编程、视频生成、存储和生产力集成可以归于同一个商业套餐,却遵循不同的使用规则。

这种结构使得价值难以用单一数字表达。消息次数并不充分,因为一条消息可能要求生成一句话,也可能要求完成一个完整应用。Token 数量很精确,但与结果的关联较弱。访问时长则忽略了任务强度。

“完成的工作”听上去更有意义,但提供商无法定义标准单位。一位开发者完成的任务可能只是修复一个小 bug;另一位开发者的任务则可能涉及跨越数百个文件的大型迁移。

不确定性也会向两个方向蔓延。客户难以预测消耗,而提供商也无法预测会有多少高成本用户加入固定价格的订阅。

在许多订阅模式下,轻度用户补贴重度用户。重度用户会获得相当可观的价值,直到其行为触发为维持服务可持续性而设计的限制。

这种紧张关系解释了 AI 公司为何持续调整额度和回退行为,也解释了为何用户会将这些变化解读为产品降级,即使列出的订阅套餐仍然可用。

为某个特定模型订阅套餐的客户,可能会看到该模型被替换或转移。曾经显得充裕的功能,可能在需求上升后变得受限。促销额度可能结束。一个 agent 可能变得更强大,同时也会消耗更多套餐额度。

这些并非产品周边的副作用,它们定义了产品的实际价值。

市场尚未形成稳定的报告方式来呈现这些情况。提供商发布帮助页面、使用仪表板和通知,但这些材料往往描述的是限制,而非可预测的工作负载。

这一缺口对知识工作者尤为重要。他们的回报并不取决于原始输出量,而取决于助手能否在研究、写作、会议、编程或分析中节省经过验证的时间。

如果一个回答生成得很快,却让人花费更长时间检查,它可能创造负价值。编程 agent 看似高效,却可能引入需要手动修复的缺陷。研究工具可能交付一份精美摘要,但引用来源并不可靠。

这就是为什么有用的 AI 评估必须包括核实时间,也必须纳入设置、纠错、等待以及工作被中断的成本。

CNET 公布的测试方法说明了这一衡量难题。其评测人员通过实际任务评估准确性、创造力、幻觉和速度,因为生成式系统难以适用电视或电池使用的固定实验室测试。

同样的难题也会随客户回到家中。他们支付的是一种核心质量无法由单一稳定规格概括的产品。

新模型可能让现有套餐显得更小

当改进后的模型更快消耗额度或取代用户熟悉的选项时,AI 的进步可能降低用户感知到的订阅价值。

软件更新通常承诺在相同许可下提供更多能力。AI 模型发布也可能带来这种改进,同时改变客户实际能够完成的工作量。

更强大的模型可能进行更深入的推理、处理更多上下文、调用更多工具,或花费更长时间评估备选方案。这些行为可以提升结果,也可能消耗更大比例的有限额度。

PCMag 通过 Claude 模型变化描述了这种影响。作者发现,较新的高端模型比前代更快消耗可用容量。对该模型的访问还遵循其自身的限制。

结果颇为反直觉:订阅获得了更好的模型,订阅者却可能在碰到边界前完成更少任务。

这并不意味着该模型提供的价值更差。一次成功的回答可能替代数次较弱的尝试。一个能力更强的编程模型或许能解决高效模型根本无法处理的问题。

不过,客户需要足够的信息才能做出明智选择。他们必须知道,对于自己的工作负载,新模型的质量提升是否抵消了其更高的消耗。

当额度通过倍数或定性标签表达时,这种比较很困难。“更多使用量”描述的是相对关系,而不是预期结果。

当基准本身也在变化时,情况会更复杂。如果入门套餐的有效额度发生变动,被描述为该基准倍数的高级套餐,其含义可能在营销措辞不变的情况下发生变化。

模型退役又增加了一个变量。OpenAI 的发布历史记录了 ChatGPT 模型选择器、回退行为和旧版访问权限的多次变化。

这些变化表明,AI 订阅所包含的内容可以迅速演变。某个模型在用户开始一项工作流程时可用,之后可能被转移到旧版设置中,或从主界面消失。

自动路由可以降低普通用户的复杂性。系统会选择合适模型,而不是要求客户理解每一项技术差异。

但它也削弱了控制权。用户可能不知道,一次回答是否来自与上个月处理类似任务时相同的模型。性能变化很难与提示词差异或路由决策区分开来。

对于专业工作流程而言,一致性的重要性可能不亚于峰值智能。团队可能围绕某个模型已知的倾向建立审查程序。即使基准测试显示有所提升,替换模型仍可能需要重新测试。

基准测试是用于比较模型性能的标准化测试。它们有助于识别整体变化,但并不保证模型在企业的私有文档、代码库或沟通风格上会取得更好的结果。

因此,实际的价值单位并不是获得最新模型的访问权限,而是在客户真实工作中实现可重复的稳定表现。

这种区别改变了买方解读模型发布公告的方式。更快的发布节奏增加了选择空间,但也增加了评估工作。

每个新模型都会让客户重新审视几个问题。它是否改善了真正重要的任务?它是否消耗更多额度?它是否保持此前的行为表现?用户能否回到旧模型?

这类似于持续采购。客户在已经订阅服务后,仍需反复评估一项不断变化的服务。

AI 公司受益于快速迭代,因为竞争对手也在频繁发布模型。若等待传统的一年一度升级,服务商就会落后。

订阅用户承担了这场竞争的一部分成本。他们能更早获得新功能,但也要承受迁移、测试和不确定性。

个人的 AI 工作流 可以通过将源材料和审核步骤保留在单一聊天机器人之外,降低一部分切换成本。它无法让服务商的限制变得可预测,但可以避免模型成为工作的唯一资料库。

ChatGPT、Claude 和 Gemini 面临同样的透明度问题

领先服务商以不同方式打包其限制条件,但三者都要求客户接受一定程度的可变访问权限。

Anthropic 明确告知用户,Claude 的使用量取决于消息长度、附件、对话历史、工具和模型选择。这种披露指出了相关变量,但并不能预测订阅用户能够完成多少真实任务。

OpenAI 同样将访问权限划分在不同模型和产品界面之间。在达到某些限制后,ChatGPT 可能会将用户路由至备用模型;而编程和代理功能则可能遵循受任务复杂度与工具使用情况影响的额度安排。

当首选模型不可用时,这种做法能够维持服务。然而,连续性不等于等效性。备用模型或许能很好地回答简单问题,却可能在长篇编程或研究任务上表现不同。

Google 在当前的 Gemini 文档中异常明确地说明了计算资源之间的关系。其 Gemini 限制 取决于提示词复杂度、模型选择、功能使用情况和对话长度。

Google 还表示,限制可能因测试、可用性或容量而变化。当客户达到某个边界后,Gemini 可能会将对话切换至更轻量的模型。

这种表述准确反映了这项技术服务的现实,也说明了为何传统的订阅比喻显得牵强。

客户购买的并不是对某一台定义明确的机器的永久访问权,而是进入一个由模型和功能组成的托管资源池的优先资格。

竞争促使服务商将更多产品捆绑进这些套餐。编程代理、文档研究、图像工具、视频功能、云存储和办公集成都可以增强套餐表面上的吸引力。

当客户本来就使用这些产品时,捆绑确实能够带来真实价值。但它也可能模糊究竟是哪项权益支撑了订阅的合理性。

Gemini 订阅用户的看重之处,可能是存储空间和 Google 集成,而非高级模型访问权。Claude 订阅用户可能主要关心 Claude Code。ChatGPT 订阅用户则可能优先考虑语音、研究、图像生成或通用聊天功能。

这些用户名义上购买的是 AI 套餐,但实际购买的是不同的结果。因此,按功能清单比较套餐可能会产生误导。

捆绑也降低了替代关系的可见性。客户可能已经通过工作、手机、办公套件或云账户获得了助手服务。再单独为另一个通用聊天机器人付费,可能造成能力重复。

这种重复并不总是浪费。不同助手各有优势,第二个模型可以帮助交叉核验不确定的答案。

不过,交叉核验意味着额外劳动。两个看似自信的答案可能彼此矛盾,用户仍须负责解决冲突。

这带来了第二层反转。获得更多模型访问权可以降低对单一服务商的依赖,但也可能增加选择、测试和验证所需的时间。

免费套餐加剧了这种压力。它们让用户无需维持付费订阅,也能完成许多常见任务。因此,付费套餐必须通过更高额度、特殊模型、集成工具、可靠性或工作流连续性来证明自身价值。

如果客户的工作发生变化,这种合理性也可能消失。某个用户可能只在一个月内需要高强度研究,之后只使用基础摘要功能。开发者可能完成了大型项目,不再需要延长的编程会话。

套餐仍在生效,但其实际价值已经下降。与固定的软件许可证不同,客户必须持续让自己的使用情况匹配一套不断变化的额度安排。

这正是市场的主要矛盾并非 Claude 对阵 ChatGPT 或 Gemini 的原因,而是服务商灵活性与客户可预测性之间的矛盾。

服务商需要自由地路由流量、管理容量和发布模型。客户则需要知道,订阅是否能支持明天的工作。

这两种诉求都合理。当前的产品设计更偏向服务商。

真正的成本,是那些从未出现在账单上的工作

订阅标价所揭示的信息,远少于用户为监控限制、切换模型和核查不可靠输出所投入的时间。

PCMag 的报道很有价值,因为它来自一位经验丰富的测试者。如果一个每天评估 AI 的人都觉得商业结构令人困惑,那么问题就不能被归咎于新手操作失误。

专业能力甚至可能暴露出更多不确定性。高级用户会接触模型选择器、编程代理、长上下文和专业工具。他们会看到普通用户可以忽略的差异。

普通订阅用户可能只问几个问题,从未触及限制。对这类用户而言,体验很简单,尽管免费服务或许也能完成同样的任务。

专业用户能够获得更多价值,但前提是他们必须管理系统。他们要学习哪种模型适合何种任务、限制何时重置、对话长度如何影响消耗,以及何时该开启新会话。

这种管理是无偿的运营工作。

验证也是如此。大语言模型根据已学习的模式和当前上下文,预测可能的后续文本。它们可以用令人信服的措辞生成错误细节或不可靠的引用。

PCMag 更广泛的测试反复强调了流畅度与判断力之间的差距。这些工具适合用于组织信息、起草初稿和解释问题,但重要主张仍需要独立核查。

验证改变了经济账。假设一个助手迅速生成了研究摘要,真正相关的问题并不是文本出现得有多快。

真正相关的问题是,用户花了多少时间打开来源、纠正主张、重建缺失的上下文,并判断最终结果是否可信。

订阅可以在某一个环节节省时间,却在别处增加工作量。服务商很少披露这种完整交换关系,因为他们无法观察到每一次下游修正。

客户可以自行衡量,但很少有套餐能让这件事变得容易。使用情况仪表盘报告的是容量,而不是结果。聊天记录保留了交互,却不会记录节省了多少小时,或引入了多少缺陷。

更好的评估应从一项重复性任务开始。用户应比较在有无付费功能时的完整工作流。

对于研究,这包括收集、来源核查、综合与修订。对于编程,这包括测试、审查、调试和清理。对于写作,这包括事实核验、编辑和语气修正。

衡量标准应始终与已完成的工作挂钩。提示词数量鼓励的是活动,而不是价值。Token 消耗既不奖励准确性,也不奖励实用性。

这种以结果为导向的方法还能揭示何时较轻量的模型已经足够。对于分类、格式整理或简短摘要,最新模型可能并无必要。

为每项任务使用高计算资源模型,可能会耗尽额度,却无法改善最终工作成果。它还可能造成一种错觉:似乎必须购买更高级的订阅。

服务商有动力让模型选择变得更简单,自动路由满足了这一需求的一部分。然而,如果希望客户信任它,路由过程就必须变得更可观察。

有用的记录应标明所用模型、主要工具、消耗的额度以及任何已应用的备用方案,并以通俗语言将这些事实关联到具体会话。

当熟悉的模型、限制或已包含功能即将变化时,客户也需要提前获知。工作流发生变化后才发布的更新说明属于文档,但并不等于可预测性。

这些变化都无法消除可变使用量,但能让这种交换关系更清晰易懂。

三个信号将显示 AI 套餐是否变得更值得信赖

AI 竞争的下一阶段,将检验服务商能否在不放弃其基础设施所需灵活性的同时提升透明度。

第一个信号是任务级使用可见性。客户应关注那些能够解释为何某次会话比另一次消耗更多容量的仪表盘。

单独的百分比进度条无法回答这个问题。有用的报告应区分模型使用、上下文处理、工具调用和延展推理,而不要求客户理解 API 计费。

如果服务商加入这些细节,PCMag 的批评就会减弱。用户可以将消耗与行为联系起来,并在触及限制前调整工作流。

如果仪表盘仍然抽象,批评就会加强。客户将继续购买相对访问权限,却没有可靠的基准。

第二个信号是公司如何处理模型过渡。OpenAI、Anthropic 和 Google 将继续发布和淘汰模型。关键问题在于,订阅用户是否能获得稳定的迁移窗口和有意义的控制权。

强有力的过渡机制会说明性能差异、消耗变化、备用行为,以及旧模型仍可使用的期限。

薄弱的过渡机制则会替换熟悉的模型,却让用户只能通过任务失败或更快的额度消耗来发现后果。

这一信号对企业尤为重要。它们需要时间针对内部数据、安全要求和质量控制验证新模型。当团队依赖它进行日常工作时,消费级界面的突然变化可能演变为运营事故。

第三个信号是订阅是否开始报告结果,而非访问权限倍数。没有服务商能够承诺确切的已完成项目数量,但每一家都可以发布具有代表性的工作负载范围。

这些示例应清晰说明前提条件。简短聊天、文档审阅、代理式编程会话和研究项目消耗资源的方式并不相同。

代表性工作负载无法保证每位用户的结果,但比“可获得数倍使用量”的说法更能为买方提供有用的起点。

Google 当前的文档已经指出主要计算变量。Anthropic 解释了影响 Claude 使用的多项行为。OpenAI 则持续维护涵盖 ChatGPT 功能的详细发布说明。

缺失的一层,是稳定的商业化转译。客户需要将这些技术事实转化为可在订阅前评估的预期。

在此之前,最稳妥的做法是把每一项 AI 订阅都视为可续期的实验。选择一项重复性任务,衡量完成它所需的全部时间,并记录限额或模型变更会在何处打断流程。

然后,将付费工作流与现有的免费选项进行比较。评估时不仅要看首次回复的质量,也要计入修正所需的时间和切换成本。

目标并不是找到一款放之四海而皆准的最佳聊天机器人。这样的产品并不存在,因为其价值取决于工作负载、集成能力、对错误的容忍度,以及对一致性的需求。

更有用的问题范围更小:在当前计费周期内,这项订阅是否带来了可重复的改进?

PCMag 的每日测试表明,回答这个问题依然很困难。AI 公司已经很擅长交付更强的能力,但尚未把这种能力背后的商业计费单元解释得同样清晰。

能解决这一问题的服务商,不会只是发布一个更简单的套餐页面。它会让客户能够将付款、使用量与实际完成的工作关联起来,而无需成为模型基础设施专家。

这才是值得关注的标准。在续订付费 AI 服务之前,先明确它必须改善的任务,衡量完整工作流,并追问:在下一次模型变更后,是否仍能获得同样的结果。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page