top of page

Anthropic 与 Google 的竞争转向信任:Claude 满意度超越 ChatGPT,Gemini 瞄准律所

9月1日
讀畢需時 13 分鐘

Anthropic 与 Google 的较量在 8 月呈现出鲜明分化:Claude 登上英国满意度排行榜榜首,而 Gemini 则直接进入受监管的法律工作领域。Anthropic 的助手净满意度得分为 56.2,高于 Gemini 的 46.5 和 ChatGPT 的 46.0。然而,Google 正在为律所打包推出专业化智能体。

这一反差的重要性远不止于一份聊天机器人排名。Anthropic 似乎在实际使用过 Claude 的人群中建立了更强的满意度。与此同时,Google 押注于分发能力、权限、连接器和行业专属工作流,认为这些因素将决定企业真正采用哪些 AI 系统。

本周其他中小企业科技新闻也强化了同一个观点。Xero 扩展了 AI 辅助会计工作流,LinkedIn 加强了对低质量 AI 帖子的应对措施,而金融领域领导者则警告人类判断力正在被削弱。这些故事共同表明,AI 竞争正在超越模型智能本身。

正在浮现的问题不再只是哪个助手能写出最好的答案。企业必须决定,哪个系统能在真实工作流中安全执行操作,而不会让用户陷入错误、泛泛内容或隐性风险之中。

五则新闻指向商业 AI 的新阶段

本周科技新闻围绕着一个主题:AI 产品将按其完成的工作来评判,而不是按其吸引的关注来评判。

Forbes 发布的一篇中小企业综述串联了五项发展。每项都涉及不同的产品或专业场景,但都暴露出同一个实施难题。

首先,Xero 宣布为中小企业和会计专业人士增加更多 AI 工作流。该公司将其 AI 财务助手 JAX 定位为一种工具,帮助用户从解释财务信息转向完成受控的会计任务。

其次,Google 推出了 Gemini Enterprise for Legal。这款产品面向律所和企业法务部门,整合了 Gemini 智能体、连接器、搜索功能和访问控制。

第三,Goldman Sachs 的一位合伙人警告称,过度依赖 AI 可能导致“认知萎缩”。这一担忧很直接:当软件持续生成初稿、分析或建议时,专业人士可能失去练习推理能力的机会。

第四,LinkedIn 表示,用户点击其“AI Slop”反馈选项的次数已超过 100 万次。该公司称,收到这一信号的帖子浏览量可能最多下降 40%。这一功能将受众的不满转化为对低价值自动化内容的分发后果。

最后,YouGov 数据显示,在英国现有及曾经使用过相关产品的用户中,Claude 的净满意度高于 Gemini 和 ChatGPT。这一结果构成了本周最吸引眼球的标题,但仍需谨慎解读。

这一发现并不能证明 Claude 在所有情况下都比 ChatGPT 或 Gemini 更聪明。它衡量的是有过各品牌使用经验的人群中的满意度,而非市场份额、任务准确率、营收或所有专业使用场景下的表现。

将这些新闻视为市场信号会更有价值。Xero 正在将 AI 嵌入会计记录中。Google 正在让它适应法律权限体系。LinkedIn 正在惩罚不受欢迎的输出。Anthropic 则受益于积极的用户情绪。

这些发展将注意力从访问能力转向问责机制。中小企业已经有很多方法可以生成文本。更困难的问题是,何时应让生成的工作获得访问文档、财务记录、客户事务和公开发布渠道的权限。

Xero 希望 AI 在会计系统内执行操作

Xero 的优势不是通用聊天机器人,而是已经存储在公司会计系统中的财务上下文。

在丹佛举行的 2026 年客户活动上,Xero 介绍了围绕 JAX 构建的新工作流。该公司称 JAX 是一位 AI 财务伙伴,但企业应将这一说法视为产品主张,而非独立验证结果。

根据 Xero 的工作流公告,该助手可协助处理银行对账和单据采集等任务。Xero 表示,其自动化对账工作流可将账户对账所花费的时间减少 50%。

银行对账是将会计记录中的交易与银行活动进行比对。它虽然重复性高,但错误可能扭曲现金状况、税务准备和管理报告。

因此,对账是检验商业 AI 的一个典型场景。一段润色精美的文字即使包含错误,也未必会立即影响账本;一笔错误分类的交易,却可能在无人察觉前流入报告和决策过程。

Xero 的做法是让 AI 紧贴结构化财务数据和既有会计控制机制。JAX 可在一个已存在交易、发票、联系人和历史分类记录的系统内提出建议或执行操作。

这一模式不同于将财务信息复制到面向消费者的聊天机器人中。它为系统提供了更多上下文,但也提高了风险。该助手需要明确的审批边界、可追溯的变更记录,以及可靠的纠错方式。

Xero 还将其财务数据与 Claude 连接起来。其 Claude 集成允许符合条件的用户通过 Anthropic 的助手,就其企业信息提出问题。这为专业业务数据与通用对话界面之间建立了具体联系。

对中小企业主而言,这种吸引力显而易见。关于逾期发票或现金流动的问题可以用日常语言提出,而底层系统随后可基于最新会计记录给出回应。

风险同样清楚。一段流畅的解释即使建立在不完整记录、异常交易或错误假设之上,也可能听起来很权威。因此,财务 AI 需要的不只是一个优秀模型,还需要权限控制、对源记录的引用、审批步骤和审计轨迹。

这正是个人与组织信息管理成为 AI 采用一部分的原因。团队需要可靠的方法来保存决策背后的源材料。当记录延伸到会计平台之外时,可搜索的 AI 知识库可以支持这一过程。

Xero 的公告表明,掌握可信业务数据的软件供应商拥有优势。他们不需要在每项基准测试中击败所有通用助手,而是需要让一项特定的高频任务更快完成,同时保持用户的控制权。

这比自主财务的承诺更为有限,但也更容易检验。企业可以衡量对账是否更省时、修正是否增加,以及员工是否仍然理解最终形成的账目。

Google 瞄准法律 AI 中的权限难题

Google 进入法律 AI 市场时,将访问控制和工作流集成视为产品功能,而不是实施细节。

Google Cloud 于 2026 年 8 月 25 日发布 Gemini Enterprise for Legal。该产品仍处于预览阶段,目标用户包括律所、企业法律团队和法务运营团队。

该公司的法律 AI 平台将专门构建的智能体与文档及案件管理系统的连接器相结合。这些智能体是软件组件,旨在通过多个步骤推进一项任务,而不只是生成一次回应。

Google 列出的预期工作流包括合同审查、法律研究、文档分析和起草。该公司还表示,律所可构建定制智能体,并将其连接到现有数据源。

其核心功能是继承访问控制。Google 表示,该平台会遵守律所文件和系统中已有的权限。如果律师无法访问底层存储库中的某项事务,AI 也不应通过单独配置获得访问权限。

律所通常将这类限制称为伦理隔离墙。当职业义务、客户利益冲突或保密要求需要时,它们会将不同团队或个人隔离开来。

这一权限模型回应了法律 AI 采用中的一个现实障碍。一个有用的助手需要访问合同、往来文件、研究资料和案件历史;但赋予其广泛访问权限,也可能使信息跨越客户边界而暴露。

Google 表示,客户内容、策略和输出不会被用于训练基础模型。买家在依赖这一说法之前,仍需审查数据保留设置、连接器行为、区域控制、日志记录和合同承诺。

首批采用者表明,Google 的目标是大型、复杂组织。Weil 宣布将成为最早部署该系统的律所之一,并与 Google Cloud 合作参与其开发。

Google 进入这一领域时也已拥有既有的法律服务影响力。Freshfields 在 4 月表示,已有超过 5,000 名专业人士使用基于 Gemini 模型的工具。员工使用这些工具进行会议转录、文档摘要和定制工作场所助手等工作。

不过,Google 进入的并非空白市场。Anthropic 在 2026 年早些时候推出了 Claude for Legal,而 Harvey 等法律科技公司已经围绕研究、起草和文档审查开发了工具。

因此,Anthropic 与 Google 之间的重要冲突并不是两个聊天窗口之间的简单竞赛,而是平台、集成、模型行为和信任安排之间的竞争。

Anthropic 可以通过自己的产品和云合作伙伴销售 Claude。Google 则可以将 Gemini 与 Google Cloud 基础设施、Workspace、搜索技术、身份服务和企业管理功能结合起来。

专业化让 Google 的商业价值主张更加明确,但也带来了更高期待。法律用户需要的不只是看似合理的文本,还需要来源依据、保密性、一致的访问规则,以及输出生成方式的记录。

一条虚构的餐厅推荐最多令人不便。一项伪造的引文或被忽略的条款,则可能影响客户、交易或法庭文件。即使平台充满信心地呈现输出,人类审查仍然不可或缺。

Anthropic 与 Google 的竞争正在将满意度与覆盖范围分开

Claude 的满意度领先值得关注,但 ChatGPT 和 Gemini 仍拥有该排名未衡量的优势。

YouGov 收集了 2026 年 3 月 1 日至 7 月 31 日期间的英国 BrandIndex 数据。其分析纳入了每个 AI 助手品牌的现有及曾经用户,每个品牌图表样本均超过 380 份回应。

在最终的满意度排名中,Claude 获得 56.2 的净得分。Gemini 以 46.5 紧随其后,ChatGPT 则为 46.0。

这些数字是分值,而不是百分比。YouGov 根据使用过该工具的人群中满意与不满意的回应计算净得分。

Claude 在前用户中的评分也最高,为 21.8。Perplexity 以 18.7 紧随其后,而 ChatGPT 在前用户中的评分为 2.9。Grok 则录得负 4.7。

现有用户的结果有所不同。DeepSeek 以 77.2 领跑该群体,Claude 以 74.5 紧随其后。Perplexity 得分为 70.5,ChatGPT 为 66.6,Gemini 达到 64.2。

这种差异表明,“Claude 击败 ChatGPT”这一说法过于笼统。Claude 在一项总体满意度指标中领先。DeepSeek 在现有用户中领先,而 ChatGPT 在整体偏好方面仍然更具优势。

YouGov 的另一项品牌偏好分析显示,在英国 AI 用户中,ChatGPT 以 30.0% 位居第一。Alexa 以 12.7% 紧随其后,Copilot 为 11.6%,Gemini 为 11.3%。Claude 以 4.3% 排名第五。

换言之,整体偏好 Claude 的受访者较少,但有直接使用经验的用户对其评价更积极。这体现了覆盖范围与满意度之间的重要差异。

选择效应同样不可忽视。Claude 用户可能与更广泛的 ChatGPT 用户群体存在差异。人们需要主动寻找某些助手,而另一些则通过成熟设备、搜索产品、工作场所订阅或广为人知的品牌进入用户视野。

该调查覆盖的是一个特定国家及五个月的时间段。产品更新、服务中断、界面变化和模型发布,都可能迅速改变用户看法。这些数据不应被概括为一项永久性的全球排名。

它同样无法告诉小型企业,哪一个助手在其自身工作中表现最佳。满意度评分融合了许多体验,包括写作风格、速度、可靠性、界面设计和用户预期。

企业应使用具有代表性的任务评估助手。一个实用的测试集可能包括客户邮件草稿、文档摘要、政策问题、电子表格分析,以及需要引用来源的研究任务。

结果应从准确性、修正时间、来源可追溯性和一致性等方面加以评判。用户偏好仍然重要,因为员工会回避自己不喜欢的系统。但它不应取代任务层面的验证。

这正是 Anthropic 与 Google 竞争更深层的含义。Anthropic 拥有积极的满意度信号。Google 拥有分发能力以及不断扩大的专业化企业产品组合。OpenAI 则保留了强劲的偏好度和品牌认知度。

没有任何单一指标能够决定这场竞争。对一家小型企业而言,胜出的产品可能是最适配其现有文件、员工习惯、安全控制和日常工作的一款。

反转之处在于,更好的 AI 会创造更多人工工作

随着 AI 完成更多任务,企业需要更强的审查体系和更审慎的人类判断。

通常的自动化承诺是,软件能够消除重复性工作。这仍然有可能实现,但这五则报道揭示了一个不那么令人舒适的模式:每一项新的 AI 行动都会带来新的监督需求。

Xero 可以减少手动对账,但仍需有人调查例外情况并核实分类。Gemini 可以审阅合同,但合格的专业人士必须检查引用、上下文以及针对客户的具体影响。

Claude 可以生成出色的草稿,但用户仍需判断草稿是否反映当前事实。LinkedIn 可以帮助用户创作更多帖子,但受众和平台也必须筛选随之而来的内容洪流。

这正是有关认知萎缩警告背后的担忧。人们通过完成工作、发现例外、接受纠正以及比较相互竞争的解释,来培养专业判断力。

如果 AI 持续提供初步分析,初级员工可能会失去一部分这样的重复训练。他们或许会负责监督输出,却没有形成识别细微错误所需的经验。

法律工作说明了这一问题。初级律师传统上通过研究、文件审阅、起草以及反复反馈来学习。这些任务可能繁琐,但也让律师接触到能在日后支持更高层次判断的模式。

AI 可以减少与这些工作相关的可计费时间。律所因此面临培训挑战:即使软件能够生成可接受的初稿,也必须创造新的方式,让初级专业人员练习推理。

资源更少的小型企业也面临类似问题。企业主可能要求助手起草合同摘要、解读财务报告或制定人事政策。只有当企业主能够识别哪些内容需要专业审查时,输出才能真正节省时间。

这并不意味着每项任务都应继续手动完成。它意味着企业需要区分辅助、建议和执行。

辅助会生成选项或摘要。建议会提出一个选择。执行则会修改记录、发送消息、提交文件,或使企业承诺采取某项行动。

每个阶段都需要不同的审批规则。如果摘要链接到来源,就可以容忍有限的不确定性。付款、申报或客户沟通则需要更高的门槛。

公司还应保留重要决策背后的推理过程。笔记、源文件和会议背景有助于审查者还原 AI 生成的提案为何会被接受。一个可搜索的工作流可以降低关键信息在不同应用之间消失的概率。

目标不是记录每一个提示词,而是保留能够支撑重要决策的信息,尤其是在多人或多个系统参与时。

因此,最有效的 AI 工作流可能会包含刻意设置的摩擦。它可以要求在修改账本前获得批准,披露哪些文件支撑了回答,或在置信度低于既定阈值时暂停。

这类控制会在错误变得昂贵的环节放慢自动化速度。这是一项功能,而非失败。

LinkedIn 的 AI Slop 按钮揭示了分发风险

AI 可以降低内容生产成本,却会提高赢得注意力的成本。

LinkedIn 的“AI Slop”反馈选项将一种主观抱怨转化为平台信号。据 Forbes 的汇总报道,用户点击该按钮已超过一百万次。

LinkedIn 还表示,被标记的帖子可能获得最多减少 40% 的浏览量。具体影响取决于平台系统以及每篇帖子所处的语境,但方向已经很明确。

企业现在可以生成比受众合理消费量更多的文章、更新、邮件和产品描述。增加产出并不会创造对这些产出的更多需求。

泛泛而谈的帖子通常具有易于识别的特征:重复熟悉的建议,采用重复的结构,回避具体经验,并在没有证据的情况下提出主张。文本或许语法无误,却几乎没有值得阅读的理由。

这改变了小型企业营销的经济逻辑。起草变得更便宜,但编辑、核实、原创报道和分发变得更有价值。

一家企业发布五篇泛泛的帖子,表现可能不如发布一篇有用分析的企业。平台可能减少分发,读者可能忽视该品牌,搜索系统也可能难以识别其独特专长。

这种风险不止存在于社交媒体。AI 生成的支持回复如果只是重复文档、却没有解决实际问题,可能会让客户感到沮丧。自动化销售消息若假装是个人化沟通,也可能损害信任。

解决办法并不是隐藏 AI 的使用。企业应让输出更具体,也更可追责。

一篇有价值的帖子可以包含已观察到的客户问题、记录在案的流程变化,或具有足够上下文以供评估的结果。一则有用的支持回复可以引用客户的确切账户状态,并提供清晰的下一步行动。

人工审查应聚焦价值,而非表面润色。编辑需要问:内容是否包含新事实、站得住脚的观点,或目标读者无法从其他地方获得的直接经验。

这一经验同样适用于 Claude、Gemini 和 ChatGPT。即使底层模型依然具备能力,当助手生成冗长或泛泛的回答时,满意度也可能下降。

对 Anthropic 而言,简洁且协作性的行为可以强化 Claude 的声誉。对 Google 而言,将 Gemini 整合到专业系统中可以提升回答的相关性。这两种策略都试图缩小生成语言与有用工作之间的距离。

但两家公司都无法仅靠增加自动化来保证实用性。相关性依赖于上下文,信任依赖于稳定的结果。

三项信号将检验 Anthropic 与 Google 的竞争

下一阶段将由采用情况、持续满意度和可衡量的错误率决定,而不是由发布公告的数量决定。

第一项信号是 Gemini Enterprise for Legal 的生产使用情况。预览合作伙伴关系展现了兴趣,但并不能证明已形成常规采用。

应关注律所披露有多少专业人士每周使用该系统、哪些工作流进入生产环境,以及用户多频繁地接受或修改其工作成果。更广泛部署的证据将强化 Google 的专业化战略。

安全与治理事件同样重要。权限失误或缺乏依据的法律输出,将削弱“通用云服务提供商能够为敏感专业工作安全封装 AI”这一论点。

第二项信号是 Claude 是否能保持其满意度优势。YouGov 的测量窗口于 7 月 31 日结束,因此未来的排名将反映更新后的产品、不断变化的界面和不同的用户预期。

持久的领先将支持 Anthropic 的立场:产品行为能够弥补整体偏好较低的不足。若出现急剧下滑,则可能表明该结果反映的是某一时期特定的用户或产品版本组合。

第三项信号是工作流供应商能否在不增加修正工作的前提下验证其效率主张。Xero 表示,其新的对账体验可将该任务的耗时减少 50%。企业应将这一节省与例外率、审查时间和后续修正进行比较。

同样的测试也适用于法律研究、内容生成和客户支持。节省的总时间并不足够。真正相关的指标是验证和修复之后的净耗时。

因此,小型企业买家不应根据单一基准测试或调查来选择赢家。他们可以在治理机制确定前,使用实际文件和可重复任务开展受控试验,同时排除敏感信息。

记录每项任务耗时多久、错误出现在哪里,以及员工是否理解最终输出。应将审查 AI 工作的成本纳入考量,而不只是看它生成内容的速度。

Anthropic 与 Google 的竞争之所以变得更有价值,恰恰是因为两家公司在追求不同的优势。Claude 的满意度结果为 Anthropic 提供了可信的产品信号。Google 的法律产品则检验企业基础设施能否将 Gemini 转化为可靠的工作流层。

这两项结果都无法决定市场。Claude 的得分并不意味着它在所有场景下都更好,Gemini 的整合也不保证其法律工作值得信赖。

对企业主而言,实际问题更为具体:哪一个系统能改善某项特定工作流,同时保留控制力、证据和人类判断?在授予任何助手访问最重要工作的权限之前,应先检验这个问题。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page