top of page

AI 聊天机器人如今似乎比政治人物更值得信赖,但准确性讲述了另一番故事

据 Bloomberg 8 月 5 日重点报道的一项调查,AI 聊天机器人据称已超越地方政治领导人,成为准确且有用信息的来源。

这一比较标志着非同寻常的逆转。聊天机器人仍会产生事实错误、不完整的引用和过时的回答。然而,受访者显然对其提供的信息评价高于地方领导人的沟通内容。

这一结果并不能证明 ChatGPT、Claude、Gemini 或 Grok 能够持续提供更好的公民信息。它表明,即使这类软件存在严重的可靠性问题,对话式软件也可能比一个机构显得更有用。

这种区别很重要,因为人们日益将聊天机器人作为信息入口。他们提出一个问题,便得到简明回答,往往不会再访问提供底层事实的政府网页。

地方领导人如今面对的竞争对手永不下线,鲜少使用官僚语言,并能在数秒内作出回应。然而,与民选官员不同,聊天机器人无法为错误答案承担责任。

因此,核心冲突并非机器与政治人物之争,而是易获取的信息与可问责的信息之间的较量。聊天机器人擅长前者,而民主机构仍须对后者负责。

调查结果究竟改变了什么

这项调查的重要性在于它衡量的是感知中的信息质量,而非证明聊天机器人客观上比政府更准确。

Bloomberg 8 月 5 日的新闻简报称,受访者认为聊天机器人比政治人物更值得信赖。这一比较聚焦于各类来源是否提供准确、有用的信息。

这种框架合并了几项本应彼此区分的判断。一个来源可以有用,却不一定完全准确;它也可能听起来值得信赖,却未必真正赢得了制度性信任。

聊天机器人通常能把复杂问题转化为直接回答。它从用户路径中移除了菜单、机构边界、陌生术语和冗长政策文件。

居民可能会询问如何补办许可证、质疑税务评估,或举报不安全住房。聊天机器人能够将流程呈现为一套针对该问题量身定制的简短步骤。

相应的政府体验可能需要搜索多个页面,也可能涉及打开 PDF、解读法律语言,或在工作时间致电办公室。

用户会立即注意到这种差异。便利性成为信任判断的一部分,因为即使信息权威,难以使用的来源也会让人觉得不够及时。

这有助于解释为何这一报道中的结果具有合理性。人们往往根据一个信息系统能否帮助他们完成任务来评价它,而不只看其事实精确度。

Center for News, Technology and Innovation 的研究发现,聊天机器人用户通常寻求能帮助自己行动或理解事件的信息。受访者重视整合多个来源材料的综合回答。

根据该中心关于信息需求的研究,这些用户并不总是将聊天机器人视为新闻机构的完全替代品。许多人会查看引用、核对其他平台,然后回到对话中继续交流。

这种行为揭示了其吸引力。聊天机器人充当了问题与碎片化信息环境之间的解释者。

政府沟通往往从机构结构出发,而聊天机器人沟通则从用户的一句话开始。

这种差异甚至会在尚未有人证明哪个来源更准确之前就形成压力。人们会记住哪个渠道以更少的努力化解了他们的困惑。

因此,地方领导人面临的不仅是政治信任问题,也是服务设计问题。当居民无法找到或理解信息时,仅仅发布正确信息已不再足够。

调查结果改变了竞争基准。市政网站不再只与其他政府网站相比;居民会将其与自己在其他场景中使用的最佳对话式产品进行比较。

为什么 AI 聊天机器人比地方领导人更让人觉得可信

聊天机器人凭借速度、清晰度和个性化赢得感知信任,尽管这些特质没有一项能保证事实可靠性。

聊天机器人会直接回应一个人所使用的措辞。它可以换一种说法解释答案、定义陌生术语、翻译说明,或调整详略程度。

政治沟通则不同。官方声明通常要面向多类受众,同时维护法律、行政和选举利益。

这会产生带有保留的语言。信息或许准确,但当居民只想得到一个简单答案时,它可能显得闪烁其词。

聊天机器人也避开了许多会引发政治怀疑的明显信号。它们不会竞选、打断对手,也不会在日常交流中为投票记录辩护。

由于界面掩盖了其背后的机构,它们的回答可能显得中立。模型开发者、训练数据、检索提供商、系统规则和安全政策大多仍不可见。

这种感知中的中立性很脆弱。每个聊天机器人都反映了其数据、指令、来源和回答边界方面的选择。

尽管如此,对话体验仍会形成强烈的第一印象。系统看似在倾听,因为每一个回答都针对个人提示作出回应。

地方领导人通常通过演讲、公开会议、新闻简报、社交账号和官方网站沟通。这些形式通常是向许多人广播同一条信息。

对话交流颠倒了这种关系。用户掌控第一个问题,并可以立即要求澄清。

可用性又带来一项优势。聊天机器人可以在办公时间之外解释陌生流程,而无需让居民等待接听。

这些特质近似于能力表现。快速、条理清晰的回答会让人觉得信息充分,尤其当系统以自信的口吻写作时。

研究表明,有用性与真实性并不总能获得同等评价。用户能够认识到生成式 AI 并不完美,同时仍认为其输出极具帮助。

这种差距是调查结果表面现象的核心。受访者可能是在奖励聊天机器人降低理解信息成本的能力。

Pew Research Center 的最新数据表明,这种行为已相当普遍。42% 的美国成年人表示,他们使用聊天机器人搜索信息。

同一项2026 年 AI 调查发现,13% 的人使用它们获取新闻。Pew 在 2 月 17 日至 2 月 23 日期间调查了 5,119 名美国成年人。

这些数字本身并不能证明信任。它们表明,对相当一部分公众而言,经由聊天机器人获取信息已成为日常体验。

政治领导人如今要在这种体验中竞争。居民可以在任一信息出现后的数秒内,将城市声明与聊天机器人摘要进行比较。

聊天机器人也可能给出更易读的解释。不过,在简化来源时,它可能会删去不确定性、例外情况或程序细节。

这种权衡很容易被忽视,因为经过润色的回答看起来完整无缺。用户看到的是答案,而不是生成过程中被舍弃的材料。

这正是为何不应将感知信任简单视为技术热情。它反映了人们对从个人问题出发的沟通方式的真实需求。

政府不能仅靠坚持让居民按旧方式浏览信息来回应这种需求。它们必须让权威信息更易于提问、核实和使用。

真正的较量是便利与问责之间的较量

聊天机器人可以赢得一次互动,却无需为后果承担责任;公共机构则必须为每一项官方决定负责。

地方政府不能将资格规则视为近似答案。它必须遵守法律、保存记录、保护个人信息,并提供申诉程序。

通用型聊天机器人没有可比的公共责任。它可以生成看似可信的解释,却不控制其所描述的服务、政策或法律程序。

这造成了一场不对称的较量。政治人物或机构因行政复杂性受到指责,而聊天机器人则因总结这些内容获得认可。

如果摘要有误,用户可能直到错过截止日期或提交无效申请后才发现问题。

模型提供商或许会修正未来的输出,但无法挽回每一次失去的机会。公共机构仍可能需要解决由此造成的损害。

随着聊天机器人从一般性解释走向公民指导,这一区别变得愈发重要。错误的餐厅推荐只会造成不便;错误的福利答案则可能威胁一个人的收入或住房。

英国 Open Data Institute 测试了聊天机器人对超过 22,000 个政府服务合成问题的表现。其研究人员发现,事实性和来源选择方面持续存在问题。

该项目还发现,强制模型给出更简洁的回答可能降低事实准确性。根据该机构关于政府信息的研究结果,简短回答未必会优先采用权威政府来源。

这一结果揭示了信任逆转背后的机制。用户偏好的特质,可能与可靠公民答案所需的特质相冲突。

简洁回答可能遗漏管辖范围、例外情形、生效日期或资格条件。每一项遗漏都会让答案更易阅读,却也使其更不宜照做。

政府信息也经常发生变化。聊天机器人必须检索当前材料、区分官方来源,并保留相关限定条件。

依赖内部训练数据的模型可能会自信地给出已过时的规则。即使接入网络的系统,也可能检索到二手摘要,而非现行机构页面。

引用链接有所帮助,但无法解决所有问题。被引用的页面可能只支持生成答案的一部分。

用户仍须打开来源、找到相关段落,并确认聊天机器人是否正确呈现了其内容。许多人不会完成每一步。

因此,问责需要一条清晰可见的路径。面向公众的公民聊天机器人应标明权威来源、显示相关更新时间,并提供人工升级渠道。

它还应区分一般性指导与官方裁定。居民必须在采取行动前看到这一界线,而不是在系统造成困惑之后。

政府机构在这方面拥有一项重要优势:它们掌握着聊天机器人所需的大量一手信息。

它们可以发布为人类和检索系统设计的结构化、易获取且最新的材料,也可以维护版本记录和纠错流程。

这一更广泛的教训同样适用于知识工作者。流畅的回答应始终与支撑它的文件保持关联。

可搜索的知识库可以减少摩擦,同时保留回溯原始记录的路径。只要决策会带来后果,这种与来源的连接就至关重要。

最强大的信息服务应将对话式访问与机构问责结合起来。缺少任何一项,都会留下严重弱点。

准确性研究令信任逆转更趋复杂

在被报道的信任优势出现之际,独立评估仍持续发现,领先聊天机器人在时事新闻和公民议题上表现不佳。

彭博社报道的一项5月研究测试了 ChatGPT、Claude、Gemini 和 Grok,涵盖超过3,100个有关新闻、选举、医疗保健和外交事务的问题。

研究发现存在广泛的准确性问题。这直接挑战了这样一种假设:自信的对话式回答比其来源材料更值得信任。

斯坦福大学另一项评估在2026年2月对六款商业聊天机器人进行了为期14天的测试。研究人员使用了基于六个地区 BBC 当日报道生成的2,100个事实性问题。

根据斯坦福大学的新闻审计,系统的表现因语言和地区而异。它们在印地语问题上的表现最差,并呈现出英语世界来源偏好。

这项研究并不意味着聊天机器人总会失败。它表明,关于聊天机器人准确性的总体说法掩盖了不同主题、语言、提示词和信息环境之间的重要差异。

模型可能会正确回答一个稳定的历史问题,却错过当天早晨发布的地方选举更新。用户通过同一个精致界面体验这两种回答。

系统的语气变化往往小于其可靠性变化。这种一致性可能让较弱的回答看起来与较强的回答一样可信。

本地信息带来了额外难度。市政规则因司法管辖区而异,也可能存在于格式不一致的页面中。

会议纪要、紧急通知、议会决定、许可变更和部门指引可能出现在不同系统中。有些记录仍被困在扫描文档或难以使用的门户中。

通用聊天机器人必须先识别正确的司法管辖区和当前文件,才能生成安全的回答。微小的检索错误就可能改变结果。

官方聊天机器人同样会出错。纽约市的 MyCity 聊天机器人在测试发现其对住房和就业规则给出错误回答后,招致批评。

城市研究所(Urban Institute)在其对地方政府 AI 的评估中引用了这一事件。该机构还警告称,当政府将测试不足的工具用于面向居民的服务时,可能损害公众信任。

该机构建议采取渐进式方法。与影响公共福利或执法的复杂决策相比,风险较低的内部协助和常规沟通是更安全的起点。

地方 AI 研究描述了三个广泛的使用层级,从员工协助到与居民沟通,再到复杂问题解决。

这一框架有助于解释为何调查的标题结论需要谨慎解读。信任一个能查询办公时间的聊天机器人,并不等于信任自动化资格判定。

人们可能欢迎 AI 用于翻译、搜索、表单指引和常规问题。但同样的居民可能会拒绝将其用于警务、医疗服务或福利管理。

调查措辞同样重要。询问哪种来源提供更有用的信息,与询问谁应作出具有约束力的决定并不相同。

受访者可能更偏好聊天机器人的解释,但仍期望经选举产生的政府制定政策,并对错误负责。

因此,现有证据支持一个较为有限的结论。对话式系统正作为界面获得更多权威,但其事实权威仍是有条件的。

这仍是一项重大转变。界面会影响人们接触到哪些事实、这些事实如何被呈现,以及用户是否会查看原始证据。

危险不仅在于一句捏造的话。更在于人们的注意力逐渐从可问责的第一手来源转向生成式摘要。

地方政府面临回应压力

最有力的回应不是发动反对聊天机器人的政治运动,而是围绕清晰度、证据和人工审核重新设计公共信息。

地方领导者首先需要承认服务缺口。居民不应必须具备机构内部知识,才能找到基本信息。

CivicPlus 的研究发现,72%的居民通过数字渠道与地方政府互动。该机构还报告称,54%的居民会将市政网站质量与领导质量联系起来。

这些发现表明,即使底层机构运作有效,糟糕的数字服务也可能成为政治负担。一个令人困惑的网站会传递混乱感。

CivicPlus 还报告称,在没有进一步背景的情况下,只有21%的居民支持地方政府探索 AI。另有42%的人表示,他们的支持取决于具体使用场景。

这种区别应指导部署。政府可以从边界清晰、结果可衡量的狭窄任务开始。

聊天机器人可以查询会议议程、说明在哪里缴费,或转交服务请求。每个回答都可以引用经批准的页面,并提供人工协助。

除非由具备资质的权威人士审核,否则系统应避免就法律身份、福利资格、执法或紧急安全给出最终答案。

每个回答都应说明聊天机器人掌握哪些信息。对于时效性指引,还应披露其背后的日期和来源。

地方机构在引入对话式软件之前,需要先建立内容治理机制。如果其来源页面相互矛盾,聊天机器人就会复现或放大这种冲突。

各部门应为高影响力信息指定负责人。这些负责人需要有明确的时间表,用于审查规则、链接、表单和紧急说明。

机构应测试真实的对话,包括拼写错误、追问、模糊地点,以及涉及多个部门的请求。

只测试理想提示词会造成误导性的印象。居民很少会使用政府网站中的语言来表述问题。

针对市政聊天机器人的独立研究已记录到自信的幻觉、虚构链接、过时信息和语义漂移。语义漂移是指回答逐渐偏离用户实际问题的情况。

因此,公开测试应包括成对问题和变化的上下文。测试应衡量聊天机器人能否在多轮对话中保留司法管辖区、日期和资格条件。

机构还需要建立纠错闭环。居民应能标记错误回答,而无需再经历另一套复杂流程。

工作人员必须审查高风险报告、修正底层来源,并确定类似回答是否需要重新核查。

这种方法让问责变得可见。它告诉居民,聊天机器人是公共信息的界面,而非独立的公共权威。

政治领导者也需要更直接地沟通。聊天机器人不应成为居民获取通俗解释的唯一渠道。

官方页面可以先给出实用答案,再提供法律细节和支持记录。机构可以发布简短摘要,同时不放弃严谨性。

翻译和无障碍格式应得到同等重视。一个只适用于英语流利使用者的系统,会加深现有的服务缺口。

人工联系渠道必须保持可用。有些问题涉及恐惧、紧迫性、个人情况或相互矛盾的记录,生成式回答无法安全地解决。

目标并非为了摩擦本身而保留摩擦,而是在让责任仍归属于公共机构的前提下,消除可避免的摩擦。

如果政府达到这一标准,聊天机器人就会成为交付层,而非竞争性的权威。如果做不到,商业 AI 系统将替它们定义公众的信息体验。

读者接下来应关注什么

三个信号将表明,聊天机器人信任是会成为持久权威,还是仍只是对令人沮丧的政府沟通的反应。

第一个信号是针对本地信息的独立准确性测试。评估者应在不同城市、语言和政策领域测试真实的市政问题。

最有用的结果将把常规导航与高风险指引区分开来。单一的总体准确率会掩盖最重要的风险。

如果系统在最新、特定司法管辖区的问题上表现改善,调查中的信任逆转将获得更坚实的事实支持。持续的失败则会扩大认知与现实之间的差距。

第二个信号是政府在可见保障措施下的采用。机构将继续增加对话式搜索、翻译和居民支持工具。

读者应关注来源引用、更新日期、人工升级渠道、保留政策和公开的测试结果。仅有“聊天机器人”标签,几乎无法说明部署是否负责。

清晰的保障措施将表明,地方政府可以在维持问责的同时匹配商业服务的便利性。不透明的推出方式则会增加造成破坏性错误的可能性。

第三个信号是人们在收到回答后的行为。使用量增长并不能说明居民是否核实聊天机器人输出,还是将其视为最终结论。

未来调查应询问用户是否会打开引用、比较官方页面,以及是否会基于生成式指引改变决定。这些行为比一般性的热情更重要。

政府和模型提供商也应追踪更正情况。涉及截止日期、资格、选举或紧急信息的重复错误尤其值得严格审查。

最初的调查结果捕捉到一种重要情绪,但并未决定这场竞争的结果。人们正在奖励那些让信息更易使用的系统。

现在,更艰难的考验开始了。聊天机器人能否在保持这种便利性的同时,展示其证据、不确定性和局限?

读者应向每一种信息工具要求这两项品质。索要来源、核查日期,并向负责机构确认会产生重要后果的指引。

聊天机器人信任的下一阶段,不会由自信的文笔决定。它将由一个清晰的回答在有人据此采取行动时是否仍然准确来决定。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page