选举 AI 的准确性正在提升,但选民仍需依赖官方来源
- Martin Chen

- 8月6日
- 讀畢需時 13 分鐘
Google News 在 2026 年中期选举前带来了一个令人鼓舞的结果:领先的 AI 工具在近期一项选举研究中没有出现可核实的事实错误。与 2025 年末的测试相比,这似乎是决定性的进步。然而,这些工具仍经常遗漏候选人,也未能引导选民前往官方选举网站。
这一差异至关重要,因为技术上正确的回答,仍可能让人无法找到投票所需的信息。不完整的候选人名单并不包含虚假姓名,却依然会令选民对选情形成失真的认识。
这项新的选举 AI 研究考察了 ChatGPT 和集成于 Google Search 的 AI 界面。研究人员在两轮测试中收集了 899 份回答,其中包括 2026 年初主要调查期间的 402 份回答。
States United Democracy Center 发现,两轮测试之间确实取得了进展。在初步测试中,Google AI 的事实错误率为 6.9%,ChatGPT 为 8.2%。在范围更窄的 2026 年测试中,两个平台均未出现可核实的事实错误。
但在相关查询中,ChatGPT 返回的州长候选人名单有 88.9% 不完整。在主要测试轮次的所有回答中,它仅有 39.4% 提及州选举网站。Google AI 的这一比例为 55.6%,随后一次格式调整使许多受测回答不再提供解释性摘要。
这构成了选民面临的核心矛盾。AI 公司正在提升事实准确性,但选举信息还要求完整性、时效性、本地背景,以及清晰的行动路径。
搜索产品正被优化为即时回答问题。选举机构则是负责任的信息来源,其信息会随申报、截止日期、法院裁决和地方程序而变化。选民应将前者视为起点,将后者视为最终权威。
Google News 选举报告实际发现了什么
AI 的选举回答变得更准确,但研究并未发现它们已经成为选举机构可靠的替代品。
States United 在 2025 年 9 月和 10 月开展了初步调查。研究人员在六个政治竞争激烈的州中,测试了 216 份 Google AI 回答和 281 份 ChatGPT 回答。
这些州包括 Arizona、Michigan、Nevada、North Carolina、Pennsylvania 和 Wisconsin。问题涵盖选民登记,以及初选和大选的日期。
第二轮测试于 2026 年 1 月和 2 月进行,重点关注 Arizona、Michigan 和 Pennsylvania,其中部分问题未指明州别。
研究人员测试了未登录账户的免费版 ChatGPT。他们还在无痕浏览器中,以及通过具有选举怀疑论浏览记录的账户,测试了 Google AI。
该研究依据官方州级来源,对离散的事实主张进行了编码。研究内容包括登记、投票地点、邮寄投票、选举日期、候选人阵容和计票等议题。
这一方法带来了研究中最令人鼓舞的发现。包含可核实事实错误的回答比例,从 Google AI 的 6.9% 和 ChatGPT 的 8.2%,在第二轮中降至零。
这一结果值得认可。早期选举测试显示,生成式 AI 可能虚构投票地点、错误说明截止日期,或提供过时指引。避免这些直接失误,降低了一项明确的风险。
不过,未检测到错误并不等于普遍准确。主要测试轮次覆盖三个州、限定的问题集合,以及产品行为快速变化的数周时间。
它衡量的还是已出现主张是否正确。这种方法不会自动将遗漏候选人或缺少行动链接归类为事实错误。
这一界限解释了为何研究的标题数字与其实用发现看上去差异如此之大。一份回答可以只包含真实陈述,同时排除会改变选民决策的信息。
原始报道通过一个简单例子捕捉了这种张力。聊天机器人可能会识别共和党和民主党候选人,却遗漏所有第三党候选人。
这份回答中的陈述未必有任何错误。但选民仍可能合理地得出结论:只有两名候选人参选。
该研究也没有比较所有主要助手。Claude、Copilot、Gemini 的独立聊天机器人、Grok 和 Perplexity 均不在其主要测试范围内。
因此,其结论适用于受测产品和测试条件,不应被视为对更广泛 AI 市场的权威排名。
即使在这个有限范围内,这一改进仍然重要。更难的问题在于,事实准确性是否代表选举辅助的正确标准。
正确的事实仍可能产生糟糕的投票回答
选举指引必须完整且可执行,而不能仅仅没有研究人员可以标记为错误的陈述。
设想一位选民询问如何登记。聊天机器人或许能准确说明资格规则,却遗漏官方登记入口。
另一位选民可能会询问在哪里投票。一份回答可能泛泛说明投票地点,却不要求提供识别正确选区所需的位置信息。
候选人名单的结果最清楚地暴露了这一问题。ChatGPT 在州长相关查询中有 88.9% 给出了不完整名单,在州检察长相关查询中这一比例为 35.7%,在州务卿相关查询中为 28.6%。
Google AI 摘要同样表现不佳。其州长相关查询中有 44.4% 不完整,另外两个全州职位的查询中则有 42.9% 不完整。
Arizona 在很大程度上推动了这一模式。测试时,该州州长候选人阵容至少包括九名已宣布参选、分属多个党派的候选人。
所有涉及 Arizona 州长候选人的受测文字摘要均不完整。Michigan 的比例达到 77.8%,Pennsylvania 为 44.4%。
这些失误反映的是结构性问题,而非一道困难的知识问答题。候选人阵容会随着人们提交申请、退选、取得资格、面临异议或失去选票资格而变化。
语言模型从历史信息中学习,且往往定期检索网页。州级申报数据库则代表当前的法律记录。
模型或许可以根据近期报道识别几位知名候选人,却遗漏昨天刚提交申请、知名度较低的候选人。其简洁的呈现方式可能使这份不完整名单看起来像最终结果。
来源选择让这一弱点更加令人担忧。在初选测试中引用的 3,481 个链接里,Wikipedia 占 12.3%。
Wikipedia 可以提供有用的背景信息,但其页面是开放编辑的。对于正在进行的申报窗口或特定司法辖区的选举程序,它们并非权威记录。
包括 Reddit 和 YouTube 在内的混合内容来源,占被引用链接的另外 7.6%。这些平台上的部分帖子来自选举官员,另一些则并非如此。
合计来看,Wikipedia 以及混合或不可靠来源约占被引用链接的五分之一。因此,大量来源链接并不保证来源具有权威性。
ChatGPT 在每份州长相关回答中平均引用 5.61 个 Wikipedia 链接。其针对州务卿和州检察长选举的回答,平均包含 6.4 至 6.8 个此类链接。
当被问及投票地点时,这些模型表现得更负责任。ChatGPT 在 88.2% 的此类回答中提及州选举网站。
在其他问题类型中,这一表现降至 33.6%。Google AI 摘要在投票问题与其他选举查询之间也呈现类似差距。
投票地点迫使系统承认一项限制。没有地址和当前选区地图,它无法自信地提供个性化地点。
因此,最安全的回答是引导用户使用官方查询工具。同样的设计原则也应适用于登记截止日期、选票规则和候选人申报。
AI 系统应识别何时一个问题依赖于不断变化的政府记录。随后,它们应将选民引导至负责任的信息来源,而非模仿最终权威。
Google AI 在研究期间改变了回答形式
最重要的风险并非虚构事实,而是一项产品决策在毫无预警的情况下改变了选举信息的呈现方式。
大约在 2026 年 2 月 2 日,Google AI 开始在无痕测试条件下,以链接列表取代书面的选举摘要。输出内容写道:“Here are top web results for exploring this topic.”
在调整前,这些回答平均有 224.5 个词。之后的许多回答只包含九个词和链接结果。
通过具有选举怀疑论浏览记录的账户收集到的全部 79 份回答,均出现在调整之后。每一份都采用了仅链接格式。
这一推出并非完全一致。在 2 月的若干日期中,摘要曾短暂恢复,随后又重新出现仅链接输出。
研究人员还观察到,一些非选举查询仍会获得摘要,而选举问题则收到链接列表。研究无法确定造成这一差异的确切原因。
这一变化带来了取舍。Google AI 不再生成解释性文字,从而减少了缺乏支持的表述或误导性综合的机会。
与此同时,用户失去了关于哪个目标网站属于官方来源的指引。更多链接并不必然让输出更易于使用。
调整前的摘要平均包含 3.7 个来源。仅链接回答平均为 9.6 个,而 ChatGPT 平均为 10.2 个。
在格式调整前,Google AI 摘要有 55.6% 的回答提及官方州选举网站。由于新格式不提供引导性文字,这一指标随后降至零。
仅链接输出仍包含政府链接,但并未说明哪个链接代表该州的选举主管机构,也未说明选民应从何处开始。
正是在这里,Google News 的报道超越了准确性基准这一层面。产品界面可以在同一选举周期内改变公民信息的传递方式。
这种不稳定性使外部验证变得困难。研究人员可以在 1 月测试某个版本,却在几天后遇到实质不同的体验。
选举官员在准备公开指引时也面临同样问题。他们无法假定一个平台的引导行为会在登记截止日期或 Election Day 前保持稳定。
该研究询问 Google AI 为何其格式发生变化。其生成的回答提到了准确性、减少幻觉、出版商担忧,以及使 AI 搜索更具商业化价值的努力。
这一回答由产品生成,并非经核实的公司声明。它无法证明 Google 的内部理由。
不过,它凸显了一个真实的政策问题。搜索界面需要平衡用户回答、出版商流量、广告、安全控制和产品互动。
选举信息并不适合这些不断变化的激励机制。无论商业表现如何,正确的截止日期或官方候选人记录都具有公民价值。
最安全的保障措施应存在于生成文字之外。固定的选举模块可以始终链接至相应的政府网站。
Anthropic 已采用相关做法。Claude 会显示横幅,将选举问题引导至 TurboVote——由 Democracy Works 运营的一项无党派服务。
OpenAI 表示,其 2026 年保障措施包括与美国 Democracy Works 建立合作伙伴关系。该合作旨在通过 ChatGPT 提供可靠的投票与选民登记信息。
这类转介较少依赖模型的措辞。它们也能在回答长度、检索方法和广告实验发生变化时保持有效。
AI 搜索正在成为新的选举战场
压力已不止于模型准确性,因为竞选团队和影响力操作者正越来越多地为 AI 检索塑造内容。
传统搜索引擎优化试图让网页在普通搜索结果中获得靠前排名。生成式引擎优化则针对由 AI 回答选中并概括的材料。
民主与技术中心(Center for Democracy and Technology)的选举政策分析师 Isabel Linzer 将当前环境描述为生成式引擎优化阶段。
竞选团队希望其政策页面、人物简介和偏好的叙事框架出现在聊天机器人的回答中。选举办公室则需要让权威指引获得同样的可见度。
不良行为者也可以采取类似策略。他们能够发布由大量页面组成的网络,以检索系统易于处理的格式反复传播虚假叙事。
这种风险并不需要入侵模型或修改其训练数据。相关行动可以瞄准助手回答时事问题时会检索的实时网络来源。
算法投毒分析描述了行为者如何组织信息,以在 AI 中介搜索中获得可见度。这使得来源溯源、信源权重和官方转介变得愈发重要。
这一问题在地方选举中尤为突出。全国性新闻机构很少为每个县、学区委员会和市政选举持续维护完整、实时的候选人名单。
AI 系统可能会用竞选网站、社交网络、可编辑百科全书或低质量地方网页的材料填补这一信息缺口。每类来源都带有不同的激励机制。
Google News 仍有助于发现有关这些风险的报道。它并非选票资格、选民登记、投票地点或地方选举程序的官方记录。
AI 生成的摘要在选民与底层来源之间增加了一层。这一层可以澄清复杂信息,但也可能淡化不确定性。
个性化带来了进一步的担忧。系统可能根据既往对话、浏览模式、位置线索或推断出的偏好来调整措辞。
States United 的研究尝试通过一个具有选举怀疑论浏览历史的账户来测试这一点。然而,Google 的格式变化阻碍了其与无痕模式摘要进行干净比较。
个性化账户的所有回答均采用仅链接输出。因此,研究人员无法将个性化效应与平台范围内的呈现方式变化区分开来。
这一悬而未决的问题很重要,因为政治信息不应根据用户被推定的意识形态悄然变化。两名选民提出相同的程序性问题,应当获得相同的底层事实。
聊天机器人也可能变得迎合用户,也就是说,它会过于轻易地适应用户的假设。结果可能是认可误导性的前提,而不是予以纠正。
例如,用户可能询问官员将一个实际上从未变更的投票地点“迁移”到了哪里。听起来乐于助人的模型可能接受这一前提,并搜索支持它的材料。
政治竞选活动也有强烈动机影响候选人描述。一个从竞选页面拼凑回答的系统,可能在缺乏足够背景的情况下复述选择性的主张。
这些压力使 AI 搜索成为信息基础设施问题。核心问题不再是模型能否复述一个选举日期。
平台必须决定哪些来源应获优先权、何时需要披露不确定性,以及何时产品应停止摘要。这些选择会影响数百万人的个体信息获取路径。
为什么官方选举网站仍是最终权威
州和地方选举办公室仍是最佳信息来源,因为它们负责执行 AI 系统试图描述的规则。
美国选举横跨 50 个州和数千个地方辖区。登记系统、截止日期、提前投票、邮寄选票、身份证明规则和投票地点都存在巨大差异。
这些细节也会变化。立法机构修订法规,法院发布命令,选举委员会制定程序,紧急情况也可能改变投票地点。
全国性的 AI 助手可以提供总体背景。它无法承担在选民所在辖区实施相关程序的法律责任。
州选举官员维护登记系统、公布截止日期、认证候选人并报告结果。县级和市政官员往往管理最地方化的细节。
这种机构角色并不意味着每个政府网页都完美无缺。官方网站可能令人困惑、内容过时、缺乏无障碍支持,或难以在移动设备上浏览。
不过,负责机构可以纠正自身发布的信息。它也与所描述的流程存在法律和行政上的联系。
聊天机器人则没有这种关系。即使选举办公室已发布更新页面,它仍可能复述旧的官方页面。
因此,选民应采用一套简单的核验阶梯。
当需要宽泛解释来帮助界定问题时,可以先使用 AI。
确定负责具体流程的州或地方机构。
直接打开官方政府网站。
在该网站确认日期、地址、资格规则和候选人备案信息。
若答案仍不明确,请联系选举办公室。
这种方法保留了 AI 的便利性,同时不赋予它所不具备的权威。它也减少了对自信措辞或冗长引文列表的依赖。
联邦选举 AI 指引同样强调了准确性、冒充和误导性内容相关的风险。该指引向选举管理人员提供资源,以帮助他们将选民引导至官方信息。
选举办公室也有需要完成的工作。它们的网页必须易于理解、保持最新、适配移动端,并且便于搜索系统识别。
结构化数据可以帮助机器区分官方登记截止日期与对该截止日期的评论。稳定的 URL 使政府网页更容易被一致引用。
通俗语言同样重要。如果官方页面将答案埋藏在扫描文档中,AI 系统可能会偏向一个更清晰但权威性较低的来源。
States United 建议与候选人备案系统直接集成。这类连接将缩短法律备案与助手检索到相关信息之间的滞后时间。
平台还可以增加常设选举横幅。这些模块应出现在涉及登记、投票地点、候选人、选票和结果的查询中。
横幅并不是完整的解决方案。用户可能会忽视它,错误摘要仍可能造成伤害。
不过,稳定的转介可建立一条可追责的路径。它会告诉用户,在采取行动前应到哪里确认答案。
知识工作者已经在低风险场景中采用类似的核验习惯。他们保留来源、比较版本,并将生成的摘要与原始记录区分开来。
个人AI 知识库可以帮助整理研究并保留引文。它无法将二手来源变成选举权威。
同样的原则适用于每一位选民。如有需要,可以保存有帮助的解释,但应向负责执行该程序的机构核验可操作的细节。
2026 年中期选举前值得关注的事项
三个信号将显示 AI 平台是否正在成为更安全的选举指南,还是仅仅更擅长听起来准确。
第一个信号是稳定一致的转介行为。ChatGPT 和 Google AI 应将选举相关问题引导至正确的州或地方官方网站。
这种转介不应只适用于投票地点,还应涵盖登记、邮寄投票、候选人备案、身份证明规则、选票程序和结果。
全平台横幅将比生成文本中偶尔出现的链接提供更清晰的证据。它也能在回答格式变化时保持可见。
如果官方转介变得普遍,该研究的核心批评将会减弱。如果其仍不一致,较低的事实错误率所能提供的保护将很有限。
第二个信号是备案截止日期后的候选人名单完整性。活跃选战构成了一项严格测试,因为参选阵容可能快速变化。
研究人员应在选票获得认证后重复相同问题,并将每一位被点名的候选人与官方备案记录进行比对。
若出现改善,将表明实时检索或政府数据整合正在发挥作用。持续缺漏则会证实,通用搜索在选举名册方面仍存在结构性弱点。
测试应包括较小规模的选举,而不仅是全州职位。地方选举的新闻报道较少,维护良好的二手来源也更少。
第三个信号是产品在选举日之前的稳定性。Google 在研究中途的格式调整表明,公民信息体验能够多么迅速地发生变化。
研究人员和选举官员应记录,摘要、链接、警告、引文和个性化结果是否会在重大截止日期前后发生变化。
平台应在选举回答系统变更时发布明确通知,并说明哪些官方数据来源支撑其保障措施。
稳定的界面将增强人们对于安全机制能够经受商业和技术更新的信心。突然而未记录的变化则会削弱这种信心。
普及程度使这三个信号都更为紧迫。2026 年 6 月的一项聊天机器人使用调查发现,约半数美国成年人使用过 AI 聊天机器人。
约四分之一受访者表示每天使用,而约十分之四使用聊天机器人进行信息搜索。仅 ChatGPT 就有 44% 的成年人使用过。
这些数据并未揭示有多少人会寻求选举指导。但它们表明,在中期选举前,AI 助手已经成为人们熟悉的信息工具。
因此,真正的衡量标准并不是聊天机器人是否胜过旧模型,而是选民能否正确完成下一项必要行动。
Google News 可以引导读者关注重要报道,AI 也可以解释陌生的选举概念。二者都不应取代由选举官员维护的最新记录。
在依赖某个答案之前,请问三个问题:它是否完整、是否最新,以及是否链接至负责的政府机构?
如果其中任何一个答案是否定的,请继续核查。对于 2026 年选举周期而言,更好的 AI 是有益的进步,但核验仍是负责任投票的一部分。


