AI 搜索诈骗答案危及用户信任
- Ethan Carter

- 8月15日
- 讀畢需時 13 分鐘
Google 已将 Search 打造成答案引擎,但诈骗联系方式暴露了这一转变中的危险弱点。一则突出 Panda Security 警告的 Google News 内容,再次让这一问题受到关注。即使底层信息本应接受更严格审查,答案框依然可能显得权威可信。
问题并不在于每一条 AI Overview 都含有欺诈信息。Google 表示,其防御系统每天会拦截数亿条诈骗性结果。矛盾始于用户尚未查看来源,综合生成的答案就已先出现在屏幕上。
传统搜索要求人们在链接之间作出选择。AI 搜索则替他们完成这一选择,再通过用户熟悉的 Google 界面给出简洁回复。当答案包含电话号码、付款指引或账户恢复流程时,一个错误细节就可能直接把用户带入骗局。
这改变了安全问题的性质。用户不再只需判断陌生网站看起来是否可信,还必须判断 Google 自己的答案框是否如实反映了可靠来源。
诈骗进入答案框内部
核心变化很简单:如果 AI 摘要先重复了欺诈信息,诈骗者就不再需要赢得最后那一次点击。
诈骗者长期以来一直操纵搜索排名、购买误导性广告、仿冒客服页面,并植入虚假电话号码。这些手法通常依赖于说服用户访问欺诈目的地。AI 生成的答案则提供了一条更短的路径。
攻击者可以在银行、航空公司、配送服务或科技公司的名称旁发布虚假客服电话。类似说法随后可能出现在论坛、低质量目录、被入侵的页面或一次性网站上。
AI 搜索系统会从网络中检索信息,并综合看似相关的内容。检索增强生成(RAG)让模型在生成答案时使用近期检索到的材料。这一过程让模型拥有最新信息,但也为被操纵的内容打开了通道。
最终答案未必看起来像广告或可疑搜索结果。它会出现在熟悉的 Google 页面顶部、经过精心呈现的摘要中。来源链接可能位于主要回复旁边或下方,而用户所需的具体信息则会立即显示。
有关虚假客服号码的报道说明了这种布局为何重要。面对航班取消、账户锁定、付款失败或包裹丢失的人,往往希望尽快解决问题。紧迫感会降低他们检查多个来源的可能性。
攻击者只需要受害者拨打电话。接听者可能冒充员工、索要账户信息、要求转账,或诱导安装远程访问软件。屏幕共享请求和付款提示会让这类接触尤为危险。
这不只是 AI 幻觉,即模型凭空编造没有依据的信息。系统也可能准确复述攻击者刻意放到网上的虚假说法。在这种情况下,答案基于检索材料,但材料本身已经被污染。
这一区别很重要,因为增加更多引用并不能自动解决问题。多个低质量页面可能重复同一个被植入的号码。表面上的多源一致,可能反映的是协同操纵,而非独立验证。
综合生成的答案还可能剥离警示信号。异常的域名、糟糕的页面设计、激进的弹窗和可疑的作者身份,都可能提醒谨慎的访问者。答案框却可以抽取其中一行内容,同时隐藏不可信的上下文。
Google News 并未创造这种攻击模式。不过,更广泛的 Google 界面有助于建立使这种模式奏效的信任感。用户可以从新闻内容或普通搜索进入 AI 生成的回复,却不会觉得自己进入了高风险环境。
因此,这种变化既是行为层面的,也是技术层面的。搜索过去会展示证据供用户评估。如今,答案框越来越多地在评估开始前就给出结论。
Google News 和 Search 现在承担了更多信任责任
当 Google 撰写用户看到的答案时,用户自然会赋予 Google 更大的责任,要求其确保每一个可执行细节的准确性。
Google 将 AI Overviews 描述为 Search 的一部分,并由其排名和质量系统提供支持。该公司也会在生成摘要旁放置链接,方便用户进一步查看支撑内容的网页。
这种设计形成了复杂的责任划分。Google 可以辩称,信息来自独立网站。用户则完全可以认为,是 Google 选择、总结并突出展示了这些信息。
当答案包含行动指引而非一般背景时,紧张关系会更强。一段历史事件摘要具有一种风险等级;电话号码、登录路径、医疗指引或付款流程则具有另一种风险等级。
Google 自己的安全建议也承认联系方式的敏感性。其指引称,寻找客服的用户应查看公司的官方网站。它还警告称,一些机构根本不提供电话支持。
这一建议实际上限制了答案框应鼓励用户采取的行动。如果官方网站仍是最安全的来源,那么 AI 生成的电话号码本身就不能作为可信终点。它只能作为未经验证的线索。
Google 表示其系统正在改进。在其 2025 年发布的关于诈骗防御的说明中,该公司称 AI 帮助其识别出多 20 倍的诈骗页面。它还表示,Search 每天会拦截数亿条诈骗性结果。
这些数字说明了 Google 防御工作的规模,但并不能证明每一条生成答案都是安全的。一个系统可以清除海量滥用内容,同时仍遗漏少量后果严重的细节。
错误率与影响程度之间的区别很重要。罕见的错误餐厅描述只会令人烦恼;罕见的欺诈性银行号码则可能导致凭证、资金、身份证件或设备暴露。
Google 正承受来自两个方向的压力。它希望 AI 答案显得即时而完整,也需要让用户理解何时必须进行外部核实。
更多警告可能降低产品的便利性,更少警告则可能助长不当的信心。这正是搜索引擎开始以单一、连贯的声音发言时所带来的信任负担。
其他 AI 搜索提供商也面临相同的结构性压力。Microsoft Copilot、Perplexity、ChatGPT search 和其他答案引擎都会在生成简洁回复前检索在线材料。它们的界面各不相同,但每个系统都会将多个来源压缩为一个看似确定的结论。
由于 Search 的覆盖范围和熟悉的角色,Google 面临更严格的审视。许多用户多年来一直把其首页视为最安全的起点。在用户尚未了解其新失效模式之前,AI Overviews 已经借用了这种长期积累的信任。
Google News 又增加了一层被感知的正当性。读者通过公认的新闻入口看到标题时,可能会认为周围的信息环境已经经过充分审查。然而,聚合、排名和答案生成其实是不同的过程。
一条新闻结果可以准确识别真实发布者,而相邻的 AI 回复仍可能错误处理某项具体说法。对 Google 某一界面的信任,不应自动转移到另一界面生成的每一个细节上。
验证尚未开始,便利性已占上风
答案框之所以改变用户行为,是因为它消除了过去进行来源评估时的停顿。
Pew 的研究人员分析了美国成年人在 2025 年 3 月进行的 68,879 次 Google 搜索。他们的点击行为研究发现,其中 18% 的搜索生成了 AI 摘要。
在包含 AI 摘要的访问中,用户点击传统搜索结果的比例为 8%。没有 AI 摘要的访问中,这一比例为 15%。在带有摘要的访问中,只有 1% 会点击摘要内引用的链接。
这项研究并未衡量诈骗暴露情况,但它表明许多用户在没有打开背后证据的情况下就接受了搜索页面。这种行为提高了 Google 放入生成回复中的每一个细节的重要性。
Pew 还发现,26% 带有摘要的访问会结束浏览会话;没有摘要的页面中,相应比例为 16%。对于许多搜索而言,摘要实际上已成为最终目的地。
这一结果解释了为何来源链接只能提供部分防护。当几乎没人打开引用时,引用的保护价值有限。生成文本仍是主要的产品体验。
当用户提出狭窄、交易导向的问题时,风险最为突出。“这家公司是做什么的?”是在询问一般信息;“我该拨打哪个号码?”则是在要求系统选择一个可信的通信渠道。
客服查询往往同时伴随着紧迫感和有限的背景信息。用户可能正站在机场登机口、回应欺诈警报,或试图恢复被锁定的账户。在压力之下,他们更不可能进行来源审查。
诈骗者会围绕这种情绪状态设计下一步。所谓客服人员可能要求立即行动,声称账户已被入侵,或称退款即将失效。AI 答案提供联系方式,随后社会工程攻击便接手了。
界面本身也会赋予权威感。AI Overview 使用统一的字体、干净的间距和 Google 品牌标识。它不会继承可疑说法原始页面的视觉混乱。
这一过程可能在未经证明真实性的情况下洗白可信度。系统将零散的网页文本转化为自信的陈述。读者看到的是自信,而检索和来源选择中的不确定性则被隐藏。
问题也不限于电话号码。攻击者还可以植入虚假的软件下载说明、加密货币钱包地址、恢复步骤、优惠码,或指向凭证窃取页面的链接。
只要答案会促使用户采取外部行动,风险就会增加。拨打号码、安装应用程序、共享屏幕、汇款或输入凭证,都应触发更高的验证标准。
这一标准不能只依赖流畅的措辞。语言模型被设计用于生成连贯文本。连贯性几乎无法告诉用户,一个电话号码是否真正属于其旁边所写的机构。
类似问题也会影响工作场所的研究。员工越来越常将生成答案复制到工单、报告和内部聊天线程中。一项缺乏支持的细节在失去原始来源上下文后,可能会在组织内部传播。
团队需要为涉及安全、财务、客户或合规的决策保留可见的证据链。可搜索的AI 知识库可以保存已批准的文档及其上下文,但它仍需要可信的来源选择。
更有用的思维模型并不是“AI 的回答都是错的”,而是“AI 的回答是证据质量各异的摘要”。这种理解既保留了其便利性,也不会自动赋予它权威。
更多来源并不总能带来更安全的答案
即使引用的是真实网页,AI 搜索仍可能失败,因为检索质量和来源独立性仍是两回事。
传统搜索引擎对文档进行排序。AI 驱动的搜索引擎则先对文档排序,再加以解读。每增加一个环节,都会引入关于相关性、权威性、一致性和呈现方式的选择。
模型可能因为某个恶意页面与查询措辞高度匹配而检索到它,随后也可能准确引用该页面。即便模型没有捏造任何内容,最终答案仍可能造成伤害。
研究人员在 2025 年 USENIX Security Symposium 上对这一问题进行了广泛测试。他们的 AI 搜索研究使用来自多个威胁数据库的恶意材料,评估了七款已投入生产的 AI 驱动搜索引擎。
研究人员报告称,按照其评估框架,47% 的受测回答存在风险。他们还发现,34% 的回答直接引用了有害内容。
这些百分比不应被视为 Google Search 的日常失败率。该实验刻意采用恶意输入,并测试了多种产品。它衡量的是对抗条件下的脆弱性,而非普通消费者流量中的表现。
不过,其作用机制依然具有现实意义。研究人员证明,AI 搜索系统可能将钓鱼网站识别为合法的官方网站。他们还展示了在线文档仿冒如何误导生成式回答。
该研究比较了 AI 搜索与传统搜索,发现 AI 驱动系统在实用性和安全性两方面整体表现更好。这一发现避免了“链接列表总是更安全”这种过于简单的结论。
真正的权衡更为精确。AI 综合回答可以提高相关性,并减少用户接触某些恶意页面的机会;但它也可能把检索到的虚假信息变成直接建议。
传统搜索结果会展示域名、摘要、相互竞争的链接以及排名差异。这些线索可帮助细心的用户识别不确定性。AI 综合回答则代替用户消解分歧,从而降低了这种摩擦。
攻击者同样可以利用重复性。如果多个页面包含同一个虚假数字,检索系统可能将这种模式理解为相互印证。然而,这些页面可能彼此抄袭,或同属一场攻击活动。
因此,来源多样性不能只靠计算 URL 数量。可靠系统还应识别共同所有权、复制文本、被攻陷的网站、近期域名变更,以及与机构官方渠道之间的冲突。
时效性带来了另一项挑战。新近植入的页面可能包含更符合紧急查询的更新关键词,比旧版官方支持页面更容易匹配。搜索的新鲜度可能反而削弱来源权威性。
被攻陷的合法网站尤其难以处理。受信任域名可能在所有者不知情的情况下托管被注入的内容。该域名既有的声誉也因此成为攻击者伪装的一部分。
Google 长期运营 Safe Browsing、垃圾内容分类器、排名保护机制和人工举报渠道。这些防线让 Search 能够在极大规模下更安全地运行。但 AI 回答仍需要针对生成式行动设计的控制措施,而不仅仅是针对危险目的地的防护。
URL 分类器可以在用户访问钓鱼页面前发出警告,却无法完全保护已经拨打答案中所复制诈骗号码的人。危险载荷已经离开了网页。
因此,高风险字段需要专门验证。电话号码应与官方联系页面比对。钱包地址不应由一般网页搜索结果综合生成。软件下载应指向经过验证的发布者渠道。
系统还应保留分歧。如果来源彼此冲突,最安全的输出可能是说明未找到经过验证的联系方式。拒绝给出一个看似方便的细节,可能优于选择出现次数最多的答案。
安全主张与产品承诺渐行渐远
Google 的防御能力可以显著提升,但以答案为先的界面仍会鼓励用户给予超出证据支撑程度的信任。
Google 的立场具有坚实的事实基础。该公司运营着少数机构能够匹敌规模的反滥用系统。它表示,AI 有助于在海量网络内容中识别协同诈骗活动和新兴威胁。
其回答功能也提供来源链接。自 AI Overviews 在美国广泛推出以来,Google 已对其作出调整,其中包括旨在减少荒谬或讽刺性回答的改动。
这些措施反驳了 Google 忽视问题的说法。搜索团队知道,对手会操纵排名和内容。该公司数十年来一直在应对垃圾信息、恶意软件、欺骗性广告和被黑网站。
但产品承诺已不再局限于帮助用户找到相关页面。答案框提供的是用户可立即据以行动的综合回答。这使标准从发现质量提升至结论质量。
Google 可以准确地说,大多数 AI Overviews 都很有帮助;批评者也可以准确指出严重的边缘案例。平均实用性与高影响力失败可以同时存在。
Panda Security 的警告正处于这一缺口之中。值得吸取的重点并不是必须放弃 Google News 或 AI Overviews,而是该界面的权威感超过了部分底层主张的确定性。
来自安全报道的报道描述了诈骗支持电话号码出现在 AI Overviews 中的案例。此类报道仍属于个别事件,而非对发生频率的完整衡量。
这一限制很重要。公开轶事无法证明欺诈性细节出现得有多频繁。截图可能已经过时,结果会因地点而异,而且 Google 也可能迅速移除不良回答。
研究人员也难以复现个性化或快速变化的搜索输出。今天测试的查询,明天可能返回不同的概览。账户、措辞、地理位置和浏览上下文都会影响页面。
因此,声称 AI Overviews 普遍不安全超出了现有证据所能支持的范围;声称问题已经解决同样言之过早。
可辩护的结论更为狭窄:生成式回答为恶意来源材料创造了可信的攻击面。现实世界的报告表明,有害的联系方式可能绕过现有防御机制。
用户应采用基于风险的验证规则。一般性解释可以作为起点;可执行的细节则需要由权威来源确认。
对于客户支持,请打开该机构的官方网站或应用程序。不要仅因电话号码出现在 AI 摘要、论坛、广告或目录中就信任它。
对于金融服务,请使用印在卡片上或认证应用内显示的号码。绝不要向来电者分享一次性验证码、密码或完整支付凭证。
对于软件,请使用开发者经过验证的分发渠道。即使回答将其描述为官方渠道,也应避免通过陌生域名推荐的安装程序。
对于账户恢复,请直接进入服务本身。合法代表不应要求远程控制、屏幕共享、礼品卡、加密货币或即时转账。
Google 也提供了类似的诈骗防范指南。它建议用户放慢节奏、核实来源,并通过官方渠道获取客户服务信息。
这类建议将部分负担重新转回用户身上。它是合理的建议,但也暴露了其中的矛盾:答案框只能在验证尚未成为必要步骤前节省时间。
长期解决方案不能只是让用户永久保持怀疑。Google 控制着检索、排序、呈现和警告设计。它能够在危险行动发生前,让不确定性变得可见。
Google News 读者接下来应关注什么
下一阶段将由三个信号来评判:行动层面的验证、透明的事件报告,以及独立的安全测试。
第一个信号是,Google 是否将联系方式和交易指令视为特殊风险类别。对于会涉及资金流动或账户开通的信息,普通相关性排序并不够。
经过验证的电话号码可以要求与机构官方网站域名或经认证的企业资料一致。如果 Google 引入更强的验证机制,将支持答案框能够安全处理交易型查询这一主张。
如果缺少此类控制,当前的矛盾就会持续存在。Google 一面继续提供直接答案,一面又建议用户到其他地方验证这些答案。
第二个信号是更好的事件透明度。Google 会发布有关被拦截诈骗页面的总体数据,但用户同样需要了解出现在生成式回答内部的有害细节。
有价值的报告应区分恶意链接、虚假支持电话号码、被攻陷域名和捏造指令,还应说明发现时间、移除时间和复发情况。
这些指标不应暴露攻击者可轻易绕过的防御方法,但应说明随着 Google 扩展 AI 搜索,答案层面的事件是否正在下降。
事件率下降将增强 Google 的安全论据。只有广泛移除总量、却没有针对答案的证据,仍无法解决核心问题。
第三个信号是可重复的独立测试。安全研究人员需要稳定的方法,来评估不同 AI 搜索产品中的来源质量、引文忠实度和高风险行动。
测试应区分普通事实错误与对抗性操纵,也应区分有害引文和直接在回答中给出的有害指令。
研究人员应在可能的情况下公布查询集、测试时间、地区和评估规则。生成式结果变化很快,因此透明的方法比孤立截图更重要。
独立测试还可以比较 Google、Microsoft、OpenAI、Perplexity 和其他提供商。这种比较将显示某一产品是否存在独特弱点,还是整个答案引擎模式都共享这一问题。
对于用户而言,操作规则已经很明确:将 AI Overview 视为快速摘要,而不是经过验证的权威信息。只要回答包含可能导致资金流动、账户暴露或设备变化的细节,就应打开来源进行核实。
Google News 可以呈现有关这些风险的有价值报道,而 Google Search 仍可能生成正在讨论的风险界面。这种反差概括了围绕 AI 搜索的更大张力。
答案框之所以有用,是因为它减少了操作成本;验证之所以必要,是因为被省去的操作过去也包含判断过程。在 Google 能够可靠地在产品中恢复这种判断之前,最安全的做法是多做一次核查。
在拨打电话、付款、安装软件或分享信息前,先问一个问题:该机构自身经过验证的渠道是否确认了这一细节?如果答案不明确,就停止。Google 的摘要可以开启搜索,但不应终结决策。


