AI 语音诈骗骗走退休老人 15,000 美元,而声音只是诱饵
据报道,一起 AI 语音诈骗从佛罗里达州退休老人 Sharon Brightwell 手中骗走了 15,000 美元,此前一名来电者似乎复刻了她成年女儿哭泣的声音。
电话里的声音称,Brightwell 的女儿在开车发短信时造成了一起严重车祸。大约一小时内,Brightwell 便取出现金,并将其交给了一名所谓的法律事务专员。
而她真正的女儿当时安然无恙,身处坦帕地区的另一个社区。
此案引发关注,是因为 Brightwell 认为自己认出的不仅是女儿的声音,还有她独特的哭声。然而,这种模仿只是一个精心操控的骗局中的一环。
第二名来电者冒充公设辩护律师。虚构的紧急事件涉及一名怀孕的车祸受害者、可能面临的牢狱之灾,以及要求立即支付的保释金。
来电者还告诉 Brightwell,不要向银行说明取款原因。这一指示使她与一个可能介入阻止骗局的渠道隔绝开来。
警方尚未公开确认犯罪分子使用了语音克隆软件。Brightwell 和她的女儿认为他们使用了这种软件,音频可能来自社交媒体。
这一核实缺口很重要。现有报道能够证实的是一次令人信服的冒充、一场协同实施的诈骗,以及 15,000 美元的损失,但无法确定所使用的软件或源录音。
尽管如此,此案符合一种已有记录的模式。FBI 目前会追踪包含 AI 相关信息的投诉,其中包括在虚构紧急事件中模仿亲属的危难诈骗。
核心矛盾已不再是合成语音与人类听觉之间的较量,而是声音识别与独立身份验证之间的较量。
人类听觉从来就不是为充当安全身份验证系统而设计的。生成式音频让这种弱点变得更容易被大规模利用。
这起 AI 语音诈骗始于熟悉的哭声
所谓的克隆声音先制造了情感上的确信,随后其他来电者再将这种确信转化为现金。
2025 年 7 月,Brightwell 在坦帕郊外多佛的家中接到了这通电话。电话里的声音听起来歇斯底里,似乎来自她的女儿 April Munroe。
来电者声称,她在开车发短信时撞到了一名孕妇。有关部门据称没收了她的手机,这也解释了为何电话来自另一个号码。
这一细节发挥了重要作用。它在 Brightwell 产生怀疑之前,便消除了一个最明显的警示信号。
随后,一名男子接过电话,自称是公设辩护律师。他说 Munroe 已被拘留,需要 15,000 美元现金作为保释金。
Brightwell 后来形容,这个声音绝不可能认错。“我了解我女儿的哭声,”她对报道此案的记者说。
Munroe 同样写道,模仿的声音与她一模一样。这两种说法都无法独立证明音频是如何生成的,但都解释了这种手段为何能够得逞。
犯罪分子并没有要求 Brightwell 判断一段很长的对话。他们先让她短暂听到痛苦的声音,随后便由一个权威角色作出解释。
这种结构降低了模仿过程中暴露不一致之处的风险,同时也将控制权转交给一个能够随机应变并回答具体问题的真人。
Brightwell 前往银行,取出对方要求的现金,将钱放进一个盒子里,然后回到家中。一名司机随后抵达并取走了现金。
这一据报道发生的过程同时出现在当地的受害者访谈以及后续的全国性报道中。
取走现金后,犯罪分子再次打来电话。这一次,一名自称代表伤者家属的人又索要 30,000 美元。
第二次索款改变了故事情节。所谓的车祸如今导致该女子腹中的孩子死亡,而她的家人据称威胁要提起诉讼。
Brightwell 没有再支付这笔钱。她的外孙最终在 Munroe 午休期间收到了她本人发来的消息。
直到那时,这家人才确认根本没有发生任何车祸。
这一事件说明,建议人们“留意像机器人的声音”并没有多大用处。诈骗之所以成功,是因为这种声音被嵌入了一套可信的社会关系和程序性话术中。
它还利用了人们对紧急事件的常见认知。手机被没收解释了陌生号码,而保密据称是为了保护 Munroe 的法律和经济利益。
Brightwell 前往银行,为阻止骗局提供了一个潜在的介入点。犯罪分子预判到了这一点,并给出了隐瞒取款目的的理由。
上门取款的专员又增加了一层隔离。Brightwell 无需操作陌生的支付应用,也不用把钱转入可疑的网络账户。
每个参与者的分工都十分明确。痛苦的声音建立信任,假律师指导行动,而专员则将现金取走。
这种分工比具体使用哪一种语音生成器更重要。只要周围的操作能让目标持续感到恐惧并忙于应对,即使音频并不完美,也可能奏效。
据全国性报道,希尔斯伯勒县的警探对此案展开了调查,但尚未公开确认其中涉及 AI。
这一尚未解决的问题应当限制外界对相关技术的断言,但不应掩盖调查人员和家庭已经面对的诈骗设计。
这一事件改变了熟悉声音在现实中的意义。声音识别可以开启一段对话,但已无法再安全地授权紧急付款。
为什么可辨认的声音已无法再证明身份
语音克隆攻击的是“认出某人”与“验证此人身份”之间的差异。
人们通过语调、发音、呼吸、情绪以及细微的说话习惯来辨认亲近的家人。这些线索之所以让人感到私密,是因为它们来自多年的相处。
但它们并不是秘密凭证。
语音克隆使用机器学习模型,生成具有目标说话者声音特征的语音。输出内容可以包含原本人从未录制过的话语。
模型不需要理解家庭关系。它只需要足够的声音信息,就能生成听起来可信的模仿语音。
公开音频可能来自社交视频、语音信箱问候语、直播、访谈、播客或工作场合的录音。Brightwell 所接电话背后的确切样本来源仍然未知。
简短样本也可以生成可辨认的结果,但质量会因模型、录音条件、语言和情感表达方式而异。声称普遍存在“三秒门槛”的说法过度简化了这些差异。
更重要的变化在于技术的易用性。生成合成语音已不再需要专业录音棚或专家团队。
面向消费者的服务可以自动完成大部分建模工作。随后,犯罪分子可以在通话中结合使用生成的语句、预录音频片段或真人接线员。
痛苦情绪可以掩盖输出中的缺陷。哭声、背景噪声、信号不佳以及刻意简短的回答,都会削弱听者仔细辨别语音的能力。
紧急事件的叙事还会改变人们评估证据的方式。他们会寻找能够证实亲人需要帮助的信息,而不是检验每个细节是否内在一致。
来电者不需要在实验室条件下制造完美的复制品。这个复制品只需要撑过一名惊慌失措的亲属最初几秒钟的注意即可。
这正是所谓的 AI 语音诈骗与早期“祖父母诈骗”的不同之处。传统诈骗者往往通过模糊的问候,让受害者自行推断来电者身份。
生成或精心复刻的声音可以消除最初的疑虑。受害者补全情感经历,而犯罪分子则提供紧急情节。
研究人员一再警告,各种产品的安全保障措施仍不一致。Consumer Reports 在 2025 年的一项评估中调查了六款语音克隆产品,发现其同意机制存在重大缺陷。
据报道,对于其中四款受测产品,研究人员无需提供具有实质意义、能够证明说话者授权的技术证据,便能利用公开音频创建克隆语音。这一发现并不意味着所有服务的行为都完全相同。
但它表明,仅仅依赖用户的道德自律并不足够。语音样本一旦进入另一个系统,一份同意声明或一个复选框便无法对其提供保护。
水印可以通过嵌入来源信息,为生成音频添加标记。然而,它在普通电话通话中的保护作用有限。
电话压缩、重新录制、噪声和蓄意修改都可能破坏可检测信号。犯罪服务也可能完全不添加水印。
检测工具也面临类似问题。它必须在不同网络和生成系统环境下,通过消费级硬件迅速给出可靠结论。
假阴性会让合成音频蒙混过关。假阳性则可能将真实的紧急电话误判为诈骗。
FTC 的技术评估将可能的防御措施分为预防、实时检测和事后评估,并得出结论:不存在单一的解决方案。
这一结论对于 Brightwell 案仍至关重要。当任何人开始评估这通电话时,现金早已随专员的车辆离开。
几小时后才得出的取证结论,无法阻止在几分钟的恐慌中完成的交易。防御措施必须在付款发生前打断整个流程。
这意味着,应将声音视为一种沟通渠道,而不是身份凭证。
银行在密码和账户安全方面也吸取过类似教训。一个熟悉的事实可以帮助建立情境,但不足以作为授权依据。
家庭和组织如今面临同样的调整。每当请求涉及金钱、保密、凭证或异常紧迫的情况时,即使听到了可信之人的声音,也应当进行独立核实。
真正的对手是身份验证,而不是更敏锐的听力
应对合成语音的持久之策,是建立一条来电者无法控制的独立验证路径。
检测要判断的是录音中是否存在生成技术的迹象。身份验证要判断的是,提出请求的人能否通过另一个渠道证明自己的身份。
在快速发展的诈骗过程中,第二个问题更有价值。
家人可以使用已保存的号码回拨亲属,也可以联系身处其附近的人,或询问一个与公开信息无关的私密问题。
预先约定的家庭暗语也会有所帮助,前提是它始终保密,不会变成另一个被广泛分享的个人信息。
没有任何方法是完美的。在真正的紧急情况下,电话可能无法接通,而私人问题的答案也经常能从泄露或公开的数据中查到。
原则比任何单一测试都更重要。验证路径必须独立于来电者的故事和指示。
Brightwell 的来电者试图封闭这些路径。他们解释了号码为何不同、借助法律权威施压、要求保密,并持续推动整个流程。
这些手法之所以容易辨认,是因为它们早在生成式 AI 出现之前便已存在。语音克隆强化了社会工程,但并未取代它。
整个行动依赖的是具有强迫性的流程设计。每一个步骤都在阻止受害者停下来思考或联系外界人员。
FBI 将语音克隆描述为危难诈骗中可能使用的一种工具。其分类还包括涉及 AI 联系对象的更广泛的骗取信任和情感诈骗。
在其 2025 年年度报告中,FBI 互联网犯罪投诉中心记录了 22,364 起包含 AI 相关信息的投诉。
这些投诉涉及超过 8.933 亿美元的调整后损失。相关数据涵盖多种欺诈类别,不应被单独表述为语音克隆造成的损失。
报告指出,2025 年报告的紧急求助诈骗损失超过 500 万美元,并将此类诈骗描述为一种不断演变的家庭成员冒充形式。
60 岁及以上人群提交了 3,143 起带有 AI 相关标记的投诉,其调整后损失约为 3.525 亿美元。
需要再次强调的是,这一数字广泛涵盖 AI 相关投诉,并非衡量克隆家庭成员语音来电所造成的单独损失。
明确这一区别可以避免两个常见错误。第一,并非所有 AI 相关投诉都涉及合成音频。第二,并非所有逼真的家庭成员冒充行为都已从技术上证实使用了 AI。
投诉数据衡量的也是已报告案件,而非犯罪的全部发生规模。一些受害者因羞耻、不确定或掌握的信息有限而从未报告损失。
尽管如此,这些数字表明,AI 已出现在足够多的欺诈报告中,值得进行专项追踪。它们还揭示了老年投诉者面临的金融风险格外严重。
老年人往往拥有更多累积储蓄和可用信贷。有些人可能也不太熟悉不断变化的数字操纵技术。
然而,不应将 Brightwell 案描述成一个关于轻信的故事。据报道,她的孙子当时也在场,并经历了同样的恐慌。
费城律师 Gary Schildhorn 在 2023 年的国会证词中描述了一通类似的电话。一个听起来像他儿子的声音声称,自己因撞伤一名孕妇而被关进监狱。
Schildhorn 是一名律师,了解法律体系。尽管如此,在真正的儿子联系他、揭穿骗局之前,他仍进入了自己所说的“行动模式”。
这种反复出现的话术很能说明问题。车祸制造内疚感,孕妇受害者抬高事态严重性,而入狱则制造紧迫感。
随后,所谓的法律保密要求阻止受害者向他人求证。冒充的律师则把家人的担忧转化为具体的付款流程。
合成音频可以增强开场话术的可信度,但其余部分更像是一套经过排演的剧本。这意味着,即使音频分析失效,仍然可以在流程层面进行干预。
银行员工无须判定某个声音是否由 AI 生成。员工可以识别出伴随施压和保密要求的异常现金提取行为。
电信运营商无须认识受害者的女儿。它可以加强来电者身份验证,并降低伪造号码的可信度。
家庭无须使用取证软件。家人可以制定一条规则:任何紧急资金请求都必须回拨,并由另一人确认。
这些措施从流程层面与诈骗抗衡,而犯罪活动在这一层面仍存在弱点。
检测仍然重要,但无法独自承担防御重任
技术检测可以提供有用证据,但它要么介入太晚,要么仍存在太多不确定性,无法成为唯一的防护措施。
音频检测器会寻找能够区分生成语音与人类录音的模式。这些模式可能包括频谱伪影、时序异常,或特定模型留下的痕迹。
当研究人员知道生成方法并拥有完整音频文件时,这种方法的效果最佳。而实时电话通话所提供的条件则远为不利。
电话通信会通过压缩丢失信息。背景声音、数据包丢失、重新录制和免提播放,都可能掩盖检测器所需的特征。
生成系统也在迅速变化。针对昨日输出训练的检测器,在面对新模型或陌生语言时可能表现更差。
这形成了一场不对称的较量。诈骗者只需要一次听起来可信的通话,而防御系统却必须处理大量真实语音,同时不能阻断真正的紧急情况。
显眼的警告仍可能有所帮助。手机可以标记未经身份验证的来电者、可疑的号码行为或疑似合成语音。
然而,警告必须如实传达不确定性。“可能是合成音频”不同于“此来电者是罪犯”。
过度自信也会带来危险。人们可能因为检测器错误分类,而忽视真正的亲属、患者、员工或公职人员。
水印还面临另一项部署难题。只有当生成服务提供商统一添加水印,且下游系统能够保留水印时,它才会发挥作用。
开放模型、海外服务、经过修改的工具以及翻录音频,都可以绕过需要各方配合的水印机制。犯罪分子会选择管控最薄弱的路径。
同意保护机制可以减少主流平台上的随意滥用,但无法阻止所有犯罪分子搭建或修改其他系统。
正因如此,FTC 强调了多个干预环节。上游管控减少获取机会,实时系统增加阻力,事后分析则协助调查。
但这些措施都无法取代交易层面的验证。
监管应对也只覆盖了部分威胁。2024 年,Federal Communications Commission 裁定,AI 生成的语音受人工或预录自动呼叫相关限制的约束。
这项 FCC 决定加强了对使用生成语音进行非法自动呼叫的执法力度,但并未将所有语音合成行为都定为违法。
自动呼叫规则也无法自动阻止涉及实时参与者、境外基础设施、伪造号码和线下现金取款人的定向通话。
执法需要等到调查人员确认参与者和司法管辖权后才能开展。调查 Brightwell 案的当地警探指出,这类案件可能很难追踪。
取款人是潜在的线下线索之一,但该犯罪活动可能使用对组织者知之甚少的中间人。
现金还会消除某些电子交易所具备的撤销机制。一旦现金被取走并转移,追回就会变得十分困难。
这说明了监管机构和开发者面临的核心权衡。语音克隆同样可以服务于无障碍功能、本地化、娱乐和言语恢复。
全面禁令会伤害合法用户,同时仍会让非法工具存在于合规平台之外。
有针对性的防护措施提供了一条更现实的路径。服务可以要求获得有实际意义的同意、保留滥用信号、限制敏感用途,并配合法律规定的调查。
电信网络可以改进来电者身份验证。金融机构可以完善针对紧急提款的干预措施,同时避免将老年客户视为缺乏行为能力的人。
执法部门可以把本地取款人案件与更广泛的犯罪网络联系起来。公众教育可以聚焦验证流程,而不是要求每个人都成为音频专家。
质疑的观点仍然很重要。目前尚无公开证据表明,这些措施中的任何一种已经消除了此类欺诈模式。
攻击者会调整话术、付款方式和通信平台。认知度提高后,他们可能从现金取款人转向加密货币自助终端或账户转账。
Brightwell 案的调查也体现了一个基本的证据问题。受害者确信自己听到了克隆语音,这是一项有说服力的证词,但并不等同于技术归因。
该通话可能使用了生成音频、剪辑录音、人工模仿者,或这些手段的组合。在调查人员公布证据之前,报道应保留这些可能性。
这种谨慎态度反而增强了分析的可信度。即使有争议的技术环节最终被证明比怀疑的更简单,这起欺诈也不会因此变得无害。
攻击者仍然击败了基于声音的信任。正确的防御方式依然是独立身份验证。
美国老年人承担了不成比例的损失
AI 扩大了欺诈能力,但现有的经济和社会条件决定了谁会遭受最严重的损失。
FBI 的 2025 年数据提供了必要的规模参照。60 岁及以上投诉者报告了 201,266 起欺诈投诉,总损失达 77.48 亿美元。
他们报告的平均损失为 38,500 美元。该年龄段中,超过 12,000 名投诉者报告的损失超过 100,000 美元。
这些总数包括许多与 AI 语音克隆无关的犯罪类型。投资欺诈和技术支持诈骗造成的损失远高于紧急求助诈骗。
这一背景可以避免对单一技术进行夸大渲染。AI 正在成为既有犯罪活动的加速器,而不是创造了所有基础骗局。
老年受害者之所以对犯罪分子具有吸引力,是因为他们可以利用其储蓄、房屋净值、退休账户以及强烈的家庭责任感。
有些老年人也会接听陌生来电,因为医疗服务提供者、保险公司、政府机构和亲属都可能通过未知号码与他们进行正当联系。
因此,一律不接听陌生来电的建议并不完整。它把过多责任转嫁给消费者,也忽视了现代服务的运作方式。
要求人们从互联网上清除自己的声音同样不切实际。人们的声音早已存在于公开会议、社交帖子、校园活动、营销视频和语音信箱系统中。
现实目标不是实现绝对保密,而是防止公开的声音样本被当作金融授权。
组织还需要考虑那些正在照护年长亲属的员工。紧急骗局可能迫使员工离开工作岗位,并造成持久的情绪伤害。
Brightwell 的家人描述了发现被骗后出现的身体不适。伤害并不止于被骗走的金额。
羞耻感可能会加深这种伤害。指责受害者粗心会打击其报案意愿,也会使调查人员更难了解成功诈骗话术的运作方式。
更好的问题是:哪些控制措施失效了?犯罪分子联系到这户家庭,控制了叙事,诱发了现金提取,并完成了当面取款。
每个阶段都涉及一个本可以增加阻力的系统,但没有任何单一参与者掌握完整情况。
电话运营商看到了通话,银行看到了提款,司机看到了取款过程,而家庭成员分别掌握着有关 Munroe 所在位置的信息。
隐私和运营限制使自动协调变得困难。然而,这种信息割裂恰恰是有组织欺诈所利用的条件。
银行已经培训员工询问异常提款。因此,犯罪分子会指示受害者隐瞒用途或编造掩饰说辞。
更积极的干预同样会产生代价。客户需要能够动用自己的资金,包括在真正的紧急情况下。
有效的防护措施必须在不永久剥夺客户控制权的情况下延迟可疑交易,同时还必须避免把每一位老年人都刻板地视为弱势群体。
限时冻结、私下进行的反欺诈询问以及可选的可信联系人,都可以创造验证机会。不同机构对这些措施的设计和法律处理方式各不相同。
现金取款人骗局尤其值得关注,因为它把远程操纵与本地取款连接起来。这一连接既会产生调查证据,也会加速形成不可逆转的损失。
语音克隆行业则面临着来自相反方向的压力。开发者希望提供简便的上手流程和自然的输出效果,而防滥用措施会增加阻力和监控。
要求获得说话者同意可以遏制随意冒充。然而,开发者必须测试其控制措施能否抵御预录声明、经过操纵的音频和批量养号行为。
电信运营商也面临类似的挑战。来电显示身份验证有助于确认电话的来源,但无法证明正在说话的人是谁。
已验证号码可能属于遭入侵的账户。未验证号码也可能属于真正的医院、旅行者,或使用另一部电话的家庭成员。
因此,行业需要的是分层信号,而非通用的信任徽章。身份、设备、通话来源、交易行为和用户确认分别回答不同的问题。
FTC 的框架体现了这种分层方法。它将责任分配给工具制造商、通信服务提供商、监管机构和其他上游参与者。
消费者仍然需要清晰的操作流程,但不应承担全部责任。在情绪压力下,个人最不适合进行复杂的取证判断。
监管机构、银行和家庭接下来应关注什么
下一阶段将通过经核实的投诉数据、交易保障措施以及在实际通话中有效的身份核验来衡量。
第一个信号是来自 FBI 和其他机构的更完善报告。2025 年 IC3 报告引入了更明确的 AI 相关描述标签,并识别出危急求助骗局造成的损失。
未来的报告应区分已确认的合成音频与疑似涉及 AI 的情况。还应区分语音克隆、生成式视频、聊天自动化和被篡改的身份证件。
这种分类将表明,冒充家人制造紧急情况的骗局究竟是在扩大,还是仅仅受到了更多关注。它还将改善不同年龄群体和支付方式之间的比较。
第二个信号是银行和电信服务提供商的实际部署。与能够中断正在进行的交易的控制措施相比,研究挑战和政策声明的重要性较低。
有价值的证据应包括经过测试的来电者身份验证指示、客户警告,以及已完成紧急骗局数量减少的记录。
银行应追踪干预措施能否在不给合法取款造成不可接受延误的情况下阻止损失。电信服务提供商应报告警告如何影响用户行为。
第三个信号是语音生成服务可强制执行的责任机制。授权检查、滥用调查和可追踪的来源证明需要通过贴近现实的攻击进行独立评估。
一项服务不应仅仅因为发布了政策就获得认可。研究人员必须确定普通用户是否可以利用公开音频绕过其控制措施。
任何声称能够可靠检测合成语音的供应商,还应公布其在不同语言、设备、噪声水平和未知生成系统下的错误率。
这三个信号既可能加强,也可能削弱身份验证方面的论点。
更精确的投诉数据将确定威胁的真实规模。有效的交易保障措施将表明,程序性防御能够在资金转出之前减少损失。
稳健的授权和来源证明控制措施将减少随意制作语音克隆的可能性。薄弱的成效则会证实,消费者验证仍是目前主要的可用屏障。
家庭无须等待这些系统。他们可以采用一条简单规则:未经其他独立渠道联系确认,任何紧急付款都不得进行。
这种独立渠道可以是回拨已保存的号码、进行视频通话,或向另一位可信任的人确认。
即使声音听起来一模一样,也必须遵守这条规则。当来电者提供看似可信的个人信息时,也同样适用。
公开事实并不是私密的身份验证信息。地址、生日、工作单位、宠物和亲属信息经常出现在数据经纪商、数据泄露事件或社交资料中。
家庭私密口令可以增加骗子的操作难度,但它应作为独立联系确认的补充,而非替代。犯罪分子最终也可能获取或操纵这些口令。
在可疑通话中,最安全的做法是暂停行动并直接联系本人。真正的律师或有关机构可以提供能够独立核实的办公电话。
付款指示值得单独审查。现金取款交付、礼品卡、加密货币自助终端、保密要求和施压催促,无论来电者的声音如何,都是强烈的诈骗信号。
受害者应尽快向其金融机构、当地执法部门、FTC 以及 FBI 的 Internet Crime Complaint Center 报告事件。
快速报告无法保证追回损失,但可以保存电话记录、交易详情、摄像头画面、车辆描述和通信日志。
Brightwell 案的重要性不在于它证明了任何人的声音都能通过极短的样本被克隆。公开证据并不支持这一宽泛结论。
它之所以重要,是因为一个家庭将声音识别视为身份证明,而犯罪分子控制了之后的每一次验证机会。
这种假设曾经看似合理。如今,它已不足以作为金融决策的依据。
因此,这起 AI 语音骗局带来的持久教训是程序性的:识别声音,警惕紧迫感,并通过其他渠道核实对方身份。



