top of page

AI语音技术如何模糊人类与机器之间的界限

已更新:6月17日

How AI Voice Technology Is Blurring the Lines Between Human and Machine

从我们口袋里的虚拟助手到处理客服电话的自动化代理,AI 生成的声音已成为现代生活中一种无形却又无处不在的存在。这项技术的发展速度令人惊叹,早已超越了早期系统那种机械、生硬的语音,能够产生自然、富有情感且日益趋近真人的声音。这种飞速进步提出了一个至关重要且引人深思的问题:我们是否仍能可靠地分辨出真人声音与算法生成的声音?

随着“超现实”AI 生成面孔的兴起——这些图像如此逼真,以至于通常被认为比真实的真人照片更真实——研究人员已将注意力转向听觉领域。本文深入探讨了一项近期将我们的感知置于测试之下的科学研究,探索 AI 语音是否存在类似的超现实效应。我们将揭示我们如何感知合成语音的科学原理,检查那些出卖它们(或没有出卖它们)的细微线索,并讨论在一个人类与机器之间的界限不再清晰的世界中,所带来的深远社会和伦理影响。

AI 语音的无形崛起

The Unseen Rise of the AI Voice

从机械语音到自然对话

语音合成的旅程始于一个简单的目标:生成仅能被听懂的语音。早期的文本转语音 (TTS) 系统虽然实用,但缺乏人类交流中的节奏、语调和温情。然而,在人工智能和深度学习进步的推动下,这项技术已经取得了巨大的飞跃。如今最先进的生成式 AI 可以产生极具说服力的合成语音,模仿声音特征、情感细微差别和自然语言模式,使交互感觉更加真实。这项技术不再仅仅是新鲜事物;它已成为各行各业的基础工具,从制作有声读物和播客,到为广告和社交媒体内容提供配音。

为什么我们现在讨论它

围绕 AI 语音的讨论之所以升温,主要有两个关键原因。首先,创建这些语音的工具已变得广泛可用且价格低廉,几乎任何人都能轻松生成合成语音。其次,在视觉领域发现了一种被称为“超现实主义效应”的有趣现象。研究发现,AI 生成的面孔不仅与真实面孔难以区分,有时甚至被认为比真实面孔更值得信赖,甚至更具“人性”。这促使科学家们去研究声音领域是否也存在同样的情况。了解人类如何感知这些日益逼真的声音并对其做出反应至关重要,因为这项技术既蕴含着巨大的前景,也存在被滥用的重大风险。

区分声音的科学

什么是 AI 语音?通用型 vs. 克隆型

通用型 AI 语音:这些是从大型语音模型的“潜空间”中生成的全新人声身份。可以将其想象为 AI 根据性别、年龄和口音等参数,从零开始创建一个新的合成人物声音。这些通常用于通用目的的应用,例如在线内容解说或驱动虚拟助手。

语音克隆:这种类型的AI 语音是通过在特定真实人物的录音上训练模型,以高度准确地模仿其独特的声线特征而创建的。仅需几分钟的音频,该技术就能生成一个能够以该人的声音朗读任何文本的“克隆体”。

“超写实主义”之谜:语音领域不存在恐怖谷效应?

该研究的核心问题是 AI 语音是否已经达到了“超写实主义”——即被认为比人类声音更真实的程度。研究结果非常微妙。通过多项实验,研究发现 AI 生成的语音整体上并未表现出超写实效应。通用的 AI 语音虽然具有说服力,但其真实感和人性化评分始终低于真实的人类声音。

然而,语音克隆(voice clones)的情况则截然不同。听众认为语音克隆的真实感和人性化程度与真人录音不相上下。虽然它们未被视为“更”真实,但在统计学上已无法区分。这表明,虽然该技术在群体层面可能尚未达到“超写实”,但它肯定已经跨越了可信度的关键门槛。对于某些特定的语音克隆样本,克隆声音甚至被评为比原始真人录音听起来更真实,这暗示了超写实主义在个别案例中是可能实现的。

实验:人类与机器的对决

The Experiment: Pitting Human vs. Machine

听力测试:研究人员如何测试感知力

为了得出这些结论,研究人员进行了一系列精心设计的实验。他们在网上招募了参与者,并要求他们听一组随机的音频剪辑,其中包含三种类型的声音:真人说话者、通用 AI 生成的语音以及 AI 语音克隆。针对每种声音,参与者执行了多项任务:

特征评分: 他们对每种声音的可靠性和主导性进行了评分,分值为 0 到 100 分。

真实度评分: 他们判断了每种声音听起来“有多真实”,同样采用 0-100 的连续滑动评分制。

分类任务: 在被告知部分声音是由 AI 生成的之后,他们对每个片段做出了二选一的抉择:它是“真人”还是“AI 生成”?

这种多维度的方法让研究人员不仅能观察人们是否能分辨出差异,还能衡量这些声音所产生的微妙社会印象。

令人惊讶的结论:我们无法可靠地检测出语音克隆

分类任务的结果令人触目惊心。一项综合了听者敏感度和偏好的信号检测分析揭示了一个明显的界限。

通用 AI 语音:听众能够以中等程度的敏感度区分通用 AI 语音和人类语音。虽然他们经常被误导——有 41% 的时间将通用 AI 语音误认为人类——但他们辨别两者的表现仍优于随机猜测。

语音克隆:当涉及到语音克隆时,这种辨别力完全消失了。分析显示,听众在区分人类语音及其 AI 克隆版本时完全没有敏感度。听众有 58% 的时间将语音克隆错误识别为人类,其表现实际上处于随机水平。此外,参与者表现出一种将声音判断为“人类”的持续偏见,尤其是在面对高度逼真的克隆语音时。研究表明,利用现有技术,我们无法可靠地将 AI 语音克隆与真实的人类言语区分开来。

社会影响:信任、支配地位与欺骗

更具支配力,有时更值得信赖

除了真实感之外,该研究还揭示了我们在感知 AI 语音的社会特征方面存在的迷人差异. 总体而言,无论是通用 AI 语音还是克隆语音,其听起来都比真实的人类声音更具主导性。这表明,当前 AI 生成语音的声学特性中,某些元素比典型的人类语音更能传达出一种权威感或果敢感。

更令人惊讶的是,关于可信度的调查结果挑战了先前的假设。虽然早期的一些研究认为合成语音不那么讨人喜欢或不可信,但这项研究得出了相反的结论。通用 AI 语音被认为比人类语音显著更具可信度。尽管语音克隆在统计学上没有表现出显著差异,但它们的趋势是相同的。这意味着 AI 语音可以被设计成比人类声音更强烈地暗示特定的人类特征,这一发现对于这些语音在社会和商业环境中的应用具有重大意义。

双刃剑:从无障碍到欺诈

日益逼真的 AI 语音呈现出典型的双重用途困境。其造福社会的潜力是巨大的。该技术提供了改变生活的益处,例如为视障人士提供听感自然的屏幕阅读器,或允许失去说话能力的人使用个性化的克隆语音进行交流。公司和创作者也可以从具有成本效益的内容语音生成中获益。

然而,同样的技术也为恶意使用打开了大门。创建特定人物高度准确的语音克隆能力,是传播虚假信息、进行骗局和欺诈的强大工具。想象一下,你接到一个亲人急需用钱的求助电话,但电话那头的声音却是完美的 AI 克隆。随着听众无法分辨真伪,受骗的可能性呈指数级增长,这凸显了公众意识和保护措施的紧迫需求。

超越现实:AI 语音技术的下一步是什么?

Beyond Realism: What's Next for AI Voice Technology?

动态声音的挑战

为什么静态 AI 面部已经实现了超现实主义,而动态 AI 语音却还没有?研究人员指出了两种模态之间的关键区别。面部图像是一个静态快照。然而,语音是一种动态的、随时间变化的信号,编码了丰富的语言和副语言信息。人类大脑经过专业训练,能够感知和分析这种展开的听觉信息。要让我们的感知系统相信合成的、动态的语音流比真实的语音“更真实”,可能从根本上比用单张静态图像欺骗它更难。

熟悉度因素:你能识别出亲人的克隆声音吗?

这项研究的一个重要前提是它使用了参与者并不熟悉的陌生人的声音。听众根据他们对“真实”人类声音听起来是什么样的通用、原型化概念来评估这些声音。但如果被克隆的声音是你亲密的人,比如伴侣或密友,这些结果会如何变化?关于熟悉声音识别的研究表明,我们对个人熟悉声音的感知表征是非常稳健且细致的。虽然语音克隆可以欺骗不熟悉的听众,但对于对原讲述者声音有深度、长期了解的人来说,那些细微的不完美之处可能会变得显而易见。未来的研究需要探索这种“熟悉度因素”,以全面了解我们在语音克隆面前的脆弱性。

结论:在合成语音的世界中航行

核心要点

这项研究清晰地描绘了AI voice technology目前的现状。我们正处于一个关键时刻,这种技术的一种核心形式——语音克隆——对于普通听众来说已经变得与现实无异。主要结论如下:

  • 没有证据表明 AI 语音存在群体层面的“超现实主义”效应;总体而言,它们尚未被认为比人类声音更真实

  • 最先进的 AI 语音克隆听起来与人类声音一样真实,听众无法可靠地将它们区分开来

  • AI 生成的声音被认为比人类声音更具主导地位,在某些情况下,甚至更值得信赖

前行之路

类人 AI 语音的广泛普及对我们与技术以及彼此之间的互动方式产生了深远影响。它挑战了我们对真实性和身份的基本假设。随着这些工具变得日益先进,我们必须就其使用展开广泛的社会讨论。这包括制定 AI 语音设计的伦理准则,开发检测合成媒体的技术,以及最重要的——提高公众意识。持续的研究至关重要,这有助于理清我们对真实感的感知如何与社会判断相互作用,并理解聆听 AI 语音的整体体验如何影响我们的态度和行为。人类与机器之间的界限正在模糊,应对这一新现实既需要科学探究,也需要深思熟虑。

FAQ:关于 AI 语音的常见问题

FAQ: Frequently Asked Questions About AI Voices

1. 什么是 AI 语音克隆?

AI 语音克隆是由 AI 模型创建的合成语音,该模型经过特定人物录音的训练。其目标是高度准确地模仿原讲述者的声音(包括音调、语气和口音),使克隆语音能够像本人一样朗读任何新文本。

2. AI 语音听起来能比真人声音更真实吗?

目前不能。从广义上讲,AI 语音听起来并不会比真人声音“更真实”, 这种现象被称为超写实主义。然而,研究表明,语音克隆听起来可以和人类声音一样真实,以至于听者无法分辨。在某些特定的个案中,语音克隆甚至被评为比其对应的人类原声更真实,但这并非普遍趋势。

3. 为什么 AI 语音经常被评为更具“支配感”?

研究发现,无论是通用 AI 语音还是语音克隆,都被一致认为比真实的人类录音更具支配感。虽然确切的声学原因仍在研究中,但这表明用于生成这些语音的算法可能正在创造具有某些特征(如更稳定的音高、更少的犹豫或特定的声道共鸣)的语音,而人类听众会将这些特征与自信和权威联系起来。

4. 逼真的 AI 语音最大的风险是什么?

最显著的风险涉及欺骗和滥用。这些包括为虚假信息宣传活动创建“deepfake”音频、通过在电话中冒充他人进行诈骗、伪造证据,以及通过伪造他人从未说过的话来骚扰或诽谤他人。

5. 我该如何保护自己免受 AI 语音诈骗?

虽然识别变得越来越困难,但你可以采取措施保护自己。对那些紧急、高压的索要钱财或个人信息的要求保持警惕,即使声音听起来很熟悉。如果你接到可疑电话,请挂断并拨打已知、可信的号码回电。考虑与亲近的家庭成员建立一个只有你们知道答案的暗号或安全问题,以便在可疑情况下验证身份。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page