精要:学习与说语言的科学 | Eddie Chang 博士
说话似乎毫不费力,直到疾病或损伤打乱这一能力。然而,每一句能被理解的话都依赖惊人的协调:大脑必须选择有意义的词语,组织它们的声音,指挥数十块肌肉,监测结果并作出修正——这些往往都在几分之一秒内完成。
在这场对谈中,神经科学家兼神经外科医生 Eddie Chang 博士解释了这套隐藏机制,并介绍了为重度瘫痪患者恢复沟通能力的努力。他的讨论涵盖言语与语言的区别、口吃、神经解码、具备表情的虚拟形象,以及围绕人类增强而来的伦理问题。
言语是一种信号;语言承载意义
Chang 首先区分了两个常被视为同义的概念。言语是一种物理的沟通信号:由身体产生的、有规律的声音。语言则是赋予这些信号意义的更大系统。
语言包括语义,即词语表达什么;句法,即词语如何排列;以及语用,即语境如何影响理解。因此,言语只是语言的一种表达方式,并不等同于语言本身。阅读和手语同样能传达语言结构,而不需要发出声音。
这一差别在临床上很重要。一个人可能完全知道自己想说什么,却无法发出可理解的言语。反过来,有人可能仍保有发声的身体能力,却失去了部分语言理解或组织能力。识别这一过程在哪个环节出了问题,是理解神经系统疾病和设计辅助技术的关键。
Chang 还区分了言语与发声。哭泣、笑声、呻吟及其他自发声音,都依赖空气通过喉部,但未必动用了构建口语时所使用的同一套神经系统。有些言语相关脑区受损的人仍能发声,这说明大脑为这些行为保留了部分彼此独立的通路。
身体如何将呼吸变成词语
言语始于气流。喉部让声带靠拢,使流经的空气产生振动。这提供了原始的声学能量,随后声道再将其转化为可辨识的辅音和元音。
Chang 指出,声带振动的频率通常约为 100 至 200 赫兹。喉部大小和形状的解剖差异会造成音质与音高的不同;平均而言,男性声音的基频较低,女性声音的基频较高。这些是广泛的生理趋势,而非僵化的分类。
喉部产生的声音只是开端。嘴唇、下颌、舌头、咽部及其他结构必须持续重塑声道。位置上的细微变化,就可能决定听者听到的是一个音位还是另一个。各种动作也会相互重叠:嘴巴还在完成一个声音时,就已在为下一个声音做准备。
对 Chang 而言,说话是人类所执行的最复杂运动行为之一。流畅的对话掩盖了这种复杂性,因为底层动作大多已变得自动化。我们通常关注想法和社交语境,而不会有意识地调整舌头位置或控制声带的时机。
当一个人意识清醒却无法说话
在闭锁综合征中,这种能力的意义尤其明显。脑干卒中、肌萎缩侧索硬化症,或其他严重的神经系统疾病,可能让人的认知与意识保持完整,却几乎失去所有可靠的自主表达渠道。
Chang 讨论了 BRAVO 临床试验的一位参与者。这名参与者在一次车祸及脑干卒中后,已带着严重瘫痪生活约 15 年。他无法移动手臂或双腿,也无法说出可理解的话语。进入研究前,他只能通过有限的颈部动作在屏幕上选择字母,以缓慢地进行沟通。
该试验的目标直接,却在技术上极具挑战:当参与者尝试说话时,检测大脑皮层中的活动,再将这种活动转化为电脑上的文字。外科医生在参与控制嘴唇、舌头、下颌、喉部及更广泛声道的皮层区域上放置了电极阵列。一个固定于颅骨上的连接装置,使植入物能够将记录到的信号传输至外部设备。
这种方法并不会读取不受限制的思想。它聚焦于尝试说话时相关的神经活动——即参与者有意识地试图说出某句话时产生的运动模式。这一区别既是系统运作方式的核心,也是负责任地讨论其能力的关键。
用机器学习解码尝试说话的信号
来自大脑皮层的电信号包含复杂模式,而不是整齐标注的词语。研究人员必须找出这些模式与参与者意图发出的言语动作之间微妙的关联。
在 Chang 所描述的试验中,记录到的活动被转换为数字数据,并由机器学习模型处理。训练历时数周,最初围绕 50 个词汇展开。虽然词汇量有限,但这些词可以组合成许多有用的句子,并为后续扩展奠定基础。
解码并不完美。与尝试说话无关的动作可能改变神经活动,或干扰信号。Chang 回忆说,当系统开始输出文字时,这名参与者情绪激动:他颤抖、摇头,还咯咯地笑起来。这份喜悦极具人性,但这些动作也让系统更难判断他接下来试图说什么。
语言模型可以弥补部分错误。就像手机键盘会利用可能的词序来修正误触的字母一样,言语神经假体也可以考虑哪些解码出的组合在语言上更合理。这并不是取代大脑信号,而是在多个可能输出都与记录模式相似时,帮助消除不确定性。
Chang 将这项工作置于脑机接口的更长发展历程之中。早期系统往往专注于移动机械臂或控制电脑光标。言语解码将同一广泛原则延伸至一种特别具有人际意义的人类需求:参与对话。
恢复的不只是文字
沟通并不只是连续的文字。面部表情、时机、视线、嘴部动作和语调,都会影响对方如何理解信息。下颌和嘴唇的可见动作可以提高可懂度,而听者的反应则帮助说话者实时调整。
因此,Chang 的愿景不止于显示解码出的文字。研究人员正在探索把尝试说话与动画面孔连接起来的系统,让这些面孔能够重现相关的嘴部动作和表情。数字虚拟形象或许可以代用户说话,同时恢复纯文字沟通中丢失的一部分非语言信息。
具身性也可能让这些系统更易学习。当用户看到虚拟形象立即响应自己的意图时,这种反馈能帮助他们感到自己正在直接控制结果。界面不再像是在操作一个分离的设备,而更像是在获得一种新的表达通道。
这项工作在数字社交空间中可能尤其重要:具备表情的虚拟形象可让瘫痪者更自然地参与其中。目标并非为了逼真的视觉效果本身,而是为了归还自主性、情感细腻度和对话中的在场感。
口吃揭示了流利表达的奥秘
Chang 以口吃说明言语系统的各部分必须多么精确地协调。口吃者通常具备语言知识,也知道自己想传达什么。困难在于流畅地产出言语,包括启动和协调声道动作。
焦虑可能会加重口吃,但 Chang 提醒,不应将焦虑视为其根本原因。这种状况似乎涉及大脑功能与言语协调,但其完整机制仍未厘清。它也可能有很大差异:一个人可能在某种情境下口吃,却在另一种情境中说得很流利。
这种差异性提供了重要线索。如果在某些时刻仍能流利说话,研究人员就可以探究大脑发生了哪些变化,使系统得以成功协调。Chang 将正常的言语产生比作一场交响乐:众多组成部分必须在正确的时间进入,任何微小的扰动都可能影响整体演出。
听觉系统是其中一个关键参与者。说话并非大脑单向发出运动指令的过程。大脑也会聆听由此产生的声音,并利用这一反馈调节产出。改变说话者听到的内容,可能改善或加重口吃,显示出知觉与发音之间的紧密互动。
由于发育中的大脑具有很强的可塑性,早期支持可能尤其有价值。言语治疗可以帮助处理启动问题,引入更有利于流利表达的策略,探索听觉反馈,并协助应对围绕说话形成的焦虑。因此,治疗并非强迫说话,而是帮助系统找到可靠的协调方式。
从医疗修复到人类增强
一旦植入式接口能够恢复一项丧失的功能,随之而来的问题就更难了:类似技术是否应该将能力增强到普通范围之外?
Chang 指出,增强并不是人类的新冲动。人们早已使用咖啡因、尼古丁、药物、教育和无数工具,来改变注意力、耐力、记忆力或表现。不过,神经技术带来了独特担忧,因为它可能涉及手术、直接获取神经信号,以及获取机会的不平等。
潜在的增强可能包括更快的沟通或更强的认知能力,但生物性的言语仍然极难超越。人类沟通依赖包含数百万个神经元的神经系统,并经过进化、发育和终身学习的打磨。现有技术还无法复制这种完整的信息带宽。
如果增强技术到来,Chang 认为它可能通过渐进的小步出现,而不是一次戏剧性的飞跃。这种渐进路径让同意、安全、隐私、所有权和获取机会等问题更加紧迫,而非相反。一项技术可能在看似尚未革命性之前,就已带来重要的社会影响。
言语神经假体最直接的价值仍在于修复。对一个意识完全清醒却无法表达一句话的人而言,即使是有限的词汇量,也能重新打开通往他人的道路。长期目标则更加丰富:实现更快、更具表现力,并且足够具身、让人感觉属于自己的沟通。



