Essentials : la science de l’apprentissage et de la parole | Dr Eddie Chang
Parler semble naturel jusqu’à ce qu’une maladie ou une blessure vienne perturber cette capacité. Pourtant, chaque phrase intelligible dépend d’une coordination stupéfiante : le cerveau doit choisir des mots porteurs de sens, en organiser les sons, diriger des dizaines de muscles, contrôler le résultat et le corriger — souvent en une fraction de seconde.
Dans cette conversation, le neuroscientifique et neurochirurgien Dr Eddie Chang explique ces mécanismes invisibles et décrit les efforts entrepris pour rétablir la communication chez les personnes atteintes de paralysie sévère. Il aborde la différence entre parole et langage, le bégaiement, le décodage neuronal, les avatars expressifs et les questions éthiques liées à l’augmentation humaine.
La parole est un signal ; le langage porte le sens
Chang commence par distinguer deux notions souvent considérées comme interchangeables. La parole est un signal physique de communication : un son structuré produit par le corps. Le langage est le système plus large qui donne un sens à ces signaux.
Le langage comprend la sémantique, c’est-à-dire le sens des mots ; la syntaxe, c’est-à-dire la manière dont ils sont organisés ; et la pragmatique, c’est-à-dire l’influence du contexte sur l’interprétation. La parole est donc une expression du langage, et non le langage lui-même. La lecture et la langue des signes transmettent également une structure linguistique sans nécessiter de voix.
Cette distinction est importante sur le plan clinique. Une personne peut savoir exactement ce qu’elle veut dire sans être capable de produire une parole intelligible. À l’inverse, une personne peut conserver la capacité physique d’émettre des sons tout en perdant certains aspects de la compréhension ou de l’organisation du langage. Identifier l’étape à laquelle le processus s’est rompu est essentiel pour comprendre les troubles neurologiques et concevoir des technologies d’assistance.
Chang distingue aussi la parole de la vocalisation. Les pleurs, les rires, les gémissements et d’autres sons spontanés reposent sur le passage de l’air dans le larynx, mais ils ne mobilisent pas nécessairement les mêmes systèmes neuronaux que ceux qui construisent le langage parlé. Certaines personnes ayant subi des lésions dans des régions cérébrales liées à la parole peuvent encore vocaliser, ce qui suggère que le cerveau conserve des voies partiellement distinctes pour ces comportements.
Comment le corps transforme le souffle en mots
La parole commence par le flux d’air. Le larynx rapproche les cordes vocales, permettant à l’air qui passe de créer des vibrations. Celles-ci fournissent l’énergie acoustique brute que le conduit vocal transforme ensuite en consonnes et voyelles reconnaissables.
Chang indique que la vibration des cordes vocales se situe couramment dans une plage d’environ 100 à 200 hertz. Les différences anatomiques de taille et de forme du larynx contribuent aux variations de timbre et de hauteur de voix ; en moyenne, les voix masculines ont une fréquence fondamentale plus basse et les voix féminines une fréquence plus élevée. Il s’agit de tendances physiologiques générales, non de catégories rigides.
Le son généré par le larynx n’est qu’un début. Les lèvres, la mâchoire, la langue, le pharynx et d’autres structures doivent remodeler continuellement le conduit vocal. De très légers changements de position peuvent déterminer si l’auditeur perçoit un phonème plutôt qu’un autre. Les mouvements se chevauchent aussi : alors que la bouche achève un son, elle se prépare déjà au suivant.
Pour Chang, parler est ainsi l’un des comportements moteurs les plus complexes que les humains accomplissent. Une conversation fluide masque cette complexité, car les mouvements sous-jacents deviennent en grande partie automatiques. Nous nous concentrons généralement sur les idées et le contexte social, non sur le placement conscient de la langue ou le timing des cordes vocales.
Quand une personne est pleinement consciente mais ne peut pas parler
Les enjeux deviennent particulièrement évidents dans le syndrome d’enfermement. Un accident vasculaire cérébral du tronc cérébral, la sclérose latérale amyotrophique ou une autre affection neurologique grave peuvent laisser intactes les capacités cognitives et la conscience, tout en supprimant presque tous les moyens fiables d’expression volontaire.
Chang évoque un participant à l’essai clinique BRAVO, qui vivait avec une paralysie profonde depuis environ 15 ans à la suite d’un accident de voiture et d’un AVC du tronc cérébral. Il ne pouvait ni bouger ses bras ni ses jambes, ni produire une parole intelligible. Avant de participer à l’étude, il communiquait lentement en effectuant des mouvements limités du cou pour sélectionner des lettres sur un écran.
L’objectif de l’essai était simple dans son principe, mais redoutable sur le plan technique : détecter l’activité du cortex cérébral pendant que le participant tentait de parler, puis traduire cette activité en mots sur un ordinateur. Des chirurgiens ont placé une matrice d’électrodes sur des régions corticales impliquées dans le contrôle des lèvres, de la langue, de la mâchoire, du larynx et, plus largement, du conduit vocal. Une connexion fixée au crâne permettait à l’implant de transmettre les signaux enregistrés à un équipement externe.
Cette approche ne lit pas les pensées sans restriction. Elle se concentre sur l’activité neuronale associée à la parole tentée — les schémas moteurs produits lorsqu’un participant essaie délibérément de dire quelque chose. Cette distinction est essentielle tant pour le fonctionnement du système que pour une discussion responsable de ses capacités.
Décoder la parole tentée grâce à l’apprentissage automatique
Les enregistrements électriques du cortex contiennent des motifs complexes plutôt que des mots soigneusement étiquetés. Les chercheurs doivent repérer les relations subtiles entre ces motifs et les mouvements de parole que le participant a l’intention de produire.
Dans l’essai décrit par Chang, l’activité enregistrée a été convertie en données numériques puis traitée par des modèles d’apprentissage automatique. L’entraînement a duré plusieurs semaines et s’est d’abord concentré sur un vocabulaire de 50 mots. Bien que limité, ce vocabulaire pouvait être combiné en de nombreuses phrases utiles et constituait une base pour une extension future.
Le décodage n’est pas parfait. Des mouvements sans rapport avec une tentative de parole peuvent modifier l’activité neuronale ou perturber le signal. Chang se souvient de la réaction émotionnelle du participant lorsque le système a commencé à produire des mots : il tremblait, bougeait la tête et gloussait de rire. Sa joie était profondément humaine, mais ses mouvements compliquaient l’interprétation par le système de ce qu’il tentait de dire ensuite.
La modélisation du langage peut compenser certaines erreurs. Tout comme les claviers de téléphone utilisent les séquences de mots probables pour corriger les lettres mal saisies, une neuroprothèse de la parole peut tenir compte des combinaisons décodées qui ont un sens linguistique. Cela ne remplace pas le signal cérébral ; cela aide à résoudre l’incertitude lorsque plusieurs résultats possibles ressemblent au motif enregistré.
Chang inscrit ce travail dans la longue histoire des interfaces cerveau-machine. Les systèmes antérieurs se concentraient souvent sur le déplacement de bras robotiques ou le contrôle de curseurs d’ordinateur. Le décodage de la parole étend le même principe général à un besoin humain profondément social : participer à une conversation.
Rétablir davantage que des mots
La communication n’est pas un simple flux de texte. L’expression du visage, le rythme, le regard, les mouvements de la bouche et le ton de la voix influencent tous ce qu’une autre personne comprend. Les mouvements visibles de la mâchoire et des lèvres peuvent améliorer l’intelligibilité, tandis que les réactions de l’auditeur aident le locuteur à s’ajuster en temps réel.
C’est pourquoi la vision de Chang va au-delà de l’affichage de mots décodés. Des chercheurs étudient des systèmes reliant la parole tentée à des visages animés capables de reproduire des mouvements de bouche et des expressions pertinents. Un avatar numérique pourrait potentiellement parler au nom de son utilisateur tout en rétablissant une partie des informations non verbales perdues dans une communication exclusivement textuelle.
L’incarnation peut aussi rendre ces systèmes plus faciles à apprendre. Lorsque les utilisateurs voient un avatar répondre immédiatement à leurs intentions, ce retour peut les aider à sentir qu’ils contrôlent directement le résultat. L’interface ressemble alors moins à l’utilisation d’un appareil détaché qu’à l’acquisition d’un nouveau canal d’expression.
Ce travail pourrait être particulièrement important dans les espaces sociaux numériques, où un avatar expressif peut permettre à une personne paralysée de participer plus naturellement. L’objectif n’est pas le réalisme esthétique pour lui-même. Il s’agit de rendre à la personne son pouvoir d’agir, ses nuances émotionnelles et sa présence dans la conversation.
Ce que le bégaiement révèle sur la fluidité
Chang utilise le bégaiement pour illustrer à quel point le système de la parole doit coordonner ses composantes avec précision. Les personnes qui bégaient possèdent généralement les connaissances linguistiques et savent ce qu’elles veulent communiquer. La difficulté réside dans la production fluide de la parole, notamment dans l’initiation et la coordination des mouvements du conduit vocal.
L’anxiété peut intensifier le bégaiement, mais Chang met en garde contre l’idée d’en faire sa cause fondamentale. Cette condition semble impliquer le fonctionnement du cerveau et la coordination de la parole, tandis que son mécanisme complet reste non résolu. Elle peut aussi varier considérablement : une personne peut bégayer dans une situation et parler avec fluidité dans une autre.
Cette variabilité offre un indice important. Si une parole fluide reste possible à certains moments, les chercheurs peuvent se demander quels changements dans le cerveau permettent au système de se coordonner avec succès. Chang compare la production normale de la parole à une symphonie : de nombreux éléments doivent intervenir au bon moment, et une petite perturbation peut affecter l’ensemble de la performance.
Le système auditif est l’un des participants essentiels. Parler n’est pas un processus à sens unique dans lequel le cerveau se contente d’émettre des commandes motrices. Il écoute aussi la voix produite et utilise ce retour pour réguler la production. Modifier ce que les locuteurs entendent peut améliorer ou aggraver le bégaiement, ce qui montre à quel point perception et articulation sont étroitement liées.
Un soutien précoce peut être particulièrement précieux, car le cerveau en développement possède une forte plasticité. L’orthophonie peut aider à l’initiation, introduire des stratégies créant des conditions plus favorables à la fluidité, explorer le retour auditif et accompagner l’anxiété développée autour de la parole. Le traitement consiste donc moins à forcer la parole qu’à aider le système à trouver une coordination fiable.
De la restauration médicale à l’augmentation humaine
Lorsqu’une interface implantée peut restaurer une fonction perdue, une question plus difficile se pose : une technologie similaire devrait-elle améliorer les capacités au-delà de la plage ordinaire ?
Chang observe que l’augmentation n’est pas une impulsion humaine nouvelle. Les gens utilisent déjà la caféine, la nicotine, les médicaments, l’éducation et d’innombrables outils pour modifier leur attention, leur endurance, leur mémoire ou leurs performances. Les neurotechnologies soulèvent néanmoins des préoccupations particulières, car elles peuvent impliquer une intervention chirurgicale, un accès direct aux signaux neuronaux et une disponibilité inégale.
Les améliorations possibles pourraient inclure une communication plus rapide ou de meilleures capacités cognitives, mais la parole biologique reste extraordinairement difficile à dépasser. La communication humaine repose sur des systèmes neuronaux contenant des millions de neurones et affinés par l’évolution, le développement et l’apprentissage tout au long de la vie. La technologie actuelle ne peut pas reproduire toute cette bande passante.
Si l’augmentation se concrétise, Chang suggère qu’elle pourrait émerger par étapes modestes plutôt que par un unique saut spectaculaire. Ce chemin progressif rend les questions de consentement, de sécurité, de confidentialité, de propriété et d’accès plus urgentes, et non moins. Une technologie peut avoir des conséquences sociales avant même de paraître révolutionnaire.
Le cas le plus immédiat en faveur des neuroprothèses de la parole demeure la restauration. Pour une personne pleinement consciente mais incapable d’exprimer une phrase, même un petit vocabulaire peut rouvrir un chemin vers les autres. L’ambition à long terme est plus riche : une communication plus rapide, plus expressive et suffisamment incarnée pour sembler lui appartenir.



