top of page

Essentials: Die Wissenschaft des Sprachenlernens und -sprechens | Dr. Eddie Chang

26. Aug.
6 Min. Lesezeit

Sprechen fühlt sich mühelos an – bis Krankheit oder Verletzung es beeinträchtigen. Doch jeder verständliche Satz beruht auf einer erstaunlichen Koordination: Das Gehirn muss bedeutungsvolle Wörter auswählen, ihre Laute organisieren, Dutzende Muskeln steuern, das Ergebnis überwachen und Korrekturen vornehmen – oft innerhalb von Sekundenbruchteilen.

In diesem Gespräch erklärt der Neurowissenschaftler und Neurochirurg Dr. Eddie Chang diese verborgene Maschinerie und beschreibt Bemühungen, Menschen mit schwerer Lähmung wieder Kommunikation zu ermöglichen. Seine Ausführungen reichen von der Unterscheidung zwischen Sprechen und Sprache über Stottern, neuronale Dekodierung und ausdrucksstarke Avatare bis hin zu den ethischen Fragen rund um menschliche Verbesserung.

Sprechen ist ein Signal; Sprache vermittelt Bedeutung

Chang beginnt damit, zwei Konzepte voneinander zu trennen, die oft gleichgesetzt werden. Sprechen ist ein physisches Kommunikationssignal: ein vom Körper erzeugter, strukturierter Schall. Sprache ist das umfassendere System, das diesen Signalen Bedeutung verleiht.

Sprache umfasst Semantik, also die Bedeutung von Wörtern; Syntax, also die Anordnung von Wörtern; und Pragmatik, also den Einfluss des Kontexts auf die Interpretation. Sprechen ist daher eine Ausdrucksform von Sprache, nicht Sprache selbst. Auch Lesen und Gebärdensprache vermitteln sprachliche Strukturen, ohne eine gesprochene Stimme zu benötigen.

Diese Unterscheidung ist klinisch wichtig. Eine Person kann genau wissen, was sie sagen möchte, aber nicht in der Lage sein, verständliche Sprache zu produzieren. Umgekehrt kann jemand die körperliche Fähigkeit behalten, Laute zu erzeugen, während Aspekte des sprachlichen Verstehens oder der sprachlichen Organisation verloren gehen. Zu erkennen, an welcher Stelle der Prozess gestört ist, ist entscheidend für das Verständnis neurologischer Erkrankungen und die Entwicklung unterstützender Technologien.

Chang unterscheidet außerdem zwischen Sprechen und Lautäußerungen. Weinen, Lachen, Stöhnen und andere spontane Laute beruhen darauf, dass Luft durch den Kehlkopf strömt, doch sie nutzen nicht zwingend dieselben neuronalen Systeme, die gesprochene Sprache aufbauen. Manche Menschen mit Verletzungen in sprachrelevanten Hirnregionen können weiterhin Laute äußern, was darauf hindeutet, dass das Gehirn für diese Verhaltensweisen teilweise getrennte Bahnen aufrechterhält.

Wie der Körper Atem in Wörter verwandelt

Sprechen beginnt mit Luftstrom. Der Kehlkopf bringt die Stimmlippen zusammen, sodass vorbeiströmende Luft Schwingungen erzeugen kann. Dadurch entsteht die rohe akustische Energie, die der Vokaltrakt anschließend in erkennbare Konsonanten und Vokale umformt.

Chang weist darauf hin, dass die Schwingungen der Stimmlippen häufig ungefähr im Bereich von 100 bis 200 Hertz liegen. Anatomische Unterschiede in Größe und Form des Kehlkopfs tragen zu Unterschieden in Stimmklang und Tonhöhe bei; im Durchschnitt haben männliche Stimmen eine niedrigere Grundfrequenz und weibliche Stimmen eine höhere. Dabei handelt es sich um breite physiologische Tendenzen, nicht um starre Kategorien.

Der im Kehlkopf erzeugte Klang ist nur der Anfang. Lippen, Kiefer, Zunge, Rachen und weitere Strukturen müssen den Vokaltrakt kontinuierlich umformen. Winzige Positionsänderungen können darüber entscheiden, ob Zuhörende ein bestimmtes Phonem oder ein anderes hören. Die Bewegungen überlappen sich zudem: Während der Mund einen Laut beendet, bereitet er bereits den nächsten vor.

Für Chang macht dies das Sprechen zu einem der komplexesten motorischen Verhaltensweisen des Menschen. Fließende Gespräche verbergen diese Komplexität, weil die zugrunde liegenden Bewegungen weitgehend automatisch ablaufen. Normalerweise konzentrieren wir uns auf Ideen und den sozialen Kontext, nicht darauf, die Zunge bewusst zu positionieren oder die Stimmlippen zeitlich zu koordinieren.

Wenn jemand geistig präsent ist, aber nicht sprechen kann

Besonders deutlich werden die Folgen beim Locked-in-Syndrom. Ein Hirnstammschlaganfall, amyotrophe Lateralsklerose oder eine andere schwere neurologische Erkrankung kann Kognition und Bewusstsein intakt lassen, während nahezu jeder verlässliche Kanal für willentliche Äußerungen verloren geht.

Chang berichtet über einen Teilnehmer der klinischen BRAVO-Studie, der nach einem Autounfall und einem Hirnstammschlaganfall etwa 15 Jahre mit schwerster Lähmung gelebt hatte. Er konnte weder Arme noch Beine bewegen noch verständlich sprechen. Vor Beginn der Studie kommunizierte er langsam, indem er begrenzte Nackenbewegungen nutzte, um Buchstaben auf einem Bildschirm auszuwählen.

Das Ziel der Studie war direkt, technisch jedoch äußerst anspruchsvoll: Aktivität in der Großhirnrinde erfassen, während der Teilnehmer zu sprechen versuchte, und diese Aktivität dann in Wörter auf einem Computer übersetzen. Chirurgen platzierten ein Elektrodenarray über kortikalen Regionen, die Lippen, Zunge, Kiefer, Kehlkopf und den umfassenderen Vokaltrakt steuern. Eine am Schädel befestigte Verbindung ermöglichte es dem Implantat, die aufgezeichneten Signale an externe Geräte zu übertragen.

Dieser Ansatz liest keine uneingeschränkten Gedanken. Er konzentriert sich auf neuronale Aktivität, die mit beabsichtigtem Sprechen verbunden ist – also auf die motorischen Muster, die entstehen, wenn ein Teilnehmer bewusst versucht, etwas zu sagen. Diese Unterscheidung ist sowohl für die Funktionsweise des Systems als auch für eine verantwortungsvolle Diskussion seiner Möglichkeiten zentral.

Versuchte Sprache mit maschinellem Lernen dekodieren

Elektrische Aufzeichnungen aus der Großhirnrinde enthalten komplexe Muster statt eindeutig beschrifteter Wörter. Forschende müssen feine Zusammenhänge zwischen diesen Mustern und den Sprechbewegungen erkennen, die ein Teilnehmer beabsichtigt.

In der von Chang beschriebenen Studie wurde die aufgezeichnete Aktivität in digitale Daten umgewandelt und von Modellen des maschinellen Lernens verarbeitet. Das Training dauerte Wochen und konzentrierte sich zunächst auf einen Wortschatz von 50 Wörtern. Obwohl dieser begrenzt war, ließ er sich zu zahlreichen nützlichen Sätzen kombinieren und bildete eine Grundlage für die Erweiterung.

Die Dekodierung ist nicht perfekt. Bewegungen, die nicht mit beabsichtigtem Sprechen zusammenhängen, können neuronale Aktivität verändern oder das Signal stören. Chang erinnert sich daran, dass der Teilnehmer emotional reagierte, als das System begann, Wörter zu erzeugen: Er zitterte, bewegte den Kopf und kicherte. Seine Freude war zutiefst menschlich, doch die Bewegung erschwerte es dem System, zu deuten, was er als Nächstes sagen wollte.

Sprachmodelle können einige Fehler ausgleichen. So wie Smartphone-Tastaturen wahrscheinliche Wortfolgen nutzen, um falsch getippte Buchstaben zu korrigieren, kann eine Sprach-Neuroprothese berücksichtigen, welche dekodierten Kombinationen sprachlich sinnvoll sind. Das ersetzt nicht das Hirnsignal; es hilft dabei, Unsicherheit aufzulösen, wenn mehrere mögliche Ausgaben dem aufgezeichneten Muster ähneln.

Chang ordnet diese Arbeit in die längere Geschichte von Gehirn-Maschine-Schnittstellen ein. Frühere Systeme konzentrierten sich häufig darauf, Roboterarme zu bewegen oder Computerzeiger zu steuern. Die Sprachdekodierung erweitert dasselbe grundlegende Prinzip auf ein besonders soziales menschliches Bedürfnis: die Teilnahme an Gesprächen.

Mehr als Wörter wiederherstellen

Kommunikation ist nicht bloß ein Textstrom. Gesichtsausdruck, Timing, Blick, Mundbewegungen und Stimmton beeinflussen alle, was eine andere Person versteht. Sichtbare Bewegungen von Kiefer und Lippen können die Verständlichkeit verbessern, während Reaktionen von Zuhörenden Sprechenden helfen, sich in Echtzeit anzupassen.

Deshalb geht Changs Vision über die Anzeige dekodierter Wörter hinaus. Forschende untersuchen Systeme, die beabsichtigtes Sprechen mit animierten Gesichtern verbinden, welche relevante Mundbewegungen und Gesichtsausdrücke nachbilden können. Ein digitaler Avatar könnte potenziell im Namen einer Nutzerin oder eines Nutzers sprechen und zugleich einen Teil der nonverbalen Informationen wiederherstellen, die bei rein textbasierter Kommunikation verloren gehen.

Auch die Verkörperung könnte diese Systeme leichter erlernbar machen. Wenn Nutzerinnen und Nutzer sehen, dass ein Avatar unmittelbar auf ihre Absichten reagiert, kann dieses Feedback ihnen helfen, das Gefühl zu haben, das Ergebnis direkt zu steuern. Die Schnittstelle wirkt dann weniger wie die Bedienung eines losgelösten Geräts und mehr wie der Erwerb eines neuen Ausdruckskanals.

Diese Arbeit könnte besonders in digitalen sozialen Räumen wichtig sein, wo ein ausdrucksstarker Avatar einer Person mit Lähmung eine natürlichere Teilnahme ermöglichen kann. Das Ziel ist nicht fotorealistisches Aussehen um seiner selbst willen. Es geht darum, Handlungsfähigkeit, emotionale Nuancen und kommunikative Präsenz zurückzugeben.

Was Stottern über Sprechflüssigkeit verrät

Chang nutzt Stottern, um zu verdeutlichen, wie präzise das Sprachsystem seine Bestandteile koordinieren muss. Menschen, die stottern, verfügen im Allgemeinen über Sprachwissen und wissen, was sie mitteilen möchten. Die Schwierigkeit liegt darin, Sprache flüssig zu produzieren, einschließlich des Einleitens und Koordinierens von Bewegungen des Vokaltrakts.

Angst kann Stottern verstärken, doch Chang warnt davor, Angst als dessen grundlegende Ursache zu betrachten. Die Erkrankung scheint Hirnfunktion und Sprechkoordination zu betreffen, während ihr vollständiger Mechanismus noch ungeklärt ist. Sie kann zudem erheblich variieren: Eine Person kann in einer Situation stottern und in einer anderen flüssig sprechen.

Diese Variabilität liefert einen wichtigen Hinweis. Wenn flüssiges Sprechen in bestimmten Momenten möglich bleibt, können Forschende untersuchen, welche Veränderungen im Gehirn dem System eine erfolgreiche Koordination ermöglichen. Chang vergleicht die normale Sprachproduktion mit einer Symphonie: Zahlreiche Komponenten müssen zum richtigen Zeitpunkt einsetzen, und eine kleine Störung kann die gesamte Aufführung beeinflussen.

Das Hörsystem ist ein entscheidender Beteiligter. Sprechen ist kein Einwegprozess, bei dem das Gehirn lediglich motorische Befehle ausgibt. Es hört auch auf die entstehende Stimme und nutzt dieses Feedback, um die Produktion zu regulieren. Veränderungen dessen, was Sprechende hören, können Stottern entweder verbessern oder verschlimmern und zeigen damit, wie eng Wahrnehmung und Artikulation zusammenwirken.

Frühe Unterstützung kann besonders wertvoll sein, weil das sich entwickelnde Gehirn eine hohe Plastizität besitzt. Sprachtherapie kann das Einleiten des Sprechens behandeln, Strategien einführen, die günstigere Bedingungen für Sprechflüssigkeit schaffen, auditives Feedback untersuchen und bei Angst helfen, die sich rund um das Sprechen entwickelt hat. Die Behandlung zielt daher weniger darauf ab, Sprache zu erzwingen, als dem System zu helfen, eine verlässliche Koordination zu finden.

Von medizinischer Wiederherstellung zu menschlicher Verbesserung

Sobald eine implantierte Schnittstelle eine verlorene Funktion wiederherstellen kann, folgt eine schwierigere Frage: Sollte eine ähnliche Technologie Fähigkeiten über den gewöhnlichen Bereich hinaus verbessern?

Chang stellt fest, dass Verbesserung kein neuer menschlicher Impuls ist. Menschen nutzen bereits Koffein, Nikotin, Medikamente, Bildung und unzählige Werkzeuge, um Aufmerksamkeit, Ausdauer, Gedächtnis oder Leistung zu verändern. Neurotechnologie wirft dennoch besondere Bedenken auf, weil sie Operationen, direkten Zugang zu neuronalen Signalen und ungleichen Zugang umfassen kann.

Mögliche Verbesserungen könnten schnellere Kommunikation oder bessere Kognition einschließen, doch biologisches Sprechen ist außerordentlich schwer zu übertreffen. Menschliche Kommunikation beruht auf neuronalen Systemen mit Millionen von Neuronen und wurde durch Evolution, Entwicklung und lebenslanges Lernen verfeinert. Die heutige Technologie kann diese vollständige Bandbreite nicht reproduzieren.

Falls Verbesserungen kommen, so Chang, könnten sie eher in kleinen Schritten als durch einen einzigen dramatischen Sprung entstehen. Dieser schrittweise Weg macht Fragen nach Einwilligung, Sicherheit, Privatsphäre, Eigentum und Zugang dringlicher, nicht weniger dringlich. Eine Technologie kann gesellschaftlich folgenreich werden, bevor sie revolutionär erscheint.

Der unmittelbarste Anwendungsfall für Sprach-Neuroprothesen bleibt die Wiederherstellung. Für jemanden, der bei vollem Bewusstsein ist, aber keinen Satz ausdrücken kann, kann selbst ein kleiner Wortschatz den Weg zu anderen Menschen wieder öffnen. Das langfristige Ziel ist umfassender: Kommunikation, die schneller, ausdrucksstärker und ausreichend verkörpert ist, um sich wie die eigene anzufühlen.

Quellen

 
 

Kostenlos loslegen

Ein Local-First-KI-Assistent mit persönlichem Wissensmanagement

Für ein besseres KI-Erlebnis

unterstützt remio derzeit nur Windows 10+ (x64) und M-Chip Macs.

Ihr KI-Partner bei der Arbeit
Mehr schaffen mit remio

Planen. Erstellen. Liefern.
Alles an einem Ort.

bottom of page