에센셜: 언어를 배우고 말하는 과학 | 에디 창 박사
말하기는 질병이나 부상이 이를 방해하기 전까지는 아무런 노력 없이 이루어지는 것처럼 느껴진다. 하지만 알아들을 수 있는 문장 하나하나는 놀라운 협응에 의존한다. 뇌는 의미 있는 단어를 고르고, 그 소리를 조직하며, 수십 개의 근육을 지휘하고, 결과를 확인해 수정해야 한다. 이 모든 과정은 대개 1초의 일부에 해당하는 시간 안에 이루어진다.
이 대화에서 신경과학자이자 신경외과 의사인 에디 창 박사는 그 숨은 작동 원리를 설명하고, 심각한 마비를 지닌 사람들의 의사소통을 회복하려는 노력도 소개한다. 그의 논의는 말과 언어의 차이, 말더듬, 신경 디코딩, 표현력 있는 아바타, 인간 능력 증강을 둘러싼 윤리적 질문까지 폭넓게 다룬다.
말은 신호이고, 언어는 의미를 전달한다
창은 흔히 같은 의미로 취급되는 두 개념을 구분하며 이야기를 시작한다. 말은 신체가 만들어 내는 일정한 패턴의 소리, 즉 물리적인 의사소통 신호다. 언어는 그러한 신호에 의미를 부여하는 더 큰 체계다.
언어에는 단어가 무엇을 뜻하는지에 관한 의미론, 단어가 어떻게 배열되는지에 관한 통사론, 그리고 맥락이 해석에 어떤 영향을 주는지에 관한 화용론이 포함된다. 따라서 말은 언어 그 자체가 아니라 언어를 표현하는 한 방식이다. 읽기와 수어 역시 음성을 필요로 하지 않으면서 언어적 구조를 전달한다.
이 구분은 임상적으로 중요하다. 어떤 사람은 자신이 말하고 싶은 바를 정확히 알고 있어도 알아들을 수 있는 말을 만들어 내지 못할 수 있다. 반대로 소리를 낼 신체적 능력은 유지하면서도 언어를 이해하거나 조직하는 능력의 일부를 잃을 수도 있다. 어느 단계에서 과정이 무너졌는지를 파악하는 일은 신경학적 장애를 이해하고 보조 기술을 설계하는 데 필수적이다.
창은 또한 말과 발성을 구별한다. 울음, 웃음, 신음, 그 밖의 자발적인 소리는 공기가 후두를 통과하면서 만들어지지만, 반드시 구어를 구성하는 데 사용되는 것과 동일한 신경계가 작동하는 것은 아니다. 말과 관련된 뇌 영역에 손상을 입은 일부 사람도 여전히 발성할 수 있는데, 이는 뇌가 이러한 행동을 위해 부분적으로 분리된 경로를 유지한다는 점을 시사한다.
신체는 어떻게 호흡을 단어로 바꾸는가
말은 공기의 흐름에서 시작된다. 후두는 성대를 서로 붙게 하고, 그 사이를 지나는 공기는 진동을 만든다. 이렇게 생긴 원초적인 음향 에너지를 성도가 알아들을 수 있는 자음과 모음으로 바꾼다.
창은 성대의 진동이 일반적으로 약 100~200헤르츠 범위에 있다고 설명한다. 후두의 크기와 형태에서 오는 해부학적 차이는 음색과 음높이의 차이에 영향을 준다. 평균적으로 남성의 목소리는 더 낮은 기본 주파수를, 여성의 목소리는 더 높은 기본 주파수를 보인다. 이는 엄격한 범주가 아니라 전반적인 생리학적 경향이다.
후두에서 생성된 소리는 시작일 뿐이다. 입술, 턱, 혀, 인두 및 다른 구조물은 성도를 지속적으로 재구성해야 한다. 위치의 미세한 변화에 따라 청자가 한 음소를 들을지 다른 음소를 들을지가 결정될 수 있다. 움직임은 서로 겹치기도 한다. 입이 한 소리를 끝내는 동안에도 이미 다음 소리를 준비하고 있는 것이다.
창에게 말하기는 인간이 수행하는 가장 복잡한 운동 행동 중 하나다. 유창한 대화는 기저의 움직임이 대부분 자동화되기 때문에 그 복잡성을 감춘다. 우리는 보통 혀를 어디에 둘지, 성대의 타이밍을 어떻게 맞출지를 의식하기보다 생각과 사회적 맥락에 집중한다.
인지는 온전하지만 말할 수 없는 경우
이 문제의 중요성은 감금증후군에서 특히 분명해진다. 뇌간 뇌졸중, 근위축성 측삭경화증 또는 다른 심각한 신경학적 질환은 인지와 의식을 온전하게 유지한 채 자발적으로 자신을 표현할 수 있는 거의 모든 신뢰할 만한 통로를 앗아갈 수 있다.
창은 자동차 사고와 뇌간 뇌졸중 이후 약 15년간 심각한 마비 상태로 살아온 BRAVO 임상시험 참가자를 소개한다. 그는 팔이나 다리를 움직일 수 없었고, 알아들을 수 있는 말을 만들어 낼 수도 없었다. 연구에 참여하기 전에는 제한적인 목 움직임으로 화면의 글자를 선택해 천천히 의사소통했다.
이 임상시험의 목표는 직접적이지만 기술적으로는 만만치 않았다. 참가자가 말을 하려고 시도하는 동안 대뇌피질의 활동을 감지하고, 그 활동을 컴퓨터상의 단어로 번역하는 것이었다. 외과의들은 입술, 혀, 턱, 후두 및 더 넓은 성도의 움직임을 제어하는 피질 영역 위에 전극 배열을 배치했다. 두개골에 장착된 연결 장치를 통해 임플란트는 기록한 신호를 외부 장비로 전송할 수 있었다.
이 접근법은 제한 없이 생각을 읽는 것이 아니다. 참가자가 무언가를 의도적으로 말하려 할 때 생기는 운동 패턴, 즉 말하려는 시도와 관련된 신경 활동에 초점을 맞춘다. 이 차이는 시스템의 작동 방식과 그 역량을 책임감 있게 논의하는 데 모두 핵심적이다.
머신러닝으로 말하려는 시도 디코딩하기
피질에서 기록한 전기 신호에는 깔끔하게 이름 붙은 단어가 아니라 복잡한 패턴이 담겨 있다. 연구자들은 그러한 패턴과 참가자가 의도한 말하기 움직임 사이의 미묘한 관계를 찾아야 한다.
창이 설명한 임상시험에서는 기록된 활동을 디지털 데이터로 변환한 뒤 머신러닝 모델로 처리했다. 훈련에는 몇 주가 걸렸으며, 처음에는 50개 단어로 구성된 어휘를 중심으로 이루어졌다. 제한된 어휘였지만 여러 유용한 문장으로 조합할 수 있었고, 확장의 기반이 되었다.
디코딩은 완벽하지 않다. 말하려는 시도와 무관한 움직임도 신경 활동을 바꾸거나 신호를 방해할 수 있다. 창은 시스템이 단어를 만들어 내기 시작했을 때 참가자가 감정적으로 반응했던 일을 떠올린다. 그는 몸을 떨고, 머리를 움직이고, 킥킥 웃었다. 그의 기쁨은 매우 인간적인 것이었지만, 그 움직임은 그가 다음에 무엇을 말하려 했는지에 대한 시스템의 해석을 복잡하게 만들었다.
언어 모델링은 일부 오류를 보완할 수 있다. 휴대전화 키보드가 가능성 높은 단어 순서를 사용해 오타를 바로잡듯, 말하기 신경보철도 디코딩된 조합 가운데 어떤 것이 언어적으로 자연스러운지를 고려할 수 있다. 이는 뇌 신호를 대체하는 것이 아니라, 여러 가능한 출력이 기록된 패턴과 비슷할 때 불확실성을 해소하는 데 도움을 준다.
창은 이 연구를 뇌-기계 인터페이스의 더 긴 역사 속에 위치시킨다. 초기 시스템은 흔히 로봇 팔을 움직이거나 컴퓨터 커서를 제어하는 데 집중했다. 말 디코딩은 같은 폭넓은 원리를 대화에 참여하고자 하는, 특히 사회적인 인간의 필요로 확장한다.
단어 이상을 되돌려 주기
의사소통은 단순한 텍스트 흐름이 아니다. 표정, 타이밍, 시선, 입의 움직임, 목소리의 억양은 모두 상대방이 무엇을 이해하는지에 영향을 준다. 턱과 입술의 눈에 보이는 움직임은 이해도를 높일 수 있으며, 청자의 반응은 화자가 실시간으로 조절하는 데 도움을 준다.
그래서 창의 비전은 디코딩된 단어를 보여 주는 데서 끝나지 않는다. 연구자들은 말하려는 시도를 관련 입 움직임과 표정을 재현할 수 있는 애니메이션 얼굴과 연결하는 시스템을 연구하고 있다. 디지털 아바타는 사용자를 대신해 말하면서 텍스트만으로 소통할 때 사라지는 비언어적 정보의 일부를 되돌려 줄 가능성이 있다.
신체성을 갖춘 표현은 이러한 시스템을 배우기 쉽게 만들 수도 있다. 사용자가 자신의 의도에 아바타가 즉시 반응하는 모습을 보면, 그 피드백은 자신이 결과를 직접 제어하고 있다는 감각을 형성하는 데 도움이 된다. 인터페이스는 분리된 기기를 조작하는 도구라기보다 새로운 표현 채널을 익히는 경험에 가까워진다.
이 연구는 표현력 있는 아바타가 마비된 사람이 더 자연스럽게 참여하도록 도울 수 있는 디지털 사회 공간에서 특히 중요할 수 있다. 목표는 그 자체를 위한 외형적 사실감이 아니다. 주체성, 감정의 미묘함, 대화 속 존재감을 되돌려 주는 것이다.
말더듬이 유창성에 대해 보여 주는 것
창은 말하기 시스템이 각 부분을 얼마나 정밀하게 조율해야 하는지를 설명하기 위해 말더듬을 예로 든다. 말더듬이 있는 사람들은 대체로 언어 지식을 갖추고 있으며, 자신이 무엇을 전달하고 싶은지도 알고 있다. 어려움은 유창하게 말을 만들어 내는 데 있으며, 여기에는 발성을 시작하고 성도의 움직임을 조율하는 일이 포함된다.
불안은 말더듬을 심화할 수 있지만, 창은 불안을 근본 원인으로 간주해서는 안 된다고 경고한다. 이 상태에는 뇌 기능과 말하기 협응이 관여하는 것으로 보이지만, 그 완전한 메커니즘은 아직 밝혀지지 않았다. 또한 상당한 변동성을 보일 수 있다. 한 상황에서는 말더듬이 나타나던 사람이 다른 상황에서는 유창하게 말할 수도 있다.
이러한 변동성은 중요한 단서를 제공한다. 특정 순간에 유창한 말하기가 가능하다면, 연구자들은 어떤 뇌의 변화가 시스템이 성공적으로 협응하도록 만드는지 물을 수 있다. 창은 정상적인 말 산출을 교향곡에 비유한다. 수많은 구성 요소가 정확한 때에 들어와야 하며, 작은 방해 하나가 전체 연주에 영향을 줄 수 있다.
청각계는 중요한 참여자 중 하나다. 말하기는 뇌가 단지 운동 명령을 내리는 일방적 과정이 아니다. 뇌는 생성된 자신의 목소리를 듣고, 그 피드백을 사용해 산출을 조절한다. 화자가 듣는 소리를 바꾸면 말더듬이 좋아질 수도, 악화될 수도 있는데, 이는 지각과 조음이 얼마나 긴밀하게 상호작용하는지를 보여 준다.
발달 중인 뇌는 강한 가소성을 지니므로 조기 지원은 특히 가치 있을 수 있다. 언어 치료는 말하기 시작을 다루고, 유창성에 더 유리한 조건을 만드는 전략을 도입하며, 청각 피드백을 탐색하고, 말하기를 둘러싸고 형성된 불안을 돕는다. 따라서 치료는 말을 억지로 만들어 내게 하는 것보다 시스템이 신뢰할 수 있는 협응을 찾도록 돕는 데 가깝다.
의학적 회복에서 인간 능력 증강으로
임플란트형 인터페이스가 상실된 기능을 회복할 수 있게 되면, 더 어려운 질문이 뒤따른다. 비슷한 기술이 일반적인 범위를 넘어 능력을 향상하는 데 쓰여야 할까?
창은 능력 증강이 새로운 인간의 충동은 아니라고 말한다. 사람들은 이미 카페인, 니코틴, 약물, 교육 및 수많은 도구를 이용해 주의력, 지구력, 기억력 또는 수행 능력을 바꾼다. 그럼에도 신경기술은 수술, 신경 신호에 대한 직접적인 접근, 불평등한 이용 가능성을 수반할 수 있기 때문에 고유한 우려를 낳는다.
더 빠른 의사소통이나 향상된 인지가 잠재적인 증강 형태가 될 수 있지만, 생물학적 말하기는 여전히 뛰어넘기 매우 어렵다. 인간의 의사소통은 수백만 개의 뉴런으로 이루어진 신경계에 기반하며, 진화와 발달, 평생의 학습을 통해 다듬어져 왔다. 현재의 기술로는 그 전체 대역폭을 재현할 수 없다.
능력 증강이 현실화된다면, 창은 한 번의 극적인 도약이 아니라 점진적인 단계들을 통해 나타날 수 있다고 본다. 이러한 점진적 경로는 동의, 안전, 프라이버시, 소유권, 접근성의 문제를 덜 시급하게 만드는 것이 아니라 오히려 더 시급하게 만든다. 기술은 혁명적으로 보이기 전에 이미 사회적으로 중대한 영향을 미칠 수 있다.
말하기 신경보철의 가장 즉각적인 근거는 여전히 회복에 있다. 의식은 온전하지만 한 문장도 표현할 수 없는 사람에게는 작은 어휘만으로도 다른 사람에게 이르는 길이 다시 열릴 수 있다. 장기적인 목표는 더 풍부하다. 더 빠르고, 더 표현력이 있으며, 자신의 것처럼 느낄 만큼 충분한 신체성을 지닌 의사소통이다.



