인간 소통의 총체성을 포착해 온
멀티모달 말뭉치 연구의 30년
‘보이는 대화, 들리는 제스처’라는 이 역설적인 표현은 멀티모달 커뮤니케이션의 본질을 담고 있다. 대화는 귀로만 듣는 것이 아니라 눈으로도 ‘보는’ 것이며, 제스처는 눈으로만 보는 것이 아니라 그 의미로서 ‘듣는’ 것이다. 인간의 소통에서 언어와 비언어, 청각과 시각, 음성과 동작은 분리될 수 없는 하나의 통합된 메시지를 형성한다. 이처럼 복합적인 소통양식을 기록하고 분석하려는 노력이 바로 멀티모달 말뭉치 연구이다.
『보이는 대화, 들리는 제스처: 멀티모달 말뭉치 30년의 여정』은 지난 30년간 전 세계에서 구축된 멀티모달 말뭉치의 역사를 체계적으로 정리하며, 언어학·심리학·전산학이 교차하는 대화 연구의 결정적 전환점들을 그려낸 학술서이다. 이 책은 포스트휴먼적 소통의 총체적인 모습을 어떻게 경험적으로 포착할 것인가라는 한 가지 질문에서 출발한다. 그 대답으로 지난 30년간 1990년대 생체인식 데이터 수집에서 출발해 오늘날 인공지능 학습의 핵심 인프라로 진화하기까지, 멀티모달 말뭉치의 흐름을 다섯 세대로 구분하여 살핀다.
각 시대별로 AMI, IEMOCAP, FOLK, CEJC, CANDOR 등의 사례를 통해 인간 소통의 총체성을 깊이 있게 탐구한다. 이를 통해 음성과 텍스트라는 분절된 기호를 넘어 제스처, 시선, 사물, 공간까지 통합적으로 기록해 온 연구 패러다임의 전환을 조명한다. 나아가 국립국어원과 AI Hub를 중심으로 한 한국어 멀티모달 말뭉치의 현주소를 진단하고, ‘보존용 마스터’와 ‘분석용 프록시’를 병행 구축하는 ‘이중 트랙 전략’을 미래의 핵심 패러다임으로 제안한다.
기술과 언어, 인간과 기계의 경계를 넘나들며 소통의 다층적 본질을 파고드는 이 책은, 연구자와 독자 모두에게 멀티모달 커뮤니케이션의 새로운 지평을 여는 안내서가 될 것으로 기대한다. 인간의 목소리만이 아니라 손짓, 시선, 그리고 그 사이에 놓인 사물과 기술까지 인간과 비인간 행위자들이 함께 직조해 내는 의미의 네트워크를 탐구하는 연구 여정에, 이 책이 길잡이가 되기를 소망한다.