기술

소리 없이 입모양만으로 대화 내용을 정확히 맞히는 인공지능 기술

소리 없이 입모양만으로 대화 내용을 정확히 맞히는 인공지능 기술

오디오-비주얼 음성 인식 기술은 소리뿐만 아니라 입술의 움직임을 함께 분석하여 사람이 말하는 내용을 파악합니다. 주변이 시끄러워 목소리가 잘 들리지 않는 환경에서도 입모양을 단서로 삼아 훨씬 정확하게 언어를 식별해냅니다.

이 기술은 우리가 상대방의 얼굴을 보며 대화할 때 소리에만 의존하지 않는 것과 같은 원리를 컴퓨터에 적용한 것입니다. 소음이 섞여 발음이 불분명할 때 컴퓨터는 입술의 미세한 떨림을 추적하여 단어를 더욱 명확하게 구분합니다. 마치 숙련된 독순술가처럼 소리의 빈틈을 시각 정보로 채우는 셈이죠. 앞으로 스마트폰이나 인공지능 스피커가 더욱 정교해지면, 시끄러운 공공장소에서도 오차 없이 완벽한 음성 인식이 가능해질 것입니다.

출처: Audio-visual speech recognition

ko en