LSTM 기반의 Seq2Seq 모델을 이용한 한국어 음성인식 오류 교정 방법

Error Correction for Korean Speech Recognition using a LSTM-based Sequence-to-Sequence Model
  • 진혜원
  • 이아현
  • 채예진
  • 박수현
  • 강유진
  • ... 이수원

초록

현재 대부분의 음성인식 오류 교정에 관한 연구는 영어를 기준으로 연구되어 한국어 음성인식에대한 연구는 미비한 실정이다. 하지만 영어 음성인식에 비해 한국어 음성인식은 한국어의 언어적인특성으로 인해 된소리, 연음 등의 발음이 있어, 비교적 많은 오류를 보이므로 한국어 음성인식에 대한연구가 필요하다. 또한, 기존의 한국어 음성인식 연구는 주로 편집 거리 알고리즘과 음절 복원 규칙을사용하기 때문에, 된소리와 연음의 오류 유형을 교정하기 어렵다. 본 연구에서는 된소리, 연음 등 발음으로 인한 한국어 음성인식 오류를 교정하기 위하여 LSTM을 기반으로 한 인공 신경망 모델Sequence-to-Sequence와 Bahdanau Attention을 결합하는 문맥 기반 음성인식 후처리 모델을 제안한다. 실험 결과, 해당 모델을 사용함으로써 음성인식 성능은 된소리의 경우 64%에서 77%, 연음의 경우 74%에서 90%, 평균 69%에서 84%로 인식률이 향상되었다. 이를 바탕으로 음성인식을 기반으로 한 실제 응용프로그램에도 본 연구에서 제안한 모델을 적용할 수 있다고 사료된다.

키워드

음성인식오류 교정한국어LSTMSequence-to-SequenceBahdanau AttentionSpeech RecognitionError CorrectionKoreanLSTMSequence-to-SequenceBahdanau Attention
제목
LSTM 기반의 Seq2Seq 모델을 이용한 한국어 음성인식 오류 교정 방법
제목 (타언어)
Error Correction for Korean Speech Recognition using a LSTM-based Sequence-to-Sequence Model
저자
진혜원이아현채예진박수현강유진이수원
DOI
10.9708/jksci.2021.26.10.001
발행일
2021-10
저널명
한국컴퓨터정보학회논문지
26
10
페이지
1 ~ 7