상세 보기
환경적 요인에 대한 음성 인식 기법 분석
Analysis of Speech Recognition Methods Regarding Environmental Factors
- 민동욱;
- 나현식;
- 최대선
초록
본 연구는 다양한 환경에서 한국어 음성 인식 성능을 개선하기 위한 방법을 탐구하였다. 깨끗한 음성 데이터와 노이즈 음성 데이터에서의 성능 저하, 데이터 일관성 부족, 한국어 특유의 음운 규칙으로 인한 정확도 저하 문제를 해결하고자 하였다. 이를 위해 Wav2Vec 2.0, Whisper, Google STT 등의 음성 인식 모델을 활용하고, 노이즈 제거 전처리 기술과 텍스트 후처리 커스터마이징을 적용하였다. Whisper 모델의 Transformer 기반 구조와 Self-Attention 메커니즘을 활용하여 노이즈 제거 및 텍스트 정규화 기법을 적용한 결과, 깨끗한 환경과 노이즈 환경에서의 Character Error Rate(단어 오류율)이 각각 5.53%, 9.66% 개선되었다. 또한, 다양한 환경에서 수집된 한국어 음성 데이터셋을 기반으로 모델 성능을 비교 분석하고, 한국어에 특화된 대규모 사전 훈련 언어 모델(LLM)을 후처리에 적용하여 성능 향상을 도모하였다.
키워드
automatic speech recognition; Korean speech processing; speech-to-text; noise speech data; 동 음성 인식; 한국어 음성 처리; Speech-to-Text; 노이즈 음성 데이터
- 제목
- 환경적 요인에 대한 음성 인식 기법 분석
- 제목 (타언어)
- Analysis of Speech Recognition Methods Regarding Environmental Factors
- 저자
- 민동욱; 나현식; 최대선
- 발행일
- 2025-12
- 유형
- Y
- 저널명
- 정보과학회논문지
- 권
- 52
- 호
- 12
- 페이지
- 1025 ~ 1035