상세 보기
환경음 분류와 위치 정보를 이용한 딥러닝 기반 음성 품질 향상 기법
A Deep Learning based Speech Quality Enhancement Scheme Using Environmental Sound Classification and Location Information
- 강병휘;
- 노동건
초록
음성 처리 분야에서 딥러닝은 음성인식의 정밀도를 향상시켜 많은 발전을 이루었다. 그중 하나인 음성 향상은 말하는 음성과 잡음이 섞여있는 입력에서 음성과 잡음을 분리시켜 음성 품질을 향상시킬 수 있는 기법이다. 이는 AI-스피커, 스마트폰 등에 활용되어 사람 대 사람, 기계 대 인간과의 의사소통을 원활하게 하고 로봇이나 문자 음성 변환(Text-to-Speech) 등을 위한 깨끗한 음성 데이터 수집을 가능하게 한다. 하지만 단일 모델만을 사용한 기존 음성 향상 기법은 환경마다 특수적으로 발생하는 잡음 제거에 있어 효과적이지 못하다. 환경 특수적으로 발생할 수 있는 잡음을 효과적으로 제거하기 위해, 본 논문은 음향 장면 분류 기법과 위치 정보 활용 기술을 결합하여 최적의 환경별 음성 향상이 이루어 질 수 있게 하는 딥러닝 모델을 제안한다. 실험 결과 SNR 9 dB을 기준으로 하였을 때, 본 기법이 기존 딥러닝 모델 대비 PESQ 값은 평균 0.06 이상, STOI 값은 평균 0.015 이상의 향상된 품질을 보임을 확인하였다.
키워드
speech enhancement; environmental sound classification; deep learning; location information; 음성 향상; 환경음 분류; 딥러닝; 위치정보
- 제목
- 환경음 분류와 위치 정보를 이용한 딥러닝 기반 음성 품질 향상 기법
- 제목 (타언어)
- A Deep Learning based Speech Quality Enhancement Scheme Using Environmental Sound Classification and Location Information
- 저자
- 강병휘; 노동건
- 발행일
- 2023-04
- 저널명
- 정보과학회논문지
- 권
- 50
- 호
- 4
- 페이지
- 344 ~ 350