AI 기술 비전공자를 위한 음성 복제 솔루션의 사용성 중심 파이프라인 구현

Implementing a usability-focused pipeline for a voice replication solution for non-AI professionals

초록

본 논문은 음성 복제 기술 비전공자도 재현 가능하게 적용하도록, 한 흐름으로 연결된 사용성 중심(end-to-end) 파이프라인을 제안한다. 2장에서는 음성 복제에 활용 가능한 모델들을 기능·제약·활용 관점에서 비교하여, 실무에서 모델을 선택할 때 고려해야 할 기준(데이터 요구량, 생성 품질, 운용 난이도 등)을 정리한다. 3장에서는 실험 대상인 F5-TTS, XTTS-V2, Chatterbox Turbo-TTS의 구조적 특징과 적용 방향을 제시하여, 동일한 목표(음성 복제)라도 모델별 강점이 다름을 설명한다. 4장에서는 자동화 벤치마크와 앱 기반 평가 절차를 통해 유사성(화자성 유지), 심미성(자연성/음질), 복제 성능(내용 충실도/안정성)을 객관 지표로 측정하고, 시나리오·텍스트 단위 결과를 집계해 비교 가능성을 높인다. 결론에서는 이러한 실험 결과를 토대로 용도별 모델 적합성을 논의하고, 자동 지표 한계를 보완하기 위한 인간 청취 평가 도입및 이를 교육 커리큘럼(실습 레시피·평가 루브릭)으로 확장하는 개선 방향을 제안한다.

키워드

음성 복제자동화 벤치마크사용성 중심 파이프라인유사성심미성복제 성능Voice CloningAutomated BenchmarkUsability-focused PipelineSimilarityAestheticsCloning Performance
제목
AI 기술 비전공자를 위한 음성 복제 솔루션의 사용성 중심 파이프라인 구현
제목 (타언어)
Implementing a usability-focused pipeline for a voice replication solution for non-AI professionals
저자
김강섭이강희
DOI
10.17703/JCCT.2026.12.3.9
발행일
2026-05
유형
Y
저널명
문화기술의 융합
12
3
페이지
9 ~ 20