- OpenVoice는 참조 음색을 복제해 여러 언어와 억양으로 음성을 생성하는 즉각적 음성 복제 프로젝트이며, V1과 V2 기능을 공개함
- V1은 정확한 음색 복제, 감정·억양·리듬·멈춤·억양 변화 같은 음성 스타일 제어, 제로샷 교차 언어 음성 복제를 지원함
- OpenVoice V2는 2024년 4월 공개됐으며, V1 기능을 포함하면서 다른 학습 전략으로 더 나은 오디오 품질을 제공함
- V2는 영어, 스페인어, 프랑스어, 중국어, 일본어, 한국어를 네이티브 다국어로 지원하며, V1과 V2 모두 MIT License로 상업·연구 용도에 무료 사용 가능함
- OpenVoice는 2023년 5월부터 myshell.ai의 즉각 음성 복제 기능에 사용됐고, 2023년 11월까지 전 세계 사용자에게 수천만 회 사용됨
OpenVoice가 제공하는 음성 복제 기능
OpenVoice V1의 핵심 기능
-
정확한 음색 복제
- 참조 음색을 정확하게 복제할 수 있음
- 여러 언어와 억양으로 음성을 생성할 수 있음
-
유연한 음성 스타일 제어
- 감정과 억양을 세밀하게 제어할 수 있음
- 리듬, 멈춤, 억양 변화 같은 스타일 파라미터도 제어 대상임
-
제로샷 교차 언어 음성 복제
- 생성 음성의 언어와 참조 음성의 언어가 대규모 다화자 다국어 학습 데이터셋에 포함돼 있지 않아도 됨
OpenVoice V2의 변경점
- OpenVoice V2는 2024년 4월 공개됨
- V2는 V1의 모든 기능을 포함함
- 다른 학습 전략을 채택해 더 나은 오디오 품질을 제공함
- 영어, 스페인어, 프랑스어, 중국어, 일본어, 한국어를 네이티브로 지원함
- 2024년 4월부터 V2와 V1 모두 MIT License로 공개돼 상업적 사용이 무료임
실제 사용과 공개 범위
- OpenVoice는 2023년 5월부터 myshell.ai의 즉각 음성 복제 기능을 구동해 왔음
- 2023년 11월까지 음성 복제 모델이 전 세계 사용자에게 수천만 회 사용됨
- README에는 데모 Video가 포함돼 있음