WhisperSpeech 개요
- WhisperSpeech는 Whisper를 역으로 구축하여 만든 오픈 소스 텍스트-투-스피치 시스템임.
- 이 모델은 강력하면서도 쉽게 커스터마이징할 수 있도록 설계되었으며, 상업적 용도로 안전하게 사용할 수 있음.
- 현재 모델은 영어 LibreLight 데이터셋을 기반으로 훈련되었으며, 다음 릴리스에서는 다양한 언어를 지원할 예정임.
진행 상황 업데이트 [2024-01-18]
- 최근 한 주 동안 추론 성능 최적화에 집중함.
torch.compile통합, kv-캐싱 추가, 일부 레이어 조정을 통해 소비자용 4090에서 실시간보다 12배 빠른 속도로 작업 중임.- 단일 문장에서 여러 언어를 혼합하는 기능을 추가함.
- 음성 복제를 쉽게 테스트할 수 있는 방법도 추가함.
진행 상황 업데이트 [2024-01-10]
- 더 빠르면서도 고품질의 음성을 생성하는 새로운 SD S2A 모델을 배포함.
- 참조 오디오 파일을 기반으로 한 음성 복제 예제도 추가함.
진행 상황 업데이트 [2023-12-10]
- 영어와 폴란드어를 지원하는 새로운 모델 3개를 추가함.
- 새로운 샘플 음성을 제공하며, Colab에서 직접 시도해볼 수 있음.
다운로드
- Google Colab 링크를 시작점으로 사용하거나 제공된 노트북을 로컬에서 실행할 것을 권장함.
- 수동 다운로드나 모델을 처음부터 훈련하고 싶다면, HuggingFace에서 WhisperSpeech 사전 훈련 모델과 변환된 데이터셋을 이용할 수 있음.
로드맵
- 더 큰 감정적인 음성 데이터셋 수집
- 감정과 억양에 따라 생성을 조절하는 방법 찾기
- 다양한 언어로 자유롭게 사용 가능한 음성을 수집하기 위한 커뮤니티 노력 창출
- 최종 다국어 모델 훈련
아키텍처
- AudioLM, SPEAR TTS, MusicGen과 유사한 일반적인 아키텍처를 가짐.
- 강력한 오픈 소스 모델을 기반으로 구축: 의미 토큰 생성과 전사를 위한 OpenAI의 Whisper, 음향 모델링을 위한 Meta의 EnCodec, 고품질 보코더로서 Charactr Inc의 Vocos.
감사의 말
- 이 작업은 Collabora, LAION, Jülich Supercomputing Centre의 후원과 개인 기여자들의 도움으로 가능함.
컨설팅
- 오픈 소스 및 독점 AI 프로젝트에 대한 도움을 제공할 수 있음.
인용
- 다양한 뛰어난 오픈 소스 프로젝트와 연구 논문에 의존함.
GN⁺의 의견
- WhisperSpeech는 음성 합성 분야에서 혁신적인 오픈 소스 프로젝트로, 다양한 언어를 지원하며 상업적 용도로 안전하게 사용할 수 있는 강력한 텍스트-투-스피치 모델을 제공함.
- 최신 기술을 활용하여 실시간보다 훨씬 빠른 성능을 달성하고, 음성 복제와 같은 고급 기능을 쉽게 테스트할 수 있는 접근성을 갖추고 있음.
- 이 프로젝트는 커뮤니티 기반으로 발전하고 있으며, 다양한 언어로의 확장과 감정적인 요소를 포함한 음성 생성을 목표로 하고 있어, 음성 기술의 미래에 중요한 역할을 할 것으로 기대됨.