VoxCPM2 · 30개 언어 TTS · 음성 복제

VoxCPM — 토크나이저가 필요 없는 다국어 음성 복제 TTS

공식 Hugging Face Space에서 실행되는 OpenBMB의 VoxCPM2 모델

다국어 텍스트 음성 변환, 음성 디자인, 제어 가능한 음성 복제와 48 kHz AI 음성을 온라인에서 VoxCPM으로 사용해 보세요. 이 페이지는 공개된 VoxCPM2 정보를 아래의 공식 데모와 함께 독립적이고 크롤링 가능한 가이드로 정리합니다.

2B 매개변수30개 언어음성 디자인제어 가능한 복제48 kHz 출력Apache-2.0
VoxCPM2 · 공식 Hugging Face Space
Hugging Face에서 열기

Hugging Face에서 호스팅되는 공식 VoxCPM-Demo Space이며, OpenBMB에서 제공합니다. 호스팅 환경이 시작되는 동안 첫 실행이 느릴 수 있습니다. 공개 Space에는 기밀 텍스트나 개인 음성 샘플을 입력하지 마세요.

빠른 답변

VoxCPM이란 무엇인가요?

VoxCPM은 OpenBMB의 오픈 텍스트 음성 변환 모델 제품군입니다. 최신 VoxCPM2 릴리스는 별도의 음성 토크나이저 파이프라인 없이 자연스러운 다국어 음성, 창의적인 음성 디자인과 실제 같은 음성 복제에 집중합니다.

공개 VoxCPM2 모델 카드와 프로젝트 문서에 따르면 VoxCPM2는 200만 시간 이상의 다국어 음성으로 학습된 20억 매개변수 규모의 토크나이저 없는 확산 자기회귀 TTS 모델입니다. 30개 언어를 지원하고 짧은 참조 오디오로 음성을 복제하며 AudioVAE V2를 통해 48 kHz 음성을 출력합니다.

내장된 Space는 팀이 실제로 먼저 테스트하는 워크플로(직접 다국어 TTS, 자연어 음성 디자인, 스타일 안내를 통한 제어 가능한 복제, 참조 오디오와 대본을 사용한 고충실도 복제)를 공개하므로 빠른 평가에 유용합니다.

특징

VoxCPM2가 돋보이는 이유

VoxCPM은 하나의 오픈 모델 워크플로에 다국어 생성, 음성 디자인, 복제와 프로덕션 지향 서빙을 결합합니다.

토크나이저 없는 확산 자기회귀 TTS

VoxCPM2는 개별 음성 토큰에 의존하지 않고 확산 자기회귀 아키텍처로 연속 음성 표현을 직접 생성합니다.

30개 언어 다국어 음성

모델 카드에는 중국어, 영어, 일본어, 한국어, 스페인어, 프랑스어, 독일어, 포르투갈어, 힌디어, 아랍어, 베트남어 등을 포함한 30가지 지원 언어가 나열되어 있습니다.

자연어를 활용한 음성 디자인

성별, 연령, 어조, 감정 또는 속도와 같은 속성을 사용하여 화자를 설명하고 VoxCPM2가 참조 오디오 없이 새로운 합성 음성을 생성하도록 합니다.

제어 가능한 고품질 음성 복제

짧은 참조 클립으로 음색을 유지하고 스타일 지침으로 표현을 조절할 수 있습니다. 대본을 함께 제공하면 원본 스타일을 더 충실하게 복제할 수 있습니다.

48 kHz 출력 및 스트리밍 경로

VoxCPM2는 16 kHz 참조 오디오를 입력받아 48 kHz 음성을 출력합니다. 문서에서는 표준 추론과 더 빠른 Nano-vLLM 서빙을 통한 실시간 스트리밍을 소개합니다.

오픈 릴리스와 안전 지침

Apache-2.0으로 공개되었지만 프로젝트는 사칭, 사기와 허위 정보 생성을 명시적으로 금지합니다. AI 생성 오디오임을 명확히 표시하세요.

사용방법

4단계로 VoxCPM을 사용해 보세요

호스팅된 Space는 로컬 설정 없이 핵심 VoxCPM2 워크플로를 제공합니다.

1

VoxCPM 스페이스 열기

위에 내장된 Hugging Face Space를 사용하거나 새 탭에서 엽니다. 호스팅된 환경이 종속성과 모델을 로드하는 동안 콜드 스타트에는 추가 시간이 걸릴 수 있습니다.

2

지원되는 언어로 텍스트를 입력하세요.

스크립트를 직접 붙여넣으세요. VoxCPM2는 별도의 언어 태그 없이 다국어 입력이 가능하도록 설계되었으므로 대상 언어의 짧은 문장으로 시작하세요.

3

음성 디자인 또는 복제 선택

음성 디자인의 경우 텍스트 앞에 자연어 화자 설명을 넣습니다. 복제의 경우 깔끔한 참조 클립을 업로드하고 속도나 감정을 바꾸고 싶을 때만 스타일 지침을 추가하세요.

4

설정을 조정하고 듣기

데모에서 추론 단계, 가이던스, 노이즈 제거 또는 스타일 설정을 조정하고 짧은 샘플을 생성한 뒤 발음, 속도와 화자 스타일이 원하는 수준이 될 때까지 반복하세요.

모델 세부정보

VoxCPM 기능 개요

빠른 평가를 위해 재작성된 VoxCPM2 Hugging Face 모델 카드, Space 메타데이터, 문서 및 프로젝트 데모 페이지의 주요 공개 사실입니다.

모델 제품군
OpenBMB의 VoxCPM / VoxCPM2
주요 작업
다국어 텍스트 음성 변환, 음성 디자인, 제어 가능한 음성 복제 및 고품질 복제
아키텍처
LocEnc → TSLM → RALM → LocDiT로 구성된 토크나이저 없는 확산 자기회귀 TTS 파이프라인
크기 및 백본
MiniCPM-4 백본에 구축된 2B 매개변수
학습 규모
공개 모델 카드 기준 200만 시간 이상의 다국어 음성 데이터
언어 적용 범위
30개 언어 및 쓰촨어, 광둥어, 우어, 북동부 만다린어 등을 포함한 중국어 방언 지원
오디오 품질
16 kHz 참조 오디오를 수용하고 AudioVAE V2를 통해 48 kHz 음성을 출력합니다.
호스팅된 데모
openbmb/VoxCPM-Demo의 공식 Gradio Space는 현재 openbmb-voxcpm-demo.hf.space에서 제공됩니다.
라이선스
VoxCPM2 모델 및 Space 메타데이터 기준 Apache-2.0
사용 사례

VoxCPM으로 만들 수 있는 것

VoxCPM은 음성 프로젝트에 다국어 지원, 제어 가능한 표현과 자체 호스팅 옵션이 필요할 때 특히 유용합니다.

다국어 상품 해설

최종 인간 내레이션을 녹음하기 전에 여러 언어로 제품 둘러보기, 강의 및 설명을 위한 음성 해설 초안을 만듭니다.

음성 에이전트 프로토타이핑

프로덕션 음성 에이전트 스택을 연결하기 전에 음성 페르소나, 속도, 감성 톤 및 48 kHz 출력 품질을 살펴보세요.

더빙 및 현지화 테스트

이전 TTS 시스템에서 종종 제대로 지원되지 않는 언어로 현지화된 스크립트의 발음, 리듬 및 표현력을 평가합니다.

동의 기반 음성 복제

사용 권한이 있는 경우에만 화자를 복제하고, 제어 가능한 지침을 사용해 음색을 유지하면서 다양한 감정이나 속도를 테스트하세요.

합성 캐릭터 탐색

실제 사람을 복제하지 않고 새로운 가상 또는 브랜드 안전 목소리가 필요할 때 음성 디자인을 사용하세요.

개발자 평가

VoxCPM을 다른 오픈 TTS 시스템과 비교하고 Python 패키지를 테스트하거나, 저지연 실험을 위해 Nano-vLLM 서빙 경로를 살펴보세요.

모범 사례

더 나은 VoxCPM 결과를 위한 팁

  • 짧은 텍스트로 시작하면 긴 구절을 생성하기 전에 발음, 리듬, 음성 일관성을 빠르게 평가할 수 있습니다.
  • 복제에는 깨끗한 단일 화자 참조 오디오를 사용하세요. 소음이 많거나 여러 화자가 섞인 클립은 화자 유사성을 판단하기 어렵게 만듭니다.
  • 디자인한 음성이 목표와 다르면 연령, 속도, 감정 및 음성 질감 같은 구체적인 속성을 사용해 화자 설명을 다시 작성하세요.
  • 고품질 복제를 원한다면 데모에서 요청할 때 참조 오디오의 대본도 제공하세요. 정렬된 대본 정보가 원본의 말하기 스타일을 보존하는 데 도움이 됩니다.
  • 공개 호스팅 Space에는 기밀 대본이나 비공개 음성 샘플을 입력하지 마세요. 민감한 프로덕션 작업에는 VoxCPM2를 자체 호스팅하세요.
  • 사칭, 사기 또는 합성 사실을 표시하지 않은 미디어에 VoxCPM을 사용하지 마세요. 실제 음성을 복제하기 전에 반드시 동의를 받으세요.
FAQ

VoxCPM 자주 묻는 질문

다국어 TTS, 음성 복제, 음성 디자인과 자체 호스팅 AI 음성 워크플로를 위해 VoxCPM을 검토하는 분들을 위한 간단한 답변입니다.

VoxCPM이란 무엇인가요?

VoxCPM은 OpenBMB의 토크나이저 없는 텍스트 음성 변환 모델 제품군입니다. VoxCPM2는 다국어 음성 생성, 음성 디자인과 음성 복제를 위한 최신 20억 매개변수 릴리스입니다.

VoxCPM을 온라인에서 사용해 볼 수 있나요?

예. 이 페이지에는 공식 VoxCPM-Demo Hugging Face Space가 포함되어 있어 Python 패키지를 설치하지 않고도 브라우저에서 VoxCPM2를 테스트할 수 있습니다.

VoxCPM2는 어떤 언어를 지원하나요?

공개 VoxCPM2 모델 카드에는 중국어, 영어, 일본어, 한국어, 스페인어, 프랑스어, 독일어, 포르투갈어, 힌디어, 아랍어, 베트남어 등을 포함한 30개 언어와 여러 중국어 방언이 나열되어 있습니다.

VoxCPM은 음성 복제를 지원하나요?

예. VoxCPM2는 참조 오디오를 이용한 제어 가능한 음성 복제와, 높은 충실도를 위해 참조 클립과 해당 대본을 함께 사용하는 고품질 복제 워크플로를 지원합니다. 본인이 소유하거나 사용 권한이 있는 음성만 복제하세요.

VoxCPM 음성 디자인이란 무엇인가요?

나이, 성별, 어조, 감정, 속도 같은 속성으로 원하는 화자를 자연어로 설명하면 참조 녹음 없이도 새 음성을 디자인하고 생성할 수 있는 기능입니다.

내장된 VoxCPM 데모는 비공개인가요?

아니요. 내장 앱은 Whisper AI 외부에서 실행되는 공개 Hugging Face Space입니다. 기밀 텍스트나 개인 음성 샘플을 입력하지 마세요. 민감한 작업에는 모델을 자체 호스팅하세요.

브라우저에서 VoxCPM을 사용해 보세요

VoxCPM을 로컬에 설치하기 전에 공식 Hugging Face 데모에서 다국어 음성을 생성하고, 음성 디자인과 동의 기반 복제를 평가해 보세요.