VoxCPM2 · 30 języków TTS · klonowanie głosu

VoxCPM — wielojęzyczne klonowanie głosu bez tokenizerów TTS

Model OpenBMB VoxCPM2 osadzony z oficjalnego Hugging Face Space

Wypróbuj VoxCPM online, aby uzyskać wielojęzyczną zamianę tekstu na mowę, projektowanie głosu, kontrolowane klonowanie głosu i mowę AI 48 kHz. Ta strona przepisuje publiczne fakty dotyczące VoxCPM2 w niezależny, możliwy do przeszukania przewodnik z oficjalną wersją demonstracyjną umieszczoną poniżej.

Parametry 2B30 językówProjekt głosuKontrolowane klonowanieWyjście 48 kHzApache-2.0
VoxCPM2 · oficjalny Space na Hugging Face
Otwórz w Hugging Face

To jest oficjalny VoxCPM-Demo Space hostowany na Hugging Face przez OpenBMB. Pierwsze uruchomienie może być wolniejsze po uruchomieniu hostowanej wersji demonstracyjnej. Unikaj poufnych tekstów lub prywatnych próbek głosu w jakiejkolwiek przestrzeni publicznej.

Szybka odpowiedź

Co to jest VoxCPM?

VoxCPM to rodzina otwartych modeli zamiany tekstu na mowę firmy OpenBMB. Obecna wersja VoxCPM2 koncentruje się na naturalnej mowie wielojęzycznej, kreatywnym projektowaniu głosu i wiernym klonowaniu głosu, unikając jednocześnie oddzielnego potoku tokenizacji mowy.

Zgodnie z publiczną kartą modelu VoxCPM2 i dokumentacją projektową, VoxCPM2 jest 2B-parametrowym, pozbawionym tokenizera, autoregresyjnym modelem TTS, wytrenowanym na ponad 2 milionach godzin wielojęzycznej mowy. Obsługuje 30 języków, akceptuje krótki dźwięk referencyjny do klonowania i wyprowadza mowę 48 kHz poprzez AudioVAE V2.

Wbudowany Space jest przydatny do szybkiej oceny, ponieważ udostępnia przepływy pracy faktycznie testowane przez zespoły w pierwszej kolejności: bezpośredni wielojęzyczny TTS, projekt głosu w języku naturalnym, kontrolowane klonowanie ze wskazówkami dotyczącymi stylu oraz klonowanie o wyższej jakości z referencyjnym dźwiękiem i transkrypcją.

Funkcje

Dlaczego VoxCPM2 się wyróżnia

VoxCPM łączy generowanie wielojęzyczne, projektowanie głosu, klonowanie i obsługę zorientowaną na produkcję w jednym, otwartym modelu przepływu pracy.

Autoregresja dyfuzyjna bez tokenizera TTS

VoxCPM2 bezpośrednio generuje ciągłe reprezentacje mowy poprzez architekturę autoregresyjną dyfuzji, zamiast polegać na dyskretnych tokenach mowy.

Mowa wielojęzyczna w 30 językach

Karta modelu zawiera listę 30 obsługiwanych języków, w tym chińskiego, angielskiego, japońskiego, koreańskiego, hiszpańskiego, francuskiego, niemieckiego, portugalskiego, hindi, arabskiego, wietnamskiego i innych.

Projektowanie głosu z języka naturalnego

Opisz mówcę za pomocą atrybutów takich jak płeć, wiek, ton, emocje lub tempo, a następnie pozwól VoxCPM2 stworzyć nowy syntetyczny głos bez referencyjnego dźwięku.

Kontrolowane i najlepsze klonowanie głosu

Prześlij krótki klip referencyjny, aby zachować barwę, dodaj wskazówki dotyczące stylu, aby sterować ekspresją, lub prześlij transkrypcję na potrzeby klonowania w stylu kontynuacji o wyższej jakości.

Wyjście i ścieżka przesyłania strumieniowego 48 kHz

VoxCPM2 akceptuje dźwięk referencyjny 16 kHz i wyprowadza mowę 48 kHz; dokumentacja raportuje przesyłanie strumieniowe w czasie rzeczywistym ze standardowym wnioskowaniem i szybszym udostępnianiem Nano-vLLM.

Otwarte i bezpieczne wydanie

Publiczne wydanie to Apache-2.0, ale projekt wyraźnie zabrania podszywania się, oszustwa i dezinformacji. Wyraźnie oznacz dźwięk generowany przez sztuczną inteligencję.

Jak używać

Wypróbuj VoxCPM w czterech krokach

Hostowany Space zapewnia podstawowe przepływy pracy VoxCPM2 bez lokalnej konfiguracji.

1

Otwórz VoxCPM Space

Użyj osadzonego Hugging Face Space powyżej lub otwórz go w nowej karcie. Zimne uruchomienie może zająć więcej czasu, gdy środowisko hostowane ładuje zależności i model.

2

Wprowadź tekst w obsługiwanym języku

Wklej bezpośrednio swój skrypt. VoxCPM2 jest przeznaczony do wprowadzania wielojęzycznego bez osobnego znacznika języka, więc zacznij od krótkiego zdania w swoim języku docelowym.

3

Wybierz projektowanie głosu lub klonowanie

W przypadku projektowania głosu umieść przed tekstem opis mówiącego w języku naturalnym. W przypadku klonowania prześlij czysty klip referencyjny i dodaj wskazówki dotyczące stylu tylko wtedy, gdy chcesz zmienić tempo lub emocje.

4

Dostrój generację i słuchaj

Dostosuj kroki wnioskowania, wskazówki, odszumianie lub ustawienia stylu w wersji demonstracyjnej, wygeneruj krótką próbkę, a następnie powtarzaj, aż wymowa, tempo i styl mówiącego będą prawidłowe.

Szczegóły modelu

Możliwości VoxCPM w skrócie

Najważniejsze publiczne informacje z karty modelu VoxCPM2 na Hugging Face, metadanych Space, dokumentacji i strony demonstracyjnej projektu, zebrane z myślą o szybkiej ocenie.

Rodzina modelowa
VoxCPM / VoxCPM2 autorstwa OpenBMB
Zadanie podstawowe
Wielojęzyczna zamiana tekstu na mowę, projektowanie głosu, kontrolowane klonowanie głosu i klonowanie o wysokiej wierności
Architektura
Autoregresyjny potok dyfuzyjny TTS bez tokenizera opisany jako LocEnc → TSLM → RALM → LocDiT
Rozmiar i architektura bazowa
2 miliardy parametrów, model zbudowany na MiniCPM-4
Skala treningu
Ponad 2 miliony godzin wielojęzycznych danych mowy na karcie modelu publicznego
Zasięg językowy
30 języków plus wymieniona obsługa dialektów chińskich, w tym syczuański, kantoński, wu, północno-wschodni mandaryński i inne
Jakość dźwięku
Akceptuje dźwięk referencyjny 16 kHz i wyprowadza mowę 48 kHz przez AudioVAE V2
Hostowane demo
Oficjalny Gradio Space openbmb/VoxCPM-Demo, obecnie dostępny pod adresem openbmb-voxcpm-demo.hf.space
Licencja
Apache-2.0 zgodnie z kartą modelu VoxCPM2 i metadanymi Space
Przypadki użycia

Co możesz zbudować z VoxCPM

VoxCPM jest najbardziej przydatny, gdy projekt głosowy wymaga wielojęzyczności, kontrolowanej ekspresji i opcji samodzielnego hostowania.

Wielojęzyczna narracja produktu

Twórz wersje robocze narracji do wycieczek po produktach, lekcji i objaśnień w wielu językach, zanim nagrasz ostateczną narrację ludzką.

Prototypowanie agenta głosowego

Przed podłączeniem produkcyjnego stosu agentów głosowych sprawdź osobowości głosowe, szybkość, ton emocjonalny i jakość wyjściową 48 kHz.

Testy dubbingowe i lokalizacyjne

Oceń wymowę, rytm i ekspresję zlokalizowanych pism w językach, które są często niedostatecznie obsługiwane przez starsze systemy TTS.

Klonowanie głosu za zgodą

Klonuj głos tylko wtedy, gdy masz zgodę mówcy, a następnie używaj kontrolowanych promptów, aby testować różne emocje lub tempo przy zachowaniu barwy głosu.

Syntetyczna eksploracja postaci

Użyj projektowania głosu, gdy potrzebujesz nowego fikcyjnego lub bezpiecznego dla marki głosu bez klonowania prawdziwej osoby.

Ocena dewelopera

Porównaj VoxCPM z innymi otwartymi systemami TTS, przetestuj pakiet Python lub przestudiuj ścieżkę obsługi Nano-vLLM pod kątem eksperymentów z mniejszymi opóźnieniami.

Najlepsze praktyki

Wskazówki dotyczące lepszych wyników VoxCPM

  • Zacznij od krótkiego tekstu, aby móc szybko ocenić wymowę, rytm i spójność głosu przed utworzeniem długich fragmentów.
  • Do klonowania używaj czystego nagrania referencyjnego z jednym mówcą; szum lub wiele głosów utrudniają ocenę podobieństwa.
  • Jeśli zaprojektowany głos nie trafia w cel, przepisz opis mówcy, podając konkretne atrybuty, takie jak wiek, tempo, emocje i tekstura głosu.
  • Aby uzyskać klonowanie o wysokiej wierności, podaj transkrypcję próbki referencyjnej, gdy demo o nią poprosi, ponieważ ten kontekst pomaga zachować oryginalny sposób wypowiedzi.
  • Unikaj poufnych skryptów i prywatnych próbek głosu w publicznym Space; w przypadku wrażliwych zastosowań produkcyjnych uruchom VoxCPM2 we własnej infrastrukturze.
  • Nie używaj VoxCPM do podszywania się, oszustw lub nieoznakowanych mediów syntetycznych. Uzyskaj zgodę przed sklonowaniem prawdziwego głosu.
Często zadawane pytania

VoxCPM często zadawane pytania

Krótkie odpowiedzi dla osób oceniających VoxCPM pod kątem wielojęzycznego TTS, klonowania głosu, projektowania głosu i samodzielnie hostowanych przepływów pracy głosowych AI.

Co to jest VoxCPM?

VoxCPM to rodzina modeli zamiany tekstu na mowę firmy OpenBMB bez tokenizerów. VoxCPM2 to aktualna wersja z parametrami 2B do wielojęzycznego generowania mowy, projektowania głosu i klonowania głosu.

Czy mogę wypróbować VoxCPM online?

Tak. Ta strona zawiera oficjalny VoxCPM-Demo Space na Hugging Face, dzięki czemu możesz przetestować VoxCPM2 w przeglądarce bez wcześniejszej instalacji pakietu Python.

Jakie języki obsługuje VoxCPM2?

Publiczna karta modelu VoxCPM2 zawiera listę 30 języków, w tym chińskiego, angielskiego, japońskiego, koreańskiego, hiszpańskiego, francuskiego, niemieckiego, portugalskiego, hindi, arabskiego, wietnamskiego i innych, a także kilka chińskich dialektów.

Czy VoxCPM obsługuje klonowanie głosu?

Tak. VoxCPM2 obsługuje kontrolowane klonowanie głosu z referencyjnego dźwięku i ostateczny proces klonowania, który może wykorzystywać zarówno klip referencyjny, jak i jego transkrypcję, w celu uzyskania wyższej wierności. Klonuj tylko te głosy, które posiadasz lub masz pozwolenie na używanie.

Co to jest projekt głosu VoxCPM?

Projektowanie głosu pozwala opisać żądanego mówcę w języku naturalnym — na przykład wiek, płeć, ton, emocje lub tempo — i wygenerować mowę tym nowo zaprojektowanym głosem bez przesyłania nagrania referencyjnego.

Czy wbudowana wersja demonstracyjna VoxCPM jest prywatna?

Nie. Wbudowana aplikacja to publiczny Hugging Face Space działający poza Whisper AI. Nie przesyłaj tam poufnych tekstów ani prywatnych próbek głosu; w przypadku wrażliwych zastosowań uruchom model we własnej infrastrukturze.

Wypróbuj VoxCPM w swojej przeglądarce

Wygeneruj wielojęzyczną mowę, przetestuj projekt głosu i oceń klonowanie oparte na zgodzie w oficjalnej wersji demonstracyjnej Hugging Face przed lokalną instalacją VoxCPM.