Przejdź do treści

Szczegóły modelu

Qwen3-TTS-12Hz-1.7B-CustomVoice

Status: AktywnyW trendach Hugging Face

Dostawca: Qwen →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Główne zadanie
Synteza mowy

Opis modelu

Qwen3-TTS obejmuje 10 głównych języków (chiński, angielski, japoński, koreański, niemiecki, francuski, rosyjski, portugalski, hiszpański i włoski), a także wiele dialektalnych profili głosowych, aby sprostać globalnym potrzebom aplikacji. Ponadto modele charakteryzują się silnym rozumieniem kontekstu, umożliwiając adaptacyjną kontrolę tonu, tempa mówienia i ekspresji emocjonalnej na podstawie instrukcji i semantyki tekstu, a także wykazują znacznie poprawioną odporność na zaszumiony tekst wejściowy. Kluczowe cechy: Potężna reprezentacja mowy: Napędzana samodzielnie opracowanym Qwen3-TTS-Tokenizer-12Hz, osiąga wydajną kompresję akustyczną i wysokowymiarowe modelowanie semantyczne sygnałów mowy. W pełni zachowuje informacje paralingwistyczne i cechy środowiska akustycznego, umożliwiając szybką, wysokiej jakości rekonstrukcję mowy poprzez lekką architekturę nie-DiT. Uniwersalna architektura end-to-end: Wykorzystując dyskretną architekturę LM z wieloma księgami kodów, realizuje pełnoinformacyjne modelowanie mowy end-to-end. Całkowicie omija wąskie gardła informacyjne i kaskadowe błędy nieodłączne w tradycyjnych schematach LM+DiT, znacznie zwiększając wszechstronność modelu, wydajność generowania i górną granicę wydajności. Ekstremalnie niskie opóźnienie generowania strumieniowego: W oparciu o innowacyjną hybrydową architekturę generowania strumieniowego Dual-Track, pojedynczy model obsługuje zarówno generowanie strumieniowe, jak i niestrumieniowe. Może wyprowadzić pierwszy pakiet audio natychmiast po wprowadzeniu pojedynczego znaku, z opóźnieniem syntezy end-to-end wynoszącym zaledwie 97ms, spełniając rygorystyczne wymagania scenariuszy interakcji w czasie rzeczywistym. Inteligentne rozumienie tekstu i kontrola głosu: Obsługuje generowanie mowy sterowane instrukcjami w języku naturalnym, umożliwiając elastyczną kontrolę wielowymiarowych atrybutów akustycznych, takich jak barwa, emocje i prozodia. Poprzez głęboką integrację semantycznego rozumienia tekstu, model adaptacyjnie dostosowuje ton, rytm i ekspresję emocjonalną, osiągając realistyczne wyjście „co sobie wyobrażasz, to słyszysz”. Opis wydanych modeli i pobieranie Poniżej znajduje się wprowadzenie i informacje o pobieraniu modeli Qwen3-TTS, które zostały już wydane. Inne modele wymienione w raporcie technicznym zostaną wydane w najbliższej przyszłości. Wybierz i pobierz model odpowiadający Twoim potrzebom.

Nazwa tokenizeraOpis
Qwen3-TTS-Tokenizer-12HzModel Qwen3-TTS-Tokenizer-12Hz, który może kodować wejściową mowę na kody i dekodować je z powrotem na mowę.
ModelFunkcjeObsługa językówStrumieniowanieSterowanie instrukcjami
Qwen3-TTS-12Hz-1.7B-VoiceDesignWykonuje projektowanie głosu na podstawie opisów dostarczonych przez użytkownika.

| Chiński, angielski, japoński, koreański, niemiecki, francuski, rosyjski, portugalski, hiszpański, włoski | ✅ | ✅ | | Qwen3-TTS-12Hz-1.7B-CustomVoice | Zapewnia kontrolę stylu nad docelowymi barwami za pomocą instrukcji użytkownika; obsługuje 9 premium barw obejmujących różne kombinacje płci, wieku, języka i dialektu.

| Chiński, angielski, japoński, koreański, niemiecki, francuski, rosyjski, portugalski, hiszpański, włoski | ✅ | ✅ | | Qwen3-TTS-12Hz-1.7B-Base | Model podstawowy zdolny do 3-sekundowego szybkiego klonowania głosu z wejściowego audio użytkownika; może być używany do fine-tuningu (FT) innych modeli.

| Chiński, angielski, japoński, koreański, niemiecki, francuski, rosyjski, portugalski, hiszpański, włoski | ✅ | | | Qwen3-TTS-12Hz-0.6B-CustomVoice | Obsługuje 9 premium barw obejmujących różne kombinacje płci, wieku, języka i dialektu.

| Chiński, angielski, japoński, koreański, niemiecki, francuski, rosyjski, portugalski, hiszpański, włoski | ✅ | | | Qwen3-TTS-12Hz-0.6B-Base | Model podstawowy zdolny do 3-sekundowego szybkiego klonowania głosu z wejściowego audio użytkownika; może być używany do fine-tuningu (FT) innych modeli.

| Chiński, angielski, japoński, koreański, niemiecki, francuski, rosyjski, portugalski, hiszpański, włoski | ✅ | | Podczas ładowania modelu w pakiecie qwen-tts lub vLLM, wagi modelu zostaną automatycznie pobrane na podstawie nazwy modelu. Jeśli jednak środowisko wykonawcze nie sprzyja pobieraniu wag podczas wykonywania, możesz odwołać się do następujących poleceń, aby ręcznie pobrać wagi modelu do katalogu lokalnego: Najłatwiejszym sposobem szybkiego użycia Qwen3-TTS jest zainstalowanie pakietu Python qwen-tts z PyPI. Spowoduje to pobranie wymaganych zależności wykonawczych i umożliwi załadowanie dowolnego opublikowanego modelu Qwen3-TTS. Zalecamy użycie świeżego, izolowanego środowiska, aby uniknąć konfliktów zależności z istniejącymi pakietami. Możesz utworzyć czyste środowisko Python 3.12 w następujący sposób:

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON