Szczegóły modelu
s2-pro
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Główne zadanie
- Synteza mowy
Opis modelu
Raport techniczny | GitHub | Plac zabaw Fish Audio S2 Pro to wiodący model tekst-na-mowę (TTS) z precyzyjną kontrolą prosodii i emocji w czasie rzeczywistym. Wytrenowany na ponad 10M+ godzin danych audio w ponad 80 językach, system łączy dopasowanie uczenia przez wzmocnienie z architekturą dual-autoregresywną. Wydanie zawiera wagi modelu, kod do fine-tuningu oraz silnik wnioskowania strumieniowego oparty na SGLang. S2 Pro opiera się na transformatorze tylko dekodera połączonym z kodekiem audio opartym na RVQ (10 książek kodów, ~21 Hz częstotliwości klatek) używając architektury Dual-Autoregressive (Dual-AR):
- Slow AR (4B parametrów): Działa wzdłuż osi czasu i przewiduje główną semantyczną książkę kodów.
- Fast AR (400M parametrów): Generuje pozostałe 9 książek kodów resztkowych w każdym kroku czasowym, rekonstruując szczegółowe akustyczne detale. Ten asymetryczny projekt utrzymuje efektywność wnioskowania przy zachowaniu wierności audio. Ponieważ architektura Dual-AR jest strukturalnie izomorficzna do standardowych autoregresywnych LLM, dziedziczy wszystkie optymalizacje serwowania charakterystyczne dla LLM z SGLang — w tym ciągłe grupowanie, pamięć podręczną KV z paginacją, odtwarzanie grafów CUDA i pamięć podręczną prefiksów opartą na RadixAttention. S2 Pro umożliwia lokalizowaną kontrolę nad generowaniem mowy poprzez osadzanie instrukcji w naturalnym języku bezpośrednio w tekście za pomocą składni
[tag]. Zamiast polegać na stałym zestawie zdefiniowanych tagów, S2 Pro akceptuje opisy tekstowe w formie wolnej — takie jak[whisper in small voice],[professional broadcast tone]lub[pitch up]— co pozwala na otwartą kontrolę ekspresji na poziomie słowa. Typowe tagi (15,000+ unikalnych tagów wspieranych):[pause][emphasis][laughing][inhale][chuckle][tsk][singing][excited][laughing tone][interrupting][chuckling][excited tone][volume up][echo][angry][low volume][sigh][low voice][whisper][screaming][shouting][loud][surprised][short pause][exhale][delight][panting][audience laughter][with strong accent][volume down][clearing throat][sad][moaning][shocked]
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.