Przejdź do treści

Szczegóły modelu

s2-pro

Status: AktywnyW trendach Hugging Face

Dostawca: fishaudio →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Główne zadanie
Synteza mowy

Opis modelu

Raport techniczny | GitHub | Plac zabaw Fish Audio S2 Pro to wiodący model tekst-na-mowę (TTS) z precyzyjną kontrolą prosodii i emocji w czasie rzeczywistym. Wytrenowany na ponad 10M+ godzin danych audio w ponad 80 językach, system łączy dopasowanie uczenia przez wzmocnienie z architekturą dual-autoregresywną. Wydanie zawiera wagi modelu, kod do fine-tuningu oraz silnik wnioskowania strumieniowego oparty na SGLang. S2 Pro opiera się na transformatorze tylko dekodera połączonym z kodekiem audio opartym na RVQ (10 książek kodów, ~21 Hz częstotliwości klatek) używając architektury Dual-Autoregressive (Dual-AR):

  • Slow AR (4B parametrów): Działa wzdłuż osi czasu i przewiduje główną semantyczną książkę kodów.
  • Fast AR (400M parametrów): Generuje pozostałe 9 książek kodów resztkowych w każdym kroku czasowym, rekonstruując szczegółowe akustyczne detale. Ten asymetryczny projekt utrzymuje efektywność wnioskowania przy zachowaniu wierności audio. Ponieważ architektura Dual-AR jest strukturalnie izomorficzna do standardowych autoregresywnych LLM, dziedziczy wszystkie optymalizacje serwowania charakterystyczne dla LLM z SGLang — w tym ciągłe grupowanie, pamięć podręczną KV z paginacją, odtwarzanie grafów CUDA i pamięć podręczną prefiksów opartą na RadixAttention. S2 Pro umożliwia lokalizowaną kontrolę nad generowaniem mowy poprzez osadzanie instrukcji w naturalnym języku bezpośrednio w tekście za pomocą składni [tag]. Zamiast polegać na stałym zestawie zdefiniowanych tagów, S2 Pro akceptuje opisy tekstowe w formie wolnej — takie jak [whisper in small voice], [professional broadcast tone] lub [pitch up] — co pozwala na otwartą kontrolę ekspresji na poziomie słowa. Typowe tagi (15,000+ unikalnych tagów wspieranych): [pause] [emphasis] [laughing] [inhale] [chuckle] [tsk] [singing] [excited] [laughing tone] [interrupting] [chuckling] [excited tone] [volume up] [echo] [angry] [low volume] [sigh] [low voice] [whisper] [screaming] [shouting] [loud] [surprised] [short pause] [exhale] [delight] [panting] [audience laughter] [with strong accent] [volume down] [clearing throat] [sad] [moaning] [shocked]

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON