Szczegóły modelu
diamond-1.0
Status: AktywnyW trendach Hugging Face
Opis modelu
Model sekwencyjny do przywracania mowy za pomocą autoregresywnego RQ-Transformera na tokenach kodera audio Diamond przekształca zdegradowane audio w bliską studiu mowę 44.1 kHz. Dwukierunkowy Transformer koduje zdegradowany mel-spektrogram; autoregresywny dekoder z uwagą krzyżową przewiduje tokeny zamrożonego kodera audio (Descript Audio Codec, 9-book RVQ), który syntetyzuje przywrócony przebieg fali. Przywracanie nie jest odszumianiem. Koder odcina pasmo powyżej 8 kHz, przycinanie obcina szczyty, utracony pakiet zeruje klatkę — żaden maska nie może przywrócić tego, czego obserwacja już nie zawiera. Brakująca zawartość musi być generowana z przetrwałych formantów, dlatego Diamond jest generatywnym modelem seq2seq, a nie filtrem. Diamond jest trenowany od podstaw — bez wstępnie wytrenowanego rdzenia — i osiąga poziom najsilniejszych otwartych przywracaczy, pozostając jednocześnie najlepszym przywracaczem od podstaw w swojej klasie.
- Dwa transformery do odczytu. Czasowy transformer modeluje sekwencję klatek; kompaktowy głęboki transformer przechodzi przez 9 kodów RVQ w każdej klatce. To przywraca przyczynowy łańcuch RVQ i rozdziela projekcję wyjściową — podczas gdy wcześniejsze modele odczytywały wszystkie dziewięć książek z pojedynczego wektora klatki z równoległymi głowami.
- Od podstaw, 166.6M parametrów do trenowania. Brak wstępnie wytrenowanego rdzenia mowy, 63 godziny GPU treningu dla wydanego punktu kontrolnego.
- Wyjście 44.1 kHz. Zamrożony dekoder DAC syntetyzuje pełnopasmowe audio; sybilanty i "powietrze" powyżej 8 kHz są regenerowane, a nie tylko przepuszczane.
- Zawartość jest mierzona, a nie zakładana. Generatywny przywracacz może brzmieć czysto, jednocześnie rozmazując słowa, więc CER w porównaniu do transkrypcji prawdziwej jest obowiązkową drugą osią obok DNSMOS.
- Kalibrowana degradacja. Wejścia pochodzą z augmentora DSP, którego paleta kodera jest dopasowywana do rzeczywistego rozkładu zdegradowanej mowy, a nie z torby losowych efektów. Rzeczywista, mocno zdegradowana mowa przywrócona do 44.1 kHz. DNSMOS-P.835 OVRL wzrasta o więcej niż pełny punkt w każdej klipie — słyszalne nawet bez słuchawek. Wypróbuj to na żywo w Diamond Space. #Zdegradowane wejściePrzywrócone — 44.1 kHzDNSMOS OVRL
1 2.16 → 3.50 (+1.34) 2 2.83 → 3.59 (+0.76) 3 2.56 → 3.65 (+1.10) 4 3.32 → 3.89 (+0.57) – Opracowane przez: nineninesix.ai
- Typ modelu: Autoregresywne przywracanie mowy sekwencyjnej (enkoder + dekoder RQ-Transformera na tokenach kodera)
- Enkoder: Dwukierunkowy Transformer, bez próbkowania — 20 warstw, 512d, 8 głów (63.9M)
- Dekoder / czasowy transformer: przyczynowa uwaga własna + uwaga krzyżowa — 20 warstw, 512d, 8 głów (88.7M)
- Odczyt kodu / głęboki transformer: lokalne AR nad 9 kodami RVQ klatki — 4 warstwy, 384d, 6 głów (14.0M)
- Parametry: ≈ 166.6M do trenowania (koder DAC, ~74M, jest zamrożony i pobierany w czasie wykonania)
- Koder audio: Descript Audio Codec — 44.1 kHz, 9-kodowy RVQ, 86 klatek/s
- Primitives: RMSNorm, uczący się per-warstwa RoPE, QK-Norm, LayerScale, GELU FFN
- Częstotliwość próbkowania wejścia/wyjścia: dowolne wejście, wewnętrznie próbkowane do 24 kHz → 44,100 Hz wyjście
- Dane treningowe: 681.5 h mowy studyjnej, ~2.5k mówców, 28% natywnie szerokopasmowych.
- Języki: Angielski
- Licencja: Apache 2.0
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.