Przejdź do treści

Szczegóły modelu

diamond-1.0

Status: AktywnyW trendach Hugging Face

Dostawca: nineninesix →Dodaj do porównania

Opis modelu

Model sekwencyjny do przywracania mowy za pomocą autoregresywnego RQ-Transformera na tokenach kodera audio Diamond przekształca zdegradowane audio w bliską studiu mowę 44.1 kHz. Dwukierunkowy Transformer koduje zdegradowany mel-spektrogram; autoregresywny dekoder z uwagą krzyżową przewiduje tokeny zamrożonego kodera audio (Descript Audio Codec, 9-book RVQ), który syntetyzuje przywrócony przebieg fali. Przywracanie nie jest odszumianiem. Koder odcina pasmo powyżej 8 kHz, przycinanie obcina szczyty, utracony pakiet zeruje klatkę — żaden maska nie może przywrócić tego, czego obserwacja już nie zawiera. Brakująca zawartość musi być generowana z przetrwałych formantów, dlatego Diamond jest generatywnym modelem seq2seq, a nie filtrem. Diamond jest trenowany od podstaw — bez wstępnie wytrenowanego rdzenia — i osiąga poziom najsilniejszych otwartych przywracaczy, pozostając jednocześnie najlepszym przywracaczem od podstaw w swojej klasie.

  • Dwa transformery do odczytu. Czasowy transformer modeluje sekwencję klatek; kompaktowy głęboki transformer przechodzi przez 9 kodów RVQ w każdej klatce. To przywraca przyczynowy łańcuch RVQ i rozdziela projekcję wyjściową — podczas gdy wcześniejsze modele odczytywały wszystkie dziewięć książek z pojedynczego wektora klatki z równoległymi głowami.
  • Od podstaw, 166.6M parametrów do trenowania. Brak wstępnie wytrenowanego rdzenia mowy, 63 godziny GPU treningu dla wydanego punktu kontrolnego.
  • Wyjście 44.1 kHz. Zamrożony dekoder DAC syntetyzuje pełnopasmowe audio; sybilanty i "powietrze" powyżej 8 kHz są regenerowane, a nie tylko przepuszczane.
  • Zawartość jest mierzona, a nie zakładana. Generatywny przywracacz może brzmieć czysto, jednocześnie rozmazując słowa, więc CER w porównaniu do transkrypcji prawdziwej jest obowiązkową drugą osią obok DNSMOS.
  • Kalibrowana degradacja. Wejścia pochodzą z augmentora DSP, którego paleta kodera jest dopasowywana do rzeczywistego rozkładu zdegradowanej mowy, a nie z torby losowych efektów. Rzeczywista, mocno zdegradowana mowa przywrócona do 44.1 kHz. DNSMOS-P.835 OVRL wzrasta o więcej niż pełny punkt w każdej klipie — słyszalne nawet bez słuchawek. Wypróbuj to na żywo w Diamond Space. #Zdegradowane wejściePrzywrócone — 44.1 kHzDNSMOS OVRL

1 2.16 → 3.50 (+1.34) 2 2.83 → 3.59 (+0.76) 3 2.56 → 3.65 (+1.10) 4 3.32 → 3.89 (+0.57) – Opracowane przez: nineninesix.ai

  • Typ modelu: Autoregresywne przywracanie mowy sekwencyjnej (enkoder + dekoder RQ-Transformera na tokenach kodera)
  • Enkoder: Dwukierunkowy Transformer, bez próbkowania — 20 warstw, 512d, 8 głów (63.9M)
  • Dekoder / czasowy transformer: przyczynowa uwaga własna + uwaga krzyżowa — 20 warstw, 512d, 8 głów (88.7M)
  • Odczyt kodu / głęboki transformer: lokalne AR nad 9 kodami RVQ klatki — 4 warstwy, 384d, 6 głów (14.0M)
  • Parametry: ≈ 166.6M do trenowania (koder DAC, ~74M, jest zamrożony i pobierany w czasie wykonania)
  • Koder audio: Descript Audio Codec — 44.1 kHz, 9-kodowy RVQ, 86 klatek/s
  • Primitives: RMSNorm, uczący się per-warstwa RoPE, QK-Norm, LayerScale, GELU FFN
  • Częstotliwość próbkowania wejścia/wyjścia: dowolne wejście, wewnętrznie próbkowane do 24 kHz → 44,100 Hz wyjście
  • Dane treningowe: 681.5 h mowy studyjnej, ~2.5k mówców, 28% natywnie szerokopasmowych.
  • Języki: Angielski
  • Licencja: Apache 2.0

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON