Przejdź do treści

Szczegóły modelu

GigaAM-Multilingual

Status: AktywnyW trendach Hugging Face

Dostawca: ai-sage →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Główne zadanie
Rozpoznawanie mowy

Opis modelu

GigaAM Multilingual to rodzina modeli bazowych opartych na Conformer (220M / 600M parametrów), wstępnie wytrenowanych z celem w stylu HuBERT na 2M godzinach mowy w ponad 70 językach i dostosowanych do rozpoznawania mowy z użyciem dekoderów CTC na poziomie znaków na 50K godzinach. Modele zapewniają jakość open-source w najlepszej klasie w języku rosyjskim, kazachskim, kirgiskim i uzbeckim oraz umiarkowaną jakość w języku angielskim. GigaAM Multilingual obejmuje następujące warianty modeli:

  • ssl — 220M samonadzorowany enkoder
  • ctc — 220M model ASR z dekoderem CTC na poziomie znaków
  • large_ssl — 600M samonadzorowany enkoder
  • large_ctc — 600M model ASR z dekoderem CTC na poziomie znaków

Wskaźnik błędów słownych (%) na zestawach testowych Common Voice (CV), FLEURS i wewnętrznych zestawach testowych w terenie. Wypowiedzi dłuższe niż 30 s oraz odniesienia zawierające cyfry są wykluczone; odniesienia/hipotezy są normalizowane (małe litery, usunięcie interpunkcji, cyfry→słowa); dekodowanie zachłanne. Najlepsze wiersze w pogrubieniu.

JęzykZestaw danychGigaAM MultilingualGigaAM Multilingual LargeOmnilingual 1B (LLM)Seamless M4T large v2Whisper large v3
AngielskiCV26.021.524.716.220.0
AngielskiFLEURS12.29.47.15.83.9
RosyjskiCV7.15.113.69.29.1
RosyjskiFLEURS4.43.06.44.63.1
RosyjskiWewnętrzny7.66.014.616.110.1
KazachskiCV17.213.823.723.857.8
KazachskiFLEURS5.24.46.66.832.4
KazachskiWewnętrzny18.815.832.262.965.2
KirgiskiCV12.510.221.614.395.2
KirgiskiFLEURS7.05.58.19.586.3
KirgiskiWewnętrzny11.19.825.078.3102.2
UzbeckiCV11.39.232.825.1109.9
UzbeckiFLEURS10.07.315.411.9105.4
UzbeckiWewnętrzny13.812.730.240.0120.6

Rekomendowane wersje:

  • torch==2.10.*, torchaudio==2.10.*
  • transformers==5.*
  • (dowolna) hydra-core, omegaconf Pełny przewodnik użytkowania można znaleźć w przykładzie. Podstawy ssl / large_ssl można dostosować do nowego języka — zobacz przewodnik po dostosowywaniu i przykładowy notatnik.

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON