Przejdź do treści

Szczegóły modelu

Audio8-ASR-0.1B

Status: AktywnyW trendach Hugging Face

Dostawca: Audio8 →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Główne zadanie
Rozpoznawanie mowy
Biblioteka
Transformers

Opis modelu

Audio8-ASR-0.1B to kompaktowy model ASR autoregresywny, którego komponent modelu językowego ma tylko 0.1B parametrów. Obsługuje wielojęzyczne rozpoznawanie mowy dla języków, w tym chińskiego, angielskiego, francuskiego, niemieckiego, japońskiego, koreańskiego i kantońskiego. Pozycjonujemy go jako jeden z najmniejszych użytecznych modeli ASR o wysokiej wydajności w erze LLM. To repozytorium bazowe zapewnia punkt kontrolny Hugging Face Transformers. Oferujemy również wydania skoncentrowane na wdrożeniu:

  • Audio8-ASR-0.1B-onnx-runtime – Audio8-ASR-0.1B-iOS-ANE Wydanie ONNX Runtime jest zaprojektowane do wdrożenia na urządzeniach brzegowych i może działać z około 1.1 GB szczytowego zużycia pamięci, w zależności od urządzenia, konfiguracji czasu wykonania i obciążenia. Wydanie iOS jest zaprojektowane do lokalnej transkrypcji na iPhone'ie z około 200 MB szczytowego zużycia pamięci w czasie wykonania, w zależności od urządzenia, wersji iOS i obciążenia. Twoja przeglądarka nie obsługuje tagu wideo.
Zestaw oceniającyZbiór danych / podziałJęzykMetrykaWynik (%)H200 RTFx
Open ASR LeaderboardAMI CleanedENWER10.99396.91
Open ASR LeaderboardEarnings22ENWER12.31654.17
Open ASR LeaderboardGigaSpeech CleanedENWER8.48641.19
Open ASR LeaderboardLibriSpeech test.cleanENWER2.70687.84
Open ASR LeaderboardLibriSpeech test.otherENWER6.59610.52
Open ASR LeaderboardSPGISpeechENWER3.73870.32
Open ASR LeaderboardVoxPopuli Cleaned AAENWER4.39686.14
Open ASR LeaderboardŚrednia siedmiu podziałów / kompozytENWER / RTFx7.03741.15
Wewnętrzna kanoniczna ocena ASRWenetSpeech meetingZHCER8.842
Wewnętrzna kanoniczna ocena ASRWenetSpeech netZHCER7.976

Wyniki Open ASR wykorzystują siedem aktualnych publicznych podziałów z hf-audio/open-asr-leaderboard w rewizji zbioru danych b6bdcd0beb34f8975dc659796176d88f43aff502. Zostały one zmierzone przy użyciu samodzielnego pakietu Transformers na znormalizowanych zadaniach H200 Hugging Face przy użyciu BF16, eager attention, greedy decoding, max_new_tokens=256 oraz udokumentowanego limitu audio 30 sekund. Rozmiary partii na każdy podział wynosiły 1152, 1024, 1408, 1024, 1024, 2048 i 628. Surowe manifesty są przechowywane w hf://buckets/AutoArk-AI/audio8-asr-open-asr-results, a odpowiadające wyniki w formacie maszynowym są dostarczane w .eval_results/open_asr_leaderboard.yaml.

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON