Szczegóły modelu
Audio8-ASR-0.1B
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Główne zadanie
- Rozpoznawanie mowy
- Biblioteka
- Transformers
Opis modelu
Audio8-ASR-0.1B to kompaktowy model ASR autoregresywny, którego komponent modelu językowego ma tylko 0.1B parametrów. Obsługuje wielojęzyczne rozpoznawanie mowy dla języków, w tym chińskiego, angielskiego, francuskiego, niemieckiego, japońskiego, koreańskiego i kantońskiego. Pozycjonujemy go jako jeden z najmniejszych użytecznych modeli ASR o wysokiej wydajności w erze LLM. To repozytorium bazowe zapewnia punkt kontrolny Hugging Face Transformers. Oferujemy również wydania skoncentrowane na wdrożeniu:
- Audio8-ASR-0.1B-onnx-runtime – Audio8-ASR-0.1B-iOS-ANE Wydanie ONNX Runtime jest zaprojektowane do wdrożenia na urządzeniach brzegowych i może działać z około 1.1 GB szczytowego zużycia pamięci, w zależności od urządzenia, konfiguracji czasu wykonania i obciążenia. Wydanie iOS jest zaprojektowane do lokalnej transkrypcji na iPhone'ie z około 200 MB szczytowego zużycia pamięci w czasie wykonania, w zależności od urządzenia, wersji iOS i obciążenia. Twoja przeglądarka nie obsługuje tagu wideo.
| Zestaw oceniający | Zbiór danych / podział | Język | Metryka | Wynik (%) | H200 RTFx |
|---|---|---|---|---|---|
| Open ASR Leaderboard | AMI Cleaned | EN | WER | 10.99 | 396.91 |
| Open ASR Leaderboard | Earnings22 | EN | WER | 12.31 | 654.17 |
| Open ASR Leaderboard | GigaSpeech Cleaned | EN | WER | 8.48 | 641.19 |
| Open ASR Leaderboard | LibriSpeech test.clean | EN | WER | 2.70 | 687.84 |
| Open ASR Leaderboard | LibriSpeech test.other | EN | WER | 6.59 | 610.52 |
| Open ASR Leaderboard | SPGISpeech | EN | WER | 3.73 | 870.32 |
| Open ASR Leaderboard | VoxPopuli Cleaned AA | EN | WER | 4.39 | 686.14 |
| Open ASR Leaderboard | Średnia siedmiu podziałów / kompozyt | EN | WER / RTFx | 7.03 | 741.15 |
| Wewnętrzna kanoniczna ocena ASR | WenetSpeech meeting | ZH | CER | 8.842 | – |
| Wewnętrzna kanoniczna ocena ASR | WenetSpeech net | ZH | CER | 7.976 | – |
Wyniki Open ASR wykorzystują siedem aktualnych publicznych podziałów z hf-audio/open-asr-leaderboard w rewizji zbioru danych b6bdcd0beb34f8975dc659796176d88f43aff502. Zostały one zmierzone przy użyciu samodzielnego pakietu Transformers na znormalizowanych zadaniach H200 Hugging Face przy użyciu BF16, eager attention, greedy decoding, max_new_tokens=256 oraz udokumentowanego limitu audio 30 sekund. Rozmiary partii na każdy podział wynosiły 1152, 1024, 1408, 1024, 1024, 2048 i 628. Surowe manifesty są przechowywane w hf://buckets/AutoArk-AI/audio8-asr-open-asr-results, a odpowiadające wyniki w formacie maszynowym są dostarczane w .eval_results/open_asr_leaderboard.yaml.
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.