Szczegóły modelu
CrisperWhisper2.0_large
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Główne zadanie
- Rozpoznawanie mowy
- Biblioteka
- Crisperwhisper
Opis modelu
Najbardziej dokładne rozpoznawanie mowy dosłownej, które możesz uruchomić w produkcji: kontrolowane, wielojęzyczne i dostosowane do słowa. Post wydania · Artykuł · Pełna dokumentacja · Modele · Benchmark · Repozytorium benchmarków Większość systemów rozpoznawania mowy nigdy tak naprawdę nie decyduje, czy zapisać to, co zostało powiedziane, czy to, co miano na myśli. Dziedziczą tę decyzję z danych treningowych i stosują ją niespójnie. CrisperWhisper 2.0 czyni to wyraźnym, kontrolowanym wyborem. Jedno nagranie, dwa transkrypty: > Dosłownie, dokładnie to, co zostało powiedziane, w jednym spójnym formacie:
[um] więc musimy, musimy przełożyć czwartkowe spotkanie na [uh] trzeci marca o dziewiątej trzydzieści [śmiech]Zamierzony, czysta wersja, którą miał na myśli mówca, z liczbami, datami, i e-mailami sformatowanymi tak, jak byś je napisał:Więc musimy przełożyć czwartkowe spotkanie na 3 marca o 9:30.– Czasowanie na poziomie słowa. Około 30 ms średniego błędu granicy w mowie czytanej
i 41 ms w mowie konwersacyjnej, najdokładniejsze czasowanie słów ze wszystkich systemów, które testowaliśmy, w obu przypadkach.
- Dosłowność. Ulepsz transkrypty, które już masz: podając audio plus zaufaną czystą transkrypt, model reprodukuje twoją treść słowo w słowo
i wstawia tylko nieprawidłowości i zdarzenia głosowe, które faktycznie występują w audio (współczynnik przypomnienia rzadkich słów wzrasta z 6.8% do 96.1% w porównaniu do ponownego transkrybowania). To przekształca obfite czyste korpusy świata w dosłowne, gotowe do danych TTS, analizy mowy klinicznej i budowy zbiorów danych.
- Wielojęzyczność. Tryby dosłowny i zamierzony działają w większości języków,
które wspiera Whisper. CrisperWhisper 2.0 zajmuje pierwsze miejsce w rankingu Nyra Verbatim Speech Benchmark w kategorii F1 dla nieprawidłowości w dziesięciu językach, wyprzedzając każdą alternatywę zamkniętoźródłową, którą testowaliśmy.
- Bezproblemowe długie formy. Audio dowolnej długości, transkrybowane bez zwykłych
artefaktów granic okien: każde okno kontynuuje od słów już transkrybowanych (kontynuacja warunkowa), więc nie ma powtórzonych ani zgubionych słów na granicach i żadnego delikatnego prowadzenia czasów-tokenów.
- Produkcja inferencji. CTranslate2 runtime z spekulacyjnym dekodowaniem
i wbudowaną mitigacją trybu awarii pętli Whisper. Ranking Nyra Verbatim Speech Benchmark ocenia wypełniacze, powtórzenia, przerwania i dźwięki głosowe jako oddzielne, typowane metryki. Jego główną liczbą jest F1 dla nieprawidłowości: jak niezawodnie system zapisuje nieprawidłowości, które faktycznie zostały wypowiedziane, bez wymyślania tych, które nie były. Uśrednione w dziesięciu językach:
| # | System | F1 dla nieprawidłowości |
|---|---|---|
| 1 | CrisperWhisper 2.0 Pro | 93.5 |
| 2 | CrisperWhisper 2.0 | 87.8 |
| 3 | ElevenLabs Scribe v2 | 79.2 |
| 4 | Microsoft MAI-Transcribe-1.5 | 77.5 |
| 5 | CrisperWhisper 1.0\* | 64.8 |
| 6 | Inworld STT | 59.5 |
| 7 | xAI Grok Speech-to-Text | 42.8 |
| 8 | Deepgram Nova-3 | 37.8 |
| 9 | Fish Audio ASR | 35.0 |
| 10 | AssemblyAI Universal-3 Pro | 30.5 |
\* CrisperWhisper 1.0 jest tylko w języku angielskim/niemieckim; jego średnia obejmuje te dwa języki. Angielski i niemiecki używają zestawów oceny oznaczonych przez ludzi; pozostałe osiem języków używa syntetycznych zestawów dosłownych. Szczegółowe analizy dla każdego języka oraz sposób obliczania metryki znajdują się w
poście benchmarkowym.
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.