Przejdź do treści

Szczegóły modelu

CrisperWhisper2.0_large

Status: AktywnyW trendach Hugging Face

Dostawca: nyralabs →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Główne zadanie
Rozpoznawanie mowy
Biblioteka
Crisperwhisper

Opis modelu

Najbardziej dokładne rozpoznawanie mowy dosłownej, które możesz uruchomić w produkcji: kontrolowane, wielojęzyczne i dostosowane do słowa. Post wydania · Artykuł · Pełna dokumentacja · Modele · Benchmark · Repozytorium benchmarków Większość systemów rozpoznawania mowy nigdy tak naprawdę nie decyduje, czy zapisać to, co zostało powiedziane, czy to, co miano na myśli. Dziedziczą tę decyzję z danych treningowych i stosują ją niespójnie. CrisperWhisper 2.0 czyni to wyraźnym, kontrolowanym wyborem. Jedno nagranie, dwa transkrypty: > Dosłownie, dokładnie to, co zostało powiedziane, w jednym spójnym formacie:

[um] więc musimy, musimy przełożyć czwartkowe spotkanie na [uh] trzeci marca o dziewiątej trzydzieści [śmiech] Zamierzony, czysta wersja, którą miał na myśli mówca, z liczbami, datami, i e-mailami sformatowanymi tak, jak byś je napisał: Więc musimy przełożyć czwartkowe spotkanie na 3 marca o 9:30.Czasowanie na poziomie słowa. Około 30 ms średniego błędu granicy w mowie czytanej

i 41 ms w mowie konwersacyjnej, najdokładniejsze czasowanie słów ze wszystkich systemów, które testowaliśmy, w obu przypadkach.

  • Dosłowność. Ulepsz transkrypty, które już masz: podając audio plus zaufaną czystą transkrypt, model reprodukuje twoją treść słowo w słowo

i wstawia tylko nieprawidłowości i zdarzenia głosowe, które faktycznie występują w audio (współczynnik przypomnienia rzadkich słów wzrasta z 6.8% do 96.1% w porównaniu do ponownego transkrybowania). To przekształca obfite czyste korpusy świata w dosłowne, gotowe do danych TTS, analizy mowy klinicznej i budowy zbiorów danych.

  • Wielojęzyczność. Tryby dosłowny i zamierzony działają w większości języków,

które wspiera Whisper. CrisperWhisper 2.0 zajmuje pierwsze miejsce w rankingu Nyra Verbatim Speech Benchmark w kategorii F1 dla nieprawidłowości w dziesięciu językach, wyprzedzając każdą alternatywę zamkniętoźródłową, którą testowaliśmy.

  • Bezproblemowe długie formy. Audio dowolnej długości, transkrybowane bez zwykłych

artefaktów granic okien: każde okno kontynuuje od słów już transkrybowanych (kontynuacja warunkowa), więc nie ma powtórzonych ani zgubionych słów na granicach i żadnego delikatnego prowadzenia czasów-tokenów.

  • Produkcja inferencji. CTranslate2 runtime z spekulacyjnym dekodowaniem

i wbudowaną mitigacją trybu awarii pętli Whisper. Ranking Nyra Verbatim Speech Benchmark ocenia wypełniacze, powtórzenia, przerwania i dźwięki głosowe jako oddzielne, typowane metryki. Jego główną liczbą jest F1 dla nieprawidłowości: jak niezawodnie system zapisuje nieprawidłowości, które faktycznie zostały wypowiedziane, bez wymyślania tych, które nie były. Uśrednione w dziesięciu językach:

#SystemF1 dla nieprawidłowości
1CrisperWhisper 2.0 Pro93.5
2CrisperWhisper 2.087.8
3ElevenLabs Scribe v279.2
4Microsoft MAI-Transcribe-1.577.5
5CrisperWhisper 1.0\*64.8
6Inworld STT59.5
7xAI Grok Speech-to-Text42.8
8Deepgram Nova-337.8
9Fish Audio ASR35.0
10AssemblyAI Universal-3 Pro30.5

\* CrisperWhisper 1.0 jest tylko w języku angielskim/niemieckim; jego średnia obejmuje te dwa języki. Angielski i niemiecki używają zestawów oceny oznaczonych przez ludzi; pozostałe osiem języków używa syntetycznych zestawów dosłownych. Szczegółowe analizy dla każdego języka oraz sposób obliczania metryki znajdują się w

poście benchmarkowym.

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON