Szczegóły modelu
speaker-diarization-3.1
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Główne zadanie
- Rozpoznawanie mowy
- Biblioteka
- Pyannote-audio
Opis modelu
Do czego służy speaker-diarization-3.1
speaker-diarization-3.1 to gotowy potok biblioteki pyannote.audio, który odpowiada na pytanie „kto mówi i kiedy?”. Model nie zapisuje treści wypowiedzi. Dzieli nagranie na odcinki przypisane do poszczególnych mówców, dlatego dobrze uzupełnia system rozpoznawania mowy w transkrypcjach spotkań, wywiadów, podcastów i nagrań call center.
Najważniejsze możliwości
- działa automatycznie bez podawania liczby mówców, ale pozwala też określić dokładną, minimalną lub maksymalną ich liczbę;
- przyjmuje dźwięk jedno- lub wielokanałowy, sprowadza go do mono i w razie potrzeby próbuje do 16 kHz;
- zwraca obiekt z przedziałami czasu i etykietami mówców, który można połączyć ze znacznikami czasu z ASR;
- obsługuje przetwarzanie na CPU i GPU oraz pliki w pamięci.
Wersja 3.1 zastąpiła zależność od onnxruntime implementacją opartą wyłącznie na PyTorch, zachowując architekturę potoku 3.0. W praktyce jakość zależy od akustyki, nakładających się głosów i poprawnego doboru parametrów. To komponent analizy nagrań, a nie model konwersacyjny ani transkrypcyjny. Repozytorium modelu jest objęte licencją MIT, lecz dostęp do wag może wymagać zaakceptowania warunków na Hugging Face.
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.