Przejdź do treści

Szczegóły modelu

speaker-diarization-3.1

Status: AktywnyW trendach Hugging Face

Dostawca: pyannote →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Główne zadanie
Rozpoznawanie mowy
Biblioteka
Pyannote-audio

Opis modelu

Do czego służy speaker-diarization-3.1

speaker-diarization-3.1 to gotowy potok biblioteki pyannote.audio, który odpowiada na pytanie „kto mówi i kiedy?”. Model nie zapisuje treści wypowiedzi. Dzieli nagranie na odcinki przypisane do poszczególnych mówców, dlatego dobrze uzupełnia system rozpoznawania mowy w transkrypcjach spotkań, wywiadów, podcastów i nagrań call center.

Najważniejsze możliwości

  • działa automatycznie bez podawania liczby mówców, ale pozwala też określić dokładną, minimalną lub maksymalną ich liczbę;
  • przyjmuje dźwięk jedno- lub wielokanałowy, sprowadza go do mono i w razie potrzeby próbuje do 16 kHz;
  • zwraca obiekt z przedziałami czasu i etykietami mówców, który można połączyć ze znacznikami czasu z ASR;
  • obsługuje przetwarzanie na CPU i GPU oraz pliki w pamięci.

Wersja 3.1 zastąpiła zależność od onnxruntime implementacją opartą wyłącznie na PyTorch, zachowując architekturę potoku 3.0. W praktyce jakość zależy od akustyki, nakładających się głosów i poprawnego doboru parametrów. To komponent analizy nagrań, a nie model konwersacyjny ani transkrypcyjny. Repozytorium modelu jest objęte licencją MIT, lecz dostęp do wag może wymagać zaakceptowania warunków na Hugging Face.

Źródło: oficjalna karta pyannote speaker-diarization-3.1.

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON