Przejdź do treści

Szczegóły modelu

MOSS-Transcribe-Diarize

Status: AktywnyW trendach Hugging Face

Dostawca: OpenMOSS-Team →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Biblioteka
Transformers

Opis modelu

MOSS-Transcribe-Diarize 0.9B to kompleksowy model rozumienia audio dla długich transkrypcji wielomówców, diaryzacji, znaczników czasu i świadomości zdarzeń akustycznych. Obsługuje transkrypcję i diaryzację w ponad 50 językach, inferencję w jednym przebiegu dla nagrań audio o długości do 90 minut oraz niestandardowe podpowiadanie hotwordów dla terminów specyficznych dla domeny. Mając plik audio lub wideo, model generuje w jednym przebiegu zwarty transkrypt z uwzględnieniem mówcy, zawierający znaczniki czasu i anonimowe etykiety mówców, takie jak [S01], [S02] i inne. 2026-07-14: ? MOSS-Transcribe-Diarize zdobył pierwsze miejsce w 2. MLC-SLM Challenge na INTERSPEECH 2026, obejmującym 14 języków. 2026-07-09: Wydano MOSS-Transcribe-Diarize 0.9B.

  • Wprowadzenie – Architektura modelu – Ocena – Szybki start – Konfiguracja środowiska – Użycie w Pythonie – Obsługa z vLLM i SGLang – Aplikacja internetowa napisów – Format wyjściowy – Więcej informacji – Licencja – Cytowanie MOSS-Transcribe-Diarize 0.9B przekształca rzeczywiste długie audio w ustrukturyzowane transkrypty z uwzględnieniem mówcy w jednym przebiegu. Zamiast łączyć oddzielne systemy ASR i diaryzacji, wspólnie wykonuje transkrypcję mowy i diaryzację mówców, tworząc tekst z wyrównaniem czasowym i spójnymi etykietami mówców. Model jest przeznaczony do spotkań, rozmów, podcastów, wywiadów, wykładów, filmów i innych długich lub chaotycznych nagrań wielomówców. Może również emitować adnotacje zdarzeń akustycznych, dając systemom downstream bogatszy obraz tego, co się wydarzyło, kto mówił i kiedy. Transkrypcja długich form: Konwertuje długie nagrania audio lub wideo na tekst z oznaczeniem czasu. Diaryzacja z uwzględnieniem mówcy: Przypisuje anonimowe etykiety mówców, takie jak [S01] i [S02], bez osobnego potoku diaryzacji. * Generowanie z podpowiedziami: Obsługuje niestandardowe instrukcje transkrypcji, hotwordy i adnotacje zdarzeń akustycznych.

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON