Szczegóły modelu
MOSS-Transcribe-Diarize
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Biblioteka
- Transformers
Opis modelu
MOSS-Transcribe-Diarize 0.9B to kompleksowy model rozumienia audio dla długich transkrypcji wielomówców, diaryzacji, znaczników czasu i świadomości zdarzeń akustycznych. Obsługuje transkrypcję i diaryzację w ponad 50 językach, inferencję w jednym przebiegu dla nagrań audio o długości do 90 minut oraz niestandardowe podpowiadanie hotwordów dla terminów specyficznych dla domeny. Mając plik audio lub wideo, model generuje w jednym przebiegu zwarty transkrypt z uwzględnieniem mówcy, zawierający znaczniki czasu i anonimowe etykiety mówców, takie jak [S01], [S02] i inne. 2026-07-14: ? MOSS-Transcribe-Diarize zdobył pierwsze miejsce w 2. MLC-SLM Challenge na INTERSPEECH 2026, obejmującym 14 języków. 2026-07-09: Wydano MOSS-Transcribe-Diarize 0.9B.
- Wprowadzenie – Architektura modelu – Ocena – Szybki start – Konfiguracja środowiska – Użycie w Pythonie – Obsługa z vLLM i SGLang – Aplikacja internetowa napisów – Format wyjściowy – Więcej informacji – Licencja – Cytowanie MOSS-Transcribe-Diarize 0.9B przekształca rzeczywiste długie audio w ustrukturyzowane transkrypty z uwzględnieniem mówcy w jednym przebiegu. Zamiast łączyć oddzielne systemy ASR i diaryzacji, wspólnie wykonuje transkrypcję mowy i diaryzację mówców, tworząc tekst z wyrównaniem czasowym i spójnymi etykietami mówców. Model jest przeznaczony do spotkań, rozmów, podcastów, wywiadów, wykładów, filmów i innych długich lub chaotycznych nagrań wielomówców. Może również emitować adnotacje zdarzeń akustycznych, dając systemom downstream bogatszy obraz tego, co się wydarzyło, kto mówił i kiedy. Transkrypcja długich form: Konwertuje długie nagrania audio lub wideo na tekst z oznaczeniem czasu. Diaryzacja z uwzględnieniem mówcy: Przypisuje anonimowe etykiety mówców, takie jak
[S01]i[S02], bez osobnego potoku diaryzacji. * Generowanie z podpowiedziami: Obsługuje niestandardowe instrukcje transkrypcji, hotwordy i adnotacje zdarzeń akustycznych.
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.