Szczegóły modelu
MOSS-VL-Realtime
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Biblioteka
- Transformers
Opis modelu
MOSS-VL-Realtime jest punktem kontrolnym do strumieniowania w czasie rzeczywistym z wydania MOSS-VL, części ekosystemu OpenMOSS do otwartego rozumienia wizualnego. W przeciwieństwie do offline'owych modeli wideo-językowych, które najpierw odczytują całe wideo, a następnie odpowiadają, MOSS-VL-Realtime jest zaprojektowany dla ciągłych strumieni wideo. Odbiera nadchodzące klatki i generuje tekst równolegle, obsługuje pytania w dowolnych momentach strumienia i może zdecydować, czy odpowiedzieć, czy kontynuować obserwację, gdy dowody wizualne są niewystarczające. To wydanie zachowuje architekturę cross-attention MOSS-VL i 256K kontekst tekstowy, dodając dane strumieniowe w czasie rzeczywistym oraz interfejs inferencji dla wprowadzania klatek z sygnaturą czasową.
- Rozumienie strumieniowe w czasie rzeczywistym: przetwarza nadchodzące klatki ciągle, zamiast czekać na całe wideo.
- Interakcja z możliwością przerwania: użytkownicy mogą zadawać pytania w dowolnym momencie działającego strumienia, a model odpowiada na podstawie zaobserwowanych do tej pory klatek.
- Proaktywna cisza: model może wyemitować i kontynuować obserwację, gdy nie ma znaczącej aktualizacji wizualnej lub kontekst jest niewystarczający.
- Dynamiczna korekta: wraz z nadejściem nowych klatek model może poprawić wcześniejsze odpowiedzi zamiast trwać przy początkowej interpretacji.
- Klatki ze świadomością czasu: każda strumieniowana klatka jest powiązana z absolutną sygnaturą czasową, pomagając modelowi wnioskować o kolejności zdarzeń, czasie trwania, tempie i szczegółowej lokalizacji czasowej.
- Ujednolicona rodzina MOSS-VL: wydana razem z MOSS-VL-Instruct i MOSS-VL-Base do użytku offline, kontynuacji pretreningu, dostrajania i badań stosowanych. MOSS-VL-Realtime przyjmuje architekturę wizyjno-językową opartą na cross-attention, która rozdziela kodowanie wizualne od rozumowania językowego. Ten projekt jest ważny do użytku w czasie rzeczywistym, ponieważ nadchodzące treści wizualne mogą być zintegrowane z bieżącym kontekstem generowania bez zmuszania modelu do ściśle offline'owego przepływu pracy „załadować wszystkie klatki, potem odpowiedzieć”. Dla wideo i strumieniowych klatek w czasie rzeczywistym MOSS-VL wstrzykuje absolutne sygnatury czasowe wraz z próbkowanymi klatkami. Pomaga to modelowi wnioskować o tym, kiedy zdarzenie ma miejsce, jak długo trwa i jak scena zmienia się w czasie, zamiast polegać tylko na kolejności klatek. MOSS-VL używa również Cross-attention Rotary Position Embedding (XRoPE), która mapuje tokeny tekstowe i fragmenty wizualne w ujednoliconą trójwymiarową przestrzeń współrzędnych zdefiniowaną przez Czas (t), Wysokość (h) i Szerokość (w). Daje to modelowi spójną reprezentację pozycyjną dla obrazu, wideo offline i strumieniowego wideo w czasie rzeczywistym.
| Element | Wartość |
|---|---|
| Parametry | 11B |
| Typ tensora | BF16 |
| Długość kontekstu | 256K |
| Rozmiar fragmentu wizualnego | 16 |
| Rozmiar fragmentu czasowego | 1 |
| Domyślne FPS wideo | 1.0 |
| Maksymalna liczba klatek wideo | 256 |
| Format klatki w czasie rzeczywistym | Obraz zgodny z PIL plus sygnatura czasowa |
| Zakres sesji w czasie rzeczywistym | Jedna aktywna sesja w czasie rzeczywistym na instancję modelu |
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.