Przejdź do treści

Szczegóły modelu

MOSS-VL-Realtime

Status: AktywnyW trendach Hugging Face

Dostawca: OpenMOSS-Team →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Biblioteka
Transformers

Opis modelu

MOSS-VL-Realtime jest punktem kontrolnym do strumieniowania w czasie rzeczywistym z wydania MOSS-VL, części ekosystemu OpenMOSS do otwartego rozumienia wizualnego. W przeciwieństwie do offline'owych modeli wideo-językowych, które najpierw odczytują całe wideo, a następnie odpowiadają, MOSS-VL-Realtime jest zaprojektowany dla ciągłych strumieni wideo. Odbiera nadchodzące klatki i generuje tekst równolegle, obsługuje pytania w dowolnych momentach strumienia i może zdecydować, czy odpowiedzieć, czy kontynuować obserwację, gdy dowody wizualne są niewystarczające. To wydanie zachowuje architekturę cross-attention MOSS-VL i 256K kontekst tekstowy, dodając dane strumieniowe w czasie rzeczywistym oraz interfejs inferencji dla wprowadzania klatek z sygnaturą czasową.

  • Rozumienie strumieniowe w czasie rzeczywistym: przetwarza nadchodzące klatki ciągle, zamiast czekać na całe wideo.
  • Interakcja z możliwością przerwania: użytkownicy mogą zadawać pytania w dowolnym momencie działającego strumienia, a model odpowiada na podstawie zaobserwowanych do tej pory klatek.
  • Proaktywna cisza: model może wyemitować i kontynuować obserwację, gdy nie ma znaczącej aktualizacji wizualnej lub kontekst jest niewystarczający.
  • Dynamiczna korekta: wraz z nadejściem nowych klatek model może poprawić wcześniejsze odpowiedzi zamiast trwać przy początkowej interpretacji.
  • Klatki ze świadomością czasu: każda strumieniowana klatka jest powiązana z absolutną sygnaturą czasową, pomagając modelowi wnioskować o kolejności zdarzeń, czasie trwania, tempie i szczegółowej lokalizacji czasowej.
  • Ujednolicona rodzina MOSS-VL: wydana razem z MOSS-VL-Instruct i MOSS-VL-Base do użytku offline, kontynuacji pretreningu, dostrajania i badań stosowanych. MOSS-VL-Realtime przyjmuje architekturę wizyjno-językową opartą na cross-attention, która rozdziela kodowanie wizualne od rozumowania językowego. Ten projekt jest ważny do użytku w czasie rzeczywistym, ponieważ nadchodzące treści wizualne mogą być zintegrowane z bieżącym kontekstem generowania bez zmuszania modelu do ściśle offline'owego przepływu pracy „załadować wszystkie klatki, potem odpowiedzieć”. Dla wideo i strumieniowych klatek w czasie rzeczywistym MOSS-VL wstrzykuje absolutne sygnatury czasowe wraz z próbkowanymi klatkami. Pomaga to modelowi wnioskować o tym, kiedy zdarzenie ma miejsce, jak długo trwa i jak scena zmienia się w czasie, zamiast polegać tylko na kolejności klatek. MOSS-VL używa również Cross-attention Rotary Position Embedding (XRoPE), która mapuje tokeny tekstowe i fragmenty wizualne w ujednoliconą trójwymiarową przestrzeń współrzędnych zdefiniowaną przez Czas (t), Wysokość (h) i Szerokość (w). Daje to modelowi spójną reprezentację pozycyjną dla obrazu, wideo offline i strumieniowego wideo w czasie rzeczywistym.
ElementWartość
Parametry11B
Typ tensoraBF16
Długość kontekstu256K
Rozmiar fragmentu wizualnego16
Rozmiar fragmentu czasowego1
Domyślne FPS wideo1.0
Maksymalna liczba klatek wideo256
Format klatki w czasie rzeczywistymObraz zgodny z PIL plus sygnatura czasowa
Zakres sesji w czasie rzeczywistymJedna aktywna sesja w czasie rzeczywistym na instancję modelu

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON