Przejdź do treści

Szczegóły modelu

Mage-VL

Status: AktywnyW trendach Hugging Face

Dostawca: Microsoft →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Główne zadanie
Obraz i tekst → tekst
Biblioteka
Transformers

Opis modelu

Mage-VL to model podstawowy multimodalny z natywnym kodekiem i proaktywnym strumieniowaniem, który służy do rozumienia obrazów i wideo. Jego wizualny enkoder jest trenowany całkowicie od podstaw w kompaktowej skali 4B. Model ten odpowiada nowoczesnemu paradoksowi Moraveca VLM — jest silny w skomplikowanym rozumowaniu offline, ale wolny i wymagający obliczeń w przypadku prostego postrzegania strumieniowego w czasie rzeczywistym. Zamiast dekodować wideo na jednorodnie próbkowane klatki i przesyłać gęstą siatkę tokenów łatki przez zamrożony, wstępnie wytrenowany ViT, Mage-VL podąża za strukturą nowoczesnych kodeków wideo: dzieli strumień na klatki zakotwiczone (I) i klatki przewidywane (P), zachowuje każdą łatkę zakotwiczoną i zatrzymuje tylko łatki klatek przewidywanych, gdzie kodek wydaje bity — obszary przenoszące rzeczywisty ruch i nowe szczegóły. Ta zgodność z kodekiem redukuje liczbę tokenów wizualnych o ponad 75%, zachowując kontekst spatio-temporalny, co skutkuje do 3.5× przyspieszenia czasu wnioskowania w porównaniu do jednorodnego próbkowania klatek.

  • Mage-ViT — wizualny enkoder Codec-ViT trenowany od podstaw, który alokuje tokeny według spatio-temporalnego znaczenia pochodzącego z kodeka, na wspólnej siatce łatki 16×16 z rotacyjnym kodowaniem pozycji 3D. Jest niezależny od kodeka: ten sam interfejs akceptuje tradycyjny kodek (H.264/AVC, HEVC/H.265) za pomocą wektorów ruchu + energii resztkowej lub kodek neuronowy (DCVC-RT) za pomocą jego wyuczonej mapy bitowej — bez zmiany architektury ani retrainingu.
  • Dekoder przyczynowy Qwen3-4B — rdzeń językowy Qwen3-4B-Instruct-2507 (jedyny wstępnie wytrenowany komponent), który konsumuje zmienną długość strumienia tokenów Mage-ViT przez lekką projektor MLP o dwóch warstwach, z jednolitym interfejsem dla obrazów, krótkich/długich/ultra-długich wideo i strumieniowania. Na szczycie tej pary, System 1 & System 2 dodaje proaktywne strumieniowanie w ramach jednego modelu: lekka brama poznawcza (System 1) obserwuje każde przesuwające się okno kodeka i milczy w przypadku rutynowej treści, wywołując pełne VLM (System 2) tylko wtedy, gdy zakończy się zdarzenie warte odpowiedzi — nie jest wymagany żaden pipeline wieloagentowy.
  • Natywne kodek i od podstaw. Cała wizualna struktura jest trenowana od podstaw — bez inicjalizacji ViT na skali miliardowej obrazów-tekstów. Mechanizm przewidywania łatki inspirowany biologią (I/P klatki przy 16×16) redukuje zużycie tokenów wizualnych o ponad 75% (~1/8 lub mniej w przypadku gęstego próbkowania klatek), pozwalając modelowi trenować na wideo 8× dłużej w ramach tego samego budżetu.
  • Przyspieszenie natywne kodeka. Tokenizacja kodeka ustala doskonałą granicę dokładności–efektywności — do 3.5× przyspieszenia czasu wnioskowania w porównaniu do jednorodnego próbkowania klatek przy dopasowanej dokładności, a także jest najszybsza ze wszystkich porównywanych modeli w większości benchmarków wideo (pojedynczy węzeł 8×B200).
  • Skalowanie w natywnej rozdzielczości. Wstępne trenowanie o zmiennej rozdzielczości pozwala Mage-ViT poprawić się monotonicznie w ramach budżetu tokenów (osiągając >96.1% Food-101 / >86.3% ImageNet przy 676 tokenach), gdzie enkodery o stałej rozdzielczości saturują lub degradują.
  • Zyski wideo dopasowane do LLM. Przy stałym rdzeniu Qwen3 4B i tylko zamienionym ViT, Mage-VL poprawia się w porównaniu do Qwen3-VL-4B w każdym zgłoszonym benchmarku wideo i temporal-grounding — największe zyski w zadaniach wymagających lokalizacji (+22.5 QVHighlight, +17.1 ActivityNet, +11.0 VSI-Bench, +24.5 VideoEval-Pro).
  • Silny jak na swój rozmiar. Na równi z Qwen3-VL-4B w przypadku statycznych obrazów, a wyraźnie lepszy w rozumieniu wideo i inteligencji przestrzennej (+11.0 VSI-Bench, +53.1 CrossPoint, +5.2 EmbSpatial, +22.5 QVHighlight).
  • Proaktywne strumieniowanie, jeden model. Zamrożona brama poznawcza dostarcza niskolatencyjny, zdarzeniowy komentarz; osiąga najwyższe wyniki TimVal / F1 / ROC-AUC / PR-AUC w strumieniu SoccerNet i generalizuje do rzeczywistych transmisji Mistrzostw Świata 2026. Jedna kontrolka, microsoft/Mage-VL, to jeden zintegrowany model, który jednocześnie zapewnia rozumienie obrazów i wideo oraz proaktywną bramę strumieniową — te same wagi odpowiadają na pytania offline dotyczące obrazów/wideo i prowadzą komentarz zdarzeniowy. Obejmuje wszystkie możliwości Mage-VL: rozumienie obrazów, wideo próbkowane klatkami, tradycyjne wideo kodeka H.264/HEVC, wideo kodeka neuronowego DCVC-RT oraz strumieniowanie z bramą zdarzeniową. Repozytorium zawiera procesor kodeka, pakiet kodeka neuronowego i wagi bramy proaktywnej — nie jest wymagany osobny punkt kontrolny dla rozumienia, NVC ani strumieniowania. Dodatkowo wydajemy microsoft/Mage-ViT — samodzielny wizualny enkoder z dwuetapowego, od podstaw wstępnego trenowania ViT. To jest tylko punkt kontrolny wstępnie wytrenowanego ViT: nie przeszedł on przez wspólne trenowanie VLM z modelem językowym. Użyj go jako efektywnego w danych, natywnego kodeka wizualnego lub jako zamiennika ViT do własnego trenowania multimodalnego.
ModelZadanieRdzeńHugging Face
Mage-VLrozumienie obrazów i wideo + proaktywna brama strumieniowaMage-ViT + Qwen3-4B-Instruct-2507? microsoft/Mage-VL
Mage-ViTwizualny enkoder natywny kodeka — tylko wstępne trenowanie ViT, bez wspólnego trenowania VLMCodec-ViT (od podstaw)? microsoft/Mage-ViT

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON