Szczegóły modelu
Mage-VL
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Główne zadanie
- Obraz i tekst → tekst
- Biblioteka
- Transformers
Opis modelu
Mage-VL to model podstawowy multimodalny z natywnym kodekiem i proaktywnym strumieniowaniem, który służy do rozumienia obrazów i wideo. Jego wizualny enkoder jest trenowany całkowicie od podstaw w kompaktowej skali 4B. Model ten odpowiada nowoczesnemu paradoksowi Moraveca VLM — jest silny w skomplikowanym rozumowaniu offline, ale wolny i wymagający obliczeń w przypadku prostego postrzegania strumieniowego w czasie rzeczywistym. Zamiast dekodować wideo na jednorodnie próbkowane klatki i przesyłać gęstą siatkę tokenów łatki przez zamrożony, wstępnie wytrenowany ViT, Mage-VL podąża za strukturą nowoczesnych kodeków wideo: dzieli strumień na klatki zakotwiczone (I) i klatki przewidywane (P), zachowuje każdą łatkę zakotwiczoną i zatrzymuje tylko łatki klatek przewidywanych, gdzie kodek wydaje bity — obszary przenoszące rzeczywisty ruch i nowe szczegóły. Ta zgodność z kodekiem redukuje liczbę tokenów wizualnych o ponad 75%, zachowując kontekst spatio-temporalny, co skutkuje do 3.5× przyspieszenia czasu wnioskowania w porównaniu do jednorodnego próbkowania klatek.
- Mage-ViT — wizualny enkoder Codec-ViT trenowany od podstaw, który alokuje tokeny według spatio-temporalnego znaczenia pochodzącego z kodeka, na wspólnej siatce łatki
16×16z rotacyjnym kodowaniem pozycji 3D. Jest niezależny od kodeka: ten sam interfejs akceptuje tradycyjny kodek (H.264/AVC, HEVC/H.265) za pomocą wektorów ruchu + energii resztkowej lub kodek neuronowy (DCVC-RT) za pomocą jego wyuczonej mapy bitowej — bez zmiany architektury ani retrainingu. - Dekoder przyczynowy Qwen3-4B — rdzeń językowy Qwen3-4B-Instruct-2507 (jedyny wstępnie wytrenowany komponent), który konsumuje zmienną długość strumienia tokenów Mage-ViT przez lekką projektor MLP o dwóch warstwach, z jednolitym interfejsem dla obrazów, krótkich/długich/ultra-długich wideo i strumieniowania. Na szczycie tej pary, System 1 & System 2 dodaje proaktywne strumieniowanie w ramach jednego modelu: lekka brama poznawcza (System 1) obserwuje każde przesuwające się okno kodeka i milczy w przypadku rutynowej treści, wywołując pełne VLM (System 2) tylko wtedy, gdy zakończy się zdarzenie warte odpowiedzi — nie jest wymagany żaden pipeline wieloagentowy.
- Natywne kodek i od podstaw. Cała wizualna struktura jest trenowana od podstaw — bez inicjalizacji ViT na skali miliardowej obrazów-tekstów. Mechanizm przewidywania łatki inspirowany biologią (I/P klatki przy
16×16) redukuje zużycie tokenów wizualnych o ponad 75% (~1/8 lub mniej w przypadku gęstego próbkowania klatek), pozwalając modelowi trenować na wideo 8× dłużej w ramach tego samego budżetu. - Przyspieszenie natywne kodeka. Tokenizacja kodeka ustala doskonałą granicę dokładności–efektywności — do 3.5× przyspieszenia czasu wnioskowania w porównaniu do jednorodnego próbkowania klatek przy dopasowanej dokładności, a także jest najszybsza ze wszystkich porównywanych modeli w większości benchmarków wideo (pojedynczy węzeł 8×B200).
- Skalowanie w natywnej rozdzielczości. Wstępne trenowanie o zmiennej rozdzielczości pozwala Mage-ViT poprawić się monotonicznie w ramach budżetu tokenów (osiągając >96.1% Food-101 / >86.3% ImageNet przy 676 tokenach), gdzie enkodery o stałej rozdzielczości saturują lub degradują.
- Zyski wideo dopasowane do LLM. Przy stałym rdzeniu Qwen3 4B i tylko zamienionym ViT, Mage-VL poprawia się w porównaniu do Qwen3-VL-4B w każdym zgłoszonym benchmarku wideo i temporal-grounding — największe zyski w zadaniach wymagających lokalizacji (+22.5 QVHighlight, +17.1 ActivityNet, +11.0 VSI-Bench, +24.5 VideoEval-Pro).
- Silny jak na swój rozmiar. Na równi z Qwen3-VL-4B w przypadku statycznych obrazów, a wyraźnie lepszy w rozumieniu wideo i inteligencji przestrzennej (+11.0 VSI-Bench, +53.1 CrossPoint, +5.2 EmbSpatial, +22.5 QVHighlight).
- Proaktywne strumieniowanie, jeden model. Zamrożona brama poznawcza dostarcza niskolatencyjny, zdarzeniowy komentarz; osiąga najwyższe wyniki TimVal / F1 / ROC-AUC / PR-AUC w strumieniu SoccerNet i generalizuje do rzeczywistych transmisji Mistrzostw Świata 2026. Jedna kontrolka,
microsoft/Mage-VL, to jeden zintegrowany model, który jednocześnie zapewnia rozumienie obrazów i wideo oraz proaktywną bramę strumieniową — te same wagi odpowiadają na pytania offline dotyczące obrazów/wideo i prowadzą komentarz zdarzeniowy. Obejmuje wszystkie możliwości Mage-VL: rozumienie obrazów, wideo próbkowane klatkami, tradycyjne wideo kodeka H.264/HEVC, wideo kodeka neuronowego DCVC-RT oraz strumieniowanie z bramą zdarzeniową. Repozytorium zawiera procesor kodeka, pakiet kodeka neuronowego i wagi bramy proaktywnej — nie jest wymagany osobny punkt kontrolny dla rozumienia, NVC ani strumieniowania. Dodatkowo wydajemymicrosoft/Mage-ViT— samodzielny wizualny enkoder z dwuetapowego, od podstaw wstępnego trenowania ViT. To jest tylko punkt kontrolny wstępnie wytrenowanego ViT: nie przeszedł on przez wspólne trenowanie VLM z modelem językowym. Użyj go jako efektywnego w danych, natywnego kodeka wizualnego lub jako zamiennika ViT do własnego trenowania multimodalnego.
| Model | Zadanie | Rdzeń | Hugging Face |
|---|---|---|---|
Mage-VL | rozumienie obrazów i wideo + proaktywna brama strumieniowa | Mage-ViT + Qwen3-4B-Instruct-2507 | ? microsoft/Mage-VL |
Mage-ViT | wizualny enkoder natywny kodeka — tylko wstępne trenowanie ViT, bez wspólnego trenowania VLM | Codec-ViT (od podstaw) | ? microsoft/Mage-ViT |
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.