Szczegóły modelu
JoyAI-Video-Edit
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Biblioteka
- Diffusers
Opis modelu
JoyAI-Video-EditReal-Time Open-Ended Video Editing with Autoregressive Diffusion Arxiv Projekt Hugging Face ModelScope Licencja JoyAI-Video-Edit to system edycji wideo w czasie rzeczywistym, kierowany instrukcjami, przeznaczony do otwartych strumieni wideo. Dany strumień z kamery na żywo lub przesłane wideo oraz instrukcja edycji w naturalnym języku, edytuje klatki w sposób przyczynowy w miarę ich przybywania, bez oczekiwania na pełne wideo, wymagania wstępnie zdefiniowanej długości wideo lub ponownego odwiedzania przyszłych klatek. W naszym benchmarku wdrożeniowym, pełny pipeline end-to-end osiąga 30.19 FPS przy 720×1280, przesuwając edycję wideo z offline'owego przetwarzania wsadowego w kierunku interaktywnej generacji strumieniowej. System łączy enkoder warunkowy oparty na MLLM, przyczynowy VAE wideo oraz multimodalny transformator dyfuzji o 16B parametrach. Jest trenowany i wdrażany jako edytor dyfuzyjny autoregresywny, a następnie przyspieszany za pomocą dopasowania rozkładu autoregresywnego, optymalizacji długohoryzontalnej, ograniczonego wnioskowania KV-state oraz harmonogramowania zorientowanego na wdrożenie, aby utrzymać wysokowydajną edycję 720p, jednocześnie redukując niedopasowanie między treningiem a wnioskowaniem oraz skumulowany dryf czasowy.
- Edycja w czasie rzeczywistym o otwartym końcu. Edytuje filmy na żywo lub przesłane wideo w miarę przybywania klatek, bez konieczności posiadania pełnej sekwencji z góry.
- Różnorodna kontrola instrukcji. Obsługuje edycje tematyczne, lokalne edycje, zmiany tła, transfer stylu, zmiany ruchu oraz edycję kierowaną odniesieniem.
- Projekt dyfuzji autoregresywnej. Łączy enkoder warunkowy MLLM, przyczynowy VAE wideo oraz rdzeń MMDiT do edycji wideo strumieniowego.
- Wdrożenie o wysokiej wydajności 720p. Osiąga 30.19 FPS wydajności end-to-end przy 720×1280 z ograniczonym wnioskowaniem KV-state i stabilnym obliczeniem na kawałku. Pobierz wydane wagi z powyższego linku Hugging Face. MiMo-VL i pliki detektora ONNX są zewnętrznymi zależnościami czasu wykonania; zobacz
DEPLOYMENT.mdpo szczegóły wdrożenia. Dla zdalnych maszyn, powiąż serwer z0.0.0.0i otwórz wybrany port, lub użyj przekierowania portu SSH. Pobierz wydane wagi JoyAI-Video-Edit z Hugging Face, a następnie umieść je pod:
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.