Przejdź do treści

Szczegóły modelu

JoyAI-Video-Edit

Status: AktywnyW trendach Hugging Face

Dostawca: jdopensource →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Biblioteka
Diffusers

Opis modelu

JoyAI-Video-EditReal-Time Open-Ended Video Editing with Autoregressive Diffusion Arxiv Projekt Hugging Face ModelScope Licencja JoyAI-Video-Edit to system edycji wideo w czasie rzeczywistym, kierowany instrukcjami, przeznaczony do otwartych strumieni wideo. Dany strumień z kamery na żywo lub przesłane wideo oraz instrukcja edycji w naturalnym języku, edytuje klatki w sposób przyczynowy w miarę ich przybywania, bez oczekiwania na pełne wideo, wymagania wstępnie zdefiniowanej długości wideo lub ponownego odwiedzania przyszłych klatek. W naszym benchmarku wdrożeniowym, pełny pipeline end-to-end osiąga 30.19 FPS przy 720×1280, przesuwając edycję wideo z offline'owego przetwarzania wsadowego w kierunku interaktywnej generacji strumieniowej. System łączy enkoder warunkowy oparty na MLLM, przyczynowy VAE wideo oraz multimodalny transformator dyfuzji o 16B parametrach. Jest trenowany i wdrażany jako edytor dyfuzyjny autoregresywny, a następnie przyspieszany za pomocą dopasowania rozkładu autoregresywnego, optymalizacji długohoryzontalnej, ograniczonego wnioskowania KV-state oraz harmonogramowania zorientowanego na wdrożenie, aby utrzymać wysokowydajną edycję 720p, jednocześnie redukując niedopasowanie między treningiem a wnioskowaniem oraz skumulowany dryf czasowy.

  • Edycja w czasie rzeczywistym o otwartym końcu. Edytuje filmy na żywo lub przesłane wideo w miarę przybywania klatek, bez konieczności posiadania pełnej sekwencji z góry.
  • Różnorodna kontrola instrukcji. Obsługuje edycje tematyczne, lokalne edycje, zmiany tła, transfer stylu, zmiany ruchu oraz edycję kierowaną odniesieniem.
  • Projekt dyfuzji autoregresywnej. Łączy enkoder warunkowy MLLM, przyczynowy VAE wideo oraz rdzeń MMDiT do edycji wideo strumieniowego.
  • Wdrożenie o wysokiej wydajności 720p. Osiąga 30.19 FPS wydajności end-to-end przy 720×1280 z ograniczonym wnioskowaniem KV-state i stabilnym obliczeniem na kawałku. Pobierz wydane wagi z powyższego linku Hugging Face. MiMo-VL i pliki detektora ONNX są zewnętrznymi zależnościami czasu wykonania; zobacz DEPLOYMENT.md po szczegóły wdrożenia. Dla zdalnych maszyn, powiąż serwer z 0.0.0.0 i otwórz wybrany port, lub użyj przekierowania portu SSH. Pobierz wydane wagi JoyAI-Video-Edit z Hugging Face, a następnie umieść je pod:

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON