Przejdź do treści

Szczegóły modelu

MiniMax-H3

Status: AktywnyW trendach Hugging Face

Dostawca: MiniMaxAI →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Biblioteka
Diffusers

Opis modelu

API online Użyj MiniMax-H3 bezpośrednio przez API.

  • Global: platform.minimax.io | CN: platform.minimaxi.com Aplikacja online

Użyj MiniMax-H3 bezpośrednio przez aplikację.

  • WebApp Global: hailuoai.video | CN: hailuoai.com
  • Desktop Global: hub.minimax.io | CN: hub.minimaxi.com Przegląd systemu

MiniMax H3 to ogólnego przeznaczenia, omni-modalny system generatywny. Obsługuje zjednoczone rozumienie multimodalnych kontekstów składających się z tekstu, obrazów, wideo i dźwięku, i może generować wideo z natywnym dźwiękiem stereo w rozdzielczości do 2K i czasie trwania do 15 sekund. Dzięki swojemu projektowi systemu ukierunkowanemu na generalizację zadań, H3 już posiada szerokie możliwości rozumienia i generowania multimodalnych kontekstów na etapie wstępnego szkolenia, co umożliwia doskonałe wyniki w realizacji złożonych multimodalnych instrukcji. H3 obsługuje następujące specyfikacje wejścia i wyjścia:

KategoriaSpecyfikacja
Czas trwania wyjścia4–15 sekund
Proporcje wyjściaObsługuje szeroki zakres proporcji, w tym, ale nie ograniczając się do 21:9, 16:9, 4:3, 1:1, 3:4 i 9:16
Rozdzielczość wyjściaObsługuje różne wymiary rozdzielczości. Krótszy bok ustawiony jest domyślnie na 768 pikseli. 2K
Liczba klatek na sekundę24 FPS
Dźwięk wyjściowy32 kHz stereo

generacja może być osiągnięta z H3-Regenerate-2K

Obsługiwane języki dialogoweStabilne wsparcie dla 11 języków: arabski, chiński, angielski, francuski, niemiecki, włoski, japoński, koreański, portugalski, rosyjski i hiszpański. Dodatkowe języki są również wspierane w różnym stopniuWariant modeluTryb wejściaSpecyfikacje
H3-Base-FL2VATryb pierwszej i ostatniej klatkiObsługuje zero, jeden lub dwa obrazy wejściowe.
  • Brak obrazu wejściowego: Tryb tekst-na-wideo – Jeden obraz wejściowy: Generacja wideo z pierwszej klatki lub ostatniej klatki – Dwa obrazy wejściowe: Generacja wideo z pierwszej i ostatniej klatki |

| H3-Base-Ref2VA | Tryb omni-referencyjny | Obsługuje multimodalne wejścia referencyjne:

  • Obrazy: ≤ 9 obrazów – Wideo: ≤ 3 klipy; każdy klip musi mieć długość 2–15 sekund; całkowity czas trwania ≤ 15 sekund – Dźwięk: ≤ 3 klipy; dźwięk musi być towarzyszony przez obraz lub wideo i nie może być używany jako jedyne wejście; każdy klip musi mieć długość 2–15 sekund; całkowity czas trwania ≤ 15 sekund – Mieszane wejścia: Maksymalna liczba plików we wszystkich typach wejść wynosi 12 | Cały system H3 składa się z następujących trzech modułów:
  • H3-Context-IR: W miarę jak wejścia stają się coraz bardziej złożone, budujemy dedykowany system do głębokiego rozumienia i udoskonalania multimodalnych instrukcji wejściowych, a następnie przekształcamy je w formę, którą H3 może łatwo zrozumieć—Reprezentacja Pośrednia Kontekstowa—do generacji. H3-Context-IR jest kluczowe dla jakości końcowego wyjścia, dlatego zdecydowanie zalecamy włączenie go do swojego procesu generacji lub postępowanie zgodnie z „Wskazówkami dotyczącymi podpowiedzi”, aby zbudować własny system przetwarzania kontekstu.
  • H3-Base: Generuje dźwięk i wideo na podstawie wyjścia H3-Context-IR, produkując wyniki w rozdzielczości 768p.
  • H3-Regenerate-2K: Wprowadza wynik 768p razem z oryginalnym kontekstem z powrotem do H3, aby ponownie wygenerować wyjście w rozdzielczości 2K. Proces ten wykorzystuje zarówno potężne możliwości generacyjne H3, jak i bogate informacje zawarte w oryginalnym kontekście, co pozwala na uzyskanie wysokiej rozdzielczości z bardziej dokładnymi szczegółami i większą wiernością wizualną. H3-Context-IR to hostowany system wstępnego przetwarzania i orkiestracji zaprojektowany dla swobodnych multimodalnych wejść.

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON