Szczegóły modelu
MiniMax-H3
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Biblioteka
- Diffusers
Opis modelu
API online Użyj MiniMax-H3 bezpośrednio przez API.
- Global: platform.minimax.io | CN: platform.minimaxi.com Aplikacja online
Użyj MiniMax-H3 bezpośrednio przez aplikację.
- WebApp Global: hailuoai.video | CN: hailuoai.com
- Desktop Global: hub.minimax.io | CN: hub.minimaxi.com Przegląd systemu
MiniMax H3 to ogólnego przeznaczenia, omni-modalny system generatywny. Obsługuje zjednoczone rozumienie multimodalnych kontekstów składających się z tekstu, obrazów, wideo i dźwięku, i może generować wideo z natywnym dźwiękiem stereo w rozdzielczości do 2K i czasie trwania do 15 sekund. Dzięki swojemu projektowi systemu ukierunkowanemu na generalizację zadań, H3 już posiada szerokie możliwości rozumienia i generowania multimodalnych kontekstów na etapie wstępnego szkolenia, co umożliwia doskonałe wyniki w realizacji złożonych multimodalnych instrukcji. H3 obsługuje następujące specyfikacje wejścia i wyjścia:
| Kategoria | Specyfikacja |
|---|---|
| Czas trwania wyjścia | 4–15 sekund |
| Proporcje wyjścia | Obsługuje szeroki zakres proporcji, w tym, ale nie ograniczając się do 21:9, 16:9, 4:3, 1:1, 3:4 i 9:16 |
| Rozdzielczość wyjścia | Obsługuje różne wymiary rozdzielczości. Krótszy bok ustawiony jest domyślnie na 768 pikseli. 2K |
| Liczba klatek na sekundę | 24 FPS |
| Dźwięk wyjściowy | 32 kHz stereo |
generacja może być osiągnięta z H3-Regenerate-2K
| Obsługiwane języki dialogowe | Stabilne wsparcie dla 11 języków: arabski, chiński, angielski, francuski, niemiecki, włoski, japoński, koreański, portugalski, rosyjski i hiszpański. Dodatkowe języki są również wspierane w różnym stopniu | Wariant modelu | Tryb wejścia | Specyfikacje | |
|---|---|---|---|---|---|
| H3-Base-FL2VA | Tryb pierwszej i ostatniej klatki | Obsługuje zero, jeden lub dwa obrazy wejściowe. |
- Brak obrazu wejściowego: Tryb tekst-na-wideo – Jeden obraz wejściowy: Generacja wideo z pierwszej klatki lub ostatniej klatki – Dwa obrazy wejściowe: Generacja wideo z pierwszej i ostatniej klatki |
| H3-Base-Ref2VA | Tryb omni-referencyjny | Obsługuje multimodalne wejścia referencyjne:
- Obrazy: ≤ 9 obrazów – Wideo: ≤ 3 klipy; każdy klip musi mieć długość 2–15 sekund; całkowity czas trwania ≤ 15 sekund – Dźwięk: ≤ 3 klipy; dźwięk musi być towarzyszony przez obraz lub wideo i nie może być używany jako jedyne wejście; każdy klip musi mieć długość 2–15 sekund; całkowity czas trwania ≤ 15 sekund – Mieszane wejścia: Maksymalna liczba plików we wszystkich typach wejść wynosi 12 | Cały system H3 składa się z następujących trzech modułów:
- H3-Context-IR: W miarę jak wejścia stają się coraz bardziej złożone, budujemy dedykowany system do głębokiego rozumienia i udoskonalania multimodalnych instrukcji wejściowych, a następnie przekształcamy je w formę, którą H3 może łatwo zrozumieć—Reprezentacja Pośrednia Kontekstowa—do generacji. H3-Context-IR jest kluczowe dla jakości końcowego wyjścia, dlatego zdecydowanie zalecamy włączenie go do swojego procesu generacji lub postępowanie zgodnie z „Wskazówkami dotyczącymi podpowiedzi”, aby zbudować własny system przetwarzania kontekstu.
- H3-Base: Generuje dźwięk i wideo na podstawie wyjścia H3-Context-IR, produkując wyniki w rozdzielczości 768p.
- H3-Regenerate-2K: Wprowadza wynik 768p razem z oryginalnym kontekstem z powrotem do H3, aby ponownie wygenerować wyjście w rozdzielczości 2K. Proces ten wykorzystuje zarówno potężne możliwości generacyjne H3, jak i bogate informacje zawarte w oryginalnym kontekście, co pozwala na uzyskanie wysokiej rozdzielczości z bardziej dokładnymi szczegółami i większą wiernością wizualną. H3-Context-IR to hostowany system wstępnego przetwarzania i orkiestracji zaprojektowany dla swobodnych multimodalnych wejść.
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.