Przejdź do treści

Szczegóły modelu

Instella-MoE-16B-A3B-Think

Status: AktywnyW trendach Hugging Face

Dostawca: amd →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Modalność
Tekst → tekst
Główne zadanie
Generowanie tekstu
Biblioteka
Transformers

Opis modelu

Instella-MoE✨: W pełni otwarty, nowoczesny model językowy Mixture-of-Experts Instella-MoE to nowoczesny, w pełni otwarty model językowy Mixture-of-Experts (MoE) z 16 miliardem całkowitych parametrów i 2.8 miliardami aktywnych parametrów, wytrenowany od podstaw od pre-treningu do RL. Wytrenowany od podstaw na GPU AMD Instinct™ MI300X i MI325X przy użyciu frameworka Primus firmy AMD, Instella-MoE łączy rzadko aktywowany projekt MoE z innowacjami architektonicznymi, takimi jak Gated Multi-head Latent Attention (Gated MLA) i FarSkip-Collective. Rysunek 1: Wydajność modelu Instella-MoE przed i po treningu w porównaniu z innymi modelami nowoczesnymi o podobnej wielkości. – Instella-MoE to nowy, nowoczesny, w pełni otwarty model językowy Mixture-of-Experts opracowany przez AMD, z 16 miliardami całkowitych parametrów i 2.8 miliardami aktywnych parametrów na token, wytrenowany od podstaw na GPU AMD Instinct™ MI300X i MI325X.

  • Wydanie punktu kontrolnego modelu Instella-MoE obejmuje każdy etap procesu treningu modelu, w tym pre-trening, mid-training, rozszerzenie kontekstu długiego, SFT, DPO i RL.
  • Całkowicie zbudowany na stosie oprogramowania AMD ROCm™ na bazie frameworków treningowych Primus i Miles RL, Instella-MoE wprowadza nowoczesną architekturę i innowacje systemowe — w tym Gated Multi-head Latent Attention (Gated MLA) oraz ekstremalne nakładanie się komunikacji i obliczeń dzięki FarSkip-Collective — dla efektywnego treningu i wnioskowania na dużą skalę na sprzęcie AMD.
  • W pełni otwarty i dostępny: udostępniamy nasz kompletny przepis na trening we wszystkich etapach treningu, w tym frameworki treningowe, mieszanki danych, punkty kontrolne pośrednie i kod wnioskowania. Wydanie obejmuje punkty kontrolne z następujących etapów procesu treningowego Instella-MoE, jak pokazano w tabeli 1 poniżej:
ModelEtapOpis
Instella-MoE-16B-A3B-Pretrain (Link)Pre-treningModel bazowy MoE wytrenowany od podstaw na dużym i zróżnicowanym korpusie treningowym.
Instella-MoE-16B-A3B-Midtrain (Link)Mid-trainingModel wstępnie wytrenowany, dalej trenowany na wysokiej jakości mieszankach danych w celu udoskonalenia kluczowych możliwości.
Instella-MoE-16B-A3B-Base (Link)Długi kontekstTrening długiego kontekstu w celu rozszerzenia zdolności modelu do przetwarzania i rozumienia dłuższych sekwencji. Używamy tego jako naszego ostatecznego punktu kontrolnego bazowego.
Instella-MoE-16B-A3B-SFT (Link)SFTPunkt kontrolny bazowy rozszerzony poprzez nadzorowane dostrajanie (SFT) w celu umożliwienia podążania za instrukcjami i rozumowania w łańcuchu myślowym.
Instella-MoE-16B-A3B-DPO (Link)DPOOptymalizacja preferencji bezpośrednich (DPO) na danych preferencji kontrastowych w celu poprawy wydajności modelu.
Instella-MoE-16B-A3B-Think (Link)RLOstateczny punkt kontrolny myślenia, udoskonalony za pomocą uczenia przez wzmocnienie (RL), aby dodatkowo wzmocnić podążanie za instrukcjami i ogólną jakość odpowiedzi.

| Tabela 1: modele Instella-MoE-16B-A3B i etapy treningu.

ParametrWartość
Całkowite parametry16B
Aktywne parametry na token2.8B
Warstwy dekodera27
Rozmiar ukryty2048
Głowy uwagi16
Liczba ekspertów64
Wspólni eksperci2
Aktywowani eksperci na token6
Rozmiar słownika128,896
UwagaGated Multi-head Latent Attention (Gated MLA)
Łączność MoEFarSkip-Collective

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON