Szczegóły modelu
Instella-MoE-16B-A3B-Think
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Modalność
- Tekst → tekst
- Główne zadanie
- Generowanie tekstu
- Biblioteka
- Transformers
Opis modelu
Instella-MoE✨: W pełni otwarty, nowoczesny model językowy Mixture-of-Experts Instella-MoE to nowoczesny, w pełni otwarty model językowy Mixture-of-Experts (MoE) z 16 miliardem całkowitych parametrów i 2.8 miliardami aktywnych parametrów, wytrenowany od podstaw od pre-treningu do RL. Wytrenowany od podstaw na GPU AMD Instinct™ MI300X i MI325X przy użyciu frameworka Primus firmy AMD, Instella-MoE łączy rzadko aktywowany projekt MoE z innowacjami architektonicznymi, takimi jak Gated Multi-head Latent Attention (Gated MLA) i FarSkip-Collective. Rysunek 1: Wydajność modelu Instella-MoE przed i po treningu w porównaniu z innymi modelami nowoczesnymi o podobnej wielkości. – Instella-MoE to nowy, nowoczesny, w pełni otwarty model językowy Mixture-of-Experts opracowany przez AMD, z 16 miliardami całkowitych parametrów i 2.8 miliardami aktywnych parametrów na token, wytrenowany od podstaw na GPU AMD Instinct™ MI300X i MI325X.
- Wydanie punktu kontrolnego modelu Instella-MoE obejmuje każdy etap procesu treningu modelu, w tym pre-trening, mid-training, rozszerzenie kontekstu długiego, SFT, DPO i RL.
- Całkowicie zbudowany na stosie oprogramowania AMD ROCm™ na bazie frameworków treningowych Primus i Miles RL, Instella-MoE wprowadza nowoczesną architekturę i innowacje systemowe — w tym Gated Multi-head Latent Attention (Gated MLA) oraz ekstremalne nakładanie się komunikacji i obliczeń dzięki FarSkip-Collective — dla efektywnego treningu i wnioskowania na dużą skalę na sprzęcie AMD.
- W pełni otwarty i dostępny: udostępniamy nasz kompletny przepis na trening we wszystkich etapach treningu, w tym frameworki treningowe, mieszanki danych, punkty kontrolne pośrednie i kod wnioskowania. Wydanie obejmuje punkty kontrolne z następujących etapów procesu treningowego Instella-MoE, jak pokazano w tabeli 1 poniżej:
| Model | Etap | Opis |
|---|---|---|
| Instella-MoE-16B-A3B-Pretrain (Link) | Pre-trening | Model bazowy MoE wytrenowany od podstaw na dużym i zróżnicowanym korpusie treningowym. |
| Instella-MoE-16B-A3B-Midtrain (Link) | Mid-training | Model wstępnie wytrenowany, dalej trenowany na wysokiej jakości mieszankach danych w celu udoskonalenia kluczowych możliwości. |
| Instella-MoE-16B-A3B-Base (Link) | Długi kontekst | Trening długiego kontekstu w celu rozszerzenia zdolności modelu do przetwarzania i rozumienia dłuższych sekwencji. Używamy tego jako naszego ostatecznego punktu kontrolnego bazowego. |
| Instella-MoE-16B-A3B-SFT (Link) | SFT | Punkt kontrolny bazowy rozszerzony poprzez nadzorowane dostrajanie (SFT) w celu umożliwienia podążania za instrukcjami i rozumowania w łańcuchu myślowym. |
| Instella-MoE-16B-A3B-DPO (Link) | DPO | Optymalizacja preferencji bezpośrednich (DPO) na danych preferencji kontrastowych w celu poprawy wydajności modelu. |
| Instella-MoE-16B-A3B-Think (Link) | RL | Ostateczny punkt kontrolny myślenia, udoskonalony za pomocą uczenia przez wzmocnienie (RL), aby dodatkowo wzmocnić podążanie za instrukcjami i ogólną jakość odpowiedzi. |
| Tabela 1: modele Instella-MoE-16B-A3B i etapy treningu.
| Parametr | Wartość |
|---|---|
| Całkowite parametry | 16B |
| Aktywne parametry na token | 2.8B |
| Warstwy dekodera | 27 |
| Rozmiar ukryty | 2048 |
| Głowy uwagi | 16 |
| Liczba ekspertów | 64 |
| Wspólni eksperci | 2 |
| Aktywowani eksperci na token | 6 |
| Rozmiar słownika | 128,896 |
| Uwaga | Gated Multi-head Latent Attention (Gated MLA) |
| Łączność MoE | FarSkip-Collective |
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.