Przejdź do treści

Szczegóły modelu

GPT-X2.5-135M

Status: AktywnyW trendach Hugging Face

Dostawca: AxiomicLabs →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Modalność
Tekst → tekst
Główne zadanie
Generowanie tekstu
Biblioteka
Transformers

Opis modelu

GPT-X2.5-135M to ulepszony model generacji 2.5th z rodziny GPT-X, zbudowany na architekturze TX-3. 135M parametry, 75B tokeny, niestandardowy 32K tokenizer, 30 warstwy oraz nasza uwaga XGQA. Wytrenowany od podstaw na wieloźródłowym programie nauczania, osiągając wyniki bliskie stanu sztuki zarówno w benchmarkach języka naturalnego, jak i rozumowania matematycznego. GPT-X2.5-135M osiąga konkurencyjne wyniki w porównaniu do wiodących modeli, mimo użycia znacznie mniejszej ilości danych treningowych. Osiąga wskaźnik inteligencji 25.17 — w granicach 1.96 punktów od SmolLM2-135M, używając około 27× mniej tokenów treningowych. Wyniki benchmarków i metodologia wskaźnika inteligencji są zgodne z Open SLM Leaderboard. Obliczenia treningowe szacuje się na 6 × parametry × tokeny treningowe.

RangaOrganizacjaModelParametryHellaSwagARC-EasyARC-ChallengePIQAArithMark-3Indeks IntTokeny treningowe
1HuggingFaceSmolLM2-135M135M43.22%58.63%29.69%68.44%39.20%27.132T
2HuggingFaceSmolLM-135M135M42.70%56.31%29.01%68.28%36.80%25.74600B
3Axiomic LabsGPT-X2.5-135M135M40.57%51.81%29.18%69.42%38.40%25.1775B
4FacebookMobileLLM-R1-140M-base140M33.84%49.92%24.74%63.22%65.70%24.644.2T
5Axiomic LabsGPT-X2-125M125M40.41%51.47%27.82%67.30%37.20%23.3675B
6BananaMindBananaMind-2-Pro-Preview139M39.83%51.01%27.13%66.76%38.90%23.0452B
7Axiomic LabsGPT-X-125M125M36.57%50.76%26.62%64.96%35.60%19.9415B
8SupraLabsSupra2-100M-Base100.7M35.98%47.81%24.83%65.40%36.90%19.4130B
9FacebookOPT-125M125M31.31%40.28%22.70%62.24%35.20%13.80180B
10OpenAIGPT-2 (124M)124M31.26%39.35%22.35%62.08%35.70%13.5810B

Wskaźnik inteligencji normalizuje szansę HellaSwag, łączony ARC, PIQA i ArithMark-3, a następnie stosuje wagi 1.00, 1.00, 1.00 i 0.65 odpowiednio. Model osiąga również ogólny elo 1104 na Bananamind-Base-Bench-1.1 i można go zobaczyć na liście liderów BananaMindBench.

ZmianaGPT-X2GPT-X2.5Dlaczego
Parametry125.08M135.03MWiększa pojemność skoncentrowana w warstwach feed-forward
Szerokość feed-forward1,5361,728Rozszerza każdy SwiGLU MLP z 2.67x do 3x w 576-szerokim strumieniu resztkowym
Długość kontekstu1,0248,192Trening zaczyna się od 2K kontekstu i wydłuża się do 8K po 60B tokenach
Udoskonalenie uwagiQK-NormXSA projekcja; brak QK-NormProjekty z komponentu każdego wyjścia głowy uwagi równolegle do wektora wartości bieżącego tokena
Skalowanie osadzeniaMnożenie przez sqrt(576)BrakPasuje do formuły używanej w biegu treningowym XSA
Tokenizer32,768-token niestandardowy BPE32,770 tokeny (32K BPE + ChatML start/end)Dodaje natywne tokeny granicy czatu bez zastępowania podstawowego tokenizera
Dane treningowe75B tokenów, 4-źródłowy program nauczania75B tokenów, rozszerzony 11-źródłowy program nauczaniaDodaje Cosmopedia, SmolTalk i cztery podzbiory FinePhrase do oryginalnej mieszankiKomponentSzczegóły
Kodowanie pozycjiRoPE (theta=100,000)
NormalizacjaRMSNorm (float32 upcast)
Feed-forwardSwiGLU (3-macierz bramkowana MLP, 1,728 średnia szerokość, 3x stosunek)
UwagaXGQA — 9Q / 3KV (3:1)
Udoskonalenie uwagiXSA projekcja; brak QK-Norm
BiasBrak (wszystkie warstwy bez biasu)
OsadzenieTying wag, bez skalowania osadzenia
Głębokość30 warstwy x 576 ukryte
Maksymalny kontekstWytrenowany do 8,192 tokenów

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON