Szczegóły modelu
GPT-X2.5-135M
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Modalność
- Tekst → tekst
- Główne zadanie
- Generowanie tekstu
- Biblioteka
- Transformers
Opis modelu
GPT-X2.5-135M to ulepszony model generacji 2.5th z rodziny GPT-X, zbudowany na architekturze TX-3. 135M parametry, 75B tokeny, niestandardowy 32K tokenizer, 30 warstwy oraz nasza uwaga XGQA. Wytrenowany od podstaw na wieloźródłowym programie nauczania, osiągając wyniki bliskie stanu sztuki zarówno w benchmarkach języka naturalnego, jak i rozumowania matematycznego. GPT-X2.5-135M osiąga konkurencyjne wyniki w porównaniu do wiodących modeli, mimo użycia znacznie mniejszej ilości danych treningowych. Osiąga wskaźnik inteligencji 25.17 — w granicach 1.96 punktów od SmolLM2-135M, używając około 27× mniej tokenów treningowych. Wyniki benchmarków i metodologia wskaźnika inteligencji są zgodne z Open SLM Leaderboard. Obliczenia treningowe szacuje się na 6 × parametry × tokeny treningowe.
| Ranga | Organizacja | Model | Parametry | HellaSwag | ARC-Easy | ARC-Challenge | PIQA | ArithMark-3 | Indeks Int | Tokeny treningowe |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | HuggingFace | SmolLM2-135M | 135M | 43.22% | 58.63% | 29.69% | 68.44% | 39.20% | 27.13 | 2T |
| 2 | HuggingFace | SmolLM-135M | 135M | 42.70% | 56.31% | 29.01% | 68.28% | 36.80% | 25.74 | 600B |
| 3 | Axiomic Labs | GPT-X2.5-135M | 135M | 40.57% | 51.81% | 29.18% | 69.42% | 38.40% | 25.17 | 75B |
| 4 | MobileLLM-R1-140M-base | 140M | 33.84% | 49.92% | 24.74% | 63.22% | 65.70% | 24.64 | 4.2T | |
| 5 | Axiomic Labs | GPT-X2-125M | 125M | 40.41% | 51.47% | 27.82% | 67.30% | 37.20% | 23.36 | 75B |
| 6 | BananaMind | BananaMind-2-Pro-Preview | 139M | 39.83% | 51.01% | 27.13% | 66.76% | 38.90% | 23.04 | 52B |
| 7 | Axiomic Labs | GPT-X-125M | 125M | 36.57% | 50.76% | 26.62% | 64.96% | 35.60% | 19.94 | 15B |
| 8 | SupraLabs | Supra2-100M-Base | 100.7M | 35.98% | 47.81% | 24.83% | 65.40% | 36.90% | 19.41 | 30B |
| 9 | OPT-125M | 125M | 31.31% | 40.28% | 22.70% | 62.24% | 35.20% | 13.80 | 180B | |
| 10 | OpenAI | GPT-2 (124M) | 124M | 31.26% | 39.35% | 22.35% | 62.08% | 35.70% | 13.58 | 10B |
Wskaźnik inteligencji normalizuje szansę HellaSwag, łączony ARC, PIQA i ArithMark-3, a następnie stosuje wagi 1.00, 1.00, 1.00 i 0.65 odpowiednio. Model osiąga również ogólny elo 1104 na Bananamind-Base-Bench-1.1 i można go zobaczyć na liście liderów BananaMindBench.
| Zmiana | GPT-X2 | GPT-X2.5 | Dlaczego |
|---|---|---|---|
| Parametry | 125.08M | 135.03M | Większa pojemność skoncentrowana w warstwach feed-forward |
| Szerokość feed-forward | 1,536 | 1,728 | Rozszerza każdy SwiGLU MLP z 2.67x do 3x w 576-szerokim strumieniu resztkowym |
| Długość kontekstu | 1,024 | 8,192 | Trening zaczyna się od 2K kontekstu i wydłuża się do 8K po 60B tokenach |
| Udoskonalenie uwagi | QK-Norm | XSA projekcja; brak QK-Norm | Projekty z komponentu każdego wyjścia głowy uwagi równolegle do wektora wartości bieżącego tokena |
| Skalowanie osadzenia | Mnożenie przez sqrt(576) | Brak | Pasuje do formuły używanej w biegu treningowym XSA |
| Tokenizer | 32,768-token niestandardowy BPE | 32,770 tokeny (32K BPE + ChatML start/end) | Dodaje natywne tokeny granicy czatu bez zastępowania podstawowego tokenizera |
| Dane treningowe | 75B tokenów, 4-źródłowy program nauczania | 75B tokenów, rozszerzony 11-źródłowy program nauczania | Dodaje Cosmopedia, SmolTalk i cztery podzbiory FinePhrase do oryginalnej mieszanki | Komponent | Szczegóły | |
|---|---|---|---|---|---|---|
| Kodowanie pozycji | RoPE (theta=100,000) | |||||
| Normalizacja | RMSNorm (float32 upcast) | |||||
| Feed-forward | SwiGLU (3-macierz bramkowana MLP, 1,728 średnia szerokość, 3x stosunek) | |||||
| Uwaga | XGQA — 9Q / 3KV (3:1) | |||||
| Udoskonalenie uwagi | XSA projekcja; brak QK-Norm | |||||
| Bias | Brak (wszystkie warstwy bez biasu) | |||||
| Osadzenie | Tying wag, bez skalowania osadzenia | |||||
| Głębokość | 30 warstwy x 576 ukryte | |||||
| Maksymalny kontekst | Wytrenowany do 8,192 tokenów |
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.