Szczegóły modelu
K-EXAONE-2.0-750B-A37B
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Modalność
- Tekst → tekst
- Główne zadanie
- Generowanie tekstu
- Biblioteka
- Transformers
Opis modelu
Przedstawiamy K-EXAONE 2.0, model językowy na skalę graniczną, opracowany przez LG AI Research. K-EXAONE 2.0 został powiększony do ponad trzykrotności rozmiaru swojego poprzednika poprzez upcycling, a następnie ciągłe wstępne szkolenie, skoncentrowane na trudności szkolenie w trakcie oraz szkolenie po. K-EXAONE 2.0 jest szeroko konkurencyjny w porównaniu do wiodących modeli o otwartych wagach, wykazując znaczne poprawy w stosunku do swojego poprzednika i osiągając szczególnie silne wyniki w zakresie wyszukiwania długiego kontekstu i bezpieczeństwa.
- Skala klasy granicznej Aby zbudować model podstawowy na dużą skalę z inteligencją na poziomie granicznym, przeprowadziliśmy upcycling modelu K-EXAONE, rozszerzając zarówno jego głębokość, jak i szerokość, co skutkowało korzystniejszą krzywą skalowania. W trakcie tego procesu odkryliśmy, że ograniczenie po dwóch gałęziach SwiGLU skutecznie łagodzi eksplodujące aktywacje w głębszych warstwach, poprawiając zarówno stabilność szkolenia, jak i wnioskowania.
- Zaawansowane rozumowanie i inteligencja agentowa W odpowiedzi na rozwój agentowej AI, skoncentrowaliśmy się na rozszerzeniu możliwości modelu w zakresie rozumowania, agentowych przepływów pracy i zarządzania długim kontekstem. Dzięki starannej kalibracji danych szkoleniowych i przepisów, K-EXAONE 2.0 osiąga stałe poprawy w kodowaniu agentowym i rozumieniu długiego kontekstu, z silnymi wynikami w zakresie wyszukiwania długiego kontekstu i bezpieczeństwa.
- Wnioskowanie gotowe do produkcji Wspieramy dwie metody spekulacyjnego dekodowania, aby przyspieszyć wnioskowanie: MTP (Multi-Token Prediction) i DSpark. Obie metody mogą przyspieszyć generację modelu o około 3–5×, zmniejszając opóźnienia dla długoterminowych obciążeń roboczych, takich jak zadania agentowe.
- Wielojęzyczność i otwartość Rozszerzyliśmy wielojęzyczne pokrycie z sześciu do dziesięciu języków: koreańskiego, angielskiego, hiszpańskiego, niemieckiego, japońskiego, wietnamskiego, francuskiego, włoskiego, polskiego i portugalskiego. Udostępniamy również K-EXAONE 2.0 na licencji Apache 2.0, aby szerszy ekosystem AI mógł go badać, wdrażać i rozwijać. Liczba parametrów 750B Parametry aktywne 37B Wymiar ukryty 6,144 Rozmiar pośredni 18,432 Liczba warstw 78 (2 nagłówki gęste + 76 rzadkich) Główne warstwy 1 warstwy MTP Uwaga 1 x Global (NoPE) 1 x 4096 SWA 19 x [3 x 128 SWA + 1 x Global] Bloki Głowy uwagi 64 Q-heads / 8 KV-heads Wymiar głowy 128 Liczba ekspertów 1 wspólny ekspert 256 łącznie ekspertów 8 aktywowanych ekspertów Wymiar eksperta 2,048 Rozmiar słownika 153,600 Długość kontekstu 262,144 Termin wiedzy 2025 2Q Poniższa tabela pokazuje wyniki benchmarków dla modelu K-EXAONE 2.0 BF16. Szczegółowe wyniki oceny i konfiguracje można znaleźć w naszym raporcie technicznym. K-EXAONE 2.0 K-EXAONE Qwen3.5 GLM-5.1 DSV4 Pro (max) Architektura MoE MoE MoE MoE MoE Łączna liczba parametrów 750B 236B 397B 754B 1.6T Parametry aktywne 37B 23B 17B 40B 49B Wiedza o świecie MMLU-Pro 83.5 83.8 89.8 86.0 87.5 GPQA-Diamond 82.2 79.1 88.4 86.2 90.1 Ostatni egzamin ludzkości 18.3 13.6 28.7 31.0 37.7 Matematyka AIME 2026 92.3 92.2 91.3 95.3 95.2 HMMT luty 2026 78.4 80.7 84.6 82.6 95.2 IMO Odpowiedź 78.6 76.3 80.9 83.8 89.8 Kodowanie / Kodowanie agentowe SciCode 37.4 35.6 42.0 43.8 50.0 Zweryfikowane SWE Bench 68.2 49.4 76.4 73.6 80.6 Terminal-Bench 2.1 43.8 30.3 51.3 61.8 64.0 Użycie narzędzi agentowych τ3-Banking 14.2 14.2 13.4 11.5 25.8 Claw-Eval 77.7 70.3 79.7 84.4 82.7 Śledzenie instrukcji IFEval 92.4 89.7 92.6 93.9 94.0 IFBench 72.6 67.3 76.5 76.3 76.5 Zrozumienie długiego kontekstu OpenAI-MRCR 94.4 52.3 93.0 71.5 92.9 AA-LCR 56.2 53.5 65.7 62.3 66.3 Ko-LongBench 89.6 86.8 91.3 83.6 91.4 Koreański KMMLU-Pro 69.1 67.3 77.4 75.8 80.5 Kliknij 84.2 83.9 88.9 88.7 91.6 HRM8K-KSM 91.1 91.9 91.2 89.4 94.3 Wielojęzyczność MMMLU 86.6 86.2 90.6 89.7 89.6 GlobalMMLU-Lite 86.6 86.9 92.1 90.7 92.0 PolyMath 71.3 57.4 73.3 73.8 80.9 Bezpieczeństwo KGC-Safety 99.8 96.1 92.0 69.3 82.8 ROK-Fortress 89.5 60.9 86.1 73.2 47.6
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.