Szczegóły modelu
Z.ai: GLM 5.2
Status: AktywnyW trendach Hugging FaceDostęp APIModel lokalny
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Rozmiar wag
- 1 506,7 GBdokładne metadane plików
- Skala modelu
- 753,3 mldparametrów · metadane Safetensors
- Okno kontekstu
- 1 048 576tokenów · dane modelu/API
- Modalność
- Tekst → tekst
- Format wag
- SafetensorsBF16
- Architektura
- Glm Moe Dsakonfiguracja modelu
- Aktywni eksperci
- 8na token · konfiguracja wariantu
- Główne zadanie
- Generowanie tekstu
- Biblioteka
- Transformers
Opis modelu
? Dołącz do naszej społeczności WeChat lub Discord. ? Sprawdź blog GLM-5.2 i raport techniczny GLM-5. ? Korzystaj z usług API GLM-5.2 na platformie API Z.ai. ? Wypróbuj GLM-5.2 tutaj.
Przedstawiamy GLM-5.2, nasz najnowszy flagowy model do zadań długoterminowych. Stanowi on znaczący skok w możliwościach zadań długoterminowych w porównaniu z poprzednikiem GLM-5.1 i po raz pierwszy dostarcza tę możliwość na solidnym kontekście 1M tokenów.
Nowe możliwości GLM-5.2 obejmują:
- Solidny kontekst 1M: Solidny kontekst 1M tokenów, który stabilnie utrzymuje długoterminową pracę
- Zaawansowane kodowanie z elastycznym wysiłkiem: Silniejsze możliwości kodowania z wieloma poziomami wysiłku myślenia, aby zrównoważyć wydajność i opóźnienia
- Ulepszona architektura: Proponujemy IndexShare, który ponownie używa tego samego indeksatora w co czwartej rzadkiej warstwie uwagi, redukując FLOPs na token o 2,9× przy długości kontekstu 1M. Ulepszamy również warstwę MTP GLM-5.2 do spekulacyjnego dekodowania, zwiększając długość akceptacji nawet o 20%
- Czysto otwarty: Licencja open-source MIT — bez ograniczeń regionalnych, dostęp techniczny bez granic
| Benchmark | GLM-5.2 | GLM-5.1 | Qwen3.7-Max | MiniMax M3 | DeepSeek-V4-Pro | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|---|---|
| Rozumowanie | ||||||||
| HLE | 40.5 | 31 | 41.4 | 37 | 37.7 | 49.8* | 41.4* | 45 |
| HLE (z narzędziami) | 54.7 | 52.3 | 53.5 | – | 48.2 | 57.9* | 52.2* | 51.4* |
| CritPt | 20.9 | 4.6 | 13.4 | 3.7 | 12.9 | 20.9 | 27.1 | 17.7 |
| AIME 2026 | 99.2 | 95.3 | 97 | – | 94.6 | 95.7 | 98.3 | 98.2 |
| HMMT Nov. 2025 | 94.4 | 94 | 95 | 84.4 | 94.4 | 96.5 | 96.5 | 94.8 |
| HMMT Feb. 2026 | 92.5 | 82.6 | 97.1 | 84.4 | 95.2 | 96.7 | 96.7 | 87.3 |
| IMOAnswerBench | 91.0 | 83.8 | 90 | – | 89.8 | 83.5 | – | 81 |
| GPQA-Diamond | 91.2 | 86.2 | 90 | 93 | 90.1 | 93.6 | 93.6 | 94.3 |
| Kodowanie | ||||||||
| SWE-bench Pro | 62.1 | 58.4 | 60.6 | 59 | 55.4 | 69.2 | 58.6 | 54.2 |
| NL2Repo | 48.9 | 42.7 | 47.2 | 42.1 | 35.5 | 69.7 | 50.7 | 33.4 |
| DeepSWE | 46.2 | 18 | 18 | 20 | 8 | 58 | 70 | 10 |
| ProgramBench | 63.7 | 50.9 | – | – | 47.8 | 71.9 | 70.8 | 39.5 |
| Terminal Bench 2.1 (Terminus-2) | 81.0 | 63.5 | 75 | 65 | 64 | 85 | 84 | 74 |
| Terminal Bench 2.1 (Najlepszy zgłoszony harness) | 82.7 | 69 | – | – | – | 78.9 | 83.4 | 70.7 |
| FrontierSWE (Dominance) | 74.4 | 30.5 | – | – | 29.0 | 75.1 | 72.6 | 39.6 |
| PostTrainBench | 34.3 | 20.1 | – | – | – | 37.2 | 28.4 | 21.6 |
| SWE-Marathon | 13.0 | 1.0 | – | – | – | 26.0 | 12.0 | 4.0 |
| Agentowe | ||||||||
| MCP-Atlas (Zbiór publiczny) | 76.8 | 71.8 | 76.4 | 74.2 | 73.6 | 77.8 | 75.3 | 69.2 |
| Tool-Decathlon | 48.2 | 40.7 | – | – | 52.8 | 59.9 | 55.6 | 48.8 |
GLM-5.2 obsługuje wdrożenie z następującymi frameworkami. Zachęcamy do wypróbowania:
- SGLang (v0.5.13.post1+) — zobacz cookbook
- vLLM (v0.23.0+) — zobacz przepisy
- Transformers (v0.5.12+) — zobacz dokumentację transformers
- KTransformers (v0.5.12+) — zobacz poradnik
- Unsloth (v0.1.47-beta+) — zobacz przewodnik
- Do wdrożenia na platformie
Ascend NPUobsługiwane są frameworki wnioskowania takie jak vLLM-Ascend, xLLM i SGLang — zobacz tutaj.
- Humanity’s Last Exam (HLE) i inne zadania rozumowania: Do oceny używamy parametrów próbkowania
temperature=1.0,top_p=0.95. Oceniamy z maksymalną długością generacji163 840tokenów. Domyślnie raportujemy podzbiór tylko tekstowy; wyniki oznaczone * pochodzą z pełnego zbioru. Dla AIME, HMMT i IMOAnswerBench oceniamy każde pytanie za pomocą następującego promptu systemowego:Your response should be in the following format:\nExplanation: {your explanation for your final answer}\nExact Answer: {your succinct, final answer}\nConfidence: {your confidence score between 0% and 100% for your answer}.Używamy GPT-5.5 (medium) jako modelu sędziego. Dla HLE z narzędziami używamy maksymalnej długości kontekstu 300 000 tokenów, bez strategii zarządzania kontekstem. - SWE-Bench Pro: Uruchamiamy zestaw SWE-Bench Pro z OpenHands przy użyciu dostosowanego promptu instrukcji. Ustawienia:
temperature=1,top_p=1,max_new_tokens=32k, z oknem kontekstu 400K. - NL2Repo: Oceniliśmy NL2Repo z
temperature=1.0,top_p=1.0imax_new_tokens=48kprzy kontekście 400k. Aby zapobiec nadużyciom, używamy oceny opartej na regułach i LLM, aby zapobiec złośliwym zachowaniom (np. nieautoryzowane operacje pip lub curl). - DeepSWE: Uruchamiamy DeepSWE z oficjalnym frameworkiem oceny pier i harnessem mini-swe-agent (
temperature=1.0,top_p=1.0,timeout=2h, kontekst 400K). Każde zadanie jest rozwiązywane w izolowanym kontenerze z 2 CPU, 8 GB RAM i bez dostępu do internetu. - ProgramBench: Oceniamy ProgramBench (200 instancji) z Claude-Code 2.1.156 przy użyciu
temperature=1.0, top_p=1.0, max_tokens=64000, max_turns=2000, sample_timeout=6h, reasoning_effort=max, z oknem kontekstu 400K. Każda instancja działa w piaskownicy (4 CPU, 8 GB RAM) z wyłączonym dostępem do internetu. - Terminal-Bench 2.1 (Terminus 2): Oceniamy Terminal-Bench 2.1 z frameworkiem Terminus-2 przy użyciu
parser=json,timeout=4h,temperature=1.0,top_p=1.0,max_new_tokens=48k,max_episodes=500, z oknem kontekstu 256K. Limity zasobów są ograniczone do 4 CPU i 8 GB RAM. - Terminal-Bench 2.1 (Claude Code): Oceniamy w Claude Code 2.1.167 z
temperature=1.0, top_p=0.95, max_new_tokens=131072. Zastępujemy maxnewtokens na 128k przez przezroczysty proxy, omijając limit CLI 64k, aby przywrócić konfigurowalnośćCLAUDE_CODE_MAX_OUTPUT_TOKENS. Usuwamy limity czasu rzeczywistego, zachowując ograniczenia CPU i pamięci na zadanie. Wyniki są uśrednione z 5 uruchomień. - MCP-Atlas: Wszystkie modele zostały ocenione w trybie myślenia na publicznym podzbiorze 500 zadań z limitem czasu 10 minut na zadanie. Używamy Gemini-3.0-Pro jako modelu sędziego do oceny.
- Tool-Decathlon: Korzystamy z oficjalnej usługi oceny i ustawiamy max_token na 128K.
- FrontierSWE: Ocena została przeprowadzona przez Proximal z długością kontekstu 1M, maksymalnym poziomem wysiłku i 128K maksymalnych tokenów wyjściowych. Wynik Dominance zgłoszony na dzień 2026/06/16.
- PostTrainBench: Ocena została przeprowadzona przez PostTrainBench z długością kontekstu 1M, maksymalnym poziomem wysiłku i 128K maksymalnych tokenów wyjściowych.
- SWE-Marathon: Ocena została przeprowadzona przez Abundant AI z długością kontekstu 1M, maksymalnym poziomem wysiłku i 128K maksymalnych tokenów wyjściowych.
Jeśli GLM-5.2 okaże się przydatny w Twoich badaniach, prosimy o cytowanie naszego raportu technicznego:
Warianty do uruchomienia
| Wariant | Format | Rozmiar wag | Źródło i weryfikacja |
|---|---|---|---|
753B · SAFETENSORSManifest plików (283)
| SAFETENSORS | 1 506,7 GB282 shardów | Hugging Face Hub Models APIWeryfikacja: 2026-08-09 |
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
| Dostawca API | Wejście / 1 mln tokenów | Wyjście / 1 mln tokenów | Pozostałe stawki źródłowe | Możliwości |
|---|---|---|---|---|
| OpenRouter | 4,42 zł / 1 mln tokenów | 13,89 zł / 1 mln tokenów | Cache odczyt: 0,821 zł / 1 mln tokenów | Kontekst providera: 262 144 · Maks. odpowiedź: 262 144 · Tokenizer: Other · Wejście: text · Wyjście: text · API: frequency_penalty, include_reasoning, logit_bias, logprobs, max_tokens · Bez moderacji providera |
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API. Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Dane porównywalne
Historia wyniku AI-TOP
Seria używa snapshotów głównego rankingu z metodologii 1.2.
Skala adaptacyjna: obserwowany zakres 74–80 pkt / 100.
- Wynik AI-TOP
| Data | Wynik AI-TOP | Miejsce | Dane źródłowe | Metodologia | Stan dnia |
|---|---|---|---|---|---|
| 2026-08-18 |
|
|
|
|
|
| 2026-08-17 |
|
|
|
|
|
| 2026-08-16 |
|
|
|
|
|
| 2026-08-15 |
|
|
|
|
|
| 2026-08-14 |
|
|
|
|
|
| 2026-08-13 |
|
|
|
|
|
| 2026-08-12 |
|
|
|
|
|
| 2026-08-11 |
|
|
|
|
|
| 2026-08-10 |
|
|
|
|
|
| 2026-08-09 |
|
| — |
|
|
| 2026-08-08 |
|
| — |
|
|
| 2026-08-07 |
|
|
|
|
|
| 2026-07-26 |
|
|
|
|
|
| 2026-07-25 |
|
|
|
|
|
| 2026-07-22 |
|
| — |
|
|
| 2026-07-21 | — | — |
| — |
|
| 2026-07-20 |
|
|
|
|
|
| 2026-07-19 |
|
|
|
|
|
| 2026-07-18 |
|
|
|
|
|
| 2026-07-17 | — | — |
| — |
|