Szczegóły modelu
MoonshotAI: Kimi K3
Status: AktywnyDostęp APIModel lokalny
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Rozmiar wag
- 1 560,9 GBdokładne metadane plików
- Skala modelu
- 2 779,9 mldparametrów · metadane Safetensors
- Okno kontekstu
- 1 048 576tokenów · dane modelu/API
- Modalność
- Tekst + obraz → tekst
- Format wag
- SafetensorsBF16
- Architektura
- Kimi K3konfiguracja modelu
- Główne zadanie
- Obraz i tekst → tekst
- Biblioteka
- Transformers
Opis modelu
? Blog technologiczny | ? Pełny raport Kimi K3 to model agentowy o otwartej wadze i natywnej multimodalności, a także nasz najbardziej zaawansowany model do tej pory. Jest to model o 2.8T parametrach, zbudowany na Kimi Delta Attention (KDA) i Attention Residuals (AttnRes), z natywnymi możliwościami wizualnymi i oknem kontekstowym o 1 milionach tokenów. Jest to pierwszy na świecie otwarty model klasy 3T, zaprojektowany do inteligencji na granicy w zakresie długoterminowego kodowania, pracy z wiedzą i rozumowania. Kluczowe cechy
- Nowa architektura: Kimi K3 oparty jest na Kimi Delta Attention (KDA) i Attention Residuals (AttnRes), a także zwiększa rzadkość MoE w ramach stabilnej struktury LatentMoE, która aktywuje 16 z 896 ekspertów — co daje około 2.5× poprawy w ogólnej efektywności skalowania w porównaniu do Kimi K2.
- Długoterminowe kodowanie: Działając przy minimalnym nadzorze ludzkim, Kimi K3 utrzymuje długie sesje inżynieryjne, nawigując po ogromnych repozytoriach i orkiestrując narzędzia terminalowe — od optymalizacji rdzeni GPU i rozwoju kompilatorów po rozwój gier z wizją w pętli, CAD, a nawet projektowanie chipów.
- Agentowa praca z wiedzą: Kimi K3 rozwija pracę z wiedzą end-to-end, produkując głębokie badania z interaktywnymi wizualizacjami, widgetami i pulpitami nawigacyjnymi oraz projektowaniem ruchu i edytowaniem wideo, napędzany przez swoją natywną architekturę multimodalną.
- Natywna multimodalność i długi kontekst: Kimi K3 rozumie tekst, obrazy i wideo w tym samym modelu i wspiera okno kontekstowe o 1 milionach tokenów.
- Otwarte wagi graniczne: Udostępniamy pełne wagi modelu Kimi K3 na licencji Kimi K3, udostępniając inteligencję na granicy do badań, wdrożeń i dalszej innowacji.
- Podsumowanie modelu Architektura
Mieszanka ekspertów (MoE) Całkowita liczba parametrów 2.8T Aktywowane parametry 104B Liczba warstw 93 Liczba warstw gęstych 1 Kompozycja warstwy uwagi 69 KDA + 24 Gated MLA Wymiar ukryty uwagi 7168 Liczba głów uwagi 96 Wymiar latentnego MoE 3584 Wymiar ukryty MoE (na eksperta) 3072 Liczba ekspertów 896 Wybrane eksperci na token 16 Liczba wspólnych ekspertów 2 Rozmiar słownika 160K Długość kontekstu 1048576 Mechanizm uwagi KDA & Gated MLA Funkcja aktywacji SiTU-GLU Kodowanie wizji MoonViT-V2 Parametry kodera wizji 401M Kwantyzacja MXFP4 wagi / MXFP8 aktywacje (szkolenie z uwzględnieniem kwantyzacji) Modalność Tekst, Obraz Benchmark Kimi K3(max) Claude Fable 5(max, z fallbackiem) GPT-5.6 Sol(max) Claude Opus 4.8(max) GPT-5.5(xhigh) GLM-5.2(max) Rozumowanie i wiedza GPQA Diamond 93.5 92.6 94.1 91.0 93.5 91.2 CritPt 23.4 28.6 32.3 20.9 27.1 20.9 AA-LCR 74.7 70.0 73.7 67.7 74.3 71.3 HLE-Full 43.5 / 56.0 53.3 / 63.0 44.5 / 58.0 49.8 / 57.9 41.4 / 52.2 — Kodowanie DeepSWE 67.5 70.0 73.0 59.0 67.0 46.2 ProgramBench 77.8 76.8 77.6 71.9 70.8 63.7 Terminal-Bench 2.1 88.3 88.0 88.8 84.6 83.4 82.7 FrontierSWE 81.2 86.6 71.3 66.7 64.9 67.3 SWE-Marathon 42.0 35.0 39.0 40.0 14.0 13.0 PostTrainBench 36.6 41.4 34.6 34.1 28.4 34.3 MLS-Bench-Lite 48.3 49.9 46.2 42.8 35.5 40.4 SciCode 58.7 60.2 56.1 53.5 56.1 50.5 Kimi Code Bench 2.0 72.9 76.9 64.8 71.7 69.0 64.2 Agentowy BrowseComp 91.2 88.0 90.4 84.3 84.4 — DeepSearchQA (F1) 95.0 94.2 — 93.1 — — ResearchRubrics 76.2 — 73.8 73.5 64.0 71.1 GDPval-AA v2 (Elo) 1686 1747 1736 1593 1491 1510 Toolathlon-Verified 76.5 77.9 74.9 76.2 73.5 59.9 MCPMark-Verified 94.5 87.4 92.9 76.4 92.9 — MCP-Atlas 84.2 84.7 83.6 83.6 82.8 82.6 AutomationBench 30.8 29.1 29.7 27.2 22.7 12.9 JobBench 54.3 57.4 45.4 48.4 38.3 43.4 AA-Briefcase (Elo) 1548 1583 1495 1354 1158 1260 Ostatni egzamin agentów 28.3 25.7† 29.6 27.0 26.6 20.4 APEX-Agents 41.0 43.3 39.9 39.4 38.5 35.6 OfficeQA Pro 63.3 69.9 63.2 63.9 60.9 41.4 SpreadsheetBench 2 34.8 34.7 32.4 31.6 29.1 28.1 OSWorld-Verified 84.8 85.0 83.0 83.4 79.0 — OSWorld 2.0 58.3 66.1 62.6 55.7 49.5 — SaaS-Bench 60.1 — 61.4 56.1 43.8 — τ³-Banking 33.4 26.8 33.0 27.6 31.3 26.8 Harvey Lab-AA 94.6 93.6 87.2 91.1 86.3 91.0 CorpFin v2 71.6 71.8 64.4 66.7 68.4 66.1 Finance Agent v2 54.4 56.3 53.8 53.9 51.8 49.7 Legal Research Bench 44.2 49.5 48.1 43.8 40.4 31.3 Wizja WorldVQA ForceAnswer 51.0 56.7 41.8 39.1 38.5 — OmniDocBench 91.1 89.8 85.8 87.9 89.4 — PerceptionBench 58.5 57.2 59.7 47.2 55.8 — Video-MME (z napisami) 90.0 — 89.5 86.0 89.3 — MMVU 82.1 — 81.2 79.2 81.7 — BabyVision z pythonem 85.7 90.5 88.9 81.2 83.6 — MMMU-Pro 81.6 / 83.4 81.2 / 86.5 83.0 / 84.6 78.9 / 82.7 81.2 / 83.2 — CharXiv (RQ) 84.8 / 91.3 88.9 / 93.5 84.6 / 89.1 80.5 / 89.9 84.1 / 89.0 — MathVision 94.3 / 97.8 94.8 / 98.6 95.8 / 97.8 86.7 / 97.1 92.2 / 96.8 — ZeroBench (pass@5) 23.0 / 41.0 23.0 / 46.0 17.0 / 35.0 17.0 / 34.0 22.0 / 41.0 — Wszystkie wyniki Kimi K3 uzyskano przy ustawieniu wysiłku rozumowania na 'max' i temperaturze = 1.0. Dla zadań jednowarstwowych, takich jak GPQA Diamond, HLE-Full i benchmarki wizji bez narzędzi, ustawiamy top-p = 0.95; dla zadań agentowych ustawiamy top-p = 1.0. Dla HLE-Full, MMMU-Pro, CharXiv (RQ), MathVision i ZeroBench, każda komórka raportuje wyniki bez i z augmentacją narzędzi (ogólne narzędzia dla HLE-Full, Python dla benchmarków wizji), w tej kolejności. 1. Benchmarki rozumowania i wiedzy
- CritPt i AA-LCR. Wyniki są cytowane z Artificial Analysis z lipca 23, 2026.
- Benchmarki kodowania
- DeepSWE. Kimi K3 jest oceniane za pomocą zestawu Kimi Code. Wynik GLM-5.2 pochodzi z bloga wydania GLM-5.2; wszystkie pozostałe wyniki pochodzą z oficjalnej tabeli liderów DeepSWE, pod którą Kimi K3 osiąga 67.3 za pomocą zestawu mini-SWE-agent. Raportujemy zadania DeepSWE v1.1.
- Terminal-Bench 2.1. Kimi K3 jest oceniane za pomocą zestawu Kimi Code. Dla wszystkich innych modeli raportujemy najlepszy wynik wśród zestawów: GLM-5.2 z Claude Code (blog wydania GLM-5.2); Claude Opus 4.8 i Claude Fable 5 z Terminus 2 (Artificial Analysis); GPT-5.5 i GPT-5.6 Sol z Codex (OpenAI).
- ProgramBench. Kimi K3 jest oceniane za pomocą zestawu Kimi Code. Wynik GLM-5.2 pochodzi z bloga wydania GLM-5.2; wszystkie inne wyniki pochodzą z Vals AI.
- SWE-Marathon. Kimi K3, Claude Opus 4.8 i Claude Fable 5 są oceniane za pomocą zestawu Claude Code; GPT-5.6 Sol jest oceniane za pomocą zestawu Codex. Wynik GLM-5.2 pochodzi z bloga wydania GLM-5.2. Nasza ocena opiera się na kalibrowanej gałęzi oficjalnych zadań H20 z lipca 9, 2026, przed ostatecznym wydaniem v1.1: obrazy Docker, bramy wydajności i referencyjne orakle dla zadań GPU zostały przeskalibrowane dla H20, podczas gdy walidatory poprawności i anty-oszustwa pozostają niezmienione. Dodatkowo, Claude Fable 5 osiągnął fallbacki w 35% zadań w naszej ocenie, co mogło negatywnie wpłynąć na jego zmierzoną wydajność.
- FrontierSWE. Kimi K3 jest oceniane za pomocą zestawu Kimi Code, a GPT-5.6 Sol za pomocą zestawu Codex; wszystkie inne wyniki pochodzą z FrontierSWE. Wyniki dominacji są przeliczane z surowych wyników za pomocą oficjalnego skryptu oceny i są aktualne na lipiec 16, 2026.
- PostTrainBench. Wyniki dla GLM-5.2, GPT-5.5 i Claude Opus 4.8 są przyjęte z oficjalnych wyników PostTrainBench. Kimi K3, Claude Fable 5 i GPT-5.6 Sol są oceniane za pomocą oficjalnej implementacji Harbor przy maksymalnym wysiłku rozumowania, uśrednionym na trzech uruchomieniach na GPU H20 (zamiast H100 w oficjalnym ustawieniu) — Kimi K3 i Claude Fable 5 z zestawem Claude Code, a GPT-5.6 Sol z zestawem Codex.
- MLS-Bench-Lite. Kimi K3 jest oceniane za pomocą zestawu Kimi Code; GLM-5.2 i modele Claude z zestawem Claude Code; GPT-5.5 i GPT-5.6 Sol z zestawem Codex.
- SciCode. Wyniki są cytowane z Artificial Analysis z lipca 23, 2026.
- Kimi Code Bench 2.0 (wewnętrzny). Kimi K3 jest oceniane za pomocą zestawu Kimi Code (osiąga 73.7 z zestawem Claude Code); GLM-5.2, Claude Opus 4.8 i Claude Fable 5 z zestawem Claude Code; GPT-5.5 i GPT-5.6 Sol z zestawem Codex. Wszystkie modele są oceniane przy maksymalnym wysiłku rozumowania, z wyjątkiem GPT-5.5, który używa ustawienia "xhigh". Ponieważ benchmark obejmuje zadania związane z cyberbezpieczeństwem i bezpieczeństwem, ujawniamy również ułamek zadań odrzuconych lub z fallbackiem: Claude Fable 5 osiągnął 13 fallbacki i 1 odmowy z 80 zadań; 10 odmowy z 80 zadań wprowadzonych do cyber straży GPT-5.6 Sol; GPT-5.5 miało 3 odmowy z 80 zadań.
- Benchmarki agentowe
- OfficeQA Pro. Każdy przypadek testowy dostarcza agentowi cały zbiór PDF, z wszystkimi PDF-ami renderowanymi jako obrazy i bez dostępnego tekstu maszynowego.
- OfficeQA Pro i SpreadsheetBench 2. Kimi K3, GLM-5.2, Claude Opus 4.8 i Claude Fable 5 są oceniane za pomocą zestawu Claude Code; GPT-5.5 i GPT-5.6 Sol są oceniane za pomocą zestawu Codex.
- MCP-Atlas. Wszystkie modele są oceniane na publicznym podzbiorze zadań 500 z limitem 100 tur, używając Gemini 3.1 Pro jako sędziego.
- AutomationBench. Wszystkie modele są oceniane na publicznym podzbiorze zadań 600, zgodnie z oficjalnym ustawieniem GitHub w innych aspektach.
- BrowseComp. Przyjmujemy strategię kompresji kontekstu wyzwalaną przy 300K tokenach. Gdy oceniane są z pełnym oknem kontekstowym o 1M tokenach i bez zarządzania kontekstem, Kimi K3 osiąga wynik 90.4. Wyniki Claude Fable 5, Claude Opus 4.8, GPT-5.6 Sol i GPT-5.5 są cytowane z Anthropic i OpenAI.
- GDPval-AA v2, AA-Briefcase, τ³-Banking, Harvey Lab-AA i APEX-Agents. Wyniki są cytowane z Artificial Analysis i tabeli liderów APEX-Agents z lipca 23, 2026. Dla Harvey Lab-AA raportujemy wskaźnik przejścia kryteriów.
- CorpFin v2, Finance Agent v2 i Legal Research Bench. Wyniki są cytowane z Vals AI.
- Ostatni egzamin agentów. Wyniki są cytowane z oficjalnej tabeli liderów z lipca 23, 2026; raportujemy główny wskaźnik przejścia tabeli liderów. Na tabeli liderów każdy model jest sparowany z określonym zestawem: Kimi K3 z Kimi Code; GPT-5.6 Sol i GPT-5.5 z Codex; Claude Fable 5, Claude Opus 4.8 i GLM-5.2 z zestawem Claude Code. † Wpis Claude Fable 5 działa przy wysiłku xhigh z 40% zadań oznaczonych jako obniżone.
- Benchmarki multimodalne
- Z wyjątkiem ZeroBench, który podąża za oficjalnym ustawieniem i jest uruchamiany pięć razy, wszystkie wyniki multimodalne są uśredniane na trzech uruchomieniach. MMMU-Pro jest oceniane zgodnie z oficjalnym protokołem, zachowując oryginalną kolejność wejściową i dodając obrazy do wejścia tekstowego.
- PerceptionBench to wewnętrzny benchmark, który koncentruje się na atomowych zdolnościach percepcyjnych wizualnych. Kimi K3 stosuje szkolenie z uwzględnieniem kwantyzacji od etapu SFT, używając wag MXFP4 z aktywacjami MXFP8 dla szerokiej kompatybilności sprzętowej.
Warianty do uruchomienia
| Wariant | Format | Rozmiar wag | Źródło i weryfikacja |
|---|---|---|---|
2 780B · SAFETENSORSManifest plików (97)
| SAFETENSORS | 1 560,9 GB96 shardów | Hugging Face Hub Models APIWeryfikacja: 2026-08-09 |
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
| Dostawca API | Wejście / 1 mln tokenów | Wyjście / 1 mln tokenów | Pozostałe stawki źródłowe | Możliwości |
|---|---|---|---|---|
| OpenRouter | 11,14 zł / 1 mln tokenów | 55,71 zł / 1 mln tokenów | Cache odczyt: 1,11 zł / 1 mln tokenów | Kontekst providera: 1 048 576 · Tokenizer: Other · Wejście: text, image · Wyjście: text · API: frequency_penalty, include_reasoning, logit_bias, logprobs, max_tokens · Bez moderacji providera |
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API. Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Dane porównywalne
Historia wyniku AI-TOP
Seria używa snapshotów głównego rankingu z metodologii 1.2.
Skala adaptacyjna: obserwowany zakres 60–75 pkt / 100.
- Wynik AI-TOP
| Data | Wynik AI-TOP | Miejsce | Dane źródłowe | Metodologia | Stan dnia |
|---|---|---|---|---|---|
| 2026-08-18 |
|
|
|
|
|
| 2026-08-17 |
|
|
|
|
|
| 2026-08-16 |
|
|
|
|
|
| 2026-08-15 |
|
|
|
|
|
| 2026-08-14 |
|
|
|
|
|
| 2026-08-13 |
|
|
|
|
|
| 2026-08-12 |
|
|
|
|
|
| 2026-08-11 |
|
|
|
|
|
| 2026-08-10 |
|
|
|
|
|
| 2026-08-09 |
|
| — |
|
|
| 2026-08-08 |
|
| — |
|
|
| 2026-08-07 |
|
|
|
|
|
| 2026-07-26 |
|
|
|
|
|
| 2026-07-25 |
|
|
|
|
|
| 2026-07-22 |
|
| — |
|
|
| 2026-07-21 | — | — |
| — |
|
| 2026-07-20 |
|
|
|
|
|
| 2026-07-19 |
|
| — |
|
|
| 2026-07-18 |
|
| — |
|
|
| 2026-07-17 | — | — |
| — |
|