Szczegóły modelu
DeepSeek: DeepSeek V4 Pro
Status: AktywnyW trendach Hugging FaceDostęp APIModel lokalny
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Rozmiar wag
- 864,7 GBdokładne metadane plików
- Skala modelu
- 1 598,8 mldparametrów · metadane Safetensors
- Okno kontekstu
- 1 048 576tokenów · dane modelu/API
- Modalność
- Tekst → tekst
- Format wag
- SafetensorsBF16
- Architektura
- Deepseek V4konfiguracja modelu
- Aktywni eksperci
- 6na token · konfiguracja wariantu
- Główne zadanie
- Generowanie tekstu
- Biblioteka
- Transformers
Opis modelu
DeepSeek-V4: W kierunku wysoce wydajnej inteligencji kontekstu miliona tokenów. Przedstawiamy wersję zapoznawczą serii DeepSeek-V4, obejmującą dwa wydajne modele językowe typu Mixture-of-Experts (MoE) — DeepSeek-V4-Pro z 1,6T parametrów (49B aktywnych) oraz DeepSeek-V4-Flash z 284B parametrów (13B aktywnych) — oba obsługujące długość kontekstu jednego miliona tokenów. Seria DeepSeek-V4 zawiera kilka kluczowych ulepszeń w architekturze i optymalizacji:
- Hybrydowa architektura uwagi: Zaprojektowaliśmy hybrydowy mechanizm uwagi łączący Compressed Sparse Attention (CSA) i Heavily Compressed Attention (HCA), aby radykalnie poprawić wydajność długiego kontekstu. W ustawieniu kontekstu 1M tokenów, DeepSeek-V4-Pro wymaga tylko 27% FLOPs wnioskowania pojedynczego tokena i 10% pamięci podręcznej KV w porównaniu z DeepSeek-V3.2.
- Manifold-Constrained Hyper-Connections (mHC): Wprowadzamy mHC w celu wzmocnienia konwencjonalnych połączeń resztkowych, zwiększając stabilność propagacji sygnału między warstwami przy jednoczesnym zachowaniu ekspresywności modelu.
- Optymalizator Muon: Stosujemy optymalizator Muon dla szybszej zbieżności i większej stabilności treningu.
Oba modele są wstępnie trenowane na ponad 32T różnorodnych i wysokiej jakości tokenach, a następnie poddawane kompleksowemu potokowi po treningu. Potrening obejmuje dwuetapowy paradygmat: niezależne kształcenie ekspertów domenowych (poprzez SFT i RL z GRPO), a następnie ujednolicona konsolidacja modelu poprzez destylację on-policy, integrująca odrębne umiejętności z różnych dziedzin w jeden model.
DeepSeek-V4-Pro-Max, tryb maksymalnego wysiłku rozumowania DeepSeek-V4-Pro, znacząco rozwija możliwości wiedzowe modeli open-source, umacniając swoją pozycję jako najlepszy obecnie dostępny model open-source. Osiąga najwyższą wydajność w benchmarkach kodowania i znacząco zmniejsza lukę w stosunku do wiodących modeli zamkniętych w zadaniach rozumowania i agentowych. Tymczasem DeepSeek-V4-Flash-Max osiąga porównywalną wydajność rozumowania do wersji Pro, gdy otrzyma większy budżet myślenia, choć jego mniejsza skala parametrów naturalnie plasuje go nieco niżej w czysto wiedzowych zadaniach i najbardziej złożonych przepływach agentowych.
| Model | #Parametry całkowite | #Parametry aktywowane | Długość kontekstu | Precyzja | Pobierz |
|---|---|---|---|---|---|
| DeepSeek-V4-Flash-Base | 284B | 13B | 1M | FP8 Mixed | HuggingFace | ModelScope |
| DeepSeek-V4-Flash | 284B | 13B | 1M | FP4 + FP8 Mixed* | HuggingFace | ModelScope |
| DeepSeek-V4-Pro-Base | 1.6T | 49B | 1M | FP8 Mixed | HuggingFace | ModelScope |
| DeepSeek-V4-Pro | 1.6T | 49B | 1M | FP4 + FP8 Mixed* | HuggingFace | ModelScope |
\FP4 + FP8 Mixed: Parametry ekspertów MoE używają precyzji FP4; większość innych parametrów używa FP8.*
Warianty do uruchomienia
| Wariant | Format | Rozmiar wag | Źródło i weryfikacja |
|---|---|---|---|
1 599B · SAFETENSORSManifest plików (65)
| SAFETENSORS | 864,7 GB64 shardów | Hugging Face Hub Models APIWeryfikacja: 2026-08-09 |
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
| Dostawca API | Wejście / 1 mln tokenów | Wyjście / 1 mln tokenów | Pozostałe stawki źródłowe | Możliwości |
|---|---|---|---|---|
| OpenRouter | 4,9 zł / 1 mln tokenów | 14,71 zł / 1 mln tokenów | Cache odczyt: 0,163 zł / 1 mln tokenów | Kontekst providera: 1 048 576 · Maks. odpowiedź: 384 000 · Tokenizer: DeepSeek · Wejście: text · Wyjście: text · API: frequency_penalty, include_reasoning, logit_bias, logprobs, max_tokens · Bez moderacji providera |
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API. Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Dane porównywalne
Historia wyniku AI-TOP
Seria używa snapshotów głównego rankingu z metodologii 1.2.
Skala adaptacyjna: obserwowany zakres 70–78 pkt / 100.
- Wynik AI-TOP
| Data | Wynik AI-TOP | Miejsce | Dane źródłowe | Metodologia | Stan dnia |
|---|---|---|---|---|---|
| 2026-08-18 |
|
|
|
|
|
| 2026-08-17 |
|
|
|
|
|
| 2026-08-16 |
|
|
|
|
|
| 2026-08-15 |
|
|
|
|
|
| 2026-08-14 |
|
|
|
|
|
| 2026-08-13 |
|
|
|
|
|
| 2026-08-12 |
|
|
|
|
|
| 2026-08-11 |
|
|
|
|
|
| 2026-08-10 |
|
|
|
|
|
| 2026-08-09 |
|
| — |
|
|
| 2026-08-08 |
|
| — |
|
|
| 2026-08-07 |
|
|
|
|
|
| 2026-07-26 |
|
|
|
|
|
| 2026-07-25 |
|
|
|
|
|
| 2026-07-22 |
|
| — |
|
|
| 2026-07-21 | — | — |
| — |
|
| 2026-07-20 |
|
|
|
|
|
| 2026-07-19 |
|
| — |
|
|
| 2026-07-18 |
|
|
|
|
|
| 2026-07-17 | — | — |
| — |
|