Szczegóły modelu
DeepSeek: DeepSeek V3
Status: AktywnyDostęp APIModel lokalny
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Rozmiar wag
- 688,6 GBdokładne metadane plików
- Skala modelu
- 684,5 mldparametrów · metadane Safetensors
- Okno kontekstu
- 131 072tokenów · dane modelu/API
- Modalność
- Tekst → tekst
- Format wag
- SafetensorsBF16
- Architektura
- DeepSeek V3konfiguracja modelu
- Aktywni eksperci
- 8na token · konfiguracja wariantu
- Główne zadanie
- Generowanie tekstu
- Biblioteka
- Transformers
Opis modelu
Przedstawiamy DeepSeek-V3, silny model językowy Mixture-of-Experts (MoE) z łączną liczbą 671B parametrów, z czego 37B jest aktywowanych dla każdego tokena. Aby osiągnąć wydajne wnioskowanie i opłacalny trening, DeepSeek-V3 przyjmuje architektury Multi-head Latent Attention (MLA) i DeepSeekMoE, które zostały dokładnie zweryfikowane w DeepSeek-V2. Ponadto DeepSeek-V3 jest pionierem strategii bezstratnej bez pomocniczej straty dla równoważenia obciążenia i ustanawia cel treningowy Multi-Token Prediction dla silniejszej wydajności. Trenujemy DeepSeek-V3 na 14,8 biliona różnorodnych i wysokiej jakości tokenów, a następnie etapy Supervised Fine-Tuning i Reinforcement Learning, aby w pełni wykorzystać jego możliwości. Kompleksowe oceny ujawniają, że DeepSeek-V3 przewyższa inne modele open-source i osiąga wydajność porównywalną z wiodącymi modelami zamkniętymi. Pomimo doskonałej wydajności, DeepSeek-V3 wymaga tylko 2,788M godzin GPU H800 na pełny trening. Ponadto jego proces treningu jest niezwykle stabilny. Podczas całego procesu treningu nie doświadczyliśmy żadnych nieodwracalnych skoków straty ani nie wykonaliśmy żadnych wycofań.
Architektura: Innowacyjna strategia równoważenia obciążenia i cel treningowy
- Na bazie wydajnej architektury DeepSeek-V2, jesteśmy pionierami strategii bezstratnej bez pomocniczej straty dla równoważenia obciążenia, która minimalizuje degradację wydajności wynikającą z zachęcania do równoważenia obciążenia.
- Badamy cel Multi-Token Prediction (MTP) i udowadniamy, że jest korzystny dla wydajności modelu. Może być również używany do spekulacyjnego dekodowania w celu przyspieszenia wnioskowania.
Przedtrening: W kierunku najwyższej wydajności treningu
- Projektujemy framework treningu mieszanej precyzji FP8 i po raz pierwszy potwierdzamy wykonalność i skuteczność treningu FP8 na modelu o ekstremalnie dużej skali.
- Poprzez współprojektowanie algorytmów, frameworków i sprzętu, pokonujemy wąskie gardło komunikacji w treningu MoE między węzłami, osiągając prawie pełne nakładanie się obliczeń i komunikacji. To znacząco zwiększa naszą wydajność treningu i obniża koszty treningu, umożliwiając dalsze skalowanie rozmiaru modelu bez dodatkowych kosztów ogólnych.
- Przy ekonomicznym koszcie tylko 2,664M godzin GPU H800, kończymy przedtrening DeepSeek-V3 na 14,8T tokenów, produkując obecnie najsilniejszy otwarty model bazowy. Kolejne etapy treningu po przedtreningu wymagają tylko 0,1M godzin GPU.
Potrening: Dystylacja wiedzy z DeepSeek-R1
- Wprowadzamy innowacyjną metodologię dystylacji zdolności rozumowania z modelu długiego łańcucha myśli (CoT), w szczególności z jednego z modeli serii DeepSeek R1, do standardowych LLM, szczególnie DeepSeek-V3. Nasz potok elegancko włącza wzorce weryfikacji i refleksji R1 do DeepSeek-V3 i znacząco poprawia jego wydajność rozumowania. Jednocześnie utrzymujemy kontrolę nad stylem wyjścia i długością DeepSeek-V3.
| Model | Łączna liczba parametrów | Aktywowane parametry | Długość kontekstu | Pobierz |
|---|---|---|---|---|
| DeepSeek-V3-Base | 671B | 37B | 128K | ? HuggingFace |
| DeepSeek-V3 | 671B | 37B | 128K | ? HuggingFace |
Warianty do uruchomienia
| Wariant | Format | Rozmiar wag | Źródło i weryfikacja |
|---|---|---|---|
685B · SAFETENSORSManifest plików (164)
| SAFETENSORS | 688,6 GB163 shardów | Hugging Face Hub Models APIWeryfikacja: 2026-08-09 |
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
| Dostawca API | Wejście / 1 mln tokenów | Wyjście / 1 mln tokenów | Pozostałe stawki źródłowe | Możliwości |
|---|---|---|---|---|
| OpenRouter | 0,956 zł / 1 mln tokenów | 3,82 zł / 1 mln tokenów | Brak | Brak danych |
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API. Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Dane porównywalne
Historia wyniku AI-TOP
Seria używa snapshotów głównego rankingu z metodologii 1.2.
Skala adaptacyjna: obserwowany zakres 55–75 pkt / 100.
- Wynik AI-TOP
| Data | Wynik AI-TOP | Miejsce | Dane źródłowe | Metodologia | Stan dnia |
|---|---|---|---|---|---|
| 2026-08-18 |
|
| — |
|
|
| 2026-08-17 |
|
| — |
|
|
| 2026-08-16 |
|
| — |
|
|
| 2026-08-15 |
|
| — |
|
|
| 2026-08-14 |
|
| — |
|
|
| 2026-08-13 |
|
| — |
|
|
| 2026-08-12 |
|
| — |
|
|
| 2026-08-11 |
|
| — |
|
|
| 2026-08-10 |
|
| — |
|
|
| 2026-08-09 |
|
| — |
|
|
| 2026-08-08 |
|
| — |
|
|
| 2026-08-07 |
|
| — |
|
|
| 2026-07-26 |
|
|
|
|
|
| 2026-07-25 |
|
| — |
|
|
| 2026-07-22 |
|
| — |
|
|
| 2026-07-21 | — | — |
| — |
|
| 2026-07-20 |
|
| — |
|
|
| 2026-07-19 |
|
| — |
|
|
| 2026-07-18 |
|
| — |
|
|
| 2026-07-17 | — | — |
| — |
|