Szczegóły modelu
A.X-K2-Raon-Speech-21B-A3B
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Główne zadanie
- Wielomodalne wejście i wyjście
- Biblioteka
- Transformers
Opis modelu
A.X K2 Raon-Speech to dwujęzyczny model językowy mowy angielsko-koreańskiej z około 21.2B całkowitymi parametrami i 3.5B aktywnymi parametrami. Zbudowany na bazie tekstowej A.X K2 Light 20B-A3B firmy SK Telecom, integruje kodera mowy AuT oraz kodera audio w stylu Mimi, niezależnie wytrenowanych przez KRAFTON AI, łącząc rozumienie mowy i generację w jednym modelu multimodalnym. Jest trenowany z użyciem przepisu Raon-Speech-9B, otwartego modelu językowego mowy KRAFTON.
- Model Językowy Mowy End-to-End: 21.2B-parametrowy (około 3.5B
aktywnych) model multimodalny zbudowany na bazie A.X K2 Light 20B-A3B mixture-of-experts.
- Niezależnie Wytrenowane Moduły Mowy: Koder mowy AuT
(około 317M parametrów) oraz koder audio w stylu Mimi (około 96M parametrów), trenowane na starannie dobranych danych z wewnętrzną infrastrukturą.
- Wsparcie Dwujęzyczne: Pierwsze w Korei i trzecie w Anglii w agregatowym wyniku
wśród publicznie dostępnych modeli językowych mowy na poziomie 30B.
- Możliwości Wielozadaniowe: STT, TTS, SpeechQA, SpokenQA oraz czat multimodalny
w trybie turowym w jednym zintegrowanym modelu.
- Świadomość Paralingwistyczna: Wykorzystuje emocje, intonację i inne
informacje zawarte w głosie użytkownika do generowania naturalnych odpowiedzi mówionych.
- Kondycjonowanie Głosu Mówcy: TTS z opcjonalnym odniesieniem audio mówcy
poprzez osadzenia ECAPA.
- Kontynuacja TTS: Generuje mowę, która naturalnie kontynuuje z
odniesienia audio z kontynuacją opartą na wypełnieniu dla płynnej prozodii.
| Komponent | Konfiguracja |
|---|---|
| Podstawa tekstowa | A.X K2 Light 20B-A3B MoE, 48 warstwy, 2,048 rozmiar ukryty |
| Eksperci | 128 kierowani eksperci, top-8 kierowanie |
| Koder mowy | Niezależnie wytrenowany koder AuT oparty na architekturze Qwen3-ASR, 24 warstwy, około 317M parametrów |
| Koder mowy | Niezależnie wytrenowany koder w stylu Mimi, około 96M parametrów |
| Konfiguracja kodeka | 32 kwantyzatory, 2,048-entry książki kodowe, 24 kHz, 12.5 klatki na sekundę |
| Interfejs kodu SpeechLM | 8 grupy kodów wejściowych i 16 generowane grupy kodów wyjściowych |
| Mówca | Mówca oparty na Qwen3, 4 warstwy, 2,048 rozmiar ukryty |
| Okno kontekstowe podstawy tekstowej | Do 131,072 tokenów |
Wszystkie komponenty dla głównych ścieżek rozumienia mowy i bezpośredniego TTS są
zawarte w punkcie kontrolnym. TTS z kondycjonowaniem głosu i kontynuacją dodatkowo wykorzystuje zamrożony koder mówcy ECAPA z SpeechBrain, pobierany automatycznie przy pierwszym użyciu. Ocena obejmowała sześć obszarów zadań — rozpoznawanie mowy, syntezę mowy, rozumienie mowy, odpowiadanie na pytania mówione, odpowiadanie na pytania tekstowe oraz wywoływanie narzędzi — z użyciem benchmarków 46 (24 Koreański, 22 Angielski), w tym LibriSpeech, KsponSpeech, VoiceBench, KVoiceBench, MMAU, KMMAU, API-Bank oraz FunctionChat-Bench. Każdy wynik jest normalizowany do zakresu 0–1 i agregowany na język; zobacz blog technologiczny KRAFTON AI w celu uzyskania pełnej metodologii i wyników. Wśród publicznie dostępnych modeli językowych mowy na poziomie 30B, A.X K2 Raon-Speech zajął pierwsze miejsce w koreańskim agregatowym wyniku (0.72) i trzecie miejsce w angielskim agregatowym wyniku (0.75). Wydajność w każdej kategorii, normalizowana od zera do najwyższego wyniku w każdej kategorii. Modele porównawcze to najlepsi angielscy wykonawcy poniżej, którzy wspierają zarówno angielski, jak i koreański.
| Ranga Koreańska | Model | Koreański | Angielski | Ranga Angielska |
|---|---|---|---|---|
| 1 | A.X K2 Raon-Speech | 0.72 | 0.75 | 3 |
| 2 | Raon-Speech | 0.70 | 0.79 | 1 |
| 3 | Qwen3-Omni | 0.65 | 0.78 | 2 |
| 4 | HyperCLOVA X 8B Omni | 0.60 | 0.68 | 8 |
| 5 | MOSS-Audio | 0.58 | 0.62 | 13 |
| 6 | Qwen2.5-Omni | 0.55 | 0.73 | 5 |
| 7 | Fun-Audio-Chat | 0.53 | 0.69 | 7 |
| 8 | Step-Audio 2 mini | 0.32 | 0.67 | 10 |
| 9 | Interactive-Omni | 0.27 | 0.71 | 6 |
| 10 | Ming-Lite-Omni v1.5 | 0.21 | 0.68 | 8 |
| 10 | AF-Next | 0.21 | 0.65 | 11 |
| 12 | COVO-Audio | 0.18 | 0.41 | 15 |
| — | MiniCPM-o 4.5 | — | 0.74 | 4 |
| — | Kimi-Audio | — | 0.65 | 11 |
| — | Audio Flamingo 3 | — | 0.60 | 14 |
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.