Przejdź do treści

Szczegóły modelu

A.X-K2-Raon-Speech-21B-A3B

Status: AktywnyW trendach Hugging Face

Dostawca: KRAFTON →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Główne zadanie
Wielomodalne wejście i wyjście
Biblioteka
Transformers

Opis modelu

A.X K2 Raon-Speech to dwujęzyczny model językowy mowy angielsko-koreańskiej z około 21.2B całkowitymi parametrami i 3.5B aktywnymi parametrami. Zbudowany na bazie tekstowej A.X K2 Light 20B-A3B firmy SK Telecom, integruje kodera mowy AuT oraz kodera audio w stylu Mimi, niezależnie wytrenowanych przez KRAFTON AI, łącząc rozumienie mowy i generację w jednym modelu multimodalnym. Jest trenowany z użyciem przepisu Raon-Speech-9B, otwartego modelu językowego mowy KRAFTON.

  • Model Językowy Mowy End-to-End: 21.2B-parametrowy (około 3.5B

aktywnych) model multimodalny zbudowany na bazie A.X K2 Light 20B-A3B mixture-of-experts.

  • Niezależnie Wytrenowane Moduły Mowy: Koder mowy AuT

(około 317M parametrów) oraz koder audio w stylu Mimi (około 96M parametrów), trenowane na starannie dobranych danych z wewnętrzną infrastrukturą.

  • Wsparcie Dwujęzyczne: Pierwsze w Korei i trzecie w Anglii w agregatowym wyniku

wśród publicznie dostępnych modeli językowych mowy na poziomie 30B.

  • Możliwości Wielozadaniowe: STT, TTS, SpeechQA, SpokenQA oraz czat multimodalny

w trybie turowym w jednym zintegrowanym modelu.

  • Świadomość Paralingwistyczna: Wykorzystuje emocje, intonację i inne

informacje zawarte w głosie użytkownika do generowania naturalnych odpowiedzi mówionych.

  • Kondycjonowanie Głosu Mówcy: TTS z opcjonalnym odniesieniem audio mówcy

poprzez osadzenia ECAPA.

  • Kontynuacja TTS: Generuje mowę, która naturalnie kontynuuje z

odniesienia audio z kontynuacją opartą na wypełnieniu dla płynnej prozodii.

KomponentKonfiguracja
Podstawa tekstowaA.X K2 Light 20B-A3B MoE, 48 warstwy, 2,048 rozmiar ukryty
Eksperci128 kierowani eksperci, top-8 kierowanie
Koder mowyNiezależnie wytrenowany koder AuT oparty na architekturze Qwen3-ASR, 24 warstwy, około 317M parametrów
Koder mowyNiezależnie wytrenowany koder w stylu Mimi, około 96M parametrów
Konfiguracja kodeka32 kwantyzatory, 2,048-entry książki kodowe, 24 kHz, 12.5 klatki na sekundę
Interfejs kodu SpeechLM8 grupy kodów wejściowych i 16 generowane grupy kodów wyjściowych
MówcaMówca oparty na Qwen3, 4 warstwy, 2,048 rozmiar ukryty
Okno kontekstowe podstawy tekstowejDo 131,072 tokenów

Wszystkie komponenty dla głównych ścieżek rozumienia mowy i bezpośredniego TTS są

zawarte w punkcie kontrolnym. TTS z kondycjonowaniem głosu i kontynuacją dodatkowo wykorzystuje zamrożony koder mówcy ECAPA z SpeechBrain, pobierany automatycznie przy pierwszym użyciu. Ocena obejmowała sześć obszarów zadań — rozpoznawanie mowy, syntezę mowy, rozumienie mowy, odpowiadanie na pytania mówione, odpowiadanie na pytania tekstowe oraz wywoływanie narzędzi — z użyciem benchmarków 46 (24 Koreański, 22 Angielski), w tym LibriSpeech, KsponSpeech, VoiceBench, KVoiceBench, MMAU, KMMAU, API-Bank oraz FunctionChat-Bench. Każdy wynik jest normalizowany do zakresu 0–1 i agregowany na język; zobacz blog technologiczny KRAFTON AI w celu uzyskania pełnej metodologii i wyników. Wśród publicznie dostępnych modeli językowych mowy na poziomie 30B, A.X K2 Raon-Speech zajął pierwsze miejsce w koreańskim agregatowym wyniku (0.72) i trzecie miejsce w angielskim agregatowym wyniku (0.75). Wydajność w każdej kategorii, normalizowana od zera do najwyższego wyniku w każdej kategorii. Modele porównawcze to najlepsi angielscy wykonawcy poniżej, którzy wspierają zarówno angielski, jak i koreański.

Ranga KoreańskaModelKoreańskiAngielskiRanga Angielska
1A.X K2 Raon-Speech0.720.753
2Raon-Speech0.700.791
3Qwen3-Omni0.650.782
4HyperCLOVA X 8B Omni0.600.688
5MOSS-Audio0.580.6213
6Qwen2.5-Omni0.550.735
7Fun-Audio-Chat0.530.697
8Step-Audio 2 mini0.320.6710
9Interactive-Omni0.270.716
10Ming-Lite-Omni v1.50.210.688
10AF-Next0.210.6511
12COVO-Audio0.180.4115
MiniCPM-o 4.50.744
Kimi-Audio0.6511
Audio Flamingo 30.6014

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON