Szczegóły modelu
neutts-2e
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Główne zadanie
- Synteza mowy
Opis modelu
Stworzony przez Neuphonic – budowanie szybszej, mniejszej, lokalnej sztucznej inteligencji głosowej NeuTTS-2E to super szybki, wysoce realistyczny, lokalny model syntezatora mowy TTS z emocjami. Jest to wczesna wersja alfa, model tylko w języku angielskim, wspierający sześć emocji plus neutralną (angry, disgusted, fearful, happy, sad, surprised i neutral) w czterech stałych głosach (emily, paul, sophie, steven). Dzięki kompaktowej architekturze i efektywnemu projektowi LM + kodeka, NeuTTS-2E zapewnia silną naturalność i ekspresyjną kontrolę przy minimalnym zużyciu mocy obliczeniowej, co czyni go idealnym do wbudowanych agentów głosowych, asystentów, zabawek i aplikacji wrażliwych na prywatność. > [!NOTE]
Ten model jest tylko w języku angielskim z ustalonymi głosami: dla innych języków i natychmiastowego klonowania głosu, zobacz kolekcję NeuTTS Nano Multilingual. – ⚡️ Ultra-szybki dla lokalnych zastosowań — zaprojektowany do generacji w czasie rzeczywistym lub lepszej niż w czasie rzeczywistym na procesorach klasy laptopów
- ??? Kontrola emocji — sześć emocji plus neutralna, wybierane za pomocą jednego argumentu
- ? Wysoka realizm jak na swój rozmiar — naturalna, ekspresyjna mowa w kompaktowej formie
- ? Przyjazne dla GGUF/GGML wdrożenie — łatwe do uruchomienia lokalnie za pomocą narzędzi CPU-first
- ? Lokalne i zgodne z przepisami — przechowuj audio i tekst na urządzeniu > [!CAUTION]
Strony internetowe takie jak neutts.com pojawiają się i nie są powiązane z Neuphonic, naszym githubem ani tym repozytorium. Jesteśmy tylko na neuphonic.com. Proszę być ostrożnym! ? NeuTTS-2E został zaprojektowany z myślą o maksymalnej prędkości na parametr przy zachowaniu silnej naturalności i ekspresyjnej kontroli:
- Backbone: kompaktowa architektura LM dostosowana do generacji tokenów TTS z emocjami
- Format wejściowy: tekst — nie wymaga fonemizacji ani zależności systemowych
- Głosy: cztery stałe głosy (
emily,paul,sophie,steven) - Emocje:
angry,disgusted,fearful,happy,sad,surprisedineutral - Kodek audio: NeuCodec – nasz otwarty kodek audio oparty na sieciach neuronowych, który osiąga wyjątkową jakość dźwięku przy niskich bitrate'ach, używając jednego zbioru kodów
- Format: kwantyzacje dostępne w formacie GGUF dla efektywnego wnioskowania lokalnego
- Odpowiedzialność: Wydania z watermarkiem
- Prędkość wnioskowania: Optymalizowane do generacji w czasie rzeczywistym na procesorach
- Zużycie energii: Zaprojektowane dla urządzeń mobilnych i wbudowanych – Aktywne parametry (tylko backbone): ~125M
- Całkowite parametry (backbone + powiązane osadzenia/głowa): ~236M
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-07
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Dyskusja jest chwilowo niedostępna.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.