Szczegóły modelu
LongCat-Flash-Lite-Sparse
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Modalność
- Tekst → tekst
- Główne zadanie
- Generowanie tekstu
- Biblioteka
- LongCat-Flash-Lite-Sparse
Opis modelu
LongCat-Flash-Lite-Sparse to model Mixture-of-Experts (MoE) bez myślenia, z łączną liczbą parametrów 69B i około 3B aktywowanych parametrów na token. Zbudowany na bazie LongCat-Flash-Lite, zastępuje gęste MLA LongCat Sparse Attention (LSA) i natywnie wspiera długości kontekstu do 1M tokenów. W porównaniu do swojego gęstego poprzednika, LongCat-Flash-Lite-Sparse poprawia efektywność wnioskowania w długim kontekście oraz zdolności agentowe, zachowując jednocześnie silne umiejętności rozumowania i ogólnej wiedzy. LSA to efektywna pod względem sprzętowym struktura uwagi rzadkiej, która rozszerza DeepSeek Sparse Attention (DSA) o trzy komplementarne mechanizmy indeksowania:
- Streaming-Aware Indexing (SI) reallocuje część budżetu selekcji tokenów do stałego zlewu i lokalnego okna przesuwnego, jednocześnie zachowując dynamiczny wybór rzadkich tokenów dla pozostałych tokenów. Ten projekt przekształca fragmentowany dostęp KV w bardziej przewidywalne, ciągłe odczyty, poprawiając efektywność dostępu HBM i efektywną przepustowość.
- Cross-Layer Indexing (CLI) wykorzystuje stabilność istotności uwagi w sąsiednich warstwach, pozwalając wielu kolejnym warstwom na ponowne wykorzystanie wyników jednego przejścia indeksowania w czasie wnioskowania. Ta zdolność jest uczona poprzez destylację międzywarstwową podczas treningu.
- Hierarchical Indexing (HI) przyjmuje schemat oceny od ogółu do szczegółu w dwóch etapach: najpierw przypomina bloki kandydatów za pomocą ocen o dużej rozdzielczości, a następnie przeprowadza selekcję tokenów o wysokiej rozdzielczości w tych blokach. Poprzez zmniejszenie przestrzeni kandydatów przetwarzanych dla każdego zapytania, HI obniża koszty indeksowania i może być włączony w czasie wnioskowania bez dodatkowego treningu. Razem te mechanizmy umożliwiają LongCat-Flash-Lite-Sparse przetwarzanie długich kontekstów znacznie bardziej efektywnie, nie kompromitując jakości modelu. Aby wzmocnić zdolności długiego kontekstu, aktualizujemy etap rozszerzenia długiego kontekstu LongCat-Flash-Lite z wzbogaconą korpusem i progresywnym harmonogramem, który skaluje się do 1,024K, umożliwiając natywne wsparcie dla długości kontekstu do 1M. LongCat-Flash-Lite-Sparse osiąga lepsze wyniki niż jego gęsty poprzednik w zadaniach związanych z kodowaniem agentowym, wyszukiwaniem i używaniem narzędzi. Proszę zapoznać się z naszym raportem technicznym w celu uzyskania szczegółowych informacji!
| Benchmark | Lite-Dense | Lite-Sparse (w/o HI) | Lite-Sparse (w/ HI) |
|---|
| Agentic Coding | | SWE-Bench Verified(acc) | 54.40 | 68.20 | 65.20 | | SWE-Bench Pro(acc) | – | 40.63 | 39.40 | | SWE-Bench Multilingual(acc) | 38.10 | 59.33 | 56.00 | | TerminalBench 2.0(acc) | 33.75 | 33.70 | 32.58 | | Agentic Tool Use | | τ²-Telecom(avg@4) | 72.80 | 95.18 | 96.05 | | VitaBench(avg@4) | 7.00 | 21.67 | 20.42 | | MCP-Atlas | – | 45.60 | 45.00 | | Agentic Search | | BrowseComp(pass@1) | – | 48.62 | 48.18 | | BrowseComp-zh(pass@1) | – | 61.94 | 61.59 | | RWSearch(pass@1) | – | 68.50 | 66.00 | | General Domains | | MMLU(acc) | 85.52 | 85.31 | 85.14 | | MMLU-Pro(acc) | 78.29 | 79.24 | 78.68 | | CMMLU(acc) | 82.48 | 84.25 | 84.51 | | C-Eval(acc) | 86.55 | 85.76 | 85.71 | | Mathematical Reasoning | | GPQA-Diamond(avg@16) | 66.78 | 69.49 | 69.03 | | MATH500(acc) | 96.80 | 95.80 | 96.80 | | AIME 2026(avg@32) | – | 65.73 | 64.90 | | HMMT 2026 Feb(avg@32) | – | 40.53 | 41.47 | | BeyondAIME(avg@10) | – | 44.20 | 42.30 | | IMO AnswerBench(avg@4) | – | 49.38 | 46.69 |
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.