Przejdź do treści

Szczegóły modelu

LongCat-Flash-Lite-Sparse

Status: AktywnyW trendach Hugging Face

Dostawca: meituan-longcat →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Modalność
Tekst → tekst
Główne zadanie
Generowanie tekstu
Biblioteka
LongCat-Flash-Lite-Sparse

Opis modelu

LongCat-Flash-Lite-Sparse to model Mixture-of-Experts (MoE) bez myślenia, z łączną liczbą parametrów 69B i około 3B aktywowanych parametrów na token. Zbudowany na bazie LongCat-Flash-Lite, zastępuje gęste MLA LongCat Sparse Attention (LSA) i natywnie wspiera długości kontekstu do 1M tokenów. W porównaniu do swojego gęstego poprzednika, LongCat-Flash-Lite-Sparse poprawia efektywność wnioskowania w długim kontekście oraz zdolności agentowe, zachowując jednocześnie silne umiejętności rozumowania i ogólnej wiedzy. LSA to efektywna pod względem sprzętowym struktura uwagi rzadkiej, która rozszerza DeepSeek Sparse Attention (DSA) o trzy komplementarne mechanizmy indeksowania:

  • Streaming-Aware Indexing (SI) reallocuje część budżetu selekcji tokenów do stałego zlewu i lokalnego okna przesuwnego, jednocześnie zachowując dynamiczny wybór rzadkich tokenów dla pozostałych tokenów. Ten projekt przekształca fragmentowany dostęp KV w bardziej przewidywalne, ciągłe odczyty, poprawiając efektywność dostępu HBM i efektywną przepustowość.
  • Cross-Layer Indexing (CLI) wykorzystuje stabilność istotności uwagi w sąsiednich warstwach, pozwalając wielu kolejnym warstwom na ponowne wykorzystanie wyników jednego przejścia indeksowania w czasie wnioskowania. Ta zdolność jest uczona poprzez destylację międzywarstwową podczas treningu.
  • Hierarchical Indexing (HI) przyjmuje schemat oceny od ogółu do szczegółu w dwóch etapach: najpierw przypomina bloki kandydatów za pomocą ocen o dużej rozdzielczości, a następnie przeprowadza selekcję tokenów o wysokiej rozdzielczości w tych blokach. Poprzez zmniejszenie przestrzeni kandydatów przetwarzanych dla każdego zapytania, HI obniża koszty indeksowania i może być włączony w czasie wnioskowania bez dodatkowego treningu. Razem te mechanizmy umożliwiają LongCat-Flash-Lite-Sparse przetwarzanie długich kontekstów znacznie bardziej efektywnie, nie kompromitując jakości modelu. Aby wzmocnić zdolności długiego kontekstu, aktualizujemy etap rozszerzenia długiego kontekstu LongCat-Flash-Lite z wzbogaconą korpusem i progresywnym harmonogramem, który skaluje się do 1,024K, umożliwiając natywne wsparcie dla długości kontekstu do 1M. LongCat-Flash-Lite-Sparse osiąga lepsze wyniki niż jego gęsty poprzednik w zadaniach związanych z kodowaniem agentowym, wyszukiwaniem i używaniem narzędzi. Proszę zapoznać się z naszym raportem technicznym w celu uzyskania szczegółowych informacji!
BenchmarkLite-DenseLite-Sparse (w/o HI)Lite-Sparse (w/ HI)

| Agentic Coding | | SWE-Bench Verified(acc) | 54.40 | 68.20 | 65.20 | | SWE-Bench Pro(acc) | – | 40.63 | 39.40 | | SWE-Bench Multilingual(acc) | 38.10 | 59.33 | 56.00 | | TerminalBench 2.0(acc) | 33.75 | 33.70 | 32.58 | | Agentic Tool Use | | τ²-Telecom(avg@4) | 72.80 | 95.18 | 96.05 | | VitaBench(avg@4) | 7.00 | 21.67 | 20.42 | | MCP-Atlas | – | 45.60 | 45.00 | | Agentic Search | | BrowseComp(pass@1) | – | 48.62 | 48.18 | | BrowseComp-zh(pass@1) | – | 61.94 | 61.59 | | RWSearch(pass@1) | – | 68.50 | 66.00 | | General Domains | | MMLU(acc) | 85.52 | 85.31 | 85.14 | | MMLU-Pro(acc) | 78.29 | 79.24 | 78.68 | | CMMLU(acc) | 82.48 | 84.25 | 84.51 | | C-Eval(acc) | 86.55 | 85.76 | 85.71 | | Mathematical Reasoning | | GPQA-Diamond(avg@16) | 66.78 | 69.49 | 69.03 | | MATH500(acc) | 96.80 | 95.80 | 96.80 | | AIME 2026(avg@32) | – | 65.73 | 64.90 | | HMMT 2026 Feb(avg@32) | – | 40.53 | 41.47 | | BeyondAIME(avg@10) | – | 44.20 | 42.30 | | IMO AnswerBench(avg@4) | – | 49.38 | 46.69 |

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON