Szczegóły modelu
BarunLM-35M
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Modalność
- Tekst → tekst
- Główne zadanie
- Generowanie tekstu
- Biblioteka
- Pytorch
Opis modelu
BarunLM-35M to kompaktowy, oparty na dekoderze model językowy, zbudowany z myślą o silnych możliwościach na parametr. Z dokładnie 35,072,768 parametrów osiąga 41.01% w stałym, oczyszczonym zestawie dziewięciu zadań zero-shot i przewyższa LFM2.5-230M-Base, używając 6.55× mniej parametrów. Pobierz model · Sprawdź dane benchmarkowe · Licencja – Efektywna hybrydowa uwaga. Trzy warstwy lokalnej uwagi zasilają each warstwę pełnej uwagi, łącząc 256-tokenowe okno robocze z okresową wymianą globalnych informacji.
- Selektywne trasowanie resztkowe. Wyuczony wypukły selektor co cztery warstwy
wybiera między wejściem grupy bloków a jego przekształconym stanem, zapewniając lekką ścieżkę do zachowania użytecznych reprezentacji.
- Stabilna optymalizacja małych modeli. Uwaga z grupowanymi zapytaniami, częściowe RoPE,
normalizacja QK, wyjścia z bramkowaną uwagą oraz ograniczone SwiGLU są zintegrowane w jednym projekcie z 35M parametrami.
- Pretraining dostosowany do pojemności. Model był trenowany na 5.70B tokenów—około
162.5 tokenów na parametr—z kuratowanej mieszanki tekstów edukacyjnych z sieci, sztucznej ekspozycji, matematyki, ogólnych tekstów z sieci oraz kodu.
- Ocena świadoma zanieczyszczenia. Zgłoszone wyniki wykluczają 1,854 próbki
zidentyfikowane przez dokładne skanowanie 13-tokenowe bez uwzględnienia poprawności w całej historii treningu. Wszystkie poniższe wiersze zostały ocenione zero-shot z użyciem LM Evaluation Harness 0.4.12 na ARC-Challenge, ARC-Easy, BoolQ, HellaSwag, LAMBADA OpenAI, OpenBookQA, PIQA, SciQ i WinoGrande. Zgłoszona wartość to nieważona średnia makro po zastosowaniu tych samych zamrożonych decyzji o oczyszczaniu do każdego modelu.
| Model | Załadowane parametry | Dokładność makro | Przewaga BarunLM |
|---|---|---|---|
| BarunLM-35M | 35.1M | 41.01% | — |
| LFM2.5-230M-Base | 229.7M | 39.20% | +1.81 pp |
| Pythia-160M | 162.3M | 37.35% | +3.66 pp |
| Stentor-30M | 30.4M | 36.46% | +4.55 pp |
| TinyStories-33M¹ | 68.5M | 33.16% | +7.85 pp |
| Pythia-70M | 70.4M | 31.71% | +9.30 pp |
Sparowany 10,000-próbkowy przedział bootstrapowy dla różnicy makro BarunLM minus LFM2.5
wynosi [+0.92, +2.71] punkty procentowe. Dokładne rewizje, wyniki zadań, przedziały ufności, liczby próbek i hashe dowodowe znajdują się w benchmark_results.json. ¹ TinyStories jest uwzględniony jako diagnostyka w wąskiej dziedzinie, a nie jako ogólny odpowiednik. Liczby parametrów są obliczane na podstawie załadowanych modeli, a nie wnioskowane z nazw repozytoriów. Te wyniki ustanawiają efektywność parametrów w tym zestawie ocen; nie implikują uniwersalnej przewagi w różnych zadaniach lub ustawieniach wdrożeniowych.
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.