Przejdź do treści

Szczegóły modelu

BarunLM-35M

Status: AktywnyW trendach Hugging Face

Dostawca: harrrshall →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Modalność
Tekst → tekst
Główne zadanie
Generowanie tekstu
Biblioteka
Pytorch

Opis modelu

BarunLM-35M to kompaktowy, oparty na dekoderze model językowy, zbudowany z myślą o silnych możliwościach na parametr. Z dokładnie 35,072,768 parametrów osiąga 41.01% w stałym, oczyszczonym zestawie dziewięciu zadań zero-shot i przewyższa LFM2.5-230M-Base, używając 6.55× mniej parametrów. Pobierz model · Sprawdź dane benchmarkowe · Licencja – Efektywna hybrydowa uwaga. Trzy warstwy lokalnej uwagi zasilają each warstwę pełnej uwagi, łącząc 256-tokenowe okno robocze z okresową wymianą globalnych informacji.

  • Selektywne trasowanie resztkowe. Wyuczony wypukły selektor co cztery warstwy

wybiera między wejściem grupy bloków a jego przekształconym stanem, zapewniając lekką ścieżkę do zachowania użytecznych reprezentacji.

  • Stabilna optymalizacja małych modeli. Uwaga z grupowanymi zapytaniami, częściowe RoPE,

normalizacja QK, wyjścia z bramkowaną uwagą oraz ograniczone SwiGLU są zintegrowane w jednym projekcie z 35M parametrami.

  • Pretraining dostosowany do pojemności. Model był trenowany na 5.70B tokenów—około

162.5 tokenów na parametr—z kuratowanej mieszanki tekstów edukacyjnych z sieci, sztucznej ekspozycji, matematyki, ogólnych tekstów z sieci oraz kodu.

  • Ocena świadoma zanieczyszczenia. Zgłoszone wyniki wykluczają 1,854 próbki

zidentyfikowane przez dokładne skanowanie 13-tokenowe bez uwzględnienia poprawności w całej historii treningu. Wszystkie poniższe wiersze zostały ocenione zero-shot z użyciem LM Evaluation Harness 0.4.12 na ARC-Challenge, ARC-Easy, BoolQ, HellaSwag, LAMBADA OpenAI, OpenBookQA, PIQA, SciQ i WinoGrande. Zgłoszona wartość to nieważona średnia makro po zastosowaniu tych samych zamrożonych decyzji o oczyszczaniu do każdego modelu.

ModelZaładowane parametryDokładność makroPrzewaga BarunLM
BarunLM-35M35.1M41.01%
LFM2.5-230M-Base229.7M39.20%+1.81 pp
Pythia-160M162.3M37.35%+3.66 pp
Stentor-30M30.4M36.46%+4.55 pp
TinyStories-33M¹68.5M33.16%+7.85 pp
Pythia-70M70.4M31.71%+9.30 pp

Sparowany 10,000-próbkowy przedział bootstrapowy dla różnicy makro BarunLM minus LFM2.5

wynosi [+0.92, +2.71] punkty procentowe. Dokładne rewizje, wyniki zadań, przedziały ufności, liczby próbek i hashe dowodowe znajdują się w benchmark_results.json. ¹ TinyStories jest uwzględniony jako diagnostyka w wąskiej dziedzinie, a nie jako ogólny odpowiednik. Liczby parametrów są obliczane na podstawie załadowanych modeli, a nie wnioskowane z nazw repozytoriów. Te wyniki ustanawiają efektywność parametrów w tym zestawie ocen; nie implikują uniwersalnej przewagi w różnych zadaniach lub ustawieniach wdrożeniowych.

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON