Szczegóły modelu
BTL-4
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Modalność
- Tekst → tekst
- Główne zadanie
- Generowanie tekstu
- Biblioteka
- Transformers
Opis modelu
Model agentywnego rozumowania 35B od Bad Theory Labs, dostosowany z Ornith-1.0-35B na korpusie rozumowania z bramkami wykonawczymi. Stworzony do użycia narzędzi, inżynierii oprogramowania i pracy agentów na długich horyzontach.
| Benchmark | BTL-4 | Podstawowy Ornith-1.0-35B | Harness |
|---|---|---|---|
| BFCL v4 (AST) | 73.5% | 69.2% | oficjalny ast_checker, wszystkie 1240 przypadków |
| LiveCodeBench v6 | 66.1% | — | oficjalny, 442 problemy, 2024-08 → 2025-05 |
| SWE-bench Verified | 78.4% | — | oficjalny harness |
BFCL i LiveCodeBench były uruchamiane wewnętrznie z oficjalnymi oceniaczami, pełne podziały, bez podzbiorów. Liczba BFCL to porównanie par: identyczny
harness, identyczne dekodowanie, tylko wagi się różnią.
| pass@1 | |
|---|---|
| łatwe | 99.1% |
| średnie | 86.7% |
| trudne | 60.5% |
Zestaw składa się w 45% z trudnych problemów, co obniża agregat. Rozumowanie musi być oddzielone od treści, na każdym stosie. Szablon czatu
usuwa rozumowanie z wcześniejszych tur, ale tylko wtedy, gdy harness umieszcza je w reasoning_content. W przypadku vLLM to --reasoning-parser qwen3; w przypadku llama.cpp to --reasoning-format deepseek. Bez tego, rozumowanie gromadzi się w content w każdej turze, a model powtarza tury zamiast kończyć. Ustawienia Ornith, używane dla każdej liczby powyżej:
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.