Szczegóły modelu
Ornith-1.0-35B
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Modalność
- Tekst → tekst
- Główne zadanie
- Generowanie tekstu
- Biblioteka
- Transformers
Opis modelu
Aloha! ? Dziś wydajemy Ornith-1.0, samodoskonalącą się rodzinę modeli open-source do kodowania agentowego.
- Najnowocześniejsze agenty kodowania: Dostępne w wersjach 9B-Dense, 31B-Dense, 35B-MoE i 397B-MoE (po przeszkoleniu na Gemma 4 i Qwen 3.5), osiągające najlepsze wyniki wśród modeli open-source o porównywalnej wielkości w benchmarkach kodowania, takich jak Terminal-Bench 2.1, SWE-Bench, NL2Repo i OpenClaw.
- Samodoskonaląca się struktura szkoleniowa: Ornith-1.0 wykorzystuje RL do nauki generowania nie tylko rozwiązań, ale także scaffoldów, które napędzają te rozwiązania. Poprzez wspólne optymalizowanie scaffoldu i wynikowego rozwiązania, model odkrywa lepsze trajektorie wyszukiwania i generuje rozwiązania wyższej jakości.
- Licencja: Licencja MIT, globalnie dostępna i wolna od ograniczeń regionalnych. Ta karta modelu dokumentuje Ornith-1.0-35B, lekkiego członka rodziny Ornith, zaprojektowanego do efektywnego wdrożenia na pojedynczym GPU. Ornith-1.0-35B
Qwen3.5-35B Qwen3.6-35B Gemma4-31B Qwen3.5-397B Kodowanie agentowe Terminal-Bench 2.1 (Terminus-2) 64.2 41.4 52.5 42.1 53.5 Terminal-Bench 2.1 (Claude Code) 62.8 38.9 49.2 – 48.6 SWE-bench Weryfikowany 75.6 70 73.4 52 76.4 SWE-bench Pro 50.4 44.6 49.5 35.7 51.6 SWE-bench Wielojęzyczny 69.3 60.3 67.2 51.7 69.3 NL2Repo 34.6 20.5 29.4 15.5 36.8 Claw-eval Średnia 69.8 65.4 68.7 48.5 70.7 SWE Atlas – QnA 37.1 13.2 15.5 – 20.4 SWE Atlas – RF 29.7 10.2 11.4 – 18.4 SWE Atlas – TW 27.8 9.8 13.3 – 18.5 * Terminal-Bench 2.1 (Terminus-2): Oceniamy Terminal-Bench 2.1 przy użyciu frameworka Harbor/Terminus-2 z parser=json, temperature=1.0, topp=1.0 i oknem kontekstowym 128K. Każde uruchomienie korzysta z limitu czasu 4 godzin z 32 rdzeniami CPU i 48GB RAM, a wyniki są uśredniane na podstawie 5 uruchomień. Dostosowujemy szablon czatu Qwen, aby zapewnić spójność między szkoleniem a wnioskowaniem (https://huggingface.co/deepreinforce-ai/Ornith-1.0-397B/blob/main/chattemplate.jinja) i modyfikujemy Harbor, aby dostosować go do klucza reasoning_content vLLM.
- Terminal-Bench 2.1 (Claude Code): Oceniamy Terminal-Bench 2.1 przy użyciu Claude Code 2.1.126 z parser=json, temperature=1.0, topp=1.0, maxnew_tokens=131072. Wyniki są uśredniane na podstawie 5 uruchomień. Ponownie, szablon czatu Qwen musi być zmodyfikowany.
- SWE-Bench Weryfikowany, Pro i Wielojęzyczny: korzystając z harness OpenHands z temp=1.0, top_p=0.95, oknem kontekstowym 256k.
- SWE Atlas QnA, RF, TW: korzystając z mini SWE agent harness z temp=1.0, top_p=0.95, oknem kontekstowym 128K. Wyniki są uśredniane na podstawie 5 uruchomień.
- NL2Repo: z temperature=1.0, top_p=1.0, 400K kontekstu, 48K wyjścia i filtrami antyhakerskimi.
- ClawEval: Benchmark kodowania agentowego w oparciu o rozkłady zadań rzeczywistych użytkowników; temp=0.6 i 256K kontekstu. ? UWAGA
Ornith-1.0-35B jest modelem rozumującym: domyślnie asystent otwiera się z blokiem <think> … </think> przed ostateczną odpowiedzią. Poniższe przepisy serwujące umożliwiają parser rozumowania, aby łańcuch myślenia był zwracany w osobnym polu reasoningcontent, oraz parser wywołań narzędzi, aby bloki <toolcall> modelu były wyświetlane jako wywołania narzędzi w stylu OpenAI. Serwowanie Ornith-1.0-35B wymaga aktualnych wersji: Transformers ≥ 5.8.1 vLLM ≥ 0.19.1 SGLang ≥ 0.5.9 Dwa poniższe przepisy uruchamiają serwer kompatybilny z OpenAI na pojedynczym węźle GPU 8×80GB (tensor-parallel 8). Dostosuj --tensor-parallel-size / --tp do liczby posiadanych GPU. Aby szybko przetestować lokalnie (lub zautomatyzować generację offline), załaduj model bezpośrednio z Transformers. Upewnij się, że masz zainstalowaną aktualną wersję — zobacz przewodnik instalacji Transformers; Ornith-1.0-35B wymaga transformers >= 5.8.1.
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.