Przejdź do treści

Szczegóły modelu

Ornith-1.0-9B

Status: AktywnyW trendach Hugging Face

Dostawca: deepreinforce-ai →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Modalność
Tekst → tekst
Główne zadanie
Generowanie tekstu
Biblioteka
Transformers

Opis modelu

Aloha! ? Dziś wydajemy Ornith-1.0, rodzinę modeli open-source do agentycznego kodowania, które samodzielnie się poprawiają.

  • Najnowocześniejsze agenty kodowania: Dostępne w wersjach 9B-Dense, 31B-Dense, 35B-MoE i 397B-MoE (po treningu na Gemma 4 i Qwen 3.5), osiągające najlepsze wyniki wśród modeli open-source o porównywalnej wielkości na benchmarkach kodowania, takich jak Terminal-Bench 2.1, SWE-Bench, NL2Repo i OpenClaw.
  • Framework treningowy samodzielnie poprawiający: Ornith-1.0 wykorzystuje RL do nauki generowania nie tylko rozwiązań, ale także rusztowań, które napędzają te rozwiązania. Poprzez wspólną optymalizację rusztowania i wynikowego rozwiązania, model odkrywa lepsze trajektorie wyszukiwania i generuje rozwiązania o wyższej jakości.
  • Licencja: Licencja MIT, globalnie dostępna i wolna od ograniczeń regionalnych. Ta karta modelu dokumentuje Ornith-1.0-9B, najlżejszego członka rodziny Ornith, zaprojektowanego do efektywnego wdrożenia na pojedynczym GPU. Ornith-1.0-9B

Qwen3.5-9B Qwen3.5-35B Gemma4-12B Gemma4-31B Agentic Coding Terminal-Bench 2.1 (Terminus-2) 43.1 21.3 41.4 21 42.1 Terminal-Bench 2.1 (Claude Code) 40.6 18.9 38.9 – – SWE-bench Verified 69.4 53.2 70 44.2 52 SWE-bench Pro 42.9 31.3 44.6 27.6 35.7 SWE-bench Multilingual 52 39.7 60.3 32.5 51.7 NL2Repo 27.2 16.2 20.5 10.3 15.5 Claw-eval Avg 63.1 53.2 65.4 32.5 48.5 SWE Atlas – QnA 17.9 9.2 13.2 – – SWE Atlas – RF 16.6 4.3 10.2 – – SWE Atlas – TW 15.3 4.4 9.8 –

  • * Terminal-Bench 2.1 (Terminus-2): Oceniamy Terminal-Bench 2.1 przy użyciu frameworka Harbor/Terminus-2 z parser=json, temperature=1.0, topp=1.0 i oknem kontekstowym 128K. Każde uruchomienie korzysta z limitu czasowego 4 godzin z 32 rdzeniami CPU i 48GB RAM, a wyniki są uśredniane na podstawie 5 uruchomień. Dostosowujemy szablon czatu Qwen, aby zapewnić spójność między treningiem a wnioskowaniem (https://huggingface.co/deepreinforce-ai/Ornith-1.0-397B/blob/main/chattemplate.jinja), i modyfikujemy Harbor, aby dostosować go do klucza reasoning_content vLLM.
  • Terminal-Bench 2.1 (Claude Code): Oceniamy Terminal-Bench 2.1 przy użyciu Claude Code 2.1.126 z parser=json, temperature=1.0, topp=1.0, maxnew_tokens=131072. Wyniki są uśredniane na podstawie 5 uruchomień. Ponownie, szablon czatu Qwen musi być zmodyfikowany.
  • SWE-Bench Verified, Pro i Multilingual: korzystając z harness OpenHands z temp=1.0, top_p=0.95, oknem kontekstowym 256k.
  • SWE Atlas QnA, RF, TW: korzystając z mini SWE agent harness z temp=1.0, top_p=0.95, oknem kontekstowym 128K. Wyniki są uśredniane na podstawie 5 uruchomień.
  • NL2Repo: z temperature=1.0, top_p=1.0, 400K kontekstu, 48K wyjścia i filtrami antyhackingowymi.
  • ClawEval: Benchmark kodowania agentycznego w oparciu o rozkłady zadań rzeczywistych użytkowników; temp=0.6 i 256K kontekstu. ? UWAGA

Ornith-1.0-9B jest modelem rozumującym: domyślnie asystent otwiera się z blokiem <think> … </think> przed ostateczną odpowiedzią. Poniższe przepisy serwujące umożliwiają parser rozumowania, aby łańcuch myślenia był zwracany w osobnym polu reasoningcontent, oraz parser wywołania narzędzia, aby bloki <toolcall> modelu były wyświetlane jako wywołania narzędzi w stylu OpenAI. Serwowanie Ornith-1.0-9B wymaga aktualnych środowisk: Transformers ≥ 5.8.1 vLLM ≥ 0.19.1 SGLang ≥ 0.5.9 Zalecane parametry próbkowania: temperature=0.6, topp=0.95, topk=20 (użyj temperature=1.0, aby odtworzyć zgłoszoną konfigurację benchmarku). Ornith-1.0-9B to gęsty model ~9B (≈19 GB w bf16), więc działa wygodnie na pojedynczym GPU 80GB. Poniższe przepisy uruchamiają serwer zgodny z OpenAI; dodaj --tensor-parallel-size / --tp, jeśli chcesz podzielić obciążenie na więcej GPU. Aby szybko przetestować lokalnie (lub zautomatyzować generację offline), załaduj model bezpośrednio z Transformers. Upewnij się, że masz zainstalowaną aktualną wersję — zobacz przewodnik instalacji Transformers; Ornith-1.0-9B wymaga transformers >= 5.8.1.

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON