Szczegóły modelu
KAT-Coder-V2.5-Dev
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Modalność
- Tekst → tekst
- Główne zadanie
- Generowanie tekstu
- Biblioteka
- Transformers
Opis modelu
To repozytorium zawiera wagi modelu i pliki konfiguracyjne dla modelu KAT-Coder-V2.5-Dev po treningu w formacie Hugging Face Transformers. Artefakty są zgodne z Hugging Face Transformers, vLLM, SGLang, KTransformers itp. Uwaga: ta wersja z otwartymi wagami zawiera tylko wagi modelu językowego i działa jako model tylko tekstowy; komponenty wizji/multimodalne nie są dołączone i są niedostępne. Po wydaniu KAT-Coder-V2.5 w lipcu, z przyjemnością ogłaszamy wydanie wersji z otwartymi wagami KAT-Coder-V2.5-Dev, modelu MOE z całkowitą liczbą parametrów wynoszącą 35B i 3B aktywowanych parametrów, aby wzmocnić komunikację z społecznością i zaprezentować nasze osiągnięcia badawcze.
- Poprawa wydajności. Dzięki treningowi SFT/RL, KAT-Coder-V2.5-Dev osiąga wyniki SOTA w dziedzinie Agentic Coding wśród modeli o podobnych skalach parametrów.
- Optymalizacja zachowań anormalnych. Dzięki treningowi RL, pewne anormalne zachowania zostały znacznie zoptymalizowane, takie jak: anormalne etykiety narzędzi -9pp (9.34% -> 0.28%), powtarzanie w jednym obiegu -0.34pp (0.34% -> 0%). Benchmark
KAT-Coder-V2.5-Dev Qwen3.5-27B Qwen3.6-35BA3B Gemma4-31B Qwen3.5-35BA3B Ornith-1.0-35B Gemma4-26BA4B Qwen3-Coder-30B Agent kodujący SWE-bench Zweryfikowane 69.40 68.60 64.40 60.60 58.60 55.80 35.80 31.80 SWE-bench Wielojęzyczny 63.00 57.67 57.00 49.33 47.67 51.67 27.33 20.67 SWE-bench Pro 45.96 42.13 40.63 32.97 38.03 34.47 9.58 19.84 Terminal-Bench 2.1 41.0232.60 / 49.44 34.8441.57 / 28.10 32.0234.83 / 29.20 32.5930.34 / 34.83 26.1226.44 / 25.80 35.9835.96 / 36.00 20.9427.27 / 14.60 13.5010.11 / 16.90 PinchBench 93.43 90.71 92.21 85.53 88.75 91.62 82.01 72.3 Scicode 44.20 25.58 37.53 33.19 27.73 30.34 30.84 18.27 KAT-Code-Bench 46.21 44.83 42.76 37.93 35.86 33.10 22.06 15.17 Dla Terminal-Bench 2.1, pogrubiona liczba to średnia z dwóch uchwytów agenta; małe liczby poniżej to wyniki na każdy uchwyt (Terminus-2 / Claude Code). 1. Metoda oceny. Wszystkie metryki przedstawione w tabeli są reprodukowane wewnętrznie: pobieramy publiczne punkty kontrolne modelu, wdrażamy je za pomocą vLLM lub SGLang i oceniamy w ramach zunifikowanego standardowego procesu. Żadne oficjalnie zgłoszone wyniki odpowiednich modeli nie są bezpośrednio przyjmowane w tej tabeli. Każdy model jest testowany tylko raz na każdym zbiorze oceny; ponowne testy są przeprowadzane tylko w przypadku stwierdzenia oczywistych błędów. 2. Konfiguracja oceny.
- SWE-bench Zweryfikowane / Wielojęzyczne / Pro, KAT-Code-Bench: agent=claudecode@2.1.195, pass@k=1, temperatura=1.0, topp=0.95, 256k kontekst.
- Terminal-Bench 2.1: agent=terminus-2 / claudecode, pass@k=1, temperatura=0.7, topp=1.0, 256k kontekst.
- PinchBench: agent=openclaw@2026.3.13, pass@k=1, temperatura=0.7, top_p=1.0, 256k kontekst.
- Scicode: pass@k=1, temperatura=0.6, top_p=1.0, 256k kontekst. 3. Opis anomalii.
- Qwen3.6-35BA3B: Stwierdziliśmy, że w testach SWE-bench Zweryfikowane, SWE-bench Wielojęzyczne i SWE-bench Pro, nasze wyniki testów mają około 10 pp różnicy w porównaniu z oficjalnymi wynikami. Uważamy, że jest to głównie spowodowane wersją uchwytu i niektórymi optymalizacjami wprowadzonymi do zestawów testowych przez zespół Qwen, i nie powinno to być problemem z samym modelem.
- Qwen3.5-35BA3B: Obserwowaliśmy częste halucynacje podczas oceny, w tym próby wywołania niedostępnego narzędzia MultiEdit w obecnym środowisku agenta, co negatywnie wpływa na końcową metrykę.
- Gemma4-26B-A4B-it: Dwa główne czynniki pogarszające wydajność oceny: przepełnienie kontekstu (przekroczenie limitu 256k kontekstu) i halucynowane wywołania do nieobsługiwanego narzędzia MultiEdit w tej konfiguracji oceny.
Powyższe odchylenia wynikają z niezgodności między preferencjami narzędzi modelu a dozwolonym zestawem narzędzi w uchwycie oceny, a nie z wewnętrznych ograniczeń możliwości modeli.
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.