Przejdź do treści

Szczegóły modelu

KAT-Coder-V2.5-Dev

Status: AktywnyW trendach Hugging Face

Dostawca: Kwaipilot →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Modalność
Tekst → tekst
Główne zadanie
Generowanie tekstu
Biblioteka
Transformers

Opis modelu

To repozytorium zawiera wagi modelu i pliki konfiguracyjne dla modelu KAT-Coder-V2.5-Dev po treningu w formacie Hugging Face Transformers. Artefakty są zgodne z Hugging Face Transformers, vLLM, SGLang, KTransformers itp. Uwaga: ta wersja z otwartymi wagami zawiera tylko wagi modelu językowego i działa jako model tylko tekstowy; komponenty wizji/multimodalne nie są dołączone i są niedostępne. Po wydaniu KAT-Coder-V2.5 w lipcu, z przyjemnością ogłaszamy wydanie wersji z otwartymi wagami KAT-Coder-V2.5-Dev, modelu MOE z całkowitą liczbą parametrów wynoszącą 35B i 3B aktywowanych parametrów, aby wzmocnić komunikację z społecznością i zaprezentować nasze osiągnięcia badawcze.

  • Poprawa wydajności. Dzięki treningowi SFT/RL, KAT-Coder-V2.5-Dev osiąga wyniki SOTA w dziedzinie Agentic Coding wśród modeli o podobnych skalach parametrów.
  • Optymalizacja zachowań anormalnych. Dzięki treningowi RL, pewne anormalne zachowania zostały znacznie zoptymalizowane, takie jak: anormalne etykiety narzędzi -9pp (9.34% -> 0.28%), powtarzanie w jednym obiegu -0.34pp (0.34% -> 0%). Benchmark

KAT-Coder-V2.5-Dev Qwen3.5-27B Qwen3.6-35BA3B Gemma4-31B Qwen3.5-35BA3B Ornith-1.0-35B Gemma4-26BA4B Qwen3-Coder-30B Agent kodujący SWE-bench Zweryfikowane 69.40 68.60 64.40 60.60 58.60 55.80 35.80 31.80 SWE-bench Wielojęzyczny 63.00 57.67 57.00 49.33 47.67 51.67 27.33 20.67 SWE-bench Pro 45.96 42.13 40.63 32.97 38.03 34.47 9.58 19.84 Terminal-Bench 2.1 41.0232.60 / 49.44 34.8441.57 / 28.10 32.0234.83 / 29.20 32.5930.34 / 34.83 26.1226.44 / 25.80 35.9835.96 / 36.00 20.9427.27 / 14.60 13.5010.11 / 16.90 PinchBench 93.43 90.71 92.21 85.53 88.75 91.62 82.01 72.3 Scicode 44.20 25.58 37.53 33.19 27.73 30.34 30.84 18.27 KAT-Code-Bench 46.21 44.83 42.76 37.93 35.86 33.10 22.06 15.17 Dla Terminal-Bench 2.1, pogrubiona liczba to średnia z dwóch uchwytów agenta; małe liczby poniżej to wyniki na każdy uchwyt (Terminus-2 / Claude Code). 1. Metoda oceny. Wszystkie metryki przedstawione w tabeli są reprodukowane wewnętrznie: pobieramy publiczne punkty kontrolne modelu, wdrażamy je za pomocą vLLM lub SGLang i oceniamy w ramach zunifikowanego standardowego procesu. Żadne oficjalnie zgłoszone wyniki odpowiednich modeli nie są bezpośrednio przyjmowane w tej tabeli. Każdy model jest testowany tylko raz na każdym zbiorze oceny; ponowne testy są przeprowadzane tylko w przypadku stwierdzenia oczywistych błędów. 2. Konfiguracja oceny.

  • SWE-bench Zweryfikowane / Wielojęzyczne / Pro, KAT-Code-Bench: agent=claudecode@2.1.195, pass@k=1, temperatura=1.0, topp=0.95, 256k kontekst.
  • Terminal-Bench 2.1: agent=terminus-2 / claudecode, pass@k=1, temperatura=0.7, topp=1.0, 256k kontekst.
  • PinchBench: agent=openclaw@2026.3.13, pass@k=1, temperatura=0.7, top_p=1.0, 256k kontekst.
  • Scicode: pass@k=1, temperatura=0.6, top_p=1.0, 256k kontekst. 3. Opis anomalii.
  • Qwen3.6-35BA3B: Stwierdziliśmy, że w testach SWE-bench Zweryfikowane, SWE-bench Wielojęzyczne i SWE-bench Pro, nasze wyniki testów mają około 10 pp różnicy w porównaniu z oficjalnymi wynikami. Uważamy, że jest to głównie spowodowane wersją uchwytu i niektórymi optymalizacjami wprowadzonymi do zestawów testowych przez zespół Qwen, i nie powinno to być problemem z samym modelem.
  • Qwen3.5-35BA3B: Obserwowaliśmy częste halucynacje podczas oceny, w tym próby wywołania niedostępnego narzędzia MultiEdit w obecnym środowisku agenta, co negatywnie wpływa na końcową metrykę.
  • Gemma4-26B-A4B-it: Dwa główne czynniki pogarszające wydajność oceny: przepełnienie kontekstu (przekroczenie limitu 256k kontekstu) i halucynowane wywołania do nieobsługiwanego narzędzia MultiEdit w tej konfiguracji oceny.

Powyższe odchylenia wynikają z niezgodności między preferencjami narzędzi modelu a dozwolonym zestawem narzędzi w uchwycie oceny, a nie z wewnętrznych ograniczeń możliwości modeli.

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON