Szczegóły modelu
NVIDIA-Nemotron-Parse-2.0
Status: AktywnyW trendach Hugging Face
Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Główne zadanie
- Obraz i tekst → tekst
- Biblioteka
- Transformers
Opis modelu
Opis: NVIDIA Nemotron Parse 2.0 przekształca obrazy dokumentów w strukturalne, czytelne przez maszyny reprezentacje z tekstem, klasami układu, ramkami ograniczającymi i informacjami o kolejności czytania. Dany obraz dokumentu w kolorze czerwonym, zielonym i niebieskim (RGB) oraz polecenie zadania, model produkuje sformatowany tekst i adnotacje przestrzenne dla elementów dokumentu, takich jak tytuły, akapity, podpisy, tabele, wykresy, nagłówki stron, stopki, przypisy, obrazy i wpisy bibliograficzne. W porównaniu do NVIDIA Nemotron Parse v1.2, NVIDIA Nemotron Parse 2.0 dodaje około 20k-tokenową ekspansję słownictwa dla bardziej efektywnego wsparcia wielojęzycznego, analizę dokumentów z wykresami z tokenem class oraz zaktualizowane pokrycie treningowe dla dokumentów bogatych w wykresy/tabele. NVIDIA Nemotron Parse 2.0 jest przeznaczony do zrozumienia dokumentów, pozyskiwania informacji, ekstrakcji danych i wielomodalnych procesów kuracji danych. Ten model jest gotowy do użytku komercyjnego lub niekomercyjnego. Licencja/Warunki użytkowania: Obowiązujące warunki: Twoje korzystanie z tego modelu jest regulowane przez Umowę Licencyjną NVIDIA Open Model. Użycie tokenizera zawartego w tym modelu jest regulowane przez licencję CC-BY-4.0. Przypadek użycia: NVIDIA Nemotron Parse 2.0 jest zaprojektowany dla deweloperów i zespołów budujących inteligencję dokumentów, generację wspomaganą wyszukiwaniem (RAG), kuratorów, ekstraktorów i aplikacje AI agentowe. Może być używany do konwersji zeskanowanych lub renderowanych plików PDF, slajdów prezentacji, formularzy, raportów, tabel i stron dokumentów o mieszanej zawartości w strukturalne wyjścia do późniejszego indeksowania, wyszukiwania, analityki, tworzenia danych treningowych dla modeli oraz przeglądów przez ludzi. Najważniejsze cechy:
- Rozszerzone wsparcie dla wielojęzycznego OCR, z istotnymi zyskami w przypadku tekstów dokumentów w językach CJK i skryptach indyjskich.
- Ulepszona ekstrakcja tekstu ręcznie pisanego dla stron dokumentów zawierających nieformalne, ręcznie pisane lub przypominające notatki treści.
- Analiza wykresów do tabel, która może identyfikować obszary wykresów i przekształcać widoczne informacje wykresu w strukturalny tekst do późniejszego wykorzystania.
- Ulepszona obsługa tabel, w tym silniejsze wykrywanie tabel, odzyskiwanie struktury i ekstrakcja tekstu w dokumentach bogatych w tabele. Data wydania:
Hugging Face 3 sierpnia 2026 poprzez URL Odniesienia:
- Dokumentacja Hugging Face Transformers mBART
- Architektura modelu NVIDIA C-RADIO:
Typ architektury: model oparty na transformatorze z kodowaniem wizji i dekodowaniem.
Warianty do uruchomienia
Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Brak danych porównywalnych
Historia wyniku AI-TOP
Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.
Brak zapisanych obserwacji tego modelu.