Przejdź do treści

Szczegóły modelu

Solar-Open2-250B

Status: AktywnyW trendach Hugging Face

Dostawca: Upstage →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Modalność
Tekst → tekst
Główne zadanie
Generowanie tekstu
Biblioteka
Transformers

Opis modelu

Solar Open 2 to model językowy o dużej wadze i otwartej architekturze 250B-A15B firmy Upstage, stworzony do zastosowań agentowych, takich jak produktywność biurowa, prace intensywne w dokumentach i kodowanie. Jego architektura Hybrid-Attention Mixture-of-Experts (MoE) z liniową uwagą zapewnia wysoce efektywną inferencję nawet w długich kontekstach. Raport techniczny | Blog | Strona internetowa UpstageSpecjalista agentowy: Stworzony specjalnie do przepływów pracy agentowych — wywoływanie narzędzi, wieloetapowe rozumowanie i realizacja zadań od początku do końca. Konkurencyjny z najsilniejszymi modelami o otwartej wadze w benchmarkach agentowych.

  • Minimalny koszt inferencji: Model MoE o 250B parametrach, który aktywuje tylko 15B na token, zbudowany na hybrydowej stosie uwagi, który przeplata trzy warstwy liniowej uwagi z jedną warstwą uwagi softmax — duża pojemność modelu przy niskim koszcie inferencji modelu.
  • Kontext 1M-Token: Warstwy liniowej uwagi kodują kolejność tokenów wewnętrznie w swoim stanie rekurencyjnym, więc kodowanie pozycyjne jest całkowicie usunięte (NoPE), podnosząc limit ekstrapolacji RoPE. Tylko 12 z 48 warstw przechowuje pamięć KV, trzymając pamięć długiego kontekstu na poziomie około jednej czwartej modelu all-softmax o tym samym kształcie.
  • Efektywnie trenowany przy niskim koszcie: Zainicjowany przez selektywny transfer wag z Solar Open 1 (102B) — tylko 2.3% wag, które przetrwały zmianę architektoniczną, są przenoszone, a wszystko inne jest losowo inicjowane — co podnosi punkt startowy i przyspiesza wczesną konwergencję na poziomie 250B.
  • Wielojęzyczny: Angielski, koreański i japoński.
PoleWartość
Nazwa modeluSolar Open 2 (250B-A15B)
ArchitekturaHybrid-Attention Mixture-of-Experts (MoE)
Łączna liczba parametrów250B (250,287,794,944)
Aktywne parametry15B (na token)
Warstwy48
Rozmiar ukryty4096
UwagaHybrydowa — Softmax + Liniowa Uwaga, wzór [Softmax, Linear×3] × 12
Kodowanie pozycyjneNoPE (brak kodowania pozycyjnego rotacyjnego)
Liczba głów uwagi (GQA)(Softmax) 64 zapytanie / 8 KV, (Liniowa) 64 zapytanie
Liczba ekspertów321 (320 routowane + 1 współdzielone)
Liczba aktywowanych ekspertów8 routowane (top-8) + 1 współdzielone
Słownik196,608
Długość kontekstu1M
Tokeny wstępnego treningu~12 bilion
Obsługiwane językiAngielski, koreański, japoński
Sprzęt do treninguNVIDIA B200 GPU
Czas GPU treningu2M godziny GPU
LicencjaLicencja Upstage Solar (zobacz LICENCJA)
Wymagania sprzętoweMinimum: H200 \ 4ea / Zalecane: H200 \ 8ea

Warianty do uruchomienia

Brak potwierdzonych danych o wariantach do pobrania. Nie zastępujemy brakujących wartości zerem ani szacunkiem VRAM.

Ostatnia aktualizacja: 2026-08-18

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Dyskusja jest chwilowo niedostępna.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Brak danych porównywalnych

Historia wyniku AI-TOP

Wykres pojawi się po zapisaniu co najmniej dwóch porównywalnych pomiarów.

Brak zapisanych obserwacji tego modelu.

Dane historii w formacie JSON