Przejdź do treści

Szczegóły modelu

Poolside: Laguna M.1 (free)

Status: Aktywny

Dostawca: poolside →Dodaj do porównania

Profil techniczny

Kluczowe dane modelu

Pokazujemy wyłącznie dostępne, potwierdzone informacje.

Modalność
Tekst → tekst

Opis modelu

Get an API key · Release blog post · Technical report Laguna M.1 to model oparty na mieszance ekspertów (MoE) z łączną liczbą 225B parametrów i 23B aktywnymi parametrami na token, zaprojektowany do agentowego kodowania i długoterminowej pracy. > [!NOTE] > Aby uzyskać więcej informacji na temat treningu tego modelu, w tym naszego podejścia Model Factory, receptury potreningowej, asynchronicznego agentowego RL poza polityką i ocen, sprawdź nasz wpis na blogu oraz raport techniczny. Duży rzadki MoE do agentowego kodowania: Laguna M.1 to 70-warstwowy transformator MoE z 225B łącznymi parametrami i 23B aktywnymi parametrami na token. Wydajne kierowanie ekspertów: Po 3 gęstych warstwach SwiGLU, Laguna M.1 używa 67 rzadkich warstw MoE z 256 ekspertami, routingiem top-k=16 i równoważeniem obciążenia bez strat pomocniczych. Globalna architektura uwagi: Laguna M.1 używa globalnej uwagi we wszystkich warstwach z 64 głowicami Q, 8 głowicami KV i wyjściowym bramkowaniem uwagi softplus. Natywne wsparcie rozumowania: Przeplatane myślenie między wywołaniami narzędzi z obsługą włączania i wyłączania myślenia na żądanie. Silna wydajność agentowych benchmarków: Laguna M.1 jest konkurencyjna z najnowocześniejszymi modelami o otwartej wadze i granicznymi w SWE-bench Verified, SWE-bench Multilingual, SWE-Bench Pro i Terminal-Bench 2.0. Licencja Apache 2.0: Używaj i modyfikuj swobodnie do celów komercyjnych i niekomercyjnych.

  • Trening: etapy przedtreningu, potreningu i uczenia przez wzmacnianie.
  • Liczba parametrów: 225B łącznie z 23B aktywnymi na token.
  • Optymalizator: Muon.
  • Warstwy: 70 warstw z globalną uwagą.
  • Eksperci: 256 ekspertów z 1 wspólnym ekspertem; routing top-k=16.
  • Gęste warstwy: pierwsze 3 warstwy to gęsty SwiGLU; pozostałe 67 warstw to rzadki MoE.
  • Uwaga: 64 głowice Q, 8 głowic KV, wymiar głowicy 128, z wyjściowym bramkowaniem uwagi softplus.
  • Kodowanie pozycyjne: RoPE z YaRN.
  • Modalność: tekst-tekst.
  • Okno kontekstowe: 262 144 tokenów.
  • Wsparcie rozumowania: przeplatane myślenie z zachowaniem myśli.
ModelParametrySWE-bench VerifiedSWE-bench MultilingualSWE-Bench Pro (Public Dataset)Terminal-Bench 2.0
Laguna M.1225B-A23B74,6%63,1%49,2%45,8%
Devstral 2123B dense72,2%61,3%32,6%
GLM-4.7355B-A32B73,8%66,7%41,0%
DeepSeek-V4 Flash284B-A13B79,0%73,3%52,6%56,9%
Qwen3.5-397B-A17B397B-A17B76,2%69,3%50,9%52,5%

Claude Sonnet 4.6 · – · 79,6% · – · – · 59,1% · Użyliśmy najwyższych publicznie cytowanych wyników dla wszystkich porównywanych modeli w każdym benchmarku. W prawie wszystkich przypadkach były to oficjalne wyniki opublikowane w postach na blogu lub ich odpowiedniki, z Claude Sonnet 4.6 pokazanym jako graniczna zastrzeżona referencja porównywalnego rozmiaru modelu. „-” oznacza wynik niezgłoszony przez dostawcę modelu. > [!NOTE] > Wszystkie benchmarki dla Laguna M.1 zostały wykonane przy użyciu naszego narzędzia pool agent harness, z maksymalnie 500 krokami i wykonaniem w piaskownicy. Użyto tych samych parametrów próbkowania dla wszystkich benchmarków Laguna M.1: temperature=1,0 i top_k=20, z włączonym trybem myślenia i długością kontekstu 256K tokenów. Wszystkie zadania były uruchamiane we własnej piaskownicy przy użyciu 8 GB RAM/2 CPU, z wyjątkiem Terminal-Bench 2.0, który używał 48 GB RAM/32 CPU. > > Niektóre podstawowe obrazy zadań i weryfikatory zostały poprawione, aby rozwiązać problemy z niezawodnością infrastruktury nieodłączne w konfiguracji zadań, takie jak ograniczenia szybkości zależności stron trzecich w zewnętrznych rejestrach używanych przez weryfikator. Wszystkie cztery agentowe benchmarki zostały uruchomione z poprawionymi obrazami. Przeprowadziliśmy również ocenę nagród typu reward-hack post-hoc na przebiegach ewaluacyjnych Laguna M.1 i nie znaleziono znaczącego reward hackingu po wspólnej ocenie recenzenta i ręcznej kontroli. > > – SWE-bench Verified: średnia pass@1 uśredniona z 4 przebiegów > – SWE-bench Multilingual: średnia pass@1 uśredniona z 4 przebiegów > – SWE-Bench Pro: średnia pass@1 uśredniona z 4 przebiegów > – Terminal-Bench 2.0: średnia pass@1 uśredniona z 4 przebiegów; 48 GB RAM/32 CPU

Szybka opinia

Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.

Brak szybkich opinii.

Zaloguj się, aby oddać szybką opinię.

Ocena użytkowników

Brak ocen użytkowników. Wynik AI-TOP pozostaje odrębną miarą techniczną.

API i ceny

Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.

Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.

Brak aktualnej, porównywalnej oferty API.

Język polski

Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.

Dyskusja o modelu

Komentarze dotyczące praktycznego użycia tego modelu.

Nie ma jeszcze zatwierdzonych komentarzy.

Zaloguj się, aby komentować.

Historia modelu

Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.

Dane porównywalne

Historia wyniku AI-TOP

Seria używa snapshotów głównego rankingu z metodologii 1.2.

Skala adaptacyjna: obserwowany zakres 44,66–44,74 pkt / 100.

  • Wynik AI-TOP
Historia wyniku AI-TOPWykres obejmuje 2 dat od 2026-08-09 do 2026-08-10. Zakres osi: 44,66–44,74 pkt / 100. Skala osi jest adaptacyjna do obserwowanego zakresu.44,7444,7244,7044,6844,669 sie10 sie
Dzienny zapis wyniku, pozycji, źródeł i statusu
DataWynik AI-TOPMiejsceDane źródłoweMetodologiaStan dnia
2026-08-11
  • Brak snapshotu rankingu
  • Brak metryk źródłowych
  • Wycofanie źródłowej oferty API
2026-08-10
  • 44,68 / 100
  • #136
  • 1.2
  • Ranking zapisany
  • Brak metryk źródłowych
2026-08-09
  • 44,72 / 100
  • #136
  • 1.2
  • Ranking zapisany
  • Brak metryk źródłowych
2026-07-26
  • OpenRouter: popularność #32
  • Brak snapshotu rankingu
  • Źródła: 1
2026-07-25
  • OpenRouter: popularność #27
  • Brak snapshotu rankingu
  • Źródła: 1
2026-07-21
  • OpenRouter: popularność #14
  • Brak snapshotu rankingu
  • Źródła: 1
2026-07-20
  • OpenRouter: popularność #15
  • Brak snapshotu rankingu
  • Źródła: 1
2026-07-19
  • 47,54 / 100
  • #100
  • 1.1
  • Ranking zapisany
  • Brak metryk źródłowych
2026-07-18
  • OpenRouter: popularność #17
  • Brak snapshotu rankingu
  • Źródła: 1
  • Aktualizacja ceny API
2026-07-17
  • OpenRouter: popularność #17
  • Brak snapshotu rankingu
  • Źródła: 1
  • Aktualizacja ceny API

Dane historii w formacie JSON