Profil techniczny
Kluczowe dane modelu
Pokazujemy wyłącznie dostępne, potwierdzone informacje.
- Okno kontekstu
- 262 144tokenów · dane modelu/API
- Modalność
- Tekst → tekst
Opis modelu
Get an API key · Release blog post · Technical report Laguna M.1 to model oparty na mieszance ekspertów (MoE) z łączną liczbą 225B parametrów i 23B aktywnymi parametrami na token, zaprojektowany do agentowego kodowania i długoterminowej pracy. > [!NOTE] > Aby uzyskać więcej informacji na temat treningu tego modelu, w tym naszego podejścia Model Factory, receptury potreningowej, asynchronicznego agentowego RL poza polityką i ocen, sprawdź nasz wpis na blogu oraz raport techniczny. Duży rzadki MoE do agentowego kodowania: Laguna M.1 to 70-warstwowy transformator MoE z 225B łącznymi parametrami i 23B aktywnymi parametrami na token. Wydajne kierowanie ekspertów: Po 3 gęstych warstwach SwiGLU, Laguna M.1 używa 67 rzadkich warstw MoE z 256 ekspertami, routingiem top-k=16 i równoważeniem obciążenia bez strat pomocniczych. Globalna architektura uwagi: Laguna M.1 używa globalnej uwagi we wszystkich warstwach z 64 głowicami Q, 8 głowicami KV i wyjściowym bramkowaniem uwagi softplus. Natywne wsparcie rozumowania: Przeplatane myślenie między wywołaniami narzędzi z obsługą włączania i wyłączania myślenia na żądanie. Silna wydajność agentowych benchmarków: Laguna M.1 jest konkurencyjna z najnowocześniejszymi modelami o otwartej wadze i granicznymi w SWE-bench Verified, SWE-bench Multilingual, SWE-Bench Pro i Terminal-Bench 2.0. Licencja Apache 2.0: Używaj i modyfikuj swobodnie do celów komercyjnych i niekomercyjnych.
- Trening: etapy przedtreningu, potreningu i uczenia przez wzmacnianie.
- Liczba parametrów: 225B łącznie z 23B aktywnymi na token.
- Optymalizator: Muon.
- Warstwy: 70 warstw z globalną uwagą.
- Eksperci: 256 ekspertów z 1 wspólnym ekspertem; routing top-k=16.
- Gęste warstwy: pierwsze 3 warstwy to gęsty SwiGLU; pozostałe 67 warstw to rzadki MoE.
- Uwaga: 64 głowice Q, 8 głowic KV, wymiar głowicy 128, z wyjściowym bramkowaniem uwagi softplus.
- Kodowanie pozycyjne: RoPE z YaRN.
- Modalność: tekst-tekst.
- Okno kontekstowe: 262 144 tokenów.
- Wsparcie rozumowania: przeplatane myślenie z zachowaniem myśli.
| Model | Parametry | SWE-bench Verified | SWE-bench Multilingual | SWE-Bench Pro (Public Dataset) | Terminal-Bench 2.0 |
|---|---|---|---|---|---|
| Laguna M.1 | 225B-A23B | 74,6% | 63,1% | 49,2% | 45,8% |
| Devstral 2 | 123B dense | 72,2% | 61,3% | – | 32,6% |
| GLM-4.7 | 355B-A32B | 73,8% | 66,7% | – | 41,0% |
| DeepSeek-V4 Flash | 284B-A13B | 79,0% | 73,3% | 52,6% | 56,9% |
| Qwen3.5-397B-A17B | 397B-A17B | 76,2% | 69,3% | 50,9% | 52,5% |
Claude Sonnet 4.6 · – · 79,6% · – · – · 59,1% · Użyliśmy najwyższych publicznie cytowanych wyników dla wszystkich porównywanych modeli w każdym benchmarku. W prawie wszystkich przypadkach były to oficjalne wyniki opublikowane w postach na blogu lub ich odpowiedniki, z Claude Sonnet 4.6 pokazanym jako graniczna zastrzeżona referencja porównywalnego rozmiaru modelu. „-” oznacza wynik niezgłoszony przez dostawcę modelu. > [!NOTE] > Wszystkie benchmarki dla Laguna M.1 zostały wykonane przy użyciu naszego narzędzia pool agent harness, z maksymalnie 500 krokami i wykonaniem w piaskownicy. Użyto tych samych parametrów próbkowania dla wszystkich benchmarków Laguna M.1: temperature=1,0 i top_k=20, z włączonym trybem myślenia i długością kontekstu 256K tokenów. Wszystkie zadania były uruchamiane we własnej piaskownicy przy użyciu 8 GB RAM/2 CPU, z wyjątkiem Terminal-Bench 2.0, który używał 48 GB RAM/32 CPU. > > Niektóre podstawowe obrazy zadań i weryfikatory zostały poprawione, aby rozwiązać problemy z niezawodnością infrastruktury nieodłączne w konfiguracji zadań, takie jak ograniczenia szybkości zależności stron trzecich w zewnętrznych rejestrach używanych przez weryfikator. Wszystkie cztery agentowe benchmarki zostały uruchomione z poprawionymi obrazami. Przeprowadziliśmy również ocenę nagród typu reward-hack post-hoc na przebiegach ewaluacyjnych Laguna M.1 i nie znaleziono znaczącego reward hackingu po wspólnej ocenie recenzenta i ręcznej kontroli. > > – SWE-bench Verified: średnia pass@1 uśredniona z 4 przebiegów > – SWE-bench Multilingual: średnia pass@1 uśredniona z 4 przebiegów > – SWE-Bench Pro: średnia pass@1 uśredniona z 4 przebiegów > – Terminal-Bench 2.0: średnia pass@1 uśredniona z 4 przebiegów; 48 GB RAM/32 CPU
Ostatnia aktualizacja: 2026-08-18
Szybka opinia
Czy ten model pomógł Ci w realnym zadaniu? To zajmuje jedno kliknięcie. Szczegółowa ocena jest opcjonalna.
Brak szybkich opinii.
API i ceny
Ceny API są źródłowymi stawkami dostawcy, przeliczonymi na PLN według ostatniego zapisanego kursu średniego USD NBP. Stawki tokenowe pokazujemy za 1 mln tokenów. Dla obrazu, wyszukiwania, cache, reasoning i żądań zachowujemy jednostkę przekazaną przez API.
Ceny są przeliczone na PLN według ostatniego zapisanego średniego kursu NBP USD z 2026-08-17.
Brak aktualnej, porównywalnej oferty API.
Język polski
Wsparcie języka polskiego: deklarowane. Jakość języka polskiego: NIEZWERYFIKOWANA.
Dyskusja o modelu
Komentarze dotyczące praktycznego użycia tego modelu.
Nie ma jeszcze zatwierdzonych komentarzy.
Historia modelu
Wykres pokazuje wyłącznie porównywalne punkty głównego rankingu. Tabela zawiera wynik, pozycję, dane źródłowe i stan każdego dnia.
Dane porównywalne
Historia wyniku AI-TOP
Seria używa snapshotów głównego rankingu z metodologii 1.2.
Skala adaptacyjna: obserwowany zakres 44,66–44,74 pkt / 100.
- Wynik AI-TOP
| Data | Wynik AI-TOP | Miejsce | Dane źródłowe | Metodologia | Stan dnia |
|---|---|---|---|---|---|
| 2026-08-11 | — | — | — | — |
|
| 2026-08-10 |
|
| — |
|
|
| 2026-08-09 |
|
| — |
|
|
| 2026-07-26 | — | — |
| — |
|
| 2026-07-25 | — | — |
| — |
|
| 2026-07-21 | — | — |
| — |
|
| 2026-07-20 | — | — |
| — |
|
| 2026-07-19 |
|
| — |
|
|
| 2026-07-18 | — | — |
| — |
|
| 2026-07-17 | — | — |
| — |
|