AI-TOP.PL · aktualności
Gemini 3.5 Flash: Google przenosi inteligencję klasy premium do modelu budowanego na skalę

Nazwa „Flash” była dotychczas kojarzona przede wszystkim z szybkością, niskim opóźnieniem i kosztem niższym od modeli klasy Pro.
Gemini 3.5 Flash pokazuje zmianę tej definicji.
Google opisuje go jako model łączący inteligencję graniczną z szybkością potrzebną w rzeczywistych systemach. Został zaprojektowany dla epoki agentowej: ma uruchamiać podagentów, wykonywać procesy wieloetapowe i utrzymywać działanie w dłuższym horyzoncie.
To nie jest więc wyłącznie szybszy chatbot.
To model roboczy przeznaczony do działania wewnątrz złożonych procesów.
Flash przestaje oznaczać „wersję uproszczoną”
W starszym podziale portfolio modele Flash realizowały zadania szybkie i masowe, natomiast Pro obsługiwały problemy wymagające bardziej zaawansowanego rozumowania.
Gemini 3.5 Flash zaciera tę granicę.
Model ma wykonywać złożone pętle programistyczne, koordynować wielu agentów i realizować zadania wymagające licznych kolejnych decyzji. Google podkreśla nie tylko szybkość pojedynczej odpowiedzi, ale również zdolność do utrzymywania jakości podczas długiego procesu.
To istotna zmiana ekonomiczna.
W systemie agentowym koszt nie zależy wyłącznie od ceny jednego wywołania. Agent może wykonywać dziesiątki kroków, wielokrotnie korzystać z narzędzi, analizować ich wyniki i poprawiać własną pracę.
Model wystarczająco inteligentny, ale tańszy i szybszy od klasycznego modelu premium, może więc wygrać nie pojedynczy test, lecz cały proces.
Milion tokenów kontekstu i multimodalne wejście
Gemini 3.5 Flash obsługuje tekst, obrazy, wideo, dźwięk i dokumenty PDF. Limit danych wejściowych wynosi 1 048 576 tokenów, natomiast maksymalny wynik tekstowy może zawierać 65 536 tokenów.
Model wspiera między innymi:
- wykonywanie kodu,
- wywoływanie funkcji,
- wyszukiwanie w plikach,
- ustrukturyzowane odpowiedzi,
- pobieranie kontekstu z adresów URL,
- ugruntowanie w wyszukiwarce Google i Mapach,
- tryb rozumowania,
- eksperymentalną obsługę komputera.
Sama obecność miliona tokenów kontekstu nie oznacza jednak, że każde zadanie powinno przesyłać milion tokenów.
Duży kontekst ułatwia analizę rozległych repozytoriów i zbiorów dokumentów, ale zwiększa koszt, opóźnienie oraz ryzyko wprowadzenia szumu. Model nadal musi odnaleźć istotną informację wśród wielu danych, a organizacja powinna kontrolować, co rzeczywiście trafia do zapytania.
Duże okno kontekstu nie zastępuje dobrej architektury informacji.
Cennik pokazuje kilka sposobów używania tego samego modelu
W standardowym trybie Gemini 3.5 Flash kosztuje 1,50 dolara za milion tokenów wejściowych oraz 9 dolarów za milion tokenów wyjściowych. Tokeny zużyte podczas rozumowania są wliczane do ceny wyjścia.
Google oferuje również dwa tańsze tryby:
Batch — 0,75 dolara za wejście i 4,50 dolara za wyjście,
Flex — również 0,75 i 4,50 dolara.
Dla zadań wymagających wyższego priorytetu dostępny jest tryb kosztujący 2,70 dolara za wejście i 16,20 dolara za wyjście.
Ten cennik pokazuje, że wybór modelu nie kończy się na nazwie modelu. Ważny jest również sposób jego uruchomienia.
Proces wykonywany w nocy nie wymaga tej samej klasy dostępności co interaktywny asystent klienta. Masowe przetwarzanie dokumentów może korzystać z Batch. Operacje wykonywane w czasie rzeczywistym mogą uzasadniać tryb standardowy lub priorytetowy.
Porównując Gemini z innymi modelami, należy więc zestawiać nie tylko standardowe ceny API, lecz także dostępne tryby przetwarzania.
Wyszukiwanie może stać się osobnym składnikiem kosztu
Gemini 3.5 Flash może korzystać z ugruntowania za pomocą Google Search i Google Maps. W płatnym planie pierwsze 5000 zapytań miesięcznie jest objęte limitem wspólnym dla Gemini 3, a później koszt wynosi 14 dolarów za 1000 zapytań wyszukiwawczych. Jedno polecenie użytkownika może wygenerować więcej niż jedno zapytanie do wyszukiwarki.
Oznacza to, że koszt agenta badawczego nie kończy się na tokenach.
Model może wielokrotnie wyszukiwać informacje, pobierać strony, porównywać wyniki i dopiero później generować odpowiedź. W dużej skali opłata za grounding może stać się zauważalną częścią rachunku.
W systemie produkcyjnym warto więc mierzyć:
- liczbę zapytań modelu,
- liczbę zapytań do wyszukiwarki,
- liczbę kroków agenta,
- liczbę ponowień,
- koszt poprawnie zakończonego zadania.
Dopiero ten ostatni wskaźnik pozwala porównywać rzeczywistą efektywność modeli agentowych.
Komputer jako kolejne narzędzie modelu
Gemini 3.5 Flash oferuje obsługę komputera w wersji preview. Oznacza to możliwość analizowania interfejsu i wykonywania operacji w aplikacjach, które nie zawsze posiadają przygotowane API.
Jest to funkcja o dużym potencjale, ale również o wyższym ryzyku.
Agent obsługujący interfejs graficzny może trafić na zmieniony układ strony, komunikat błędu, reklamę, okno potwierdzenia albo niejednoznaczny element. Powinien działać w środowisku ograniczonym, rejestrować wykonane kroki i zatrzymywać się przed operacjami o wysokich konsekwencjach.
Słowo „preview” jest tutaj ważniejsze od marketingowego „computer use”.
Funkcja nadaje się do testów i wybranych procesów, lecz nie powinna automatycznie otrzymywać pełnych uprawnień do systemów organizacji.
Gdzie Gemini 3.5 Flash może mieć największy sens?
Model wygląda szczególnie interesująco w procesach wymagających połączenia czterech cech:
dużej liczby operacji,
złożonego rozumowania,
multimodalnych danych,
kontrolowanego kosztu.
Przykładami mogą być:
- przetwarzanie faktur i dokumentacji,
- agenci programistyczni pracujący iteracyjnie,
- analiza długich materiałów wideo i audio,
- systemy wyszukujące dane i tworzące raporty,
- wieloagentowe procesy biznesowe,
- klasyfikacja i przetwarzanie dużych kolekcji plików.
Model może być mniej racjonalnym wyborem dla najtrudniejszych, pojedynczych problemów, w których jakość ma znacznie większą wagę niż koszt i szybkość. W takich przypadkach nadal należy porównać go z modelami najwyższej klasy.
Flash nie oznacza automatycznie niskiego kosztu
Cena 1,50 dolara za wejście i 9 dolarów za wyjście jest atrakcyjna na tle wielu modeli granicznych. Nie oznacza jednak, że proces będzie tani.
Tokeny rozumowania są rozliczane jako wyjście. Agent może wykonywać wiele kroków. Grounding generuje osobne opłaty. Duże dokumenty zwiększają wejście, a analiza materiałów multimodalnych może być bardziej kosztowna niż prosty tekst.
Dlatego podczas pilotażu należy mierzyć nie tylko średnią cenę zapytania, lecz także rozkład kosztów.
Dziewięć prostych zadań i jedno niezwykle kosztowne może dać przyjemną średnią — oraz bardzo nieprzyjemną fakturę przy wzroście skali.
Wniosek AI-TOP.PL
Gemini 3.5 Flash nie powinien być oceniany jako „tańszy Gemini Pro”.
To odrębna propozycja: model o wysokich możliwościach, zaprojektowany do szybkiego i masowego wykonywania pracy agentowej.
Jego przewaga może ujawnić się nie w jednym benchmarku, lecz w relacji pomiędzy jakością, czasem, liczbą kroków i kosztem zakończonego procesu.
W rankingu modeli należy więc osobno ocenić:
- jakość odpowiedzi,
- działanie agentowe,
- wykorzystanie narzędzi,
- koszt tokenów,
- koszt wyszukiwania,
- efektywność w trybie Batch i Flex.
Gemini 3.5 Flash pokazuje, że kolejny etap rywalizacji nie dotyczy już wyłącznie najinteligentniejszego modelu.
Dotyczy inteligencji, którą można ekonomicznie uruchomić tysiące razy.