monaltro . pl
← Dziennik
Sztuczna Inteligencja 6 lip 2026 · 11 min czytania · Zespół Monaltro

Gemini 3.5 Flash — co zmienia się w twoich narzędziach AI od maja 2026

Gemini 2.5 Flash zostaje wyłączony w październiku 2026. Nowy model ma okno 1 miliona tokenów i tryb myślenia, ale jest droższy. Wyjaśniamy, co to oznacza dla firmy, która używa automatyzacji AI.

Gemini 2.5 Flash zostaje wyłączony w październiku 2026. Nowy model ma okno 1 miliona tokenów i tryb myślenia, ale jest droższy. Wyjaśniamy, co to oznacza dla firmy, która używa automatyzacji AI.

Wyobraź sobie, że możesz wgrać do asystenta AI cały swój cennik, historię zamówień za ostatnie pół roku i skrzynkę e-mailową z odpowiedziami do klientów — jednocześnie, w jednym zapytaniu. I że AI nie „zapomni” początku, gdy dojdzie do końca. To nie jest wizja przyszłości — to okno kontekstowe 1 miliona tokenów w Gemini 3.5 Flash, dostępnym od maja 2026.

W maju Google udostępniło Gemini 3.5 Flash jako stabilną wersję dla deweloperów i firm. Zmiana brzmi technicznie, ale ma konkretny wpływ na każdą firmę, która korzysta z narzędzi opartych na tym modelu — od chatbotów w platformach no-code do automatyzacji w n8n. Do tego Google ogłosiło, że poprzedni model (Gemini 2.5 Flash) zostanie wyłączony 16 października 2026. Masz cztery miesiące na zrozumienie, co się zmienia i czy cokolwiek musisz zrobić.

Co to jest Gemini 3.5 Flash i czym różni się od poprzednika

Gemini 3.5 Flash to model językowy od Google, dostępny przez API (w skrócie: interfejs, który pozwala programom „rozmawiać” z modelem AI). Większość właścicieli MŚP nie używa go bezpośrednio — korzystają z narzędzi, które pod spodem korzystają właśnie z takich modeli. Jeśli używasz chatbota zbudowanego na platformie no-code, automatyzacji przez n8n, albo narzędzia do analizy dokumentów zasilanego przez Google AI — z dużym prawdopodobieństwem gdzieś w tle pracuje właśnie Gemini.

Poprzednia wersja, Gemini 2.5 Flash, była przez ostatnie miesiące jednym z najpopularniejszych i najtańszych modeli na rynku — świetny stosunek ceny do jakości dla prostych i średniozłożonych zadań. Nowa wersja to nie tylko ulepszenie — to przeprojektowanie pod kątem systemów agentowych: automatyzacji składających się z wielu kroków, gdzie AI planuje, wykonuje i weryfikuje wyniki bez stałego nadzoru człowieka.

Kluczowe różnice:

  • Tryb myślenia (thinking): Gemini 3.5 Flash potrafi przed odpowiedzią „zastanowić się” — przetworzyć pytanie w kilku etapach wewnętrznego wnioskowania. Poprzedni model takiej funkcji nie miał w stabilnej formie.
  • Obsługa wielu narzędzi jednocześnie: Gemini 3.5 Flash może łączyć w jednym wywołaniu kilka narzędzi (np. wyszukiwanie + lokalizacja + obliczenia) bez oddzielnych kroków. W Gemini 2.5 Flash każde narzędzie wymagało osobnego wywołania.
  • Przeznaczenie: explicite zaprojektowany do wieloetapowych przepływów pracy, gdzie jeden model koordynuje działanie kilku narzędzi lub subagentów.
  • Okno kontekstowe: 1 048 576 tokenów (ok. 700–800 stron A4) — takie samo jak w 2.5 Flash. Różnica nie w rozmiarze, lecz w tym, że 3.5 Flash lepiej radzi sobie z przetwarzaniem długich dokumentów w kontekście zadań agentowych.
  • Cena: wyższa — ale o tym osobna sekcja.

Model jest dostępny zarówno przez Google AI Studio (bezpłatny interfejs graficzny w przeglądarce) jak i przez API z modelem gemini-3.5-flash. Obsługuje tekst, obrazy, pliki PDF, wideo i audio jako wejście — wyniki generuje jako tekst.

Okno 1 miliona tokenów w języku właściciela firmy

Słowo „token” brzmi abstrakcyjnie, więc przełóżmy na konkret. Jeden token to mniej więcej 3/4 słowa w języku angielskim albo ok. 0,5–0,6 słowa w polskim (polskie słowa mają więcej liter). Milion tokenów to mniej więcej 700–750 tysięcy słów — tyle co około 3–4 średniej wielkości powieści albo rok firmowych e-maili.

Dlaczego to ważne dla MŚP? Bo dotychczas AI miały ograniczoną „pamięć roboczą” — jeśli plik był za długi, trzeba go było dzielić na kawałki, przetwarzać osobno i sklejać wyniki. To wymagało albo niestandardowego kodu, albo systemu RAG (wyszukiwanie semantyczne — skomplikowana architektura z własną bazą danych wektorowych). Teraz wiele takich przypadków można rozwiązać prościej: wsadzimy całość do okna kontekstowego i zapytamy.

Konkretne przykłady dla firmy:

  • Analiza umów i dokumentów: wgraj kilka umów z kontrahentami i zapytaj „W której umowie termin płatności przekracza 30 dni?“. Zamiast czytać każdą samemu — AI wyciąga odpowiedź w kilkanaście sekund.
  • Przegląd historii korespondencji: skopiuj rok e-maili z jednym klientem i zapytaj „Gdzie pojawia się powtarzający się problem?“. Bez osobistego przeglądania każdego wątku.
  • Trenowanie chatbota na wzorcach odpowiedzi: zamiast ręcznie pisać FAQ, wgraj 200 przykładowych odpowiedzi, które dawałeś klientom, i poproś AI o zbudowanie bazy wiedzy.

Ważne zastrzeżenie: duże okno kontekstowe przyspiesza i upraszcza pracę, ale ma swoje ograniczenia. Wgranie 700 stron tekstu do jednego zapytania nie jest darmowe — tokeny wejściowe kosztują, a przy stawce $1,50/1M tokenów przetworzenie dużego dokumentu kilkukrotnie dziennie może wygenerować mierzalne koszty. Warto więc przemyśleć, które zadania rzeczywiście korzystają z długiego kontekstu, a które można obsłużyć krótszym promptem. Dla okazjonalnych analiz (raz w tygodniu, kilka dokumentów) koszty są minimalne. Dla przetwarzania dużych wolumenów codziennie — warto zaplanować budżet i rozważyć tryb Batch/Flex.

Więcej o tym, jak analizować dokumenty firmowe bez kodu, pisaliśmy przy okazji NotebookLM w Google Workspace — tamto narzędzie działa na podobnej zasadzie i ma darmowy plan.

Trzy praktyczne zastosowania dla MŚP

1. Automatyzacja z myśleniem — od prostego chatbota do asystenta decyzyjnego

Poprzednie modele świetnie odpowiadały na pytania według skryptu. Tryb thinking w Gemini 3.5 Flash sprawia, że model potrafi zmierzyć się z pytaniami niejednoznacznymi — tam, gdzie odpowiedź wymaga kilku kroków logicznych.

Przykład praktyczny: zamiast chatbota, który tylko odpowiada „tak, mamy tę usługę”, możesz zbudować asystenta, który przejrzy stan magazynowy, sprawdzi dostępność terminu i zaproponuje konkretną ofertę — bo model potrafi sam rozłożyć problem na etapy i przetworzyć każdy z nich.

Dla firm korzystających z n8n (narzędzia do automatyzacji): model gemini-3.5-flash jest już obsługiwany przez węzeł Google Gemini. Jeśli nie widzisz go na liście, możesz wpisać nazwę modelu ręcznie w trybie Expression. Upgrade z 2.5 do 3.5 Flash w istniejącym workflowie to zmiana jednego pola konfiguracyjnego.

2. Analiza wielu dokumentów naraz bez RAG

Dotychczasowe rozwiązania dla firm, które chciały zadawać pytania do własnej bazy dokumentów, wymagały systemu RAG — indeksowania plików, tworzenia bazy wektorowej, konfigurowania wyszukiwania semantycznego. To była i jest dobra architektura, ale wymaga wiedzy technicznej lub kosztownej konfiguracji.

Dla wielu prostszych przypadków — kilkadziesiąt dokumentów, historia e-maili, zbiór umów — duże okno kontekstowe pozwala po prostu wrzucić wszystko do jednego zapytania. To nie zastępuje RAG przy dużych bazach wiedzy, ale eliminuje potrzebę złożonego systemu dla codziennych potrzeb małej firmy.

Ograniczenie warte zapamiętania: Gemini 3.5 Flash generuje wyłącznie tekst. Jeśli potrzebujesz generowania obrazów jako wynik — to inny model lub inne narzędzie.

Dodatkowy koszt przy włączonym trybie myślenia: tokeny zużyte przez model podczas „wewnętrznego procesu wnioskowania” są rozliczane tak samo jak pozostałe tokeny wejściowe — według stawki $1,50/1M tokenów. Przy złożonych zadaniach thinking może wygenerować kilkaset dodatkowych tokenów na zapytanie. Warto to uwzględnić w estymacji kosztów, jeśli planujesz używać modelu intensywnie.

3. Koordynacja kilku narzędzi w jednym przepływie

Nowa generacja modeli Google jest zoptymalizowana pod combined tool use — połączenie kilku narzędzi w jednym zapytaniu. Zamiast osobnych kroków: najpierw Search, potem Maps, potem kalkulacja — model może zrobić to w jednym przebiegu.

Dla właściciela firmy, który używa platformy automatyzacji: oznacza to, że przepływy pracy z wieloma integracjami (CRM + e-mail + calendar + search) będą działać szybciej i bardziej niezawodnie na Gemini 3.5 Flash niż na 2.5 Flash.

Jak uruchomić Gemini 3.5 Flash bez programisty

Dwa podejścia — zależnie od tego, jak technicznie jest twój setup:

Opcja A — Google AI Studio (darmowe, bez kodu): Google AI Studio to przeglądarkowy interfejs graficzny pod adresem aistudio.google.com. Wchodzisz, logujesz się kontem Google i możesz od razu pracować z modelem Gemini 3.5 Flash — pisać prompty, wgrywać pliki PDF, testować scenariusze. Darmowy dostęp istnieje, choć Google nie podaje stałych widełek — aktualne ograniczenia widać w panelu po zalogowaniu i mogą się różnić w zależności od obciążenia infrastruktury.

Idealne do: testowania, analizy okazjonalnych dokumentów, prototypowania przed wdrożeniem płatnym.

Opcja B — przez narzędzie automatyzacji (n8n, Make, Zapier): Jeśli już masz przepływ pracy w n8n lub podobnym narzędziu i chcesz zaktualizować model z Gemini 2.5 Flash — wystarczy zmienić nazwę modelu w konfiguracji węzła na gemini-3.5-flash. Nie trzeba rekonfigurować klucza API ani zmieniać logiki przepływu. Integracja działa przez natywny węzeł Google Gemini lub Google Vertex AI. Jeśli model nie pojawi się na liście rozwijalnej — można go wpisać ręcznie w polu tekstowym.

Warto wiedzieć, że część platform SaaS, które „pod spodem” używają modeli Google, robi taką migrację automatycznie po stronie serwera. Zanim ręcznie cokolwiek zmieniasz — zapytaj dostawcę narzędzia, czy to już zrobił.

Jeśli dopiero zaczynasz z automatyzacją i nie wiesz, od czego zacząć budowanie promptów — obszerny przewodnik o skutecznym zlecaniu zadań AI opisuje podejście krok po kroku.

Cena: czy przejście na 3.5 Flash się opłaca?

Tu jest haczyk, który warto rozumieć przed podjęciem decyzji. Gemini 3.5 Flash jest droższy od poprzednika — nie o kilka procent, ale znacznie. Porównanie cennika (wg Google AI Developer pricing, lipiec 2026):

ModelKoszt wejścia (1M tokenów)Koszt wyjścia (1M tokenów)
Gemini 2.5 Flash$0,30$2,50
Gemini 3.5 Flash (Standard)$1,50$9,00
Gemini 3.5 Flash (Batch/Flex)$0,75$4,50

Wejście jest 5× droższe w trybie standardowym. Tryb Batch/Flex (dla zadań niewymagających natychmiastowej odpowiedzi) jest 2× tańszy niż Standard i może być sensowną opcją przy przetwarzaniu dokumentów, które nie wymagają odpowiedzi w czasie rzeczywistym.

Kiedy wyższy koszt ma sens dla MŚP?

  • Gdy używasz modelu do zadań, które wcześniej wymagały kilku wywołań — jedno dokładniejsze zapytanie do 3.5 Flash może zastąpić trzy do tańszego modelu.
  • Gdy potrzebujesz thinking mode — dla prostych zadań (pytania-odpowiedzi, klasyfikacja) Gemini 2.5 Flash był i jest wystarczający; nowy model wygrywa przy złożonych decyzjach wieloetapowych.
  • Gdy przeniesienie się na 3.5 Flash eliminuje RAG lub inne kosztowne komponenty architektury.

Kiedy 3.5 Flash nie jest potrzebny: Jeśli twój chatbot lub automatyzacja robią proste zadania — odpowiedzi na FAQ, klasyfikacja e-maili, ekstrakcja danych z faktur — nie ma powodu przepłacać. Gemini 2.5 Flash był do tego celu optymalny. Problem polega na tym, że nie będziesz już mógł z niego korzystać po październiku 2026 — musisz przenieść się na nowy model, ale nie koniecznie na najnowszy. Warto sprawdzić, czy twój dostawca platformy (chatbot, automatyzacja) oferuje alternatywne opcje modelowe.

Dobre pytanie do dostawcy brzmi: „Jakiego modelu używacie po wycofaniu Gemini 2.5 Flash i czy zmienią się koszty?“. Odpowiedź pomoże zdecydować, czy warto szukać alternatywy, czy po prostu poczekać na update po stronie platformy.

Ostrzeżenie: Jeśli płacisz za platformę SaaS, która „pod spodem” używa Gemini API i podniesie ceny w Q4 2026, prawdopodobną przyczyną będzie właśnie ta zmiana cennika. Warto zapytać swojego dostawcę: „Jakiego modelu Gemini używa platforma i kiedy planujesz przejście na 3.5?“.

Migracja przed październikiem 2026: co konkretnie sprawdzić

Gemini 2.5 Flash zostaje oficjalnie wyłączony 16 października 2026 (źródło: dokumentacja cyklu życia modeli Google Vertex AI, lipiec 2026). Co to oznacza w praktyce?

Krok 1: Sprawdź, czy twoje narzędzia używają Gemini

Zapytaj dostawcę swojego chatbota, platformy automatyzacji lub narzędzia AI: „Czy używacie Gemini API i jeśli tak, to której wersji?“. Większość dostawców SaaS sam zajmuje się migracją i zaktualizuje model w tle — ale warto to potwierdzić, żeby wiedzieć, czy i jak zmieni się działanie narzędzia.

Krok 2: Jeśli zarządzasz własnym n8n lub konfiguracją API

Zmiana jest prosta — w węźle Google Gemini (lub Google Vertex AI) zmieniasz model z gemini-2.5-flash na gemini-3.5-flash. Zrób to przed 16 października. Po tej dacie wywołania do gemini-2.5-flash przestaną działać i twój workflow się zatrzyma.

Krok 3: Przetestuj zachowanie modelu po zmianie

Nowy model może odpowiadać inaczej — szczególnie przy złożonych promptach. Po zmianie modelu uruchom kilka testowych scenariuszy i sprawdź, czy wyniki są zgodne z oczekiwaniami. Thinking mode domyślnie włączony może spowolnić czas odpowiedzi przy prostych zapytaniach — jeśli potrzebujesz szybkich odpowiedzi, sprawdź konfigurację thinking_level w dokumentacji API.

Krok 4: Przelicz koszty

Jeśli masz własny API key i płacisz za tokeny — przygotuj się na wzrost kosztu. Przeanalizuj dotychczasowe zużycie i sprawdź, czy nie opłaca się zastąpić Gemini 3.5 Flash tańszą alternatywą lub przełączyć część zadań na tryb Batch/Flex ($0,75 zamiast $1,50 za 1M tokenów wejściowych). Tryb Batch/Flex jest przeznaczony do zadań, które nie wymagają natychmiastowej odpowiedzi — przetwarzanie wsadowe dokumentów, generowanie raportów nocą, analizy historycznych danych. Dla takich przypadków jest sensowną optymalizacją kosztów.

Warto też monitorować, ile tokenów faktycznie zużywa thinking mode przy twoich zapytaniach — Google AI Studio pokazuje szczegóły zużycia tokenów po każdym wywołaniu.

Podsumowanie

  • Gemini 3.5 Flash jest dostępny od maja 2026 jako stabilna wersja — nowy model, nie aktualizacja poprzednika.
  • Okno 1 miliona tokenów otwiera praktyczne zastosowania: analiza wielu dokumentów naraz, przetwarzanie długich historii korespondencji, trenowanie chatbota na własnych danych — bez konieczności wdrożenia systemu RAG.
  • Tryb myślenia (thinking) sprawia, że model lepiej radzi sobie ze złożonymi, wieloetapowymi decyzjami — co ma znaczenie przy automatyzacjach wymagających planowania, nie tylko odpowiadania.
  • Gemini 2.5 Flash zostaje wyłączony 16 października 2026 — sprawdź, czy twoje narzędzia wymagają ręcznej aktualizacji konfiguracji.
  • Nowy model jest droższy: input 5× w trybie standardowym, 2,5× w trybie Batch/Flex. Dla prostych zadań zastanów się, czy wyższy koszt jest uzasadniony możliwościami.

Wskazówka: Zanim zaktualizujesz konfigurację automatyzacji na Gemini 3.5 Flash — przetestuj te same scenariusze na nowym modelu przez Google AI Studio (darmowe). To pozwoli ocenić różnicę w jakości odpowiedzi i ewentualną potrzebę dostosowania promptów, zanim zmiana trafi na produkcję. Jeśli chcesz porozmawiać o tym, jak wpiąć nowe możliwości Gemini w automatyzacje twojej firmy — chętnie podpowiemy.

§ Zaczynamy

Napisz. Odpiszemy.

Umów 30 minut →