Jeśli Twoja strona jest dostępna publicznie, to w tej chwili crawluje ją co najmniej kilka botów AI. Część z nich indeksuje treść, żeby Twoja firma pojawiła się w odpowiedziach ChatGPT lub Perplexity — to coraz ważniejszy kanał odkrywania usług. Część pobiera całą Twoją wiedzę, żeby wytrenować model językowy, i ten model nigdy nie poda Twojej strony jako źródła. A jeszcze inne działają w czasie rzeczywistym jako automatyczni agenci — sprawdzają ceny, wypełniają formularze, analizują ofertę w imieniu nieznanych użytkowników.
Dla właściciela strony firmowej to trzy zupełnie różne sytuacje wymagające różnych decyzji. Blokowanie wszystkiego sprawia, że firma znika z AI search. Blokowanie niczego sprawia, że treści firmowe zasilają cudze modele bez wiedzy właściciela i bez atrybucji.
Do niedawna jedynym narzędziem dla właściciela strony był plik robots.txt — lista próśb, którą każdy bot może po prostu zignorować. Od 1 lipca 2026 Cloudflare zmienił to podejście i udostępnił bezpłatnie wszystkim klientom granularne sterowanie ruchem botów AI według ich intencji, a nie wyłącznie tożsamości. To zmiana, którą warto skonfigurować zanim zrobi to za Ciebie automatyzm Cloudflare — nowe domyślne ustawienia wchodzą 15 września 2026.
Boty AI na Twojej stronie — trzy różne intencje
Cloudflare klasyfikuje boty według zachowania, nie według nazwy. To ważna różnica: jeden dostawca może wystawiać kilka botów o różnych intencjach. Od 1 lipca 2026 ta klasyfikacja przekłada się na trzy oddzielne konfiguracje.
Search — szuka dla Ciebie, ale Twoje treści to jego paliwo
Bot klasyfikowany jako Search indeksuje Twoją stronę, żeby odpowiadać na zapytania w swojej wyszukiwarce AI lub asystencie. Ściąga tekst, analizuje, buduje indeks i serwuje go użytkownikowi podczas rozmowy z chatbotem. Taka firma mówi: “chcę wiedzieć, co jest na Twojej stronie, żeby potem odesłać do Ciebie pytającego”.
Przykłady botów z tej kategorii: PerplexityBot, OAI-SearchBot (wyszukiwanie ChatGPT), MicrosoftCopilotBot, Applebot-Extended, DuckAssistBot.
Ta kategoria jest niejednoznaczna: blokując boty Search, ryzykujesz, że Twoja firma nie pojawi się w odpowiedziach ChatGPT, Perplexity ani Microsoft Copilot. To nowe kanały wyszukiwania, które zaczynają przyciągać realny ruch do stron firmowych — szczególnie dla zapytań lokalnych i specjalistycznych. Zazwyczaj warto je przepuścić.
Agent — działa w czasie rzeczywistym za kogoś
Bot klasyfikowany jako Agent nie indeksuje — wykonuje zadania. W czasie rzeczywistym, w imieniu konkretnego użytkownika, może sprawdzić dostępność produktu, odczytać ceny z listy, porównać ofertę z konkurencją, a nawet wypełnić formularz. Agenci to programy, które człowiek uruchamia zamiast samodzielnie przeglądać strony.
Przykłady: ChatGPT-User (kiedy użytkownik ChatGPT wysyła go na stronę), Claude-Web (Anthropic), Perplexity-User, a także klienci korzystający z protokołu MCP — agentów łączących się z narzędziami przez Model Context Protocol.
Agenci to kategoria, przy której decyzja jest najbardziej zależna od kontekstu. Jeśli prowadzisz sklep lub serwis z cennikiem, agenci mogą przynosić zamówienia od użytkowników AI. Jeśli masz stronę z formularzem kontaktowym i zależy Ci na ludzkich klientach, możesz je blokować bez strat.
Training — pobiera treści na stałe do modelu
Bot klasyfikowany jako Training pobiera Twoje teksty, żeby wbudować je w model językowy. Kiedy taki model zostanie wytrenowany, “wie” to, co napisałeś — ale nie poda Cię jako źródła, nie wyśle do Ciebie ruchu i nie zapłaci za dostęp do wiedzy. Twoje treści po prostu stają się częścią cudzego produktu.
Przykłady: GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended, Bytespider (ByteDance/TikTok), CCBot (Common Crawl, źródło treningowe dla wielu modeli open source).
Cloudflare od 1 lipca 2026 traktuje boty mieszane — czyli takie, które łączą zachowanie Search z Training — jako Training. Wcześniejszy przełącznik „Block AI bots” te boty wyłączał z blokady. Teraz konfiguracja blokady Training ich dotyczy.
Uwaga: Jeden bot może mieć więcej niż jedną klasyfikację. Cloudflare stosuje etykiety na podstawie zachowania i deklaracji dostawcy, nie wyłącznie nazwy bota — wg dokumentacji z 1 lipca 2026 (
developers.cloudflare.com/bots/concepts/bot/).
Dlaczego robots.txt przestał wystarczać
Przez ostatnie dwa lata standardowym narzędziem dla właścicieli stron był plik robots.txt — lista dyrektyw, która informuje boty, czego nie powinny odwiedzać. Właściciel strony mógł napisać User-agent: GPTBot i Disallow: /, a OpenAI twierdziła, że to szanuje.
Problem polega na tym, że robots.txt to prośba, a nie blokada techniczna. Compliance jest dobrowolny. Przeglądarki nie mogą pobierać stron ignorując CSS — ale boty mogą ignorować robots.txt i nikt ich za to nie wyłączy.
Część firm AI dotrzymuje słowa dla swoich botów treningowych. Inne boty — szczególnie te od mniejszych lub agresywniej działających dostawców — regularnie ignorują reguły. Właściciel strony nie miał technicznego mechanizmu, by powiedzieć “nie” w sposób egzekwowalny. Mógł tylko zapisać preferencję i liczyć, że zostanie uszanowana.
Cloudflare daje teraz właścicielom stron możliwość egzekwowania tych reguł — bot próbujący pobrać stronę po prostu dostaje blokadę na poziomie sieci, zanim zapytanie dotrze do serwera. To technicznie inny poziom ochrony niż dyrektywa w pliku tekstowym.
Jeśli chcesz dowiedzieć się, jak wcześniej wyglądało ustawianie robots.txt pod boty AI i które boty deklaratywnie go szanują, wyjaśniliśmy to w artykule o GPTBot, ClaudeBot i PerplexityBot. Tu przechodzimy od prośby do blokady.
Co Cloudflare ogłosił 1 lipca 2026 — granularne przełączniki zamiast jednego togla
Cloudflare zaktualizował narzędzia ochrony botów AI 1 lipca 2026. W oficjalnym changelogu czytamy:
Wszyscy klienci mogą teraz zarządzać crawlerami AI według zachowania — Search, Agent i Training — zamiast jednego przełącznika „Block AI bots”. — Cloudflare Bots Changelog, 1 lipca 2026
Stary przełącznik „Block AI bots” był zero-jedynkowy — blokował część botów treningowych, ale pomijał boty mieszane (te z zachowaniem Search i Training jednocześnie). Od teraz każda z trzech kategorii ma osobną konfigurację z trzema opcjami do wyboru:
| Opcja | Co robi |
|---|---|
| Block (wszystkie strony) | Blokuje daną kategorię botów w całym serwisie, niezależnie od zawartości strony |
| Block on pages with ads | Cloudflare automatycznie wykrywa strony wyświetlające reklamy i blokuje boty tylko tam — reszta strony pozostaje otwarta |
| Allow | Przepuszcza boty z tej kategorii bez ograniczeń |
Opcja „Block on pages with ads” jest nowością skierowaną do wydawców treści i stron monetyzowanych reklamami — pozwala chronić te strony bez zamykania całego serwisu na boty AI.
Stary przełącznik znika 15 września 2026
Dotychczasowy „Block AI bots” jest planowany do wycofania 15 września 2026. Do tego czasu działa równolegle z nowymi ustawieniami. Jeśli masz go włączonego, Cloudflare przeniesie to ustawienie na nową konfigurację — ale konkretna migracja może różnić się od tego, co byś wybrał ręcznie.
Nowe domyślne ustawienia dla nowych domen od 15 września 2026
Cloudflare zapowiedział zmianę domyślnych wartości dla nowych domen rejestrowanych po 15 września 2026:
- Training → Block on pages with ads (automatycznie włączone)
- Agent → Block on pages with ads (automatycznie włączone)
- Search → Allow (bez zmian — wyszukiwarki AI nadal indeksują)
Istniejące domeny mogą już teraz wybrać ustawienia samodzielnie i zrezygnować z oczekiwania na automatyczne nowe domyślne wartości. Decyzja o konfiguracji to 5 minut w panelu — warto podjąć ją świadomie.
Jak włączyć i skonfigurować AI bot policies w panelu Cloudflare
Konfiguracja jest dostępna bezpłatnie dla wszystkich planów — Free, Pro, Business i Enterprise — bez konieczności wykupowania dodatkowych funkcji.
Ścieżka w nowym dashboardzie Cloudflare:
- Zaloguj się do panelu Cloudflare (
dash.cloudflare.com) i wybierz swoją domenę. - Przejdź do Security Settings (Ustawienia bezpieczeństwa).
- Przefiltruj sekcję według „Bot traffic”.
- Znajdź Configure AI bot policies — zobaczysz trzy sekcje (Search, Agent, Training) z przełącznikami dla każdej.
- Ustaw poziom blokady dla każdej kategorii i zapisz.
Zmiana jest natychmiastowa — nie wymaga ponownego wdrożenia strony, przebudowy DNS ani zmian w kodzie.
Rekomendowane ustawienie dla typowej strony firmowej MŚP bez reklam:
Search → Allow (widoczność w ChatGPT Search, Perplexity, Copilot)
Agent → Allow lub Block (zależnie od tego, czy spodziewasz się klientów z agentów AI)
Training → Block (ochrona treści przed trenowaniem cudzych modeli)Jeśli strona ma sekcję z cennikiem i formularzem kontaktowym, przepuszczenie agentów (Allow) może przynosić zapytania od użytkowników korzystających z AI asystentów. Decyzja nie jest jednoznaczna — warto sprawdzić Bot Analytics przez kilka tygodni i zobaczyć, skąd przychodzi ruch.
AI Labyrinth — pułapka dla botów ignorujących reguły
Cloudflare oferuje dodatkową warstwę ochrony, dostępną osobno: AI Labyrinth. Mechanizm jest elegancki — zamiast blokady, strona otrzymuje niewidoczne dla użytkowników linki z odpowiednimi tagami Nofollow. Te linki prowadzą do stron generowanych przez AI na bieżąco, tworząc labirynt nieskończonych treści.
Bot, który szanuje oznaczenia Nofollow, bezpiecznie je omija — nic się nie dzieje. Bot, który ignoruje oznaczenia i podąża za wszystkimi linkami, traci czas i zasoby na przeszukiwanie pułapki. Co ważniejsze, szczegóły nieposłusznego bota (sygnatura, zachowanie, IP) trafiają do bazy danych Cloudflare i pomagają chronić pozostałych klientów korzystających z blokady botów AI.
AI Labyrinth nie wpływa na SEO — Googlebot i inne legalne crawlery poprawnie rozumieją tagi Nofollow i ignorują pułapkę. Nie wpływa też na wygląd strony ani na szybkość ładowania dla użytkowników.
Włączenie AI Labyrinth w panelu:
- Security Settings > sekcja Bot traffic.
- Znajdź AI Labyrinth i przełącz na włączone.
To ustawienie jest niezależne od konfiguracji AI bot policies — można mieć jedno bez drugiego lub oba naraz.
Managed robots.txt — sygnał prawny uzupełniający blokadę techniczną
Poza blokadami technicznymi Cloudflare generuje automatycznie zarządzany plik robots.txt zawierający sformalizowane „sygnały treści” (content signals). Te sygnały odwołują się do art. 4 Dyrektywy UE 2019/790 o prawach autorskich na jednolitym rynku cyfrowym, który reguluje eksplorację tekstów i danych (text and data mining) w celach komercyjnych.
W praktyce: Cloudflare nie tylko technicznie blokuje boty, ale też tworzy formalną podstawę prawną dla ewentualnych roszczeń — robots.txt staje się dokumentem zastrzegającym prawa do treści w odniesieniu do przepisów UE. To może mieć znaczenie, gdy w przyszłości pojawią się regulacje lub postępowania dotyczące nieautoryzowanego pobierania treści do celów treningowych.
Sygnały w pliku obejmują trzy typy użycia: search (budowanie indeksu i wyniki wyszukiwania), ai-input (dostarczanie treści do modeli AI w czasie rzeczywistym), ai-train (trening lub fine-tuning modeli). Właściciel może dla każdego sygnału powiedzieć “tak”, “nie” lub nie podawać żadnej deklaracji.
Włączenie managed robots.txt:
- Security Settings > Bot traffic > robots.txt setting > włącz.
Jeśli strona ma już własny robots.txt, Cloudflare dołącza swoje dyrektywy na początku pliku — oba zbiory reguł działają razem. Cloudflare podkreśla: robots.txt to wyrażenie preferencji, blokada techniczna (Configure AI bot policies) to egzekwowanie. Oba mechanizmy można stosować jednocześnie.
Co to oznacza dla widoczności w AI search — i dlaczego nie blokuj wszystkiego
Najczęstszy błąd przy konfiguracji: blokowanie wszystkich botów AI en masse, bo “nie chcę, żeby AI scraping mój serwis”. Efekt uboczny: firma znika z wyników ChatGPT Search, Perplexity, Microsoft Copilot i Apple Intelligence.
Kluczowe rozróżnienie, które robi różnicę w praktyce:
ChatGPT jako wyszukiwarka używa OAI-SearchBot (kategoria Search, przychodzi jako indekser treści), nie GPTBot (kategoria Training, crawluje do trenowania modelu). Blokując Training, nie blokujesz indeksowania przez ChatGPT Search. Blokując Search — tak.
Perplexity do indeksowania wyszukiwarkowego używa PerplexityBot (Search), do pobierania treści w czasie rzeczywistym przez użytkownika — Perplexity-User (Agent). To dwa oddzielne boty w dwóch oddzielnych kategoriach z niezależną konfiguracją.
Google wystawia Googlebot jako standardowy crawler wyszukiwarki (w ogóle poza tym systemem, Google Search działa normalnie) i Google-Extended jako bota treningowego do Gemini i innych modeli AI. Blokowanie Google-Extended nie wpływa na pozycje w Google Search.
Ta granularność to właśnie sedno zmiany Cloudflare z 1 lipca 2026. Wcześniejszy przełącznik „Block AI bots” dotyczył głównie botów treningowych — ale granica między tym, co “szukuje” a co “trenuje” była niejasna dla właścicieli stron. Teraz Cloudflare sam klasyfikuje i daje przełączniki per kategoria.
Możliwa konfiguracja, która pozwala być widocznym w AI search, nie oddając treści do treningu:
Search → Allow (ChatGPT Search, Perplexity, Copilot indeksują → potencjalny ruch)
Agent → Allow (automatyczni klienci mogą odwiedzać → zależnie od biznesu)
Training → Block (nikt nie trenuje modelu na Twoich tekstach bez wiedzy i zgody)Dla strony firmowej z opisem usług, formularzem kontaktowym i artykułami blogowymi — ta konfiguracja jest sensowna i nie wymaga dalszych zmian ani monitorowania.
Bot Analytics — skąd wiedzieć, kto i jak crawluje Twoją stronę
Cloudflare oferuje Bot Analytics jako panel raportów do analizy ruchu botów na stronie. Dostępny z menu głównego: Security > Bots > Bot Analytics.
W Bot Analytics możesz zobaczyć:
- Udział ruchu botów w całym ruchu na stronie (procent i bezwzględna liczba requestów)
- Podział na wiarygodne boty (Verified bots), prawdopodobne boty (Likely bots) i ruch ludzki
- Szczegółowy podział dla konkretnych botów — ile requestów generuje GPTBot, ile OAI-SearchBot, ile ClaudeBot
Dla klientów na planie Business i Enterprise od 1 lipca 2026 dostępny jest BotBase — przeszukiwalna baza danych wszystkich znanych botów i agentów z ich klasyfikacją zachowania i ID detekcji. Pozwala sprawdzić, co konkretnie dany bot robi i jakie ma intencje przed decyzją o blokowaniu.
Podsumowanie
Cloudflare 1 lipca 2026 zastąpił jeden globalny przełącznik „Block AI bots” trzema osobnymi konfiguracjami: Search, Agent, Training. Dla każdej możesz wybrać blokadę całą stronę, blokadę tylko na stronach z reklamami lub brak blokady.
Dla typowej strony firmowej MŚP bez reklam sensowna konfiguracja to: Search = Allow (widoczność w AI search zachowana), Training = Block (ochrona treści przed nieautoryzowanym trenowaniem modeli), Agent = decyzja zależna od profilu biznesu. AI Labyrinth i managed robots.txt uzupełniają to o pułapkę dla nieposłusznych botów i formalny sygnał prawny oparty o dyrektywę UE 2019/790.
Wskazówka: Jeśli używasz Cloudflare i nie zmieniłeś jeszcze ustawień, sprawdź Security Settings > Configure AI bot policies — od 15 września 2026 Cloudflare zmieni domyślne ustawienia dla nowych domen. Istniejące domeny muszą decydować samodzielnie, a to tylko kilka kliknięć. Jeśli chcesz wiedzieć, jak Monaltro konfiguruje i zabezpiecza strony klientów przed agresywnymi botami, chętnie opowiemy szczegóły.
