monaltro . pl
← Dziennik
Web 23 cze 2026 · 11 min czytania · Zespół Monaltro

Dlaczego Twoja firma nie pojawia się w ChatGPT — GPTBot, ClaudeBot i robots.txt w 2026

ChatGPT, Perplexity i Claude nie odpowiadają na pytania z głowy — najpierw czytają Twoją stronę przez specjalne programy. Jeśli je przypadkowo zablokowałeś, znikasz z AI search. Pokazujemy, które boty blokować, a które przepuszczać.

ChatGPT, Perplexity i Claude nie odpowiadają na pytania z głowy — najpierw czytają Twoją stronę przez specjalne programy. Jeśli je przypadkowo zablokowałeś, znikasz z AI search. Pokazujemy, które boty blokować, a które przepuszczać.

Właściciel lokalnej firmy usługowej wpisuje w ChatGPT: „znajdź mi dobrego projektanta stron internetowych w Krakowie”. Dostaje listę konkurentów. Jego własna firma nie figuruje — mimo że ma świeżą stronę, regularnie pisze artykuły i dobrze radzi sobie w Google. Gdzie tkwi problem?

Odpowiedź często leży w jednym pliku na serwerze — robots.txt — który mówi botom internetowym, co mogą, a czego nie mogą odwiedzać. W erze klasycznego wyszukiwania chodziło głównie o Googlebot. Dziś do gry weszły dziesiątki botów od OpenAI, Anthropic i Perplexity, a reguły gry są inne. Ruch z wyszukiwarek AI urósł o 42,8% rok do roku — z 15,6 miliarda do 27,4 miliarda wizyt między Q1 2025 a Q1 2026, według analizy Contently z maja 2026. Ten kanał jest już realny, nie przyszłościowy.

Problem polega na tym, że wiele robots.txt było ustawianych kilka lat temu — albo przez wtyczkę, albo przez konfigurację hostingu — i nigdy nie wróciło się do nich po wybuchu popularności AI search. Blokada ustawiona defensywnie w 2022 roku może dziś wykluczać Cię z kanału, z którego Twoi klienci zaczynają szukać.

Dlaczego AI search nie działa jak Google

Klasyczna wyszukiwarka to katalog biblioteczny: pytasz, dostajesz listę książek do wyboru. AI search to coś innego — to bibliotekarz, który przeczytał wszystkie książki i odpowiada własnym zdaniem, cytując źródła.

Kluczowy mechanizm: żeby ChatGPT lub Perplexity mogły zacytować Twoją stronę, muszą ją najpierw przeczytać. Robią to przez crawlery — specjalne programy, które automatycznie odwiedzają strony i zapisują ich treść. Działanie jest identyczne jak w Googlebocie, ale firmy są różne, boty mają inne nazwy i — co kluczowe — inne user-agenty, które możesz kontrolować niezależnie.

Dwuetapowy proces wygląda tak: crawler pobiera treść Twojej strony → zapisuje ją w bazie danych → gdy użytkownik zadaje pytanie, model AI szuka w tej bazie → jeśli Twoja treść jest tam i odpowiada na pytanie, możesz być zacytowany. Jeśli crawler nie dotarł — nie ma Cię w bazie, nie ma cytowania.

Jak często boty AI odwiedzają strony? Częstotliwość zależy od bota i aktywności strony. Regularnie aktualizowane blogi firmowe mogą być odwiedzane przez OAI-SearchBot co kilka dni. Strony rzadko zmieniane — raz na kilka tygodni lub miesięcy. Blokada robots.txt wchodzi w życie od razu — bot ją sprawdza przy każdym wejściu.

Praktyczny test: Wejdź na swoją stronę i wpisz w przeglądarce https://twojastrona.pl/robots.txt. Zobaczysz plik tekstowy (lub błąd 404, jeśli plik nie istnieje). Jeśli widzisz linie User-agent: * i Disallow: /, masz problem — zablokowałeś wszystkich botów, w tym te odpowiedzialne za cytowania w AI search.

Dwa typy AI-botów, które musisz rozróżnić

Zanim zaczniesz cokolwiek edytować, zrozum kluczowe rozróżnienie: boty szkoleniowe i boty wyszukiwawcze to zupełnie inne programy z zupełnie innymi konsekwencjami blokady.

Boty szkoleniowe (training crawlers) czytają Twoją stronę, żeby poprawić przyszłe wersje modelu AI. Treść Twojego bloga może trafić do danych trenujących kolejny GPT-6 czy nową wersję Claude’a. Zablokowanie tych botów jest w pełni uzasadnioną decyzją biznesową — szczególnie jeśli tworzysz unikalne treści, których nie chcesz „oddawać” modelom komercyjnym za darmo. Decyzja ta nie wpływa na Twoją widoczność w aktualnych wynikach AI search.

Boty wyszukiwawcze (search/answer crawlers) czytają Twoją stronę, żeby móc zacytować ją w odpowiedzi dla konkretnego użytkownika tu i teraz. To one decydują o tym, czy pojawisz się w ChatGPT Search, Claude.ai lub Perplexity. Zablokowanie ich usuwa Cię z aktywnych odpowiedzi AI — bez względu na jakość Twojej strony.

Ostrzeżenie: Wiele poradników z 2022–2023 roku zalecało blokowanie „wszystkich zewnętrznych botów” ze względów wydajnościowych lub prywatności treści. Te wskazówki, pisane przed erą AI search, są dziś potencjalnie szkodliwe dla firm, które chcą zaistnieć w ChatGPT i Perplexity. Sprawdź datę ostatniej aktualizacji swojego robots.txt.

Kluczowa zasada: możesz blokować training crawlery i nadal być widoczny w AI search — bo to różne procesy, identyfikowane przez różne user-agenty w tym samym pliku. Jeden plik robots.txt może zawierać jednocześnie Disallow: / dla GPTBot i Allow: / dla OAI-SearchBot — instrukcje dotyczą konkretnych botów, nie całej kategorii. Właśnie to rozróżnienie warto wprowadzić do konfiguracji swojej strony.

Kto konkretnie odwiedza Twoją stronę w 2026

Każdy bot identyfikuje się przez tzw. user-agent — ciąg znaków, którym przedstawia się Twojemu serwerowi. To na podstawie tego identyfikatora robots.txt decyduje, kto może wejść, a kto nie.

Boty OpenAI (ChatGPT)

OpenAI prowadzi cztery różne programy, udokumentowane w oficjalnej dokumentacji developers.openai.com:

BotUser-agentCel
OAI-SearchBotOAI-SearchBot/1.3Indeksuje strony do wyników ChatGPT Search — to on decyduje o cytowaniach
GPTBotGPTBot/1.3Zbiera dane szkoleniowe do modeli OpenAI
ChatGPT-UserChatGPT-User/1.0Wchodzi na stronę, gdy konkretny użytkownik ChatGPT o to poprosi
OAI-AdsBotOAI-AdsBot/1.0Weryfikuje strony docelowe reklam pod kątem bezpieczeństwa

Dla większości MŚP najważniejszy jest OAI-SearchBot — jego przepuszczenie lub zablokowanie decyduje bezpośrednio o obecności w ChatGPT Search. GPTBot to trening — możesz go zablokować bez utraty widoczności w wyszukiwaniu.

Boty Anthropic (Claude)

Anthropic prowadzi analogiczny podział, potwierdzony w centrum pomocy support.claude.com:

BotUser-agentCel
Claude-SearchBotClaude-SearchBotIndeksuje strony do Claude.ai search
ClaudeBotClaudeBotDane szkoleniowe dla modeli Anthropic
Claude-UserClaude-UserAktywny, gdy użytkownik Claude zadaje pytanie wymagające wyjścia do sieci

Anthropic udostępnia listę adresów IP swoich botów pod adresem claude.com/crawling/bots.json — przydatne, gdy chcesz granularnie zarządzać ruchem na poziomie WAF, a nie tylko przez robots.txt.

Boty Perplexity

Perplexity dokumentuje dwa główne agenty w docs.perplexity.ai:

BotUser-agentCel
PerplexityBotPerplexityBot/1.0Indeksuje strony do wyników Perplexity — oficjalnie nie zbiera danych szkoleniowych
Perplexity-UserPerplexity-User/1.0Odpowiada na pytania użytkownika w czasie rzeczywistym

Warta odnotowania informacja z oficjalnej dokumentacji: Perplexity-User oficjalnie ignoruje robots.txt — bo użytkownik inicjuje żądanie. To zupełnie inne uzasadnienie etyczne niż stealth crawling, ale praktyczny efekt jest taki sam: ta wejście następuje bez względu na ustawienia robots.txt. Do tego wrócimy w kolejnej sekcji.

Co z Google-Extended i innymi?

Google prowadzi dwa osobne boty do powiązanych celów: Google-Extended zbiera dane do trenowania modeli Gemini i jest osobny od Googlebot (który indeksuje do klasycznej wyszukiwarki). Blokowanie Google-Extended nie wpływa na pozycje w Google Search, ale może zmniejszyć szanse na cytowanie przez Gemini.

Inne boty warte uwagi: meta-externalagent (Meta AI), Applebot-Extended (Apple Intelligence — zbiera dane do Siri i Apple AI), Bytespider (TikTok / ByteDance, kontrowersyjny historią ignorowania dyrektyw robots.txt).

Jak sprawdzić, czy AI-boty już odwiedziły Twoją stronę

Przed konfiguracją warto zobaczyć, z kim faktycznie masz do czynienia. Jeśli używasz Cloudflare (nawet na bezpłatnym planie), wejdź w Security → Events i filtruj po User Agent zawierającym GPTBot, ClaudeBot lub PerplexityBot. Zobaczysz historię wizyt.

Jeśli masz bezpośredni dostęp do logów serwera (nginx, Apache), szukaj tych wzorców:

grep -E "GPTBot|OAI-SearchBot|ClaudeBot|PerplexityBot" /var/log/nginx/access.log | tail -50

Brak wpisów może oznaczać jedno z trzech: boty jeszcze nie trafiły na Twoją stronę (np. nowe domeny), masz aktywną blokadę, lub Cloudflare blokuje je na poziomie WAF zanim dotrą do logów.

Jak skonfigurować robots.txt — gdzie to znaleźć i jak edytować

Plik robots.txt leży zawsze w katalogu głównym domeny — twojastrona.pl/robots.txt. Sposób edycji zależy od platformy.

WordPress: Jeśli używasz Yoast SEO (lub Rank Math), plik można edytować z poziomu panelu admina: SEO → Narzędzia → Edytor pliku Robots. Zmiany są zapisywane i odczytywane przez boty natychmiast. Jeśli nie używasz tych wtyczek, plik leży fizycznie w katalogu głównym WordPressa i można go edytować przez FTP lub menedżer plików w panelu hostingowym.

Astro / strony statyczne: Plik robots.txt umieszcza się w katalogu public/ — zostaje skopiowany do katalogu głównego przy każdym buildzie. Przykładowa lokalizacja: public/robots.txt. Zmiany wchodzą w życie po następnym deploy.

Next.js: Od Next.js 13.3 można zdefiniować robots.ts w app/ i generować plik automatycznie. Alternatywnie — plik statyczny w public/robots.txt.

Strategia A — Przepuść wszystko, w tym szkolenia (maksymalna widoczność)

Jeśli zależy Ci na obecności wszędzie i nie martwisz się tym, że treść trafi do danych szkoleniowych modeli:

User-agent: *
Allow: /

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

Odpowiednia dla firm, które tworzą treści przeznaczone do szerokiego upowszechniania — portale informacyjne, blogi edukacyjne, firmy budujące markę przez zasięg.

Strategia B — Zablokuj szkolenia, przepuść wyszukiwanie (rekomendowana dla większości MŚP)

Ta strategia gwarantuje widoczność w AI search, jednocześnie chroniąc treść przed użyciem do trenowania modeli.

# Boty szkoleniowe — blok
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: Applebot-Extended
Disallow: /

# Boty wyszukiwawcze — przepuść
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

To najlepszy kompromis dla firm, które chcą być cytowane w ChatGPT i Claude, a jednocześnie nie oddawać treści do przyszłych wersji modeli.

Strategia C — Zamknij wszystko (dla firm z wrażliwymi danymi)

Kancelarie prawne, biura rachunkowe i inne firmy, które publikują profesjonalne treści wymagające ochrony:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: Claude-SearchBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Pamiętaj: strategia C usuwa Cię z AI search w zamian za pełną kontrolę nad dystrybucją treści.

Przypadek Perplexity — kiedy robots.txt nie wystarczy

Cloudflare opublikował raport, który wstrząsnął branżą webmasterów: Perplexity używał ukrytych crawlerów, które udawały zwykłe przeglądarki (Chrome na macOS), żeby ominąć bloki robots.txt. Równolegle do 20–25 milionów dziennych zapytań deklarowanych przez oficjalnego Perplexity-User, firma generowała 3–6 milionów niezadeklarowanych zapytań z adresów IP spoza oficjalnej listy. Proceder dotknął dziesiątek tysięcy domen.

Cloudflare zareagował, usuwając Perplexity z listy weryfikowanych botów i dodając dedykowane reguły wykrywające to zachowanie — dostępne nawet dla użytkowników bezpłatnego planu.

Co to oznacza w praktyce?

Jeśli używasz Cloudflare jako swojego CDN — a korzysta z niego ogromna część stron na Astro, Next.js i WordPress — możesz włączyć dedykowaną ochronę w panelu: Security → Bots → Block AI Bots. Funkcja ta daje granularną kontrolę per-bot: możesz zablokować stealth Perplexity i Bytespider, jednocześnie przepuszczając OAI-SearchBot i PerplexityBot (deklarowany).

Jeśli nie używasz Cloudflare, jedyną skuteczną obroną przed botami ignorującymi robots.txt jest blokowanie adresów IP na poziomie serwera lub WAF. Adresy botów Perplexity są dostępne pod perplexity.com/perplexitybot.json — można je automatycznie pobierać i aktualizować reguły firewalla za pomocą prostego skryptu cron.

Warto też pamiętać, że Perplexity-User oficjalnie deklaruje ignorowanie robots.txt — ponieważ działa na żądanie żywego użytkownika, nie jako automatyczny crawler. Zdaniem Perplexity, użytkownik ma prawo zlecić botowi wejście na dowolną stronę, analogicznie jak przeglądarka ignoruje meta-tagi noindex (bo to instrukcja dla robotów indeksujących, nie dla przeglądarek). Jest to kwestia interpretacyjna i etycznie kontrowersyjna — ale w praktyce oznacza, że Perplexity-User odwiedzi Twoją stronę niezależnie od robots.txt.

Co poza robots.txt decyduje o cytowaniu przez AI

Samo przepuszczenie bota to konieczny, ale niewystarczający warunek. Crawlerzy AI, podobnie jak Googlebot, preferują treści spełniające określone kryteria jakościowe.

Świeżość treści. AI search preferuje aktualne strony — regularnie aktualizowany blog firmowy ma wyraźną przewagę nad witryną, której ostatnia zmiana była dwa lata temu. Nie chodzi tu o sztuczne odświeżanie, ale o reagowanie na zmiany w branży.

Kompletność odpowiedzi. Boty AI szukają treści, które wyczerpująco odpowiadają na konkretne pytanie. Post, który kompleksowo wyjaśnia temat — z kontekstem, przykładami i ograniczeniami — ma większe szanse na cytowanie niż krótka notka z kilkoma zdaniami.

Autorytet i linki zewnętrzne. Podobnie jak w Google, strony z linkami od innych wiarygodnych domen są lepiej oceniane. Publikacje gościnne, wzmianki w branżowych mediach, cytowania w raportach — to buduje reputację, którą AI search uwzględnia.

Dane strukturalne (JSON-LD). Schema.org pomaga AI zrozumieć kontekst treści — czy to artykuł, lokalna firma, FAQ, czy produkt. Wpływ na cytowania w AI Overviews jest dokumentowany. Szczegółowo opisaliśmy mechanizm we wpisie o schema.org i AI Overviews dla MŚP.

Szybkość strony. Boty AI mają ograniczony czas na pobranie strony — zbyt wolna odpowiedź serwera może skutkować niekompletnym indeksowaniem. Strony z dobrymi Core Web Vitals są też częściej preferowane przez Googlebot, a analogiczne mechanizmy działają przy indeksowaniu AI.

Dostępność treści bez JavaScriptu. Część crawlerów AI nie renderuje JavaScriptu — pobierają surowy HTML i na nim opierają analizę. Jeśli treść Twojego bloga ładuje się dynamicznie przez JS (typowy problem w niektórych SPA), crawler może zobaczyć pustą stronę. Popularne frameworki z renderowaniem serwerowym (SSR) lub generowaniem statycznym (SSG) — jak Astro, Next.js czy Nuxt — domyślnie serwują gotowy HTML i są pod tym względem bezpieczne. Możesz to przetestować szybko: wpisz w terminalu curl -s "https://twojastrona.pl/artykul" i sprawdź, czy treść artykułu jest widoczna w zwróconym kodzie HTML.

Sitemapa XML. Chociaż większość crawlerów AI wykrywa linki samodzielnie, obecność sitemapy przyspiesza odkrycie nowych treści — szczególnie na nowych domenach i stronach z małą liczbą linków zewnętrznych. Jeśli Twoja sitemapa zawiera wpisy z lastmod, boty mogą priorytetyzować odwiedziny po zmianach, zamiast skanować niezmienione strony od nowa.

Podsumowanie

AI search rośnie zbyt szybko, żeby traktować go jako „przyszłościowy kanał do oceny”. Firmy, które dziś nie zarządzają swoim robots.txt pod kątem AI-botów, nieświadomie znikają z odpowiedzi ChatGPT, Claude i Perplexity — nawet jeśli ich strona jest świetnie zoptymalizowana pod Google. Warto też pamiętać, że zmiany w tym pliku działają natychmiast — bot sprawdza dyrektywę przy każdym wejściu, więc korekta zajmuje dosłownie kilka minut.

Wskazówka: Zacznij od sprawdzenia twojastrona.pl/robots.txt już dziś. Jeśli widzisz User-agent: * z Disallow: / na początku pliku — zablokowałeś absolutnie wszystko, w tym boty wyszukiwawcze. Jeśli masz User-agent: GPTBot z Disallow: / bez odpowiedniej reguły przepuszczającej OAI-SearchBot — stosujesz Strategię C bez świadomej decyzji. Dla większości firm usługowych rekomendujemy Strategię B: blok szkoleniowy, otwarte drzwi dla AI search.

Jeśli chcesz wiedzieć, jak skonfigurować robots.txt dla swojego projektu Astro lub WordPressa i jednocześnie zadbać o pozostałe aspekty widoczności technicznej — napisz do nas, chętnie zaczniemy od szybkiego audytu.

§ Zaczynamy

Napisz. Odpiszemy.

Umów 30 minut →