Poradnik7 min czytania
Które roboty AI blokować w robots.txt, a które wpuścić?
Autor: Jacek Pawlos, fullstack developer z Bydgoszczy
Roboty AI dzielą się na trzy grupy: zbierające treści do trenowania modeli (GPTBot, ClaudeBot), indeksujące strony dla wyszukiwarek AI (OAI-SearchBot, Claude-SearchBot, PerplexityBot) i otwierające stronę na prośbę użytkownika (ChatGPT-User, Claude-User, Perplexity-User). Firma, która chce pojawiać się w odpowiedziach AI, powinna wpuścić co najmniej roboty wyszukiwarek - blokada robotów treningowych nie usuwa jej z wyszukiwania w ChatGPT czy Claude.
Plik robots.txt to kilka linijek tekstu w katalogu głównym domeny, a decyduje dziś także o tym, czy Twoją stronę czytają ChatGPT, Claude, Perplexity i Gemini. Każdy dostawca ma dwa-trzy roboty i każdy służy do czegoś innego, więc reguły kopiowane z forów często blokują akurat ten, który firma chciałaby wpuścić. Nazwy i role sprawdziłem w dokumentacji OpenAI, Anthropic, Perplexity, Google i Apple we wrześniu 2026 roku.
Jak robot czyta robots.txt?
Plik składa się z grup. Każda zaczyna się od linii User-agent z nazwą robota, a pod nią stoją reguły Allow (wolno) i Disallow (nie wolno) dla ścieżek na stronie. Grupa z gwiazdką dotyczy wszystkich robotów, które nie mają własnej grupy.
To ostatnie zdanie jest źródłem większości pomyłek. Robot stosuje się tylko do najlepiej pasującej grupy - jeśli dodasz osobną grupę dla GPTBota, reguły spod gwiazdki przestają go obowiązywać. Kto zablokował wszystkim katalog /admin, a potem dopisał osobną grupę dla jednego robota, musi tę blokadę powtórzyć także w nowej grupie.
Robots.txt jest prośbą, a nie zabezpieczeniem. Roboty dużych dostawców deklarują, że go przestrzegają, ale roboty uruchamiane przez użytkownika czatu mają wyjątki opisane niżej. Blokada działa też tylko na przyszłość: Anthropic pisze wprost, że zablokowanie ClaudeBota wyłącza z treningu przyszłe materiały strony, a nie to, co już zebrano.
Które roboty AI odwiedzają strony i do czego służą?
Tabela obejmuje roboty, o które najczęściej pytają właściciele stron. Opisy i skutki blokady pochodzą z dokumentacji dostawców, bez moich interpretacji:
| Robot | Firma | Do czego służy | Co daje blokada w robots.txt |
|---|---|---|---|
| GPTBot | OpenAI | Zbiera treści do trenowania modeli | Treść nie trafia do treningu; wyszukiwanie w ChatGPT działa niezależnie |
| OAI-SearchBot | OpenAI | Indeksuje strony dla wyszukiwania w ChatGPT | Strona nie pojawia się w odpowiedziach wyszukiwania ChatGPT (może zostać jako link nawigacyjny) |
| ChatGPT-User | OpenAI | Otwiera stronę, gdy prosi o to użytkownik czatu albo Custom GPT | OpenAI zastrzega, że reguły robots.txt mogą go nie dotyczyć |
| ClaudeBot | Anthropic | Zbiera treści, które mogą trafić do trenowania modeli | Przyszłe treści strony są wyłączone z treningu |
| Claude-SearchBot | Anthropic | Indeksuje strony, żeby poprawić wyniki wyszukiwania w Claude | Strona nie jest indeksowana na potrzeby wyszukiwania |
| Claude-User | Anthropic | Pobiera stronę, gdy użytkownik zada pytanie w Claude | Claude nie pobierze strony w odpowiedzi na pytanie - mniejsza widoczność |
| PerplexityBot | Perplexity | Indeksuje strony do wyników Perplexity; według firmy nie służy do trenowania modeli | Strona nie trafia do indeksu Perplexity |
| Perplexity-User | Perplexity | Otwiera stronę podczas odpowiadania na pytanie użytkownika | Według dokumentacji zwykle ignoruje robots.txt |
| Google-Extended | Znacznik bez własnego robota: trening modeli Gemini i ugruntowanie odpowiedzi w aplikacji Gemini i Vertex AI | Nie wpływa na obecność w wyszukiwarce Google ani na pozycje | |
| Googlebot | Indeksuje strony do wyszukiwarki, w tym do AI Overviews i trybu AI | Strona znika z Google | |
| Applebot | Apple | Zasila wyszukiwanie w Spotlight, Siri i Safari | Strona znika z tych funkcji |
| Applebot-Extended | Apple | Znacznik bez własnego robota: czy dane z Applebota mogą trenować modele Apple | Treść nie trenuje modeli Apple, wyniki w Siri i Safari zostają |
| Bingbot | Microsoft | Indeksuje strony do Binga, z którego korzysta Copilot | Strona znika z Binga i z odpowiedzi Copilota |
Co blokować, jeśli zależy Ci na widoczności w AI?
Najważniejsze jest rozróżnienie między treningiem a wyszukiwaniem. OpenAI pisze, że każde ustawienie jest niezależne: możesz wpuścić OAI-SearchBota, żeby pojawiać się w wyszukiwaniu ChatGPT, i jednocześnie zablokować GPTBota, żeby treść nie trafiała do treningu. Tak samo rozdziela to Anthropic (ClaudeBot i Claude-SearchBot), a Google i Apple mają osobne znaczniki do treningu, które nie ruszają wyszukiwarki.
Na swojej stronie wpuszczam wszystkie roboty z tabeli. Moja treść to oferta, ceny i poradnik - chcę, żeby modele znały te fakty także wtedy, gdy nie szukają w sieci. Serwis z płatnymi artykułami, wydawnictwo czy autor książek może liczyć to inaczej i ma do tego pełne prawo. Dla typowej firmy usługowej widzę trzy rozsądne warianty:
- Pełna widoczność - żadnych blokad dla robotów AI. Grupa z gwiazdką i Allow wystarczy.
- Wyszukiwarki AI tak, trening nie - blokujesz GPTBot, ClaudeBot, Google-Extended i Applebot-Extended, zostawiasz OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot i Bingbot.
- Bez AI w ogóle - blokujesz wszystkie roboty AI z tabeli, licząc się z tym, że roboty uruchamiane przez użytkownika mogą regułę pominąć, a zablokowanie Googlebota czy Bingbota wyrzuca stronę także z klasycznych wyszukiwarek.
Jak wygląda przykładowy robots.txt?
Wariant drugi, czyli widoczność w wyszukiwarkach AI bez trenowania modeli, zapisany linia po linii. Każdą grupę oddziela się w pliku pustą linią:
| Linie w pliku | Co robią |
|---|---|
| User-agent: GPTBot / Disallow: / | OpenAI nie użyje treści do trenowania modeli |
| User-agent: ClaudeBot / Disallow: / | Anthropic wyłącza przyszłe treści z treningu |
| User-agent: Google-Extended / Disallow: / | Treść nie trenuje Gemini; wyszukiwarka Google bez zmian |
| User-agent: Applebot-Extended / Disallow: / | Treść nie trenuje modeli Apple; Siri i Safari bez zmian |
| User-agent: * / Disallow: /admin/ | Pozostałe roboty, w tym OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot i Bingbot, mają wstęp wszędzie poza panelem |
| Sitemap: https://twojadomena.pl/sitemap.xml | Wskazuje robotom mapę strony |
Jak sprawdzić, czy wtyczka albo hosting nie blokuje robotów AI?
Blokada rzadko jest świadomą decyzją właściciela. Częściej ustawiła ją wtyczka, poprzedni wykonawca albo dostawca infrastruktury. Sprawdzenie zajmuje kilka minut:
- Otwórz twojadomena.pl/robots.txt w przeglądarce i poszukaj Disallow: / pod nazwami z tabeli oraz pod User-agent: *. Samo Disallow: / pod gwiazdką blokuje wszystkie roboty, także Google.
- WordPress - wtyczki SEO i bezpieczeństwa potrafią dopisywać własne reguły do robots.txt. Sprawdź też w Ustawieniach, w sekcji Czytanie, czy nie jest zaznaczona prośba do wyszukiwarek o nieindeksowanie witryny - ona ukrywa stronę przed wszystkimi wyszukiwarkami.
- Cloudflare - od 1 lipca 2025 roku pyta przy dodawaniu nowej domeny, czy wpuścić roboty AI, a od 15 września 2026 roku nowe domeny mają domyślnie blokowane roboty treningowe i agentów na stronach z reklamami, przy otwartych robotach wyszukiwarek. Taka blokada działa na serwerze, więc robots.txt może mówić „wpuszczam”, a robot i tak dostaje odmowę. Ustawienia są w panelu, w sekcji dotyczącej botów.
- Zapora na hostingu - część hostingów odrzuca nieznane roboty po nazwie. Zapytaj dostawcę wprost, czy blokuje GPTBota, ClaudeBota albo PerplexityBota.
- Znacznik noindex w kodzie strony albo nagłówek X-Robots-Tag - wyrzucają stronę z indeksu niezależnie od robots.txt.
Co zrobić po sprawdzeniu?
Jeśli znajdziesz blokadę, której nikt świadomie nie ustawiał, usuń ją i odczekaj kilka tygodni - roboty wracają na stronę w swoim rytmie. Potem powtórz test z tekstu o tym, jak sprawdzić, co AI mówi o Twojej firmie, bo robots.txt to dopiero pierwszy warunek. Kolejne to treść w HTML i fakty podane wprost, opisane przy widoczności w ChatGPT.
Przegląd robots.txt, ustawień serwera i indeksu Binga robię jako część audytu SEO, a pełne przygotowanie strony pod asystentów AI opisałem na stronie usługi widoczność w AI. Odblokowanie robotów daje stronie szansę na cytat - nikt uczciwy nie obieca, że model faktycznie ją wybierze.
Podsumowanie
- Roboty treningowe (GPTBot, ClaudeBot) i roboty wyszukiwarek AI (OAI-SearchBot, Claude-SearchBot, PerplexityBot) blokuje się niezależnie.
- Google-Extended i Applebot-Extended nie są osobnymi robotami i nie wpływają na wyszukiwarkę Google ani na Siri i Safari.
- Roboty uruchamiane przez użytkownika czatu (ChatGPT-User, Perplexity-User) mogą pomijać robots.txt.
- Osobna grupa dla robota wyłącza dla niego reguły spod gwiazdki - blokady katalogów trzeba w niej powtórzyć.
- Blokadę mogą ustawić wtyczka, Cloudflare albo zapora hostingu, nawet gdy robots.txt wszystko przepuszcza.
| Grupa | Roboty | Blokować? |
|---|---|---|
| Wyszukiwarki AI | OAI-SearchBot, Claude-SearchBot, PerplexityBot | Nie - blokada usuwa stronę z odpowiedzi |
| Klasyczne wyszukiwarki | Googlebot, Bingbot, Applebot | Nie - od nich zależą też AI Overviews, Copilot i Siri |
| Trening modeli | GPTBot, ClaudeBot, Google-Extended, Applebot-Extended | Twoja decyzja - na wyszukiwanie nie wpływa |
| Na prośbę użytkownika | ChatGPT-User, Claude-User, Perplexity-User | Nie ma sensu - mogą pomijać robots.txt |
Najczęstsze pytania
- Czy blokada GPTBota usunie moją stronę z ChatGPT?
- Nie z wyszukiwania. GPTBot zbiera treści do trenowania modeli, a za wyniki wyszukiwania w ChatGPT odpowiada OAI-SearchBot. OpenAI podaje, że oba ustawienia są niezależne, więc można zablokować pierwszego i wpuścić drugiego.
- Czy zablokowanie Google-Extended wyłącza AI Overviews dla mojej strony?
- Nie. Google-Extended dotyczy trenowania modeli Gemini i ugruntowania odpowiedzi w aplikacji Gemini. Według Google nie wpływa na obecność w wyszukiwarce ani na pozycje. AI Overviews korzystają z indeksu Googlebota.
- Czy robots.txt chroni stronę przed kopiowaniem treści przez AI?
- Nie w pełni. To prośba, której przestrzegają roboty dużych dostawców, ale roboty uruchamiane przez użytkownika czatu mogą ją pomijać, a blokada nie działa wstecz. Twardą blokadę daje dopiero serwer albo zapora, np. ustawienia botów w Cloudflare.
- Czy muszę wpisywać każdego robota AI osobno?
- Nie, jeśli chcesz wpuścić wszystkie - wystarczy grupa User-agent: * z Allow: /. Osobne grupy są potrzebne tylko dla robotów, które chcesz zablokować albo potraktować inaczej niż resztę.
O autorze
Jacek Pawlos - fullstack developer z Bydgoszczy
Piszę ten poradnik z perspektywy osoby, która te strony buduje. Od 7 lat robię strony, sklepy i aplikacje webowe w Next.js, React i Laravelu - mam na koncie 10 wdrożonych projektów, od stron firmowych po sklep z konfiguratorem 3D. Kwoty i terminy biorę z własnego cennika; gdy się zmieniają, aktualizuję datę pod tytułem. Więcej o mnie na LinkedInie.