Pan Jacek

Poradnik7 min czytania

Które roboty AI blokować w robots.txt, a które wpuścić?

Autor: , fullstack developer z Bydgoszczy

Roboty AI dzielą się na trzy grupy: zbierające treści do trenowania modeli (GPTBot, ClaudeBot), indeksujące strony dla wyszukiwarek AI (OAI-SearchBot, Claude-SearchBot, PerplexityBot) i otwierające stronę na prośbę użytkownika (ChatGPT-User, Claude-User, Perplexity-User). Firma, która chce pojawiać się w odpowiedziach AI, powinna wpuścić co najmniej roboty wyszukiwarek - blokada robotów treningowych nie usuwa jej z wyszukiwania w ChatGPT czy Claude.

Plik robots.txt to kilka linijek tekstu w katalogu głównym domeny, a decyduje dziś także o tym, czy Twoją stronę czytają ChatGPT, Claude, Perplexity i Gemini. Każdy dostawca ma dwa-trzy roboty i każdy służy do czegoś innego, więc reguły kopiowane z forów często blokują akurat ten, który firma chciałaby wpuścić. Nazwy i role sprawdziłem w dokumentacji OpenAI, Anthropic, Perplexity, Google i Apple we wrześniu 2026 roku.

Jak robot czyta robots.txt?

Plik składa się z grup. Każda zaczyna się od linii User-agent z nazwą robota, a pod nią stoją reguły Allow (wolno) i Disallow (nie wolno) dla ścieżek na stronie. Grupa z gwiazdką dotyczy wszystkich robotów, które nie mają własnej grupy.

To ostatnie zdanie jest źródłem większości pomyłek. Robot stosuje się tylko do najlepiej pasującej grupy - jeśli dodasz osobną grupę dla GPTBota, reguły spod gwiazdki przestają go obowiązywać. Kto zablokował wszystkim katalog /admin, a potem dopisał osobną grupę dla jednego robota, musi tę blokadę powtórzyć także w nowej grupie.

Robots.txt jest prośbą, a nie zabezpieczeniem. Roboty dużych dostawców deklarują, że go przestrzegają, ale roboty uruchamiane przez użytkownika czatu mają wyjątki opisane niżej. Blokada działa też tylko na przyszłość: Anthropic pisze wprost, że zablokowanie ClaudeBota wyłącza z treningu przyszłe materiały strony, a nie to, co już zebrano.

Które roboty AI odwiedzają strony i do czego służą?

Tabela obejmuje roboty, o które najczęściej pytają właściciele stron. Opisy i skutki blokady pochodzą z dokumentacji dostawców, bez moich interpretacji:

Roboty AI i wyszukiwarek - do czego służą i co daje ich blokada (dokumentacja dostawców, wrzesień 2026)
RobotFirmaDo czego służyCo daje blokada w robots.txt
GPTBotOpenAIZbiera treści do trenowania modeliTreść nie trafia do treningu; wyszukiwanie w ChatGPT działa niezależnie
OAI-SearchBotOpenAIIndeksuje strony dla wyszukiwania w ChatGPTStrona nie pojawia się w odpowiedziach wyszukiwania ChatGPT (może zostać jako link nawigacyjny)
ChatGPT-UserOpenAIOtwiera stronę, gdy prosi o to użytkownik czatu albo Custom GPTOpenAI zastrzega, że reguły robots.txt mogą go nie dotyczyć
ClaudeBotAnthropicZbiera treści, które mogą trafić do trenowania modeliPrzyszłe treści strony są wyłączone z treningu
Claude-SearchBotAnthropicIndeksuje strony, żeby poprawić wyniki wyszukiwania w ClaudeStrona nie jest indeksowana na potrzeby wyszukiwania
Claude-UserAnthropicPobiera stronę, gdy użytkownik zada pytanie w ClaudeClaude nie pobierze strony w odpowiedzi na pytanie - mniejsza widoczność
PerplexityBotPerplexityIndeksuje strony do wyników Perplexity; według firmy nie służy do trenowania modeliStrona nie trafia do indeksu Perplexity
Perplexity-UserPerplexityOtwiera stronę podczas odpowiadania na pytanie użytkownikaWedług dokumentacji zwykle ignoruje robots.txt
Google-ExtendedGoogleZnacznik bez własnego robota: trening modeli Gemini i ugruntowanie odpowiedzi w aplikacji Gemini i Vertex AINie wpływa na obecność w wyszukiwarce Google ani na pozycje
GooglebotGoogleIndeksuje strony do wyszukiwarki, w tym do AI Overviews i trybu AIStrona znika z Google
ApplebotAppleZasila wyszukiwanie w Spotlight, Siri i SafariStrona znika z tych funkcji
Applebot-ExtendedAppleZnacznik bez własnego robota: czy dane z Applebota mogą trenować modele AppleTreść nie trenuje modeli Apple, wyniki w Siri i Safari zostają
BingbotMicrosoftIndeksuje strony do Binga, z którego korzysta CopilotStrona znika z Binga i z odpowiedzi Copilota

Co blokować, jeśli zależy Ci na widoczności w AI?

Najważniejsze jest rozróżnienie między treningiem a wyszukiwaniem. OpenAI pisze, że każde ustawienie jest niezależne: możesz wpuścić OAI-SearchBota, żeby pojawiać się w wyszukiwaniu ChatGPT, i jednocześnie zablokować GPTBota, żeby treść nie trafiała do treningu. Tak samo rozdziela to Anthropic (ClaudeBot i Claude-SearchBot), a Google i Apple mają osobne znaczniki do treningu, które nie ruszają wyszukiwarki.

Na swojej stronie wpuszczam wszystkie roboty z tabeli. Moja treść to oferta, ceny i poradnik - chcę, żeby modele znały te fakty także wtedy, gdy nie szukają w sieci. Serwis z płatnymi artykułami, wydawnictwo czy autor książek może liczyć to inaczej i ma do tego pełne prawo. Dla typowej firmy usługowej widzę trzy rozsądne warianty:

  • Pełna widoczność - żadnych blokad dla robotów AI. Grupa z gwiazdką i Allow wystarczy.
  • Wyszukiwarki AI tak, trening nie - blokujesz GPTBot, ClaudeBot, Google-Extended i Applebot-Extended, zostawiasz OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot i Bingbot.
  • Bez AI w ogóle - blokujesz wszystkie roboty AI z tabeli, licząc się z tym, że roboty uruchamiane przez użytkownika mogą regułę pominąć, a zablokowanie Googlebota czy Bingbota wyrzuca stronę także z klasycznych wyszukiwarek.

Jak wygląda przykładowy robots.txt?

Wariant drugi, czyli widoczność w wyszukiwarkach AI bez trenowania modeli, zapisany linia po linii. Każdą grupę oddziela się w pliku pustą linią:

Przykładowy robots.txt - wyszukiwarki AI wpuszczone, roboty treningowe zablokowane
Linie w plikuCo robią
User-agent: GPTBot / Disallow: /OpenAI nie użyje treści do trenowania modeli
User-agent: ClaudeBot / Disallow: /Anthropic wyłącza przyszłe treści z treningu
User-agent: Google-Extended / Disallow: /Treść nie trenuje Gemini; wyszukiwarka Google bez zmian
User-agent: Applebot-Extended / Disallow: /Treść nie trenuje modeli Apple; Siri i Safari bez zmian
User-agent: * / Disallow: /admin/Pozostałe roboty, w tym OAI-SearchBot, Claude-SearchBot, PerplexityBot, Googlebot i Bingbot, mają wstęp wszędzie poza panelem
Sitemap: https://twojadomena.pl/sitemap.xmlWskazuje robotom mapę strony

Jak sprawdzić, czy wtyczka albo hosting nie blokuje robotów AI?

Blokada rzadko jest świadomą decyzją właściciela. Częściej ustawiła ją wtyczka, poprzedni wykonawca albo dostawca infrastruktury. Sprawdzenie zajmuje kilka minut:

  • Otwórz twojadomena.pl/robots.txt w przeglądarce i poszukaj Disallow: / pod nazwami z tabeli oraz pod User-agent: *. Samo Disallow: / pod gwiazdką blokuje wszystkie roboty, także Google.
  • WordPress - wtyczki SEO i bezpieczeństwa potrafią dopisywać własne reguły do robots.txt. Sprawdź też w Ustawieniach, w sekcji Czytanie, czy nie jest zaznaczona prośba do wyszukiwarek o nieindeksowanie witryny - ona ukrywa stronę przed wszystkimi wyszukiwarkami.
  • Cloudflare - od 1 lipca 2025 roku pyta przy dodawaniu nowej domeny, czy wpuścić roboty AI, a od 15 września 2026 roku nowe domeny mają domyślnie blokowane roboty treningowe i agentów na stronach z reklamami, przy otwartych robotach wyszukiwarek. Taka blokada działa na serwerze, więc robots.txt może mówić „wpuszczam”, a robot i tak dostaje odmowę. Ustawienia są w panelu, w sekcji dotyczącej botów.
  • Zapora na hostingu - część hostingów odrzuca nieznane roboty po nazwie. Zapytaj dostawcę wprost, czy blokuje GPTBota, ClaudeBota albo PerplexityBota.
  • Znacznik noindex w kodzie strony albo nagłówek X-Robots-Tag - wyrzucają stronę z indeksu niezależnie od robots.txt.

Co zrobić po sprawdzeniu?

Jeśli znajdziesz blokadę, której nikt świadomie nie ustawiał, usuń ją i odczekaj kilka tygodni - roboty wracają na stronę w swoim rytmie. Potem powtórz test z tekstu o tym, jak sprawdzić, co AI mówi o Twojej firmie, bo robots.txt to dopiero pierwszy warunek. Kolejne to treść w HTML i fakty podane wprost, opisane przy widoczności w ChatGPT.

Przegląd robots.txt, ustawień serwera i indeksu Binga robię jako część audytu SEO, a pełne przygotowanie strony pod asystentów AI opisałem na stronie usługi widoczność w AI. Odblokowanie robotów daje stronie szansę na cytat - nikt uczciwy nie obieca, że model faktycznie ją wybierze.

Podsumowanie

  • Roboty treningowe (GPTBot, ClaudeBot) i roboty wyszukiwarek AI (OAI-SearchBot, Claude-SearchBot, PerplexityBot) blokuje się niezależnie.
  • Google-Extended i Applebot-Extended nie są osobnymi robotami i nie wpływają na wyszukiwarkę Google ani na Siri i Safari.
  • Roboty uruchamiane przez użytkownika czatu (ChatGPT-User, Perplexity-User) mogą pomijać robots.txt.
  • Osobna grupa dla robota wyłącza dla niego reguły spod gwiazdki - blokady katalogów trzeba w niej powtórzyć.
  • Blokadę mogą ustawić wtyczka, Cloudflare albo zapora hostingu, nawet gdy robots.txt wszystko przepuszcza.
Roboty AI - co blokować, jeśli zależy Ci na widoczności
GrupaRobotyBlokować?
Wyszukiwarki AIOAI-SearchBot, Claude-SearchBot, PerplexityBotNie - blokada usuwa stronę z odpowiedzi
Klasyczne wyszukiwarkiGooglebot, Bingbot, ApplebotNie - od nich zależą też AI Overviews, Copilot i Siri
Trening modeliGPTBot, ClaudeBot, Google-Extended, Applebot-ExtendedTwoja decyzja - na wyszukiwanie nie wpływa
Na prośbę użytkownikaChatGPT-User, Claude-User, Perplexity-UserNie ma sensu - mogą pomijać robots.txt

Najczęstsze pytania

Czy blokada GPTBota usunie moją stronę z ChatGPT?
Nie z wyszukiwania. GPTBot zbiera treści do trenowania modeli, a za wyniki wyszukiwania w ChatGPT odpowiada OAI-SearchBot. OpenAI podaje, że oba ustawienia są niezależne, więc można zablokować pierwszego i wpuścić drugiego.
Czy zablokowanie Google-Extended wyłącza AI Overviews dla mojej strony?
Nie. Google-Extended dotyczy trenowania modeli Gemini i ugruntowania odpowiedzi w aplikacji Gemini. Według Google nie wpływa na obecność w wyszukiwarce ani na pozycje. AI Overviews korzystają z indeksu Googlebota.
Czy robots.txt chroni stronę przed kopiowaniem treści przez AI?
Nie w pełni. To prośba, której przestrzegają roboty dużych dostawców, ale roboty uruchamiane przez użytkownika czatu mogą ją pomijać, a blokada nie działa wstecz. Twardą blokadę daje dopiero serwer albo zapora, np. ustawienia botów w Cloudflare.
Czy muszę wpisywać każdego robota AI osobno?
Nie, jeśli chcesz wpuścić wszystkie - wystarczy grupa User-agent: * z Allow: /. Osobne grupy są potrzebne tylko dla robotów, które chcesz zablokować albo potraktować inaczej niż resztę.

O autorze

Jacek Pawlos - fullstack developer z Bydgoszczy

Piszę ten poradnik z perspektywy osoby, która te strony buduje. Od 7 lat robię strony, sklepy i aplikacje webowe w Next.js, React i Laravelu - mam na koncie 10 wdrożonych projektów, od stron firmowych po sklep z konfiguratorem 3D. Kwoty i terminy biorę z własnego cennika; gdy się zmieniają, aktualizuję datę pod tytułem. Więcej o mnie na LinkedInie.

Czytaj dalej

Masz pytanie, którego tu nie ma?

Napisz w dwóch zdaniach, co chcesz zbudować. Odpowiadam w ciągu 24 godzin, a prototyp dostajesz w 48.