Blokowanie botów AI polega na połączeniu kilku warstw ochrony: modułu Boty AI w dPanelu, pliku robots.txt, metatagów i nagłówków noai, nowych standardów takich jak TDMRep oraz filtrów po stronie serwera lub usług typu Cloudflare. Dzięki takiemu podejściu zatrzymasz grzeczne crawlery modeli językowych, które przestrzegają standardów, i dodatkowo utrudnisz działanie agresywnym scraperom.
Zanim zaczniesz, warto rozróżnić dwie grupy botów AI, bo blokada każdej z nich oznacza co innego. Pierwsza grupa to crawlery zbierające treści do trenowania modeli oraz scrapery. Generują głównie obciążenie serwera, a w zamian dają niewiele (na przykład Bytespider, meta-externalagent, PetalBot). Te zwykle można blokować bez szkody dla widoczności strony. Druga grupa to boty asystentów i wyszukiwarek AI (na przykład ChatGPT, Claude, Perplexity), dzięki którym Twoja strona może pojawiać się w odpowiedziach AI. Ich blokada tę widoczność ogranicza, więc decyduj o niej świadomie.
Spis treści
Blokada z poziomu dPanelu
W dPanelu blokadę ustawisz w module Boty AI. Każdego bota włączasz lub wyłączasz osobno, a przy każdym znajdziesz opis tego, co robi i czym skutkuje jego zablokowanie. To najszybsza droga, jeśli Twoja strona działa na dhosting i nie chcesz ręcznie edytować plików konfiguracyjnych.
Krok po kroku opisujemy to w osobnym poradniku: Aktywacja blokady botów AI w dPanelu.
Poniżej znajdziesz metody uniwersalne, które działają niezależnie od panelu i dostawcy hostingu. Przydadzą się, gdy chcesz dołożyć kolejne warstwy ochrony albo gdy korzystasz z innego środowiska.
Warstwa 1 – robots.txt dla znanych botów AI
Podstawowym narzędziem komunikacji z botami jest plik robots.txt w katalogu głównym witryny. To w nim możesz zdefiniować reguły blokujące konkretne crawlery AI, na przykład GPTBot, ClaudeBot czy PerplexityBot. Taki zapis działa na boty, które respektują standard robots.txt, czyli na większość dużych dostawców modeli.
Przykładowy fragment pliku robots.txt blokujący wybrane boty AI może wyglądać tak:
User-agent: GPTBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: *
Disallow:
Dzięki takiej konfiguracji wskazane boty AI nie powinny wchodzić na Twoją stronę, natomiast pozostałe roboty mogą mieć nadal pełny dostęp, jeśli tego potrzebujesz.
Pamiętaj, że boty uruchamiane na żądanie użytkownika (na przykład ChatGPT-User, Perplexity-User) często nie stosują się do robots.txt, bo wchodzą na stronę dopiero w chwili zapytania asystenta. Dla nich pewniejsza jest twarda blokada po stronie serwera (Warstwa 4) lub moduł Boty AI. Blokując te boty, rezygnujesz z widoczności strony w ich odpowiedziach. Rób to tylko wtedy, gdy świadomie nie chcesz, by Twoje treści były tam dostępne. Jeśli zależy Ci na obecności w odpowiedziach AI, zostaw te boty odblokowane.
Warstwa 2 – meta tagi i nagłówki noai
Sama blokada w robots.txt nie mówi jeszcze wprost, że nie życzysz sobie wykorzystywania treści do trenowania modeli. Coraz popularniejsze stają się metatagi oraz nagłówki X-Robots-Tag z dyrektywą noai i noimageai. To dodatkowy sygnał dla narzędzi i crawlerów powiązanych z AI, że nie zgadzasz się na takie użycie zawartości.
Aby zastosować to rozwiązanie globalnie, możesz dodać w sekcji head szablonu WordPressa metatag w takiej postaci:
<meta name="robots" content="noai, noimageai">
Jeżeli chcesz zastrzec tylko część serwisu, na przykład katalog z materiałami premium, możesz użyć nagłówka X-Robots-Tag po stronie serwera. W przypadku Nginx przykładowa konfiguracja może wyglądać tak:
location /premium/ {
add_header X-Robots-Tag "noai, noimageai" always;
}
Dzięki temu żądania do katalogu premium będą zawsze otrzymywały nagłówek zabraniający wykorzystania treści w treningu modeli AI.
Warto pamiętać, że noai i noimageai nie są jeszcze powszechnie uznanym standardem, więc część narzędzi może je ignorować. To sygnał Twojej woli, a nie twarda blokada.
Warstwa 3 – TDMRep, llms.txt i ai.txt
W ostatnich latach rozwijane są standardy ułatwiające zgłaszanie sprzeciwu wobec text and data mining, czyli masowego przetwarzania treści przez narzędzia i modele AI. Jednym z nich jest protokół TDMRep, który wykorzystuje prosty metatag i nagłówek HTTP, aby poinformować, że właściciel nie zgadza się na tego typu wykorzystanie danych.
Przykładowy metatag TDMRep może wyglądać tak:
<meta name="tdm-reservation" content="1">
Analogicznie możesz dodać nagłówek HTTP:
TDM-Reservation: 1
Równolegle rozwijany jest plik ai.txt, którym możesz zgłosić sprzeciw wobec wykorzystania treści przez dostawców AI, z możliwością wskazania zakresu użycia. Osobnym plikiem, często mylonym z mechanizmami blokady, jest llms.txt. Działa on odwrotnie: nie ogranicza dostępu, lecz pomaga modelom AI odczytać najważniejsze treści strony i bywa stosowany do zwiększania widoczności w odpowiedziach asystentów. Jeśli interesuje Cię to zagadnienie, opisujemy je w osobnym poradniku: Co to jest llms.txt i po co go wdrożyć.
Warstwa 4 – blokada na serwerze i w Cloudflare
Twarda blokada po stronie serwera lub u dostawcy CDN ma sens przede wszystkim wobec botów, które ignorują robots.txt i metatagi, czyli agresywnych crawlerów i scraperów. Przykładowo w panelu Cloudflare możesz włączyć w sekcji Security regułę blokującą znane boty AI, co od razu odfiltruje część ruchu.
Możesz użyć pliku .htaccess, aby zwrócić błąd 403 dla wybranych user agentów. Przykładowa reguła wygląda tak:
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} Bytespider [NC,OR]
RewriteCond %{HTTP_USER_AGENT} meta-externalagent [NC,OR]
RewriteCond %{HTTP_USER_AGENT} PetalBot [NC,OR]
RewriteCond %{HTTP_USER_AGENT} TikTokSpider [NC,OR]
RewriteCond %{HTTP_USER_AGENT} CCBot [NC]
RewriteRule .* - [F,L]
Taką samą logikę możesz rozszerzyć na inne boty z tej grupy. W dPanelu zrobisz to przełącznikiem przy danym bocie, bez wchodzenia w .htaccess.
Warstwa 5 – regulamin, paywall i dostęp warunkowy
Ostatnia warstwa dotyczy nie tyle konfiguracji technicznej, co zasad korzystania z treści. Warto w regulaminie oraz polityce praw autorskich jasno zapisać, że nie wyrażasz zgody na wykorzystywanie treści serwisu w treningu modeli AI i masowym scrapowaniu. Taki zapis nie zatrzyma botów sam w sobie, ale tworzy dodatkową podstawę prawną do działania, jeśli ktoś zignoruje Twoje dyrektywy.
W przypadku szczególnie cennych lub wrażliwych treści możesz też rozważyć ich udostępnianie wyłącznie po zalogowaniu, w modelu subskrypcyjnym lub za paywallem. Większość botów nie przechodzi przez takie zabezpieczenia, dzięki czemu nie ma technicznej możliwości pobrania pełnych materiałów.
Od czego zacząć w praktyce
- Zadbaj o aktualny robots.txt
- Dodaj metatagi noai / noimageai lub nagłówki X-Robots-Tag
- Wdróż TDMRep, a jeśli chcesz, ai.txt
- Włącz twardą blokadę w module Boty AI w dPanelu lub przez .htaccess albo Cloudflare
- Uzupełnij całość regulaminem i modelem dostępu do treści
Taki zestaw nie gwarantuje pełnej ochrony, ale istotnie utrudnia masowe scrapowanie zawartości przez boty AI.

