Status „Blocked by robots.txt” oznacza, że Google zna adres URL, ale nie może go pobrać, ponieważ reguły w pliku robots.txt blokują crawlowanie. Naprawa polega na sprawdzeniu, czy blokada jest celowa, a potem zmianie tylko tych reguł, które blokują ważne publiczne strony.
Ten artykuł pomaga bezpiecznie odróżnić strony, które powinny być widoczne w Google, od obszarów prywatnych, technicznych lub testowych, które nadal powinny pozostać wyłączone z crawlowania.
Spis treści
Co oznacza status „Blocked by robots.txt”
Plik robots.txt znajduje się zwykle pod adresem domeny, na przykład https://twojadomena.pl/robots.txt. Zawiera instrukcje dla robotów wyszukiwarek, które adresy mogą pobierać, a których nie powinny crawlowac.
Jeśli Google Search Console pokazuje status „Blocked by robots.txt”, oznacza to, że Googlebot natrafił na regułę Disallow dla danego adresu lub katalogu. W efekcie Google może nie pobrać treści strony. Taka strona zwykle nie pojawi się poprawnie w wynikach wyszukiwania, nawet jeśli jest ważna dla witryny.
Blokada w robots.txt nie jest tym samym co usunięcie strony z internetu. Adres nadal może być dostępny dla użytkowników, jeśli znają link. Robots.txt nie jest też zabezpieczeniem prywatnych danych, ponieważ sam plik jest publiczny.
Jak potwierdzić problem w Google Search Console
- Otwórz Google Search Console dla właściwej domeny.
- Sprawdź raport indeksowania stron i znajdź adresy oznaczone jako „Blocked by robots.txt”.
- Użyj inspekcji adresu URL dla jednej z ważnych stron, która nie pojawia się w Google.
- Sprawdź, czy Google wskazuje blokadę przez robots.txt jako powód problemu.
- Otwórz plik robots.txt w przeglądarce i znajdź regułę, która obejmuje ten adres.
Warto sprawdzać pojedyncze przykłady, a nie tylko listę adresów. Jeden wpis w robots.txt może blokować cały katalog, dlatego podobny problem może dotyczyć wielu podstron naraz.
Jak odróżnić blokadę celową od przypadkowej
Nie każda blokada w robots.txt jest błędem. Część reguł może chronić obszary techniczne przed crawlowaniem. Problem pojawia się wtedy, gdy reguła obejmuje publiczne strony, które mają być widoczne w Google.
| Typ blokady | Co zwykle oznacza | Co zrobić |
|---|---|---|
| Celowa blokada | Dotyczy obszarów technicznych, prywatnych, koszyka, panelu administracyjnego lub środowiska testowego. | Zostaw regułę, jeśli strona nie powinna być crawlowana. |
| Przypadkowa blokada | Dotyczy publicznych stron, kategorii, wpisów, produktów lub strony głównej. | Zmień regułę tak, aby nie obejmowała ważnych adresów. |
| Blokada z przeszłości | Pozostała po migracji, pracach testowych lub dawnej konfiguracji. | Usuń albo zawęź regułę po sprawdzeniu, czego dotyczy. |
Przy środowiskach testowych zachowaj ostrożność. Dobrze skonfigurowany staging nie powinien wpływać na widoczność strony produkcyjnej. Problem pojawia się, gdy staging jest publicznie dostępny i zostaje zaindeksowany. Więcej kontekstu znajdziesz w artykule Staging a SEO – jak testować zmiany bez szkody dla widoczności.
Najczęstsze błędy w robots.txt
Najpierw sprawdź reguły o najszerszym zakresie. To one najczęściej powodują blokadę ważnych stron.
Blokada całej witryny
User-agent: *
Disallow: /Taka reguła blokuje crawlowanie całej witryny dla wszystkich robotów, które respektują robots.txt. Jest używana czasem na etapie prac nad stroną, ale na stronie produkcyjnej może zatrzymać widoczność ważnych adresów.
Blokada zbyt szerokiego katalogu
User-agent: *
Disallow: /blog/Ta reguła blokuje cały katalog /blog/. Jeśli wpisy blogowe mają pojawiać się w Google, reguła jest zbyt szeroka.
Reguły dodane przez wtyczkę lub ustawienia testowe
Niektóre ustawienia strony, wtyczki SEO albo konfiguracje używane podczas prac testowych mogą dodać reguły blokujące crawlowanie. Jeśli problem pojawił się po aktualizacji, migracji lub zmianach na stronie, sprawdź robots.txt oraz ustawienia narzędzia, które zarządza indeksowaniem.
Jak poprawić robots.txt bez odsłaniania prywatnych obszarów
- Wypisz adresy, które mają być widoczne w Google. Skup się na stronie głównej, ważnych podstronach, kategoriach, wpisach i stronach ofertowych.
- Wypisz obszary, które powinny pozostać poza crawlowaniem. Mogą to być katalogi techniczne, panel administracyjny, wyniki wewnętrznego wyszukiwania lub środowisko staging.
- Znajdź w robots.txt regułę
Disallow, która obejmuje ważny adres. - Zmień tylko tę regułę, która powoduje problem. Nie usuwaj całego pliku, jeśli zawiera też potrzebne blokady.
- Jeśli blokada jest zbyt szeroka, zawęź ją do konkretnego katalogu technicznego zamiast blokować cały serwis lub duży dział strony.
- Zapisz zmianę i ponownie sprawdź kilka adresów w Google Search Console.
- Poproś Google o ponowne sprawdzenie ważnych adresów, jeśli narzędzie udostępnia taką opcję.
Po poprawce Google potrzebuje czasu na ponowne crawlowanie. To jest oczekiwane zachowanie. Zmiana w robots.txt nie zawsze oznacza natychmiastową indeksację strony.
Co powinno pozostać zablokowane
Nie odblokowuj obszarów tylko dlatego, że pojawiają się w raporcie. Część adresów nie musi być indeksowana i może pozostać wyłączona z crawlowania.
- Strony logowania i panele administracyjne.
- Adresy techniczne generowane przez system lub wtyczki.
- Środowiska staging i wersje testowe strony.
- Wewnętrzne wyniki wyszukiwania, jeśli nie mają wartości dla użytkowników z Google.
- Adresy prywatne, które nie powinny być publicznie dostępne.
Jeśli treść ma być prywatna, nie polegaj wyłącznie na robots.txt. Ten plik mówi robotom, czego nie crawlowac, ale nie blokuje dostępu użytkownikom. Prywatne obszary powinny być chronione odpowiednim dostępem, na przykład logowaniem.
Co sprawdzić po zmianie
- Czy ważne adresy nie są już blokowane przez robots.txt w Google Search Console.
- Czy strony testowe i prywatne nadal nie są przeznaczone do crawlowania.
- Czy plik robots.txt nie zawiera starej reguły po migracji lub pracach nad stroną.
- Czy wtyczka lub ustawienie strony nie nadpisuje ręcznych zmian w pliku.
Jeśli po zmianie status utrzymuje się przez pewien czas, może to oznaczać, że Google jeszcze nie przetworzył nowej wersji pliku albo nie odwiedził ponownie danego adresu. W takiej sytuacji sprawdzaj pojedyncze adresy w Google Search Console i obserwuj raport indeksowania.
Kiedy skontaktować się z pomocą
Skontaktuj się z pomocą techniczną, jeśli nie masz pewności, która reguła blokuje ważne strony, albo jeśli robots.txt jest nadpisywany przez system, wtyczkę lub wcześniejszą konfigurację. W zgłoszeniu podaj przykładowy adres URL, aktualną treść robots.txt oraz informację z Google Search Console.
