Przejdź do głównej treści
Technical SEO

Jak skonfigurować robots.txt

9 min czytania

Twój plik robots.txt kontroluje, do których części Twojej witryny mają dostęp roboty wyszukiwarek. Błędnie skonfigurowany robots.txt może zablokować indeksowanie ważnych stron lub marnować budżet indeksowania (crawl budget) na mało wartościowe adresy URL. Ten przewodnik uczy, jak poprawnie ustawić plik, przetestować go i uniknąć powszechnych pułapek szkodzących SEO.

Poradnik krok po kroku

1

Zrozum podstawy Robots.txt

Robots.txt to zwykły plik tekstowy znajdujący się w głównym katalogu Twojej witryny (example.com/robots.txt), który wykorzystuje dyrektywy do kierowania crawlerami. Dwie główne dyrektywy to User-agent (którego crawlera dotyczy reguła) oraz Disallow (które ścieżki zablokować). Pusty lub brakujący plik robots.txt oznacza, że wszystkie crawlery mają dostęp do wszystkiego.

2

Określ, co zablokować

Blokuj adresy URL, które marnują budżet indeksowania bez oferowania wartości SEO: strony administracyjne, wewnętrzne wyniki wyszukiwania, obszary logowania, koszyki i strony płatności, wersje do druku oraz adresy URL filtrów z dużą ilością parametrów. Nigdy nie blokuj plików CSS, JavaScript ani obrazów, których wyszukiwarki potrzebują do poprawnego renderowania Twoich stron.

3

Napisz swoje reguły Robots.txt

Zacznij od User-agent: *, aby zastosować reguły do wszystkich crawlerów. Użyj Disallow dla ścieżek do zablokowania oraz Allow, aby tworzyć wyjątki wewnątrz zablokowanych katalogów. Pamiętaj, że reguły są wrażliwe na wielkość liter i wykorzystują dopasowywanie ścieżek z symbolami wieloznacznymi (*) oraz znacznikami końca adresu URL ($).

4

Dodaj odnośnik do sitemapy

Dołącz dyrektywę Sitemap wskazującą na twoją sitemapę w formacie XML: Sitemap: https://example.com/sitemap.xml. Pomaga to wyszukiwarkom odkryć twoją sitemapę, nawet jeśli nie trafiły na nią w inny sposób. Możesz wymienić wiele sitemap, jeśli twoja witryna korzysta z plików indeksu sitemap.

5

Przetestuj przed wdrożeniem

Użyj narzędzia Robots.txt Tester w Google Search Console, aby zweryfikować swoje reguły przed ich opublikowaniem. Przetestuj konkretne adresy URL, aby potwierdzić, że ważne strony są dostępne, a zablokowane strony zwracają oczekiwany wynik. Jedna błędna reguła może przypadkowo zablokować całą witrynę.

6

Monitoruj aktywność indeksowania

Po wdrożeniu monitoruj raport Statystyki indeksowania w Google Search Console, aby sprawdzić, czy wzorce indeksowania są zgodne z twoimi zamierzeniami. Upewnij się, że zablokowane adresy URL nie pojawiają się w wynikach wyszukiwania, a ważne strony są indeksowane z odpowiednią częstotliwością.

Profesjonalne wskazówki

  • Plik robots.txt blokuje indeksowanie (crawling), ale nie samo indeksowanie w bazie. Jeśli zablokowana strona posiada zewnętrzne linki zwrotne, Google może nadal zaindeksować dany adres URL (bez zawartości). Użyj tagów meta noindex, aby zapobiec indeksowaniu.
  • Użyj znaku końca ciągu $ do blokowania określonych typów plików: Disallow: /*.pdf$ blokuje wszystkie pliki PDF bez wpływu na inne adresy URL zawierające „.pdf” w ścieżce.
  • Utrzymuj swój plik robots.txt w prostocie. Złożone reguły z wieloma wyjątkami są trudne w utrzymaniu i łatwe do zepsucia. Jeśli twój plik robots.txt przekracza 20-30 linii, rozważ użycie tagów noindex.

Częste błędy, których warto unikać

Blokowanie plików CSS i JavaScript

Google musi wyrenderować twoje strony, aby prawidłowo je ocenić. Blokowanie plików CSS lub JS uniemożliwia renderowanie, co oznacza, że Google widzi uszkodzoną stronę. Nigdy nie blokuj zasobów niezbędnych do renderowania strony.

Używanie robots.txt do ukrywania wrażliwych treści

Plik robots.txt jest publicznie dostępny – każdy może go przeczytać. Używanie go do ukrywania paneli administracyjnych lub prywatnych katalogów w rzeczywistości ogłasza ich istnienie. Do naprawdę prywatnych treści używaj uwierzytelniania i tagów noindex.

Przypadkowe zablokowanie całej witryny

Pojedynczy wpis 'Disallow: /' pod 'User-agent: *' blokuje dostęp wszystkim crawlerom do całej witryny. Może się to zdarzyć podczas prac rozwojowych lub migracji. Zawsze upewnij się, że na produkcji nie są przypadkowo aktywne żadne zbyt szerokie reguły.

Jak Keyword Kick ułatwia sprawę

  • Interaktywny generator robots.txt z gotowymi szablonami dla popularnych platform CMS
  • Audyty witryny, które sygnalizują problemy z robots.txt, w tym zablokowane ważne zasoby
  • Analiza możliwości indeksowania pokazująca, które strony są zablokowane i czy jest to działanie celowe

Najczęściej zadawane pytania

Czy plik robots.txt jest wymagany dla SEO?

Nie, nie jest wymagany. Bez pliku robots.txt wyszukiwarki będą indeksować wszystko, co znajdą. Potrzebujesz go tylko wtedy, gdy chcesz zablokować określone sekcje przed crawlerami lub jeśli twoja witryna jest na tyle duża, że musisz zarządzać budżetem indeksowania (crawl budget).

Czy robots.txt zapobiega pojawianiu się stron w wynikach wyszukiwania?

Nie w sposób niezawodny. Robots.txt blokuje indeksowanie (crawling), ale Google może nadal zaindeksować adres URL, jeśli znajdzie kierujące do niego linki. Wynik w wyszukiwarce pokaże adres URL i tytuł, ale nie pokaże opisu. Użyj tagu meta noindex, aby w pełni zapobiec pojawianiu się strony w wyszukiwarce.

Jak często wyszukiwarki sprawdzają plik robots.txt?

Google zazwyczaj cachuje twój plik robots.txt do 24 godzin. Zmiany mogą nie wejść w życie natychmiast. Jeśli pilnie potrzebujesz, aby Google ponownie pobrało plik, możesz użyć narzędzia Robots.txt Tester w Search Console, aby wymusić odświeżenie.

Powiązane poradniki

Gotowy, by wdrożyć te strategie? Keyword Kick daje Ci narzędzia do zastosowania wszystkiego, czego się nauczyłeś.

Zacznij za darmo