Технические

Что такое файл robots.txt и нужен ли он вам?

Крошечный текстовый файл в корне вашего сайта незаметно задаёт правила игры для каждой поисковой системы, которая его посещает.

Что это

robots.txt — это обычный текстовый файл, который располагается в самом корне сайта (по адресу вроде вашдомен.com/robots.txt) и даёт инструкции поисковым краулерам — автоматическим программам, которые посещают сайты, чтобы читать и индексировать их страницы. Обычно в нём написано что-то вроде «можете сканировать весь этот сайт» или перечислены конкретные разделы, которые сканировать не следует, например внутренняя административная зона или страница результатов внутреннего поиска, которой не нужно показываться в Google.

Это скорее набор вежливых просьб, чем барьер безопасности — добросовестные краулеры (как у Google и Bing) его соблюдают, но он никак не мешает никому напрямую открыть страницу, если у него уже есть адрес.

Почему это важно

Без файла robots.txt большинство краулеров просто считают, что могут сканировать на сайте всё подряд, что часто вполне нормально для небольшого сайта, которому нечего исключать. Но его отсутствие также означает, что у вас вообще нет права голоса в этом вопросе — если когда-нибудь появится раздел, который вы не хотите допускать к сканированию (внутренний инструмент, тестовая зона, случайно оставленная в открытом доступе, дублирующийся контент, порождённый внутренним поиском по сайту), никакого файла, который мог бы это заявить, попросту нет.

Поисковые системы также проверяют наличие этого файла в числе первых действий при обнаружении нового сайта, и его часто используют, чтобы направить краулеров к вашему sitemap, — это помогает быстрее находить и индексировать остальные страницы сайта.

Как это исправить

  1. Создайте обычный текстовый файл с именем ровно robots.txt (все буквы строчные).
  2. Как минимум включите строку User-agent: *, за которой следует Allow: /, чтобы явно разрешить всем краулерам доступ ко всему сайту.
  3. Если есть конкретные разделы, которые вы не хотите индексировать, добавьте строку вроде Disallow: /admin/ для каждого такого раздела.
  4. Добавьте строку со ссылкой на ваш sitemap, например Sitemap: https://вашдомен.com/sitemap.xml, чтобы краулеры могли быстрее находить остальные страницы.
  5. Загрузите файл в корневую папку сайта (не во вложенную папку), чтобы он был доступен по адресу вашдомен.com/robots.txt — у большинства конструкторов сайтов для этого есть отдельное поле настроек, не требующее загрузки файла вручную.
  6. После этого откройте этот адрес в браузере, чтобы убедиться, что файл загружается и отображает ваши правила в виде обычного текста.

Проверьте, есть ли эта проблема на вашем сайте

Launch Readiness проверяет ваш сайт на эту и ещё ~50 проблем перед запуском за несколько секунд — бесплатно, без регистрации.

Запустить бесплатную проверку