Перейти к содержимому

robots.txt

Просьба к программам обхода, какие разделы им следует пропустить

Текстовый файл в корневом каталоге сайта, который сообщает поисковым системам, какие разделы им не следует запрашивать, — просьба, а не замок.

  1. Программа обхода сначала читает robots.txt
  2. Заблокированные пути не запрашиваются
  3. Тем не менее возможен: листинг без запроса
  4. noindex надёжно регулирует включение

Что означает robots.txt?

robots.txt — одна из старейших конвенций интернета. Она восходит к нидерландскому разработчику Мартейну Костеру (Martijn Koster), чей сервер в 1994 году был перегружен программой обхода. Из возникшего тогда неформального предложения, протокола Robots Exclusion Protocol, за десятилетия сложился фактический стандарт, которого придерживаются серьёзные поисковые системы, — формально его закрепила IETF лишь в сентябре 2022 года документом RFC 9309.

Технически файл предельно прост. Он лежит по адресу вашдомен.de/robots.txt и состоит из строк вида User-agent, за которыми следуют Disallow или Allow и путь. Так конкретной программе обхода или всем сразу можно сообщить, какие каталоги ей следует избегать. Дополнительно здесь можно указать ссылку на Sitemap — адресный список сайта, — чтобы оба файла работали согласованно, а не противоречили друг другу.

Самое дорогое заблуждение всегда одно и то же: robots.txt не гарантирует исключение из индексации. Заблокированная страница всё равно может появиться в результатах поиска — без описания, лишь с голым адресом, — если на неё ссылаются другие сайты. Поисковая система тогда не запрашивала страницу, но по внешним сигналам сделала вывод о её существовании и всё же включила её в список с пометкой, что описание недоступно.

Кто хочет надёжно исключить страницу из поиска, нуждается в противоположном инструменту блокировки: указании noindex в заголовке самой страницы или в ограничении доступа. Но для этого страница вообще должна быть доступна для запроса — страницу, заблокированную через robots.txt, указание noindex прочитать не может. По действию оба инструмента частично исключают друг друга, а не складываются.

На практике мы видим прежде всего две ошибки. Первая: строка Disallow: / из этапа разработки, которую забыли убрать, и при переносе на реальный домен она блокирует весь сайт целиком — страницы в браузере загружаются как обычно, только поисковая система соблюдает запрет и остаётся снаружи. Вторая: заблокированные каталоги с CSS- или скрипт-файлами, из-за чего Google не может корректно отобразить страницу, чтобы её оценить.

Поэтому мы проверяем файл не в папке с исходным кодом, а вживую — запрашиваем его по адресу, по которому он реально отдаётся, потому что локальная копия после переноса или смены сервера может отличаться. Важно сохранять разграничение с двумя соседними файлами: robots.txt регулирует доступ, sitemap перечисляет адреса, а решает, будет ли запрошенная страница действительно включена в индекс, только индексация.

Проверьте сами

Лишь в сентябре 2022 года robots.txt была формально стандартизирована — спустя 28 лет после первого применения в 1994 году.

Между первым использованием и официальной стандартизацией прошло почти три десятилетия, в течение которых поисковые системы добровольно придерживались неформальной конвенции. Это показывает, насколько действие файла держится на сотрудничестве, а не на техническом принуждении, — программу обхода, которая не хочет её соблюдать, robots.txt не остановит. Для среднего бизнеса это значит: файл — это указание доброжелательным системам, а не файрвол.

Источник: IETF, RFC 9309 «Robots Exclusion Protocol», сентябрь 2022 года, а также robotstxt.org — о возникновении в 1994 году.

Частые вопросы

Мешает ли robots.txt тому, чтобы моя страница появлялась в Google?

Не гарантированно. Заблокированная страница всё же может появиться в результатах с голым адресом, если на неё ссылаются другие сайты. Для надёжного исключения правильный инструмент — указание noindex на самой странице, а для этого страница должна быть доступна для запроса.

Обязан ли каждый сайт иметь robots.txt?

Нет, юридической обязанности не существует. Если файла нет, программы обхода исходят из того, что можно запрашивать всё. Файл становится полезным прежде всего тогда, когда нужно целенаправленно исключить отдельные разделы, например внутренние результаты поиска или тестовые окружения.

Не хватает термина? Напишите нам

Мы спокойно объясним любой термин без профессионального жаргона — и честно скажем, что вам действительно нужно, а что нет.

ProvenExpert