Чтобы настроить robots.txt, создайте текстовый файл с правилами для поисковых роботов, укажите разрешённые и запрещённые для обхода URL, добавьте адрес XML-карты сайта и разместите файл в корне домена. После публикации проверьте доступность файла и протестируйте важные URL для разных роботов.
В инструкции разберём назначение robots.txt, синтаксис директив, порядок настройки, примеры для типовых разделов сайта и ошибки, которые могут повлиять на сканирование. В конце — чек-лист для проверки перед публикацией.
Как работает robots.txt и какие задачи решает
Robots.txt — общедоступный текстовый файл с рекомендациями для поисковых роботов. Перед обходом сайта робот запрашивает файл, находит группу правил для своего User-agent и определяет, какие URL можно сканировать.
Файл используют, чтобы сократить обход технических и дублирующихся страниц: внутренних результатов поиска, служебных разделов, корзины, страниц оформления заказа, некоторых фильтров и параметров. Это помогает направить ресурсы поискового робота на важные для продвижения документы.
Robots.txt управляет сканированием, но не гарантирует исключение URL из поисковой выдачи. Если запрещённая страница известна поисковой системе по внешним или внутренним ссылкам, её адрес в отдельных случаях может оставаться в индексе без содержимого.
Для удаления страницы из поиска применяют другие способы: метатег robots со значением noindex, заголовок X-Robots-Tag, удаление документа с корректным HTTP-статусом или ограничение доступа. Поисковый робот должен иметь возможность открыть страницу, чтобы увидеть noindex, поэтому одновременно закрывать такой URL в robots.txt обычно не следует.
Файл также нельзя использовать для защиты конфиденциальных данных. Его содержимое доступно любому посетителю, а недобросовестный робот может проигнорировать правила. Личные кабинеты, административные панели и закрытые документы защищают авторизацией и серверными ограничениями.
Что проверить перед созданием файла
Настройку следует начинать не со списка запретов, а с анализа структуры сайта. Необходимо определить, какие страницы участвуют в поисковом продвижении, какие нужны пользователям, но не должны попадать в поиск, а какие URL появляются только из-за технических особенностей CMS.
Перед редактированием robots.txt составьте перечень следующих групп:
- посадочные страницы категорий, услуг, товаров, статей и других полезных материалов;
- служебные URL: авторизация, корзина, оформление заказа, сравнение и избранное;
- внутренний поиск и автоматически создаваемые результаты запросов;
- фильтры, сортировки, метки и URL с параметрами;
- страницы пагинации;
- ресурсы, необходимые для отображения страниц: CSS, JavaScript и изображения;
- тестовые разделы, копии страниц и устаревшие пути.
Не стоит закрывать целый тип URL только потому, что он выглядит техническим. Например, фильтры могут создавать бесполезные комбинации, но отдельные отфильтрованные категории иногда используются как полноценные посадочные страницы. Пагинация помогает роботам находить товары и статьи, а параметры могут быть необходимы для корректной работы сайта.
Отдельно проверьте, не закрыты ли каталоги со стилями, скриптами и изображениями. Поисковой системе важно видеть страницу близко к тому виду, который получает пользователь. Блокировка ресурсов может затруднить оценку мобильной версии, контента и интерфейса.
Как настроить robots.txt пошагово
Шаг 1. Найдите действующий файл
Откройте адрес вида https://example.ru/robots.txt, заменив example.ru своим доменом. Файл должен находиться строго в корневом каталоге сайта. Варианты наподобие /catalog/robots.txt или /files/robots.txt не управляют обходом всего ресурса.
Правила действуют только для конкретного протокола, домена и поддомена. Файл основного домена не распространяется автоматически на shop.example.ru, а robots.txt поддомена — на основной сайт. Для каждого активного хоста нужна отдельная проверка.
Шаг 2. Создайте текстовый файл
Используйте имя robots.txt, нижний регистр и текстовый формат UTF-8. Сервер должен отдавать файл без авторизации и желательно с HTTP-статусом 200. Не размещайте внутри HTML-разметку, пояснения для сотрудников или конфиденциальные адреса.
Шаг 3. Укажите поискового робота
Директива User-agent начинает группу правил и определяет, к какому роботу она относится. Звёздочка означает всех роботов, которые поддерживают стандарт.
User-agent: *
Disallow:
Пустое значение Disallow разрешает обход всех URL. Пробелы после двоеточия допустимы, но единообразное оформление упрощает проверку.
Если для отдельного робота нужны особые ограничения, создайте самостоятельную группу. У разных поисковых систем могут различаться принципы выбора групп и поддержка дополнительных директив. Например, Googlebot использует наиболее подходящую для него группу и не объединяет её автоматически с общей, поэтому необходимые общие ограничения следует повторить.
Шаг 4. Добавьте запреты и исключения
Директива Disallow запрещает обход пути, начинающегося с указанной последовательности. Слеш обозначает корень сайта.
User-agent: *
Disallow: /admin/
Disallow: /cart/
Disallow: /checkout/
Disallow: /search/
Запись Disallow: / закрывает от обхода весь сайт. Такое правило допустимо для закрытой тестовой среды, но опасно на рабочем домене.
Директива Allow создаёт исключение внутри запрещённого раздела. Например:
User-agent: *
Disallow: /private/
Allow: /private/public-page/
Правила сопоставляются с путём URL, включая параметры после знака вопроса. Регистр имеет значение: /Catalog/ и /catalog/ могут восприниматься как разные пути. Символ * заменяет любую последовательность знаков, а $ обозначает конец адреса у роботов, которые поддерживают такой синтаксис.
User-agent: *
Disallow: /*?sort=
Disallow: /*.pdf$
Первое правило ограничивает URL с параметром sort, если последовательность встречается в указанном виде. Второе запрещает обход адресов, заканчивающихся на .pdf. Маски нужно применять осторожно: слишком широкое выражение может затронуть полезные страницы.
Шаг 5. Укажите XML-карту сайта
Директива Sitemap содержит полный адрес XML-карты, включая протокол и домен. Её обычно размещают отдельно от групп User-agent. Если карт несколько, каждую указывают отдельной строкой.
User-agent: *
Disallow: /cart/
Disallow: /checkout/
Sitemap: https://example.ru/sitemap.xml
Добавление Sitemap помогает поисковому роботу обнаружить карту, но не заменяет корректную внутреннюю перелинковку. В XML-карту следует включать канонические URL, доступные для сканирования и предназначенные для поиска.
Шаг 6. Используйте комментарии только для пояснений
Текст после символа # считается комментарием. С его помощью можно объяснить назначение блока, но правила лучше сохранять короткими и понятными.
# Служебные разделы
User-agent: *
Disallow: /cart/
Disallow: /checkout/
Комментарии не должны подменять документацию проекта. Если логика ограничений сложная, зафиксируйте отдельно, зачем закрыт каждый шаблон URL и кто отвечает за его проверку после изменений на сайте.

Какие разделы обычно закрывают от обхода
Универсального файла robots.txt не существует: набор правил зависит от CMS, структуры каталога, параметров URL и поисковой стратегии. Таблица помогает определить возможные решения, но каждый путь необходимо проверить на конкретном сайте.
| Тип страниц | Возможное действие | Что учесть |
|---|---|---|
| Корзина и оформление заказа | Ограничить обход | Страницы обычно не отвечают на поисковый спрос и создаются для действий пользователя |
| Внутренний поиск | Часто закрыть | Результаты запросов могут создавать большое число слабых и дублирующихся URL |
| Фильтры | Проверять по шаблонам | Полезные посадочные комбинации нельзя закрывать вместе с техническими |
| Сортировки и параметры отображения | Обычно ограничить | Нужно убедиться, что правило не затрагивает обязательные параметры и канонические страницы |
| Пагинация | Как правило, оставить доступной | Через страницы пагинации роботы могут находить вложенные товары и материалы |
| CSS, JavaScript, изображения | Оставить доступными | Ресурсы могут быть нужны для рендеринга и анализа страницы |
| Административный раздел | Закрыть от обхода и защитить доступ | Robots.txt не является средством безопасности |
Не следует копировать правила из другой CMS без проверки. Одинаковые названия каталогов могут иметь разное назначение, а готовый шаблон способен закрыть карточки товаров, локальные версии, AJAX-ресурсы или изображения.
Директивы Crawl-delay и Host также не стоит добавлять автоматически. Их поддержка различается у поисковых систем. Ограничивать скорость обхода лучше через доступные инструменты конкретной поисковой системы или настройки сервера, если проблема подтверждена логами и нагрузкой.
Как проверить и опубликовать robots.txt
Сначала протестируйте файл вне рабочего сайта или подготовьте изменения в редакторе. Главная задача проверки — убедиться, что разрешены все продвигаемые страницы и необходимые ресурсы, а запреты охватывают только выбранные шаблоны.
- Проверьте синтаксис. У каждой группы должен быть User-agent, а у директив — двоеточие и корректное значение. Удалите опечатки и непредусмотренные символы.
- Составьте выборку URL. Возьмите главную страницу, категории, карточки, статьи, пагинацию, фильтры, корзину, поиск и адреса с параметрами.
- Проверьте разные группы роботов. Один URL может быть разрешён общей группе и запрещён отдельному User-agent.
- Сопоставьте robots.txt с XML-картой. В карте не должно быть URL, случайно закрытых от обхода.
- Опубликуйте файл в корне. После загрузки повторно откройте /robots.txt и убедитесь, что сервер показывает актуальную версию.
- Проверьте HTTP-ответ. Целевой вариант — прямой ответ 200 без авторизации и цепочки перенаправлений. Реакция роботов на ошибки 4xx и 5xx различается, поэтому полагаться на неё нельзя.
- Контролируйте последствия. Изменения применяются не мгновенно: поисковые роботы периодически загружают файл заново. После обновления следите за отчётами об индексировании, обходом и серверными логами.
Особенно внимательно проверяйте изменения при переносе сайта с тестового домена. На тестовой площадке часто используется Disallow: /, и перенос такого файла на рабочий домен способен остановить сканирование всего сайта.

Распространённые ошибки настройки
- Закрытие всего сайта. Правило Disallow: / иногда остаётся после разработки или технических работ.
- Попытка удалить URL из поиска через Disallow. Запрет обхода не равен запрету индексации и может помешать роботу увидеть noindex.
- Блокировка полезных ресурсов. Закрытые CSS и JavaScript затрудняют полноценный рендеринг страниц.
- Слишком широкие маски. Правило для одного параметра или расширения может случайно совпасть с коммерческими страницами.
- Конфликт с XML-картой. Один документ одновременно заявлен как предназначенный для обхода и запрещён в robots.txt.
- Копирование чужого шаблона. Правила не учитывают маршруты, плагины и логику текущего сайта.
- Ошибки в регистре и путях. Пропущенный слеш или другое написание каталога меняет область действия правила.
- Использование robots.txt вместо защиты. Указание административного пути делает его видимым, но не закрывает от посетителей.
- Отсутствие повторной проверки после обновлений. CMS и разработчики могут добавлять новые параметры, разделы и ресурсы, для которых старые правила становятся неактуальными.
Чем сложнее структура сайта, тем опаснее стремление закрыть все дубли одним набором масок. Иногда проблему правильнее решить через канонические адреса, noindex, редиректы, внутреннюю перелинковку или изменение генерации URL.
Частые вопросы
Обязательно ли создавать robots.txt?
Сайт может сканироваться и без файла, но robots.txt нужен для управления обходом технических разделов и указания XML-карты. Если ограничений нет, можно разместить простой файл с User-agent: * и пустым Disallow.
Можно ли запретить индексацию через robots.txt?
Robots.txt не гарантирует удаление страницы из индекса. Для запрета индексации используют поддерживаемый метатег robots или HTTP-заголовок X-Robots-Tag, оставляя документ доступным для обхода до обработки директивы.
Нужно ли закрывать все URL с параметрами?
Нет. Среди параметрических URL могут быть полезные посадочные страницы или адреса, необходимые для работы сайта. Сначала определяют назначение каждого параметра, наличие дублей и альтернативный способ управления индексацией.
Почему поисковый робот продолжает посещать запрещённую страницу?
Робот мог использовать сохранённую версию файла, встретить URL до обновления правил или обращаться к адресу для проверки доступности. Также нужно проверить правильность пути, группу User-agent, регистр и фактический хост.
Можно ли добавить несколько Sitemap?
Да. Каждую XML-карту указывают отдельной директивой Sitemap с абсолютным адресом. Также можно указать индексный файл, который содержит ссылки на несколько карт.
Как часто нужно пересматривать файл?
Robots.txt следует проверять после смены CMS, редизайна, миграции, запуска новых разделов, изменения фильтров и генерации URL. Для стабильного сайта полезен периодический технический контроль вместе с анализом индексации.
Чек-лист перед завершением настройки
- файл доступен по адресу /robots.txt на каждом нужном домене и поддомене;
- сервер возвращает актуальную версию со статусом 200;
- главная страница и продвигаемые разделы разрешены для обхода;
- корзина, внутренний поиск и выбранные технические URL ограничены;
- CSS, JavaScript и важные изображения не заблокированы;
- маски проверены на реальных примерах разрешённых и запрещённых URL;
- адрес Sitemap указан полностью и карта доступна;
- в XML-карте нет случайно закрытых страниц;
- robots.txt не используется как средство защиты данных;
- после публикации запланирован контроль обхода и индексирования.
Настройка robots.txt должна быть частью общего технического аудита: сам файл не исправляет дубли, неверные канонические адреса и проблемы внутренней структуры. Если требуется комплексно проверить индексацию и устранить технические ограничения, можно рассмотреть SEO-продвижение сайта с анализом проекта и приоритетов роста.


