+7 (495) 801-60-42

robots.txt: как настроить для Яндекса и Google без ошибок

В этом руководстве — практическая robots.txt настройка для Яндекса и Google без рискованных экспериментов. Разберём рабочие директивы, логику приоритетов, примеры для WordPress и интернет‑магазинов, способы проверки и типичные ошибки, из‑за которых поисковики теряют доступ к важным страницам.

Что такое robots.txt и как он работает

Файл robots.txt — это публичный текстовый файл в корне домена, который сообщает поисковым роботам, какие разделы сайта можно или нельзя сканировать. Он не скрывает страницы от пользователей и не защищает данные — это рекомендация для ботов. URL: https://example.com/robots.txt.

Ключевые принципы:

  • Правила задаются блоками по User-agent.
  • Последовательность строк важна только для чтения человеком; для Google и Яндекс приоритеты задаются логикой соответствия масок.
  • Более специфичное правило обычно сильнее общего; у Google действует принцип «наиболее специфичный шаблон», у Яндекса — сходный.
  • Disallow запрещает обход путей, Allow разрешает исключения из запрета.
  • Sitemap и Host — сервисные директивы: первая указывает карту сайта, вторая (Host) читается Яндексом.

Директивы Disallow/Allow: как составить robots.txt без конфликтов

Базовые директивы:

  • User-agent: имя робота (например, Googlebot, Yandex, Bingbot). Звёздочка «*» — правило по умолчанию для всех.
  • Disallow: запрет на сканирование пути.
  • Allow: разрешение на сканирование внутри ранее запрещённого пути.
  • Sitemap: ссылка на карту сайта (можно несколько строк для разных карт).
  • Host (только Яндекс): канонический хост для зеркал.

Практические советы:

  • Сначала сформулируйте глобальный запрет, затем добавляйте точечные Allow для нужных подпутей.
  • Не закрывайте через Disallow то, что планируете ранжировать (карточки, категории, статьи, теги, фильтры со спросом).
  • Для медиа и CSS/JS не ставьте запреты, если они участвуют в рендеринге страниц — Google и Яндекс учитывают отображение.

Примеры паттернов:

  • Disallow: /admin/ — запретит всё внутри /admin/.
  • Disallow: /*? — запретит все URL с параметрами (осторожно с e‑commerce фильтрами).
  • Allow: /static/js/ — разрешит подпуть даже при запрете /static/.

User-agent: примеры для Google и Яндекса

Примеры блоков:

  • Для всех ботов:
  • User-agent: *
  • Disallow: /admin/
  • Allow: /admin/assets/
  • Для Googlebot (если требуется отдельная логика):
  • User-agent: Googlebot
  • Allow: /
  • Для Yandex (основные роботы):
  • User-agent: Yandex
  • Allow: /

Замечания:

  • Если есть блок User-agent: * и специализированный блок (например, для Googlebot), специализированный для этого бота будет приоритетнее.
  • Не блокируйте критичные ресурсы рендеринга: /wp-includes/js/, /wp-content/themes/, /assets/css/ и т. п.

Host в robots.txt (Яндекс) и Sitemap для обоих поисковиков

Host:

  • Поддерживается Яндексом, игнорируется Google.
  • Формат: Host: example.com
  • Используйте один раз и указывайте протокол на уровне 301‑редиректов, а в Host — домен без протокола и без пути.
  • Если есть поддомены, Host задаётся на каждом зеркале отдельно.

Sitemap:

  • Поддерживается всеми основными поисковиками.
  • Формат: Sitemap: https://example.com/sitemap.xml
  • Можно указывать несколько строк для карт по разделам/языкам.

robots.txt настройка: базовый шаблон для большинства сайтов

Базовый подход: не мешаем обходу контента и статики, закрываем служебные разделы и мусорные параметры.

Шаблон:

  • User-agent: *
  • Disallow: /admin/
  • Disallow: /login/
  • Disallow: /search/
  • Disallow: /tmp/
  • Disallow: /*?utm_*
  • Disallow: /*?yclid=*
  • Disallow: /*?gclid=*
  • Allow: /wp-content/uploads/
  • Allow: /assets/js/
  • Allow: /assets/css/
  • Sitemap: https://example.com/sitemap.xml
  • Host: example.com

Пояснения:

  • Параметры кампаний utm_, yclid, gclid не нужны в индексе и создают дубли — их закрываем.
  • Отдельно проверьте внутренние поисковые страницы /search/ — почти всегда закрываются.

robots.txt для интернет‑магазина: нюансы фильтров и пагинации

Основные риски магазина — комбинаторика фильтров и пагинация категорий.

Рекомендации:

  • Не закрывайте категории и карточки. Это ядро трафика.
  • Закройте технические параметры сортировки и трекинга: ?sort=, ?view=, ?utm_*, ?gclid=*, ?yclid=*.
  • Для параметров фильтров подход зависит от стратегии:
  • Если фильтр порождает страницы с устойчивым спросом (например, цвет/размер у топ‑категорий) — не закрывайте, обеспечьте каноникал и ЧПУ.
  • Остальные параметры закрывайте через Disallow: /*?*param=* или управлением индексации на уровне rel=canonical и мета robots.
  • Пагинацию (page=2,3,…) не закрывайте в robots.txt, чтобы не ломать обход; используйте rel="prev/next" (если применимо к вашему движку) или корректные каноникалы, и дайте ссылочную связь в шаблоне.

Пример набора запретов для «мусорных» параметров магазина:

  • Disallow: /*?*session=*
  • Disallow: /*?*sid=*
  • Disallow: /*?*sort=*
  • Disallow: /*?*view=*
  • Disallow: /*?*compare=*

robots.txt для WordPress: безопасные правила

Цель — не мешать индексации контента и статики темы/плагинов.

Рекомендуемый набор:

  • User-agent: *
  • Disallow: /wp-admin/
  • Allow: /wp-admin/admin-ajax.php
  • Allow: /wp-content/uploads/
  • Allow: /wp-includes/js/
  • Allow: /wp-content/themes/
  • Disallow: /?s=
  • Disallow: /*?replytocom=
  • Sitemap: https://example.com/sitemap_index.xml
  • Host: example.com

Комментарии:

  • admin-ajax.php нужен для работы функционала — оставляем доступным.
  • Replytocom создаёт дубли; закрываем параметр.
  • Если используете SEO‑плагин (Yoast/Rank Math/All in One SEO), проверьте, какие карты сайта он генерирует, и укажите их все.

Проверка robots.txt: инструменты и методика

План проверки перед выкладкой:

  • Локальная валидация: проверьте синтаксис, пробелы после двоеточия допустимы, но не обязательны.
  • «Сухой прогон» по реальным URL: возьмите выборку ключевых страниц (главная, категория, карточка, статья, страница фильтра, статика CSS/JS) и проверьте, подпадают ли они под Disallow.
  • Google: используйте инструменты инспекции URL в Search Console (для проверки рендеринга и доступности ресурсов).
  • Яндекс: проверьте файл в Вебмастере (раздел «Индексирование» → «Проверка файла robots.txt»).
  • Логи сервера: отследите статус‑коды и активность роботов после обновления.

Полезные ссылки по теме SEO и технической оптимизации:




  • Рекомендуем к прочтению:
    ,

Частые ошибки в robots.txt и как их избежать

Критичные ошибки:

  • Закрыт «/» для всех ботов: Disallow: / в блоке User-agent: * — сайт выпадает из поиска.
  • Запрещены CSS/JS: роботы видят «поломанный» рендер и занижают качество страницы.
  • Конфликтующие правила: общий Disallow и отсутствие нужных Allow для вложенных путей.
  • Закрыт sitemap.xml или не указан вовсе — усложняет обход, особенно для больших сайтов.
  • Несколько строк Host — Яндекс учитывает только первую; остальные игнорируются.
  • Разный robots.txt по HTTP и HTTPS — создаёт неоднозначность, оставляйте единый файл на каноническом зеркале и редиректите остальное на него.

Незаметные проблемы:

  • Маски с «*» и «$» применены слишком широко и режут нужный контент.
  • Запрет «/*?» без исключений, когда часть параметров формирует важные посадочные.
  • Устаревшие директивы, перенесённые «как есть» с прошлых проектов, без критического пересмотра.

Процесс обновления: безопасный деплой

  • Подготовьте черновик и сверяйте каждую строку с картой URL и бизнес‑целями.
  • Проведите тест на стенде или временном поддомене, закройте его от индексации по HTTP‑аутентификации.
  • Залейте файл в корень домена: /robots.txt, убедитесь в статусе 200 и корректной кодировке UTF‑8 без BOM.
  • Сохраните прежнюю версию для отката.
  • Уведомьте поисковики: «Переобход» в Яндекс.Вебмастере, переотправка sitemaps в Google Search Console.
  • Мониторьте логи и отчёты индексации 1–2 недели.

Чек‑лист перед публикацией robots.txt

  • Файл доступен по https://вашдомен.ru/robots.txt и отдаёт 200 OK.
  • Нет строки Disallow: / для User-agent: * (если только не требуется полная блокировка на время).
  • CSS/JS и изображения, необходимые для рендеринга, не заблокированы.
  • Указаны все актуальные карты сайта (Sitemap: …), каждая отдаёт 200 и валидна.
  • Для Яндекса указан один корректный Host.
  • Служебные разделы (админка, поиск, tmp, тестовые каталоги) закрыты.
  • Маркетинговые параметры (utm_, yclid, gclid) закрыты.
  • Проверены выборки: главная, категории, карточки, статьи, пагинация, фильтры с трафиком.
  • Нет конфликтов между Disallow и Allow для нужных путей.
  • Протестировано в Вебмастере и Search Console; обновлены sitemaps.

Вывод

Грамотный robots.txt — это точечные запреты без вреда для контента и рендеринга. Начните с инвентаризации URL и параметров, затем аккуратно примените правила и проверьте результат в инструментах вебмастеров. Нужна помощь с технической частью и аудитом? Обратитесь в Аудит и оптимизация сайта или задайте задачу команде SEO и продвижение — настроим без лишних рисков и с учётом целей бизнеса.

Другие полезные статьи

Делимся экспертизой, разбираем кейсы и рассказываем, как превращать идеи в работающие digital-продукты