robots.txt: как настроить для Яндекса и Google без ошибок
В этом руководстве — практическая robots.txt настройка для Яндекса и Google без рискованных экспериментов. Разберём рабочие директивы, логику приоритетов, примеры для WordPress и интернет‑магазинов, способы проверки и типичные ошибки, из‑за которых поисковики теряют доступ к важным страницам.
Что такое robots.txt и как он работает
Файл robots.txt — это публичный текстовый файл в корне домена, который сообщает поисковым роботам, какие разделы сайта можно или нельзя сканировать. Он не скрывает страницы от пользователей и не защищает данные — это рекомендация для ботов. URL: https://example.com/robots.txt.
Ключевые принципы:
- Правила задаются блоками по User-agent.
- Последовательность строк важна только для чтения человеком; для Google и Яндекс приоритеты задаются логикой соответствия масок.
- Более специфичное правило обычно сильнее общего; у Google действует принцип «наиболее специфичный шаблон», у Яндекса — сходный.
- Disallow запрещает обход путей, Allow разрешает исключения из запрета.
- Sitemap и Host — сервисные директивы: первая указывает карту сайта, вторая (Host) читается Яндексом.
Директивы Disallow/Allow: как составить robots.txt без конфликтов
Базовые директивы:
- User-agent: имя робота (например, Googlebot, Yandex, Bingbot). Звёздочка «*» — правило по умолчанию для всех.
- Disallow: запрет на сканирование пути.
- Allow: разрешение на сканирование внутри ранее запрещённого пути.
- Sitemap: ссылка на карту сайта (можно несколько строк для разных карт).
- Host (только Яндекс): канонический хост для зеркал.
Практические советы:
- Сначала сформулируйте глобальный запрет, затем добавляйте точечные Allow для нужных подпутей.
- Не закрывайте через Disallow то, что планируете ранжировать (карточки, категории, статьи, теги, фильтры со спросом).
- Для медиа и CSS/JS не ставьте запреты, если они участвуют в рендеринге страниц — Google и Яндекс учитывают отображение.
Примеры паттернов:
- Disallow: /admin/ — запретит всё внутри /admin/.
- Disallow: /*? — запретит все URL с параметрами (осторожно с e‑commerce фильтрами).
- Allow: /static/js/ — разрешит подпуть даже при запрете /static/.
User-agent: примеры для Google и Яндекса
Примеры блоков:
- Для всех ботов:
- User-agent: *
- Disallow: /admin/
- Allow: /admin/assets/
- Для Googlebot (если требуется отдельная логика):
- User-agent: Googlebot
- Allow: /
- Для Yandex (основные роботы):
- User-agent: Yandex
- Allow: /
Замечания:
- Если есть блок User-agent: * и специализированный блок (например, для Googlebot), специализированный для этого бота будет приоритетнее.
- Не блокируйте критичные ресурсы рендеринга: /wp-includes/js/, /wp-content/themes/, /assets/css/ и т. п.
Host в robots.txt (Яндекс) и Sitemap для обоих поисковиков
Host:
- Поддерживается Яндексом, игнорируется Google.
- Формат: Host: example.com
- Используйте один раз и указывайте протокол на уровне 301‑редиректов, а в Host — домен без протокола и без пути.
- Если есть поддомены, Host задаётся на каждом зеркале отдельно.
Sitemap:
- Поддерживается всеми основными поисковиками.
- Формат: Sitemap: https://example.com/sitemap.xml
- Можно указывать несколько строк для карт по разделам/языкам.
robots.txt настройка: базовый шаблон для большинства сайтов
Базовый подход: не мешаем обходу контента и статики, закрываем служебные разделы и мусорные параметры.
Шаблон:
- User-agent: *
- Disallow: /admin/
- Disallow: /login/
- Disallow: /search/
- Disallow: /tmp/
- Disallow: /*?utm_*
- Disallow: /*?yclid=*
- Disallow: /*?gclid=*
- Allow: /wp-content/uploads/
- Allow: /assets/js/
- Allow: /assets/css/
- Sitemap: https://example.com/sitemap.xml
- Host: example.com
Пояснения:
- Параметры кампаний utm_, yclid, gclid не нужны в индексе и создают дубли — их закрываем.
- Отдельно проверьте внутренние поисковые страницы /search/ — почти всегда закрываются.
robots.txt для интернет‑магазина: нюансы фильтров и пагинации
Основные риски магазина — комбинаторика фильтров и пагинация категорий.
Рекомендации:
- Не закрывайте категории и карточки. Это ядро трафика.
- Закройте технические параметры сортировки и трекинга: ?sort=, ?view=, ?utm_*, ?gclid=*, ?yclid=*.
- Для параметров фильтров подход зависит от стратегии:
- Если фильтр порождает страницы с устойчивым спросом (например, цвет/размер у топ‑категорий) — не закрывайте, обеспечьте каноникал и ЧПУ.
- Остальные параметры закрывайте через Disallow: /*?*param=* или управлением индексации на уровне rel=canonical и мета robots.
- Пагинацию (page=2,3,…) не закрывайте в robots.txt, чтобы не ломать обход; используйте rel="prev/next" (если применимо к вашему движку) или корректные каноникалы, и дайте ссылочную связь в шаблоне.
Пример набора запретов для «мусорных» параметров магазина:
- Disallow: /*?*session=*
- Disallow: /*?*sid=*
- Disallow: /*?*sort=*
- Disallow: /*?*view=*
- Disallow: /*?*compare=*
robots.txt для WordPress: безопасные правила
Цель — не мешать индексации контента и статики темы/плагинов.
Рекомендуемый набор:
- User-agent: *
- Disallow: /wp-admin/
- Allow: /wp-admin/admin-ajax.php
- Allow: /wp-content/uploads/
- Allow: /wp-includes/js/
- Allow: /wp-content/themes/
- Disallow: /?s=
- Disallow: /*?replytocom=
- Sitemap: https://example.com/sitemap_index.xml
- Host: example.com
Комментарии:
- admin-ajax.php нужен для работы функционала — оставляем доступным.
- Replytocom создаёт дубли; закрываем параметр.
- Если используете SEO‑плагин (Yoast/Rank Math/All in One SEO), проверьте, какие карты сайта он генерирует, и укажите их все.
Проверка robots.txt: инструменты и методика
План проверки перед выкладкой:
- Локальная валидация: проверьте синтаксис, пробелы после двоеточия допустимы, но не обязательны.
- «Сухой прогон» по реальным URL: возьмите выборку ключевых страниц (главная, категория, карточка, статья, страница фильтра, статика CSS/JS) и проверьте, подпадают ли они под Disallow.
- Google: используйте инструменты инспекции URL в Search Console (для проверки рендеринга и доступности ресурсов).
- Яндекс: проверьте файл в Вебмастере (раздел «Индексирование» → «Проверка файла robots.txt»).
- Логи сервера: отследите статус‑коды и активность роботов после обновления.
Полезные ссылки по теме SEO и технической оптимизации:
- Рекомендуем к прочтению:
,
Частые ошибки в robots.txt и как их избежать
Критичные ошибки:
- Закрыт «/» для всех ботов: Disallow: / в блоке User-agent: * — сайт выпадает из поиска.
- Запрещены CSS/JS: роботы видят «поломанный» рендер и занижают качество страницы.
- Конфликтующие правила: общий Disallow и отсутствие нужных Allow для вложенных путей.
- Закрыт sitemap.xml или не указан вовсе — усложняет обход, особенно для больших сайтов.
- Несколько строк Host — Яндекс учитывает только первую; остальные игнорируются.
- Разный robots.txt по HTTP и HTTPS — создаёт неоднозначность, оставляйте единый файл на каноническом зеркале и редиректите остальное на него.
Незаметные проблемы:
- Маски с «*» и «$» применены слишком широко и режут нужный контент.
- Запрет «/*?» без исключений, когда часть параметров формирует важные посадочные.
- Устаревшие директивы, перенесённые «как есть» с прошлых проектов, без критического пересмотра.
Процесс обновления: безопасный деплой
- Подготовьте черновик и сверяйте каждую строку с картой URL и бизнес‑целями.
- Проведите тест на стенде или временном поддомене, закройте его от индексации по HTTP‑аутентификации.
- Залейте файл в корень домена: /robots.txt, убедитесь в статусе 200 и корректной кодировке UTF‑8 без BOM.
- Сохраните прежнюю версию для отката.
- Уведомьте поисковики: «Переобход» в Яндекс.Вебмастере, переотправка sitemaps в Google Search Console.
- Мониторьте логи и отчёты индексации 1–2 недели.
Чек‑лист перед публикацией robots.txt
- Файл доступен по https://вашдомен.ru/robots.txt и отдаёт 200 OK.
- Нет строки Disallow: / для User-agent: * (если только не требуется полная блокировка на время).
- CSS/JS и изображения, необходимые для рендеринга, не заблокированы.
- Указаны все актуальные карты сайта (Sitemap: …), каждая отдаёт 200 и валидна.
- Для Яндекса указан один корректный Host.
- Служебные разделы (админка, поиск, tmp, тестовые каталоги) закрыты.
- Маркетинговые параметры (utm_, yclid, gclid) закрыты.
- Проверены выборки: главная, категории, карточки, статьи, пагинация, фильтры с трафиком.
- Нет конфликтов между Disallow и Allow для нужных путей.
- Протестировано в Вебмастере и Search Console; обновлены sitemaps.
Вывод
Грамотный robots.txt — это точечные запреты без вреда для контента и рендеринга. Начните с инвентаризации URL и параметров, затем аккуратно примените правила и проверьте результат в инструментах вебмастеров. Нужна помощь с технической частью и аудитом? Обратитесь в Аудит и оптимизация сайта или задайте задачу команде SEO и продвижение — настроим без лишних рисков и с учётом целей бизнеса.


