X-Robots-Tag и meta robots: тонкое управление индексацией страниц
Между запретом обхода и запретом индексации лежит пропасть, в которую регулярно проваливаются даже грамотные вебмастера. Файл robots.txt, мета-тег robots и HTTP-заголовок X-Robots-Tag решают разные задачи, и их путаница приводит к двум противоположным катастрофам: либо важные страницы исчезают из выдачи, либо мусор продолжает в ней висеть, несмотря на все попытки его убрать. В этом руководстве мы разберём тонкое управление индексацией: что именно делает каждая директива, как настроить X-Robots-Tag для PDF и изображений, какую критическую ошибку совершает большинство и как её избежать.
Запрет обхода против запрета индексации
Главное, что нужно усвоить: robots.txt управляет обходом, а директивы meta robots и X-Robots-Tag управляют индексацией. Это совершенно разные вещи. Запретить обход — значит сказать роботу «не заходи на эту страницу». Запретить индексацию — значит сказать «зайди, но не показывай её в результатах поиска».
Парадокс в том, что закрытая в robots.txt страница может попасть в индекс. Если на неё ведут внешние ссылки, поисковик узнает о её существовании, не сможет зайти из-за запрета обхода, но всё равно покажет в выдаче — без описания, с пометкой о недоступности содержимого. Это классическая ловушка. О правильной структуре файла robots.txt и его взаимодействии с картой сайта мы подробно писали в гайде о том, как настроить robots.txt и sitemap.xml.
| Инструмент | Что делает | Уровень |
|---|---|---|
| robots.txt | Запрещает обход (заход робота) | Весь сайт, директории |
| meta robots | Запрещает индексацию HTML-страницы | Отдельная страница |
| X-Robots-Tag | Запрещает индексацию любого файла | Страница, тип файла |
Мета-тег robots и его значения
Мета-тег размещается в секции <head> HTML-страницы и выглядит так: <meta name=»robots» content=»noindex, follow»>. Значение content содержит директивы, разделённые запятыми. Разберём основные.
- index / noindex — разрешить или запретить добавление страницы в индекс.
- follow / nofollow — переходить ли роботу по ссылкам со страницы и передавать ли по ним вес.
- noarchive — не показывать сохранённую копию страницы.
- nosnippet — не выводить текстовый сниппет в выдаче.
- noimageindex — не индексировать изображения на странице.
- max-snippet:N — ограничить длину сниппета N символами.
- max-image-preview:large/standard/none — управлять размером превью изображения.
- none — эквивалент noindex, nofollow одновременно.
Самая частая комбинация для служебных страниц — noindex, follow. Это значит: страницу в индекс не добавляй, но по ссылкам с неё ходи и передавай вес дальше. Так поступают, например, со страницами фильтров, которые не нужны в выдаче, но содержат ссылки на полезные товары.
Можно адресовать директивы конкретному роботу. Тег <meta name=»googlebot» content=»noindex»> подействует только на Google, а <meta name=»yandex»> — только на Яндекс. Это полезно, когда нужно разное поведение для разных поисковиков, но на практике применяется редко.
X-Robots-Tag в HTTP-заголовке
У мета-тега robots есть фундаментальное ограничение: он работает только в HTML. А что делать с PDF-файлами, изображениями, документами Word, архивами? У них нет секции <head>, куда можно вставить тег. Здесь на помощь приходит X-Robots-Tag — та же логика директив, но переданная через HTTP-заголовок ответа сервера.
Заголовок выглядит так: X-Robots-Tag: noindex. Он поддерживает все те же значения, что и мета-тег. Главное преимущество — он применяется к любому типу контента и настраивается централизованно на уровне сервера. Например, чтобы закрыть от индексации все PDF-документы на сайте под управлением nginx, в конфигурацию добавляют правило для location с расширением pdf, которое отдаёт нужный заголовок. В Apache аналогичное правило задаётся через директивы FilesMatch в файле конфигурации или .htaccess.
Проверить, что заголовок действительно отдаётся, проще всего командой curl -I по адресу файла — в ответе должна появиться строка X-Robots-Tag. Это же можно увидеть во вкладке Network инструментов разработчика DevTools, открыв нужный запрос и посмотрев его заголовки ответа.
Мета-тег robots — для страниц. X-Robots-Tag — для всего остального. Вместе они покрывают сто процентов контента сайта.
Критическая ошибка: robots.txt плюс noindex
Это самая распространённая и самая разрушительная ошибка в управлении индексацией. Логика кажется железной: чтобы убрать страницу из выдачи, нужно и закрыть её в robots.txt, и поставить noindex. На деле получается ровно наоборот.
Дело в том, что директива noindex живёт внутри страницы — в мета-теге или в HTTP-заголовке. Чтобы её увидеть, робот должен зайти на страницу. Но если страница закрыта в robots.txt, робот туда не заходит. Значит, он никогда не прочитает noindex. В результате страница не удаляется из индекса, потому что команда на удаление физически недоступна роботу. Хуже того, если на страницу есть ссылки, она так и останется висеть в выдаче.
- Уберите страницу из robots.txt — откройте её для обхода.
- Поставьте на страницу noindex через мета-тег или X-Robots-Tag.
- Дождитесь, пока робот переобойдёт страницу и увидит noindex.
- Когда страница выпадет из индекса, при желании можно снова закрыть её в robots.txt — но обычно в этом нет необходимости.
Ускорить переобход поможет повторная отправка страницы на проверку — об этом подробно в материале о том, как ускорить индексацию сайта в Яндексе и Google. Подобные противоречивые директивы регулярно встречаются в нашем списке топ-20 ошибок, которые убивают позиции.
Директивы Яндекса и их особенности
У Яндекса есть исторические особенности. Раньше в robots.txt применялся специальный тег noindex для исключения частей текста из индексации, но он давно устарел и больше не поддерживается — забудьте о нём. Зато активно используется директива Clean-param, которая указывает Яндексу игнорировать определённые параметры URL при обходе. Это эффективный способ борьбы с дублями от меток и сессионных параметров именно для Яндекса.
Для запрета индексации страниц у Яндекса работают те же мета-тег robots и X-Robots-Tag, что и у Google. А вот тонкости работы с параметрами и Clean-param подробно разобраны в материале о параметрах URL и UTM-метках, поскольку подход Яндекса и Google к ним заметно различается.
Типичные ошибки в директивах индексации
Помимо главной ошибки с robots.txt и noindex, есть целый набор более тонких промахов, которые тихо вредят сайту.
Случайный noindex на проде
Классика жанра: разработчик закрыл тестовую версию сайта от индексации мета-тегом noindex на всех страницах, а при выкатке на продакшн забыл его убрать. Сайт уходит из индекса целиком за несколько недель. Это одна из самых частых причин внезапного обвала трафика после релиза. Всегда проверяйте мета-теги robots на боевом сайте сразу после деплоя.
Noindex на важных страницах
Иногда плагин или шаблон по умолчанию закрывает категории, теги или страницы пагинации, которые на самом деле должны быть в индексе. Проверяйте настройки SEO-плагина: что именно он закрывает автоматически.
Nofollow на внутренних ссылках
Когда-то была популярна практика «скульптурирования веса» через nofollow на внутренних ссылках. Сегодня это бессмысленно и вредно: nofollow на внутренних ссылках просто мешает нормальному распределению веса по сайту. Внутренние ссылки должны быть обычными, без атрибута nofollow.
Как найти лишние noindex на сайте
Найти случайно закрытые страницы — критически важная задача аудита. Вот рабочие методы.
- Краулер Screaming Frog или Netpeak Spider при сканировании выгружает столбец с директивами robots для каждой страницы. Отфильтруйте по noindex и сразу увидите весь список закрытых URL — проверьте, нет ли среди них нужных.
- Отчёт «Индексирование» или «Страницы» в Google Search Console показывает страницы, исключённые из индекса по причине «Страница исключена тегом noindex». Если там оказались важные адреса — повод для немедленного исправления. Все возможности консоли разобраны в полном гайде по Google Search Console.
- Точечная проверка отдельной страницы — просмотр исходного кода через Ctrl+U и поиск по слову robots, либо команда curl -I для проверки X-Robots-Tag в заголовках.
Лишние noindex часто пересекаются с проблемой дублей: иногда вместо того, чтобы каноникализировать дубль, его ошибочно закрывают, теряя вес. Эта взаимосвязь подробно объясняется в материале о том, как найти и устранить дублированный контент.
Чек-лист по управлению индексацией
- Понимаете разницу: robots.txt — обход, meta robots и X-Robots-Tag — индексация.
- Страница, которую нужно убрать из индекса, открыта для обхода и имеет noindex.
- Никогда не сочетаете запрет в robots.txt с noindex на одной странице.
- PDF, изображения и документы закрываются через X-Robots-Tag, а не мета-тег.
- После каждого деплоя проверяете отсутствие случайного noindex на проде.
- Внутренние ссылки не помечены nofollow без веской причины.
- Важные страницы (категории, нужная пагинация) не закрыты автоматически плагином.
- Для Яндекса используете актуальные директивы, а не устаревший noindex-тег.
- Регулярно сканируете сайт краулером и сверяете список noindex-страниц.
- Следите за отчётом исключённых страниц в Search Console.
Управление индексацией — это снайперская работа: одна неверная директива способна обрушить трафик всего сайта. Если вы не уверены, какие страницы должны быть в индексе, а какие нет, и боитесь сделать ошибку на живом проекте, доверьте настройку профессионалам. Закажите SEO-продвижение сайта или начните с комплексного SEO-аудита — мы проверим каждую директиву, найдём лишние noindex и выстроим корректную логику индексации, при которой в выдаче окажется только то, что должно приносить трафик.
Услуги LSI Продвижение
Наша команда предлагает полный спектр услуг по SEO-продвижению и технической доработке сайтов. Мы работаем только белыми методами, ориентируемся на реальный бизнес-результат — трафик, заявки и продажи, а не только позиции в отчёте, — и выстраиваем продвижение системно, под конкретные задачи и нишу вашего проекта. Начать можно с бесплатной диагностики, чтобы понять текущее состояние сайта и точки роста, а затем перейти к комплексной работе. Выберите подходящую услугу из списка ниже:
- Бесплатный SEO аудит сайта — автоматическая проверка на 50+ параметров за 2 минуты
- Комплексный SEO аудит — глубокий ручной анализ с рекомендациями от эксперта
- Продвижение сайтов — вывод в ТОП Яндекса и Google по целевым запросам
- SEO консультация — разбор вашего сайта с конкретными рекомендациями
- LSI тексты — экспертный контент, оптимизированный для поисковых систем
- Доработка сайта — техническая оптимизация и исправление ошибок
- Создание сайта под ключ — разработка с нуля с SEO-оптимизацией
- Стоимость продвижения — прозрачные тарифы и условия
- Портфолио и кейсы — реальные результаты наших клиентов
Закажите SEO продвижение сайта
Выведем ваш сайт в ТОП Яндекса и Google. Бесплатная консультация — разберём сайт, найдём точки роста и предложим стратегию продвижения.
Оставить комментарий