X-Robots-Tag и meta robots: тонкое управление индексацией страниц

Между запретом обхода и запретом индексации лежит пропасть, в которую регулярно проваливаются даже грамотные вебмастера. Файл robots.txt, мета-тег robots и HTTP-заголовок X-Robots-Tag решают разные задачи, и их путаница приводит к двум противоположным катастрофам: либо важные страницы исчезают из выдачи, либо мусор продолжает в ней висеть, несмотря на все попытки его убрать. В этом руководстве мы разберём тонкое управление индексацией: что именно делает каждая директива, как настроить X-Robots-Tag для PDF и изображений, какую критическую ошибку совершает большинство и как её избежать.

Запрет обхода против запрета индексации

Главное, что нужно усвоить: robots.txt управляет обходом, а директивы meta robots и X-Robots-Tag управляют индексацией. Это совершенно разные вещи. Запретить обход — значит сказать роботу «не заходи на эту страницу». Запретить индексацию — значит сказать «зайди, но не показывай её в результатах поиска».

Парадокс в том, что закрытая в robots.txt страница может попасть в индекс. Если на неё ведут внешние ссылки, поисковик узнает о её существовании, не сможет зайти из-за запрета обхода, но всё равно покажет в выдаче — без описания, с пометкой о недоступности содержимого. Это классическая ловушка. О правильной структуре файла robots.txt и его взаимодействии с картой сайта мы подробно писали в гайде о том, как настроить robots.txt и sitemap.xml.

ИнструментЧто делаетУровень
robots.txtЗапрещает обход (заход робота)Весь сайт, директории
meta robotsЗапрещает индексацию HTML-страницыОтдельная страница
X-Robots-TagЗапрещает индексацию любого файлаСтраница, тип файла

Мета-тег robots и его значения

Мета-тег размещается в секции <head> HTML-страницы и выглядит так: <meta name=»robots» content=»noindex, follow»>. Значение content содержит директивы, разделённые запятыми. Разберём основные.

  • index / noindex — разрешить или запретить добавление страницы в индекс.
  • follow / nofollow — переходить ли роботу по ссылкам со страницы и передавать ли по ним вес.
  • noarchive — не показывать сохранённую копию страницы.
  • nosnippet — не выводить текстовый сниппет в выдаче.
  • noimageindex — не индексировать изображения на странице.
  • max-snippet:N — ограничить длину сниппета N символами.
  • max-image-preview:large/standard/none — управлять размером превью изображения.
  • none — эквивалент noindex, nofollow одновременно.

Самая частая комбинация для служебных страниц — noindex, follow. Это значит: страницу в индекс не добавляй, но по ссылкам с неё ходи и передавай вес дальше. Так поступают, например, со страницами фильтров, которые не нужны в выдаче, но содержат ссылки на полезные товары.

Можно адресовать директивы конкретному роботу. Тег <meta name=»googlebot» content=»noindex»> подействует только на Google, а <meta name=»yandex»> — только на Яндекс. Это полезно, когда нужно разное поведение для разных поисковиков, но на практике применяется редко.

X-Robots-Tag в HTTP-заголовке

У мета-тега robots есть фундаментальное ограничение: он работает только в HTML. А что делать с PDF-файлами, изображениями, документами Word, архивами? У них нет секции <head>, куда можно вставить тег. Здесь на помощь приходит X-Robots-Tag — та же логика директив, но переданная через HTTP-заголовок ответа сервера.

Заголовок выглядит так: X-Robots-Tag: noindex. Он поддерживает все те же значения, что и мета-тег. Главное преимущество — он применяется к любому типу контента и настраивается централизованно на уровне сервера. Например, чтобы закрыть от индексации все PDF-документы на сайте под управлением nginx, в конфигурацию добавляют правило для location с расширением pdf, которое отдаёт нужный заголовок. В Apache аналогичное правило задаётся через директивы FilesMatch в файле конфигурации или .htaccess.

Проверить, что заголовок действительно отдаётся, проще всего командой curl -I по адресу файла — в ответе должна появиться строка X-Robots-Tag. Это же можно увидеть во вкладке Network инструментов разработчика DevTools, открыв нужный запрос и посмотрев его заголовки ответа.

Мета-тег robots — для страниц. X-Robots-Tag — для всего остального. Вместе они покрывают сто процентов контента сайта.

Критическая ошибка: robots.txt плюс noindex

Это самая распространённая и самая разрушительная ошибка в управлении индексацией. Логика кажется железной: чтобы убрать страницу из выдачи, нужно и закрыть её в robots.txt, и поставить noindex. На деле получается ровно наоборот.

Дело в том, что директива noindex живёт внутри страницы — в мета-теге или в HTTP-заголовке. Чтобы её увидеть, робот должен зайти на страницу. Но если страница закрыта в robots.txt, робот туда не заходит. Значит, он никогда не прочитает noindex. В результате страница не удаляется из индекса, потому что команда на удаление физически недоступна роботу. Хуже того, если на страницу есть ссылки, она так и останется висеть в выдаче.

  1. Уберите страницу из robots.txt — откройте её для обхода.
  2. Поставьте на страницу noindex через мета-тег или X-Robots-Tag.
  3. Дождитесь, пока робот переобойдёт страницу и увидит noindex.
  4. Когда страница выпадет из индекса, при желании можно снова закрыть её в robots.txt — но обычно в этом нет необходимости.

Ускорить переобход поможет повторная отправка страницы на проверку — об этом подробно в материале о том, как ускорить индексацию сайта в Яндексе и Google. Подобные противоречивые директивы регулярно встречаются в нашем списке топ-20 ошибок, которые убивают позиции.

Директивы Яндекса и их особенности

У Яндекса есть исторические особенности. Раньше в robots.txt применялся специальный тег noindex для исключения частей текста из индексации, но он давно устарел и больше не поддерживается — забудьте о нём. Зато активно используется директива Clean-param, которая указывает Яндексу игнорировать определённые параметры URL при обходе. Это эффективный способ борьбы с дублями от меток и сессионных параметров именно для Яндекса.

Для запрета индексации страниц у Яндекса работают те же мета-тег robots и X-Robots-Tag, что и у Google. А вот тонкости работы с параметрами и Clean-param подробно разобраны в материале о параметрах URL и UTM-метках, поскольку подход Яндекса и Google к ним заметно различается.

Типичные ошибки в директивах индексации

Помимо главной ошибки с robots.txt и noindex, есть целый набор более тонких промахов, которые тихо вредят сайту.

Случайный noindex на проде

Классика жанра: разработчик закрыл тестовую версию сайта от индексации мета-тегом noindex на всех страницах, а при выкатке на продакшн забыл его убрать. Сайт уходит из индекса целиком за несколько недель. Это одна из самых частых причин внезапного обвала трафика после релиза. Всегда проверяйте мета-теги robots на боевом сайте сразу после деплоя.

Noindex на важных страницах

Иногда плагин или шаблон по умолчанию закрывает категории, теги или страницы пагинации, которые на самом деле должны быть в индексе. Проверяйте настройки SEO-плагина: что именно он закрывает автоматически.

Nofollow на внутренних ссылках

Когда-то была популярна практика «скульптурирования веса» через nofollow на внутренних ссылках. Сегодня это бессмысленно и вредно: nofollow на внутренних ссылках просто мешает нормальному распределению веса по сайту. Внутренние ссылки должны быть обычными, без атрибута nofollow.

Как найти лишние noindex на сайте

Найти случайно закрытые страницы — критически важная задача аудита. Вот рабочие методы.

  • Краулер Screaming Frog или Netpeak Spider при сканировании выгружает столбец с директивами robots для каждой страницы. Отфильтруйте по noindex и сразу увидите весь список закрытых URL — проверьте, нет ли среди них нужных.
  • Отчёт «Индексирование» или «Страницы» в Google Search Console показывает страницы, исключённые из индекса по причине «Страница исключена тегом noindex». Если там оказались важные адреса — повод для немедленного исправления. Все возможности консоли разобраны в полном гайде по Google Search Console.
  • Точечная проверка отдельной страницы — просмотр исходного кода через Ctrl+U и поиск по слову robots, либо команда curl -I для проверки X-Robots-Tag в заголовках.

Лишние noindex часто пересекаются с проблемой дублей: иногда вместо того, чтобы каноникализировать дубль, его ошибочно закрывают, теряя вес. Эта взаимосвязь подробно объясняется в материале о том, как найти и устранить дублированный контент.

Чек-лист по управлению индексацией

  • Понимаете разницу: robots.txt — обход, meta robots и X-Robots-Tag — индексация.
  • Страница, которую нужно убрать из индекса, открыта для обхода и имеет noindex.
  • Никогда не сочетаете запрет в robots.txt с noindex на одной странице.
  • PDF, изображения и документы закрываются через X-Robots-Tag, а не мета-тег.
  • После каждого деплоя проверяете отсутствие случайного noindex на проде.
  • Внутренние ссылки не помечены nofollow без веской причины.
  • Важные страницы (категории, нужная пагинация) не закрыты автоматически плагином.
  • Для Яндекса используете актуальные директивы, а не устаревший noindex-тег.
  • Регулярно сканируете сайт краулером и сверяете список noindex-страниц.
  • Следите за отчётом исключённых страниц в Search Console.

Управление индексацией — это снайперская работа: одна неверная директива способна обрушить трафик всего сайта. Если вы не уверены, какие страницы должны быть в индексе, а какие нет, и боитесь сделать ошибку на живом проекте, доверьте настройку профессионалам. Закажите SEO-продвижение сайта или начните с комплексного SEO-аудита — мы проверим каждую директиву, найдём лишние noindex и выстроим корректную логику индексации, при которой в выдаче окажется только то, что должно приносить трафик.

Услуги LSI Продвижение

Наша команда предлагает полный спектр услуг по SEO-продвижению и технической доработке сайтов. Мы работаем только белыми методами, ориентируемся на реальный бизнес-результат — трафик, заявки и продажи, а не только позиции в отчёте, — и выстраиваем продвижение системно, под конкретные задачи и нишу вашего проекта. Начать можно с бесплатной диагностики, чтобы понять текущее состояние сайта и точки роста, а затем перейти к комплексной работе. Выберите подходящую услугу из списка ниже:

Закажите SEO продвижение сайта

Выведем ваш сайт в ТОП Яндекса и Google. Бесплатная консультация — разберём сайт, найдём точки роста и предложим стратегию продвижения.

Оставить заявку Бесплатный SEO аудит
Аудит сайта

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Этот сайт использует Akismet для борьбы со спамом. Узнайте, как обрабатываются ваши данные комментариев.