X-Robots-Tag и meta robots: тонкое управление индексацией страниц

Между запретом обхода и запретом индексации лежит пропасть, в которую регулярно проваливаются даже грамотные вебмастера. Файл robots.txt, мета-тег robots и HTTP-заголовок X-Robots-Tag решают разные задачи, и их путаница приводит к двум противоположным катастрофам: либо важные страницы исчезают из выдачи, либо мусор продолжает в ней висеть, несмотря на все попытки его убрать. В этом руководстве мы разберём тонкое управление индексацией: что именно делает каждая директива, как настроить X-Robots-Tag для PDF и изображений, какую критическую ошибку совершает большинство и как её избежать.

Запрет обхода против запрета индексации

Главное, что нужно усвоить: robots.txt управляет обходом, а директивы meta robots и X-Robots-Tag управляют индексацией. Это совершенно разные вещи. Запретить обход — значит сказать роботу «не заходи на эту страницу». Запретить индексацию — значит сказать «зайди, но не показывай её в результатах поиска».

Парадокс в том, что закрытая в robots.txt страница может попасть в индекс. Если на неё ведут внешние ссылки, поисковик узнает о её существовании, не сможет зайти из-за запрета обхода, но всё равно покажет в выдаче — без описания, с пометкой о недоступности содержимого. Это классическая ловушка. О правильной структуре файла robots.txt и его взаимодействии с картой сайта мы подробно писали в гайде о том, как настроить robots.txt и sitemap.xml.

ИнструментЧто делаетУровень
robots.txtЗапрещает обход (заход робота)Весь сайт, директории
meta robotsЗапрещает индексацию HTML-страницыОтдельная страница
X-Robots-TagЗапрещает индексацию любого файлаСтраница, тип файла

Мета-тег robots и его значения

Мета-тег размещается в секции <head> HTML-страницы и выглядит так: <meta name=»robots» content=»noindex, follow»>. Значение content содержит директивы, разделённые запятыми. Разберём основные.

  • index / noindex — разрешить или запретить добавление страницы в индекс.
  • follow / nofollow — переходить ли роботу по ссылкам со страницы и передавать ли по ним вес.
  • noarchive — не показывать сохранённую копию страницы.
  • nosnippet — не выводить текстовый сниппет в выдаче.
  • noimageindex — не индексировать изображения на странице.
  • max-snippet:N — ограничить длину сниппета N символами.
  • max-image-preview:large/standard/none — управлять размером превью изображения.
  • none — эквивалент noindex, nofollow одновременно.

Самая частая комбинация для служебных страниц — noindex, follow. Это значит: страницу в индекс не добавляй, но по ссылкам с неё ходи и передавай вес дальше. Так поступают, например, со страницами фильтров, которые не нужны в выдаче, но содержат ссылки на полезные товары.

Можно адресовать директивы конкретному роботу. Тег <meta name=»googlebot» content=»noindex»> подействует только на Google, а <meta name=»yandex»> — только на Яндекс. Это полезно, когда нужно разное поведение для разных поисковиков, но на практике применяется редко.

X-Robots-Tag в HTTP-заголовке

У мета-тега robots есть фундаментальное ограничение: он работает только в HTML. А что делать с PDF-файлами, изображениями, документами Word, архивами? У них нет секции <head>, куда можно вставить тег. Здесь на помощь приходит X-Robots-Tag — та же логика директив, но переданная через HTTP-заголовок ответа сервера.

Заголовок выглядит так: X-Robots-Tag: noindex. Он поддерживает все те же значения, что и мета-тег. Главное преимущество — он применяется к любому типу контента и настраивается централизованно на уровне сервера. Например, чтобы закрыть от индексации все PDF-документы на сайте под управлением nginx, в конфигурацию добавляют правило для location с расширением pdf, которое отдаёт нужный заголовок. В Apache аналогичное правило задаётся через директивы FilesMatch в файле конфигурации или .htaccess.

Проверить, что заголовок действительно отдаётся, проще всего командой curl -I по адресу файла — в ответе должна появиться строка X-Robots-Tag. Это же можно увидеть во вкладке Network инструментов разработчика DevTools, открыв нужный запрос и посмотрев его заголовки ответа.

Мета-тег robots — для страниц. X-Robots-Tag — для всего остального. Вместе они покрывают сто процентов контента сайта.

Критическая ошибка: robots.txt плюс noindex

Это самая распространённая и самая разрушительная ошибка в управлении индексацией. Логика кажется железной: чтобы убрать страницу из выдачи, нужно и закрыть её в robots.txt, и поставить noindex. На деле получается ровно наоборот.

Дело в том, что директива noindex живёт внутри страницы — в мета-теге или в HTTP-заголовке. Чтобы её увидеть, робот должен зайти на страницу. Но если страница закрыта в robots.txt, робот туда не заходит. Значит, он никогда не прочитает noindex. В результате страница не удаляется из индекса, потому что команда на удаление физически недоступна роботу. Хуже того, если на страницу есть ссылки, она так и останется висеть в выдаче.

  1. Уберите страницу из robots.txt — откройте её для обхода.
  2. Поставьте на страницу noindex через мета-тег или X-Robots-Tag.
  3. Дождитесь, пока робот переобойдёт страницу и увидит noindex.
  4. Когда страница выпадет из индекса, при желании можно снова закрыть её в robots.txt — но обычно в этом нет необходимости.

Ускорить переобход поможет повторная отправка страницы на проверку — об этом подробно в материале о том, как ускорить индексацию сайта в Яндексе и Google. Подобные противоречивые директивы регулярно встречаются в нашем списке топ-20 ошибок, которые убивают позиции.

Директивы Яндекса и их особенности

У Яндекса есть исторические особенности. Раньше в robots.txt применялся специальный тег noindex для исключения частей текста из индексации, но он давно устарел и больше не поддерживается — забудьте о нём. Зато активно используется директива Clean-param, которая указывает Яндексу игнорировать определённые параметры URL при обходе. Это эффективный способ борьбы с дублями от меток и сессионных параметров именно для Яндекса.

Для запрета индексации страниц у Яндекса работают те же мета-тег robots и X-Robots-Tag, что и у Google. А вот тонкости работы с параметрами и Clean-param подробно разобраны в материале о параметрах URL и UTM-метках, поскольку подход Яндекса и Google к ним заметно различается.

Типичные ошибки в директивах индексации

Помимо главной ошибки с robots.txt и noindex, есть целый набор более тонких промахов, которые тихо вредят сайту.

Случайный noindex на проде

Классика жанра: разработчик закрыл тестовую версию сайта от индексации мета-тегом noindex на всех страницах, а при выкатке на продакшн забыл его убрать. Сайт уходит из индекса целиком за несколько недель. Это одна из самых частых причин внезапного обвала трафика после релиза. Всегда проверяйте мета-теги robots на боевом сайте сразу после деплоя.

Noindex на важных страницах

Иногда плагин или шаблон по умолчанию закрывает категории, теги или страницы пагинации, которые на самом деле должны быть в индексе. Проверяйте настройки SEO-плагина: что именно он закрывает автоматически.

Nofollow на внутренних ссылках

Когда-то была популярна практика «скульптурирования веса» через nofollow на внутренних ссылках. Сегодня это бессмысленно и вредно: nofollow на внутренних ссылках просто мешает нормальному распределению веса по сайту. Внутренние ссылки должны быть обычными, без атрибута nofollow.

Как найти лишние noindex на сайте

Найти случайно закрытые страницы — критически важная задача аудита. Вот рабочие методы.

  • Краулер Screaming Frog или Netpeak Spider при сканировании выгружает столбец с директивами robots для каждой страницы. Отфильтруйте по noindex и сразу увидите весь список закрытых URL — проверьте, нет ли среди них нужных.
  • Отчёт «Индексирование» или «Страницы» в Google Search Console показывает страницы, исключённые из индекса по причине «Страница исключена тегом noindex». Если там оказались важные адреса — повод для немедленного исправления. Все возможности консоли разобраны в полном гайде по Google Search Console.
  • Точечная проверка отдельной страницы — просмотр исходного кода через Ctrl+U и поиск по слову robots, либо команда curl -I для проверки X-Robots-Tag в заголовках.

Лишние noindex часто пересекаются с проблемой дублей: иногда вместо того, чтобы каноникализировать дубль, его ошибочно закрывают, теряя вес. Эта взаимосвязь подробно объясняется в материале о том, как найти и устранить дублированный контент.

Чек-лист по управлению индексацией

  • Понимаете разницу: robots.txt — обход, meta robots и X-Robots-Tag — индексация.
  • Страница, которую нужно убрать из индекса, открыта для обхода и имеет noindex.
  • Никогда не сочетаете запрет в robots.txt с noindex на одной странице.
  • PDF, изображения и документы закрываются через X-Robots-Tag, а не мета-тег.
  • После каждого деплоя проверяете отсутствие случайного noindex на проде.
  • Внутренние ссылки не помечены nofollow без веской причины.
  • Важные страницы (категории, нужная пагинация) не закрыты автоматически плагином.
  • Для Яндекса используете актуальные директивы, а не устаревший noindex-тег.
  • Регулярно сканируете сайт краулером и сверяете список noindex-страниц.
  • Следите за отчётом исключённых страниц в Search Console.

Управление индексацией — это снайперская работа: одна неверная директива способна обрушить трафик всего сайта. Если вы не уверены, какие страницы должны быть в индексе, а какие нет, и боитесь сделать ошибку на живом проекте, доверьте настройку профессионалам. Закажите SEO-продвижение сайта или начните с комплексного SEO-аудита — мы проверим каждую директиву, найдём лишние noindex и выстроим корректную логику индексации, при которой в выдаче окажется только то, что должно приносить трафик.

Услуги LSI Продвижение

Наша команда предлагает полный спектр услуг по SEO-продвижению и технической доработке сайтов. Мы работаем только белыми методами, ориентируемся на реальный бизнес-результат — трафик, заявки и продажи, а не только позиции в отчёте, — и выстраиваем продвижение системно, под конкретные задачи и нишу вашего проекта. Начать можно с бесплатной диагностики, чтобы понять текущее состояние сайта и точки роста, а затем перейти к комплексной работе. Выберите подходящую услугу из списка ниже:

Закажите SEO продвижение сайта

Выведем ваш сайт в ТОП Яндекса и Google. Бесплатная консультация — разберём сайт, найдём точки роста и предложим стратегию продвижения.

Оставить заявку Бесплатный SEO аудит
Аудит сайта

Comments

  • Андрей

    Вот эта разница между запретом обхода и запретом индексации у меня в голове всё время путалась. robots.txt закрывает от сканирования, а noindex от попадания в индекс — и это НЕ одно и то же. Спасибо, что разжевали.

  • Светлана Ерёмина

    Про критическую ошибку robots.txt плюс noindex прям про меня. Я закрыл раздел в robots.txt и добавил noindex, а страницы всё равно висели в выдаче. Оказывается, робот просто не видел мой noindex, потому что не заходил на страницу.

    • Анатолий Кузнецов

      Светлана, вы абсолютно верно ухватили суть проблемы. Чтобы noindex сработал, робот обязан зайти на страницу и прочитать тег, а закрытие в robots.txt ему это запрещает. Сначала убираем запрет из robots.txt, ждём, пока робот увидит noindex и выкинет страницу, и только потом при желании снова закрываем в robots.

  • Егор

    А как правильно поставить X-Robots-Tag для PDF-файлов? У меня прайсы в PDF лезут в поиск, а мета-тег в них не пропишешь. Через .htaccess или на уровне nginx?

    • Анатолий Кузнецов

      Егор, для PDF мета-тег действительно не пропишешь, поэтому X-Robots-Tag через заголовок — единственный корректный путь. На Apache это делается через .htaccess с директивой по FilesMatch для расширения pdf, на nginx — через add_header в нужном location. Если нужно, наша команда поможет настроить без риска зацепить лишнее.

  • Ирина

    Полезно про nofollow на внутренних ссылках. Раньше по привычке лепил nofollow на служебные ссылки, думая, что экономлю бюджет, а на деле резал перелинковку. Перестал.

  • Владислав Гринь

    Расскажите подробнее про особенности директив именно Яндекса. Слышал, что он некоторые значения meta robots понимает не так, как Google. Это правда?

  • Оксана

    Случайный noindex на проде — наш кошмар. Разработчик выкатил релиз с тестового окружения, где стоял глобальный noindex, и весь сайт за неделю выпал. Теперь проверяю после каждого деплоя.

  • Никита

    А есть способ массово найти все страницы с noindex на большом сайте? Руками по десяти тысячам URL не пролистаешь.

  • Галина

    Спасибо за чек-лист. Взяла на вооружение пункт про то, что нельзя закрывать в robots.txt страницу, которую хочешь убрать из индекса через noindex. Логика наконец щёлкнула.

  • Денис Ушаков

    Вопрос по noindex на важных страницах. У меня категория товаров случайно оказалась под noindex после переезда на новый шаблон. Как быстро Яндекс её вернёт после снятия запрета?

    • Анатолий Кузнецов

      Денис, после снятия noindex возврат обычно занимает от нескольких дней до пары недель — зависит от того, как часто робот обходит эту категорию. Ускорить можно переобходом в Яндекс.Вебмастере и усилением внутренних ссылок на неё. Позиции чаще всего восстанавливаются близко к прежним.

  • Маргарита

    Не соглашусь, что X-Robots-Tag всегда лучше мета-тега. Для обычных страниц мета в head проще поддерживать и виднее в исходнике. Заголовок хорош именно для файлов, а не для всего подряд.

  • Виктор

    У меня вопрос про сочетание noindex, follow. Правильно понимаю, что так страница не индексируется, но ссылки с неё робот всё равно обходит и вес передаёт?

    • Анатолий Кузнецов

      Виктор, всё так: noindex, follow означает, что саму страницу в индекс не берём, но ссылки с неё робот обходит и вес по ним передаёт дальше. Удобно для страниц пагинации и некоторых служебных разделов, которые нужны для навигации робота.

  • Полина Дьякова

    Начинающий сеошник, спасибо огромное за статью. Только сейчас поняла, что robots.txt — это про краулинг, а не про индекс, и что забаненная в robots страница всё равно может попасть в выдачу без сниппета.

  • Руслан

    А как быть с изображениями? Хочу закрыть от индексации служебные картинки, но не хочу трогать товарные. Через X-Robots-Tag по маске директории это реально сделать?

  • Элина

    Отличный материал про то, как найти лишние noindex. Прогнала сайт краулером и обнаружила три важные посадочные страницы под запретом, о которых даже не подозревала. Трафик просел, а причину не могла найти месяцами.

  • Борис Тимофеев

    Подскажите, а если на странице одновременно и meta robots noindex, и X-Robots-Tag index — какой сигнал победит? Вдруг где-то настройки конфликтуют.

    • Анатолий Кузнецов

      Борис, при конфликте между meta robots и X-Robots-Tag поисковик выбирает наиболее ограничивающую директиву, то есть noindex победит index. Поэтому важно проверять оба источника — мы на аудитах регулярно находим, что сервер по недосмотру отдаёт заголовок, противоречащий тегу в head.

  • Жанна

    Спасибо! Всегда боялась трогать заголовки сервера, думала это только для программистов. После вашего объяснения решилась настроить X-Robots-Tag для архива PDF-документов.

  • Станислав

    Хороший разбор типичных ошибок. Добавлю: у нас была беда, когда CDN кэшировал старый заголовок с noindex, и даже после исправления робот ещё долго видел запрет. Проверяйте кэш.

  • Оставить комментарий

    Ваш адрес email не будет опубликован. Обязательные поля помечены *

    Этот сайт использует Akismet для борьбы со спамом. Узнайте, как обрабатываются ваши данные комментариев.