X-Robots-Tag и meta robots: тонкое управление индексацией страниц
Между запретом обхода и запретом индексации лежит пропасть, в которую регулярно проваливаются даже грамотные вебмастера. Файл robots.txt, мета-тег robots и HTTP-заголовок X-Robots-Tag решают разные задачи, и их путаница приводит к двум противоположным катастрофам: либо важные страницы исчезают из выдачи, либо мусор продолжает в ней висеть, несмотря на все попытки его убрать. В этом руководстве мы разберём тонкое управление индексацией: что именно делает каждая директива, как настроить X-Robots-Tag для PDF и изображений, какую критическую ошибку совершает большинство и как её избежать.
Запрет обхода против запрета индексации
Главное, что нужно усвоить: robots.txt управляет обходом, а директивы meta robots и X-Robots-Tag управляют индексацией. Это совершенно разные вещи. Запретить обход — значит сказать роботу «не заходи на эту страницу». Запретить индексацию — значит сказать «зайди, но не показывай её в результатах поиска».
Парадокс в том, что закрытая в robots.txt страница может попасть в индекс. Если на неё ведут внешние ссылки, поисковик узнает о её существовании, не сможет зайти из-за запрета обхода, но всё равно покажет в выдаче — без описания, с пометкой о недоступности содержимого. Это классическая ловушка. О правильной структуре файла robots.txt и его взаимодействии с картой сайта мы подробно писали в гайде о том, как настроить robots.txt и sitemap.xml.
| Инструмент | Что делает | Уровень |
|---|---|---|
| robots.txt | Запрещает обход (заход робота) | Весь сайт, директории |
| meta robots | Запрещает индексацию HTML-страницы | Отдельная страница |
| X-Robots-Tag | Запрещает индексацию любого файла | Страница, тип файла |
Мета-тег robots и его значения
Мета-тег размещается в секции <head> HTML-страницы и выглядит так: <meta name=»robots» content=»noindex, follow»>. Значение content содержит директивы, разделённые запятыми. Разберём основные.
- index / noindex — разрешить или запретить добавление страницы в индекс.
- follow / nofollow — переходить ли роботу по ссылкам со страницы и передавать ли по ним вес.
- noarchive — не показывать сохранённую копию страницы.
- nosnippet — не выводить текстовый сниппет в выдаче.
- noimageindex — не индексировать изображения на странице.
- max-snippet:N — ограничить длину сниппета N символами.
- max-image-preview:large/standard/none — управлять размером превью изображения.
- none — эквивалент noindex, nofollow одновременно.
Самая частая комбинация для служебных страниц — noindex, follow. Это значит: страницу в индекс не добавляй, но по ссылкам с неё ходи и передавай вес дальше. Так поступают, например, со страницами фильтров, которые не нужны в выдаче, но содержат ссылки на полезные товары.
Можно адресовать директивы конкретному роботу. Тег <meta name=»googlebot» content=»noindex»> подействует только на Google, а <meta name=»yandex»> — только на Яндекс. Это полезно, когда нужно разное поведение для разных поисковиков, но на практике применяется редко.
X-Robots-Tag в HTTP-заголовке
У мета-тега robots есть фундаментальное ограничение: он работает только в HTML. А что делать с PDF-файлами, изображениями, документами Word, архивами? У них нет секции <head>, куда можно вставить тег. Здесь на помощь приходит X-Robots-Tag — та же логика директив, но переданная через HTTP-заголовок ответа сервера.
Заголовок выглядит так: X-Robots-Tag: noindex. Он поддерживает все те же значения, что и мета-тег. Главное преимущество — он применяется к любому типу контента и настраивается централизованно на уровне сервера. Например, чтобы закрыть от индексации все PDF-документы на сайте под управлением nginx, в конфигурацию добавляют правило для location с расширением pdf, которое отдаёт нужный заголовок. В Apache аналогичное правило задаётся через директивы FilesMatch в файле конфигурации или .htaccess.
Проверить, что заголовок действительно отдаётся, проще всего командой curl -I по адресу файла — в ответе должна появиться строка X-Robots-Tag. Это же можно увидеть во вкладке Network инструментов разработчика DevTools, открыв нужный запрос и посмотрев его заголовки ответа.
Мета-тег robots — для страниц. X-Robots-Tag — для всего остального. Вместе они покрывают сто процентов контента сайта.
Критическая ошибка: robots.txt плюс noindex
Это самая распространённая и самая разрушительная ошибка в управлении индексацией. Логика кажется железной: чтобы убрать страницу из выдачи, нужно и закрыть её в robots.txt, и поставить noindex. На деле получается ровно наоборот.
Дело в том, что директива noindex живёт внутри страницы — в мета-теге или в HTTP-заголовке. Чтобы её увидеть, робот должен зайти на страницу. Но если страница закрыта в robots.txt, робот туда не заходит. Значит, он никогда не прочитает noindex. В результате страница не удаляется из индекса, потому что команда на удаление физически недоступна роботу. Хуже того, если на страницу есть ссылки, она так и останется висеть в выдаче.
- Уберите страницу из robots.txt — откройте её для обхода.
- Поставьте на страницу noindex через мета-тег или X-Robots-Tag.
- Дождитесь, пока робот переобойдёт страницу и увидит noindex.
- Когда страница выпадет из индекса, при желании можно снова закрыть её в robots.txt — но обычно в этом нет необходимости.
Ускорить переобход поможет повторная отправка страницы на проверку — об этом подробно в материале о том, как ускорить индексацию сайта в Яндексе и Google. Подобные противоречивые директивы регулярно встречаются в нашем списке топ-20 ошибок, которые убивают позиции.
Директивы Яндекса и их особенности
У Яндекса есть исторические особенности. Раньше в robots.txt применялся специальный тег noindex для исключения частей текста из индексации, но он давно устарел и больше не поддерживается — забудьте о нём. Зато активно используется директива Clean-param, которая указывает Яндексу игнорировать определённые параметры URL при обходе. Это эффективный способ борьбы с дублями от меток и сессионных параметров именно для Яндекса.
Для запрета индексации страниц у Яндекса работают те же мета-тег robots и X-Robots-Tag, что и у Google. А вот тонкости работы с параметрами и Clean-param подробно разобраны в материале о параметрах URL и UTM-метках, поскольку подход Яндекса и Google к ним заметно различается.
Типичные ошибки в директивах индексации
Помимо главной ошибки с robots.txt и noindex, есть целый набор более тонких промахов, которые тихо вредят сайту.
Случайный noindex на проде
Классика жанра: разработчик закрыл тестовую версию сайта от индексации мета-тегом noindex на всех страницах, а при выкатке на продакшн забыл его убрать. Сайт уходит из индекса целиком за несколько недель. Это одна из самых частых причин внезапного обвала трафика после релиза. Всегда проверяйте мета-теги robots на боевом сайте сразу после деплоя.
Noindex на важных страницах
Иногда плагин или шаблон по умолчанию закрывает категории, теги или страницы пагинации, которые на самом деле должны быть в индексе. Проверяйте настройки SEO-плагина: что именно он закрывает автоматически.
Nofollow на внутренних ссылках
Когда-то была популярна практика «скульптурирования веса» через nofollow на внутренних ссылках. Сегодня это бессмысленно и вредно: nofollow на внутренних ссылках просто мешает нормальному распределению веса по сайту. Внутренние ссылки должны быть обычными, без атрибута nofollow.
Как найти лишние noindex на сайте
Найти случайно закрытые страницы — критически важная задача аудита. Вот рабочие методы.
- Краулер Screaming Frog или Netpeak Spider при сканировании выгружает столбец с директивами robots для каждой страницы. Отфильтруйте по noindex и сразу увидите весь список закрытых URL — проверьте, нет ли среди них нужных.
- Отчёт «Индексирование» или «Страницы» в Google Search Console показывает страницы, исключённые из индекса по причине «Страница исключена тегом noindex». Если там оказались важные адреса — повод для немедленного исправления. Все возможности консоли разобраны в полном гайде по Google Search Console.
- Точечная проверка отдельной страницы — просмотр исходного кода через Ctrl+U и поиск по слову robots, либо команда curl -I для проверки X-Robots-Tag в заголовках.
Лишние noindex часто пересекаются с проблемой дублей: иногда вместо того, чтобы каноникализировать дубль, его ошибочно закрывают, теряя вес. Эта взаимосвязь подробно объясняется в материале о том, как найти и устранить дублированный контент.
Чек-лист по управлению индексацией
- Понимаете разницу: robots.txt — обход, meta robots и X-Robots-Tag — индексация.
- Страница, которую нужно убрать из индекса, открыта для обхода и имеет noindex.
- Никогда не сочетаете запрет в robots.txt с noindex на одной странице.
- PDF, изображения и документы закрываются через X-Robots-Tag, а не мета-тег.
- После каждого деплоя проверяете отсутствие случайного noindex на проде.
- Внутренние ссылки не помечены nofollow без веской причины.
- Важные страницы (категории, нужная пагинация) не закрыты автоматически плагином.
- Для Яндекса используете актуальные директивы, а не устаревший noindex-тег.
- Регулярно сканируете сайт краулером и сверяете список noindex-страниц.
- Следите за отчётом исключённых страниц в Search Console.
Управление индексацией — это снайперская работа: одна неверная директива способна обрушить трафик всего сайта. Если вы не уверены, какие страницы должны быть в индексе, а какие нет, и боитесь сделать ошибку на живом проекте, доверьте настройку профессионалам. Закажите SEO-продвижение сайта или начните с комплексного SEO-аудита — мы проверим каждую директиву, найдём лишние noindex и выстроим корректную логику индексации, при которой в выдаче окажется только то, что должно приносить трафик.
Услуги LSI Продвижение
Наша команда предлагает полный спектр услуг по SEO-продвижению и технической доработке сайтов. Мы работаем только белыми методами, ориентируемся на реальный бизнес-результат — трафик, заявки и продажи, а не только позиции в отчёте, — и выстраиваем продвижение системно, под конкретные задачи и нишу вашего проекта. Начать можно с бесплатной диагностики, чтобы понять текущее состояние сайта и точки роста, а затем перейти к комплексной работе. Выберите подходящую услугу из списка ниже:
- Бесплатный SEO аудит сайта — автоматическая проверка на 50+ параметров за 2 минуты
- Комплексный SEO аудит — глубокий ручной анализ с рекомендациями от эксперта
- Продвижение сайтов — вывод в ТОП Яндекса и Google по целевым запросам
- SEO консультация — разбор вашего сайта с конкретными рекомендациями
- LSI тексты — экспертный контент, оптимизированный для поисковых систем
- Доработка сайта — техническая оптимизация и исправление ошибок
- Создание сайта под ключ — разработка с нуля с SEO-оптимизацией
- Стоимость продвижения — прозрачные тарифы и условия
- Портфолио и кейсы — реальные результаты наших клиентов
Закажите SEO продвижение сайта
Выведем ваш сайт в ТОП Яндекса и Google. Бесплатная консультация — разберём сайт, найдём точки роста и предложим стратегию продвижения.
Comments
Вот эта разница между запретом обхода и запретом индексации у меня в голове всё время путалась. robots.txt закрывает от сканирования, а noindex от попадания в индекс — и это НЕ одно и то же. Спасибо, что разжевали.
Про критическую ошибку robots.txt плюс noindex прям про меня. Я закрыл раздел в robots.txt и добавил noindex, а страницы всё равно висели в выдаче. Оказывается, робот просто не видел мой noindex, потому что не заходил на страницу.
Светлана, вы абсолютно верно ухватили суть проблемы. Чтобы noindex сработал, робот обязан зайти на страницу и прочитать тег, а закрытие в robots.txt ему это запрещает. Сначала убираем запрет из robots.txt, ждём, пока робот увидит noindex и выкинет страницу, и только потом при желании снова закрываем в robots.
А как правильно поставить X-Robots-Tag для PDF-файлов? У меня прайсы в PDF лезут в поиск, а мета-тег в них не пропишешь. Через .htaccess или на уровне nginx?
Егор, для PDF мета-тег действительно не пропишешь, поэтому X-Robots-Tag через заголовок — единственный корректный путь. На Apache это делается через .htaccess с директивой по FilesMatch для расширения pdf, на nginx — через add_header в нужном location. Если нужно, наша команда поможет настроить без риска зацепить лишнее.
Полезно про nofollow на внутренних ссылках. Раньше по привычке лепил nofollow на служебные ссылки, думая, что экономлю бюджет, а на деле резал перелинковку. Перестал.
Расскажите подробнее про особенности директив именно Яндекса. Слышал, что он некоторые значения meta robots понимает не так, как Google. Это правда?
Случайный noindex на проде — наш кошмар. Разработчик выкатил релиз с тестового окружения, где стоял глобальный noindex, и весь сайт за неделю выпал. Теперь проверяю после каждого деплоя.
А есть способ массово найти все страницы с noindex на большом сайте? Руками по десяти тысячам URL не пролистаешь.
Спасибо за чек-лист. Взяла на вооружение пункт про то, что нельзя закрывать в robots.txt страницу, которую хочешь убрать из индекса через noindex. Логика наконец щёлкнула.
Вопрос по noindex на важных страницах. У меня категория товаров случайно оказалась под noindex после переезда на новый шаблон. Как быстро Яндекс её вернёт после снятия запрета?
Денис, после снятия noindex возврат обычно занимает от нескольких дней до пары недель — зависит от того, как часто робот обходит эту категорию. Ускорить можно переобходом в Яндекс.Вебмастере и усилением внутренних ссылок на неё. Позиции чаще всего восстанавливаются близко к прежним.
Не соглашусь, что X-Robots-Tag всегда лучше мета-тега. Для обычных страниц мета в head проще поддерживать и виднее в исходнике. Заголовок хорош именно для файлов, а не для всего подряд.
У меня вопрос про сочетание noindex, follow. Правильно понимаю, что так страница не индексируется, но ссылки с неё робот всё равно обходит и вес передаёт?
Виктор, всё так: noindex, follow означает, что саму страницу в индекс не берём, но ссылки с неё робот обходит и вес по ним передаёт дальше. Удобно для страниц пагинации и некоторых служебных разделов, которые нужны для навигации робота.
Начинающий сеошник, спасибо огромное за статью. Только сейчас поняла, что robots.txt — это про краулинг, а не про индекс, и что забаненная в robots страница всё равно может попасть в выдачу без сниппета.
А как быть с изображениями? Хочу закрыть от индексации служебные картинки, но не хочу трогать товарные. Через X-Robots-Tag по маске директории это реально сделать?
Отличный материал про то, как найти лишние noindex. Прогнала сайт краулером и обнаружила три важные посадочные страницы под запретом, о которых даже не подозревала. Трафик просел, а причину не могла найти месяцами.
Подскажите, а если на странице одновременно и meta robots noindex, и X-Robots-Tag index — какой сигнал победит? Вдруг где-то настройки конфликтуют.
Борис, при конфликте между meta robots и X-Robots-Tag поисковик выбирает наиболее ограничивающую директиву, то есть noindex победит index. Поэтому важно проверять оба источника — мы на аудитах регулярно находим, что сервер по недосмотру отдаёт заголовок, противоречащий тегу в head.
Спасибо! Всегда боялась трогать заголовки сервера, думала это только для программистов. После вашего объяснения решилась настроить X-Robots-Tag для архива PDF-документов.
Хороший разбор типичных ошибок. Добавлю: у нас была беда, когда CDN кэшировал старый заголовок с noindex, и даже после исправления робот ещё долго видел запрет. Проверяйте кэш.
Оставить комментарий
Мы используем cookies
Для улучшения работы сайта и вашего удобства. Оставаясь на сайте, вы соглашаетесь с политикой конфиденциальности.