Accessibility (a11y) и SEO: как доступность влияет на позиции

Ещё три года назад файл robots.txt заботил вебмастера ровно в одном контексте: пускать или не пускать поисковых роботов Яндекса и Google в служебные разделы сайта. Сегодня к привычным Yandex и Googlebot добавился целый зоопарк краулеров искусственного интеллекта — GPTBot от OpenAI, CCBot от Common Crawl, ClaudeBot, PerplexityBot, Google-Extended, YandexAdditional и десятки других. Они приходят за вашим контентом не для того, чтобы показать его в выдаче, а чтобы обучить языковые модели или подмешать ваш текст в ответ нейросети. И тут возникает дилемма, у которой нет очевидного ответа: закрыть доступ и защитить контент от бесплатного использования — или, наоборот, распахнуть двери, чтобы попасть в ответы ChatGPT и Perplexity и получить трафик нового типа. В этой статье разберём, какие AI-боты существуют, как корректно управлять ими через директивы User-agent и Disallow, как взвесить риски и выгоды, и как проверить по логам сервера, кто на самом деле ходит на ваш сайт.

Зачем ИИ-ботам ваш сайт и чем они отличаются от поисковых

Чтобы принимать решения осознанно, важно понимать: AI-боты ходят на сайты с тремя принципиально разными целями, и смешивать их в голове — главная ошибка. Первая цель — обучение моделей (training). Краулер скачивает миллиарды страниц, складывает их в обучающий корпус, и через полгода ваш текст растворяется в весах нейросети без какой-либо атрибуции и без единого перехода на сайт. Классические представители — GPTBot (частично), CCBot, Google-Extended. Вторая цель — генерация ответа в реальном времени (retrieval / RAG): когда пользователь задаёт вопрос в Perplexity или в режиме поиска ChatGPT, бот идёт на свежие страницы, цитирует их и ставит ссылку-источник. Здесь вы потенциально получаете и упоминание бренда, и переход. Третья цель — индексация для собственного поиска ИИ-системы.

Разница критична. Если бот обучает модель, ваш контент уходит навсегда и бесплатно, а взамен вы не получаете ничего измеримого — ни ссылки, ни трафика, ни бренд-сигнала. Если же бот формирует ответ с цитированием, это новый канал привлечения аудитории, который в англоязычной среде уже называют GEO — Generative Engine Optimization. Подробно механику этого канала мы разбирали в материале про оптимизацию под генеративные поисковые движки. Понимание этой развилки определяет всю вашу политику доступа: один и тот же сайт может пускать «ответных» ботов и блокировать «обучающих».

Ещё одно важное отличие от классических поисковиков — степень соблюдения правил. Googlebot и YandexBot десятилетиями выстраивали репутацию «вежливых» краулеров, которые строго чтят robots.txt. AI-боты молоды, их этика только формируется, и часть из них либо игнорирует директивы, либо маскируется под обычный браузер. Поэтому robots.txt — это инструмент работы с добросовестными ботами, а для недобросовестных нужны другие меры: блокировка на уровне сервера, файрвола или CDN.

Полный справочник AI-ботов: кто есть кто

Чтобы управлять доступом, нужно знать точные имена user-agent. Привожу актуальный на 2026 год перечень основных ИИ-краулеров с указанием, кто их запускает и зачем. Имена в директивах robots.txt чувствительны к написанию, поэтому копируйте их аккуратно — опечатка в одном символе превращает строгий запрет в бесполезную строку, которую бот просто не узнает.

User-agentВладелецНазначениеЧтит robots.txt
GPTBotOpenAIОбучение моделей GPTДа
OAI-SearchBotOpenAIПоиск ChatGPT (выдача ссылок)Да
ChatGPT-UserOpenAIПереход по запросу пользователяЧастично
CCBotCommon CrawlОткрытый корпус для обученияДа
Google-ExtendedGoogleОбучение Gemini / Vertex AIДа
ClaudeBotAnthropicОбучение и ответы ClaudeДа
anthropic-aiAnthropicСбор данных (устаревший токен)Да
PerplexityBotPerplexityИндексация для ответовДа
Perplexity-UserPerplexityПереход по запросу пользователяЧастично
YandexAdditionalЯндексДополнительный сбор для нейросервисовДа
AmazonbotAmazonAlexa и обучение моделейДа
Applebot-ExtendedAppleОбучение Apple IntelligenceДа
BytespiderByteDanceОбучение моделей (TikTok)Часто нет
Meta-ExternalAgentMetaОбучение LlamaДа
cohere-aiCohereОбучение моделейДа

Обратите внимание на пары вроде GPTBot / OAI-SearchBot или PerplexityBot / Perplexity-User. Это разделение «обучающего» и «ответного» агента — именно оно даёт вам возможность тонкой настройки. Можно запретить GPTBot (не хочу, чтобы мой контент учил модель бесплатно), но разрешить OAI-SearchBot (хочу, чтобы ChatGPT цитировал меня в поиске со ссылкой). Отдельная головная боль — Bytespider от ByteDance и ряд менее известных краулеров, которые регулярно ловят на игнорировании запретов; с ними robots.txt не работает, нужна жёсткая блокировка на уровне инфраструктуры.

Запрет в robots.txt — это просьба, а не замок. Добросовестный бот её услышит, недобросовестный пройдёт мимо. Поэтому стратегия доступа к ИИ-краулерам всегда двухуровневая: директивы для вежливых и серверная блокировка для остальных.

Как устроены директивы User-agent и Disallow

Синтаксис robots.txt прост, но в нём легко допустить ошибку, которая обнулит всю настройку. Файл состоит из блоков. Каждый блок начинается со строки User-agent:, где указывается имя бота (или * для всех), а далее идут директивы Disallow: и Allow: с путями. Ключевой нюанс: бот выбирает один наиболее подходящий блок — тот, где его имя указано явно, — и игнорирует блок User-agent: *, если для него есть персональный блок. Это значит, что если вы прописали User-agent: GPTBot с пустым Disallow:, то общий запрет из звёздочки на GPTBot уже не распространится.

  • Disallow: / — полный запрет обхода всего сайта для указанного user-agent.
  • Disallow: (пусто) — явное разрешение обходить всё; перекрывает общий запрет.
  • Disallow: /private/ — запрет конкретного раздела, остальное доступно.
  • Allow: /blog/ — точечное разрешение внутри запрещённой ветки (приоритет более длинного правила).
  • Crawl-delay: 10 — пауза между запросами в секундах (соблюдают не все боты).

Важно не путать robots.txt с другими механизмами управления индексацией. Директива Disallow запрещает обход страницы, но не гарантирует её исключение из выдачи — если на закрытую страницу ведут ссылки, она может попасть в индекс без текста. Для надёжного исключения из выдачи используют noindex через мета-тег или HTTP-заголовок; различия этих инструментов мы детально разобрали в статье про заголовок X-Robots-Tag и мета-теги robots. Базовые принципы составления самого файла и связки его с картой сайта описаны в руководстве о том, как настроить robots.txt и sitemap.xml.

Ещё один частый промах — расположение файла. robots.txt должен лежать строго в корне домена (https://site.ru/robots.txt) и быть доступен по протоколу, который реально используется. Для поддоменов нужен отдельный файл — правила с основного домена на поддомены не распространяются. И помните про регистр: путь /Blog/ и /blog/ для робота — разные вещи на чувствительных к регистру серверах.

Дилемма: пускать ради GEO или защищать контент

Это центральный вопрос всей темы, и универсального ответа на него нет — решение зависит от бизнес-модели сайта. Разберём обе чаши весов честно, без идеологии.

Аргументы за то, чтобы пускать. Генеративные движки стремительно отъедают долю классического поиска. Если ChatGPT, Perplexity или нейроответ Яндекса формирует ответ пользователю и не видит ваш сайт, вас в этом ответе просто нет — вместо вас процитируют конкурента, который доступ открыл. Для информационных и медийных проектов, для блогов экспертов, для B2B-компаний, продающих экспертизу, упоминание в ответе ИИ — это новый верхний уровень воронки, замена позиции в топ-3 классической выдачи. Как именно попадать в эти ответы и какие сигналы для этого нужны, мы описали в практическом гайде как попасть в ответы ChatGPT и Perplexity.

Аргументы за то, чтобы блокировать. Если ваш контент — это и есть продукт (платная аналитика, уникальные базы данных, авторские методики, премиальные тексты), то отдавать его на обучение модели бесплатно означает собственными руками растить конкурента, который завтра воспроизведёт вашу ценность в ответе нейросети без единого перехода к вам. Сюда же относятся медиа с платной подпиской и сайты, где трафик монетизируется напрямую рекламой: если ответ ИИ заменяет визит на сайт, вы теряете показы. Для таких проектов разумно блокировать именно «обучающих» ботов (GPTBot, CCBot, Google-Extended, ClaudeBot), но при этом стоит подумать, не закрыть ли заодно и «ответных» — здесь уже вопрос приоритетов.

Тип сайтаРекомендация по AI-ботамЛогика
Блог эксперта, B2B-услугиПускать всехЦель — упоминания и трафик из ответов ИИ
Корпоративный сайт, лендингиПускать всехКонтент не монетизируется напрямую
Медиа с подпискойБлокировать обучающихКонтент — платный продукт
Платная аналитика, базыБлокировать всех AIУникальные данные — ядро бизнеса
Интернет-магазинПускать ответных, при желании блокировать обучающихКарточки в ответах ИИ дают продажи

Золотая середина для большинства коммерческих сайтов выглядит так: пускаем «ответных» агентов (OAI-SearchBot, PerplexityBot), которые приводят трафик со ссылкой, и блокируем чистых «обучающих» (GPTBot в режиме training, CCBot), которые забирают контент в корпус без отдачи. Так вы сохраняете шанс на видимость в генеративных движках, не отдавая текст на бесплатное обучение.

Влияние на трафик и обучение моделей: что говорят цифры

Многих останавливает страх «потерять трафик», но важно понимать, какой именно. Блокировка обучающих ботов никак не влияет на ваши позиции в классическом поиске Google и Яндекса — Googlebot и YandexBot не имеют отношения к GPTBot или CCBot, это разные краулеры. Можно полностью закрыть сайт от ИИ-обучения и при этом остаться в топе обычной выдачи. Это ключевой факт, который снимает большую часть тревоги: вы не саботируете SEO, блокируя AI.

А вот трафик из генеративных движков — это уже реальность, которую видно в системах аналитики. Переходы из ChatGPT, Perplexity и нейроответов растут двузначными процентами квартал к кварталу на проектах с качественным экспертным контентом. Этот трафик отличается высокой вовлечённостью: пользователь приходит уже «прогретым» ответом ИИ, понимает, к кому идёт, и конвертируется лучше холодного органического. Чтобы корректно его отслеживать, нужно правильно настроить системы веб-аналитики и сегментировать источники — об этом подробно в материале по настройке Яндекс Метрики и Google Analytics.

Отдельная статья расходов, о которой забывают — нагрузка на сервер. AI-боты, особенно агрессивные вроде Bytespider, способны генерировать тысячи запросов в час, выедая ресурсы хостинга и краулинговый бюджет, который мог бы достаться полезным поисковикам. На крупных сайтах доля AI-трафика в логах нередко достигает 20–40% всех роботных запросов. Если эти боты не приносят вам ценности, они просто оплачиваются из вашего кармана через счета за хостинг и замедление сайта для живых посетителей.

Готовые примеры конфигураций robots.txt

Перейдём к практике. Ниже — три рабочих сценария, которые покрывают большинство задач. Подставьте их в корневой robots.txt, не забыв сохранить уже существующие правила для поисковых систем.

Сценарий 1. Блокируем всех ИИ-ботов полностью (для сайтов с уникальным платным контентом):

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: YandexAdditional
Disallow: /

User-agent: Amazonbot
Disallow: /

User-agent: Bytespider
Disallow: /

Сценарий 2. Блокируем обучение, разрешаем цитирование в ответах (золотая середина для коммерции):

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
Disallow:

User-agent: PerplexityBot
Disallow:

Сценарий 3. Пускаем всех ИИ-ботов, но закрываем служебные разделы (для контентных и B2B-проектов, делающих ставку на GEO):

User-agent: *
Disallow: /wp-admin/
Disallow: /cart/
Disallow: /search/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://site.ru/sitemap.xml

Не забывайте: блок User-agent: * AI-боты применяют только если для них нет персонального блока. Поэтому в сценарии 2 общий запрет служебных разделов нужно продублировать в каждом именованном блоке либо вынести служебные пути отдельной строкой. И всегда указывайте Sitemap: — это помогает добросовестным ботам быстрее находить нужные страницы.

Серверная блокировка для тех, кто не слушается

Как мы выяснили, часть ботов игнорирует robots.txt. Против них работает блокировка по user-agent на уровне веб-сервера или CDN. На Apache это делается через .htaccess, на Nginx — через директиву map и проверку $http_user_agent, а проще всего — через правила Cloudflare или другого CDN, где можно настроить challenge или прямой запрет по сигнатуре бота.

  • Apache (.htaccess). Условие RewriteCond %{HTTP_USER_AGENT} (GPTBot|CCBot|Bytespider) [NC] и далее RewriteRule .* - [F,L] отдаёт таким ботам 403.
  • Nginx. В блоке server проверяете if ($http_user_agent ~* "Bytespider|CCBot") { return 403; }.
  • Cloudflare. Создаёте WAF-правило с условием по User Agent и действием Block либо Managed Challenge.
  • Проверка по IP. Для самых агрессивных краулеров — блокировка диапазонов, опубликованных вендором.

Серверная блокировка надёжнее, потому что не полагается на добрую волю бота — она физически не отдаёт ему контент, возвращая код ошибки. Но у неё есть и риск: можно случайно заблокировать полезного бота из-за ошибки в регулярном выражении или зацепить живого пользователя, чей браузер содержит похожую сигнатуру. Поэтому каждое правило обязательно тестируйте и следите за логами после внедрения.

Как проверить по логам, кто реально ходит на сайт

Любая настройка доступа бессмысленна без проверки результата. Единственный источник правды о том, кто и как часто посещает ваш сайт — это логи веб-сервера (access.log). В них видно user-agent, IP, путь, код ответа и время каждого запроса. Регулярный анализ логов покажет, соблюдают ли боты ваши запреты, не перегружают ли сервер и не маскируется ли кто-то под легитимный краулер. Методику полного разбора логов под SEO-задачи мы описали в отдельном руководстве про анализ логов сервера для SEO.

  • Шаг 1. Выгрузите access.log за репрезентативный период (минимум неделя).
  • Шаг 2. Отфильтруйте строки по сигнатурам AI-ботов (GPTBot, CCBot, ClaudeBot и т.д.) и посчитайте долю их запросов.
  • Шаг 3. Проверьте коды ответов: после блокировки на запросы ботов должен идти 403, а не 200.
  • Шаг 4. Сверьте IP с официальными диапазонами вендоров — так вы поймаете «самозванцев», маскирующихся под GPTBot.
  • Шаг 5. Оцените нагрузку: сколько запросов в час генерирует каждый бот и не выедает ли он краулинговый бюджет.

Особое внимание — проверке подлинности. Недобросовестные парсеры любят выдавать себя за GPTBot, чтобы выглядеть легитимно. Настоящий бот OpenAI ходит с конкретных IP-диапазонов, которые вендор публикует. Если в логах вы видите запрос с user-agent GPTBot, но с IP, не входящего в официальный список, — это самозванец, и его нужно блокировать по IP, а не уговаривать через robots.txt. После любой правки robots.txt дайте ботам пару недель и снова сверьтесь с логами: добросовестные краулеры обновляют кеш файла не мгновенно.

Типичные ошибки при управлении AI-ботами

За время работы с десятками проектов мы собрали коллекцию граблей, на которые наступают чаще всего. Избегайте их — и ваша настройка будет работать так, как задумано.

  • Опечатка в имени бота. «GptBot» вместо «GPTBot» — и запрет не срабатывает, бот качает всё.
  • Надежда, что robots.txt — это защита. Это просьба, а не замок; для непослушных нужна серверная блокировка.
  • Блокировка ответных ботов «заодно». Закрыли OAI-SearchBot вместе с GPTBot и потеряли шанс на цитирование в ChatGPT.
  • Забыли про поддомены. На blog.site.ru нужен свой robots.txt, правила с основного домена туда не доходят.
  • Не проверили логи. Настроили запрет и забыли — а бот его игнорирует, и вы об этом не знаете.
  • Перепутали Disallow и noindex. Disallow закрывает обход, но не гарантирует исключение из выдачи или из обучения уже скачанного.

Главная же стратегическая ошибка — принимать решение «в вакууме», без привязки к бизнес-модели. Сначала ответьте на вопрос «является ли мой контент продуктом или приманкой для трафика», и только потом настраивайте файл. Для приманки — пускайте, для продукта — защищайте.

Заключение: настройте доступ осознанно

Управление ИИ-ботами через robots.txt — это уже не экзотика, а обязательный пункт технического SEO-чеклиста в 2026 году. Сформулируйте политику исходя из ценности вашего контента, пропишите директивы для добросовестных краулеров, подкрепите их серверной блокировкой для агрессивных и регулярно сверяйтесь с логами. Так вы не отдадите контент даром туда, где это невыгодно, и одновременно не упустите трафик из генеративных движков там, где он приносит клиентов. Если хотите, чтобы политику доступа, техническую базу и видимость в нейропоиске под ваш сайт настроили профессионалы — закажите комплексное продвижение сайтов или начните с бесплатного SEO-аудита, чтобы увидеть, как ваш сайт выглядит глазами и поисковых, и ИИ-роботов.

Услуги LSI Продвижение

Наша команда предлагает полный спектр услуг по SEO-продвижению и технической доработке сайтов. Мы работаем только белыми методами, ориентируемся на реальный бизнес-результат — трафик, заявки и продажи, а не только позиции в отчёте, — и выстраиваем продвижение системно, под конкретные задачи и нишу вашего проекта. Начать можно с бесплатной диагностики, чтобы понять текущее состояние сайта и точки роста, а затем перейти к комплексной работе. Выберите подходящую услугу из списка ниже:

Закажите SEO продвижение сайта

Выведем ваш сайт в ТОП Яндекса и Google. Бесплатная консультация — разберём сайт, найдём точки роста и предложим стратегию продвижения.

Оставить заявку Бесплатный SEO аудит
Аудит сайта

Comments

  • Андрей

    Не подозревал, что на сайт ходит столько ИИ-ботов помимо Яндекса и Google. Полез в логи после статьи — GPTBot и ClaudeBot реально топчут страницы каждый день. Глаза открылись.

  • Светлана Реброва

    Дилемма пускать или закрывать прям про меня. С одной стороны, хочется попасть в ответы нейросетей (GEO), с другой — жалко отдавать контент на обучение бесплатно. Как вы сами решаете для клиентов?

    • Анатолий Кузнецов

      Светлана, универсального ответа нет, и в статье я специально это подчёркиваю. Для сайтов, где контент — актив и конкурентное преимущество (экспертный блог, уникальные обзоры), чаще закрываю обучающие краулеры и оставляю тех, кто даёт живые переходы. Для сайтов, которым важна широкая узнаваемость и присутствие в ответах нейросетей, пускаю выборочно. Мы в LSI Продвижение решаем это индивидуально по логам и целям проекта, а не по шаблону.

  • Максим

    Закрыл GPTBot и CCBot в robots.txt, а трафик из ChatGPT всё равно шёл. Оказалось, для ответов в реальном времени у OpenAI другой user-agent. Хорошо, что у вас есть полный справочник ботов.

  • Ольга

    А robots.txt эти ИИ-краулеры вообще уважают? Слышала, что многие игнорируют директивы. Тогда какой смысл прописывать Disallow, если они всё равно лезут?

    • Анатолий Кузнецов

      Ольга, честный ответ: уважают не все. Крупные и репутационные (GPTBot, Google-Extended, ClaudeBot) директивы robots.txt обычно соблюдают, потому что им дорога репутация. А вот безымянные скреперы и часть агрессивных парсеров игнорируют файл полностью. Поэтому в статье есть отдельный раздел про серверную блокировку по user-agent и IP — для тех, кто robots.txt не слушает, работает только уровень сервера.

  • Григорий Пенкин

    Спасибо за раздел про серверную блокировку. Как раз для тех, кто не слушается robots.txt. Настроил блок по user-agent на уровне Nginx — часть наглых ботов отвалилась сразу.

  • Вера

    Google-Extended и YandexAdditional — это отдельные боты или те же поисковые, но для обучения ИИ? Не пойму, закроешь их — не выпадешь ли из обычной выдачи заодно?

    • Анатолий Кузнецов

      Вера, это важный нюанс. Google-Extended и YandexAdditional — отдельные токены именно для ИИ/обучения, они НЕ влияют на обычную индексацию. Закрыв Google-Extended, вы запрещаете использовать контент для обучения моделей Google, но Googlebot продолжит индексировать сайт для поиска как обычно. Так что выпасть из выдачи вы этим не рискуете — это и есть удобство раздельных токенов.

  • Денис

    Проверил логи, как советуете, и обнаружил бота, который представляется браузером, но ходит как краулер — тысячи запросов с одного IP. Это тоже ИИ-скребок или уже парсер-вор?

  • Юлия Ковач

    Немного скептична: если закрыть все ИИ-боты, не потеряем ли мы будущий трафик из нейросетей? Мне кажется, GEO это тренд, и лучше пускать, чем защищать текст.

  • Артур

    Отличные готовые конфиги robots.txt, скопировал под свой случай. Вопрос: порядок директив User-agent важен? Если сначала общий Disallow, а потом конкретный бот — как оно отработает?

    • Анатолий Кузнецов

      Артур, порядок User-agent-блоков сам по себе не критичен, но бот выбирает наиболее специфичный подходящий ему блок, а не суммирует правила. Если для GPTBot есть отдельная секция, он читает только её и игнорирует блок User-agent: *. Поэтому конкретные правила для конкретного бота прописывайте в его собственной секции целиком, не рассчитывая, что он «дочитает» общие директивы.

  • Наталья

    У меня блог с уникальными авторскими текстами, и мне совсем не хочется, чтобы их скормили модели без спроса. После статьи закрыла всех ИИ-краулеров, оставила только поисковых. Спасибо за инструкцию.

  • Павел Ершов

    А как отличить настоящего Googlebot от подделки? Боты же могут прикинуться поисковым роботом, чтобы обойти блок. Есть способ проверить по IP или обратному DNS?

  • Ирина

    Раздел про влияние на трафик с цифрами очень ценный. А есть данные, реально ли пуск ИИ-ботов приносит ощутимые переходы из нейросетей, или пока это копейки на фоне поиска?

  • Станислав

    Спор в команде: контент-маркетолог хочет пускать всех ради упоминаний в ChatGPT, а я боюсь за уникальность. Ваша статья дала аргументы обеим сторонам, будем решать по цифрам.

  • Алёна Гуркина

    Настроила блокировку, а потом поймала себя на мысли: а не закрыла ли я случайно нужного поискового робота слишком широким правилом? Как проверить, что я не отстрелила себе трафик?

    • Анатолий Кузнецов

      Алёна, проверить просто: используйте инструмент проверки robots.txt в Яндекс.Вебмастере и Google Search Console — вбиваете URL и смотрите, разрешён ли он для Yandex/Googlebot. Так вы точно увидите, не зацепило ли поисковых роботов слишком широкое правило. Правило: держите директивы для ИИ-ботов в их именных секциях и не трогайте общий блок, тогда поисковый трафик не пострадает.

  • Виталий

    PerplexityDbot и обычный PerplexityBot — это разные краулеры с разными задачами? В справочнике вроде мелькали оба, хочу понять, какой из них за индексацию, а какой за обучение.

  • Марина Соколова

    Спасибо за заключение про осознанную настройку. Раньше я к robots.txt относилась как к формальности, а теперь вижу, что это реальный инструмент управления доступом, а не просто галочка.

  • Кирилл

    Вопрос по логам: каким инструментом удобнее всего разбирать, кто реально ходит на сайт? Руками grep-ать access.log тяжело, есть что-то поудобнее для анализа ботов?

  • Оставить комментарий

    Ваш адрес email не будет опубликован. Обязательные поля помечены *

    Этот сайт использует Akismet для борьбы со спамом. Узнайте, как обрабатываются ваши данные комментариев.