Robots.txt для ИИ-ботов: пускать ли GPTBot, CCBot и других
Ещё пять лет назад файл robots.txt волновал вебмастеров только в одном контексте — как закрыть от поисковых роботов служебные страницы и не слить краулинговый бюджет. Сегодня к привычным Яндексу и Google добавился новый класс посетителей: краулеры искусственного интеллекта. GPTBot от OpenAI, CCBot из проекта Common Crawl, Google-Extended, ClaudeBot, PerplexityBot, YandexAdditional — десятки агентов ежедневно обходят сайты, чтобы обучать языковые модели и формировать ответы нейропоисковиков. И перед владельцем сайта встаёт неочевидная дилемма: пускать этих ботов ради видимости в ответах ИИ или блокировать, чтобы защитить контент от бесплатного копирования. В этой статье разберём полный список AI-ботов, синтаксис директив, стратегию выбора, влияние на трафик и обучение моделей, готовые конфиги и способ проверить всё по логам сервера.
Кто такие AI-боты и зачем они обходят ваш сайт
AI-бот — это автоматизированный краулер, который собирает текстовый и медийный контент сайтов для двух принципиально разных задач. Первая — обучение больших языковых моделей: компании скачивают гигантские объёмы текста, чтобы модель «знала» факты и стиль изложения. Вторая — генерация ответов в реальном времени: когда пользователь задаёт вопрос нейропоисковику, система отправляет бота за свежими данными прямо в момент запроса. Эти два сценария требуют разного отношения, потому что первый забирает ваш контент навсегда без отдачи трафика, а второй может привести к вам живого читателя через ссылку-источник.
Технически AI-краулеры работают так же, как классические поисковые роботы: они представляются строкой User-agent, запрашивают страницы по HTTP, уважают (в большинстве случаев) директивы robots.txt и оставляют следы в логах сервера. Принципиальное отличие в том, что они не строят традиционный поисковый индекс с выдачей из десяти синих ссылок, а либо пополняют обучающий датасет, либо формируют сжатый текстовый ответ. Поэтому привычная логика «чем больше роботов, тем лучше» здесь не работает — нужно осознанно решать, какому агенту что разрешить. Понимание того, как вообще устроен файл управления роботами, начинается с базовых принципов, которые мы подробно разобрали в материале о том, как правильно настроить robots.txt и sitemap.xml.
Важно понимать масштаб явления. По данным анализа серверных логов на проектах, которые мы ведём, доля запросов от AI-краулеров за 2024–2025 годы выросла с единиц процентов до 15–30% от всего бот-трафика на контентных сайтах. Для блога с тысячами статей это означает заметную дополнительную нагрузку на сервер и реальный риск того, что ваши экспертные материалы окажутся в обучающей выборке без какого-либо упоминания авторства. Игнорировать этот трафик уже нельзя — он стал постоянной частью жизни любого публичного ресурса.
Полный список AI-ботов: кого пускать решаете вы
Чтобы управлять доступом, нужно знать точные имена User-agent. Ниже — актуальный перечень самых значимых AI-краулеров с указанием их владельца и назначения. При сопоставлении строки в robots.txt большинство роботов сравнивают её без учёта регистра, однако безопаснее указывать имена ровно так, как декларирует владелец, — это исключает разночтения и ошибки.
| User-agent | Владелец | Назначение |
|---|---|---|
| GPTBot | OpenAI | Сбор данных для обучения моделей GPT |
| OAI-SearchBot | OpenAI | Индексация для поиска ChatGPT Search |
| ChatGPT-User | OpenAI | Запросы по требованию (плагины, браузинг) |
| CCBot | Common Crawl | Открытый датасет, питающий многие модели |
| Google-Extended | Согласие на использование контента в Gemini и AI Overviews | |
| ClaudeBot | Anthropic | Сбор данных для обучения моделей Claude |
| Claude-Web | Anthropic | Запросы по требованию для ответов ассистента |
| PerplexityBot | Perplexity | Индексация для нейропоисковика Perplexity |
| YandexAdditional | Яндекс | Дополнительный сбор для нейросетевых сервисов |
| Amazonbot | Amazon | Данные для Alexa и моделей Amazon |
| Bytespider | ByteDance | Сбор данных, часто агрессивный обход |
| Applebot-Extended | Apple | Согласие на использование контента для Apple Intelligence |
| Meta-ExternalAgent | Meta | Сбор данных для обучения моделей Llama |
Обратите внимание на тонкость: некоторые компании специально разделили боты обучения и боты выдачи. Например, GPTBot обучает модель, а OAI-SearchBot отвечает за поисковую витрину ChatGPT — это позволяет запретить первое, но разрешить второе. То же с Google: классический Googlebot отвечает за обычную выдачу, а Google-Extended управляет исключительно тем, попадёт ли ваш контент в Gemini и AI Overviews. Блокировка Google-Extended не убирает сайт из основного поиска Google — это критически важно не перепутать, иначе можно случайно лишиться органического трафика.
Главная ошибка новичка — заблокировать Google-Extended и решить, что «закрылся от ИИ Google», а заодно случайно прописать Disallow для Googlebot и выпасть из обычной выдачи. Это два разных агента, и путать их недопустимо.
Синтаксис директив User-agent и Disallow для AI-ботов
Управление AI-краулерами строится на тех же двух директивах, что и весь robots.txt: User-agent задаёт, к какому роботу применяются правила, а Disallow и Allow указывают, какие пути закрыты или открыты. Каждая группа правил начинается со строки User-agent, после которой идёт одна или несколько строк Disallow/Allow. Пустая строка отделяет одну группу от другой. Робот выбирает наиболее специфичную для себя группу: если есть отдельный блок для GPTBot, он применит именно его, игнорируя общий блок со звёздочкой.
- Полный запрет краулера. Сочетание
User-agent: GPTBotиDisallow: /закрывает весь сайт для этого агента. - Запрет отдельных разделов.
Disallow: /blog/закрывает только каталог блога, остальное остаётся доступным. - Точечное разрешение внутри запрета. Сначала
Disallow: /, затемAllow: /about/— открыт только раздел «О компании». - Полный доступ. Пустая строка
Disallow:без значения означает, что запретов нет.
Помните о трёх принципиальных ограничениях. Во-первых, robots.txt — это рекомендация, а не технический барьер: добросовестные боты вроде GPTBot, ClaudeBot и Google-Extended её соблюдают, но недобросовестные могут проигнорировать. Во-вторых, файл должен лежать строго в корне домена по адресу /robots.txt и отдаваться с кодом 200. В-третьих, директивы не защищают уже скачанный контент — они работают только на будущее. Для жёсткого ограничения на уровне ответа сервера применяют иные механизмы, о которых мы рассказали в гайде по заголовку X-Robots-Tag и мета-тегу robots.
Отдельно стоит сказать про директиву Crawl-delay, которую понимают не все AI-боты. Bytespider и некоторые агрессивные краулеры способны генерировать сотни запросов в минуту, перегружая слабый хостинг. Crawl-delay в секундах теоретически замедляет обход, но GPTBot и ClaudeBot официально её игнорируют, поэтому для них единственный рычаг — полный или частичный Disallow либо блокировка на уровне веб-сервера и CDN. Не стоит полагаться на эту директиву как на универсальное средство сдерживания нагрузки.
Дилемма: пускать ради GEO или защищать контент
Это центральный вопрос всей темы, и универсального ответа на него нет — решение зависит от бизнес-модели сайта. С одной стороны, появилась целая дисциплина оптимизации под нейропоиск, которую называют GEO (Generative Engine Optimization). Её суть в том, чтобы ваш бренд и контент цитировались в ответах ChatGPT, Perplexity и нейро-Яндекса. Чтобы туда попасть, краулеры этих систем должны иметь доступ к вашим страницам — иначе как они узнают о вашей экспертизе? Подробно стратегию мы разобрали в статье о GEO и оптимизации под генеративные движки.
С другой стороны, разрешая обучающим ботам забирать тексты, вы фактически бесплатно отдаёте интеллектуальную собственность. Модель «выучит» вашу уникальную методику, кейсы и формулировки, а затем будет пересказывать их пользователям без ссылки на вас. Для медиа, образовательных проектов и авторских блогов это прямая угроза: трафик уходит в чат-интерфейс, минуя сайт. Именно поэтому крупные издания — от международных газет до российских СМИ — массово закрыли GPTBot и CCBot ещё в 2023–2024 годах.
Практичный подход — разделять боты по функции. Логика такая: краулеры, которые приводят трафик через ссылки-источники, такие как OAI-SearchBot, PerplexityBot и ChatGPT-User, мы пускаем, потому что они работают как новый канал. А чисто обучающие боты — GPTBot, CCBot, ClaudeBot, Google-Extended, Applebot-Extended — которые забирают контент без отдачи, мы либо блокируем, либо открываем только некоммерческие разделы. Понять, как именно нейропоисковики выбирают источники для ответов, помогает наш разбор о том, как попасть в ответы ChatGPT и Perplexity.
Не существует «правильного» ответа для всех. Интернет-магазин и SEO-агентство выигрывают от цитирования в нейропоиске, а платный курс или закрытая база знаний — теряют. Сначала определите, что вы монетизируете: трафик на сайт или контент сам по себе.
Влияние на трафик и обучение моделей
Разберём механику влияния на цифрах. Когда ваш контент попадает в обучающую выборку, происходит «размывание авторства»: модель воспроизводит идею, но не передаёт ни ссылку, ни упоминание бренда. Эффект отложенный и трудноизмеримый — вы не увидите его в аналитике напрямую, но в перспективе он снижает уникальность вашего предложения на рынке. По нашим оценкам, для экспертных B2B-сайтов это второстепенный риск, а для контентных проектов с подпиской — первостепенный.
Иначе работают боты выдачи. Когда PerplexityBot или OAI-SearchBot включают ваш материал в ответ как источник, пользователь видит сноску со ссылкой и может кликнуть. Этот трафик уже фиксируется в системах аналитики как переход с домена ИИ-сервиса. Мы наблюдаем на проектах рост таких переходов: пока это доли процента от поискового трафика, но динамика устойчиво растущая, и недооценивать новый канал нельзя. Чтобы корректно отслеживать его в отчётах, важно правильно настроить системы веб-аналитики — об этом подробно в материале о настройке Яндекс Метрики и Google Analytics.
Есть и прямой технический эффект — нагрузка. AI-краулеры, особенно Bytespider и ClaudeBot в периоды активного сбора, способны генерировать пиковые объёмы запросов, которые роняют отклик сервера и расходуют лимиты хостинга. Если вы заметили скачок нагрузки без роста реального трафика — первым делом проверьте логи на предмет AI-ботов. На крупных сайтах это пересекается с задачей управления краулинговым бюджетом, ведь каждый лишний обход — это потраченные ресурсы сервера, которые могли бы достаться полезным посетителям.
Готовые примеры конфигов robots.txt
Перейдём к практике. Ниже — три типовых сценария. Первый — полный запрет всех известных обучающих AI-ботов при сохранении обычной поисковой выдачи. Это выбор для авторских блогов и медиа, которые хотят остаться в Яндексе и Google, но не кормить языковые модели.
User-agent: GPTBot Disallow: / User-agent: CCBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: Applebot-Extended Disallow: / User-agent: Bytespider Disallow: / User-agent: Meta-ExternalAgent Disallow: /
Второй сценарий — гибридный, для бизнеса, который хочет в GEO. Здесь мы блокируем чисто обучающие боты, но пускаем краулеры выдачи, чтобы попадать в ответы со ссылкой-источником. Дополнительно закрываем служебные разделы для всех роботов.
User-agent: GPTBot Disallow: / User-agent: CCBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: OAI-SearchBot Allow: / User-agent: PerplexityBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: * Disallow: /wp-admin/ Disallow: /cart/ Sitemap: https://example.ru/sitemap.xml
Третий сценарий — максимально открытый: пускаем все AI-боты, чтобы получить максимум присутствия в нейросервисах. Это осознанный выбор для сайтов услуг и интернет-магазинов, где цитирование бренда важнее защиты текстов. В этом случае отдельные блоки для AI-ботов не нужны — достаточно стандартного robots.txt без запретов для них. Если вы выбираете эту стратегию, уделите внимание грамотной структуре сайта, чтобы ботам было удобно его обходить — об этом в гайде об идеальной архитектуре сайта для SEO.
- Проверьте корень. Файл доступен по адресу домен/robots.txt и отдаёт код 200.
- Не перепутайте Googlebot и Google-Extended. Запрет первого выкинет вас из поиска.
- Добавьте Sitemap. Строка Sitemap указывает роботам карту сайта.
- Тестируйте в валидаторе. Используйте инструменты проверки robots.txt в Яндекс Вебмастере и Google Search Console.
- Дублируйте защиту на сервере. Для недобросовестных ботов добавьте блокировку по User-agent на уровне Nginx или CDN.
Как проверить доступ AI-ботов по логам сервера
Файл robots.txt — это декларация о намерениях, а реальную картину показывают только логи. Анализ access.log — единственный способ узнать, кто на самом деле приходит к вам, как часто и соблюдает ли запреты. В логах AI-боты идентифицируются по строке User-agent, которую они честно — в случае добросовестных краулеров — передают в каждом запросе. Системный подход к этой задаче мы описали в развёрнутом материале об анализе логов сервера для SEO.
Базовый аудит выполняется командами grep по лог-файлу. Чтобы посчитать обращения GPTBot за период, достаточно отфильтровать строки с этим User-agent и подсчитать их количество. Если после установки Disallow для GPTBot вы по-прежнему видите его запросы к закрытым страницам — значит, бот игнорирует правила, что для официального GPTBot нетипично, либо это подделка User-agent, и нужна блокировка на уровне сервера. Добросовестные боты после запрета должны обращаться только к /robots.txt и прекратить обход остального сайта.
- Фильтрация по User-agent. Команда grep по строкам GPTBot, CCBot, ClaudeBot покажет частоту визитов.
- Проверка кодов ответа. Убедитесь, что закрытые боты получают на запрещённых URL отказ, а не код 200.
- Верификация по IP. Сверьте IP-адреса с официальными диапазонами OpenAI и Anthropic — так вы отличите настоящего бота от подделки.
- Динамика во времени. Сравните объём AI-трафика помесячно, чтобы заметить пики нагрузки.
- Доля от общего обхода. Оцените, какой процент краулингового ресурса забирают именно AI-агенты.
Регулярный лог-аудит — раз в месяц для крупных сайтов и раз в квартал для небольших — позволяет держать ситуацию под контролем. Вы увидите новых ботов, которые появляются практически ежемесячно, и сможете оперативно решить, добавлять ли их в robots.txt. Это часть зрелой технической SEO-гигиены наравне с контролем индексации и кодов ответа сервера.
Типичные ошибки при управлении AI-ботами
Опыт показывает, что вебмастера совершают одни и те же промахи. Самый частый — копирование чужого robots.txt без понимания, в результате чего на коммерческом сайте оказываются заблокированы боты выдачи, которые могли бы приводить трафик. Второй по распространённости — блокировка через Disallow в надежде защитить уже опубликованный контент, хотя директива работает только на будущие обходы, а скачанное ранее уже в датасетах.
Третья ошибка — синтаксические опечатки: лишний слеш, неверный регистр пути, пропущенная пустая строка между группами. AI-боты, как и Яндекс с Google, при некорректном синтаксисе могут проигнорировать всю группу правил. Поэтому после любой правки обязательно прогоняйте файл через валидатор. Четвёртая — игнорирование подделок User-agent: злоумышленники маскируются под GPTBot, чтобы парсить сайт, и здесь robots.txt бессилен — нужна верификация по IP и блокировка на сервере или через Cloudflare.
Пятая ошибка стратегического уровня — отсутствие пересмотра решения. Рынок AI-краулеров меняется стремительно: появляются новые агенты, компании разделяют боты обучения и выдачи, меняют правила. Стратегия, которую вы выбрали год назад, сегодня может работать против вас. Поэтому управление AI-ботами — это не разовая настройка, а постоянный процесс, встроенный в общий техаудит сайта и регулярный мониторинг логов.
Подведём итог. Robots.txt стал инструментом стратегического выбора между видимостью в нейропоиске и защитой контента. Грамотная настройка требует знания актуального списка ботов, понимания разницы между краулерами обучения и выдачи, аккуратного синтаксиса и регулярной проверки по логам. Если вы хотите, чтобы файл robots.txt и вся техническая часть сайта работали на результат, а не против него, доверьте настройку профессионалам: закажите комплексный SEO-аудит сайта, в рамках которого мы проверим управление ботами, индексацию и краулинговый бюджет, либо запишитесь на персональную SEO-консультацию, где разберём вашу стратегию работы с AI-краулерами и нейропоиском.
Услуги LSI Продвижение
Наша команда предлагает полный спектр услуг по SEO-продвижению и технической доработке сайтов. Мы работаем только белыми методами, ориентируемся на реальный бизнес-результат — трафик, заявки и продажи, а не только позиции в отчёте, — и выстраиваем продвижение системно, под конкретные задачи и нишу вашего проекта. Начать можно с бесплатной диагностики, чтобы понять текущее состояние сайта и точки роста, а затем перейти к комплексной работе. Выберите подходящую услугу из списка ниже:
- Бесплатный SEO аудит сайта — автоматическая проверка на 50+ параметров за 2 минуты
- Комплексный SEO аудит — глубокий ручной анализ с рекомендациями от эксперта
- Продвижение сайтов — вывод в ТОП Яндекса и Google по целевым запросам
- SEO консультация — разбор вашего сайта с конкретными рекомендациями
- LSI тексты — экспертный контент, оптимизированный для поисковых систем
- Доработка сайта — техническая оптимизация и исправление ошибок
- Создание сайта под ключ — разработка с нуля с SEO-оптимизацией
- Стоимость продвижения — прозрачные тарифы и условия
- Портфолио и кейсы — реальные результаты наших клиентов
Закажите SEO продвижение сайта
Выведем ваш сайт в ТОП Яндекса и Google. Бесплатная консультация — разберём сайт, найдём точки роста и предложим стратегию продвижения.
Comments
Отличный разбор дилеммы. Реально сижу и не могу решить: пускать GPTBot ради видимости в ответах или защищать контент от бесплатного скармливания в обучение.
А если я закрою CCBot, это как-то повлияет на то, будет ли меня цитировать ChatGPT? Или обучающий краулер и краулер для ответов — разные вещи?
Ната, это разные вещи, и различие важное. CCBot и обучающие краулеры собирают данные для тренировки моделей, а за цитирование в реальном времени отвечают краулеры ответов — например, у Perplexity свой бот, у OpenAI отдельный агент для поиска. Можно закрыть обучающих и оставить тех, кто нужен для попадания в ответы.
Спасибо за полный список ботов. Не знал про Google-Extended и YandexAdditional, полез сразу проверять свой robots.txt.
У меня был случай: закрыла всех AI-ботов, а потом заметила, что перестали приходить редкие визиты с Perplexity. Пришлось пересматривать логику.
Подскажите, как по логам сервера отличить настоящего GPTBot от того, кто просто подделал user-agent? Боюсь, что закрою в robots, а лезть будут всё равно.
Максим, отличить просто по обратному DNS: у официальных ботов есть заявленные диапазоны и проверка реверс-записи. Если user-agent говорит GPTBot, а IP не резолвится в официальную сеть — это подделка, и её лучше резать уже на уровне сервера, а не в robots.txt. По логам это хорошо видно, мы такую чистку регулярно делаем клиентам.
Начинающий вебмастер. Правильно понял, что robots.txt для ботов — это джентльменское соглашение, и по-настоящему он никого не блокирует технически?
Полезно! Готовые примеры конфигов прямо забрала. А есть вариант: пустить ботов для ответов, но закрыть тех, кто чисто на обучение работает?
Спасибо. У нас платный контент, и для нас вопрос защиты важнее видимости. Хорошо, что показали конфиг под такой сценарий.
А ClaudeBot и PerplexityBot уважают Disallow так же, как Яндекс и Google? Или на них правила не действуют?
Дарья, крупные официальные боты — ClaudeBot, PerplexityBot, GPTBot — заявляют, что уважают robots.txt, и на практике директивы соблюдают. Но помните: это всё равно добровольное соглашение, техническую гарантию даёт только блокировка на сервере или по IP.
Вопрос про краулинговый бюджет: десятки AI-агентов реально нагружают сервер? У меня и так хостинг небыстрый, боюсь просадки.
Отличная статья. Сомневаюсь только в одном: если все начнут закрывать ботов, нейросети будут отвечать неточно, а бренды потеряют канал. Палка о двух концах.
У меня была похожая проблема с логами: куча запросов от неизвестных ботов, а я даже не знал, кто это и что они делают. Раздел про проверку по логам спас.
Начинающий маркетолог. Подскажите простое решение по умолчанию для обычного контентного сайта: пускать всех, никого или выборочно?
Полина, для обычного контентного сайта, который хочет присутствия в ответах ИИ, разумная позиция по умолчанию — пускать краулеры ответов и ключевые модели, а откровенно обучающих скраперов, не дающих вам ничего взамен, закрывать. Это баланс между видимостью и контролем, с него советую и начинать.
Спасибо за раздел про типичные ошибки. Сам когда-то криво написал User-agent и случайно закрыл заодно обычный поисковый бот, трафик просел.
А если сайт коммерческий и мы как раз хотим в GEO — получается, ботов надо пускать, несмотря на то что контент уходит в обучение бесплатно?
Понравилось, что вы не даёте однозначного пускать всех или закрыть всех, а показываете, что решение зависит от типа проекта. Взвешенно.
Забрала конфиг с выборочным доступом. Скажите только, как часто пересматривать список ботов — они же плодятся, каждый месяц новый.
Марина, я рекомендую пересматривать список раз в квартал плюс при заметных изменениях нагрузки в логах — новые агенты действительно появляются часто. Мы в LSI Продвижение держим у клиентов актуальный шаблон robots.txt под AI-ботов и обновляем его по мере выхода новых краулеров.
Оставить комментарий
Мы используем cookies
Для улучшения работы сайта и вашего удобства. Оставаясь на сайте, вы соглашаетесь с политикой конфиденциальности.