AI Crawler Checker

Вставьте ваш robots.txt и посмотрите, какие AI‑краулеры ему разрешены — и какие из заблокированных могли бы вас цитировать.

Вставьте весь файл, включая комментарии. Получите ваш файл с yourdomain.com/robots.txt.
Корень сайта также всегда проверяется. Используйте реальный путь к статье — правило, блокирующее целый раздел, легко пропустить, проверяя только главную страницу.
Краулер Для чего предназначено Блокировка стоит вам Ваш файл говорит
GPTBotOpenAI ОбучениеСобирает страницы для обучения будущих моделей OpenAI. Это не агент, который получает страницу для ответа на вопрос. Никаких цитат. Блокировка не позволит использовать ваш текст в будущих обучающих запусках и не влияет на возможность ChatGPT цитировать вас сегодня.
ChatGPT-UserOpenAI Живой запросПолучает страницу во время диалога, потому что запрос пользователя заставил ChatGPT перейти к ней. Цитаты. При блокировке эта страница не может быть открыта, суммирована или связана, пока кто‑то задаёт вопрос по вашей теме.
OAI-SearchBotOpenAI Поисковый индексСоздаёт индекс, лежащий в основе результатов поиска ChatGPT. OpenAI описывает его как отдельный от обучения. Цитаты. Это краулер, определяющий, появляетесь ли вы в поиске ChatGPT.
ClaudeBotAnthropic ОбучениеОбщий краулер Anthropic, описанный как собирающий данные для обучения модели. Никаких цитат, по той же логике, что и GPTBot.
Claude-UserAnthropic Живой запросПолучает конкретную страницу, потому что пользователь Claude запросил её. Цитаты, так же как у ChatGPT-User.
Claude-SearchBotAnthropic Поисковый индексКраулит для поддержки результатов поиска, на которые опирается и ссылается Claude. Цитаты.
anthropic-aiAnthropic — устаревший токен ОбучениеСтарый токен, встречающийся в тысячах файлов robots.txt. Документированные агенты Anthropic — три выше; этот оставлен здесь, потому что ваш файл, вероятно, его упоминает. Никаких последствий в любом случае. Оставление строки ничего не стоит, а её удаление ничего не дает.
PerplexityBotPerplexity Поисковый индексИндексирует страницы, чтобы их можно было перечислять и цитировать в ответах Perplexity. Perplexity указывает, что это не используется для обучения. Цитаты, напрямую. Perplexity размещает нумерованные источники рядом с каждым утверждением; блокировка убирает вас из этого списка.
Perplexity-UserPerplexity Живой запросПолучает страницу, потому что вопрос пользователя направил Perplexity к ней. Документация Perplexity указывает, что запросы, сделанные пользователем, могут игнорировать robots.txt, поэтому правило здесь может просто не соблюдаться. Цитаты, если правило соблюдается.
Google-ExtendedGoogle Обучение и привязкаНе краулер. Токен, контролирующий, могут ли уже полученные Googlebot страницы использоваться для обучения и привязки Gemini. Не влияет на Поиск. Некоторые. Не затрагивает Поиск или AI Overviews, но покрывает привязку в приложениях Gemini, поэтому блокировка может убрать вас из ответов там.
GooglebotGoogle Поисковый индексКраулер поиска. AI Overviews и AI Mode построены на поисковом индексе, поэтому этот также управляет ими. Всё. Нет отдельного отказа от AI Overviews: единственные настройки — nosnippet, max-snippet и data-nosnippet, которые ограничивают объём отображаемого текста, а не то, появляется ли ваш сайт.
bingbotMicrosoft Поисковый индексBing crawler. Ответы Copilot берут данные из индекса Bing. Bing и Copilot вместе. Люди блокируют bingbot, чтобы сэкономить бюджет обхода, и теряют оба сразу.
ApplebotApple Поисковый индексОбеспечивает работу Siri и предложений Spotlight, а также поиск на собственных платформах Apple. Видимость внутри продуктов Apple.
Applebot-ExtendedApple ОбучениеНе является пауком: токен, указывающий, какие страницы уже получены Applebot, может использоваться для обучения базовых моделей Apple. Никакого влияния на поиск. Запрет оставляет индексацию Applebot нетронутой.
Meta-ExternalAgentMeta ОбучениеMeta's crawler для сбора обучающих данных и улучшения своих продуктов. Никаких ссылок.
Meta-ExternalFetcherMeta Онлайн‑получениеПолучает конкретную страницу от имени пользователя Meta AI, который запросил её. Ссылки внутри Meta AI. Эта пара — самое яркое проявление разделения: одна компания, два токена, два совершенно разных решения.
AmazonbotAmazon Поисковый индексОбходит веб, чтобы отвечать на вопросы через Alexa и поддерживать собственные сервисы Amazon. Ответы на платформах Amazon.
BytespiderByteDance ОбучениеСобирает данные для моделей ByteDance. Широко сообщается владельцами сайтов, что нагрузка обхода высока; это наблюдение, а не официальная цифра. Незначительно для большинства сайтов за пределами его рынков. Обычно это решение о пропускной способности, а не о видимости.
CCBotCommon Crawl Публичный набор данныхСоздаёт архив Common Crawl — бесплатный публичный обход веба, на основе которого обучено множество моделей. Никаких ссылок. Учтите, что блокировка влияет только на будущие обходы — уже находящееся в архиве остаётся.
cohere-aiCohere ОбучениеТокен, присутствующий в большинстве блок‑листов. Использование его компанией Cohere не документировано чётко, поэтому рассматривайте эту строку как обоснованную догадку, а не факт. Вероятно, ничего. Включено, потому что ваш файл, скорее всего, упоминает его.
DiffbotDiffbot Коммерческий набор данныхОбходит веб для построения графа знаний, который продаётся другим компаниям, некоторые из которых используют его в AI. Непрямая выгода отсутствует. Он может снабжать данными о сущностях, которые некоторые инструменты используют для сопоставления брендов, что является вторичным аргументом в пользу его оставления.
TimpibotTimpi Поисковый индексОбходит для Timpi, распределённого поискового индекса. Сегодня почти ничего. Небольшой индекс.
omgiliWebz.io Коммерческий набор данныхСобирает контент форумов и новостей для наборов данных, продаваемых Webz.io, часть из которых попадает в обучающие наборы AI. Никаких ссылок.
DuckAssistBotDuckDuckGo Онлайн‑получениеПолучает страницы для AI‑поддерживаемых ответов DuckDuckGo. Ссылки в блоке ответов DuckDuckGo.

Этот каталог был составлен в сентябре 2026 года. Токены переименовываются, разделяются и выводятся из эксплуатации — перед тем как принимать решение по строке, проверьте её в документации оператора о его пауке. Столбцы «цель» и «стоимость» отражают оценку назначения каждого бота, а не чью‑то цитату.

Ничего, что вы вводите здесь, не загружается, не сохраняется и не отправляется куда‑либо. Всё работает в вашем браузере.

Обучение и получение — два разных решения

Почти каждый спор о блокировке AI‑краулеров рушится, потому что обе стороны говорят о разных ботах. Примерно три задачи:

  • Краулеры обучения собирать текст для создания следующей модели. GPTBot, ClaudeBot, Meta-ExternalAgent, CCBot. Блокировка их — это решение по лицензированию. Это не убирает вас из того, что пользователь видит сегодня.
  • Агенты извлечения получить одну страницу сейчас, потому что кто‑то задал вопрос, на который она может ответить. ChatGPT-User, Claude-User, Perplexity-User, Meta-ExternalFetcher. Блокировка этих краулеров исключит вас из ответов, которые могли бы ссылаться на вас.
  • Краулеры поиска строят индекс, из которого берутся эти ответы. OAI-SearchBot, PerplexityBot, Claude-SearchBot, Googlebot, bingbot. Блокировка их — то же самое, что блокировать поисковый движок, то есть почти никогда не то, что вы имели в виду.

Самая частая ошибка — это один скопированный блок, запрещающий сразу двадцать токенов, взятый из блога и никогда не прочитанный, который исключает вас из AI‑ответов, в то время как обучающие корпуса, уже содержащие ваш архив 2023 года, остаются полностью нетронутыми. Если вы хотите, чтобы вас цитировали, но не использовали для обучения, необходимо разделить эти два случая, а операторы, предоставляющие такое разделение, опубликовали соответствующие токены.

Как этот инструмент принимает решение

Он реализует правила сопоставления из RFC 9309, те же, что использует поисковый движок. Три из них могут сбить с толку.

  • Группы не наследуются. Если у краулера есть свой User-agent блок, правила под User-agent: * не применяются к нему вовсе — ни дополнительно, ни как резервные. Группа User-agent: GPTBot с пустым Disallow: даёт GPTBot больше доступа, чем у всех остальных, включая ваши административные пути.
  • Побеждает самое длинное совпадающее правило, а не первое. Disallow: /blog/ и Allow: /blog/public/ вместе разрешают публичную папку, независимо от порядка их записи.
  • Сопоставление происходит по токену, а не по подстроке. User-agent: Claude не совпадает ClaudeBot. Токены сравниваются полностью и без учёта регистра, поэтому почти совпадение — это правило, которое тихо ничего не делает.

Что robots.txt не может сделать

Это запрос, который соблюдается добровольно. Боты из таблицы выше публикуют токен и, насколько можно судить, соблюдают его — именно поэтому они включены в таблицу. Скрейперы, не идентифицирующие себя, представляют другую проблему с другим решением, и это решение находится на уровне сервера или CDN, а не в этом файле. Блокировка краулера также не влияет на ваш контент, который цитируется, синдицируется или репостится где‑то ещё: копия на чужом домене регулируется их robots.txt, а не вашим.

И что тогда?

Когда вы знаете, что разрешаете, используйте Генератор управления AI‑краулерами чтобы написать правила, которые вы действительно имели в виду, и Проверка готовности к AI‑поиску чтобы проверить, написаны ли страницы, к которым вы их допускаете, так, чтобы их можно было цитировать.

Вопросы, которые задают люди

Блокирует ли блокировка GPTBot меня от ChatGPT?

Нет. GPTBot — это краулер обучения от OpenAI. То, что получает вашу страницу во время диалога, — это ChatGPT-User, а то, что индексирует её для поиска в ChatGPT, — OAI-SearchBot. Блокировка только GPTBot не отключает их работу.

Могу ли я заблокировать AI‑обзоры, не выходя из Google Search?

Не по присутствию. Google-Extended охватывает Gemini, а не Search, и AI‑обзоры генерируются из поискового индекса, поэтому единственный способ исчезнуть из них — исчезнуть из Search. Частичные настройки — nosnippet, max-snippet и data-nosnippet, которые ограничивают объём отображаемого вашего текста.

Почему этот инструмент говорит, что бот разрешён, хотя в моём файле он указан?

Обычно это одна из трёх причин: токен написан иначе, чем опубликован, правило находится выше строки User-agent вместо ниже, или у краулера есть своя группа, и указанный вами Disallow находится в группе для всех остальных. Соответствующее правило показывается рядом с каждым вердиктом, чтобы вы могли увидеть, какое именно.

Блокированный AI‑краулер то же самое, что noindex?

Нет, и путать их — причина исчезновения сайтов. robots.txt останавливает загрузку; noindex останавливает индексацию и требует, чтобы загрузка всё же произошла, чтобы директива могла быть прочитана. Страница, заблокированная в robots.txt, всё ещё может быть перечислена без описания, потому что блокировка помешала краулеру увидеть noindex.

Загружается ли мой robots.txt куда‑то, когда я его вставляю?

Нет. Разбор и сопоставление выполняются в вашем браузере. Эта страница не имеет бэкенда и не делает сетевых запросов с тем, что вы вводите.

Сопутствующие инструменты

Быть доступным для краулинга — это минимум, а не максимум.

Разрешив доступ нужным ботам, вы лишь становитесь потенциальным объектом цитирования. То, что заставляет модель считать вас достойным цитаты, — то же самое, что всегда имело значение: ссылки от других людей.

Записаться на звонок Больше бесплатных инструментов