AI Crawler Checker
Вставьте ваш robots.txt и посмотрите, какие AI‑краулеры ему разрешены — и какие из заблокированных могли бы вас цитировать.
| Краулер | Для чего предназначено | Блокировка стоит вам | Ваш файл говорит |
|---|---|---|---|
GPTBot |
Обучение | Никаких цитат. Блокировка не позволит использовать ваш текст в будущих обучающих запусках и не влияет на возможность ChatGPT цитировать вас сегодня. | |
ChatGPT-User |
Живой запрос | Цитаты. При блокировке эта страница не может быть открыта, суммирована или связана, пока кто‑то задаёт вопрос по вашей теме. | |
OAI-SearchBot |
Поисковый индекс | Цитаты. Это краулер, определяющий, появляетесь ли вы в поиске ChatGPT. | |
ClaudeBot |
Обучение | Никаких цитат, по той же логике, что и GPTBot. | |
Claude-User |
Живой запрос | Цитаты, так же как у ChatGPT-User. | |
Claude-SearchBot |
Поисковый индекс | Цитаты. | |
anthropic-ai |
Обучение | Никаких последствий в любом случае. Оставление строки ничего не стоит, а её удаление ничего не дает. | |
PerplexityBot |
Поисковый индекс | Цитаты, напрямую. Perplexity размещает нумерованные источники рядом с каждым утверждением; блокировка убирает вас из этого списка. | |
Perplexity-User |
Живой запрос | Цитаты, если правило соблюдается. | |
Google-Extended |
Обучение и привязка | Некоторые. Не затрагивает Поиск или AI Overviews, но покрывает привязку в приложениях Gemini, поэтому блокировка может убрать вас из ответов там. | |
Googlebot |
Поисковый индекс | Всё. Нет отдельного отказа от AI Overviews: единственные настройки — nosnippet, max-snippet и data-nosnippet, которые ограничивают объём отображаемого текста, а не то, появляется ли ваш сайт. | |
bingbot |
Поисковый индекс | Bing и Copilot вместе. Люди блокируют bingbot, чтобы сэкономить бюджет обхода, и теряют оба сразу. | |
Applebot |
Поисковый индекс | Видимость внутри продуктов Apple. | |
Applebot-Extended |
Обучение | Никакого влияния на поиск. Запрет оставляет индексацию Applebot нетронутой. | |
Meta-ExternalAgent |
Обучение | Никаких ссылок. | |
Meta-ExternalFetcher |
Онлайн‑получение | Ссылки внутри Meta AI. Эта пара — самое яркое проявление разделения: одна компания, два токена, два совершенно разных решения. | |
Amazonbot |
Поисковый индекс | Ответы на платформах Amazon. | |
Bytespider |
Обучение | Незначительно для большинства сайтов за пределами его рынков. Обычно это решение о пропускной способности, а не о видимости. | |
CCBot |
Публичный набор данных | Никаких ссылок. Учтите, что блокировка влияет только на будущие обходы — уже находящееся в архиве остаётся. | |
cohere-ai |
Обучение | Вероятно, ничего. Включено, потому что ваш файл, скорее всего, упоминает его. | |
Diffbot |
Коммерческий набор данных | Непрямая выгода отсутствует. Он может снабжать данными о сущностях, которые некоторые инструменты используют для сопоставления брендов, что является вторичным аргументом в пользу его оставления. | |
Timpibot |
Поисковый индекс | Сегодня почти ничего. Небольшой индекс. | |
omgili |
Коммерческий набор данных | Никаких ссылок. | |
DuckAssistBot |
Онлайн‑получение | Ссылки в блоке ответов DuckDuckGo. |
Этот каталог был составлен в сентябре 2026 года. Токены переименовываются, разделяются и выводятся из эксплуатации — перед тем как принимать решение по строке, проверьте её в документации оператора о его пауке. Столбцы «цель» и «стоимость» отражают оценку назначения каждого бота, а не чью‑то цитату.
Ничего, что вы вводите здесь, не загружается, не сохраняется и не отправляется куда‑либо. Всё работает в вашем браузере.
Обучение и получение — два разных решения
Почти каждый спор о блокировке AI‑краулеров рушится, потому что обе стороны говорят о разных ботах. Примерно три задачи:
- Краулеры обучения собирать текст для создания следующей модели.
GPTBot,ClaudeBot,Meta-ExternalAgent,CCBot. Блокировка их — это решение по лицензированию. Это не убирает вас из того, что пользователь видит сегодня. - Агенты извлечения получить одну страницу сейчас, потому что кто‑то задал вопрос, на который она может ответить.
ChatGPT-User,Claude-User,Perplexity-User,Meta-ExternalFetcher. Блокировка этих краулеров исключит вас из ответов, которые могли бы ссылаться на вас. - Краулеры поиска строят индекс, из которого берутся эти ответы.
OAI-SearchBot,PerplexityBot,Claude-SearchBot,Googlebot,bingbot. Блокировка их — то же самое, что блокировать поисковый движок, то есть почти никогда не то, что вы имели в виду.
Самая частая ошибка — это один скопированный блок, запрещающий сразу двадцать токенов, взятый из блога и никогда не прочитанный, который исключает вас из AI‑ответов, в то время как обучающие корпуса, уже содержащие ваш архив 2023 года, остаются полностью нетронутыми. Если вы хотите, чтобы вас цитировали, но не использовали для обучения, необходимо разделить эти два случая, а операторы, предоставляющие такое разделение, опубликовали соответствующие токены.
Как этот инструмент принимает решение
Он реализует правила сопоставления из RFC 9309, те же, что использует поисковый движок. Три из них могут сбить с толку.
- Группы не наследуются. Если у краулера есть свой
User-agentблок, правила подUser-agent: *не применяются к нему вовсе — ни дополнительно, ни как резервные. ГруппаUser-agent: GPTBotс пустымDisallow:даёт GPTBot больше доступа, чем у всех остальных, включая ваши административные пути. - Побеждает самое длинное совпадающее правило, а не первое.
Disallow: /blog/иAllow: /blog/public/вместе разрешают публичную папку, независимо от порядка их записи. - Сопоставление происходит по токену, а не по подстроке.
User-agent: Claudeне совпадаетClaudeBot. Токены сравниваются полностью и без учёта регистра, поэтому почти совпадение — это правило, которое тихо ничего не делает.
Что robots.txt не может сделать
Это запрос, который соблюдается добровольно. Боты из таблицы выше публикуют токен и, насколько можно судить, соблюдают его — именно поэтому они включены в таблицу. Скрейперы, не идентифицирующие себя, представляют другую проблему с другим решением, и это решение находится на уровне сервера или CDN, а не в этом файле. Блокировка краулера также не влияет на ваш контент, который цитируется, синдицируется или репостится где‑то ещё: копия на чужом домене регулируется их robots.txt, а не вашим.
И что тогда?
Когда вы знаете, что разрешаете, используйте Генератор управления AI‑краулерами чтобы написать правила, которые вы действительно имели в виду, и Проверка готовности к AI‑поиску чтобы проверить, написаны ли страницы, к которым вы их допускаете, так, чтобы их можно было цитировать.
Вопросы, которые задают люди
Блокирует ли блокировка GPTBot меня от ChatGPT?
Нет. GPTBot — это краулер обучения от OpenAI. То, что получает вашу страницу во время диалога, — это ChatGPT-User, а то, что индексирует её для поиска в ChatGPT, — OAI-SearchBot. Блокировка только GPTBot не отключает их работу.
Могу ли я заблокировать AI‑обзоры, не выходя из Google Search?
Не по присутствию. Google-Extended охватывает Gemini, а не Search, и AI‑обзоры генерируются из поискового индекса, поэтому единственный способ исчезнуть из них — исчезнуть из Search. Частичные настройки — nosnippet, max-snippet и data-nosnippet, которые ограничивают объём отображаемого вашего текста.
Почему этот инструмент говорит, что бот разрешён, хотя в моём файле он указан?
Обычно это одна из трёх причин: токен написан иначе, чем опубликован, правило находится выше строки User-agent вместо ниже, или у краулера есть своя группа, и указанный вами Disallow находится в группе для всех остальных. Соответствующее правило показывается рядом с каждым вердиктом, чтобы вы могли увидеть, какое именно.
Блокированный AI‑краулер то же самое, что noindex?
Нет, и путать их — причина исчезновения сайтов. robots.txt останавливает загрузку; noindex останавливает индексацию и требует, чтобы загрузка всё же произошла, чтобы директива могла быть прочитана. Страница, заблокированная в robots.txt, всё ещё может быть перечислена без описания, потому что блокировка помешала краулеру увидеть noindex.
Загружается ли мой robots.txt куда‑то, когда я его вставляю?
Нет. Разбор и сопоставление выполняются в вашем браузере. Эта страница не имеет бэкенда и не делает сетевых запросов с тем, что вы вводите.
Сопутствующие инструменты
Быть доступным для краулинга — это минимум, а не максимум.
Разрешив доступ нужным ботам, вы лишь становитесь потенциальным объектом цитирования. То, что заставляет модель считать вас достойным цитаты, — то же самое, что всегда имело значение: ссылки от других людей.