AI Crawler Control Generator
Выберите позицию, настройте её для каждого бота и получите блок robots.txt — а также директивы уровня страниц, которые действительно учитываются, и те, которые игнорируются.
Googlebot и bingbot намеренно не включены в этот список. Их блокировка не отключает ответы ИИ — AI Overviews и Copilot построены на этих индексах — она полностью отключает вас от поиска, и ни один генератор не должен делать это галочкой. Чтобы проверить, что ваш текущий файл уже делает для каждого AI‑краулера, включая этих двух, используйте Проверка AI‑краулеров.
Ничего, что вы вводите здесь, не загружается, не сохраняется и не отправляется куда-либо. Всё работает в вашем браузере.
Решайте два вопроса отдельно
Существует лишь два реальных вопроса, и их смешивание приводит к тому, что сайты блокируют неправильную половину интернета.
Могут ли они обучаться на моём контенте? Это вопрос лицензирования. Ответ не стоит вам ни трафика в любом случае, потому что обучающий краулер не тот, кто запрашивает страницу для ответа на чей‑то вопрос. Если ваше возражение против ИИ заключается в том, что вас не спросили, это рычаг, и GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, Meta-ExternalAgent и CCBot это большинство.
Могут ли они получать мою страницу, чтобы ответить на вопрос, и ссылаться на меня? Это вопрос распространения, и для большинства компаний ответ очевидно — да. ChatGPT-User, OAI-SearchBot, Claude-User, PerplexityBot а их эквиваленты — краулеры, стоящие за цитированием. Блокировка их — это AI‑эквивалент блокировки Googlebot для защиты вашего контента.
Что делает и чего не делает сгенерированный файл
- Эти группы — дополнения, а не замена. Вставьте их рядом с тем, что у вас уже есть. Не удаляйте существующий
User-agent: *блок. - Краулер со своей группой полностью игнорирует группу со звёздочкой. Поэтому явное указание разрешённых краулеров отключено по умолчанию: пустой
Disallow:подUser-agent: ChatGPT-Userисключает его из всех правил пути, которые вы задали для остальных, включая те, что защищают ваши админ и поисковые страницы. Если включите его, повторите эти правила пути внутри каждой группы. - robots.txt не является контролем доступа. Это опубликованный запрос. Он работает с краулерами, которые идентифицируют себя и решают его соблюдать — это все из списка, но ни один из тех, о которых вы действительно беспокоитесь. Остановить настойчивый скрейпер — задача вашего CDN.
- Это не имеет обратной силы. Блокировка CCBot сегодня не удалит ваши страницы из уже опубликованных архивов и из любой модели, уже обученной на них.
Директивы уровня страницы, ранжированные по их эффективности
nosnippet, max-snippet:0 и data-nosnippet атрибуты являются задокументированными директивами Google и соблюдаются. Они ограничивают, сколько части страницы может быть отображено, и поскольку AI Overviews генерируются из поискового индекса, они единственное, что ограничивает объём вашего текста в одном обзоре. Стоимость в том, что они также ограничивают обычные сниппеты в поиске.
noai и noimageai появились в арт‑сообществе и соблюдаются небольшим числом платформ, которые решили их поддерживать. Крупные краулеры их не учитывают. Их стоит включать лишь как заявление о намерениях, и эта страница не будет претендовать иначе.
Протокол резервирования TDM — это спецификация сообщества W3C, позволяющая в машиночитаемом виде заявить, что вы сохраняете права на текстовый и дата‑майнинг, которые позволяет зарезервировать закон об авторском праве ЕС. Принятие ограниченно. Является ли такое заявление юридически значимым в вашей юрисдикции — вопрос для юриста, и ничего на этой странице не является юридической консультацией.
Вопросы, которые задают люди
Какой разумный вариант по умолчанию для бизнес‑сайта?
Разрешайте всё, что извлекает или индексирует, блокируйте то, что только обучает, и продолжайте работу. Это средний предустановленный вариант. Вы сохраняете все пути, по которым к вам могут обратиться, и прекращаете отдавать ваш архив для следующего обучения.
Повредит ли блокировка AI‑краулеров моим позициям в Google?
Не если блокировать только токены ИИ. Google-Extended отдельный от Googlebot, и его запрет не влияет на Search. Урон происходит, когда скопированный блок включает Googlebot или bingbot, поэтому ни один из них не находится на этой странице.
Нужны ли мне одновременно правила robots.txt и метатеги?
Они выполняют разные задачи. robots.txt определяет, будет ли страница вообще запрошена. Метадирективы решают, что может быть отображено после её получения, то есть они действуют только на тех краулеров, которым вы разрешили доступ. Если вы блокируете бота в robots.txt, он никогда не читает ваши метатеги.
Куда именно следует поместить этот блок?
В тот же robots.txt в корне вашего домена, после существующих групп. Порядок не важен для парсера — группы сопоставляются по user-agent, а не по позиции — но если держать правила ИИ вместе с комментарием, они сохранятся при следующем редактировании файла.
Могу ли я разрешить ИИ‑краулерам доступ к некоторым разделам и запретить в других?
Да. Каждая группа принимает правила путей, как и остальные, поэтому вы можете написать Disallow: /members/ под GPTBot и оставить остальные открытыми. Помните, что группа сопоставляется полностью: бот со своей группой не наследует ничего от User-agent: *.
Связанные инструменты
Открыт для нужных краулеров, но всё равно невидим?
Доступ — это проблема разрешений, и её решение занимает полдня. Стоить ли вас цитировать — это проблема авторитета, и этим я занимаюсь.