Как AI-боты (ChatGPT, Claude) сканируют и индексируют сайты

Мы привыкли, что Googlebot решает, попадёт ли страница в поиск. Но в последние годы появился новый игрок — AI-краулеры. ChatGPT, Claude, Perplexity, Gemini и другие AI-ассистенты активно сканируют веб, чтобы отвечать на вопросы пользователей. Если ваш сайт невидим для этих ботов, вы теряете огромный поток трафика и упоминаний.

Статистика показывает, что трафик из AI-ассистентов на сайты брендов растёт стремительными темпами, и значительная часть пользователей приходит на сайты именно через ответы языковых моделей. Это не будущее — это уже реальность.

В этой статье мы подробно разберём:

  • Кто такие AI-краулеры и чем они отличаются от Googlebot.
  • Какие типы AI-ботов существуют: обучающие, поисковые, пользовательские.
  • Как AI-боты сканируют сайты: сырой HTML, отсутствие JavaScript, извлечение ссылок.
  • Как управлять доступом AI-ботов через robots.txt: трёхуровневая политика.
  • Что такое llms.txt и зачем он нужен.
  • Мета-теги и другие сигналы для AI.
  • Как проверить, видят ли AI-боты ваш сайт.
  • Практические рекомендации для веб-мастера.

1. AI-краулеры vs Googlebot: в чём разница

Googlebot — это поисковый робот, который индексирует страницы для классического поиска. AI-краулеры — это боты, которые собирают данные для обучения больших языковых моделей или для формирования поискового индекса внутри AI-ассистентов (ChatGPT Search, Claude Search, Perplexity).

Ключевые отличия:

ХарактеристикаGooglebotAI-краулеры
ЦельИндексация для поискаОбучение моделей + поиск для AI
Рендеринг JavaScriptДа (headless Chrome)Нет (только сырой HTML)
Взаимодействие со страницейКлики, скроллинг, DOM-событияТолько базовый GET-запрос
Учёт авторитета доменаДаМеньше, больше зависит от релевантности
Управление через robots.txtДаДа (но не все боты соблюдают)

Главный вывод: Обучающие и поисковые AI-краулеры не выполняют JavaScript — они получают только сырой HTML. Однако пользовательские агенты (ChatGPT-User, Claude-User) могут использовать headless-браузер, который рендерит JS. Но полагаться на это не стоит: если контент доступен только через JS, большинство AI-ботов его не увидят.

2. Типы AI-ботов

AI-боты делятся на три категории по цели сканирования:

2.1 Обучающие краулеры (Training)

Собирают данные для обучения моделей. Сканируют огромные объёмы веба, не заботясь о свежести.

Примеры:

  • GPTBot (OpenAI) — сбор данных для обучения GPT.
  • ClaudeBot (Anthropic) — сбор данных для обучения Claude.
  • Google-Extended — сбор данных для обучения Gemini (политический токен, не отдельный user-agent).
  • CCBot (Common Crawl) — открытый датасет, используемый многими моделями.
  • Bytespider (ByteDance) — для моделей TikTok/ByteDance.

Рекомендация: если вы не хотите, чтобы ваш контент использовался для обучения моделей, блокируйте этих ботов через robots.txt.

2.2 Поисковые краулеры (Search Index)

Строят индекс для поиска внутри AI-ассистентов. Именно они определяют, какие страницы могут быть процитированы в ответах ChatGPT Search, Claude Search, Perplexity.

Примеры:

  • OAI-SearchBot (OpenAI) — индексирует страницы для ChatGPT Search.
  • Claude-SearchBot (Anthropic) — индексирует для поиска внутри Claude.
  • PerplexityBot (Perplexity) — строит собственный поисковый индекс.
  • Applebot (Apple) — используется в AI-поиске Apple.

Рекомендация: разрешайте этих ботов, если хотите, чтобы ваш контент появлялся в ответах AI-ассистентов. Блокировка OAI-SearchBot означает, что ChatGPT не сможет цитировать ваш сайт.

2.3 Пользовательские краулеры (User-Agent / On-Demand)

Загружают страницы в реальном времени, когда пользователь явно запрашивает URL в чате AI.

Примеры:

  • ChatGPT-User (OpenAI) — когда пользователь вводит URL в ChatGPT.
  • Claude-User (Anthropic) — когда пользователь вводит URL в Claude.
  • Perplexity-User (Perplexity) — аналогично.
  • MistralAI-User (Mistral) — для ассистента Le Chat.

Рекомендация: обычно разрешайте этих ботов. Они загружают страницу только по запросу пользователя, и блокировка может ухудшить пользовательский опыт.

2.4 Сводная таблица AI-ботов

User-AgentВладелецКатегорияРекомендация
GPTBotOpenAIОбучениеЗаблокировать (если не хотите участвовать в обучении)
ClaudeBotAnthropicОбучениеЗаблокировать
Google-ExtendedGoogleОбучениеЗаблокировать
CCBotCommon CrawlОбучениеЗаблокировать
BytespiderByteDanceОбучениеЗаблокировать
OAI-SearchBotOpenAIПоискРазрешить (для цитирования в ChatGPT)
Claude-SearchBotAnthropicПоискРазрешить
PerplexityBotPerplexityПоискРазрешить
ChatGPT-UserOpenAIПользовательскийРазрешить
Claude-UserAnthropicПользовательскийРазрешить
Perplexity-UserPerplexityПользовательскийРазрешить
anthropic-aiAnthropicОбщий веб-доступРазрешить
claude-webAnthropicВеб-браузингРазрешить

3. Как AI-боты сканируют сайты

3.1 Только сырой HTML

AI-краулеры, включая ChatGPT и Claude, не выполняют JavaScript и не рендерят клиентский контент. Они получают только тот HTML, который отдаёт сервер в первом ответе на GET-запрос.

Что это значит на практике:

  • Если ваш сайт — SPA (Single Page Application) на React/Vue без SSR, AI-бот увидит пустой <div id="app"></div>.
  • Если контент подгружается через AJAX, AI-бот его не увидит.
  • Если вы используете бесконечный скролл, AI-бот загрузит только первую страницу.

Решение: используйте SSR (Server-Side Rendering) или SSG (Static Site Generation). Либо предоставляйте markdown-версии страниц.

3.2 Извлечение ссылок

AI-бот получает HTML, извлекает из него все ссылки (<a href="">, <img src="">, <script src="">) и добавляет внутренние (и иногда внешние) URL в очередь сканирования.

Что важно:

  • Ссылки должны быть в HTML, а не добавляться через JavaScript.
  • Используйте <a href="...">, а не <div onclick="...">.
  • Внутренняя перелинковка помогает AI-ботам находить больше страниц.

3.3 Отсутствие взаимодействия

AI-бот не кликает, не скроллит, не заполняет формы. Он просто загружает URL и читает HTML. Поэтому:

  • Контент, скрытый за «Показать ещё», не будет виден.
  • Табы, аккордеоны, модальные окна — не раскрываются.
  • Контент, требующий авторизации, недоступен.

3.4 User-Agent и верификация

AI-боты идентифицируются через заголовок User-Agent. Например:

Важно: user-agent можно подделать. Для надёжной верификации используйте проверку IP-адресов ботов — OpenAI и Anthropic публикуют диапазоны своих IP.

4. Управление доступом через robots.txt

robots.txt — основной инструмент для управления доступом AI-ботов. Он размещается в корне домена: https://example.com/robots.txt.

4.1 Синтаксис для AI-ботов

4.2 Трёхуровневая политика

Это рекомендуемый подход, который используют многие сайты:

  1. Блокировать обучение (GPTBot, ClaudeBot, Google-Extended).
  2. Разрешать поиск (OAI-SearchBot, Claude-SearchBot, PerplexityBot).
  3. Разрешать пользовательские запросы (ChatGPT-User, Claude-User).

Так вы защищаете контент от использования в обучении, но позволяете AI-ассистентам цитировать вас в ответах.

4.3 Блокировка всего AI

Если вы хотите полностью запретить AI-ботам доступ к сайту:

Важно: robots.txt — это рекомендация, а не принуждение. Этичные боты его соблюдают, но не все. Для жёсткой блокировки используйте WAF или Cloudflare Bot Management.

5. llms.txt: новый стандарт для AI

llms.txt — это файл в корне сайта, который предоставляет AI-ассистентам структурированную информацию о вашем контенте. Это аналог sitemap.xml, но для AI.

5.1 Формат llms.txt

Markdown
# Example.com

> Краткое описание сайта.

## Документация
- [Начало работы](https://example.com/docs/getting-started.md): Как начать работу.
- [API Reference](https://example.com/docs/api.md): Справочник по API.

## Статьи
- [Руководство по Apache](https://example.com/articles/apache.md): Полное руководство.
- [Руководство по Nginx](https://example.com/articles/nginx.md): Полное руководство.

## Optional
- [О компании](https://example.com/about.md)

5.2 Где размещать

Файл должен быть доступен по одному из путей:

  • /llms.txt
  • /llms-full.txt (опционально)

5.3 Зачем это нужно

AI-ассистенты ищут llms.txt, чтобы быстро понять структуру сайта и найти ключевые страницы. Наличие этого файла повышает шансы, что ваш контент будет процитирован.

Также можно предоставить llms-full.txt с полным контентом. Важно: ни OpenAI, ни Anthropic, ни Google пока официально не подтвердили, что их боты читают llms.txt. Стандарт де-факто поддерживается сообществом, и его внедряют крупные проекты (например, Anthropic, FastHTML, GigaChat от Сбера). Но гарантии, что ChatGPT или Claude найдут и используют ваш llms.txt, пока нет — это скорее инвестиция в будущее, чем немедленный результат.

Вы можете воспользоваться нашим онлайн конструктором файлов llms-full.txt — это быстро и бесплатно.

6. Мета-теги и другие сигналы

Помимо robots.txt, можно использовать мета-теги в HTML для управления доступом AI на уровне страницы.

6.1 Мета-теги для AI

HTML
<head>
    <meta name="robots" content="index, follow">
    <meta name="ai-access" content="allow">
    <meta name="ai-policy" content="cite-source, no-train">
</head>
  • ai-access="allow" — AI-ассистентам можно читать и ссылаться на эту страницу.
  • ai-access="deny" — запретить AI доступ к странице.
  • ai-policy="cite-source, no-train" — можно цитировать, но не использовать для обучения.

Важно: эти мета-теги пока не являются формальным стандартом, но всё больше AI-систем их учитывают. Примечание: На момент 2026 года ни один крупный AI-провайдер не подтвердил, что учитывает эти теги. Они полезны как декларация намерений, но не гарантируют, что бот их прочтёт.

6.2 Структурированные данные (Schema.org)

Добавьте JSON-LD разметку на ключевые страницы. Это помогает AI-ассистентам понять тип контента (статья, FAQ, продукт) и извлечь ключевую информацию.

Пример для статьи:

HTML
<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "Article",
  "headline": "Как AI-боты сканируют сайты",
  "author": {"@type": "Person", "name": "Автор"},
  "datePublished": "2026-01-15",
  "description": "Полное руководство по AI-краулерам."
}
</script>

6.3 Чистая семантическая разметка

AI-боты лучше понимают контент, если он структурирован:

  • Используйте заголовки h1h3.
  • Разбивайте текст на короткие абзацы.
  • Используйте списки и таблицы.

ВАЖНО! Избегайте избыточной разметки: чем больше HTML-«мусора» (вложенные div, инлайновые стили, скрытые элементы), тем сложнее AI-боту извлечь полезный текст. Чистая семантическая разметка работает лучше.

7. Как проверить, видят ли AI-боты ваш сайт

7.1 Проверка robots.txt

Онлайн-инструменты:

  • Введите URL сайта в сервис проверки robots.txt для AI-ботов.
  • Инструмент покажет, какие боты заблокированы, а какие разрешены.

Пример вывода:

7.2 Анализ логов сервера

Проверьте логи Nginx/Apache на наличие запросов от AI-ботов:

Bash
grep -i "GPTBot\|ClaudeBot\|OAI-SearchBot\|Claude-SearchBot\|ChatGPT-User\|Claude-User" /var/log/nginx/access.log

Если боты не появляются — возможно, они заблокированы или сайт для них недоступен.

7.3 Проверка рендеринга без JavaScript

Откройте страницу с отключённым JavaScript (или используйте curl):

Bash
curl -s https://example.com | grep -i "ваш ключевой текст"

Если контент не найден — AI-боты его тоже не увидят.

7.4 Тестирование в AI-ассистентах

Попросите ChatGPT или Claude найти информацию с вашего сайта:

«Найди на сайте example.com информацию о [тема]»

Если ассистент отвечает, что не может найти — возможно, сайт не индексируется.

7.5 Инструменты для аудита

  • Cloudflare AI Crawl Control — показывает, какие AI-боты заходят на сайт.
  • Специализированные CLI-инструменты для аудита robots.txt и проверки доступности для AI-ботов.

8. Практические рекомендации

8.1 Для типового веб-мастера

  1. Проверьте текущий robots.txt. Убедитесь, что поисковые и пользовательские AI-боты не заблокированы.
  2. Разрешите OAI-SearchBot, Claude-SearchBot, PerplexityBot, ChatGPT-User, Claude-User. Это нужно для цитирования в AI-ответах.
  3. Заблокируйте обучающие боты (GPTBot, ClaudeBot, Google-Extended, CCBot), если не хотите, чтобы ваш контент использовался для обучения.
  4. Добавьте llms.txt. Это повысит видимость для AI.
  5. Убедитесь, что контент доступен без JavaScript. Используйте SSR или предоставляйте markdown-версии.
  6. Добавьте Schema.org разметку на ключевые страницы.
  7. Мониторьте логи на наличие AI-ботов и анализируйте трафик из AI-платформ.

ВАЖНО! ChatGPT-User и Claude-User — это агенты, которые срабатывают по запросу пользователя. Они могут не полностью соблюдать robots.txt, так как запрос инициирован человеком. Если нужно жёстко ограничить доступ — используйте WAF или серверную блокировку, а не полагайтесь только на robots.txt.

8.2 Для сайтов с JavaScript-рендерингом

Если ваш сайт — SPA, AI-боты не увидят контент. Решения:

  • SSR/SSG — рендеринг на сервере.
  • Pre-rendering — генерация статических HTML-версий для ботов.
  • Markdown-версии — предоставление /.md-версий страниц.
  • Content negotiation — отдача HTML или markdown в зависимости от заголовка Accept.

8.3 Для тех, кто хочет полной приватности

Если вы не хотите, чтобы AI вообще касался вашего сайта:

  • Заблокируйте всех AI-ботов в robots.txt.
  • Используйте Cloudflare Bot Management или WAF для жёсткой блокировки.
  • Настройте X-Robots-Tag: noai в заголовках ответа.
  • Помните, что robots.txt — это рекомендация. Для 100% гарантии нужны другие меры.

9. Заключение

AI-краулеры — это новая реальность веба. Они не заменяют Googlebot, но становятся всё более важным источником трафика и видимости. Ключевые выводы:

  • AI-боты делятся на три типа: обучающие, поисковые, пользовательские. Управляйте ими по-разному.
  • AI-боты не выполняют JavaScript. Если ваш контент рендерится на клиенте — он невидим для AI.
  • robots.txt — основной инструмент управления. Используйте трёхуровневую политику: блокируйте обучение, разрешайте поиск и пользовательские запросы.
  • llms.txt — новый стандарт. Добавьте его, чтобы повысить видимость для AI.
  • Проверяйте и мониторьте. Убедитесь, что ваши страницы действительно видны для AI-ботов.