Мы привыкли, что Googlebot решает, попадёт ли страница в поиск. Но в последние годы появился новый игрок — AI-краулеры. ChatGPT, Claude, Perplexity, Gemini и другие AI-ассистенты активно сканируют веб, чтобы отвечать на вопросы пользователей. Если ваш сайт невидим для этих ботов, вы теряете огромный поток трафика и упоминаний.
Статистика показывает, что трафик из AI-ассистентов на сайты брендов растёт стремительными темпами, и значительная часть пользователей приходит на сайты именно через ответы языковых моделей. Это не будущее — это уже реальность.
В этой статье мы подробно разберём:
- Кто такие AI-краулеры и чем они отличаются от Googlebot.
- Какие типы AI-ботов существуют: обучающие, поисковые, пользовательские.
- Как AI-боты сканируют сайты: сырой HTML, отсутствие JavaScript, извлечение ссылок.
- Как управлять доступом AI-ботов через
robots.txt: трёхуровневая политика. - Что такое
llms.txtи зачем он нужен. - Мета-теги и другие сигналы для AI.
- Как проверить, видят ли AI-боты ваш сайт.
- Практические рекомендации для веб-мастера.
1. AI-краулеры vs Googlebot: в чём разница
Googlebot — это поисковый робот, который индексирует страницы для классического поиска. AI-краулеры — это боты, которые собирают данные для обучения больших языковых моделей или для формирования поискового индекса внутри AI-ассистентов (ChatGPT Search, Claude Search, Perplexity).
Ключевые отличия:
| Характеристика | Googlebot | AI-краулеры |
|---|---|---|
| Цель | Индексация для поиска | Обучение моделей + поиск для AI |
| Рендеринг JavaScript | Да (headless Chrome) | Нет (только сырой HTML) |
| Взаимодействие со страницей | Клики, скроллинг, DOM-события | Только базовый GET-запрос |
| Учёт авторитета домена | Да | Меньше, больше зависит от релевантности |
| Управление через robots.txt | Да | Да (но не все боты соблюдают) |
Главный вывод: Обучающие и поисковые AI-краулеры не выполняют JavaScript — они получают только сырой HTML. Однако пользовательские агенты (ChatGPT-User, Claude-User) могут использовать headless-браузер, который рендерит JS. Но полагаться на это не стоит: если контент доступен только через JS, большинство AI-ботов его не увидят.
2. Типы AI-ботов
AI-боты делятся на три категории по цели сканирования:
2.1 Обучающие краулеры (Training)
Собирают данные для обучения моделей. Сканируют огромные объёмы веба, не заботясь о свежести.
Примеры:
- GPTBot (OpenAI) — сбор данных для обучения GPT.
- ClaudeBot (Anthropic) — сбор данных для обучения Claude.
- Google-Extended — сбор данных для обучения Gemini (политический токен, не отдельный user-agent).
- CCBot (Common Crawl) — открытый датасет, используемый многими моделями.
- Bytespider (ByteDance) — для моделей TikTok/ByteDance.
Рекомендация: если вы не хотите, чтобы ваш контент использовался для обучения моделей, блокируйте этих ботов через robots.txt.
2.2 Поисковые краулеры (Search Index)
Строят индекс для поиска внутри AI-ассистентов. Именно они определяют, какие страницы могут быть процитированы в ответах ChatGPT Search, Claude Search, Perplexity.
Примеры:
- OAI-SearchBot (OpenAI) — индексирует страницы для ChatGPT Search.
- Claude-SearchBot (Anthropic) — индексирует для поиска внутри Claude.
- PerplexityBot (Perplexity) — строит собственный поисковый индекс.
- Applebot (Apple) — используется в AI-поиске Apple.
Рекомендация: разрешайте этих ботов, если хотите, чтобы ваш контент появлялся в ответах AI-ассистентов. Блокировка OAI-SearchBot означает, что ChatGPT не сможет цитировать ваш сайт.
2.3 Пользовательские краулеры (User-Agent / On-Demand)
Загружают страницы в реальном времени, когда пользователь явно запрашивает URL в чате AI.
Примеры:
- ChatGPT-User (OpenAI) — когда пользователь вводит URL в ChatGPT.
- Claude-User (Anthropic) — когда пользователь вводит URL в Claude.
- Perplexity-User (Perplexity) — аналогично.
- MistralAI-User (Mistral) — для ассистента Le Chat.
Рекомендация: обычно разрешайте этих ботов. Они загружают страницу только по запросу пользователя, и блокировка может ухудшить пользовательский опыт.
2.4 Сводная таблица AI-ботов
| User-Agent | Владелец | Категория | Рекомендация |
|---|---|---|---|
GPTBot | OpenAI | Обучение | Заблокировать (если не хотите участвовать в обучении) |
ClaudeBot | Anthropic | Обучение | Заблокировать |
Google-Extended | Обучение | Заблокировать | |
CCBot | Common Crawl | Обучение | Заблокировать |
Bytespider | ByteDance | Обучение | Заблокировать |
OAI-SearchBot | OpenAI | Поиск | Разрешить (для цитирования в ChatGPT) |
Claude-SearchBot | Anthropic | Поиск | Разрешить |
PerplexityBot | Perplexity | Поиск | Разрешить |
ChatGPT-User | OpenAI | Пользовательский | Разрешить |
Claude-User | Anthropic | Пользовательский | Разрешить |
Perplexity-User | Perplexity | Пользовательский | Разрешить |
| anthropic-ai | Anthropic | Общий веб-доступ | Разрешить |
| claude-web | Anthropic | Веб-браузинг | Разрешить |
3. Как AI-боты сканируют сайты
3.1 Только сырой HTML
AI-краулеры, включая ChatGPT и Claude, не выполняют JavaScript и не рендерят клиентский контент. Они получают только тот HTML, который отдаёт сервер в первом ответе на GET-запрос.
Что это значит на практике:
- Если ваш сайт — SPA (Single Page Application) на React/Vue без SSR, AI-бот увидит пустой
<div id="app"></div>. - Если контент подгружается через AJAX, AI-бот его не увидит.
- Если вы используете бесконечный скролл, AI-бот загрузит только первую страницу.
Решение: используйте SSR (Server-Side Rendering) или SSG (Static Site Generation). Либо предоставляйте markdown-версии страниц.
3.2 Извлечение ссылок
AI-бот получает HTML, извлекает из него все ссылки (<a href="">, <img src="">, <script src="">) и добавляет внутренние (и иногда внешние) URL в очередь сканирования.
Что важно:
- Ссылки должны быть в HTML, а не добавляться через JavaScript.
- Используйте
<a href="...">, а не<div onclick="...">. - Внутренняя перелинковка помогает AI-ботам находить больше страниц.
3.3 Отсутствие взаимодействия
AI-бот не кликает, не скроллит, не заполняет формы. Он просто загружает URL и читает HTML. Поэтому:
- Контент, скрытый за «Показать ещё», не будет виден.
- Табы, аккордеоны, модальные окна — не раскрываются.
- Контент, требующий авторизации, недоступен.
3.4 User-Agent и верификация
AI-боты идентифицируются через заголовок User-Agent. Например:
GPTBot/1.0
ClaudeBot/1.0Важно: user-agent можно подделать. Для надёжной верификации используйте проверку IP-адресов ботов — OpenAI и Anthropic публикуют диапазоны своих IP.
4. Управление доступом через robots.txt
robots.txt — основной инструмент для управления доступом AI-ботов. Он размещается в корне домена: https://example.com/robots.txt.
4.1 Синтаксис для AI-ботов
# Блокировка обучающих ботов
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
# Разрешение поисковых и пользовательских ботов
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-User
Allow: /4.2 Трёхуровневая политика
Это рекомендуемый подход, который используют многие сайты:
- Блокировать обучение (GPTBot, ClaudeBot, Google-Extended).
- Разрешать поиск (OAI-SearchBot, Claude-SearchBot, PerplexityBot).
- Разрешать пользовательские запросы (ChatGPT-User, Claude-User).
Так вы защищаете контент от использования в обучении, но позволяете AI-ассистентам цитировать вас в ответах.
4.3 Блокировка всего AI
Если вы хотите полностью запретить AI-ботам доступ к сайту:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: Claude-SearchBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: Claude-User
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /Важно: robots.txt — это рекомендация, а не принуждение. Этичные боты его соблюдают, но не все. Для жёсткой блокировки используйте WAF или Cloudflare Bot Management.
5. llms.txt: новый стандарт для AI
llms.txt — это файл в корне сайта, который предоставляет AI-ассистентам структурированную информацию о вашем контенте. Это аналог sitemap.xml, но для AI.
5.1 Формат llms.txt
# Example.com
> Краткое описание сайта.
## Документация
- [Начало работы](https://example.com/docs/getting-started.md): Как начать работу.
- [API Reference](https://example.com/docs/api.md): Справочник по API.
## Статьи
- [Руководство по Apache](https://example.com/articles/apache.md): Полное руководство.
- [Руководство по Nginx](https://example.com/articles/nginx.md): Полное руководство.
## Optional
- [О компании](https://example.com/about.md)5.2 Где размещать
Файл должен быть доступен по одному из путей:
/llms.txt- /llms-full.txt (опционально)
5.3 Зачем это нужно
AI-ассистенты ищут llms.txt, чтобы быстро понять структуру сайта и найти ключевые страницы. Наличие этого файла повышает шансы, что ваш контент будет процитирован.
Также можно предоставить llms-full.txt с полным контентом. Важно: ни OpenAI, ни Anthropic, ни Google пока официально не подтвердили, что их боты читают llms.txt. Стандарт де-факто поддерживается сообществом, и его внедряют крупные проекты (например, Anthropic, FastHTML, GigaChat от Сбера). Но гарантии, что ChatGPT или Claude найдут и используют ваш llms.txt, пока нет — это скорее инвестиция в будущее, чем немедленный результат.
Вы можете воспользоваться нашим онлайн конструктором файлов llms-full.txt — это быстро и бесплатно.
6. Мета-теги и другие сигналы
Помимо robots.txt, можно использовать мета-теги в HTML для управления доступом AI на уровне страницы.
6.1 Мета-теги для AI
<head>
<meta name="robots" content="index, follow">
<meta name="ai-access" content="allow">
<meta name="ai-policy" content="cite-source, no-train">
</head>ai-access="allow"— AI-ассистентам можно читать и ссылаться на эту страницу.ai-access="deny"— запретить AI доступ к странице.ai-policy="cite-source, no-train"— можно цитировать, но не использовать для обучения.
Важно: эти мета-теги пока не являются формальным стандартом, но всё больше AI-систем их учитывают. Примечание: На момент 2026 года ни один крупный AI-провайдер не подтвердил, что учитывает эти теги. Они полезны как декларация намерений, но не гарантируют, что бот их прочтёт.
6.2 Структурированные данные (Schema.org)
Добавьте JSON-LD разметку на ключевые страницы. Это помогает AI-ассистентам понять тип контента (статья, FAQ, продукт) и извлечь ключевую информацию.
Пример для статьи:
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "Article",
"headline": "Как AI-боты сканируют сайты",
"author": {"@type": "Person", "name": "Автор"},
"datePublished": "2026-01-15",
"description": "Полное руководство по AI-краулерам."
}
</script>6.3 Чистая семантическая разметка
AI-боты лучше понимают контент, если он структурирован:
- Используйте заголовки
h1–h3. - Разбивайте текст на короткие абзацы.
- Используйте списки и таблицы.
ВАЖНО! Избегайте избыточной разметки: чем больше HTML-«мусора» (вложенные div, инлайновые стили, скрытые элементы), тем сложнее AI-боту извлечь полезный текст. Чистая семантическая разметка работает лучше.
7. Как проверить, видят ли AI-боты ваш сайт
7.1 Проверка robots.txt
Онлайн-инструменты:
- Введите URL сайта в сервис проверки
robots.txtдля AI-ботов. - Инструмент покажет, какие боты заблокированы, а какие разрешены.
Пример вывода:
AI visibility score: 40/100
BLOCKED (3): GPTBot, ClaudeBot, Google-Extended
ALLOWED (5): OAI-SearchBot, PerplexityBot, ChatGPT-User, ...7.2 Анализ логов сервера
Проверьте логи Nginx/Apache на наличие запросов от AI-ботов:
grep -i "GPTBot\|ClaudeBot\|OAI-SearchBot\|Claude-SearchBot\|ChatGPT-User\|Claude-User" /var/log/nginx/access.logЕсли боты не появляются — возможно, они заблокированы или сайт для них недоступен.
7.3 Проверка рендеринга без JavaScript
Откройте страницу с отключённым JavaScript (или используйте curl):
curl -s https://example.com | grep -i "ваш ключевой текст"Если контент не найден — AI-боты его тоже не увидят.
7.4 Тестирование в AI-ассистентах
Попросите ChatGPT или Claude найти информацию с вашего сайта:
«Найди на сайте example.com информацию о [тема]»
Если ассистент отвечает, что не может найти — возможно, сайт не индексируется.
7.5 Инструменты для аудита
- Cloudflare AI Crawl Control — показывает, какие AI-боты заходят на сайт.
- Специализированные CLI-инструменты для аудита
robots.txtи проверки доступности для AI-ботов.
8. Практические рекомендации
8.1 Для типового веб-мастера
- Проверьте текущий
robots.txt. Убедитесь, что поисковые и пользовательские AI-боты не заблокированы. - Разрешите OAI-SearchBot, Claude-SearchBot, PerplexityBot, ChatGPT-User, Claude-User. Это нужно для цитирования в AI-ответах.
- Заблокируйте обучающие боты (GPTBot, ClaudeBot, Google-Extended, CCBot), если не хотите, чтобы ваш контент использовался для обучения.
- Добавьте
llms.txt. Это повысит видимость для AI. - Убедитесь, что контент доступен без JavaScript. Используйте SSR или предоставляйте markdown-версии.
- Добавьте Schema.org разметку на ключевые страницы.
- Мониторьте логи на наличие AI-ботов и анализируйте трафик из AI-платформ.
ВАЖНО! ChatGPT-User и Claude-User — это агенты, которые срабатывают по запросу пользователя. Они могут не полностью соблюдать robots.txt, так как запрос инициирован человеком. Если нужно жёстко ограничить доступ — используйте WAF или серверную блокировку, а не полагайтесь только на robots.txt.
8.2 Для сайтов с JavaScript-рендерингом
Если ваш сайт — SPA, AI-боты не увидят контент. Решения:
- SSR/SSG — рендеринг на сервере.
- Pre-rendering — генерация статических HTML-версий для ботов.
- Markdown-версии — предоставление
/.md-версий страниц. - Content negotiation — отдача HTML или markdown в зависимости от заголовка
Accept.
8.3 Для тех, кто хочет полной приватности
Если вы не хотите, чтобы AI вообще касался вашего сайта:
- Заблокируйте всех AI-ботов в
robots.txt. - Используйте Cloudflare Bot Management или WAF для жёсткой блокировки.
- Настройте
X-Robots-Tag: noaiв заголовках ответа. - Помните, что
robots.txt— это рекомендация. Для 100% гарантии нужны другие меры.
9. Заключение
AI-краулеры — это новая реальность веба. Они не заменяют Googlebot, но становятся всё более важным источником трафика и видимости. Ключевые выводы:
- AI-боты делятся на три типа: обучающие, поисковые, пользовательские. Управляйте ими по-разному.
- AI-боты не выполняют JavaScript. Если ваш контент рендерится на клиенте — он невидим для AI.
robots.txt— основной инструмент управления. Используйте трёхуровневую политику: блокируйте обучение, разрешайте поиск и пользовательские запросы.llms.txt— новый стандарт. Добавьте его, чтобы повысить видимость для AI.- Проверяйте и мониторьте. Убедитесь, что ваши страницы действительно видны для AI-ботов.
