• Штучний інтелект у SEO

5 найкращих способів налаштувати файл robots.txt для сканерів на базі штучного інтелекту: результати перевірки 219 доменів

  • Felix Rose-Collins
  • 5 min read

Вступ

У кожній статті про AI-краулери вас попереджають про одну й ту саму помилку. У попередженні йдеться про те, що ви заблокували GPTBot під час паніки, пов’язаної зі скрейпінгом у 2023 році, і випадково заблокували новіші агенти, які завантажують сторінки для цитування у відповідях у реальному часі. Ви хотіли зупинити скрейпери для навчання і тихо відмовилися від рекомендацій.

Ми перевірили, чи це насправді відбувається.

На 219 доменах це не сталося жодного разу.

Не «рідко». Не «у кількох випадках». Жодного разу.

Метод

Ми взяли двадцять найкращих органічних результатів для 26 комерційних запитів у семи категоріях: SaaS, електронна комерція, фінанси, здоров’я, подорожі, дім та маркетинг. У результаті отримали 254 унікальні домени. 28 липня 2026 року ми отримали файл robots.txt для кожного з них, і 219 з них були оброблені. Сім із них взагалі не надавали файл robots.txt, що вважається дозволом на все.

Для кожного домену ми зіставили кожен AI-агент користувача з цим файлом, використовуючи стандартне правило пріоритету: перемагає найконкретніша група User-agent, тому точне збіг агента має пріоритет над *. Домен вважається таким, що блокує агента, коли його переможну групу забороняє доступ до кореневого каталогу сайту без більш конкретного дозволу.

Було перевірено дванадцять агентів, розділених за типом контенту, який вони передають.

Агент Оператор Канали
GPTBot OpenAI навчання
OAI-SearchBot OpenAI Посилання на ChatGPT у пошуку
ClaudeBot Anthropic навчання
Claude-SearchBot Anthropic Пошук цитат у Claude
PerplexityBot Perplexity відповіді
DuckAssistBot DuckDuckGo відповіді
Amazonbot Amazon відповіді
CCBot Common Crawl корпус, на якому базуються багато моделей
Google-Extended Google Gemini для навчання, а не для пошуку
Applebot-Extended Apple навчання
Bytespider ByteDance навчання
мета-зовнішній агент Meta навчання

Результати

77 % цих доменів дозволяють доступ усім ШІ-агентам. 23 % блокують принаймні одного.

Агент Заблоковано Домени, що прямо згадують його
Bytespider 20% 45
CCBot 20% 47
ClaudeBot 17% 50
Google-Extended 16% 46
мета-зовнішній агент 16 38
PerplexityBot 15% 44
GPTBot 14% 53
Applebot-Extended 14 39
Amazonbot 13% 39
Claude-SearchBot 10% 22
DuckAssistBot 10% 24
OAI-SearchBot 9% 34

Агент, який блокується найрідше, — це той, що завантажує сторінки для цитування ChatGPT. Агенти, які блокуються найчастіше, — це ті, що збирають дані для навчальних корпусів.

Зустрічайте Ranktracker

Універсальна платформа для ефективного SEO

За кожним успішним бізнесом стоїть потужна SEO-кампанія. Але з незліченною кількістю інструментів і методів оптимізації на вибір може бути важко зрозуміти, з чого почати. Що ж, не бійтеся, адже у мене є те, що вам допоможе. Представляємо вам універсальну платформу Ranktracker для ефективного SEO

Ми нарешті зробили реєстрацію на Ranktracker абсолютно безкоштовною!

Створіть безкоштовний обліковий запис

Або Увійдіть, використовуючи свої облікові дані

Цей порядок не випадковий, і в ньому полягає весь висновок.

Ніхто не припускається помилки. Усі приймають рішення

Зверніть увагу на двох операторів, які використовують як краулер для навчання, так і пошуковий краулер.

Блокує обидва Блокує навчання, дозволяє здійснювати пошук Блокує пошук, дозволяє навчання
OpenAI, GPTBot / OAI-SearchBot 9% 5% 0%
Anthropic, ClaudeBot / Claude-SearchBot 10% 7% 0

Дванадцять доменів блокують GPTBot, водночас свідомо дозволяючи OAI-SearchBot. П’ятнадцять роблять те саме щодо Anthropic. Це послідовна політика: не навчайтеся на моєму контенті, але цитуйте мене.

Ніхто не робить навпаки.

Ще дві цифри вказують на те саме. Лише чотири домени у всій вибірці використовують загальну заборону User-agent: * root, і лише один блокує агента ШІ, не називаючи жодного агента ШІ явно. Той, хто редагує ці файли, знає, які агенти існують і що кожен з них робить.

Отже, попередження галузі стосується проблеми, якої, у цій вибірці, не існує. Цікаве питання полягає не в тому, чи ви заблокували пошукові агенти випадково. А в тому, чи ви робили це навмисно.

Адже 18 % цих доменів блокують принаймні одного пошукового агента, а 4 % — усі чотири. Ці сайти відмовилися від появи у відповідях ШІ, і, судячи з цих даних, зробили це навмисно.

5 способів виправити ситуацію вже сьогодні

  1. Розглядайте навчання та пошук як два окремі питання. Це різні рішення, і ринок вже розділив їх. Більшість видавців хочуть другого без першого. Створіть файл саме таким чином, а не розглядайте «AI-краулери» як одну категорію.

  2. Вкажіть назву кожного агента явно. Лише чотири домени тут покладаються на символ-замінник, і на те є вагома причина: простий запис User-agent: * disallow блокує агентів, яких не існувало на момент написання файлу, а також тих, яких ще не існує. Два з найбільш блокованих агентів у цих результатах, Bytespider та meta-externalagent, з’явилися пізніше, ніж більшість порад щодо файлу robots.txt, які досі поширюються.

  3. Перевірте OAI-SearchBot і Claude-SearchBot за назвою. Ці два агенти визначають, чи можна на вас посилатися. Дев’ять і десять відсотків вибірки блокують їх. Якщо ви потрапили до цієї групи, хоча не мали наміру, саме цей рядок потрібно змінити, і це єдиний пункт у цьому списку, який має безпосередній вплив на видимість.

  4. Проводьте повторну перевірку щокварталу. Протягом минулого року кілька разів з’являлися нові агенти. У файлі, створеному вісімнадцять місяців тому, обов’язково будуть відсутні записи, незалежно від того, наскільки ретельно його складали на той час.

  5. Перевіряйте на межі, а не лише у файлі. Правила управління ботами у вашій CDN можуть заблокувати агента, якого robots.txt явно дозволяє, і файл нічого вам про це не скаже. Це та помилка, яка залишається непоміченою навіть при ідеальному robots.txt.

Відправна точка, яка розмежовує ці два рішення:

# Цитуйте мене. Ці агенти завантажують сторінки для цитування у відповідях у реальному часі.
User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot Allow: /

User-agent: PerplexityBot Allow: /

Зустрічайте Ranktracker

Універсальна платформа для ефективного SEO

За кожним успішним бізнесом стоїть потужна SEO-кампанія. Але з незліченною кількістю інструментів і методів оптимізації на вибір може бути важко зрозуміти, з чого почати. Що ж, не бійтеся, адже у мене є те, що вам допоможе. Представляємо вам універсальну платформу Ranktracker для ефективного SEO

Ми нарешті зробили реєстрацію на Ranktracker абсолютно безкоштовною!

Створіть безкоштовний обліковий запис

Або Увійдіть, використовуючи свої облікові дані

User-agent: DuckAssistBot Allow: /

Не використовуйте мене для навчання. Змініть ці рядки на «Allow», якщо ви не згодні.

User-agent: GPTBot Disallow: /

User-agent: ClaudeBot Disallow: /

User-agent: Google-Extended Disallow: /

User-agent: CCBot Disallow: /

Це майже відповідає конфігурації, яку вже використовують від дванадцяти до п’ятнадцяти доменів у цьому прикладі. Зараз це скоріше загальноприйнята позиція, ніж якась особливо кмітлива.

Чому нічого з цього не відображається у звіті, який ви вже використовуєте

Search Console повідомляє про Googlebot. Про OAI-SearchBot там нічого не сказано. Analytics повідомляє про сесії, а пошукова система, яка ніколи не посилається на вас, не надсилає жодних сесій, які б можна було вважати відсутніми. Сервіси відстеження позицій повідомляють про позиції, і на ваші позиції це ніяк не впливає.

Зустрічайте Ranktracker

Універсальна платформа для ефективного SEO

За кожним успішним бізнесом стоїть потужна SEO-кампанія. Але з незліченною кількістю інструментів і методів оптимізації на вибір може бути важко зрозуміти, з чого почати. Що ж, не бійтеся, адже у мене є те, що вам допоможе. Представляємо вам універсальну платформу Ranktracker для ефективного SEO

Ми нарешті зробили реєстрацію на Ranktracker абсолютно безкоштовною!

Створіть безкоштовний обліковий запис

Або Увійдіть, використовуючи свої облікові дані

Є два способи виявити це. Прочитати файл безпосередньо, що й було зроблено в цьому дослідженні. Або рухатися у зворотному напрямку від симптому за допомогою AI-перевіряча видимості, задаючи пошуковим системам ваші категорійні запитання за розкладом і стежачи за відповіддю, яка вказує, що вони вас взагалі не бачать.

Аудит сканерів, що лежить в основі цього дослідження, — це той, який ми проводимо в Honeyb, зіставляючи кожен зазначений у каталозі вище агент із правилами robots.txt сайту за розкладом, а не одноразово. Доступ — це перша з чотирьох речей, які він перевіряє. Інші три — чи рекомендують вас пошукові системи, що саме потрібно змінити, а потім — створення та публікація контенту, що вносить ці зміни.

Два обмеження, про які варто згадати

Ця вибірка складається з комерційних результатів пошуку в США, тому вона схильна до переважання великих видавців та відомих брендів, які мають як обізнаність, так і юридичні консультації, щоб прийняти зважене рішення в цьому питанні. Вибірка сайтів малого бізнесу, швидше за все, виглядала б інакше, і історія про випадкове блокування цілком може виявитися правдивою саме там. Ми проведемо такий аналіз наступним.

А файл robots.txt фіксує наміри, а не їхнє дотримання. Ми не перевіряли, чи ці домени насправді надають контент кожному агенту — саме тут діють правила CDN, і саме тут зазвичай виникає розрив між файлом і реальністю.

Платформа, на якій базується це дослідження, знаходиться за адресою honeyb.ai.

Felix Rose-Collins

Felix Rose-Collins

Ranktracker's CEO/CMO & Co-founder

Felix Rose-Collins is the Co-founder and CEO/CMO of Ranktracker. With over 15 years of SEO experience, he has single-handedly scaled the Ranktracker site to over 500,000 monthly visits, with 390,000 of these stemming from organic searches each month.

Почніть користуватися Ranktracker... Безкоштовно!

Дізнайтеся, що стримує ваш сайт від ранжування.

Створіть безкоштовний обліковий запис

Або Увійдіть, використовуючи свої облікові дані

Different views of Ranktracker app