ИИ-боты выкачивают с сайтов десятки тысяч строк в час

Заходишь утром проверить статистику сайта — а там аномалия: трафик вырос в разы, сервер еле дышит, а конверсии почему-то не растут. Проверяешь логи и понимаешь: это не люди. Это боты, причём не обычные, а те самые, что кормят нейросети свежими данными.

Ещё пару лет назад скрейпинг воспринимался как узкоспециализированная тема для маркетологов и SEO-специалистов. Сегодня это уже инфраструктурная проблема планетарного масштаба, с которой сталкивается буквально каждый владелец сайта — от небольшого блога до крупного интернет-магазина.

Цифры, которые публикуют аналитические компании, звучат почти фантастически: боты, которые за час выкачивают десятки тысяч строк контента, атаки в сотни тысяч запросов в сутки и целые сайты, падающие под напором вроде бы «мирных» ИИ-краулеров. Разберёмся, что реально происходит и откуда берутся эти цифры.

Масштаб явления: боты обогнали людей в интернете

Начнём с главного факта, который в 2025 году стал заголовком номер один в индустрии кибербезопасности. По данным отчёта Imperva Bad Bot Report, в 2024 году автоматизированный веб-трафик впервые за десятилетие превысил трафик людей, достигнув 51%, из которых только 14% были обычными безобидными ботами. Это значит, что уже больше половины всех обращений к сайтам в мире — не от живых пользователей.

Ситуация продолжила ухудшаться. Обновлённый отчёт Imperva за 2026 год показал, что доля автоматизированного трафика достигла уже 53% от всего веб-трафика в 2025 году, поднявшись с 51% в 2024-м. А если смотреть конкретно на HTML-запросы через сеть Cloudflare, картина ещё более радикальная: по данным Cloudflare Radar на 3 июня 2026 года, автоматизированные запросы составили уже 57,5% всего HTML-трафика к веб-контенту против 42,5% от людей — впервые в истории интернета машины оказались в большинстве.

Отдельно стоит отметить скорость, с которой ИИ-боты вытесняют людей на конкретных сайтах. Компания TollBit подсчитала, что к четвёртому кварталу 2025 года каждый 31-й визит на сайты приходился на ИИ-ботов, тогда как ещё в первом квартале того же года соотношение составляло 1 к 200. То есть меньше чем за год доля ИИ-трафика выросла в шесть раз.

Сколько именно строк в час выкачивают боты

Теперь к конкретике — сколько данных боты реально забирают с одного сайта за единицу времени. Здесь показателен пример из свежего исследования Barracuda. Одно из отслеживаемых веб-приложений получило более полумиллиона запросов от Gen AI скрейпер-ботов за сутки, а трафик серых ботов на другом приложении держался стабильно круглосуточно — в среднем около 17 000 запросов в час.

Это уже сопоставимо с теми самыми «десятками тысяч строк в час», о которых говорят владельцы сайтов. Barracuda называет такие программы «серыми ботами» — не откровенно вредоносными, но методично обшаривающими интернет с целью извлечения информации с сайтов и других веб-приложений.

А бывают и куда более агрессивные всплески. По данным Fastly, объём запросов от fetcher-ботов в отдельных случаях превышает 39 000 запросов в минуту — это уже больше двух миллионов запросов в час к одному-единственному сайту. Для сравнения — это создаёт нагрузку, сопоставимую с целенаправленной DDoS-атакой, хотя формально боты просто «отвечают» на запрос пользователя нейросети.

Реальный кейс, который наглядно показывает масштаб: сайт для ремонта техники iFixit столкнулся с более чем миллионом обращений от ClaudeBot компании Anthropic всего за сутки, и ему повезло, что этот бот вообще соблюдал правила robots.txt — не все языковые модели их придерживаются.

Кто эти боты и зачем они здесь

ChatGPT Image 5 июн. 2026 г. 19 59 37

Индустрия делит ИИ-ботов на две большие категории. Fastly разделяет их на краулеров, которые работают как поисковые системы — систематически сканируют сайты и собирают контент для построения индексов или обучения языковых моделей, — и фетчеров, а на долю краулеров приходится почти 80% всех запросов ИИ-ботов, тогда как фетчеры составляют оставшиеся 20%.

Фетчеры при этом работают иначе — они реагируют на конкретный запрос живого пользователя нейросети в реальном времени. Именно поэтому один фетчер-бот способен создать те самые пиковые 39 тысяч запросов в минуту — он обслуживает волну одновременных пользовательских вопросов.

Что касается того, кто именно генерирует основную массу трафика краулеров — здесь лидирует далеко не OpenAI, как можно было бы подумать. Боты Meta генерируют 52% всего трафика ИИ-краулеров — более чем вдвое больше, чем у Google (23%) или OpenAI (20%). При этом в сегменте fetcher-ботов, отвечающих за живые ответы пользователям, картина обратная: ChatGPT генерирует больше всего трафика в реальном времени — 98% всех запросов fetcher-ботов приходится именно на боты OpenAI.

Рост отдельных краулеров впечатляет и в динамике. По данным сетевой инфраструктуры, трафик GPTBot вырос на 305% за год, а только за пять месяцев Cloudflare заблокировала 416 миллиардов попыток ИИ-скрейпинга.

Реальные истории компаний, пострадавших от скрейпинга

Абстрактная статистика — это одно, а вот истории конкретных компаний показывают, насколько разрушительным может быть неконтролируемый скрейпинг. Показательный случай — сервис 3D-сканов Triplegangers. Небольшая компания из семи сотрудников больше десяти лет создавала крупнейшую базу «цифровых двойников» людей в интернете, но в начале года её сайт неожиданно рухнул — выяснилось, что даже после обновления robots.txt бот OpenAI использовал 600 разных IP-адресов, чтобы всё равно выкачать данные, и полностью обрушил сайт.

Ещё один показательный пример — Wikimedia Foundation, оператор Википедии. Фонд сообщил о росте числа запросов на 50%, вызванном в основном ИИ-ботами, что привело к росту расходов на инфраструктуру, а LLM-боты потребляют 65% самого «дорогого» трафика — того, что обслуживается напрямую из баз данных, а не из кеша.

Проблема усугубляется тем, что многие боты попросту игнорируют правила сайтов. Некоторые краулеры не используют заголовки вовсе или намеренно маскируются под более авторитетные ИИ-платформы, а другие систематически меняют user-agent или используют резидентные IP-адреса, чтобы обойти блокировки. Из-за этого администраторам приходится вручную разбираться с каждым подозрительным ботом отдельно.

Экономика этого процесса тоже несправедлива по отношению к владельцам контента. По расчётам на основе данных Cloudflare, ClaudeBot совершает 23 951 обращение на страницу в расчёте на одно реальное посещение сайта пользователем, у Perplexity это соотношение около 111 к 1, тогда как у обычного поиска Google — примерно 4,9 к 1. Проще говоря: сайт кормит модель тысячами обращений и почти ничего не получает взамен в виде реальных посетителей.

Российский рынок скрейпинга и защиты от ботов

В России ситуация развивается по похожему сценарию, но с местной спецификой. Отечественный рынок инструментов для скрейпинга в 2025 году оценивался аналитиками примерно в 180 миллионов долларов и демонстрирует устойчивый среднегодовой рост в районе 10–15%.

Растёт и объём вредоносного бот-трафика внутри страны. По данным экспертов StormWall, в 2025 году объём бот-трафика в российском сегменте интернета вырос минимум в 1,7 раза. А по итогам предыдущего года Россия заняла третье место в мире по объёму вредоносного бот-трафика, уступив лишь США и Германии, согласно результатам исследования StormWall.

Отдельная тема — правовое регулирование. В марте 2021 года в России начал действовать закон, который де-факто запретил скрейпинг общедоступных персональных данных без согласия субъектов. При этом с мая 2025 года вступили в силу поправки, которые ужесточили административные штрафы за нарушения законодательства о персональных данных. Для бизнеса это означает двойной риск: и от самого скрейпинга, и от возможной ответственности, если через недостаточно защищённую платформу утекли чужие данные.

Российский сегмент растёт не только количественно, но и качественно — появляются специализированные инструменты, ориентированные на локальные задачи, а не только на копирование западных решений.

Как компании защищаются и что делать дальше

Первая линия обороны — старый добрый robots.txt, но у него есть серьёзные ограничения. Файл сигнализирует скрейперу, что тот не должен забирать данные сайта, однако он не является юридически обязательным, требует прописывания конкретного имени бота, и далеко не каждый владелец Gen AI бота соблюдает эти рекомендации.

Некоторые разработчики идут дальше и придумывают куда более изобретательные способы защиты. Один из создателей защитных инструментов рассказывал журналистам, что сначала пытался «бороться вручную», подсовывая краулеру ложные данные, но затем перешёл к так называемым «зип-бомбам»: сайт в ответ на запрос бота отдаёт небольшой на вид сжатый файл, который при распаковке превращается в несколько гигабайт «мусора», мгновенно обрушивающих систему скрейпера.

Логика такой защиты вполне рациональна с экономической точки зрения. Через подобные «противоскрейпинговые механизмы» ИИ-компании, которые полагаются на краулеры для повсеместного сбора контента, вынуждены платить больше — из-за замедления трафика и расхода ресурсов им приходится увеличивать инвестиции в серверы и оборудование, что делает выполнение той же работы более затратным и менее выгодным.

Куда движется этот процесс дальше? По данным Cloudflare, 51,8% всех запросов ИИ-краулеров в мае 2026 года приходилось именно на обучение моделей и лишь 9,3% — на поисковые задачи, при этом обучающие краулеры почти не приносят обратного реферального трафика издателям. Это значит, что бизнесу стоит рассчитывать не на разовые технические заплатки, а на долгосрочную стратегию управления доступом к своему контенту.

Что это значит для обычных сайтов и бизнеса

Если у вас есть свой сайт, интернет-магазин или блог — вы, скорее всего, уже сталкиваетесь с этим трафиком, даже не подозревая об этом. Аналитика искажается, реальная картина посещаемости смазывается, а нагрузка на сервер растёт без видимой причины.

Рынок реагирует ростом спроса на инструменты защиты. За два года масштабы распространения скрейпинга увеличились в тысячи раз, а объём мирового рынка ПО для скрейпинга в 2025 году превысил 782,5 миллиона долларов и, по прогнозам, к 2035 году достигнет 2,7 миллиарда. Это подтверждает: явление не временное, а системное — и оно будет только расти вместе с развитием ИИ-агентов.

Для владельцев сайтов практический вывод простой: игнорировать эту проблему уже нельзя. Нужно хотя бы базово мониторить логи сервера, настраивать robots.txt под конкретных известных ботов и заранее продумывать, готовы ли вы «кормить» ИИ-модели своим контентом бесплатно или предпочитаете этому препятствовать.

Стоит ли этого бояться или пора привыкать

Здесь важно различать вредоносный скрейпинг, который ворует персональные данные или коммерческую информацию, и легитимный сбор данных для обучения моделей и работы ИИ-поисковиков. Оба типа создают нагрузку на инфраструктуру, но с юридической и этической точки зрения это разные истории.

В любом случае, вектор развития очевиден: доля человеческого трафика в интернете продолжает сокращаться, а доля машинного — расти. Компании, которые заранее выстроят систему учёта и контроля бот-трафика, окажутся в куда более выгодном положении, чем те, кто узнает о проблеме только тогда, когда сайт внезапно «падает» под напором тысяч запросов в час.

Скрейпинг данных ИИ-ботами — это уже не гипотетическая угроза будущего, а повседневная реальность интернета прямо сейчас. Десятки тысяч строк в час, миллионы запросов в сутки, обвалившиеся серверы небольших компаний — всё это происходит параллельно с бумом генеративного ИИ, и никакого замедления пока не предвидится.

Вопрос уже не в том, придут ли боты на ваш сайт — они там уже есть. Вопрос в том, готовы ли вы понимать масштаб происходящего и выстраивать защиту осознанно, а не постфактум, когда счётчики аналитики покажут аномальные цифры, а хостинг пришлёт неожиданный счёт за перегрузку сервера.

UTC — Гринвич
00:00:00
Подписка на обновления
Главная Neyronews ИИ-боты выкачивают с сайтов десятки тысяч строк в час