Заголовок «ИИ-боты собирают 10 тысяч строк в час» звучит как красивая метафора, но на деле это уже далеко не предел. Современные скрейперы работают на порядки быстрее, чем любой человек с браузером и таблицей Excel, и делают это круглосуточно, без перерывов на обед и отпуск. Пока мы читаем новости, смотрим цены на маркетплейсах или листаем ленту, где-то рядом невидимый бот уже прошёлся по тем же страницам и утащил данные к себе.
Ещё пару лет назад скрейпинг воспринимался как узкая техническая тема — что-то для программистов, парсящих курсы валют или цены конкурентов. Сегодня это уже вопрос выживания для бизнеса, безопасности инфраструктуры и даже авторского права. Боты не просто собирают данные — они меняют саму структуру интернет-трафика, и делают это стремительно.
В этой статье разберёмся, сколько на самом деле «весит» ИИ-скрейпинг в глобальном трафике, кто стоит за самыми активными ботами, почему они постепенно переходят от обучения моделей к сбору данных в реальном времени, и как компании — в том числе российские — пытаются от этого защититься.
Сколько трафика в интернете теперь генерируют боты
Цифры последних отчётов заставляют пересмотреть привычное представление об интернете как о пространстве, где правят люди. По данным ежегодного отчёта Bad Bot Report французской компании Thales, 53% всего мирового интернет-трафика по итогам 2025 года пришлось на ботов, тогда как люди сгенерировали лишь 47% запросов. Это не разовый скачок, а продолжение тренда: ещё в апреле 2025-го похожий вывод сделала Imperva, зафиксировав, что боты генерируют 51% от общего количества интернет-трафика в мире.
Отдельно стоит смотреть на скорость роста именно ИИ-компонента этого трафика. По данным HUMAN Security, которая проанализировала более квадриллиона взаимодействий за 2025 год, автоматизированный интернет-трафик вырос на 23,5% год к году, что в восемь раз быстрее человеческого трафика, увеличившегося на 3,1%. А трафик именно от ИИ-агентов и агентных браузеров вырос ещё драматичнее — на 7 851% год к году.
Компания TollBit, специализирующаяся на отслеживании ИИ-ботов, отмечает похожую динамику на уровне отдельных сайтов: по итогам четвёртого квартала 2025 года на каждые 31 визит человека приходился один визит ИИ-бота — против одного бота на 200 человек в первом квартале. При этом сама TollBit признаёт, что реальная цифра, скорее всего, ещё выше, поскольку многие из этих веб-скрейперов неотличимы от обычных посетителей-людей.
Кто именно скрейпит: имена и доли главных игроков
За абстрактным словом «боты» скрываются вполне конкретные компании и их краулеры. По свежим данным HUMAN Security за 2025 год, OpenAI сгенерировала примерно 69% всего наблюдаемого ИИ-бот трафика, Meta — около 16%, Anthropic — около 11%, а все остальные вместе — менее 5%. Похожую картину, но по другой методологии, описывает Fastly: за период с середины апреля по середину июля 2025 года ИИ-краулеры составили почти 80% всего ИИ-бот трафика, а Meta генерировала больше половины, обгоняя Google и OpenAI вместе взятых.
Отдельно выделяется скорость, с которой отдельные боты умеют выкачивать страницы. Fastly фиксирует, что боты-«фетчеры», которые подгружают контент сайтов в ответ на действия пользователей ИИ-сервисов, в пиковые моменты создают колоссальную нагрузку — в отдельных случаях объём запросов таких ботов превышает 39 000 запросов в минуту. При таких скоростях 10 тысяч строк в час — это уже скорее скромная, «вежливая» норма, а не предел возможностей.
Среди отдельных персонажей этой истории часто называют Bytespider — краулер TikTok, который собирает данные для улучшения рекомендательных алгоритмов и рекламных возможностей платформы. При этом эксперты отмечают, что механизм работы Bytespider остаётся непрозрачным, что затрудняет оценку его воздействия на веб-приложения. GPTBot, ClaudeBot, Meta-ExternalAgent и десятки менее известных агентов ежедневно проходятся по миллионам страниц — от новостных сайтов до интернет-магазинов.
От обучения моделей к сбору данных в реальном времени

Ещё год-два назад главным мотивом скрейпинга было обучение больших языковых моделей: чем больше текста, тем умнее модель. Сегодня баланс смещается. По данным HUMAN Security, в январе 2025 года краулеры для обучения моделей составляли около 90% всего ИИ-трафика, а к декабрю их доля снизилась до 74%, при этом доля скрейперов реального времени выросла до 24%, а новая категория — агентный ИИ — заняла 1,7%.
Причина в том, что чат-боты вроде ChatGPT или Gemini всё активнее используют технологию RAG (retrieval-augmented generation) — вытягивают свежие данные из интернета прямо в момент ответа на вопрос пользователя, а не полагаются только на то, чему их когда-то обучили. TollBit подтверждает это на цифрах: скрейпинг для обучения моделей упал на 15% между вторым и четвёртым кварталом 2025 года, тогда как трафик RAG-ботов за тот же период вырос на 33%.
Показательно и то, куда именно нацелены такие боты. По данным HUMAN Security, более 95% всего ИИ-трафика в 2025 году пришлось на три отрасли — розничную торговлю и e-commerce, стриминг и медиа, а также путешествия и гостиничный бизнес — то есть именно там, где данные меняются каждый час: цены, наличие товара, расписания рейсов, свежие новости.
Как это бьёт по бизнесу и инфраструктуре
Массированный скрейпинг — это не безобидное чтение публичных страниц. Эксперты сравнивают его с DDoS-атакой: как отмечал один из специалистов в области информационной безопасности, массированный скрейпинг по своей нагрузке мало чем отличается от DDoS-атаки. Последствия для компаний вполне ощутимые: деградация сервиса для реальных пользователей и рост расходов на инфраструктуру, которая вынуждена обрабатывать паразитный трафик.
Инфраструктурные гиганты подтверждают масштаб проблемы конкретными цифрами блокировок. По данным ресурса kiberboloid.ru, ИИ-боты уже генерируют 4,2% HTML-запросов в интернете, трафик GPTBot вырос на 305% за год, а только за пять месяцев Cloudflare заблокировала 416 млрд попыток ИИ-скрейпинга. Отдельно интересна динамика блокировок именно у Cloudflare: доля запросов краулеров, получающих ошибку 4xx, выросла с 10,2% до 35,8% за год, а доля успешных ответов 2xx упала с 80,5% до 49,2% — сайты всё активнее закрываются от нежеланных гостей.
Есть и более приземлённая проблема — искажение аналитики. Специалисты отмечают, что агрессивный скрейпинг приводит к искажению аналитики веб-сайта, что влияет на принятие бизнес-решений, а также к увеличению расходов на облачный хостинг из-за повышенной нагрузки на процессор и увеличенного трафика. Медиахолдинг Brightspot, изучив свою клиентскую базу, обнаружил, что над некоторыми крупными медиасайтами свыше 40% трафика генерировалось автоматизированными агентами, а не человеческими читателями.
Российская специфика: свои цифры и свои отрасли-мишени
В России ситуация развивается похожим образом, хотя и с местными особенностями. По итогам 2025 года страна вошла в мировую пятёрку по объёму вредоносного бот-трафика: в топ вошли США (32,4%), Китай (16,3%), Германия (9,2%), Индия (7,4%) и Россия (4,2%). При этом в целом по миру объём бот-трафика вырос в 1,6 раза по сравнению с 2024 годом, а в России рост оказался ещё заметнее — на 83% год к году.
Внутри страны у ботов есть свои любимые цели. По данным StormWall, больше всего досталось телекому (26%), ретейлу (21%), финансовой отрасли (16%), образованию (12%) и логистике (8%). При этом отдельно фиксируется всплеск именно ИИ-компонента: число глобальных DDoS-атак с участием ИИ-ботов выросло на 148%, а в России — на 63%.
Растёт и сам российский рынок инструментов для скрейпинга. По оценке аналитиков, отечественный рынок инструментов для скрейпинга в 2025 году оценивался примерно в 180 млн долларов и демонстрирует устойчивый среднегодовой рост в районе 10–15%. Параллельно ужесточается и регулирование: с мая 2025 года вступили в силу поправки — ФЗ № 420 от 30.11.2024, которые ужесточили административные штрафы за нарушения законодательства о персональных данных.
Что бизнес может противопоставить армии ботов
Самый очевидный инструмент — файл robots.txt, который сообщает роботам, какие разделы сайта трогать не стоит. Но у него есть фундаментальный изъян: этот метод не имеет юридической силы, и многие боты его попросту игнорируют. Свежие данные подтверждают, что игнорирование становится нормой: 13% запросов ИИ-ботов в четвёртом квартале 2025 года обходили правила robots.txt, а доля таких «непослушных» ботов выросла на 400% со второго по четвёртый квартал.
Из-за этого компании всё чаще переходят к более технологичным средствам защиты — системам поведенческого анализа и машинного обучения, которые ищут аномалии в паттернах запросов. Как отмечают эксперты, компании часто используют системы защиты от ботов на базе искусственного интеллекта, которые применяют машинное обучение для обнаружения и блокировки активности ботов в реальном времени.
Появляется и рыночный ответ на проблему — попытка монетизировать доступ ботов к контенту вместо тотального запрета. Компании вроде TollBit и Cloudflare предлагают модель «плати за краулинг»: TollBit продаёт инструменты, позволяющие владельцам сайтов брать плату с ИИ-скрейперов за доступ к контенту, а Cloudflare запустила похожий сервис «pay-per-crawl». По данным того же отчёта, на рынке уже работает более 40 компаний, продающих услуги веб-скрейпинга специально для ИИ-приложений.
Параллельно идут и судебные баталии — крупные медиахолдинги пытаются защитить права на свой контент через суд. Известно, что Condé Nast и другие медиакомпании подали иски против нескольких ИИ-компаний из-за предполагаемого нарушения авторских прав, связанного с обучающими данными. При этом далеко не все подобные споры заканчиваются в пользу издателей: одна из крупнейших скрейпинговых компаний, Bright Data, ранее была втянута в судебные разбирательства с Meta и X, но Meta позже отозвала свой иск, а федеральный судья отклонил иск X.
Если ещё несколько лет назад скрейпинг воспринимался как локальная головная боль для айтишников — что-то вроде спама на почте — то сегодня это уже полноценная перестройка правил игры в интернете. Боты не просто читают страницы быстрее людей: они постепенно становятся основной аудиторией сайтов, меняют экономику интернет-бизнеса и заставляют компании пересматривать саму архитектуру своих цифровых сервисов.
Скорость в 10 тысяч строк в час, вынесенная в заголовок, — это лишь скромная иллюстрация того, что происходит на самом деле. Реальные цифры кратно больше, а главное — они продолжают расти месяц за месяцем. Вопрос уже не в том, остановится ли этот процесс, а в том, успеют ли бизнес, регуляторы и разработчики выработать правила, по которым люди и машины смогут делить один и тот же интернет без взаимного ущерба.

