Полтора года назад в моём Telegram-чате для предпринимателей было триста человек и живое обсуждение раз в день. Сейчас — почти четыре тысячи, и обсуждение не прекращается вообще. А вместе с ним пришло то, о чём я раньше читал только в чужих постах: спам с «заработком на крипте», рекламные боты под видом новых участников и трое-четверо токсичных персонажей, которые превращали любую ветку в свару.
Модерировал я всё это сам. Полгода. По вечерам, вместо того чтобы заниматься делом, я листал чат и вычищал мусор. В какой-то момент понял: если я не найду способ передать эту рутину кому-то ещё, чат либо умрёт от спама, либо умру от него я.
Почему ручная модерация не масштабируется
Проблема не в том, что забанить одного бота сложно. Проблема в объёме. При трёхстах участниках спам-сообщение появлялось раз в неделю, и я замечал его сам, между делом. При четырёх тысячах — по пятнадцать-двадцать в день, и они прилетают в любое время суток, включая три часа ночи, когда я, естественно, сплю.
К спаму добавилась вторая беда — токсичность. Не мат и не откровенные оскорбления, с этим справляются обычные фильтры по словам. Хуже — пассивная агрессия, переход на личности в завуалированной форме, попытки стравить участников. Формальный фильтр по стоп-словам такое не ловит вообще, потому что там нет «плохих» слов — есть тон.
Я пробовал нанять модератора. Посчитал: за приемлемые деньги человек готов дежурить пару часов в день, а мусор прилетает круглосуточно. Разрыв между тем, что нужно, и тем, что можно себе позволить, был слишком большим.
Как я собрал систему модерации на нейросети
Решение оказалось проще, чем я ожидал, но собиралось оно не с первого раза. Первая версия — просто GPT с промптом «удаляй спам и оскорбления» — работала плохо. Модель то банила безобидные шутки, то пропускала откровенную рекламу, замаскированную под вопрос «а кто может подсказать хороший сервис для…».
Переломный момент случился, когда я перестал давать модели общую инструкцию и начал кормить её примерами. Собрал полсотни реальных сообщений из архива чата — часть спам, часть токсичность, часть нормальные, но резкие высказывания, которые легко спутать с токсичностью. И для каждого написал, что с ним нужно сделать и почему. Модель, получившая примеры вместо абстрактных правил, стала ошибаться в разы реже.
Дальше — техническая часть, для которой я нанял фрилансера на пару часов работы: бот на связке Telegram API и нейросети, который смотрит каждое новое сообщение, прогоняет через модель с моими примерами в промпте и по результату либо пропускает, либо помечает для ручной проверки, либо удаляет сразу — в зависимости от уверенности модели. Ключевое здесь — три категории, а не два. Если модель не уверена, она не банит человека молча, а откладывает решение мне.
Что реально изменилось и где ИИ спотыкается
Спам исчез почти полностью — за последний месяц бот отловил больше двухсот сообщений, я лично разбирал от силы десяток спорных случаев. Токсичность снизилась заметнее всего не количеством банов, а тем, что модель отмечает грубость на подъёме, до того как разговор перерастёт в свару — а я успеваю вмешаться сам, живым сообщением, а не удалением.
Но я не хочу рассказывать сказку про идеальную автоматизацию. Модель до сих пор путает жёсткую иронию с оскорблением примерно в одном случае из двадцати — приходится проверять пограничные пометки вручную. И она совершенно беспомощна против нового типа спама, который появляется раз в пару месяцев: пока в примерах нет ничего похожего, система его пропускает, и я снова добавляю образец в базу.
Честно говоря, самое ценное, что я получил, — не автоматизация как таковая, а освобождённое время. Раньше вечер уходил на просмотр ленты в поисках мусора. Теперь я захожу в чат, чтобы участвовать в разговоре, а не искать, что удалить. Работа модератора никуда не делась — просто девяносто процентов рутины теперь делает не человек.
Если у вас есть сообщество больше пары сотен человек и модерация уже отнимает заметное время — не начинайте с готового промпта из интернета. Начните со своих примеров: соберите десяток-другой реальных спорных сообщений из своего чата и покажите модели именно их. Разница в качестве огромная, и я убедился в этом на собственном опыте, потратив на первую неудачную версию две недели впустую.
Служебный роман
