Плагиат нашёлся за минуту: проверяю тексты перед публикацией

Проверка текста на плагиат через ИИ

Клиентка прислала текст для лендинга и попросила «просто проверить, всё ли нормально перед публикацией». Я пробежал глазами — читалось гладко, даже слишком гладко. Что-то в этой гладкости меня напрягло, и вместо того чтобы сразу отправить «всё супер», я закинул текст в проверку на плагиат. Совпадение с чужой статьёй — 43 процента. Не копипаста слово в слово, а рерайт настолько близкий, что поисковик и заказчик прочитали бы это как кражу.

С тех пор я проверяю через нейросеть буквально всё, что публикую или отдаю клиенту, прежде чем это уйдёт дальше меня. Не потому что не доверяю авторам. Потому что один такой случай стоит репутации, которую нарабатываешь годами.

Почему опасен не только прямой плагиат

Раньше я представлял плагиат так: кто-то скопировал абзац и вставил себе. Это легко ловится любым бесплатным сервисом за десять секунд. Настоящая проблема оказалась тоньше.

Гладкий текст скрывает рерайт

Рерайт близко к тексту — когда структура предложений, порядок аргументов и даже метафоры один в один повторяют источник, просто слова заменены на синонимы — формальные антиплагиат-сервисы часто пропускают, потому что смотрят на совпадение фраз, а не смысла. А поисковик и внимательный читатель такую подмену видят.

Ещё хуже, когда текст писала нейросеть, а автор не проверил, на какие источники модель опиралась. Языковая модель не копирует статьи целиком, но может выдать формулировку, почти совпадающую с популярным материалом на ту же тему — просто потому что таких материалов в её обучающих данных было много, и она усвоила общую структуру подачи. Итог тот же: текст читается как рерайт чужого, даже если никто не открывал исходник намеренно.

Как я проверяю тексты через нейросеть

Схема, которой я пользуюсь, простая и занимает пару минут. Сначала — обычный антиплагиат-сервис на прямые совпадения, это база, от неё никуда. Дальше — отдельный шаг, который многие пропускают: прошу нейросеть найти в тексте абзацы, которые звучат как типичные, «уже где-то читанные» формулировки на эту тему, и объяснить, почему. Модель хорошо ловит клише и общие места, потому что видела их тысячи раз в обучении — то, что человеческому глазу кажется просто «гладким текстом», для неё узнаваемый паттерн.

Две нейросети сверяют текст

Если модель находит подозрительный фрагмент, я беру именно эту фразу и ищу её в поиске в кавычках — так за минуту видно, откуда растут ноги у формулировки. В половине случаев источник находится сразу, и тогда с автором можно честно поговорить: перепиши своими словами или дай ссылку и цитату.

Отдельно проверяю тексты, написанные самой нейросетью для меня — это не парадокс, а необходимость. Прошу вторую, независимую модель оценить первый текст на совпадение с известными источниками по теме. Две модели редко ошибаются одинаково, и перекрёстная проверка ловит то, что пропустит один инструмент.

Показательный случай был со статьёй про выбор CRM для малого бизнеса. Первая модель написала текст гладко и уверенно, без единой прямой цитаты. Вторая модель, которой я показал этот же текст отдельно, указала на абзац про сравнение тарифов — структура аргументации почти точь-в-точь повторяла статью с известного сервиса, который я даже не открывал при постановке задачи. Оказалось, обе нейросети обучались на схожем массиве материалов про CRM, и типовая логика сравнения тарифов у них общая — а значит и у меня в тексте она оказалась общей с чужой статьёй. Пришлось попросить модель пересобрать именно этот абзац с другой структурой аргументов — не переставить слова, а поменять сам порядок, в котором подаются доводы.

Текст прошёл проверку

Что эта привычка изменила и где граница ответственности

За несколько месяцев такой проверки я поймал три серьёзных случая рерайта у разных авторов — не потому что они хотели украсть, а потому что не осознавали, насколько близко подошли к чужому тексту, пересказывая источник «своими словами» слишком буквально. Каждый раз разговор был неловким, но лучше неловкость на этапе черновика, чем письмо от юристов после публикации.

Важная оговорка: нейросеть не выносит вердикт «это плагиат» — она указывает на подозрительные места, а решение всегда за человеком. Бывают ложные срабатывания на устойчивые профессиональные обороты, которые просто часто встречаются в нише и не являются ничьей собственностью. Слепо удалять всё, что модель пометила, — тоже ошибка, только в другую сторону.

Если вы публикуете тексты регулярно — свои или чужие — потратьте пять минут на проверку перед публикацией, а не после жалобы. Это дешевле, чем кажется, и куда дешевле, чем разбирательство, когда текст уже разошёлся по сети.

Предновогоднее

МСК — Москва
00:00:00
Подписка на обновления
Главная Neyronews Плагиат нашёлся за минуту: проверяю тексты перед публикацией