Перплексия и burstiness: как детекторы вычисляют ИИ
Детекторы ИИ не сравнивают текст с базой источников — они оценивают, как он написан статистически. В основе большинства алгоритмов, включая модуль Антиплагиат.ВУЗ и GPTZero, лежат две метрики: перплексия (perplexity) — насколько предсказуемо следующее слово, и burstiness — насколько неровно идут предложения. По англоязычным бенчмаркам человеческий текст даёт перплексию порядка 20–50, а современные языковые модели — 5–10. Разбираем, откуда берутся эти числа, как считается burstiness и почему сочетание двух метрик надёжнее каждой по отдельности.
Перплексия: насколько предсказуемо следующее слово
Перплексия измеряет, насколько «неожиданным» для языковой модели оказывается каждое следующее слово. Технически детектор прогоняет текст через свою модель, берёт вероятность каждого токена и сводит их в одно число: чем предсказуемее текст, тем оно ниже. Нейросеть при генерации выбирает наиболее вероятное продолжение фразы, поэтому её перплексия низкая почти по определению.
Важная оговорка, которую пропускают почти все статьи с цифрами: единой шкалы у перплексии нет. Значение зависит от того, какой моделью её считают, и от языка — 20–50 против 5–10 это результаты англоязычных замеров, а не универсальный норматив. Поэтому детектор никогда не показывает «вашу перплексию»: он сравнивает фрагменты между собой и с обучающей выборкой, а наружу отдаёт вердикт.
Burstiness: насколько неровно идут предложения
Burstiness показывает разброс — прежде всего по длине и сложности предложений. Живой автор пишет рывками: короткая фраза, потом длинная с придаточными, потом снова короткая. Нейросеть выдаёт ровный поток предложений близкой длины.
Считают этот разброс коэффициентом, пришедшим из физики сложных систем: B = (σ − m) / (σ + m), где m — средняя длина предложения, σ — стандартное отклонение. Значение лежит между −1 и 1: −1 означает, что все предложения строго одинаковой длины, 0 — разброс как у случайной последовательности, ближе к 1 — резкие перепады. Реальные тексты почти всегда дают отрицательные значения, и вся разница между «машинным» и «человеческим» прячется в диапазоне примерно от −0,9 до −0,1.
Разница между −0,82 и −0,15 — это ровно то, что видит детектор. И заметьте, чем достигнут второй вариант: не «разговорностью», а фактами. Появились цифры, названия участков и собственное наблюдение — вместе с ними пришли и короткие предложения, потому что факт не требует придаточных.
Матрица: четыре сочетания двух метрик
По отдельности ни одна метрика вердикта не даёт. Детектор смотрит на сочетание, и практически интересны все четыре клетки.
| Сочетание | Как выглядит текст | Вердикт детектора |
|---|---|---|
| Низкая перплексия, низкий burstiness | Предсказуемые слова, ровные предложения | Основной сигнал генерации |
| Низкая перплексия, высокий burstiness | Шаблонная лексика, рваный ритм | Скорее человек: конспект, черновик, ответ на семинаре |
| Высокая перплексия, низкий burstiness | Редкие слова, одинаковые по длине фразы | Спорная зона: перевод, термины, текст после «очеловечивателя» |
| Высокая перплексия, высокий burstiness | Своя лексика, разная длина фраз | Типичный живой автор |
Дипломная работа неудобна тем, что её разделы попадают в разные клетки. Введение и определения почти всегда садятся в первую строку таблицы — предсказуемая лексика плюс ровный ритм, — даже если автор не подходил к нейросети. Практическая глава с расчётами уходит в четвёртую. Именно поэтому итоговый процент по документу говорит меньше, чем разбивка по главам: в статье «Отчёт о проверке на ИИ» разобрано, как её читать.
Как детектор считает это на практике
- Единица анализа — фрагмент, а не документ. В разборе 12 996 дипломов, опубликованном в 2026 году, разметка шла по абзацам длиной от 500 знаков; такой же порядок у большинства детекторов.
- Точность падает с уменьшением фрагмента. GPTZero прямо пишет, что вердикт по документу надёжнее, чем по абзацу, а по абзацу — надёжнее, чем по отдельному предложению. Проверять одну фразу бессмысленно.
- Итоговый процент — агрегат. Он складывается из пометок по фрагментам, поэтому 30% по документу означают не «30% текста написала нейросеть», а долю подозрительных фрагментов.
- Порог задаёт разработчик. Он калибруется по допустимому уровню ложных срабатываний, и у вузовского модуля он свой: «Антиплагиат» в мае 2025 года заявлял до 98% точности на текстах GPT-4o и DeepSeek V3, обучая модель на собственных вузовских коллекциях.
Почему по этим метрикам регулярно ошибаются
Обе метрики измеряют предсказуемость, а предсказуемо пишет не только модель. Отсюда систематические ошибки, у которых есть измеренные величины.
- Неносители языка. В исследовании журнала Patterns (2023) семь коммерческих детекторов пометили как машинные 61,3% эссе людей, для которых английский неродной, при 5,1% ошибок на текстах носителей. Причина ровно та же: небогатая лексика даёт низкую перплексию.
- Уровень предложения против уровня документа. Turnitin публично приводит порядок величин: доля ложных срабатываний на документ — меньше 1%, а на отдельное подсвеченное предложение — около 4%. То есть каждое двадцать пятое выделенное предложение написано человеком.
- Общая надёжность инструментов. Разбор 14 детекторов в International Journal for Educational Integrity (2023) закончился выводом, что они «ни точны, ни надёжны» и смещены в сторону вердикта «написано человеком», а обработка текста резко ухудшает их работу.
Практический вывод: одиночная пометка на абзаце — это не улика. Работает пересечение: если один и тот же абзац подсвечивают два независимых сервиса, он действительно предсказуем. Методика такой перекрёстной проверки — в статье «Как проверить работу на ИИ бесплатно».
Почему подогнать метрики под норму не выходит
Соблазн понятный: раз burstiness считается по длинам предложений, достаточно нарубить фраз покороче. Посчитаем. Ровный текст из 30 предложений по 18–22 слова даёт B = −0,87. Добавьте одно рубленое предложение в четыре слова — B поднимется до −0,72, добавьте три — до −0,59. Показатель действительно двигается.
Дальше начинается проблема. Перплексия при этом не меняется вовсе: слова остались теми же предсказуемыми, вы всего лишь переставили точки. Текст переезжает во вторую или третью клетку матрицы, где вердикт спорный, а читается он теперь хуже — рубленые фразы посреди академического абзаца рецензент замечает раньше детектора. Ровно та же логика ломает синонимайзеры и сервисы-«очеловечиватели»: они правят слова внутри предложений, не трогая ни распределение длин, ни предсказуемость конструкций.
Что эти метрики не умеют
Ни перплексия, ни burstiness не отвечают на вопрос «кто написал текст». Они отвечают на вопрос «насколько текст статистически похож на порождённый языковой моделью» — это разные вещи. Детектор не находит доказательство, он оценивает вероятность, и в спорном случае решение принимает человек: пять минут вопросов по содержанию работы дают больше, чем любой процент.
Отсюда рабочая стратегия автора: не подстраиваться под метрики, а возвращать в текст фактуру. Цифра, название, дата, собственное суждение поднимают перплексию и разбивают ритм сами собой — и заодно делают работу защитимой на вопросах комиссии.
Частые вопросы
- Какая перплексия считается нормой? Никакая: шкала зависит от модели-оценщика и языка, поэтому норматива в единицах перплексии не существует. Ориентироваться нужно на вердикт и подсветку конкретных абзацев.
- Показывает ли Антиплагиат.ВУЗ сами метрики? Нет. В отчёте кафедра видит итоговый показатель и подсвеченные фрагменты, а перплексия и burstiness остаются внутри модели.
- Можно ли специально поднять burstiness? Технически да, но перплексия останется низкой, и текст попадёт в спорную зону, а не в «человеческую». Дешевле добавить факты, чем ломать ритм.
- Почему у введения показатель выше, чем у практической главы? Введение построено на устойчивых конструкциях — объект, предмет, цель, задачи, — и другой перплексии там взяться неоткуда. Это норма, а не признак генерации.
- Влияет ли объём проверяемого текста? Да. Единица анализа — абзац от 500 знаков; на коротких фрагментах вердикт заметно менее надёжен.
Если работу уже вернули с высоким показателем, косметическая правка формулировок статистику не сдвинет — переписывать нужно отмеченные абзацы, с собственной логикой и фактурой. Пошаговый разбор такой ситуации — в статье «Работу завернули за высокий процент ИИ», а как устроена проверка в вузе целиком — в статье «Как вузы проверяют работы на ИИ».
В «Соавторе» тексты пишут вручную, без нейросетей, — поэтому перплексия и burstiness у них естественные, а не подогнанные. Подробнее — страница проверки на ИИ. Сколько работ сегодня получают пометки детектора, показывают цифры в статье «ИИ в студенческих работах: статистика 2026».





