8 800 600-71-40
Проверка на ИИ

Перплексия и burstiness: как детекторы вычисляют ИИ

10 августа 2026 10 мин чтения
Поделиться: Telegram WhatsApp

Детекторы ИИ не сравнивают текст с базой источников — они оценивают, как он написан статистически. В основе большинства алгоритмов, включая модуль Антиплагиат.ВУЗ и GPTZero, лежат две метрики: перплексия (perplexity) — насколько предсказуемо следующее слово, и burstiness — насколько неровно идут предложения. По англоязычным бенчмаркам человеческий текст даёт перплексию порядка 20–50, а современные языковые модели — 5–10. Разбираем, откуда берутся эти числа, как считается burstiness и почему сочетание двух метрик надёжнее каждой по отдельности.

Перплексия: насколько предсказуемо следующее слово

Перплексия и burstiness: как детекторы вычисляют ИИ

Перплексия измеряет, насколько «неожиданным» для языковой модели оказывается каждое следующее слово. Технически детектор прогоняет текст через свою модель, берёт вероятность каждого токена и сводит их в одно число: чем предсказуемее текст, тем оно ниже. Нейросеть при генерации выбирает наиболее вероятное продолжение фразы, поэтому её перплексия низкая почти по определению.

Важная оговорка, которую пропускают почти все статьи с цифрами: единой шкалы у перплексии нет. Значение зависит от того, какой моделью её считают, и от языка — 20–50 против 5–10 это результаты англоязычных замеров, а не универсальный норматив. Поэтому детектор никогда не показывает «вашу перплексию»: он сравнивает фрагменты между собой и с обучающей выборкой, а наружу отдаёт вердикт.

Пример разницы на одной фразе. «Актуальность темы обусловлена тем, что...» — низкая перплексия: конструкция настолько частая, что модель угадывает каждое следующее слово. «Тему выбрал после разговора с начальником цеха о том, почему за год из девятнадцати сборщиков ушли одиннадцать» — перплексия выше: числа, редкое слово «сборщиков» и нестандартный порядок частей фразы модель предсказать не может.

Burstiness: насколько неровно идут предложения

Burstiness показывает разброс — прежде всего по длине и сложности предложений. Живой автор пишет рывками: короткая фраза, потом длинная с придаточными, потом снова короткая. Нейросеть выдаёт ровный поток предложений близкой длины.

Считают этот разброс коэффициентом, пришедшим из физики сложных систем: B = (σ − m) / (σ + m), где m — средняя длина предложения, σ — стандартное отклонение. Значение лежит между −1 и 1: −1 означает, что все предложения строго одинаковой длины, 0 — разброс как у случайной последовательности, ближе к 1 — резкие перепады. Реальные тексты почти всегда дают отрицательные значения, и вся разница между «машинным» и «человеческим» прячется в диапазоне примерно от −0,9 до −0,1.

Ровный абзац: «Управление персоналом является важнейшим элементом системы менеджмента современной организации и во многом определяет эффективность её хозяйственной деятельности. Кадровая политика предприятия формируется под влиянием внешних и внутренних факторов, которые необходимо учитывать при разработке стратегии развития. Система мотивации сотрудников включает материальные и нематериальные стимулы, направленные на повышение производительности труда и лояльности персонала. Текучесть кадров выступает одним из ключевых показателей, характеризующих состояние кадровой политики и уровень удовлетворённости работников условиями труда. Совершенствование системы управления персоналом требует комплексного подхода и учёта отраслевой специфики конкретного предприятия». Длины предложений: 17, 17, 16, 17 и 13 слов. Средняя 16, отклонение 1,6, коэффициент B = −0,82.
Неровный абзац о том же самом: «Текучесть в цехе за 2025 год — 31%. Это вдвое выше среднего по отрасли, и почти весь прирост дал участок сборки, где за год сменились одиннадцать человек из девятнадцати. Кадровик на предприятии один. Он же ведёт табели, он же закрывает вакансии, он же проводит вводный инструктаж, поэтому на адаптацию новичка остаётся в лучшем случае полчаса в первый день. Дальше человек разбирается сам». Длины: 7, 21, 4, 25 и 4 слова. Средняя 12,2, отклонение 9,0, коэффициент B = −0,15.

Разница между −0,82 и −0,15 — это ровно то, что видит детектор. И заметьте, чем достигнут второй вариант: не «разговорностью», а фактами. Появились цифры, названия участков и собственное наблюдение — вместе с ними пришли и короткие предложения, потому что факт не требует придаточных.

Матрица: четыре сочетания двух метрик

По отдельности ни одна метрика вердикта не даёт. Детектор смотрит на сочетание, и практически интересны все четыре клетки.

Как читается текст при разных сочетаниях перплексии и burstiness
СочетаниеКак выглядит текстВердикт детектора
Низкая перплексия, низкий burstinessПредсказуемые слова, ровные предложенияОсновной сигнал генерации
Низкая перплексия, высокий burstinessШаблонная лексика, рваный ритмСкорее человек: конспект, черновик, ответ на семинаре
Высокая перплексия, низкий burstinessРедкие слова, одинаковые по длине фразыСпорная зона: перевод, термины, текст после «очеловечивателя»
Высокая перплексия, высокий burstinessСвоя лексика, разная длина фразТипичный живой автор

Дипломная работа неудобна тем, что её разделы попадают в разные клетки. Введение и определения почти всегда садятся в первую строку таблицы — предсказуемая лексика плюс ровный ритм, — даже если автор не подходил к нейросети. Практическая глава с расчётами уходит в четвёртую. Именно поэтому итоговый процент по документу говорит меньше, чем разбивка по главам: в статье «Отчёт о проверке на ИИ» разобрано, как её читать.

Как детектор считает это на практике

  • Единица анализа — фрагмент, а не документ. В разборе 12 996 дипломов, опубликованном в 2026 году, разметка шла по абзацам длиной от 500 знаков; такой же порядок у большинства детекторов.
  • Точность падает с уменьшением фрагмента. GPTZero прямо пишет, что вердикт по документу надёжнее, чем по абзацу, а по абзацу — надёжнее, чем по отдельному предложению. Проверять одну фразу бессмысленно.
  • Итоговый процент — агрегат. Он складывается из пометок по фрагментам, поэтому 30% по документу означают не «30% текста написала нейросеть», а долю подозрительных фрагментов.
  • Порог задаёт разработчик. Он калибруется по допустимому уровню ложных срабатываний, и у вузовского модуля он свой: «Антиплагиат» в мае 2025 года заявлял до 98% точности на текстах GPT-4o и DeepSeek V3, обучая модель на собственных вузовских коллекциях.
Нужна помощь с работой?
Живой эксперт по вашей теме, без нейросетей. Рассчитайте цену за 30 секунд — без регистрации.

Почему по этим метрикам регулярно ошибаются

Обе метрики измеряют предсказуемость, а предсказуемо пишет не только модель. Отсюда систематические ошибки, у которых есть измеренные величины.

  • Неносители языка. В исследовании журнала Patterns (2023) семь коммерческих детекторов пометили как машинные 61,3% эссе людей, для которых английский неродной, при 5,1% ошибок на текстах носителей. Причина ровно та же: небогатая лексика даёт низкую перплексию.
  • Уровень предложения против уровня документа. Turnitin публично приводит порядок величин: доля ложных срабатываний на документ — меньше 1%, а на отдельное подсвеченное предложение — около 4%. То есть каждое двадцать пятое выделенное предложение написано человеком.
  • Общая надёжность инструментов. Разбор 14 детекторов в International Journal for Educational Integrity (2023) закончился выводом, что они «ни точны, ни надёжны» и смещены в сторону вердикта «написано человеком», а обработка текста резко ухудшает их работу.

Практический вывод: одиночная пометка на абзаце — это не улика. Работает пересечение: если один и тот же абзац подсвечивают два независимых сервиса, он действительно предсказуем. Методика такой перекрёстной проверки — в статье «Как проверить работу на ИИ бесплатно».

Почему подогнать метрики под норму не выходит

Соблазн понятный: раз burstiness считается по длинам предложений, достаточно нарубить фраз покороче. Посчитаем. Ровный текст из 30 предложений по 18–22 слова даёт B = −0,87. Добавьте одно рубленое предложение в четыре слова — B поднимется до −0,72, добавьте три — до −0,59. Показатель действительно двигается.

Дальше начинается проблема. Перплексия при этом не меняется вовсе: слова остались теми же предсказуемыми, вы всего лишь переставили точки. Текст переезжает во вторую или третью клетку матрицы, где вердикт спорный, а читается он теперь хуже — рубленые фразы посреди академического абзаца рецензент замечает раньше детектора. Ровно та же логика ломает синонимайзеры и сервисы-«очеловечиватели»: они правят слова внутри предложений, не трогая ни распределение длин, ни предсказуемость конструкций.

Что эти метрики не умеют

Ни перплексия, ни burstiness не отвечают на вопрос «кто написал текст». Они отвечают на вопрос «насколько текст статистически похож на порождённый языковой моделью» — это разные вещи. Детектор не находит доказательство, он оценивает вероятность, и в спорном случае решение принимает человек: пять минут вопросов по содержанию работы дают больше, чем любой процент.

Отсюда рабочая стратегия автора: не подстраиваться под метрики, а возвращать в текст фактуру. Цифра, название, дата, собственное суждение поднимают перплексию и разбивают ритм сами собой — и заодно делают работу защитимой на вопросах комиссии.

Частые вопросы

  • Какая перплексия считается нормой? Никакая: шкала зависит от модели-оценщика и языка, поэтому норматива в единицах перплексии не существует. Ориентироваться нужно на вердикт и подсветку конкретных абзацев.
  • Показывает ли Антиплагиат.ВУЗ сами метрики? Нет. В отчёте кафедра видит итоговый показатель и подсвеченные фрагменты, а перплексия и burstiness остаются внутри модели.
  • Можно ли специально поднять burstiness? Технически да, но перплексия останется низкой, и текст попадёт в спорную зону, а не в «человеческую». Дешевле добавить факты, чем ломать ритм.
  • Почему у введения показатель выше, чем у практической главы? Введение построено на устойчивых конструкциях — объект, предмет, цель, задачи, — и другой перплексии там взяться неоткуда. Это норма, а не признак генерации.
  • Влияет ли объём проверяемого текста? Да. Единица анализа — абзац от 500 знаков; на коротких фрагментах вердикт заметно менее надёжен.

Если работу уже вернули с высоким показателем, косметическая правка формулировок статистику не сдвинет — переписывать нужно отмеченные абзацы, с собственной логикой и фактурой. Пошаговый разбор такой ситуации — в статье «Работу завернули за высокий процент ИИ», а как устроена проверка в вузе целиком — в статье «Как вузы проверяют работы на ИИ».

Проверка работы на признаки ИИ
Разберём, пройдёт ли ваша работа детекторы вуза, и поможем переписать без нейросетей.
Перейти

В «Соавторе» тексты пишут вручную, без нейросетей, — поэтому перплексия и burstiness у них естественные, а не подогнанные. Подробнее — страница проверки на ИИ. Сколько работ сегодня получают пометки детектора, показывают цифры в статье «ИИ в студенческих работах: статистика 2026».

Все статьи блога
Поделиться: Telegram WhatsApp
Бесплатные инструменты
Генератор титульного листа онлайн — доклад, реферат, курсоваяОформление списка литературы по ГОСТ онлайнПроверка текста на оригинальность

Читать ещё

Проверка на ИИ

Работу проверят на ИИ: как подготовиться к сдаче

Во II квартале 2026 года «Антиплагиат» нашёл признаки генерации в каждой третьей проверенной работе. Разбираем, чем вузовская проверка отличается от бесплатной, чего стоят заявления детекторов о точности и что сделать с текстом за неделю до загрузки.

11 августа 2026 11 мин
Проверка на ИИ

Работу завернули за высокий процент ИИ: что делать

Пошаговый разбор: как запросить полный отчёт вместо скриншота с процентом, какие фразы работают в разговоре с руководителем, чем доказать авторство и какие фрагменты переписывать в первую очередь.

10 августа 2026 9 мин
Проверка на ИИ

GPTZero: что это и как им проверяют работы в вузах

Бесплатно — 10 000 слов в месяц, вердикт по документу и подсветка предложений. Разбираем лимиты и тарифы, заявленную точность, почему русского нет в списке поддерживаемых языков и чем результат GPTZero отличается от показателя Антиплагиат.ВУЗ.

10 августа 2026 9 мин
Помощь в написании работ
Дипломная работаКурсовая работаРефератВКРБизнес-планОтчёт по практикеКонтрольная работаДиссертацияДокладНаучная статьяПрезентация

Доверь работу эксперту уже сегодня

Оставь заявку — назовём цену и срок за 30 минут. Без обязательств.

Гарантия до защиты Безопасная сделка Без нейросетей