Во франкофонных литературных кругах последние две недели бушует скандал: там канадско-гаитянскому автору романа-бестселлера «Либо так, либо смерть» восторженные критики сначала навыдавали кучу престижных наград – а потом выяснилось, что всё произведение является AI-слопом чуть менее, чем полностью.
Ну как, «выяснилось»: на это указывает детектор слопа под названием Pangram. И во всех обсуждениях этого вопроса регулярно можно встретить комментарии в стиле «да все эти ИИ-детекторы просто неработающая ерунда, они там по длинным тире могут любой текст генерацией признать, глупо на них полагаться!!».
И тут даже есть зерно истины в том смысле, что решить задачу «со 100%-ной точностью разделять авторство любого произвольного текста между человеком и машиной» заведомо невозможно. Но, может быть, такой безумный уровень точности и не нужен, в целом? Может, условной 99,9% точности вполне хватит? Смотрите, я тут покопался в исследованиях по поводу этого Pangram:
🐌 По данным от самих разработчиков, их свежая модель ошибочно признает за ИИ написанный человеком текст в 0,004% случаев (40 срабатываний на 1 миллион проверок). В обратную сторону точность скалибрована в меньшую сторону (тут уж надо выбирать, какой тип ошибки минимизировать): примерно 0,3% ИИ-текстов модель приняла за человеческие.
🐌 Вот в этом независимом исследовании прошлогоднюю версию Pangram проверяли на паре тысяч чисто человеческих и паре тысяч нейронных текстов. У них вышло 0,1% ложноположительных срабатываний (ошибочно определили человека как ИИ) при 1% ложноотрицательных (ошибочно приняли ИИ за человека).
🐌 Здесь и здесь анализируется уже чуть более свежая версия Панграма на выборках в 40 и 500 людских текстов – в обоих исследованиях модель выдала ноль ложноположительных срабатываний, но при этом иногда консервативно помечала тексты от ИИ как человечьи (особенно там, где исследователи их специально «хьюманизировали» или просили подражать стилю конкретного автора).
🐌 Вот тут из 300 точно человеческих текстов Pangram ни один не заклеймил ошибочно нейрослопом. Но при этом он часто (в 60–80%) помечал как машинный текст, который после человека редактировала (по сути, переписывала, а не писала с нуля) нейронка. И еще авторы там с помощью хьюманайзера смогли заабьюзить ошибку в обратную сторону и заставить Панграм пропускать 95%+ ИИшных текстов как человеческие (правда, там сами тексты были короткие, всего 180 слов).
Краткие выводы:
Если Pangram говорит, что текст является нейрослопом – то с очень высокой вероятностью он либо полностью сгенерирован, либо его правила нейронка (модель специально калибруют так, чтобы она допускала как можно меньше ошибок в эту сторону).
В обратную сторону точность сильно меньше: метка «written by human» от Панграма не является гарантией, что речь не идет про слоп, который специально постарались хьюманизировать.
Более-менее адекватная точность в любом случае начинается примерно от 200 слов, совсем короткие фрагменты на пару предложений надежно задетектить не выйдет.
Большинство исследований делалось в первую очередь на английском, для других языков точность потенциально может быть ниже. Хотя, в карте модели Pangram 4 они там заявляют впечатляюще низкий уровень в 0,005% ложноположительных срабатываний для русского языка.
P.S. Как обсуждали еще сегодня в комментах к посту на моем канале: в интернете можно найти много смешных скриншотов на тему «Pangram думает, что тексты Гюго или Витгенштейна являются AI-слопом». Так вот, рекомендую вам проверять такое самостоятельно на оригиналах текстов – там в подавляющем большинстве случаев речь идет о фейках, чтобы собрать классы.
Еще по теме:
Подпишитесь на нашу рассылку, чтобы получать уведомления о новых обновлениях, информации, скидках и т. д.