26.1 C
Sevastopol
22 августа, 2026
СЕВОБОРОНА
Технологии

Почти 90% биомедицинских статей несут следы языковых моделей

Почти 90% биомедицинских статей несут следы языковых моделей

Это заметно выше всего, что публиковалось раньше. Предыдущая работа части тех же авторов, разбиравшая только аннотации, давала для 2024 года минимум 13,5%. Разница объясняется методом: авторы утверждают, что подсчёт по «избыточной лексике» систематически занижает результат, потому что ловит частотные сдвиги, а не сами статьи.

Распределение по разделам логичное: в обсуждениях декабрьских статей следы модели нашлись в 78% случаев, в результатах — в 58%. Второе тревожнее первого: обсуждение можно и причесать, а вот в разделе с результатами галлюцинация превращается в фальсификацию.

Дисциплина требований: препринт не прошёл рецензирование, выборка — только англоязычные тексты из PMC, и «признаки LLM» — это статистическая оценка, а не признание автора.

Спорить о том, «можно ли учёному пользоваться моделью», уже поздно — вопрос в том, где проходит граница между редактурой языка и подстановкой чисел. Мне кажется, полезнее не запреты, а обязательное раскрытие: кто чем пользовался и на каком этапе. Пока такой нормы нет, рецензенту приходится читать каждую статью так, будто половину текста мог написать кто угодно.

Источник