Заместитель директора фундаментальной библиотеки РГПУ имени А.И. Герцена Светлана Морозова представила результаты исследования библиографических конфабуляций — правдоподобных, но несуществующих ссылок, которые генеративные модели создают для академических текстов и которые затем попадают в опубликованные научные работы. По её словам, конфабуляция — не ошибка и не опечатка, а результат взаимодействия пользователя с моделью, когда запрос, вероятностная генерация и отсутствие проверки совместно производят несуществующий библиографический объект. Термин пришёл из медицины: человек заполняет пробелы в памяти данными, которые кажутся ему достоверными, без намерения обмануть — так и модель комбинирует реальные фамилии, фрагменты заглавий, журналы и годы с выдуманными.
В рамках проекта «ИИллюзИИ и галлюцитирования» исследователи проанализировали 54 статьи из рецензируемых журналов, индексируемых в eLibrary.ru. В списках литературы зафиксирована 691 библиографическая позиция, из которых 306 (44,3%) признаны доказанно конфабулированными — 96 книжных изданий и 210 статей. Выявлены устойчивые признаки таких ссылок: отсутствие электронных идентификаторов, минимальное указание интернет-ссылок, упоминание только журнальных статей без сборников и глав из книг, использование двоеточия в 40% заглавий по схеме «общая научная рамка: уточнение», шаблонность объёмов. Современный тренд — смешение реальных авторов и изданий с достоверными сочетаниями года, тома, номера и страниц, что в сумме даёт несуществующую ссылку.
Проверка 306 ложных ссылок проводилась с помощью сервисов eLibrary.ru, CiteSure, Citely, GPTZero, Crossref и больших языковых моделей ChatGPT, Perplexity, DeepSeek и «ГигаЧат» — ни один инструмент не дал стопроцентного совпадения с выводами библиотекаря-верификатора. По словам Морозовой, автоматическая детекция может быть полезным этапом, но не заменяет профессионального суждения. Сегодня только специалист-верификатор может проследить цепочку распространения конфабуляций в последующих публикациях: в зарубежном поле такие «цепи» фиксируются с 2023 года, в российском — с конца 2024-го. Наработки герценовских экспертов уже внедрены в систему идентификации ссылок РИНЦ и использованы системами распознавания плагиата.
Фото: пресс-центр РГПУ им. А.И. Герцена


