В научном мире распространилась тревожная новость: бессмысленное выражение «вегетативная электронная микроскопия» неожиданно появилось в нескольких научных статьях. Эта фраза — не новая теория заговора и не прорывное открытие. Это странный, ничего не значащий набор слов, который, тем не менее, прочно укоренился как в научной литературе, так и в данных, на которых обучают искусственный интеллект, сообщает издание Futura.
Как возникла бессмыслица
История началась в 1950-х годах, когда оцифровывали две статьи из журнала Bacteriological Reviews. При оптическом распознавании символов (OCR) произошла ошибка: слово «вегетативный» из одного столбца случайно слилось с «электроном» из другого. Так родился призрачный термин, не имеющий никакого смысла.
Десятилетия спустя эта текстовая аномалия всплыла в иранских научных публикациях. В 2017 и 2019 годах две статьи содержали загадочную фразу в английских резюме и подписях. Вероятная причина — ошибка перевода: на фарси слова «вегетативный» и «сканирующий» почти идентичны и различаются лишь одним диакритическим знаком. Этой крошечной детали хватило, чтобы «вегетативная электронная микроскопия» отправилась в международное путешествие.
От опечатки к цифровой окаменелости
По данным Google Scholar, бессмысленная фраза теперь встречается в 22 научных публикациях. Некоторые издатели, например Springer Nature, отозвали затронутые статьи — хотя и не без споров. Elsevier, еще один крупный издатель, сначала пытался оправдать существование термина, но в итоге внес исправления. Эта ситуация наглядно показывает, насколько научное сообщество уязвимо перед распространением, казалось бы, незначительных ошибок.
Как бессмыслица попала в искусственный интеллект
Языковые модели, такие как ChatGPT, обучаются на огромных массивах текста, чтобы предсказывать наиболее вероятные слова. Недавно исследователи проверили, «выучили» ли эти модели странную фразу, подсказывая им фрагменты из оригинальных статей. Результаты показательны: GPT-3 уверенно завершал предложения с помощью «вегетативной электронной микроскопии», тогда как более ранние модели (GPT-2 и BERT) не демонстрировали такой тенденции.
Более того, аномалия сохраняется в новых моделях, таких как GPT-4o и Claude 3.5 от Anthropic. Это говорит о том, что термин глубоко укоренился в базах знаний ИИ. Главный виновник — CommonCrawl, огромный архив публичных веб-данных. Как только цифровая окаменелость попадает в такие источники, она становится практически бессмертной.
Почему цифровые ископаемые важны
Так называемые «цифровые окаменелости» вызывают серьезные опасения по поводу надежности знаний в эпоху, когда ИИ помогает научным исследованиям. Реакция издателей была непоследовательной: одни убрали подозрительные статьи, другие их защищали. Elsevier даже пытался доказать подлинность фразы, прежде чем изменить курс.
Автоматические инструменты проверки теперь иногда отмечают «вегетативную электронную микроскопию» как признак возможного контента, сгенерированного ИИ. Но вот в чем загвоздка: эти методы могут обнаружить только уже известные нам ошибки — а не те, которые еще ждут своего часа.
Что нужно делать
Технологическим компаниям следует быть более прозрачными в отношении данных, которые они используют для обучения ИИ. Исследователям нужно придумывать новые способы проверки надежности информации — особенно по мере того, как контент, созданный ИИ, становится все более убедительным. Научные издатели должны усилить процессы рецензирования, чтобы выявлять ошибки как человеческого, так и машинного происхождения.
Вывод
История цифровых окаменелостей, таких как «вегетативная электронная микроскопия», подчеркивает проблемы не только в контроле огромных масс данных, но и в поддержании надежности наших коллективных знаний. В современных условиях ошибки могут легко самовоспроизводиться и закрепляться десятилетиями.
По мере того как ИИ все больше участвует в производстве и распространении знаний, коллективная бдительность становится абсолютно необходимой. Если мы хотим сохранить целостность нашего научного наследия, нельзя позволить одному глупому, бессвязному выражению ускользнуть сквозь трещины — каким бы безобидным оно ни казалось на первый взгляд.
Изображение: разработано Мagnific.


