ИИ становится опасным? Ученые вывели формулу, предсказывающую, когда чат-бот сойдет с ума

ИИ становится опасным? Ученые вывели формулу, предсказывающую, когда чат-бот сойдет с ума

Физики из Университета Джорджа Вашингтона создали математический инструмент, который предсказывает момент, когда ИИ-модель переключится с нормальных ответов на опасные. Формула работает даже для офлайн-чат-ботов на телефонах, где нет облачных фильтров безопасности. Точность прогноза — 18 из 19 случаев.

Проблема, которую все игнорировали

Миллиарды людей носят в карманах устройства, способные запускать небольшие языковые модели. Эти чат-боты практически не имеют внешнего контроля безопасности. Они не фильтруют советы, которые могут подтолкнуть к самоповреждению, финансовым потерям или экстремистским идеям. Особенно остро проблема стоит при работе офлайн, когда устройство не связано с облаком.

Именно эта категория пользователей наиболее уязвима. Врачи, которые не могут отправлять данные пациентов на удаленные серверы. Юристы, защищающие конфиденциальность. Военные без сигнала связи. Для них нет облачного фильтра безопасности, нет мониторинга и нет возможности исправить модель, если что-то пошло не так.

Что именно нашли физики

Исследователи подошли к задаче как к физическому явлению. Они представили все возможные ответы ИИ как долины на ландшафте. Одни долины содержат желательные ответы. Другие — потенциально вредные. Внутри модели эти варианты конкурируют друг с другом за «внимание».

Формула описывает момент, когда система переходит из безопасной долины в рискованную. Ключевой параметр — это не просто расстояние до опасного ответа, а скорость приближения к нему. Если ИИ «едет параллельно обрыву», он в безопасности. Но если его внимание начинает смещаться в сторону опасного выхода, он неизбежно с него свалится.

Ведущий автор работы объяснил это так: в физике сложные материалы описывают через поведение одного типичного атома. Здесь ученые сделали то же самое — разобрали один эффективный механизм внимания и вывели формулу переломной точки.

Почему порядок вопросов меняет все

Один из самых тревожных результатов касается порядка разговора. Исследователи задавали одинаковый набор вопросов о вакцинах, самоповреждении и причинении вреда в двух разных последовательностях одной и той же модели. В одном порядке ИИ давал опасный ответ на каждый вопрос. В другом — приемлемый ответ на каждый.

Формула предсказывает эту траекторию, потому что все сказанное ранее подпитывает борьбу за то, что будет дальше. Как выразился один из авторов, самое пугающее в том, что переключение может произойти после нескольких perfectly acceptable ответов. Пользователь успевает проникнуться доверием, а затем система резко уходит вниз, и каждый нежелательный ответ тянет следующий за собой.

Проверка на реальных моделях

Ученые протестировали формулу на семи открытых моделях от трех разных компаний. Прогноз совпал с реальным поведением в 18 из 19 случаев переключения. Независимое тестирование крупных коммерческих чат-ботов также показало поведенческие паттерны, которые предсказывает формула.

Важно понимать: «плохой» ответ здесь не означает «ложный». Речь идет о фактически верной информации, которая может быть опасной в конкретном контексте — например, вводящий в заблуждение совет врачу или юридически некорректная рекомендация.

Что это значит для будущего

Исследователи надеются, что их работа повысит осведомленность о том, что разговоры с ИИ могут со временем дрейфовать в опасную зону. По их словам, для встроенного «предупреждающего индикатора» в будущих телефонах потребуется всего несколько простых вычислений.

Формула работает независимо от того, как определять «нежелательное» — это может быть дезинформация, нарушение медицинских или юридических обязанностей, или опасная инструкция. Машина не понимает этики, но она оперирует концепциями. И если внимание системы начинает смещаться в сторону опасного концепта, формула покажет, когда именно она перейдет черту.

Итоги работы ученых опубликованы в журнале Patterns.

Изображение: разработано Мagnific.

Почему мужчины раньше теряют иммунную защиту от рака. Новое открытие меняет подход к терапии онкологии
В московском метро открылась выставка, посвящённая Международному фестивалю НАУКА 0+