Когда ИИ умеет сомневаться: новый подход к защите нейронных сетей от атак

Когда ИИ умеет сомневаться: новый подход к защите нейронных сетей от атак

Современные системы искусственного интеллекта, основанные на трансформерах (в т.ч. ChatGPT и другие языковые модели), демонстрируют впечатляющие успехи. Однако у них есть серьезный недостаток: нейросеть может быть очень уверена в неправильном ответе. Особенно серьезной эта проблема становится в тех случаях, когда нейросеть целенаправленно пытаются обмануть. Злоумышленник может подобрать небольшие изменения во входных данных (состязательные примеры), которые практически не меняют их исходный смысл, но заставляют нейросеть принять неправильное решение.

Например, система обнаружения сетевых вторжений должна определить, является ли наблюдаемая сетевая активность нормальной или представляет угрозу. Проблема усугубляется тем, что нейросеть, распознающая угрозу, может не просто ошибиться на состязательных примерах, а сделать это с высокой степенью уверенности. Возникает естественный вопрос: можно ли сделать нейросеть менее уязвимой к состязательным воздействиям и одновременно научить ее определять, насколько надежен собственный прогноз?

Ученые из Национального исследовательского ядерного университета «МИФИ» (НИЯУ МИФИ) – аспирант Роджер-Ник Анаедевха и доцент каф. «Кибернетика» к.т.н. Александр Трофимов – предложили подход, который позволяет одновременно решать две проблемы: оценивать, насколько нейросеть уверена в своем решении, и повышать ее устойчивость к попыткам обмана. В основе подхода лежит идея стохастического трансформера – нейросети, параметры которой, в отличие от классического трансформера, являются случайными. Результаты исследования опубликованы в журнале Knowledge and Information Systems.

Искусственный «шум» как броня

Представьте, что вместо фиксированных значений коэффициентов (весов) у каждого нейрона теперь имеется «облако» возможных значений. При каждом запуске модель случайным образом выбирает свои веса, в зависимости от подаваемых на вход данных. Это означает, что для одного и того же входного объекта может быть получено множество различных прогнозов сети. Если эти прогнозы получаются примерно одинаковыми, то система может считать свое решение достаточно надежным. Если же результаты заметно различаются, то это указывает на высокую неопределенность.

Стохастический трансформер дополнительно может показать, насколько устойчив прогноз к небольшим изменениям самой модели и насколько сильно различаются полученные прогнозы. Это особенно важно для обнаружения новых или необычных атак. Если система сталкивается с данными, существенно отличающимися от обучающих примеров, высокая неопределенность может стать сигналом для проверки специалистом.

Кроме того, авторы утверждают, что случайность может создать дополнительное препятствие для злоумышленника. Если атакующий знает точную структуру и поведение модели, то он может подобрать специальное изменение входных данных, заставляющее ее ошибиться. Но если внутренние параметры модели случайным образом изменяются (авторы называют это «движущейся мишенью»), одна и та же атака уже не обязательно будет одинаково эффективна при каждом запуске модели.

Три направления повышения надежности ИИ: устойчивость, достоверность, экономия

Разработка ученых МИФИ объединяет несколько механизмов, позволяющих одновременно решать три важные задачи: повышать устойчивость нейросети к состязательным атакам, улучшать соответствие ее уверенности реальной точности прогноза и сокращать объем данных, требующих ручной разметки.

1. Устойчивость к состязательным атакам.

Авторы проверили модель на нескольких типах атак, включая FGSM, PGD и C&W. Во всех экспериментах предложенный стохастический трансформер демонстрировал более высокую устойчивость к состязательным атакам по сравнению с базовыми моделями.

2. Более достоверная оценка уверенности.

Предложенная модель оценивает не только вероятность принадлежности объекта к определенному классу, но и неопределенность своего прогноза. Для оценки соответствия прогнозируемой уверенности реальной точности авторы используют показатель ECE (Expected Calibration Error). В экспериментах его среднее значение составило 0,043, что свидетельствует о достаточно хорошей калибровке модели: ее оценки уверенности близки к фактической частоте правильных решений.

3. Экономия на «учителях».

Обучение ИИ требует разметки данных людьми. В сфере кибербезопасности эксперт, способный отличить сложную угрозу от легитимного трафика, стоит дорого. Благодаря тому, что модель знает, где она «плавает», она может сама запрашивать у человека разметку только самых сложных и неоднозначных примеров. Это позволило сократить объем необходимых размеченных данных на 81%, достигнув при этом 97% от максимальной точности прогноза.

Таким образом, предложенный подход рассматривает надежность искусственного интеллекта сразу с нескольких сторон: нейросеть должна быть устойчива к попыткам ее обмануть, уметь адекватно оценивать неопределенность своих решений и эффективно использовать человеческое участие там, где оно действительно необходимо.

Мнение экспертов и перспективы

Мы создали не просто очередную нейросеть, а теоретически обоснованный фреймворк, – комментируют авторы исследования. – Наша работа доказывает, что стохастичность (случайность) в параметрах модели не мешает, а помогает: она делает ИИ одновременно и более защищенным, и более достоверным.

Разработка протестирована на девяти наборах данных в трех прикладных областях: обнаружение сетевых вторжений, выявление токсичного контента и распознавание фейковых новостей. В планах ученых – адаптация метода для больших языковых моделей (LLM) с использованием технологий низкоранговой адаптации (LoRA), что позволит применять стохастические механизмы защиты к крупным нейросетям без необходимости полностью переобучать все их параметры.

Хотя у метода есть ограничения (например, он в 4-5 раз медленнее обычного инференса из-за необходимости многократных симуляций), исследователи предлагают пути решения: оптимизация числа прогонов и дистилляция знаний, при которой более компактная модель обучается воспроизводить поведение более сложной стохастической модели.

Разработка выполнена в рамках стратегического проекта НИЯУ МИФИ по цифровой безопасности. Код и модели находятся в открытом доступе, что позволяет мировому научному сообществу уже сейчас использовать наработки российских ученых для создания более безопасного и надежного искусственного интеллекта.

Источник: Минобрнауки России
Изображение на обложке: разработано Magnific

Без сложной обработки: в МИСИС создали новый способ покрытия имплантатов
Ученые ускорили расчет маршрутов для роботов