Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Безопасность систем искусственного интеллекта. Ч.2. Доверенный искусственный интеллект. Учебное пособие.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

6. КОМПЬЮТЕРНЫЕ АТАКИ НА ИСКУССТВЕННЫЙ ИНТЕЛЛЕКТ

 

 

ВИДЕОЛЕКЦИИ

Обзор реализованных атак

Классификация атак

Примеры реализации атак

Методы противодействия атакам

КОНСПЕКТ Обзор реализованных атак

ИИ в перспективе будет все больше и больше приносить прибыли компаниям, поэтому он становится объектом потенциальных компьютерных атак. Традиционный подход к построению интерфейса взаимодействия с ИИ в системах управления основан на том, что на вход ИИ поступает информация в пакетном режиме или режиме реального времени. Она анализируется по некоторому алгоритму, после чего на выходе ИИ возникают управляющие воздействия. Каждое «воздействие» – это код определенной команды, который представляет собой один или несколько битов информации. Печальным фактом является то, что при такой концепции построения ИИ злоумышленники гипотетически могут провести разные виды атак.

Классификация атак

Компьютерная атака – целенаправленное воздействие программных и (или) программно-аппаратных средств на объекты критической информационной инфраструктуры,

41

сети электросвязи, используемые для организации взаимо-

действия таких объектов, в целях нарушения и (или) прекращения их функционирования и (или) создания угрозы безопасности обрабатываемой такими объектами информации (ФЗ от 26.07.2017 № 187-ФЗ «О безопасности критической информационной инфраструктуры Российской Федерации»).

Атаки на системы искусственного интеллекта имеют свою специфику. Они связаны с архитектурой таких систем

иприложений, а также с их жизненным циклом.

Взависимости от способа воздействия выделяют две большие категории атак: атаки-манипуляции и атаки-извле- чения. Атаки манипуляции направлены на изменение поведения системы путем модификации входных и обучающих данных или самой модели. Атаки-извлечения предполагают незаметное получение из системы конфиденциальной информации.

Вспомним некоторые понятия машинного обучения. Входные данные – это данные, которые сообщаются модели до начала ее работы и в процессе выполнения ис-

пользуются для расчета ее выходных показателей. Выходные данные – это результат работы модели, по-

лученный при обработке входных данных.

Обучающие данные – используются для «обучения» модели. Модель извлекает знания из обучающих данных.

Атаки извлечения могут быть реализованы для извлечения данных (входных, выходных и обучающих) и моделей (извлечение и интерпретация знаний, параметров модели).

Атаки извлечения входных данных актуальны в ситуации, когда результаты работы модели общедоступны, а входные данные хранятся в секрете.

42

Атаки извлечения обучающих данных нацелены на по-

лучение сведений о наборе данных, применяемых при обучении модели.

Для непрозрачных систем машинного обучения опасность представляют атаки извлечения модели. Они позволяют скопировать поведение или параметры модели ИИ.

При атаках кражи модели и извлечения данных злоумышленник анализирует входную, выходную и прочую внешнюю информацию о системе, чтобы восстановить по ним параметры или обучающие данные модели.

Кража модели и извлечение данных особенно опасны для алгоритмов, обученных на конфиденциальной информации.

Вторая большая категория атак – атаки манипуляции. Данный вид атак может быть нацелен на модификацию данных, используемых в модели ИИ, или на изменение работы самой модели.

Манипуляции с данными – это процесс изменения входных либо обучающих данных, который позволит злоумышленнику повлиять на качество работы модели, добиться нужных ему результатов при работе модели или ее ошибочного функционирования.

К манипуляциям с данными относятся отравление данных, атака уклонения.

Манипуляция с моделями представляет собой вмешательство в алгоритмы, используемые в процессе обучения. Злоумышленник может внести изменения в архитектуру классификатора, чтобы нарушить работу или манипулировать им, а может подменить модель целиком. Здесь выделяют два способа манипуляции – отравление данных и состязательные атаки.

43

Также атаки можно классифицировать по вектору ата-

ки. По направлению вектора атаки выделяют:

анализ операций, совершаемых ИИ (алгоритм работы ИИ, суть преобразований);

управление ИИ (с помощью изменения алгоритма работы, подмены данных ИИ и т. д.);

извлечения знаний ИИ.

В качестве дополнительных способов классификации атак выделяют следующие:

по степени информированности атакующего;

времени проведения атаки;

способу воздействия;

специфике результата;

специфике проведения.

Выбор злоумышленником типа используемой атаки зависит от многих факторов. В первую очередь он опирается на наличие доступа к модели. Следующим шагом он должен ответить на вопросы:

Известна ли ему используемая модель?

Использовалась ли предобученная модель?

Известны ли параметры модели и веса?

Есть ли доступ к аппаратуре?

Примеры реализации атак

Среди атак извлечения можно привести такие примеры

реализаций, как:

атаки «ключи под ковриком»;

состязательные.

Атака «ключ под ковриком». Смысл этого способа за-

ключается в том, что если создатели системы пренебрегают шифрованием для защиты ИИ, то могут возникать внешние и внутренние угрозы, так как ключ (или ключи) шифрова-

44

ния параметров решающих правил ИИ (например, таблицы

связей и весовых коэффициентов искусственных нейронных сетей) должен(ы) где-то храниться (в базе данных, коде и т. д.). Злоумышленник может похитить ключ, используя уязвимости в защите или вступив в сговор с администратором.

Частным случаем манипуляции с моделями являются атаки «на решающий бит» (атаки «одного бита»). Существует, по крайней мере, две ситуации, касающиеся такого рода атак. Первая связана с редактированием программного кода ИИ (точнее его скомпилированной и обученной версии). Если на выходе ИИ возникают короткие команды, то злоумышленник может инвертировать логику программы, изменив решающее правило.

Вторая ситуация возникает, если злоумышленник напрямую подключится к объекту управления или к каналу передачи данных с возможностью изменять сигналы на выходе ИИ.

«Состязательные» атаки (спуфинг) – это атаки, при которых злоумышленник подает на вход интеллектуальной системы фальсифицированные или перехваченные данные, чтобы получить на выходе ИИ желаемые управляющие воздействия. «Состязательные» атаки могут применяться и для извлечения знаний модели ИИ. Угроза данных атак возникает в том случае, если разработчики ИИ пренебрегают подходами к защите от состязательных атак, например, не используют методы, повышающие устойчивость (робастность) обучения.

Атака «черного ящика» подразумевает, что злоумышленнику известен только результат работы сети для любого

45

входного сигнала. Он все еще может разметить данные

и создать на их основе вредоносные сигналы.

Атака «белого ящика» подразумевает, что у злоумышленника есть непосредственный доступ к модели ИИ. Применяются методы градиентной оптимизации для создания вредоносного сигнала.

Для изображения в качестве образа вредоносный сигнал может быть получен с помощью:

искажения всего изображения;

однопиксельного искажения;

заплатки.

Особенность такой атаки в том, что:

даже при незначительном искажении входных данных, ответ ИИ может измениться значительно;

искажение может состоять даже из одного пикселя для изображения;

может использоваться искажение небольшого фрагмента изображения («заплатка»), чтобы ИИ концентрировал свое внимание на нем.

Отказ в обслуживании ИИ относится к атакам манипуляции ИИ. Злоумышленники могут выводить из строя системы машинного обучения потоком запросов с целью ухудшения качества или отключения службы.

Также к атакам манипуляции относят атаки с внедрением триггера в модель на основе нейронной сети. Триггер

вмодели – набор нейронов, которые реагируют на определенный сигнал во входных данных. Имея обученную модель, выявить в ней наличие триггеров практически невозможно.

Отдельно выделим атаки на этапе исполнения модели, такие как перенос обучения, атаки на аппаратуру.

46

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]