Добавил:
Опубликованный материал нарушает ваши авторские права? Сообщите нам.
Вуз: Предмет: Файл:
Безопасность систем искусственного интеллекта. Ч.2. Доверенный искусственный интеллект. Учебное пособие.pdf
Скачиваний:
0
Добавлен:
12.08.2026
Размер:
1 Мб
Скачать

7. ЗАЩИТА ДАННЫХ

 

 

 

 

 

 

 

 

 

 

 

ВИДЕОЛЕКЦИИ

 

 

Федеративное обучение.

 

 

 

Дифференциальная

 

 

 

 

 

 

 

 

конфиденциальность

 

 

 

 

 

 

 

 

 

Гомоморфное шифрование.

 

 

 

 

НПБК

 

 

 

 

 

 

 

 

 

 

 

 

 

 

 

КОНСПЕКТ Федеративное обучение. Дифференциальная конфиденциальность

Существуют следующие подходы к защите данных от атак извлечения:

1)федеративное обучение;

2)дифференциальная конфиденциальность;

3)гомоморфное шифрование;

4)синтетические данные;

5)нейросетевые преобразователи «биометрия-код» (НПБК).

Федеративное обучение. Защита задействованных данных в системах и приложениях ИИ – одно из ключевых направлений, без которых невозможно создать доверенный ИИ. Это серьезный сдерживающий фактор для применения систем ИИ на предприятиях, где решения должны приниматься взвешенно, ответственно, а также при обработке информационными системами ограниченного доступа.

Во время разработки ИИ следует изначально ориентироваться на соответствие защищенному исполнению ИИ. Под «защищенным исполнением» понимается невозможность совершения следующих действий любым неавтори-

48

зованным лицом или субъектом (процессом, пользовате-

лем, злоумышленником):

анализа операций, совершаемых ИИ (алгоритм работы ИИ, суть преобразований);

управления ИИ (с помощью изменения алгоритма работы, подмены данных ИИ и т. д.);

извлечения знаний ИИ.

Федеративное (совместное) обучение – это методика за-

ключения модели в защищенную среду и ее обучение без перемещения данных куда-либо. Федеративное обучение было разработано компанией Google в 2017 году, чтобы обучать одну модель на данных миллионов пользователей сервисов компании. Суть подхода в том, что обучение частично переносится на устройства владельцев персональных данных, а сами данные никогда не покидают устройств пользователей.

Федеративное обучение работает следующим образом: центральный сервер рассылает модель владельцам данных, каждый из них обучает модель на своих данных и посылает результат обратно. Сервер усредняет результаты, обновляет модель, и цикл повторяется.

Федеративное обучение также называют совместным, поскольку ML-модели обучаются на нескольких децентрализованных периферийных устройствах или серверах, содержащих локальные выборки данных, без обмена ими. Этот подход отличается от традиционных централизованных ML-методов, когда все локальные наборы данных загружаются на один сервер, а также от более классических децентрализованных подходов с одинаковым распределением локальных данных.

В зависимости от распределения образов датасета выделяют горизонтальное, вертикальное и трансферноеобучение.

49

Основная идея механизма дифференциальной конфи-

денциальности (также дифференциальная приватность, далее – DP) состоит в том, чтобы «замаскировать» персональные данные пользователей так, чтобы статистически значимые свойства, важные для модели, сохранялись, но о данных конкретного пользователя сказать что-то с уверенностью было нельзя.

Дифференциальная конфиденциальность представляет собой целую группу сложных методов, требующих большого количества статистических данных: они добавляют в базу данных определенное количество шума (случайные данные).

Алгоритм может быть назван дифференциально приватным, только если добавление одного экземпляра в тренировочную выборку приводит к статически незначительным изменениям в ответе алгоритма.

Данный метод позволяет владельцам данных получить оценку риска, на который они соглашаются, предоставляя свои данные, а владельцам модели упрощает процесс агрегирования данных пользователей и обучения единой модели.

Есть две модели дифференциальной конфиденциальности: глобальная и локальная.

Гомоморфное шифрование. НПБК

Один из способов защитить данные – зашифровать их таким образом, чтобырасшифровать их мог только владелец. Появилась идея обучения модели на зашифрованных данных.

Проблема такого подхода в том, что когда мы шифруем данные, существующие в них зависимости теряются, потому что в этом и состоит цель шифрования – изменить

50

данные так, чтобы зависимости нельзя было обнаружить.

Степень энтропии в данных после шифрования не позволяет моделям уловить эти зависимости. Поэтому для большинства способов шифрования данных обученные на них модели не работают.

Гомоморфное шифрование гарантирует, что для некоторого рода функции f(x) возможно производить операции над зашифрованными данными так, что дешифрованный результат будет равен результату операции над незашифрованными данными, т. е.

f(x) = Decrypt(f (Encrypt(x))).

Гомоморфное шифрование работает для сложения, умножения и любой их композиции, т. е. для полиномов. Если схема гомоморфного шифрования позволяет вычислять полиномы произвольной степени, то такое шифрование называется полностью гомоморфным, иначе – частично гомоморфным.

Такой тип шифрования позволяет делать произвольные вычисления на зашифрованных данных без их расшифровки. Выделяют частично и полностью гомоморфные системы.

Кчастично гомоморфным относятся криптосистемы RSA, Эль-Гамаля, Гольдвассер – Микали и ряд других.

Кполностью гомоморфным – криптосистемы Гентри, на целых числах, Бракерски – Гентри – Вайкунтанахана (BGV), NTRU – созданная Лопез-Альтом, Тромером и Вайкунтанаханом (LTV), Гентри – Сахай – Вотерс (GSW).

Одной из существенных проблем известных полностью гомоморфных криптосистем является их крайне низкая производительность. В настоящее время существует

51

два основных пути повышения производительности: ис-

пользование «ограниченного гомоморфизма» (англ. leveled fully homomorphic encryption) и использование так называ-

емого «метода упаковки шифротекстов».

Начиная с некоторого размера гомоморфные шифротексты перестают однозначно расшифровываться. Чем больше длина зашифрованного текста, тем больше вероятность, что верно дешифровать гомоморфное решение не удастся. На сегодняшний день для гомоморфного шифрования создан стандарт ISO/IEC 18033-6:2019, но этот стандарт не касается шифрования параметров нейросетевых решающих правил.

Применение синтетических данных в задачах машинного обучения может быть полезным не только для получения выборки образов нужного объема, но и для обеспечения конфиденциальности данных.

Синтетические данные, полученные определенным способом, можно использовать как для тестирования моделей, так и для их обучения, если они создаются на основе распределений реальных данных.

Способы формирования синтетических биометрических образов приводятся в ГОСТ Р 52633.2-2010 «Защита информации. Техника защиты информации. Требования к формированию синтетических биометрических образов, предназначенных для тестирования средств высоконадежной биометрической аутентификации». К ним относятся морфинг, мутация, синтез и размножение.

Рассмотрим модель защищенного НПБК. Дело в том, что из биометрических признаков (данных) нам нужно извлекать ключи шифрования, чтобы, например, ставить электронно-цифровую подпись (ЭЦП) на документе.

52

НПБК должен преобразовывать биометрический образ

человека (образ «свой») в его личный пароль или ключ шифрования, а «чужие» биометрические образы – в случайный бинарный код. В идеале энтропия кода «чужой» должна быть сопоставима с его длиной, т. е. близка к «белому шуму». НПБК может быть обучен тому, чтобы выдавать ключ ЭЦП при поступлении биометрического образа владельца. Сам ключ генерируется заранее в соответствии с принятыми правилами. Современные стандарты в области ИБ требуют, чтобы после обучения НПБК биометрические эталоны и личный ключ пользователя были защищены от компрометации при хранении и передаче по каналам связи. При хищении баз параметров обученных НПБК должно быть невозможно извлечь ключ без воспроизведения аутентичного биометрического образа.

ИИ должен работать как преобразователь входных воздействий (поступающей информации) в длинный криптографический ключ или пароль, который можно ассоциировать с определенным управляющим воздействием. Таким образом, вместо коротких кодовых команд на выходе ИИ нужно использовать длинные криптографические ключи. Каждый ключ должен быть ассоциирован с отдельным действием, и только объект управления должен «знать», что нужно делать с поступившим от ИИ ключом (последовательность управляющих команд может быть зашифрована на данном ключе). Другими словами, ИИ должен проходить процедуру аутентификации. Для авторизации необходимо использовать неотчуждаемый от ИИ ключ или пароль, который должен храниться безопасно в защищенной памяти (ключ должен «помнить» только ИИ).

53

Соседние файлы в предмете [НЕСОРТИРОВАННОЕ]