Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
| Корпорация Майкрософт | Беркман Кляйн Центр Интернета и общества в Гарвардском университете |
|---|---|
Ноябрь 2019 г.
Введение и фон
За последние два года было написано более 200 статей о том, как машинное обучение (ML) может потерпеть неудачу из-за враждебных атак на алгоритмы и данные; это число значительно увеличивается, если включить не состязательные режимы сбоев. Наплыв статей затруднил практикам ML, а также инженерам, юристам и политикам трудно следить за нападениями на и защитой систем машинного обучения. Тем не менее, поскольку эти системы становятся более распространёнными, необходимость понять, как они терпят неудачу, по вине противника или в силу особенностей конструкции системы, становится всё более актуальной. Целью этого документа является совместная табуляция обеих этих неисправностей в одном месте.
Преднамеренные сбои , в которых происходит сбой, вызванный активным злоумышленником, пытающимся подорвать систему, чтобы достичь ее целей , либо неправильно классифицировать результат, выводить частные данные обучения или украсть базовый алгоритм.
Непреднамеренные сбои , в которых ошибка происходит из-за того, что система машинного обучения выдает формальный, но совершенно небезопасный результат.
Мы хотели бы отметить, что существуют другие таксономии и платформы, которые отдельно выделяют режимы преднамеренного сбоя[1],[2] и непреднамеренные режимы сбоев[3],[4]. Наша классификация объединяет два отдельных режима сбоя в одном месте и отвечает следующим потребностям:
Необходимость обеспечить разработчиков программного обеспечения, специалистов по реагированию на инциденты безопасности, юристов и политиков общим языком, чтобы обсуждать эту проблему. После разработки первоначальной версии таксономии в прошлом году мы работали с командами по безопасности и машинному обучению в Microsoft, 23 внешних партнеров, организации стандартов и правительств, чтобы понять, как заинтересованные лица будут использовать нашу платформу. Основываясь на этом исследовании удобства использования и отзыве заинтересованных лиц, мы итерировали на платформе.
Результаты: При представлении режима сбоя машинного обучения мы часто наблюдали, что разработчики программного обеспечения и юристы психически сопоставляли режимы сбоя машинного обучения с традиционными атаками программного обеспечения, такими как утечка данных. Таким образом, на протяжении всего документа мы пытаемся подчеркнуть, как режимы сбоя машинного обучения существенно отличаются от традиционных сбоев программного обеспечения с точки зрения технологии и политики.
Потребность в единой платформе, на которой инженеры могут строить и интегрировать в существующие практики разработки программного обеспечения и обеспечения безопасности. В целом, мы хотели, чтобы таксономия была больше, чем образовательный инструмент - мы хотим, чтобы он повлиял на реальные инженерные результаты.
Результаты: Используя таксономию в качестве объектива, корпорация Майкрософт изменила процесс жизненного цикла разработки безопасности для всей организации. В частности, специалисты по обработке и анализу данных и инженеры по безопасности в Корпорации Майкрософт теперь совместно используют общий язык этой таксономии, что позволяет им более эффективно моделировать свои системы машинного обучения перед развертыванием в рабочей среде; Ответы на инциденты безопасности также имеют панель ошибок для анализа этих новых угроз, характерных для машинного обучения, стандартного процесса для обработки уязвимостей и реагирования, используемого Центром реагирования майкрософт по безопасности и всеми командами продуктов Майкрософт.
Потребность в общем словаре для описания этих нападений среди политиков и юристов. Мы считаем, что это для описания различных режимов сбоя машинного обучения и анализа того, как их вред может регулироваться, является значимым первым шагом к информированной политике.
Результаты: Эта таксономия написана для широкой междисциплинарной аудитории , поэтому политики, которые смотрят на вопросы с общей точки зрения ML/AI, а также конкретные домены, такие как дезинформация/здравоохранение, должны найти каталог режим сбоя полезным. Мы также выделяем все применимые правовые меры для устранения проявлений отказов.
См. также моделирование угроз для систем ИИ/МО и их зависимостей Майкрософт и повороты панели ошибок SDL для уязвимостей машинного обучения.
Как использовать этот документ
В самом начале мы признаем, что это живой документ, который будет развиваться со временем с ландшафтом угроз. Мы также не предписываем технологические меры по смягчению последствий для этих модов отказа, так как защита зависит от сценария и связана с моделью угроз и рассматриваемой архитектурой системы. Варианты, представленные для устранения угроз, основаны на текущих исследованиях с ожиданием того, что эти защиты будут развиваться с течением времени.
Для инженеров рекомендуется просматривать общие сведения о возможных режимах сбоя и переходе к документу моделирования угроз. Таким образом, инженеры могут выявлять угрозы, атаки, уязвимости и использовать платформу для планирования контрмер, где они доступны. Затем мы ссылаемся на панель ошибок, которая сопоставляет эти новые уязвимости в таксономии наряду с традиционными уязвимостями программного обеспечения и предоставляет оценку для каждой уязвимости машинного обучения (например, критической, важной). Эта панель ошибок легко интегрирована в существующие процессы и сборники схем реагирования на инциденты.
Для юристов и разработчиков политики этот документ упорядочивает режимы сбоя машинного обучения и представляет платформу для анализа ключевых вопросов, соответствующих всем, кто изучает варианты политики, такие как работа, выполненная здесь[5],[6]. В частности, мы классифицировали неудачи и последствия таким образом, чтобы политики могли начать проводить различия между причинами, которые будут информировать инициативы государственной политики по повышению безопасности и безопасности машинного обучения. Мы надеемся, что руководители политики будут использовать эти категории, начиная с того, как существующие правовые режимы могут (не) адекватно захватывать возникающие вопросы, какие исторические юридические режимы или решения политики могли бы иметь дело с аналогичными вредами, и где мы должны быть особенно чувствительны к вопросам гражданских свобод.
Структура документа
В разделах "Режимы преднамеренного сбоя " и " Непреднамеренные режимы сбоев " мы предоставляем краткое определение атаки и пример из литературы.
В разделе "Режимы преднамеренного сбоя " мы предоставляем дополнительные поля:
Что атака пытается компрометировать в системе машинного обучения — конфиденциальность, целостность или доступность? Мы определяем конфиденциальность как обеспечение того, что компоненты системы машинного обучения (данные, алгоритм, модель) доступны только авторизованным сторонам; Целостность определяется как обеспечение того, что система машинного обучения может быть изменена только авторизованными сторонами; Доступность определяется как гарантия того, что система машинного обучения доступна авторизованным сторонам. Вместе конфиденциальность, целостность и доступность называются триадой КЦД. Для каждого преднамеренного режима сбоя мы пытаемся определить, какой из триад ЦРУ скомпрометирован.
Сколько знаний требуется для проведения этой атаки — black-box или white-box? В атаках стиля Blackbox злоумышленник не имеет прямого доступа к данным обучения, не знает алгоритм машинного обучения и не имеет доступа к исходному коду модели. Злоумышленник только запрашивает модель, затем наблюдает ответ. В атаке в стиле белого ящика злоумышленник имеет знание о конкретном алгоритме машинного обучения или доступ к исходному коду модели.
Комментарий о том, нарушает ли злоумышленник традиционное технологическое понятие доступа или авторизации.
Сводка по сбоям, вызванным намерением
|
|
|
|
|
|---|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Сводка непреднамеренных сбоев
|
|
|
|
|---|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
Сведения об умышленных сбоях
| Сценарий # | Класс атаки | Описание | Тип компрометации | Сценарий |
|---|---|---|---|---|
| 1 | Атаки пертурбации | При атаках стиля пертурбации злоумышленник незаметно изменяет запрос, чтобы получить нужный ответ. | Целостность | Изображение: шум добавляется к изображению рентгеновских лучей, что заставляет прогнозы переходить от нормального сканирования к аномальному [1][Blackbox] Перевод текста: определенные символы обрабатываются, чтобы привести к неправильному переводу. Атака может подавлять определенное слово или даже удалять слово полностью[2][Blackbox и Whitebox] Речь: Исследователи показали, как, имея звуковую волну речи, другой волновой сигнал может быть точно воспроизведен, но транскрибируется в совершенно другой текст[3][Белый ящик, но может быть расширен до черного ящика] |
| 2 | Нападения на отравление | Цель злоумышленника заключается в том, чтобы загрязнить модель компьютера, созданную на этапе обучения, чтобы прогнозы на новых данных были изменены на этапе тестирования. Целевой: в целевых атаках на отравление злоумышленник хочет неправильно классифицировать конкретные примеры Неизбирательный: цель заключается в том, чтобы вызвать эффект, аналогичный DoS атаке, который делает систему недоступной. |
Целостность | В медицинском наборе данных, где цель заключается в прогнозировании дозы антикоагулянта Варфарина на основе демографических данных и других факторов, исследователи внедрили вредоносные образцы с 8% уровнем отравления, в результате чего доза для половины пациентов изменилась на 75,06%[4][Blackbox] В чат-боте Тай будущие беседы были искажены, потому что часть прошлых разговоров использовалась для обучения системы через обратную связь[5] [Blackbox] |
| 3 | Инверсия модели | Частные функции, используемые в моделях машинного обучения, можно восстановить | Конфиденциальность; | Исследователи смогли восстановить частные обучающие данные, использованные для обучения алгоритма [6]. Авторы смогли реконструировать лица, используя только имя и доступ к модели, до такой степени, что работники Amazon Mechanical Turk могли использовать фотографию для опознавания личности в выборке с точностью до 95%. Авторы также смогли извлечь конкретную информацию. [Whitebox и Blackbox][12] |
| 4 | Атака на определение принадлежности | Злоумышленник может определить, является ли данная запись данных частью обучающего набора данных модели или нет. | Конфиденциальность | Исследователи смогли предсказать основную процедуру пациента (например, хирургическое вмешательство, которое пациент перенес) на основе атрибутов (например, возраст, пол, больница)[7][Blackbox] |
| 5 | Кража модели | Злоумышленники воссоздают базовую модель, законно запрашивая модель. Функциональные возможности новой модели совпадают с функциональностью базовой модели. | Конфиденциальность | Исследователи успешно эмулировали базовый алгоритм из Amazon, BigML. Например, в случае BigML исследователи смогли восстановить модель, используемую для прогнозирования того, должен ли кто-то иметь хороший или плохой кредитный риск (немецкий набор данных кредитной карты) с использованием 1150 запросов и в течение 10 минут[8] |
| 6 | Перепрограммирование глубоких нейронных сетей | С помощью специально созданного запроса от злоумышленника системы машинного обучения можно перепрограммировать в задачу, которая отклоняется от первоначального намерения создателя. | Целостность, доступность | Показано, как ImageNet, система, используемая для классификации одного из нескольких категорий изображений, была перепрофилирована для подсчета квадратов. Авторы заканчивают документ гипотетическим сценарием: злоумышленник отправляет изображения Captcha классификатору компьютерного зрения в облачном фотохостинге, чтобы решить капчи и создать спам-аккаунты[9] |
| 7 | Противоположный пример в физической области | Состязательный пример — это ввод или запрос от вредоносной сущности, отправленной с единственной целью ввода в заблуждение системы машинного обучения, которые могут проявляться в физическом домене. | Целостность | Исследователи 3D печатают винтовку с пользовательской текстурой, которая обманывает систему распознавания изображений, заставляя думать, что это черепаха[10] Исследователи создают солнцезащитные очки с дизайном, который теперь может обмануть системы распознавания изображений, и больше не распознать лица правильно[11] |
| 8 | Вредоносные поставщики машинного обучения, которые могут восстановить обучающие данные | Вредоносный поставщик машинного обучения может запрашивать модель, используемую клиентом, и восстанавливать обучающие данные клиента | Конфиденциальность | Исследователи показывают, как вредоносный поставщик представляет внутренний алгоритм, в котором восстанавливаются частные данные обучения. Они смогли восстановить лица и тексты, имея только модель. [12] |
| 9 | Атака на цепочку поставок машинного обучения[13] | Из-за больших ресурсов (данных и вычислений), необходимых для обучения алгоритмов, текущая практика заключается в повторном использованию моделей, обученных крупными корпорациями, и немного изменять их для задач (например, ResNet является популярной моделью распознавания изображений от Майкрософт). Эти модели курируются в зоопарке моделей (Caffe размещает популярные модели распознавания изображений). При этой атаке злоумышленник атакует модели, размещенные в Caffe, тем самым отравляя ситуацию для остальных. | Целостность | Исследователи показывают, как злоумышленник может проверить вредоносный код в одной из популярных моделей. Ничего не подозревающий разработчик машинного обучения загружает эту модель и использует ее как часть системы распознавания изображений в своем коде [14]. Авторы показывают, как в Caffe существует модель, чей хэш SHA1 не совпадает с дайджестом авторов, указывая на подделку. Существует 22 модели без хэша SHA1 для проверки целостности вообще. |
| 10 | Бэкдор в машинном обучении | Как и в сценарии атаки "Цепочка поставок машинного обучения", в этом сценарии процесс обучения либо полностью, либо частично передается на аутсорсинг злоумышленнику, который хочет предоставить пользователю обученную модель, содержащую бэкдор. Зломанная модель будет хорошо работать на большинстве входных данных (включая входные данные, которые конечный пользователь может использовать в качестве валидационного набора), но вызвать целевые ошибки классификации или снизить точность модели для входных данных, удовлетворяющих некоторому секретному свойству, выбранному злоумышленником, которое мы будем называть триггером бэкдора. | Конфиденциальность, целостность | Исследователи создали классификатор дорожных знаков США со встроенной лазейкой, который идентифицирует знак остановки как ограничение скорости, только когда специальная наклейка добавляется на знак остановки (триггер backdoor) 20. Они теперь расширяют эту работу на системы обработки текста, где триггером является акцент говорящего[15]. |
| 11 | Задействовать зависимости программного обеспечения системы машинного обучения | В этой атаке злоумышленник не управляет алгоритмами. Вместо этого использует традиционные уязвимости программного обеспечения, такие как переполнение буфера. | Конфиденциальность, целостность, доступность, | Злоумышленник отправляет поврежденные входные данные в систему распознавания изображений, которая приводит к неправильной классификации путем использования ошибки программного обеспечения в одной из зависимостей. |
Сведения о непреднамеренных сбоях
| Сценарий # | Класс атаки | Описание | Тип компрометации | Сценарий |
|---|---|---|---|---|
| 12 | Вознаграждение взлома | Системы обучения с подкреплением действуют непреднамеренным образом вследствие несоответствия между указанным и истинно предполагаемым вознаграждением. | Безопасность системы | Огромный корпус игровых примеров в ИИ был скомпилирован здесь[1] |
| 13 | Побочные эффекты | Система RL нарушает среду, когда она пытается достичь своей цели | Безопасность системы | Сценарий, подробные сведения от авторов в [2]: "Предположим, что дизайнер хочет агента RL (например, нашего робота очистки) достичь какой-то цели, как перемещение коробки с одной стороны комнаты на другую. Иногда наиболее эффективным способом достижения цели является выполнение чего-то не связанного и разрушительного для остальной части окружающей среды, как стук над вазой воды, которая находится в пути. Если агент получает вознаграждение только за перемещение коробки, то, вероятно, он опрокинет вазу. |
| 14 | Смены распределения | Система тестируется в одной среде, но не может адаптироваться к изменениям в других типах среды. | Безопасность системы | Исследователи обучили два современных агента RL, Rainbow DQN и A2C, в симуляции, чтобы избежать лавы. Во время обучения агент RL успешно избежал лавы и достиг своей цели. Во время тестирования они немного переместили положение лавы, но агент RL не смог её избежать [3] |
| 15 | Естественные враждебные примеры | Система неправильно распознает входные данные, обнаруженные с использованием жесткого отрицательного интеллектуального анализа данных | Безопасность системы | Здесь авторы показывают, как с помощью простого процесса жесткого отбора отрицательных примеров[4] можно запутать систему машинного обучения, передавая пример. |
| 16 | Распространенная коррупция | Система не может обрабатывать распространенные повреждения и возмущения, такие как наклон, масштабирование или шумные изображения. | Безопасность системы | Авторы[5] показывают, как распространенные повреждения, такие как изменения яркости, контрастности, добавление тумана или шума к изображениям, приводят к значительному снижению метрик в распознавании изображений. |
| 17 | Неполное тестирование в реалистичных условиях | Система машинного обучения не тестируется в реалистичных условиях, в которых она должна работать в | Безопасность системы | Авторы в [25] подчеркивают, что, хотя защитники обычно учитывают надежность алгоритма машинного обучения, они упускают из виду реалистичные условия. Например, они утверждают, что отсутствие знака остановки, снесённого ветром, более реалистично, чем попытка злоумышленника изменить входные данные системы. |
Благодарности
Мы хотели бы поблагодарить Эндрю Маршалла, Магнуса Нюстрёма, Джона Уолтона, Джона Ламберта, Шэрон Сиа, Энди Комиссонеру, Эмре Кицимана, Джугала Париха, Шэрон Гиллетт, членов комитета Microsoft по ИИ и этике в инженерии и исследованиях (AETHER) по вопросам безопасности, Амара Ашара, Сэмюэля Клейна, Джонатана Зиттрейна, членов Рабочей группы по безопасности ИИ в Беркман Кляйн за предоставление полезных отзывов. Мы также хотели бы поблагодарить рецензентов от 23 внешних партнеров, организации стандартов и государственных организаций за формирование таксономии.
Список литературы
[1] Li, Guofu и др. "Вопросы безопасности: опрос по состязательному машинному обучению". arXiv preprint arXiv:1810.07339 (2018).
[2] Chakraborty, Anirban, et al. "Состязательные атаки и обороны: опрос". arXiv preprint arXiv:1810.00069 (2018).
[3] Ортега, Педро и Вишал Майни. "Создание безопасного искусственного интеллекта: спецификация, надежность и уверенность". Блог по исследованиям глубокой безопасности DeepMind (2018).
[4] Amodei, Dario, et al. "Конкретные проблемы в безопасности ИИ". arXiv preprint arXiv:1606.06565 (2016).
[5] Шанкар Сива Кумар, Рам и т. д. "Закон и состязательное машинное обучение". arXiv preprint arXiv:1810.10731 (2018).
[6] Кало, Райан и др. "Является ли обман робота взломом?" Научная работа Школы права Университета Вашингтона 2018-05 (2018).
[7] Paschali, Magdalini, et al. "Обобщаемость против надежности: состязательные примеры для медицинской визуализации". arXiv preprint arXiv:1804.00504 (2018).
[8] Ебрахими, Джавид, Даниэль Лоуд и Деджинг Ду. "О враждебных примерах для символьно-уровневого нейронной машинного перевода". arXiv preprint arXiv:1806.09030 (2018)
[9] Карлини, Николас и Дэвид Вагнер. "Звуковые состязательные примеры: целевые атаки на речь в тексте". ArXiv preprint arXiv:1801.01944 (2018).
[10] Jagielski, Мэтью, и др. "Управление машинным обучением: атаки отравления и контрмеры для регрессионного обучения". arXiv preprint arXiv:1804.00308 (2018)
[11] [https://blogs.microsoft.com/blog/2016/03/25/learning-tays-introduction/]
[12] Фредриксон М, Jha S, Ristenpart T. 2015. Атаки инверсии модели, которые используют сведения о достоверности и базовые контрмеры
[13] Шокри Р, Стронати М, Песня С, Шматиков В. 2017. Атаки по извлечению информации о принадлежности к обучающим данным в моделях машинного обучения. В Материалах 2017-го симпозиума IEEE по безопасности и конфиденциальности (SP), Сан-Хосе, штат Калифорния, 22–24 мая 2017 года, стр. 3–18. Нью-йорк, нью-йорк: IEEE.
[14] Трамер, Флориан и др. "Кража моделей машинного обучения с помощью API прогнозирования". Семинар по безопасности USENIX. 2016.
[15] Эльсейд, Гэмелдин Ф., Ян Гудфеллоу и Джаша Соха-Дикштейн. "Состязательное перепрограммирование нейронных сетей". arXiv preprint arXiv:1806.11146 (2018).
[16] Алали, Аниш и Илья Суцкевер. Синтезирование надежных состязательных примеров. arXiv preprint arXiv:1707.07397(2017)
[17] Шариф, Махмуд и др. "Состязательные генеративные сети: атаки с использованием нейронных сетей на передовое распознавание лиц". arXiv preprint arXiv:1801.00349 (2017).
[19] Сяо, Киксуэ и др. "Риски безопасности в реализации глубокого обучения". arXiv preprint arXiv:1711.11008 (2017).
[20] Гу, Тианю, Брендан Долан-Гавитт и Сидхарт Гарг. "Badnets: выявление уязвимостей в цепочке поставок модели машинного обучения". arXiv preprint arXiv:1708.06733 ( 2017)
[21] [https://www.wired.com/story/machine-learning-backdoors/]
[22] [https://docs.google.com/spreadsheets/d/e/2PACX-1vRPiprOaC3HsCf5Tuum8bRfzYUiKLRqJmbOoC-32JorNdfyTiRRsR7Ea5eWtvsWzuxo8bjOxCG84dAg/pubhtml]
[23] Amodei, Dario и др. "Конкретные проблемы в безопасности ИИ". arXiv preprint arXiv:1606.06565 (2016).
[24] Лейк, Ян, и др. "AI safety gridworlds". arXiv preprint arXiv:1711.09883 (2017).
[25] Гилмер, Джастин и др. "Мотивируя правила игры для исследования состязательных примеров". arXiv preprint arXiv:1807.06732 (2018).
[26] Хендрикс, Дэн и Томас Дитерич. "Тестирование надежности нейронной сети для распространенных повреждений и возмущений". arXiv preprint arXiv:1903.12261 (2019).