Борис_ь с ml
2.33K subscribers
168 photos
4 videos
10 files
151 links
Машинное обучение и информационная безопасность: синергия сегодняшнего дня.
И немного личного

Мнение автора != мнение компании, где автор работает

На некоммерческой основе

Папка с каналами по AISec:

https://t.iss.one/addlist/l9ZMw7SOW9hjYzUy

+ @mlsecfeed
Download Telegram
ИИ/ML-специалисты в ИБ
#ai #hr

Аналитики МТС RED выяснили, что спрос на ИБ-специалистов, имеющих навыки работы с технологиями искусственного интеллекта, в 2023 г. вырос на 30% по сравнению с предыдущим годом, а с 2020 г. число таких вакансий увеличилось в 3,5 раза. В 2024 г. тренд продолжается – по итогам I квартала 2024 г. навыки работы с ИИ стали требоваться в два раза чаще, чем в начале 2023 г.


Чтобы сделать какие-то свои выводы, решил сделать пару графиков. На первом просто визуализация по вакансиям как есть, а вторая - корреляция данных по спросу на ИБ-технологии с данными по спросу на ml технологии. Если квадратик темный - то значит динамика одного набора чисел не связана с динамикой другого, и наоборот. Тут в данном случае можно сделать косвенный вывод о том, например, что промпт-инжиниринг больше всего нужен вкупе с навыком анализа матриц MITRE. А классический ml наоборот, слабо коррелирует с данным навыком. У NLP топ 3 варианта скиллов, которым он сопутствует, по порядку убывания: поиск уязвимостей, автоматизация СЗИ и ИБ.

Жаль правда, что нигде не опубликована методология этого исследования.

источник 1
, источник 2
🔥1
AISEC map
#иб_для_ml

Мой товарищ Артем Семенов (pwnai) недавно выпустил замечательную дорожную карту развития специалиста по безопасности ml. Она наполнена упоминаниями различных навыков, инструментов, нормативных документов, важных событий и просто полезными ссылками по теме. Проведена градация по уровням сложности, а также по категориям знаний - чисто ml, чисто безопасность, средства безопасности ml и атаки/пентест ml. В общем, база.

P.S. Мне даже довелось внести вклад в развитие этого документа)

Источник
Карта
👍7🔥1
Дайджест событий по безопасности ml в России
#иб_для_ml #ml_для_иб

1. AiSEC-2024
23-24 апреля (прошел недавно) - онлайн
https://sec-event.ru/a_i/
Программа форума сфокусирована на вопросах взаимного влияния безопасности бизнеса и искусственного интеллекта. Мы рассмотрим возможности современных AI-технологий для обеспечения корпоративной защиты компаний, а также обсудим связанные с этим новые угрозы и методы борьбы с ними.


2. PHD Fest 2 - AI Security Track
23-26 мая - онлайн и оффлайн в Москве, "Лужники"
https://phdays.com/forum/
Применение ИИ в кибербезе, машинное обучение и когда уже нас всех заменят роботы — обсуждаем в рамках трека AI Security

Ожидается много интересных докладов, в том числе будут громкие презентации и в сфере безопасности ml.

3. Технологии Доверенного Искусственного Интеллекта, 2й форум
27 мая - оффлайн в Москве, кластер "Ломоносов"
https://ib-bank.ru/trust-ai/
Участие в работе форума примут представители профильных государственных ведомств (НТЦ ЦК, ИСП РАН, Академия Криптографии, ФСТЭК, Минцифры), ведущие исследователи в области технологий ИИ и машинного обучения, криптографии и информационной безопасности, а также специалисты ведущих технологических компаний, реализующих успешные проекты в области ИИ.

Был на прошлогоднем форуме, было суперинтересно. На этом будут треки и про безопасность ИИ, и про применение ИИ для решения задач ИБ, и про атаки на ИИ. Программа в свободном доступе тут.
👍6
С Праздником Победы, коллеги!

Вечная память, воинская сила духа и несгибаемая воля всегда в наших сердцах.
👍5🎉32❤‍🔥2👎1
Forwarded from PWN AI (Boris Protoss)
Атаки на машинное обучение. Часть 1

#️⃣В практике это словосочетание встречается, как правило, в двух случаях - когда речь об эксплуатации уязвимостей ПО, применяющегося в процессах MLOps, и когда у LLM вызывают определенную вредоносную для владельцев или остальных пользователей реакцию при помощи специализированных запросов.

#️⃣В первом виде атак, называемых иногда периферийными (1), или supply chain атаками (2), именно искусственный интеллект и машинное обучение, на самом деле, как-то характерно процесс взлома системы не меняют. С prompt injections (или jailbreaks) в контексте LLM же суть заключается именно в специфичных способах нарушения основных свойств безопасности информации - конфиденциальности данных, составляющих обучающую выборку (классика 2021 года + гит к ней), целостности самой модели путем приведения ее к деградации в результате отравления данных обучающей выборки (статья с neurips 2023).

#️⃣Но разве эти подходы релевантны исключительно для LLM?.. Нет, и говорят об этом мало. На то есть причина - кроме как научно-практических кейсов (3), зафиксированных случаев реализации таких атак нет. Они слишком сложны, или или еще слабо изучены; неизвестно. Но оставлять без внимания эту область точно нельзя, потому что классическое машинное обучение уже без сомнения получило значительное распространение, а теоретическую возможность провести на него атаку уже расписали и доказали не раз и не два (и не три).

О природе и причинах вообще существования таких атак будет (может быть) в следующем посте, а пока давайте вообще разберемся, как же все таки определяется атака на машинное обучение? Те, которые иногда еще называют состязательными (adversarial attack) атаками (тут); атаками на объективность (fairness attack) или алгоритмическими (тут).

➡️Из отчета HL по угрозам AI за 2024 год (2), опять же, следует, например, такое определение (перев. авт.) -
действия, нацеленные на изменение поведения ИИ, уклонения от обнаружения с помощью ИИ, или кража сведений о технологической основе ИИ.
Это определение хорошо подсвечивает цель атаки, но совершенно не затрагивает суть явления.

➡️Один из основоположников adversarial ml, всем известный созданием генеративных состязательных сетей Ian Goodfellow, в 2014 году определяет атаку на мл как:
предоставление на вход (инференса) модели таких данных, что можно с высокой вероятностью утверждать, что ответ/прогноз модель в результате даст неверный.


Эти данные названы adversarial examples
в его статье.

➡️ Отлично, здесь уже говорится о характере влияния на модель. Расширяет и дополняет этот подход предлагаемая исследователями из института BIML таксономия атак на машинное обучение (1). Так, они выделяют:
три поверхности атаки на машинное обучение - данные обучения, сама модель, и входные данные на инференсе.

Целей при этом у атак может быть две: скомпрометировать конфиденциальность информации путем ее извлечения (extraction) и нарушить целостность информации какими-то манипуляциями с ней (manipulation).


➡️ Существует в этом вопросе и одна довольно устоявшаяся парадигма - которая постулирует, что атак на мл в общем случае существует четыре вида: poisoning, evasion, inversing (или backdooring) и extraction (или theft) (2, 4, 5).

Продолжение в части 2.

@borismlsec
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from PWN AI (Boris Protoss)
Атаки на машинное обучение. Часть 2

Ложится ли эта четверка атак в названные выше определения? Они ведь как будто все об одном и том же, но в то же время с разных ракурсов всё. Пройдемся по ним внимательно.

Итак,
➡️poisoning - по сути своей ни что иное как манипуляция над данными обучения (кстати, в случае с RL они еще и данными на вход инференса будут), по цели - нарушение целостности модели
➡️evasion - манипуляция над данными входа инференса с целью нарушения... а вот тут свойство информации не притянешь, мне кажется. И здесь, я думаю, поможет формулировка из отчета HL про обман системы проверки чего-то на основе мл. Последствия могут быть хоть вплоть до физического проникновения злоумышленников на объект в случае успешной атаки типа evasion на компьютерное зрение видеокамер СКУДа.
➡️inversion - data extraction, нарушение конфиденциальности данных обучения.
➡️extraction - model extraction, очевидно, с целью нарушения конфиденциальности данных о модели. Например, кража ее гиперпараметров (статья).

#️⃣Проанализируем приведенные определения, и заметим, что объектом воздействия, компоненты безопасности которых могут быть нарушены, является либо обучающая выборка, либо сама модель. При этом точкой входа атаки не обязательно является этот же самый объект. Например, при отравлении данных точка входа - обучающая выборка, а объект воздействия - модель. При инверсии точкой входа становится объект входных данных, модель выступает как промежуточное звено атаки, а настоящей целью являются обучающие данные. Модель как бы тоже является объектом воздействия, но косвенным, так как цель атаки лежит не в ней.
Не столь популярны, но тем не менее существуют, атаки типа input extraction, релевантные для систем с конфиденциальными входными данными при эксплуатации модели. Например, по свертке изображения лица в системе распознавания лиц может быть возможно восстановить лицо исходное. При этом необходимо иметь возможность подавать модели пары (свертка целевого изображения, свертка зловредного изображения-слепка), на что она будет возвращать свою уверенность в идентичности этих изображений (статья).

#️⃣Такой еще интересный вопрос возникает - существуют ли атаки, где непосредственной точкой входа являются сами модели? Здесь вспоминается, например, исследование EvilModel китайских специалистов, в котором в веса AlexNet был встроено вредоносное ПО так, что качество модели упало менее чем на 1% (статья). Однако даже исследований например на тему ручного воздействия на обученные веса нейросетей, или подмены каких-то отдельных решающих правила decision tree, с целью незаметно ухудшить качество модели, я не нашел. Конечно, это whitebox атака, но нельзя исключать возможность проникновения нарушителя сначала традиционными методами в закрытый контур как раз таки с целью "подправить" модель. Или атака через точечное изменение гиперпараметров модели с той же самой целью ухудшить ее результаты на инференсе. Похоже, время для таких атак еще не пришло.

#️⃣К чему же свести все вышеперечисленные наблюдения и подходы? Так, чтобы получить емкое и полное определение атаки, не вызывающее чувства сомнения?..
Возьму на себя смелость сформулировать, в итоге, два определения. Краткое и полное.

➡️Краткое
Атака на машинное обучение - это либо прямые воздействия в виде манипуляции данными либо обучающими, либо входными, либо косвенные манипуляции самой моделью, целью которых является нарушение целостности или конфиденциальности данных, модели или процесса ее функционирования.

➡️Полное
Атака на машинное обучение - это прямое или косвенное вредоносное воздействие на обучающие данные модели, внутренние зависимости/гиперпараметры модели или входные данные инференса модели, имеющее целью нарушение доступности или целостности информации, как либо связанной с моделью, или с целью изменить поведение модели для создания возможности совершения дальнейших вредоносных действий.


@borismlsec
Please open Telegram to view this post
VIEW IN TELEGRAM
#иб_для_ml
Как раз в дополение к публикации выше.
На RSAC, которая была во многом посвящена ИИ 🧠, эксперты задавались вопросами о том, насколько можно доверять моделям ИИ и как их защищать от различных атак. Вот одна из матриц оценки рисков для публичных, частных, но выложенных в паблик, и закрытых моделей машинного обучения. Чем-то похожа на баталии сторонников open source и проприетарного ПО ⚔️

Поэтому в тему еще один анонс с RSA - Cloud Security Alliance 🌦 выпустил 4 руководства по внедрению ИИ:
AI Organizational Responsibilities - Core Security Responsibilities,
AI Resilience: A Revolutionary Benchmarking Model for AI
Principles to Practice: Responsible AI in a Dynamic Regulatory Environment
Confronting Shadow Access Risks: Considerations for Zero Trust and Artificial Intelligence Deployments
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Новости AI safety - рассылка
#иб_для_ml #ai

https://newsletter.mlsafety.org/

Центр общественных рисков ИИ (американский) запустил рассылку новостей по своей тематике. Рассказывают про выравнивание (alignment) (поведения ИИ с человеческими целями), подсвечивают различные статьи про атаки на машинное обучение, исследования в области устойчивости языковы моделей и много чего еще.
Сведения по использованию ML в ИБ // RSAC 2024
#ml_для_иб
Источник

Достаточно полный список задач, имеющих практические решения с использованием машинного обучения. Приставку Gen в заголовке действительно стоило бы убрать - она имеет отношение лишь к некоторым из приведенных примеров.
И на отдельных вещах я хотел бы заострить внимание:
#️⃣Configuration Drift. Интересно, что на последних конференциях в России эта тема тоже начала звучать - Левшун Д. (СПбГУТ и СПб ФИЦ РАН) на РусКрипто 2024 выступил с докладом "Прогнозирование уязвимостей в устройствах Интернета вещей", и на грядущем PHDays от него ожидается доклад по этой тематике.
#️⃣Compliance violation monitoring. Скорее всего данная задача попадает в область NLP, и в данном контексте интересно было бы подискутировать, используется ли например RAG для поиска "нарушенных"/не выполненных требований нормативных документов по безопасности. Если у кого-то есть, чем поделиться на эту тему, велкам в комментарии. Мне кажется, схожие подходы могут быть и для подбора рекомендаций по реагированию/расследованию инцидентов (только тут - подбор сопоставление мер и требований).
#️⃣Что наверняка является в этом списке Gen AI, так это: Attack Simulation, Automated report generation, Event Log и Incident Summarization, Forensic analysis и Recommendations for action/remediation 50 на 50, и Chatbot конечно же. С появлением LLM какие-то из этих тем получили новое развитие, а какие-то и вовсе зародились.

На тему эффективных способов вкрутить машинное обучение в ИБ несколько месяцев назад был отличный отчет от Google, про который я писал в посте про мл-компетенции.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5🔥1
AI Security Framework от Snowflake
#иб_для_ml

Ссылка на статью по системе

О чем документ
Об угрозах, которые существуют для систем с ИИ. Каждая угроза из перечисляемых в отчете имеет свою категорию или ассоциированный актив, область риска (по сути информация или ее свойство, подвергаемые риску) и причины возникновения. Помимо этого, к каждой угрозе они приводят возможный ущерб и примеры, а также дают рекомендации по снижению таких рисков.
Приведены такие угрозы, как, Утечка тренировочных данных (Training Data Leakage), Конфиденциальность данных (Privacy, имеется в виду угроза inference-атаки доступа к обучающим данным через модель), Неточность модели (Bias, то есть способность ошибаться в критичных ситуациях), и еще 16 других.

Даже такое есть
Sponge samples
Угроза возникновения атаки, заключающейся в попадании в модель таких входных данных, что значительно увеличат ее потребление энергии и время на вычисление ответа.
Последствия - значительное падение качества всех ответов мл-сервиса, производительности вплоть до отказа в обслуживании, а также возможность комбинировать эту технику с другими атаками для усиления их эффекта (например, с evasion-атакой)
Пример атаки - чатбот (прим. авт.: например ассистент в банковском приложении) на основе языковой модели, в которого злоумышленник может закинуть что-то очень большое или сложное.
Меры защиты - валидация инпута, троттлинг аппаратуры мл-сервиса, обучение модели на "плохих" примерах.

Плюсы и минусы
Формализация угроз, полнота их описаний, наличие примеров и мер предотвращения
Легкий "порог вхождения" за счет простой организации документа
Наличие ссылок на научные статьи и некоторые кейсы атак на ПО, LLM-модели и данные
Все еще отсутствие ссылок на реальные кейсы атак на машинное обучение
Ориентировка на конкретные угрозы подвержена устареванию
Нет представления способа использования конкретных инструментов хотя бы в рамках своего облака для реализации предлагаемых к каждому риску защитных мер (как в DASF, например)

Мое личное мнение - полезный фреймворк.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥2
#праздное
ml-специалист в ИБ обычно на стороне защиты, но когда он меняет сторону...
😁3😈1
Защита от краж моделей ИИ
#ml_для_иб

Интереснейшая заметка о разработанном AIRI + Сколково + ИСП РАН методе идентификации украденных моделей.

Актуальность
Раз подобное исследование было проведено, то у него есть заказчики, которым оно актуально. Выход области алгоритмической безопасности машинного обучения потихоньку все значительнее.

Значимое достижение
Погрузимся немного в суть. При краже модели нарушитель некоторым образом подготавливает на своей стороне модель так, что она максимально хорошо имитирует целевую. Основа атаки - возможность как минимум видеть ответ целевой модели на те или иные входные данные. И если по общему качеству "скопированная" модель будет близка, то на конкретных примерах ответы оригинала и копии совершенно не факт что сойдутся.
Методы "водяного знака" направлен привить модели свойство отвечать определенным заранее известным образом на известные входные данные, лакмусовая бумажка, попросту говоря.
Большинство подобных методов маркировки моделей содержат существенный недостаток –– поведение водяных знаков плохо сохраняется в процессе процедуры кражи с атакой на функциональность.

Разработанный учеными AIRI подход дает вероятностную гарантию на сохранность реакции модели на водяные знаки в копиях модели, достаточно близких к оригинальной, в этом и есть его особенность.

Персоналия
Информацию о методе в заметке предоставляет Олег Рогов, кандидат физико-математических наук, руководитель научной группы «Доверенные и безопасные интеллектуальные системы» Института AIRI.

Публикация
Ознакомиться со статьей с описанием метода, принятой на IJCAI-2024, можно тут: https://arxiv.org/pdf/2401.08261
Гитхаб проекта: https://github.com/AIRI-Institute/PROWN/tree/main
👍1
Интерактивная карта навыков для ML-разработчиков
#ml_для_иб #hr

Ссылка

Взаимоувязанные и размещенные в пространстве близости по общему контексту упоминаний основные понятия из современного машинного обучения. Гладкий и удобный интерфейс, имеется углубленная детализация, взаимосвязи для обогащения предложенных понятий.

Кому и зачем ее можно использовать? Тем более в ИБ?
1. Вы мл-разработчик, инженер или аналитик данных в ИБ-компании. Если вы исследуете новую область мл, или вообще только погружаетесь в область, или вам нужно какое-то свежее решение для неподдающейся задачи - эта штука вам поможет. Для целевого запроса здесь есть прямой поиск по терминам и ключевым словам.
2. Вы руководитель
, которому нужно нанять такого специалиста. У вас скорее всего есть общее понимание области, и эта карта поможет в нем удостовериться и укрепить. Да и просто пройдя по алгоритму "какие задачи мне нужно закрыть?" → "какие библиотеки/понятия основные в области этих задач?"→"знаком ли кандидат с этими вещами, имеет ли в них опыт?", можно хоть как-то идентифицировать навыки нужного человека.
3. Вы преподаватель / вам нужно подготовить доклад. В общем человек, которому нужно разъяснить слушателям основные понятия этой сферы знаний. Карта поможет их расставить по полочкам. И проверить себя, не упустили ли вы что-то при подготовке материала.

ℹ️До этого я уже затрагивал этот вопрос. Здесь я рассказываю про то, кто такой мл-разработчик, инженер данных и далее по тексту. Во другом посте я анализирую исследование рынка специалистов по ИИ в кибербезопасности. Совмещая эти сведения, картина понимания навыков, требуемых для решения задач ИБ с помощью машинного обучения, становится еще более полной.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1🔥1
NLP!
В ИБ - полезен.
Но как разобраться?..
Часть1.

#ml_для_иб

Начнем издалека, и подойдем к практике в конце)
Что это - NLP? Natural Language Processing - обработка естественного языка. Говоря кратким образом, обработка заключается в том, что слова очень хотелось бы представить в виде чисел, хоть как-то отображающих смысл, в этих словах заключенный. Смысл в словах, предложениях и целых текстах постулируется как разница между числами, векторами, матрицами. Развиваться область начала давно, аж с 1949 года. О ключевых вехах (text statistics, rnn, word2vec, ...) этого направления МЛ хорошо расписано тут (со ссылками на самые значимые статьи, доклады и релизы).

Как специалисту в мл начать путь в познании области NLP? Для начала - покопайтесь в математической лингвистике. Для чего и зачем делается лемматизация, приведение слов к нормальной форме, поиск стоп-слов в тексте, что такое токенизация и паддинг. После - я бы порекомендовал научиться считать слова. CountVectorizer из sklearn то бишь - вот первый шаг на этом пути. Далее следует TF-IDF, и некоторые надстройки над ним - например, выясните, зачем проводится L1 и L2 нормализация создаваемых этим алгоритмом весов. Отличную статью с NLP-алгоритмами в порядке усложнения можно найти на TowardsDataScience, но она под пейволом. Однако, при определенной ловкости рук с использованием этой ссылки, его можно обойти...

Следующим углублением в вопрос станет изучение в ручном режиме принципов работы первого и простейшего генератора эмбеддингов слов - Word2Vec от Google. Эмбеддинг - это вектор, обозначающий какую-то текстовую единицу - слово, словосочетание, текст целиком. И да, за вас это уже сделали вот в этой онлайн-таблице. Осталось только аккуратно повторить и разобраться. В ней также есть ссылка на статью на medium с разбором, обходить пейвол мы уже умеем.

Начало положено, в следующей части разовьем успех ссылочками на полезное по моделям эмбеддингов и LLM.
👍1
NLP!
В ИБ - полезен.
Но как разобраться?..
Часть 2.
#ml_для_иб

Визуальное
🔖Выращивание векторов слов Word2Vec прямо на глазах - демонстрация с кучей кнопочек, наглядно. И дополнительно статья, где объясняется феномен его работы.
🔖Google Model Explorer. Инструмент для анализа собственных разработок и их отладки.
🔖B. Bycroft LLM Visualization. Интерактивный учебник по устройству трансформеров и LLM на примере GPT-2 small, GPT-2 XL, nano-gpt и GPT-3.

Полный практический ликбез
Ноутбук на Kaggle с разбором Word2Vec, Glove, RNN, и до Seq2Seq, механизма внимания из трансформеров и BERT. Мощная теория, но без кода.

LLM
Помимо бесчисленных гайдов о том, что и как в них работает, обращу ваше внимание на пару важных вещей.
➡️Квантизация моделей. А точнее, их весов. Вот есть модель на миллиард параметров, 1B. А что есть параметр? - это число. Если это float64, он весит 8 байт, float32 - 4 байт. Таким образом, модель в зависимости от числового типа займет либо 500 или 1000 МБ - разница значительная. О том, как сжать веса модели и при этом сохранить по максимуму ее эффективность, отлично расписано тут. И я достаточно убежден, что это - ключ к развертыванию подобных больших моделей в контуре заказчика, как того требуют часто реалии рынка ИБ.
➡️Высочайшая схожесть эмбеддингов. Пробовали ли вы, например, с помощью SecureBERT сделать эмбеддинг фразы "base64 encoded suspicious powershell command content" и "serve the donuts warm for the best taste", а потом измерить расстояние от них до, например "windows malicious command"? Результат вас удивит - близость будет одинаковой и колебаться в районе 0.9 (косинусная). У этого есть причина, заключается она в анизотропности пространства отображения трансформеров, создаваемого ими в процессе обучения. Подробнее о том, что это и как с этим справиться, читайте здесь.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Forwarded from Data Secrets
Что тут у нас? Это же новая громкая статья от Anthropic про интерпретируемость модели!

Исследование просто взорвало комьюнити: в нем выясняется, что, затюнив какие-то вполне конкретные фичи, мы можем заставить LLM всегда писать уязвимый код, генерировать фишинг и др. Как это работает – выясняем в карточках.

Подробнее: сочный блогпост с визуализациями, статья.
👍3🔥2