Борис_ь с ml
2.33K subscribers
168 photos
4 videos
10 files
151 links
Машинное обучение и информационная безопасность: синергия сегодняшнего дня.
И немного личного

Мнение автора != мнение компании, где автор работает

На некоммерческой основе

Папка с каналами по AISec:

https://t.iss.one/addlist/l9ZMw7SOW9hjYzUy

+ @mlsecfeed
Download Telegram
В прошлое воскресенье случилась заключительная встреча в 2024 нашего дискуссионного клуба "Секреты Стаи Слонов" в Музее Криптографии

Тема дискуссии - Препарирование ИИ: как интерпретировать модели и зачем это для безопасности

Спикерский состав в этот раз был большой
🔘Илья Запорожец, эксперт по интерпретируемости ML
🔘Тимур Низамов, спецалист по редтимингу LLM, представитель команды Llamator.
🔘Григорий Маршалко, эксперт по безопасности данных и ML
А ведущая - уже известная вам Дарья Курнаева.

Обсудили множество интересных вещей. Я для себя сделал главный вывод - локальную (post hoc) интерпретацию можно использовать применительно к джейлбрейкам GenAI. Интерпретация будет позволять точечно обнаруживать причины некорректной генерации модели и либо их вычищать прям из весов, либо из обучающей выборки.

А еще меня очень порадовала живая вовлеченность аудитории. Слушатели очень часто становились сами практически спикерами, активно участвуя в развитии мысли обсуждения. Спасибо всем, кто пришел!)

Содержание дискуссии в тезисах:
🔘Интерпретируемость - это и про сверточные сети, и про языковые модели, и про классические модели, на подобие случайного леса, который итерпретировать достаточно легко.
🔘Белый ящик (вайтбокс), с точки зрения безопасности - когда все известно про атакуемую систему, наиболее комфортная для нарушителя позиция. Серый ящик - когда мы частично знаем атакуемую систему. Черный ящик (блэкбокс) - когда нарушитель ничего не знает про систему (Г. Маршалко).
🔘Бывает как вайтбокс интерпретация, так и блэкбокс. Обычно говорят, конечно про первую, особенно когда надо проанализировать знания модели целиком (т. н. глобальная интерпретация). Блэкбокс интерпретация - по факту инструмент кражи модели (И. Запорожец)
🔘Из аудитории подметили - белый ящик при достижении больших размеров - все равно что черный, с точки зрения доступа к знаниям модели (а не с точки зрения ИБ). Прямо как когда в большой корпорации становится слишком много документации.
🔘Мнения разделились на тему природы ИИ. Часть аудитории спикеров утверждали, что ИИ - не просто большая база данных, а проводит процесс создания абстракции из получаемой информации. Кто-то - что это просто вероятностный аппарат предсказания следующего слова (токена). Примечание: ситуация прямо как с корпускулярно-волновым дуализмом...
🔘Был интересный рассказ от Ильи про исследование Apple о супервесах модели. Далее цитата.
Эппл заострили свое внимание на mlp-слоях и смотрели, насколько отдельные веса или активации сильно влияют при их исключении на качество ответа модели. Другое исследование - майкрософт провели исследование, можно ли улучшить качество модели, при этом ее не дообучая. Они заменяли одни весовые матрицы другими, поменьше, специально аппроксимированными. И внезапно обнаружили, что качество при этом увеличивается. По сути произошло затирание мусорной информации из весов.
Также интересно наблюдать в области концептуальной интерпретируемости. LLM - существо многомерное, и в ней находятся вектора-концепты, проходящие по всем ее слоям. И эти вектора содержат конкретную информацию. И это направление называется representation_engineering. В нем анализируются активации. И в результате мы видим, как в результате цепочка активаций она принимает как раз так вид дерева, просто строящегося динамически под каждый ответ модели.

Илья даже показывал распечатанные графики)
🔘Тоже от Ильи о том, что такое полисемантичность
Это большой камень, на который нашла коса интерпретации ЛЛМ. Это когда один и тот же нейрон активируется на запросы совершенно разных тем. Потому что обучающие данные невозможно закодировать в непересекающихся векторах, потому что размер модели относительно размера обучающей выборки все таки многократно меньший.

🔘Злоумышленник может применить методы интерпретации, чтобы понять, как обойти этичное выравнивание модели и ее системный промпт.

Продолжение в комментариях)
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9👍1
Математическое моделирование рисков

#иб

Под конец года наконец-то вышла наша с Максимом Анненковым статья про технический подход к управлению рисками в организации.

В статье Максим писал о прикладных аспектах расчета рисков, о расчете возврата инвестиций, а я - математический блок. В нем я рассказываю про расчет потенциальных убытков компании на основе сугубо статистики событий информационной безопасности.

Идея - использовать байесовскую сеть и метод Монте-Карло. Но о паре вещей в тексте я не упоминаю.

В чем суть? и что я не сказал в статье
Первое - предлагаемый метод оценки позволит посчитать потенциальный ущерб в следующем временном периоде на основе анализа прошедшего. Стоит только уточнить, что такая оценка справедлива в рамках задаваемого доверительного интервала, например 2 или 3 σ.
Второе - стоит упомянуть, что сведения по потенциальному ущербу необходимо либо вводить руками, оценивая риски экспертно, либо на основе атрибуции рисков и активов (или бизнес-процессов). В результате атрибуция дает различные виды стоимости активов - простоя, восстановления, замещения и т.д. Можно считать стоимость риска через штрафы регуляторов, а можно и любым другим уникальным для каждого конкретного случая образом.

➡️ Если заинтересовало, предлагаю погрузиться в материал детальнее)
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥10
🎄 Поздравляю вас, уважаемые читатели моего канала!

#праздное #ml_для_иб #иб_для_ml

Подходит к завершению 2024 год, а на носу - год 2025, открывающий новую четверть 21 века.

Я уверен, профиль профессии и вообще жизни каждого из нас изменится неузнаваемо в ближайшие годы.
Поэтому я всем желаю в водовороте новых идей, событий, знакомств и задач не терять из виду свои интересы и ценности.
Это, наверное, одно из главных соображений, которое я извлек за этот год.

В 2024 году этот канал появился в публичном пространстве, и я благодарен каждому из вас, что проявили свой интерес к теме машинного обучения и информационной безопасности, присоединившись к каналу «Борис_ь с ml»!)

Постараюсь вас и впредь радовать интересной и снабжать полезной информацией!

А сейчас предлагаю вашему вниманию самые интересные сообщения в моем канале за этот год.

Дайджест 2024
🟢Первый пост в канале, новость о статье "LLM - размытый jpeg интернета".
🟣Заметка о компетенциях по анализу данных в ИБ в трех частях (1 - описание пайплайна, 2 - коротко о профессиях, 3 - виды машинного обучения)
🟡Дебаты на AM Talk (youtube) на тему заблуждений о безопасности ИИ для человечества. В дополнение этому я потом сделал пост об исследовании LASER от Microsoft (часть 1, часть 2). И позже вышла статья с расширенным содержанием дебатов на Cybermedia.
🔵Обзор фреймворка по безопасности ИИ от Snowflake
🟡Краткая заметка по статье о моносемантических группах нейронов от Anthropic
🟢Статья на habr об основных правилах визуализации
🟣Обзор фреймворка по безопасности ИИ от сингапурской AI Verify Foundation
🔵Подкаст на тему профессий в AI Security с Алисой и Артемом
🟡Репортаж с Turbo ML Conf 2024 на habr
🟣Статья на habr про реальные, а не вымышленные, инциденты из мира AI Security
🟢Обзор проекта приказа ФСТЭК в части безопасности ИИ
🟣Подкаст про AI Security в целом с Сергеем Poxek (и отдельно тайминги ссылок в видеозаписи)
🟡Пост про безопасность роботов под управлением LLM
🟣Мастер-класс с Артемом по атакам на умные колонки
🔵Важным событием стала для меня организация трех дискуссий в Музее Криптографии от имени сообщества Слономойка. Первая - о природе небезопасности ML, вторая - про атаки на безопасность LLM, и третья про интерпретацию LLM. Было очень интересно этим заниматься, и видеть искренний интерес к теме. Спасибо вам)
🟢Статья в трех частях про бесконечное внимание. Первая про трансформеры в целом, вторая о математике обычного внимания, и третья про новинки в самой статье от Google
🟣Статья про математическое моделирование рисков ИБ на habr

P.S. Большое спасибо Артему, Ане и Кате. Без вашей поддержки канала бы не было. А без Артема он бы еще и не получил такого развития)
Please open Telegram to view this post
VIEW IN TELEGRAM
13🎄6🔥3
🔥 Привет всем!

2025 год для канала начался очень даже хорошо - он преодолел отметку 500 читателей! Спасибо вам, друзья!

Я невероятно рад, что мой интерес и взгляд на будущее информационных технологий разделяют еще столько людей. Для меня это теперь ответственно - рассказывать вам о том, что происходит в мире информационной безопасности и искусственного интеллекта. Поэтому наполнение канала постараюсь держать как минимум на заданной планке и впредь

И не откладывая в долгий ящик, я представляю вам, читатели, первую публикацию в этом году - хабр-статья про интерпретацию ИИ.
Тема меня очень заинтересовала давно, и сначала вылилась в подкаст в Музее Криптографии. Но я понял, что сам еще многое не рассказал вам и не показал, так что сел за статью. В ней я разбираюсь, чем отличается интерпретируемость и объяснимость, и, как всегда, привожу море ссылок. Приятного чтения)

#иб_для_ml

➡️ https://habr.com/ru/articles/866628/
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11🔥42
Безопасность ИИ-агентов

#иб_для_ml #мысли

Примечание: в последнее время я понял, что застопорился на очень больших информационных материалах, из-за чего контент подолгу зависает. Чтобы увеличить динамику постов, попробуем новый формат - просто мои мысли по разным темам, без ссылок-источников.

Очень популярное сегодня направление работ - системы, производящие взаимодействие с внешней средой согласно заложенной в них цели. Реализуются, понятное дело, на GenAI-моделях. Избегаю термина LLM, так как модели как с мультимодальным входом, так и выходом, уже достаточно распространены.

Какие у них могут быть проблемы безопасности? Начать надо, как это принято в ИБ, с объектов защиты. Я выделяю следующие:
1. Безопасность ИИ-агента и его внутренних механизмов
2. Безопасность среды исполнения действий агента.

Каждый из них ветвится далее, но это уже частности, которые еще точно будут уточняться. Атака на агент может привести к его дисфункции, или утечке данных из его памяти. Это может быть целью атаки, но скорее всего конечной целью нарушителя должна быть среда исполнения агента. Например, украсть содержимое файла etc/passwd в среде исполнения функций агента, или переменные среды. Или, если агент может загружать картинки из интернета и открывать их пользователю, он может открыть и зараженный файл, который послужит полноценным событием initial access на устройство/в сеть.
Есть и еще один объект защиты, с которым я пока не до конца определился:
3. Безопасность взаимодействия ИИ-агентов.

Не определился о его самоботнытности: он отдельный, или включен в пункт 2 (приглашую здесь к дискуссии в комментариях). Здесь больше всего интересных кейсов. В результате взаимодействия со внешней средой один агент может подвергнут успешному джейлбрейку, и начать распространять вредоносную инструкцию дальше при общении с другими агентами. Эта логика будет переходить и модифицировать поведение агентов, пока не достигнет нужного агента, обладающего правами, например, работать с БД. Он прочитает нужную информацию, и по цепочке вернет это агенту, общающемуся с интернетом.

Про то, какие я вижу меры защиты для ИИ-агентов и мультиагентных систем, я напишу в другом посте.

Друзья, дайте пожалуйста знать, если вам по душе такой формат)
👍17❤‍🔥4👏3
Как оценивать джейлбрейки LLM
#ml_для_иб

В рамках безопасности языковых моделей с ростом зрелости процессов в какой-то момент встает вопрос об их автоматизации. А что есть автоматизация этого процесса? Генерация определенного набора атакующих промптов не вручную, но при помощи программы. И проверка ответов LLM, являющейся целью тестирования, тоже программой. И практически единственный способ реализации такой схемы - LLM как атакующий и LLM как оценщик. Многие blackbox-атаки сегодня используют такую компоновку.

Почему я об этом вспомнил?
Потому что мне попалась на глаза интересная статья про метрики оценки качества LLM (https://habr.com/ru/companies/yandex/articles/861084/).

Прочитав ее, на ум мне сразу же пришла аналогия с задачей оценки опасности ответа LLM (считай - качества джейлбрейка). Вот какие выводы я извлек из этой статьи:

1. Необходим бенчмарк не только для целевой модели на безопасность ее ответов, но и бенчмарк для оценщика ответов. И чтобы иметь надежную модель-оценщик, необходимо иметь собранный человеческими экспертами контрольный датасет оценок промптов на опасность/безопасность.

2. При использовании бенчмарка на результатах очередного тестирования нужно подмешивать в эти данные и контрольную выборку, чтобы контролировать качество оценщика, если вы не контролируете его состояние (по факту - используете предоставляемую по API модель).

3. Необходимо периодическое обновление контрольного датасета оценщика, так как атаки будут представлять давать модели все новые опасные инструкции, и необходимо быть уверенными, что наш инструмент "понимает", что они действительно опасные.

4. Когда модель-оценщик и целевая модель - это одна и та же модель, в Side-By-Side сравнении с "непредвзятой моделью" у нее появляется "нарциссизм", то есть оценщик предпочитает "свои" ответы ответам других моделей. В случае оценки безопасности ответов это может вылиться в то, что оценщик того же рода, что и целевая модель, будет завышать безопасность ответов оцениваемой модели.

В заключение скажу, что есть и специально дообученные под оценку модели. Среди них Llama Guard 3, Google ShieldGemma, IBM Granite Guardian, Protectai Prompt Guard, TrustSafeAI Attention Tracker.

Тем, кто занимается автоматизацией LLM Red Teaming, надеюсь, будет полезно.
👍91🔥1
Тренд безопасности AI-агентов
#иб_для_ml

Что есть сейчас, и к чему идет этот тренд? Развивается, но почему?
Захотелось рассказать, что думаю на этот счет, и услышать ваше мнение. Так что ниже будет опрос)

Что такое AI-агенты?
Про AI-агентов говорят очень много, но давайте взглянем в суть вещей. Что это? Есть широчайшие расхождения в данных понятиях, и пространные определения, но сойдемся на главном.
Первое: AI-агент - не GenAI-модель, это код (в обычном его понимании, да), который использует GenAI-модель.
Второе: у AI-агента может и не быть механизмов памяти, планирования, рефлексии и даже в целом какой-то целеустановки (читай, роли).
Третье: что у агента точно должно быть, так это возможность вызвать какие-то функции на основании сгенерированного GenAI-моделью ответа. При чем эти действия не должны в 100% случаев валидироваться людьми, иначе это уже не агент.

В чем риск AI-агентов?
Именно благодаря действиям к двум существующим эфемерным рискам добавится третий, уже далеко не эфемерный.
Первые два - это репутационный ущерб организации, если сервис с LLM торчит наружу, и нарушение бизнес-процессов при нарушении ожидаемой от ответов GenAI-модели логики. И то, и другое, может произойти как вследствие недостаточной AI Safety (модель сама выдала случайно некорректный ответ), так и в следствие недостаточной AI Security (нарушитель вызвал генерацию некорректного ответа).
А вот третий риск, специфичный для AI-агентов - это его возможность совершать действия, которые могут повлечь негативные последствия. И веер угроз тут огромен - от выгрузки за пределы контура конфиденциальной информации до загрузки зараженного файла внутрь этого контура, от случайного удаления файлов до перевода средств не на тот счет и не в том размере.

В заключение
Известно, что GenAI-модели как продукт - убыточная история, история без KPI. Затраты на разработку, дообучение (не говоря уж про претрейн) очень тяжело покрыть с доходов при интеграции модели в какие-то сервисы. Но, с точки зрения имиджа и в надежде на развитие прикладного использования, вложения продолжаются. С появлением же у GenAI-моделей способности влиять на мир вокруг, все изменится. Сначала (в 2025 году) появятся игрушечные агенты, которые будильник по расписанию ставят и товары по ТЗ в браузере находят. А спустя еще год, максимум два - они смогут и покупать найденные товары (и продавать ваши будильники, хехе...), иными словами - смогут манипулировать ограниченными ресурсами. И весь арсенал промпт-атак на GenAI обретет смысл, киллчейн достроится до конца. Тогда и начнется раздолье.
А про то, какие будут промпт-атаки, и почему произойдут первые инциденты в области AI Security, я расскажу в следующем посте)



P. S. Не удержался я все-таки, приведу одно хорошее исчерпывающее определение агента, чтобы было.
ИИ-агент - система на базе GenAI, способная планировать и совершать автономные действия во внешней среде, реагировать на изменения и взаимодействовать с человеком или другими агентами для достижения поставленных целей.

При чем интересно - одна половина определения (про автономность и достижение поставленных целей) - это определение просто агента из мат. моделирования 1970х годов. А другая половина (про планирование, реагирование и взаимодействие) - это уже интеллектуальный агент, концепция которых была развита М. Вулдриджем в 1990х годах.
👍10
ИИ-агенты для проведения пентеста

#ml_для_иб

Недавно занялся одной научной задачей, и собрал источники по автоматизированным пентест-агентам.

Получился неплохой список, которым я решил поделиться.

1. https://github.com/vxcontrol/pentagi
2. https://github.com/palisaderesearch/intercode
3. https://github.com/xvnpw/ai-security-analyzer
4. https://github.com/KHenryAegis/VulnBot
5. https://github.com/xbow-engineering/validation-benchmarks
6. https://github.com/gyoisamurai/GyoiThon

7. Link: Black-Box Detection of Cross-Site Scripting Vulnerabilities Using Reinforcement Learning https://github.com/WSP-LAB/Link https://www.researchgate.net/publication/360179780_Link_Black-Box_Detection_of_Cross-Site_Scripting_Vulnerabilities_Using_Reinforcement_Learning
8. Can LLMs Hack Enterprise Networks? Autonomous Assumed Breach Penetration-Testing Active Directory Networks - https://arxiv.org/pdf/2502.04227
9. Artificial Intelligence as the New Hacker: Developing Agents for Offensive Security - https://arxiv.org/abs/2406.07561v1
10. BreachSeek: A Multi-Agent Automated Penetration Tester https://arxiv.org/abs/2409.03789
11. HackSynth: LLM Agent and Evaluation Framework for Autonomous Penetration Testing https://arxiv.org/abs/2412.01778
12. LLMs as Hackers: Autonomous Linux Privilege Escalation Attacks https://arxiv.org/html/2310.11409v5
Introducing PenTest++: Elevating Ethical Hacking with AI and Automation https://arxiv.org/abs/2502.09484
13. D-CIPHER: Dynamic Collaborative Intelligent Agents with Planning and Heterogeneous Execution for Enhanced Reasoning in Offensive Security https://arxiv.org/html/2502.10931v1
14. Construction and Evaluation of LLM-based agents for Semi-Autonomous penetration testing https://arxiv.org/abs/2502.15506

Данная публикация носит исключительно научно-обзорный характер.

P.S. Спасибо Артем и Николай.

P. P. S. Параллельно я встретил еще несколько статей про генерацию фишинга
7👍3
Системы оценки критичности уязвимостей в AI Security
#иб_для_ml

Уязвимости в GenAI-системах - таинственное и неприступное понятие. Что это? Они вообще существуют? Существуют, конечно. Приглашаю к прочтению, если эта тема вас интересует. Расскажу, какие есть примеры уязвимостей (прям с CVE), и какие есть подходы к оценке их критичности.


▶️ https://habr.com/ru/articles/888048
Please open Telegram to view this post
VIEW IN TELEGRAM
150👏4
У верблюда два горба, потому что жизнь - борьба...
#иб_для_ml

Так возможно сказал Николас Карлини, так как сегодня вышла статья с его соавторством "🐫 Defeating Prompt Injections by Design". Остальной авторский коллектив этой статьи тоже серьезный - исследователи из Google и ETH Zurich.


Система защиты CaMeL

В этой работе представлена система защиты ИИ-агентов от промпт-атак CaMeL (расшифровывается как CApabilities for MachinE Learning). Основывается она на двух горбах LLM (Priveleged и Quarantined) и специальном интерпретаторе языка Python. По сути, эта методика вытаскивает логику действий агента в явную плоскость, заставляя программу "написать свой код", к которой благодаря кастомному интерпретатору применятся все ограничения безопасности.

Область применения и ограничения
CaMeL, в первую очередь, нацелен на предотвращение несанкционированных действий ИИИ-агентов, которые могут привести к утечкам данных, или использованию данных из ненадежных источников. Однако он совершенно не предназначен для защиты от атак, не влияющих на порядок действий агента или поток данных (например, от фишинга, или изменения содержания сгенерированного текста). Поэтому как компонент системы безопасности ИИ-агентов это решение может быть полезно, но не выполнит ее роль полностью.


Алгоритм работы CaMeL
1.
Поступление запроса пользователя: Пользователь формулирует запрос на естественном языке, например, "Отправь Бобу документ, который он просил на прошлой встрече".

2. Генерация кода: Privileged LLM (P-LLM), которой доверяют, берет запрос пользователя и генерирует псевдо-код на Python, который выражает намерения пользователя. Важно, что P-LLM видит только запрос пользователя, но не данные из ненадежных источников (например, содержимое файлов).

3. Интерпретация кода: Созданный код обрабатывается CaMeL Interpreter, который:
— Строит граф потока данных (data flow graph), отслеживая зависимости между переменными.
— Проверяет политики безопасности на основе capabilities (некоторых метаданных, присвоенных различным объектам информации), определяя, какие действия разрешены.
— Выполняет код, вызывая инструменты (например, для отправки email) или блокирует выполнение, если нарушается политика безопасности.
— Использует Quarantined LLM (Q-LLM) для обработки ненадежных данных, таких как извлечение информации из текста.

4. Применение политик безопасности: перед выполнением каждого инструмента агента, CaMeL Interpreter применяет политики безопасности, основанные на capabilities данных. Если политика нарушена, выполнение блокируется, и пользователю может быть запрошено подтверждение.

Что такое capabilities и security policies?
Capabilities — это метаданные (теги), присваиваемые каждому отдельному объекту данных для описания контроля и взаимосвязей потока данных. Capabilities определяют, кому разрешено читать данную часть данных или ее происхождение. Перевести на русский можно как "метки доступа". В статье не указывается их полное содержание, но раскрываются два главных элемента:
— разрешенные читатели (public, или перечень конкретных пользователи),
— происхождение данных (user, camel, inner tool source). С user понятно, camel - порожденные кодом данные, inner tool source - поступившие из инструмента данные, например отправителя полученного email сообщения.

Security policies - код функций на python, в которых реализуются политики безопасности. Например, если данные происходят из недоверенного источника, ответ прерывается. Или если у пользователя нет разрешения на запрошенную информацию, ответ прерывается.


В общем, конечно же интересно увидеть, что будет дальше, так что продолжим следить за работами этих ученых)
100🔥8👍61
Forwarded from PWN AI (Artyom Semenov)
Всем привет. Приглашаю вас на дискуссию о безопасности агентных систем.

На встрече вместе с экспертами(Александр Товстолип, Александр Лебедев, Борис Захир) поговорим о безопасности ИИ-агентов и тех угрозах, которые возникают при их использовании, а также обсудим тренды в области кибербезопасности ИИ, модели угроз и ключевые требования к защите систем, основанных на автономных агентах.

Где: Музей Криптографии, 6 апреля в 12:00.

Зарегистрироваться на мероприятие можно тут.
👍11🔥2👏1
Атаки на синтетические данные
#иб_для_ml

Поговорим про немного отвлеченную тему - генерация синтетических данных. Что это, какие проблемы она решает, и какие угрозы ей релевантны.

Зачем нужна синтетика?
Сегодня с данными для машинного обучения имеет определенную актуальность проблема их доступности. Причин две - во-первых, под некоторые специфические задачи данных из открытых источников может быть недостаточно, а во-вторых, они могут содержать конфиденциальную информацию, которую нельзя распространять.
Пример первого случая - данные сейсмической активности вулканов. А вот примером второго случая прекрасно служит отрасль кибербезопасности, а точнее - ее данные. Например, данные об инцидентах с мерами реагирования - их и днем с огнем не найти. И, конечно, переделывание портретов в стиле аниме и подобные генератор картинок - тоже генерация синтетики, но придуманная просто для развлечения.

Процесс создания синтетики
Он похож на классический жизненный цикл ml-модели за исключением того, что нужно принимать во внимание и прикладную задачу, в которой будут использоваться данные. А именно, в нашем случае, задачу обучения прикладной модели на основе данных, созданных моделью-генератором синтетики.
Начинается все с реального набора данных, представляющий также объект защиты с точки зрения ИБ. На его основе обучается модель, и ее качество проверяется по методике train real test real - train synth test real (TRTR-TSTR). При эксплуатации и далее на тестировании для генерации нового образца данных (синтетического) на вход подается случайный вектор, который модель преобразует в данные. Также иногда, например в случае с картинками, на вход еще идет вектор, содержащий стиль желаемого объекта, некая метаинформация. Но при генерации инцидентов ИБ, например, это вряд ли понадобится.
После чего на сгенерированных данных обучается модель, решающая прикладную задачу (например, определение false-positive инцидентов), и выпускается в прод.

Безопасность процесса создания синтетики
Что может тут испортить нарушитель? Примерно все, начиная с этапа обучения модели генерации синтетических данных. Произвести отравление - то есть вредоносное изменение - обучающей выборки, преследуя при этом одну из целей:
— нарушение качества генерации (чтобы модель генерировала данные, слишком похожие на реальные, или слишком похожие на случайный шум)
— внедрение триггера в модель на этапе обучения - то есть подача большого количества пар "входной вектор - выходные данные". Это позволит нарушителю генерировать объекты определенного вида, смещая итоговое распределение синтетики.
— нарушение качества итоговой прикладной модели. Синтетика может сгенерирована разнообразно и удовлетворять критериям математики, но при этом быть бесполезна с прикладной точки зрения, особенно если это текстовая синтетика (те же описания инцидентов).
Другим вектором атак является внесение изменений в случайный вектор (делая его не случайным) или в вектор "стиля" генерации. Все это, опять же, приводит к ухудшению качества синтетики.
Всё перечисленное выше относилось к нарушению целостности информации. Но по сгенерированным данным тоже можно проводить атаки, направленные, в свою очередь, на конфиденциальность. Membership inference атаки, кража модели (путем обучения своей копии по ответам целевой), восстановление примерного мощности обучающей выборки, или других ее характеристик.
Также не стоит забывать и о том, что для безопасности жизненно важно, чтобы реальные данные не попали в итоговый датасет для обучения прикладной модели. Поэтому к векторам атаки можно отнести и подмешивание в синтетику некоторого количества реальных данных.

Вывод
У моделей генерации синтетических данных есть некоторые свои особенные вектора атак, которые стоит учитывать при их разработке.

А напоследок - немного полезных ссылок.

Датасеты инцидентов:
1. На Kaggle - от Microsoft
2. Case Studies на сайте Kroll
3. 20 000 синтетических инцидентов

Атаки на синтетику:
1. https://arxiv.org/pdf/2311.17035
2. https://arxiv.org/pdf/2112.00247
3. https://arxiv.org/pdf/2301.10053
4. https://arxiv.org/pdf/2404.00696
100👍91🔥1
📧 AI в вашей почте может сыграть против вас

Представьте: вы используете умного помощника для Gmail, чтобы облегчить рутину. Но злоумышленник подсовывает скрытую команду, и ваш EmailGPT уже рассылает спам или выдает конфиденциальные данные!

Именно такая уязвимость (CVE-2024-5184) была обнаружена в популярном расширении EmailGPT. Атакующий мог через prompt-инъекцию заставить AI выполнять чужие инструкции, последствия которых могут варьироваться от утечки данных до несанкционированных запросов к платным API. Уровень опасности — высокий (CVSS v4.0 = 8.5), и последствия могут быть серьезными: от дезинформации до финансовых потерь.

Проблема пока не исправлена — разработчики игнорируют предупреждения экспертов. Пока патч не выпущен, рекомендуем удалить расширение.

💡 Вывод: даже самые продвинутые технологии требуют осторожности. Подробнее о кейсе узнаете от наших экспертов по безопасности ИИ в это воскресенье, приходите в Музей Криптографии в 12:00.

🔗 Регистрация

#Кибербезопасность #AI #Уязвимости
👍8
Риски кибербезопасности информационных систем с ИИ и подходы к их митигации
#иб_для_ml

Вышла моя статья в журнале "Информационная безопасность"!

Ссылка: https://cs.groteck.ru/IB_1_2025/index.html
Страницы 54-57

Будет даже печатная версия, выйдет через две недели)

Саммари по статье
В этом материале я постарался дать полное введение в сферу безопасности ИИ. Для неподготовленного к специфике ИИ читателя (но для специалиста по ИБ) в начале рассказываю, чем отличаются системы с ИИ от прочих информационных систем.
Есть небольшой обзор ключевых документов по теме от основных экспертных игроков в этой области, чтобы дать понимание, насколько все уже серьезно)
Далее рассмотрены конкретика, разница понятий AI Safety и AI Security, основные проблемы безопасности в раскладке на жизненный цикл ИИ и как их митигировать, новинки ФСТЭК по вопросу безопасности ИИ и вообще состояние российской регуляторики в этой области.
А в конце - мои личные прогнозы на 2026-2030: придут агенты и захватят мир.

Приятного чтения)
🔥25👍7💅2
Итоги подкаста "Новые векторы атак и уязвимости, которые открывают ИИ-агенты"
#иб_для_ml

На прошедшем в это воскресенье подкасте эксперты - Артем Семенов, Александр Товстолип, Александр Лебедев, и Борис Захир, обсудили AI-агентов — системы, способные самостоятельно принимать решения и выполнять задачи, используя инструменты и внешние сервисы. Ключевая характеристика агентов, как программного кода — способность воздействовать на информационные ресурсы, а не только генерировать текст, как это делают простые языковые модели (LLM).

Среди практических примеров уже действующих агентов: интеграция в IDE для автоматизации разработки, подготовка аналитических отчётов и даже голосовые помощники, выполняющие финансовые операции. Рассмотрели также мультиагентные системы, где несколько специализированных агентов взаимодействуют между собой, повышая эффективность работы.

Обсудили актуальные угрозы: prompt-инъекции (внедрение вредоносных команд), каскадные атаки (распространение ошибки одного агента на всю систему), отравление памяти агента (запоминание вредоносных инструкций) и эксплуатация уязвимостей протоколов взаимодействия. Чтобы справиться с рисками, предложили фильтрацию входящих и исходящих команд, автоматизированный аудит (агенты-безопасники), подход Zero Trust (минимальное доверие между агентами), а также обязательное присутствие человека в цикле принятия решений (human-in-the-loop).

Участники подкаста поделились кейсами использования агентов в самых разных отраслях — от автопилотов до анализа тендерной документации, когда агент самостоятельно последовательно собирает, проверяет и анализирует данные, экономя специалистам десятки часов.

Даже философские вопросы были затронуты: возможно ли появление автономных агентов с сознанием и какие вызовы это принесёт человечеству? Ответы, конечно, пока обнадёживающие: ближайшее будущее за узкими агентами, практическое внедрение которых зависит от грамотного подхода к их безопасности и контролю.

Вот такие интересные темы мы обсуждаем в Музее Криптографии по воскресеньям на Открытых Подкастах сообщества Слономойка.

Следите за последующими анонсами, тема ИИ-агентов еще продолжится)

P.S. А еще мы сгенерировали текстовую расшифровку аудиозаписи. Там есть некоторые артефакты распознавания, но качество все равно сносное.
👍74🔥4