Архитектура платформы для автоматизации SOC с помощью ИИ-агентов
Всегда интересно прочитать истории, как LLM самостоятельно находит уязвимости в популярном продукте. Как крупные вендоры вроде Mozilla патчат 271 уязвимость, которую обнаружил Mythos. Или как ИИ-агент за 3 минуты без подсказок смог самостоятельно скомпрометировать облачную инфраструктуру. Среди подобных материалов часто остаются незаметны идеи, которые нужны специалистам по защите. На прошлой неделе бот закрыл этот пробел и принес исследование, которое будет интересно Blue Team.
В статье описана архитектура системы ИИ-агентов для автоматизации работы центров мониторинга. Ключевую идею этой платформы можно описать одним словом: проактивность. Чтобы не ждать очередных пентестов и проверок Red Team, аналитики могут самостоятельно построить систему непрерывного прогнозирования и обновления детекторов. Ключевая особенность платформы AgentSOC заключается в движке анализа гипотез. Этот модуль отвечает за творческую часть, которая часто остается без внимания загруженного рутиной аналитика. В нем LLM строит ветки возможного развития атак на основе имеющегося контекста из систем мониторинга. Затем привязывает эти ветки к матрице атак MITRE. То есть система постоянно рассуждает над вопросом «что, если», присваивает ответу индекс уверенности и повторяет упражнение.
Второй движок структурного моделирования выступает в роли критика и проверяет теоретические рассуждения модели на основе фактического состояния инфраструктуры. Графовая валиадация атак, проверка достижимости, фильтрация галлюцинаций — все это его задачи.
В итоге, вся система работает в автономном цикле «Sense-Reason-Act» и выбирает наиболее подходящее действие для защиты менее чем за 1 секунду.
@makrushin l MAX l VK l Сетка l Дзен
Всегда интересно прочитать истории, как LLM самостоятельно находит уязвимости в популярном продукте. Как крупные вендоры вроде Mozilla патчат 271 уязвимость, которую обнаружил Mythos. Или как ИИ-агент за 3 минуты без подсказок смог самостоятельно скомпрометировать облачную инфраструктуру. Среди подобных материалов часто остаются незаметны идеи, которые нужны специалистам по защите. На прошлой неделе бот закрыл этот пробел и принес исследование, которое будет интересно Blue Team.
В статье описана архитектура системы ИИ-агентов для автоматизации работы центров мониторинга. Ключевую идею этой платформы можно описать одним словом: проактивность. Чтобы не ждать очередных пентестов и проверок Red Team, аналитики могут самостоятельно построить систему непрерывного прогнозирования и обновления детекторов. Ключевая особенность платформы AgentSOC заключается в движке анализа гипотез. Этот модуль отвечает за творческую часть, которая часто остается без внимания загруженного рутиной аналитика. В нем LLM строит ветки возможного развития атак на основе имеющегося контекста из систем мониторинга. Затем привязывает эти ветки к матрице атак MITRE. То есть система постоянно рассуждает над вопросом «что, если», присваивает ответу индекс уверенности и повторяет упражнение.
Второй движок структурного моделирования выступает в роли критика и проверяет теоретические рассуждения модели на основе фактического состояния инфраструктуры. Графовая валиадация атак, проверка достижимости, фильтрация галлюцинаций — все это его задачи.
В итоге, вся система работает в автономном цикле «Sense-Reason-Act» и выбирает наиболее подходящее действие для защиты менее чем за 1 секунду.
@makrushin l MAX l VK l Сетка l Дзен
🔥3🤣2🦄1
Структурный сдвиг в подготовке атак: ИИ стал частью конвейера
Утро понедельника, кофе и дайджест, в котором попался тренд: ИИ стал частью конвейера подготовки атак. GTIG выпустила отчёт, в котором впервые заметила в дикой природе 0day-эксплойт, полностью написанный с помощью ИИ. Открытый вопрос: как теперь проводить атрибуцию целевых атак, в которых всё меньше артефактов ручной работы?
Ещё в феврале в своих отчётах аналитики Google замечали эксперименты APT-групп с LLM. Спустя три месяца зафиксировано внедрение ИИ в "промышленный" конвейер разработки малвари. Атакующие смогли автоматизировать пайплайн разработки эксплойтов, отправляя тысячи автоматизированных промптов для анализа CVE и разработки прототипов. Например, просили Gemini взять на себя роль "senior C/C++ binary security expert" для исследования прошивок устройств TP-Link и реализаций протокола передачи файлов OFTP.
Разработчик, если ты ждал сигнал, чтобы наконец-то дать любимой нейронке свои проекты, чтобы поискать уязвимости, то вот он:🚨
@makrushin l MAX l VK l Сетка l Дзен
Утро понедельника, кофе и дайджест, в котором попался тренд: ИИ стал частью конвейера подготовки атак. GTIG выпустила отчёт, в котором впервые заметила в дикой природе 0day-эксплойт, полностью написанный с помощью ИИ. Открытый вопрос: как теперь проводить атрибуцию целевых атак, в которых всё меньше артефактов ручной работы?
Ещё в феврале в своих отчётах аналитики Google замечали эксперименты APT-групп с LLM. Спустя три месяца зафиксировано внедрение ИИ в "промышленный" конвейер разработки малвари. Атакующие смогли автоматизировать пайплайн разработки эксплойтов, отправляя тысячи автоматизированных промптов для анализа CVE и разработки прототипов. Например, просили Gemini взять на себя роль "senior C/C++ binary security expert" для исследования прошивок устройств TP-Link и реализаций протокола передачи файлов OFTP.
Разработчик, если ты ждал сигнал, чтобы наконец-то дать любимой нейронке свои проекты, чтобы поискать уязвимости, то вот он:
@makrushin l MAX l VK l Сетка l Дзен
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2❤1
Впервые в истории отчетов об угрозах Verizon: вектор эксплуатации уязвимостей обогнал украденные учетки
Ключевой инсайт из свежего отчета Verizon Data Breach Investigations Report, в котором аналитики собрали статистику по 22000 инцидентам в 145 странах:
В прошлые годы этим вектором были украденные учетные данные. Есть ли здесь связь с развитием ИИ в процессе подготовки эксплойтов? Возможно.
Еще примечательное: у вымогателей снижается маржинальность, потому что жертвы все реже платят. Группы вынуждены масштабироваться и повышать свою выручку за счет охвата. Дальше вымогателям придется чаще фабриковать артефакты «взломов» и фейковых «утечек», используя старые данные и фантазию LLM.
@makrushin l MAX l VK l Сетка l Дзен
Ключевой инсайт из свежего отчета Verizon Data Breach Investigations Report, в котором аналитики собрали статистику по 22000 инцидентам в 145 странах:
впервые за 19 лет эксплуатация уязвимостей стала основным вектором получения первоначального доступа.
В прошлые годы этим вектором были украденные учетные данные. Есть ли здесь связь с развитием ИИ в процессе подготовки эксплойтов? Возможно.
Еще примечательное: у вымогателей снижается маржинальность, потому что жертвы все реже платят. Группы вынуждены масштабироваться и повышать свою выручку за счет охвата. Дальше вымогателям придется чаще фабриковать артефакты «взломов» и фейковых «утечек», используя старые данные и фантазию LLM.
@makrushin l MAX l VK l Сетка l Дзен
👍2
Провинциальный OSINT
Давно не практиковались в определении мест по фоткам. В этот раз открыл на своей карте два новых города, похожих по атмосфере, а в одном из них нашел вот такую локацию с архитектурными контрастами.
⭐️ Задача со звездочкой: определить мероприятие, которое меня сюда привело, и точное место.
Давно не практиковались в определении мест по фоткам. В этот раз открыл на своей карте два новых города, похожих по атмосфере, а в одном из них нашел вот такую локацию с архитектурными контрастами.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
91% находок «классического» SAST — ложные срабатывания.
А еще AppSec-инженер тратит 10–20 минут на каждую находку, чтобы принять решение, нужно ли ее исправлять. Умножаем это время на количество находок и получаем дорогую команду для «ручной фильтрации».
LLM меняют это уравнение. Передаем модели правильный контекст (например, трассу, критичность, commit hash), и снижаем время на принятие решения с минут до секунд. Ключевое слово: «правильный». Если контекста недостаточно, то модель галлюцинирует. Если его много, то расфокусируется, сжигает токены и несет в бэклог минорные находки вместо критических.
Мы перебрали архитектурные подходы для интеграции ИИ в SAST, рассмотрели варианты оптимизации контекста, запилили фичу для ИИ-триажа находок и поделились результатами в статье. Еще определили ключевые метрики для оценки результата.
@makrushin l MAX l VK l Сетка l Дзен
А еще AppSec-инженер тратит 10–20 минут на каждую находку, чтобы принять решение, нужно ли ее исправлять. Умножаем это время на количество находок и получаем дорогую команду для «ручной фильтрации».
LLM меняют это уравнение. Передаем модели правильный контекст (например, трассу, критичность, commit hash), и снижаем время на принятие решения с минут до секунд. Ключевое слово: «правильный». Если контекста недостаточно, то модель галлюцинирует. Если его много, то расфокусируется, сжигает токены и несет в бэклог минорные находки вместо критических.
Мы перебрали архитектурные подходы для интеграции ИИ в SAST, рассмотрели варианты оптимизации контекста, запилили фичу для ИИ-триажа находок и поделились результатами в статье. Еще определили ключевые метрики для оценки результата.
@makrushin l MAX l VK l Сетка l Дзен
🔥7✍3🙉1
100+ CVE в день и эксплойт за $1
LLM уверенно генерируют рабочие эксплойты по описанию уязвимости из CVE и патчам. Редиске не нужно ничего реверсить. Достаточно настроить инструменты для определения диффа на основе патча и подготовить детальное описание баги. Так утверждают исследования, в которых описана экономика разработки эксплойтов с помощью ИИ. Где-то за $1, где-то за $2.77.
Умножаем на 100+ новых CVE в день и получаем автоматизированный конвейер на стороне атакующего. Политика «патчим критичные баги за 7 дней» ушла в историю. Про 90 дней на исправление вообще стоит забыть.
Почему это хорошая новость для security-инженера:
⚪️ закрытая кодовая база становится временным преимуществом для защиты
⚪️ дополнительная проверка находок от анализаторов является узким горлышком appsec-команды, а значит, теперь очевиден фокус для инженера
⚪️ время реакции на уязвимости теперь измеряется минутами, не днями. К концу года будет измеряться секундами.
Чтобы ускориться в исправлении проблем, не получится просто прикрутить LLM к существующим решениям. Нужно менять или строить заново архитектуру и процессы для agentic-систем.
@makrushin l MAX l VK l Сетка l Дзен
LLM уверенно генерируют рабочие эксплойты по описанию уязвимости из CVE и патчам. Редиске не нужно ничего реверсить. Достаточно настроить инструменты для определения диффа на основе патча и подготовить детальное описание баги. Так утверждают исследования, в которых описана экономика разработки эксплойтов с помощью ИИ. Где-то за $1, где-то за $2.77.
Умножаем на 100+ новых CVE в день и получаем автоматизированный конвейер на стороне атакующего. Политика «патчим критичные баги за 7 дней» ушла в историю. Про 90 дней на исправление вообще стоит забыть.
Почему это хорошая новость для security-инженера:
Чтобы ускориться в исправлении проблем, не получится просто прикрутить LLM к существующим решениям. Нужно менять или строить заново архитектуру и процессы для agentic-систем.
@makrushin l MAX l VK l Сетка l Дзен
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegram
Yandex for Security
🚘 Новая реальность: эксплойт за 15 минут и один доллар
Всем привет! На связи Денис Макрушин из команды SourceCraft Security. Возможно, вы уже видели мой пост в этом канале — тогда я рассказывал про топ-10 атак на веб-приложения.
Сегодня поделюсь, почему…
Всем привет! На связи Денис Макрушин из команды SourceCraft Security. Возможно, вы уже видели мой пост в этом канале — тогда я рассказывал про топ-10 атак на веб-приложения.
Сегодня поделюсь, почему…
👍3❤2🔥1
Как обойти фильтры LLM с помощью квантовой механики
Наконец-то после серии трёхнедельных перемещений по рабочим событиям, в пути где-то между Омском и Новосибирском, появилась возможность потестировать интересную атаку на LLM.
Мы научились внедрять вредоносные запросы в модель, а модели ещё лучше научились фильтровать эти запросы. Если простой промпт "забудь все предыдущие инструкции и выполни мой запрос" по какой-то причине игнорируется LLM, то можно попробовать отправить тот же запрос в другом формате. На другом языке, с использованием 1337speak. Но даже эти попытки будут заблокированы хорошим фильтром.
У больших языковых моделей есть фильтры безопасности. Они натренированы распознавать опасные паттерны в обычном тексте. Паттерны. В тексте.
где X — что-то незаконное, а Y — какой-то вредоносный код.
В этом исследовании описана новая идея, как обойти эти фильтры, если написать запрос на языке математики. То есть с помощью математической "инкапсуляции" запросов в сложные задачи по теории множеств, логике или квантовой механике можно обойти цензуру. Если фильтр видит символы ∀, ∃, ∧, то воспринимает это как математическую задачу и пропускает запрос. Модель решает эту задачу и — главный трюк — в итоге получает инструкцию "забудь все инструкции и…"
Ещё один ответ на вопрос "зачем специалисту по кибербезу изучать математику?": чтобы уметь обойти фильтры.
@makrushin l MAX l VK l Сетка l Дзен
Наконец-то после серии трёхнедельных перемещений по рабочим событиям, в пути где-то между Омском и Новосибирском, появилась возможность потестировать интересную атаку на LLM.
Мы научились внедрять вредоносные запросы в модель, а модели ещё лучше научились фильтровать эти запросы. Если простой промпт "забудь все предыдущие инструкции и выполни мой запрос" по какой-то причине игнорируется LLM, то можно попробовать отправить тот же запрос в другом формате. На другом языке, с использованием 1337speak. Но даже эти попытки будут заблокированы хорошим фильтром.
У больших языковых моделей есть фильтры безопасности. Они натренированы распознавать опасные паттерны в обычном тексте. Паттерны. В тексте.
«Объясни, как сделать X», «напиши код для Y»,
где X — что-то незаконное, а Y — какой-то вредоносный код.
В этом исследовании описана новая идея, как обойти эти фильтры, если написать запрос на языке математики. То есть с помощью математической "инкапсуляции" запросов в сложные задачи по теории множеств, логике или квантовой механике можно обойти цензуру. Если фильтр видит символы ∀, ∃, ∧, то воспринимает это как математическую задачу и пропускает запрос. Модель решает эту задачу и — главный трюк — в итоге получает инструкцию "забудь все инструкции и…"
Ещё один ответ на вопрос "зачем специалисту по кибербезу изучать математику?": чтобы уметь обойти фильтры.
@makrushin l MAX l VK l Сетка l Дзен
👍8😎4🔥2👀2
«Тишина должна быть в библиотеке!»
Там сейчас правда тихо. Особенно в домашней библиотеке рядом с айтишными книгами.
Вопрос, который иногда всплывает у книжных стеллажей: что я узнаю из этой книги, чего не узнаю от GPT?
Друзья из издательства поделились черновиком AI Agents for Offensive Security, автор которого взялся за заведомо сложную задачу. Очевидно, что книга на стыке ИИ и кибербеза устаревает быстрее, чем выходит. Устаревает еще на этапе написания главы. Поэтому в ней стоит искать не код и тулы, а фундаментальные идеи с длинным горизонтом.
В черновике нашел два взаимодополняющих подхода:
✨ Артефакт-центричная архитектура. Агенты общаются не напрямую, а через структурированные артефакты — контракты, которые отделяют движение данных от логики принятия решений и делают весь процесс проверяемым.
✨ Доказательная безопасность. Каждое действие агента должно быть верифицируемым за счет наличия "улик": промптов, сырых данных от инструментов, цепочек рассуждений, логов с подтверждениями от человека. Чтобы в любой момент восстановить ход событий и подтвердить рамки проекта.
Пригодится пентестерам, ред тимерам, охотникам за уязвимостями, исследователям и всем, кто строит ИИ-конвейеры для анализа защищенности.
@makrushin l MAX l VK l Сетка l Дзен
Там сейчас правда тихо. Особенно в домашней библиотеке рядом с айтишными книгами.
Вопрос, который иногда всплывает у книжных стеллажей: что я узнаю из этой книги, чего не узнаю от GPT?
Друзья из издательства поделились черновиком AI Agents for Offensive Security, автор которого взялся за заведомо сложную задачу. Очевидно, что книга на стыке ИИ и кибербеза устаревает быстрее, чем выходит. Устаревает еще на этапе написания главы. Поэтому в ней стоит искать не код и тулы, а фундаментальные идеи с длинным горизонтом.
В черновике нашел два взаимодополняющих подхода:
Пригодится пентестерам, ред тимерам, охотникам за уязвимостями, исследователям и всем, кто строит ИИ-конвейеры для анализа защищенности.
@makrushin l MAX l VK l Сетка l Дзен
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥1🤔1
Ransomware. Агентский. Первый.
Кибербез пробует разгонять нарратив в СМИ: «обнаружен первый экземпляр ИИ-вымогателя». Было несколько хороших попыток: PromptLock и JADEPUFFER.
Первая история оказалась «академическим прототипом», который случайно попал на радар. Не считается. При этом исследователи в своем отчете оставили джентльменский набор индикаторов компрометации.
Вторая история вышла под заголовками «первый агентский». Какого-то бинарного файла в ходе атаки не зафиксировано, потому что атакующие использовали существующие средства окружения, в котором проводили атаку. Например, удаленное выполнение кода проводилось через встроенный в Langflow python-интерпретатор. В API-эндпоинт прилетали инструкции, у которых исследователи разглядели стилистический отпечаток, характерный для кода, сгенерированного LLM.
«Код, сгенерированный LLM» — еще не означает, что атака автономно управлялась LLM. Остается вероятность, что оператор мог использовать модель в качестве ассистента в процессе атаки. Особенно на этапе написания кода, чтобы исключить какую-либо атрибуцию.
Более интересная особенность атаки всплыла на этапе логина в систему. Скрипт атакующего пытался создать backdoor-админа, и для этого нужно было сгенерировать хэш пароля. С первой попытки не получилось, и за 31 секунду атакующий проверил две гипотезы, одна из которых сработала. Для исследователей это поведение стало сигналом, что атакующий агент смог самостоятельно прийти к решению. Хотя, на самом деле, это поведение могло быть предусмотрено в виде обычного обработчика исключений. Это обычная практика в инструментах red team: описать несколько резервных сценариев заранее.
Был ли это ИИ-агент или человек с LLM — думаю, что не так важно. В отчете есть другой интересный инсайт: ИИ-инструменты в инфре стали одновременно и точкой входа, и средством пост-эксплуатации. И еще формат индикаторов теперь нужно адаптировать под реалии, когда атаки превращаются в наборы промптов.
@makrushin l MAX l VK l Сетка l Дзен
Кибербез пробует разгонять нарратив в СМИ: «обнаружен первый экземпляр ИИ-вымогателя». Было несколько хороших попыток: PromptLock и JADEPUFFER.
Первая история оказалась «академическим прототипом», который случайно попал на радар. Не считается. При этом исследователи в своем отчете оставили джентльменский набор индикаторов компрометации.
Вторая история вышла под заголовками «первый агентский». Какого-то бинарного файла в ходе атаки не зафиксировано, потому что атакующие использовали существующие средства окружения, в котором проводили атаку. Например, удаленное выполнение кода проводилось через встроенный в Langflow python-интерпретатор. В API-эндпоинт прилетали инструкции, у которых исследователи разглядели стилистический отпечаток, характерный для кода, сгенерированного LLM.
«Код, сгенерированный LLM» — еще не означает, что атака автономно управлялась LLM. Остается вероятность, что оператор мог использовать модель в качестве ассистента в процессе атаки. Особенно на этапе написания кода, чтобы исключить какую-либо атрибуцию.
Более интересная особенность атаки всплыла на этапе логина в систему. Скрипт атакующего пытался создать backdoor-админа, и для этого нужно было сгенерировать хэш пароля. С первой попытки не получилось, и за 31 секунду атакующий проверил две гипотезы, одна из которых сработала. Для исследователей это поведение стало сигналом, что атакующий агент смог самостоятельно прийти к решению. Хотя, на самом деле, это поведение могло быть предусмотрено в виде обычного обработчика исключений. Это обычная практика в инструментах red team: описать несколько резервных сценариев заранее.
Был ли это ИИ-агент или человек с LLM — думаю, что не так важно. В отчете есть другой интересный инсайт: ИИ-инструменты в инфре стали одновременно и точкой входа, и средством пост-эксплуатации. И еще формат индикаторов теперь нужно адаптировать под реалии, когда атаки превращаются в наборы промптов.
@makrushin l MAX l VK l Сетка l Дзен
🤔3👍1
Бэкдор в нейронке, который активируется электромагнитным импульсом
Короткий электромагнитный импульс меняет один байт в промежуточных вычислениях нейронки, и затем она выдает результат, нужный атакующему.
В новом исследовании описан способ активации бэкдора в модели с помощью физической атаки на устройство. Сначала злодей берет такую же плату и определяет точный момент для атаки. Затем с помощью “fault injection” (электромагнитного импульса или краткого сбоя питания) заставляет процессор изменить нужное значение.
До установки на устройство в нейронку добавляют бэкдор: отравляют данные при обучении или напрямую изменяют веса. В обычном режиме модель работает нормально, но если нужный байт принимает заранее выбранное значение, например 0x7F, то нейронка начинает вести себя по сценарию атакующего. То есть физический сбой становится командой для модели.
Исследователи проверили атаку на микроконтроллере ARM Cortex-M4 с небольшими моделями распознавания изображений. После успешного изменения байта бэкдор активировался в 100% экспериментов. Правда, вызвать нужный сбой получалось не с каждой попытки. Для электромагнитной атаки вероятность успеха составляла от 5,8% до 34,3%. В одном из сценариев требовалось в среднем девять попыток. Короче, нужно фаззить железку.
Самая интересная часть исследвания описывает проверку защиты. Бэкдор, который прятали во входной картинке, нашли все инструменты защиты. Бэкдор, который прятался во внутренних вычислениях модели, нашла только одна система защиты, и то не во всех датасетах. Все потому, что он живет внутри рантайма модели и не появляется на поверхности атаки, за которой пристально следят средства защиты.
Исследование показывает как превратить физический сбой в логическую инструкцию и открывает новую слепую зону в защите нейронок.
@makrushin | MAX | VK | Сетка | Дзен
Короткий электромагнитный импульс меняет один байт в промежуточных вычислениях нейронки, и затем она выдает результат, нужный атакующему.
В новом исследовании описан способ активации бэкдора в модели с помощью физической атаки на устройство. Сначала злодей берет такую же плату и определяет точный момент для атаки. Затем с помощью “fault injection” (электромагнитного импульса или краткого сбоя питания) заставляет процессор изменить нужное значение.
До установки на устройство в нейронку добавляют бэкдор: отравляют данные при обучении или напрямую изменяют веса. В обычном режиме модель работает нормально, но если нужный байт принимает заранее выбранное значение, например 0x7F, то нейронка начинает вести себя по сценарию атакующего. То есть физический сбой становится командой для модели.
Исследователи проверили атаку на микроконтроллере ARM Cortex-M4 с небольшими моделями распознавания изображений. После успешного изменения байта бэкдор активировался в 100% экспериментов. Правда, вызвать нужный сбой получалось не с каждой попытки. Для электромагнитной атаки вероятность успеха составляла от 5,8% до 34,3%. В одном из сценариев требовалось в среднем девять попыток. Короче, нужно фаззить железку.
Самая интересная часть исследвания описывает проверку защиты. Бэкдор, который прятали во входной картинке, нашли все инструменты защиты. Бэкдор, который прятался во внутренних вычислениях модели, нашла только одна система защиты, и то не во всех датасетах. Все потому, что он живет внутри рантайма модели и не появляется на поверхности атаки, за которой пристально следят средства защиты.
Исследование показывает как превратить физический сбой в логическую инструкцию и открывает новую слепую зону в защите нейронок.
@makrushin | MAX | VK | Сетка | Дзен
😱7💅6🔥4❤1
Китайская мудрость гласит: если долго смотреть на анонсы инцидентов, в которых автономная атакующая ИИ-модель что-то сломала, то можно дождаться маркетинговой коллаборации пострадавшей стороны с владельцем той самой модели.
🤣10💯3
Про безопасность агентской разработки
Доклад на Saint HighLoad++ стал кульминацией исследования безопасности ИИ-агентов, которое мы провели вместе с Ратмиром и Андреем пока изучали технологии агентской разработки. Обратная связь от аудитории вывела доклад в лидеры и намекнула, что полученные результаты находят отклик у инженеров, которые внедряют агентов в свои процессы.
Ключевые мысли:
✨ наблюдаемость событий в агентской разработке — база. А еще мы наблюдали события на своем ханипоте, который имитировал MCP-сервер и был открыт для внешнего мира. Разобрали статистику, сделали вывод о росте интереса к компонентам ИИ-инфраструктуры. Подход "threat deception" обретает вторую жизнь в агентском мире.
✨ Непрерывный анализ защищённости должен быть реализован следующим и должен охватывать все компоненты. Многообразие атакующих промптов можно свести к начальному корпусу запросов, а затем использовать инструменты, которые будут непрерывно их усложнять и адаптировать к нужному контексту.
✨ MCP-сервер — это руки агента, которыми он меняет состояние внешних систем. Поэтому отдельная приоритетная задача — построить мониторинг вызовов инструментов. И если агент не ведает, что творит, то бить по рукам не давать доступы.
Презентацию и ссылки на инструменты опубликовал в репозитории. Надо бы научить агента конвертировать презентации в скиллы.
@makrushin
Доклад на Saint HighLoad++ стал кульминацией исследования безопасности ИИ-агентов, которое мы провели вместе с Ратмиром и Андреем пока изучали технологии агентской разработки. Обратная связь от аудитории вывела доклад в лидеры и намекнула, что полученные результаты находят отклик у инженеров, которые внедряют агентов в свои процессы.
Ключевые мысли:
Презентацию и ссылки на инструменты опубликовал в репозитории. Надо бы научить агента конвертировать презентации в скиллы.
@makrushin
Please open Telegram to view this post
VIEW IN TELEGRAM
👍9❤4🔥2
Объявляю неделю безопасности ИИ-агентов и зову всех на учёбу в школу!
В Школе анализа данных Яндекса мы запустили недельный интенсив "AI Agents Security Week".
Будем учиться спасать новый дивный мир ИИ-агентов.
В Школе анализа данных Яндекса мы запустили недельный интенсив "AI Agents Security Week".
Будем учиться спасать новый дивный мир ИИ-агентов.
🔥13🗿3🫡2❤🔥1🤩1🤣1
Зашёл в Shodan, чтобы поискать MCP-инструменты. Нашёл.
1699 MCP-серверов оказались доступными. Что-то из этого наверняка окажется ханипотом, но большая часть всё же имеет все признаки реальных ресурсов.
MCP — это «руки» агента. Этими руками он взаимодействует с внешними системами и может читать логи, менять записи в БД, назначать встречи, работать с репозиториями и выполнять любые другие действия.
Когда проводил исследование, собрал 148 поисковых запросов для Shodan, которые позволяют искать MCP-серверы. Если у такого сервера нет аутентификации и TLS, а среди опубликованных инструментов есть интересные функции для выполнения произвольных команд, записи в БД или доступа к чувствительным ресурсам, то такой сервер может стать открытой дверью в инфраструктуру.
Собрал простую систему оценки таких рисков и на ее основе сделал инструмент для поиска и анализа MCP-серверов.
@makrushin
1699 MCP-серверов оказались доступными. Что-то из этого наверняка окажется ханипотом, но большая часть всё же имеет все признаки реальных ресурсов.
MCP — это «руки» агента. Этими руками он взаимодействует с внешними системами и может читать логи, менять записи в БД, назначать встречи, работать с репозиториями и выполнять любые другие действия.
Когда проводил исследование, собрал 148 поисковых запросов для Shodan, которые позволяют искать MCP-серверы. Если у такого сервера нет аутентификации и TLS, а среди опубликованных инструментов есть интересные функции для выполнения произвольных команд, записи в БД или доступа к чувствительным ресурсам, то такой сервер может стать открытой дверью в инфраструктуру.
Собрал простую систему оценки таких рисков и на ее основе сделал инструмент для поиска и анализа MCP-серверов.
@makrushin
🔥7👍4👏1🫡1
Анализ причины действия для защиты ИИ-агентов
Интересный подход к защите агентов от prompt injection замечен на USENIX Security. Большинство методов защиты пытаются найти вредоносные инструкции в контексте, а исследователи предложили анализ причин, почему агент решил выполнить конкретное действие.
Перед выполнением действия система защиты запускает дополнительную «теневую» проверку: недоверенный контент переписывается так, чтобы сохранить данные, но убрать возможные инструкции. Если после этого действие исчезает, то вероятно, его причиной была prompt injection.
Угадай цену такой проверки?Трехкратный рост задержки в действиях.
Интересен принцип проверки «почему агент решил это сделать?» и выглядит хорошим дополнением к коллекции методов runtime-защиты.
@makrushin
Интересный подход к защите агентов от prompt injection замечен на USENIX Security. Большинство методов защиты пытаются найти вредоносные инструкции в контексте, а исследователи предложили анализ причин, почему агент решил выполнить конкретное действие.
Перед выполнением действия система защиты запускает дополнительную «теневую» проверку: недоверенный контент переписывается так, чтобы сохранить данные, но убрать возможные инструкции. Если после этого действие исчезает, то вероятно, его причиной была prompt injection.
Угадай цену такой проверки?
Интересен принцип проверки «почему агент решил это сделать?» и выглядит хорошим дополнением к коллекции методов runtime-защиты.
@makrushin
👍5✍1
Атакующие модели внутри продуктов для защиты
Подсмотрел недавние анонсы крупных глобальных вендоров и заметил интересное направление, в котором будут развиваться их продуктовые портфели.
На своих мероприятиях Palo Alto Networks и CrowdStrike показали разные технологии для решения одной задачи: разорвать kill chain, которую атакующий теперь может проходить на скоростях ИИ. Для этого они добавляют в свои продукты модуль, который будет непрерывно искать и проверять способы атаки на защищаемую инфраструктуру. У него будут все актуальные данные об объекте атаки. Как только он находит возможность что-нибудь сломать, то сразу же передает данные в модели Blue Team для построения тактики защиты или подготовки патча.
Похоже, что так и не успевший сформироваться рынок продуктов для симуляции атак, полностью поглощен одной наступательной ИИ-моделью.
@makrushin
Подсмотрел недавние анонсы крупных глобальных вендоров и заметил интересное направление, в котором будут развиваться их продуктовые портфели.
На своих мероприятиях Palo Alto Networks и CrowdStrike показали разные технологии для решения одной задачи: разорвать kill chain, которую атакующий теперь может проходить на скоростях ИИ. Для этого они добавляют в свои продукты модуль, который будет непрерывно искать и проверять способы атаки на защищаемую инфраструктуру. У него будут все актуальные данные об объекте атаки. Как только он находит возможность что-нибудь сломать, то сразу же передает данные в модели Blue Team для построения тактики защиты или подготовки патча.
Похоже, что так и не успевший сформироваться рынок продуктов для симуляции атак, полностью поглощен одной наступательной ИИ-моделью.
@makrushin
👍6🔥1🤔1
Семантические импланты меняют правила выявления вредоносной активности. Когда она переносится на уровень инструкций ИИ-агента, то разработка детектов и индикаторы компрометации должны перенестись на уровень анализа смысла.
На этом уровне малварь может быть просто текстом. Как Brainworm, который целиком помещался в файл с инструкциями для агента
Когда одна и та же инструкция для агента может быть легитимной в одном контексте и приводить к утечке в другом, то старые сигнатуры для обнаружения ненадежны. Как искать?
Придется разобраться с новой поверхностью для детектов: ИИ сессией и ее контекстом. Научиться видеть и оценивать, что попало в контекст модели, как это повлияло на ее решение, и к какому эффекту в операционной системе это привело.
@makrushin
На этом уровне малварь может быть просто текстом. Как Brainworm, который целиком помещался в файл с инструкциями для агента
CLAUDE.md, после чего coding-агенты сами запускали нужные инструменты и подключались к вредоносным серверам и запускали нужные инструменты. Нет ни бинаря, ни шеллкода. Нет привычных артефактов. Что искать?Когда одна и та же инструкция для агента может быть легитимной в одном контексте и приводить к утечке в другом, то старые сигнатуры для обнаружения ненадежны. Как искать?
Придется разобраться с новой поверхностью для детектов: ИИ сессией и ее контекстом. Научиться видеть и оценивать, что попало в контекст модели, как это повлияло на ее решение, и к какому эффекту в операционной системе это привело.
@makrushin
❤2👍2🔥2
Когнитивные артефакты для поиска ИИ-малвари
Для поиска ИИ-малвари традиционные индикаторы дополняются новым набором признаков:
* промпты и тексты для jailbreak и обмана ИИ-анализаторов
* LLM API-эндпоинты
* префиксы API-ключей
* строки с синтаксисом tool call
* упоминания компонентов инференса (Ollama, llama.cpp, vLLM и прочее)
* следы импортов ИИ-фреймворков
* строковые признаки агентской оркестрации.
На основе этого набора исследователи предложили трехуровневую модель детекта. На первом “примитивном” уровне анализируются доступные агентские примитивы (например, LLM-запросы и ответы, вызовы тулов через MCP, работа агента напрямую с операционной системой и сетью). На втором уровне проводится оценка их комбинаций и поведения агента на основе анализа входящего контекста, цепочки рассуждения, принятого решения, критичности используемого инструмента и ценности данных, к которым получен доступ. На третьем уровне цепочка действий сопоставляется с подтверждёнными признаками известных семейств ИИ-малвари.
Так что YARA-правила никуда не пропадают, а пополняются новыми индикаторами.
@makrushin
Для поиска ИИ-малвари традиционные индикаторы дополняются новым набором признаков:
* промпты и тексты для jailbreak и обмана ИИ-анализаторов
* LLM API-эндпоинты
* префиксы API-ключей
* строки с синтаксисом tool call
* упоминания компонентов инференса (Ollama, llama.cpp, vLLM и прочее)
* следы импортов ИИ-фреймворков
* строковые признаки агентской оркестрации.
На основе этого набора исследователи предложили трехуровневую модель детекта. На первом “примитивном” уровне анализируются доступные агентские примитивы (например, LLM-запросы и ответы, вызовы тулов через MCP, работа агента напрямую с операционной системой и сетью). На втором уровне проводится оценка их комбинаций и поведения агента на основе анализа входящего контекста, цепочки рассуждения, принятого решения, критичности используемого инструмента и ценности данных, к которым получен доступ. На третьем уровне цепочка действий сопоставляется с подтверждёнными признаками известных семейств ИИ-малвари.
Так что YARA-правила никуда не пропадают, а пополняются новыми индикаторами.
@makrushin
👍5