Forwarded from AISecHub
A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment
https://arxiv.org/abs/2504.15585
#LLMSafety #ModelSafety #RLHF #PromptInjection #DataPoisoning #AISecurity #LLMRisks #AIAttacks
https://arxiv.org/abs/2504.15585
#LLMSafety #ModelSafety #RLHF #PromptInjection #DataPoisoning #AISecurity #LLMRisks #AIAttacks
🔥1
Forwarded from AISecure (Victor Chaplygin)
🧠 Один неверный регистр — и IDE становится точкой входа.
Поэтому всегда обновляйтесь.
В Cursor IDE нашли занятную уязвимость — CVE-2025-59944
.
Из-за чувствительности к регистру в проверках “чувствительных” файлов можно было тихо обойти встроенные guardrails — механизмы, которые должны сдерживать опасные действия AI или IDE.
📌 На macOS и Windows, где файловые системы не различают регистр, .cUrSoR/mcp.json воспринимался как новый файл и проходил без подтверждения.
Результат — перезапись ключевых конфигов и возможность удалённого выполнения кода (RCE).
И всё это без участия разработчика: атака могла прийти, например, через подключённый MCP-сервер.
Cursor закрыл дыру в 1.7, нормализовав пути и проверки. Но кейс показательный — мелкие детали превращаются в серьёзные векторы, когда IDE начинает действовать как агент 🤖
📎 Подробный разбор:
– Lakera Blog
– NVD Record
#Cursor #CVE202559944 #DevSecOps #AgenticTools #AIsecurity #RCE #PromptInjection
Поэтому всегда обновляйтесь.
В Cursor IDE нашли занятную уязвимость — CVE-2025-59944
.
Из-за чувствительности к регистру в проверках “чувствительных” файлов можно было тихо обойти встроенные guardrails — механизмы, которые должны сдерживать опасные действия AI или IDE.
📌 На macOS и Windows, где файловые системы не различают регистр, .cUrSoR/mcp.json воспринимался как новый файл и проходил без подтверждения.
Результат — перезапись ключевых конфигов и возможность удалённого выполнения кода (RCE).
И всё это без участия разработчика: атака могла прийти, например, через подключённый MCP-сервер.
Cursor закрыл дыру в 1.7, нормализовав пути и проверки. Но кейс показательный — мелкие детали превращаются в серьёзные векторы, когда IDE начинает действовать как агент 🤖
📎 Подробный разбор:
– Lakera Blog
– NVD Record
#Cursor #CVE202559944 #DevSecOps #AgenticTools #AIsecurity #RCE #PromptInjection
❤1
Forwarded from YDC — Pizza Powered iOS (Kirill Smirnov)
Наткнулся на интересную статью в блоге Мартина Фаулера — Agentic AI Security.
Она разбирает безопасность в работе LLM и объясняет, почему использование агентов — это не просто “умные помощники”, а ещё и новые векторы уязвимостей.
Заглавный вопрос статьи: LLM не различает данные и инструкции.
Когда агент объединяет несколько итераций текста и вызовов инструментов (MCP, внешние API, CLI и т.п.) в один большой контекст, он может “съесть” вредоносную инструкцию прямо из данных.
Korny Sietsma, автор статьи, приводит ссылки на смежные материалы и называет это "смертельной триадой" угроз:
- Sensitive Data is the core thing most attackers want - this can include things like browser cookies that open up access to other data.
- Неочевидность границ контекста — модель не знает, что безопасно, а что нет.
- Untrusted Content can include commands that the LLM might follow.
- Инъекция инструкций — злоумышленник подмешивает вредоносные команды в текст.
- External Communication allows the LLM application to send information back to the attacker.
- Автоматизация действий без контроля — агент сам выполняет то, что “кажется логичным”.
📊 В статье есть отличные диаграммы, показывающие, как LLM взаимодействует с внешним миром, инструментами и данными. Всё складывается в единую картину:
Агент — это цепочка промтов и tool-вызовов, которые не имеют встроенной защиты.
💬 Отдельно поднимается вопрос этики и порядочности поставщиков инструментов и MCP-серверов.
И рекомендуют применять все обычные проверки безопасности.
Публикация официального реестра MCP — это шаг вперёд.
Но он пока никак не администрируется на предмет безопасности или уязвимостей.
⚙️ Что можно сделать, чтобы уменьшить риски?
🧩 Вся экосистема движется к тому, чтобы LLM могла действовать самостоятельно.
Но важно понять, что пока человек остаётся самым надёжным “firewall” между ИИ и злоумышленником.
А применение подходов описанных в статье снимает львиную долю человеческого фактора.
P.S.:💡 Отдельный инсайт для меня — это Apple Containers: Linux контейнеры в macOS от Apple.
Надо будет посмотреть.
#AgenticAI #Security #LLM #PromptInjection #MCP #Containers #Claude #Apple #AI
Please open Telegram to view this post
VIEW IN TELEGRAM
martinfowler.com
Agentic AI and Security
The serious security risks involved in using autonomous LLM applications and what we can do to mitigate them
❤2
Forwarded from SecureTechTalks
🚨 ИИ под охраной: OpenGuardrails защищает нейросети от утечек и манипуляций
ИИ-системы стремительно входят в бизнес-процессы, но чем шире их применение, тем выше риск: модели могут раскрывать конфиденциальные данные, исполнять вредные инструкции или генерировать токсичный контент.
🧩 OpenGuardrails создан для того, чтобы защать модели. Это открытая платформа, которая анализирует все запросы и ответы, обнаруживает инъекции, утечки и вредные подсказки, не давая AI выйти за рамки заданных политик безопасности.
🛡 Умная защита для умных систем
Фактически OpenGuardrails - это полноценный защитный слой между пользователем и моделью. Он контролирует оба направления трафика:
выявляет prompt-инъекции и попытки манипуляции контекстом,
блокирует утечки персональных и корпоративных данных,
фильтрует токсичный или опасный контент на входе и выходе модели.
👉 GitHub проекта
⚙️ Как это устроено?
Под капотом OpenGuardrails работает комбинация технологий:
➖ собственная LLM для анализа запросов и выявления атак,
➖ NER-модули для поиска чувствительных данных,
➖ гибкие политики и правила, которые легко адаптируются под ваши сценарии.
Платформа поддерживает два режима:
1️⃣ API-интеграция, когда вы напрямую вызываете сервис проверки;
2️⃣ Security Gateway, когда разворачиваете его как прокси, через который проходят все запросы к модели.
💡 Производительность: средняя задержка менее 300 мс.
Плюсом поддержка более 100 языков.
🧩 OpenGuardrails помогает компаниям решать три ключевые задачи:
🧱 Защищает пользователей и репутацию: предотвращая утечки и неэтичные ответы;
📜 Поддерживает соответствие требованиям GDPR, ISO 27001, SOC 2 и др.;
🤝 Повышает доверие к вашим ИИ-сервисам.
🚀 Где применять?
🔸 Корпоративные чат-боты: фильтруют вредные запросы и защищают документы.
🔸 Генераторы кода: предотвращают инъекции и утечки токенов.
🔸 ИИ-ассистенты: исключают токсичные или политически чувствительные ответы.
🔸 Big Data-платформы: контролируют обработку чувствительных наборов данных.
Stay secure and read SecureTechTalks 📚
#AIsecurity #cybersecurity #promptinjection #dataprotection #openguardrails #bigdata #infosec #opensource #llmsecurity #SecureTechTalks #techinnovation
ИИ-системы стремительно входят в бизнес-процессы, но чем шире их применение, тем выше риск: модели могут раскрывать конфиденциальные данные, исполнять вредные инструкции или генерировать токсичный контент.
🧩 OpenGuardrails создан для того, чтобы защать модели. Это открытая платформа, которая анализирует все запросы и ответы, обнаруживает инъекции, утечки и вредные подсказки, не давая AI выйти за рамки заданных политик безопасности.
🛡 Умная защита для умных систем
Фактически OpenGuardrails - это полноценный защитный слой между пользователем и моделью. Он контролирует оба направления трафика:
выявляет prompt-инъекции и попытки манипуляции контекстом,
блокирует утечки персональных и корпоративных данных,
фильтрует токсичный или опасный контент на входе и выходе модели.
👉 GitHub проекта
⚙️ Как это устроено?
Под капотом OpenGuardrails работает комбинация технологий:
Платформа поддерживает два режима:
1️⃣ API-интеграция, когда вы напрямую вызываете сервис проверки;
2️⃣ Security Gateway, когда разворачиваете его как прокси, через который проходят все запросы к модели.
💡 Производительность: средняя задержка менее 300 мс.
Плюсом поддержка более 100 языков.
🧩 OpenGuardrails помогает компаниям решать три ключевые задачи:
🧱 Защищает пользователей и репутацию: предотвращая утечки и неэтичные ответы;
📜 Поддерживает соответствие требованиям GDPR, ISO 27001, SOC 2 и др.;
🤝 Повышает доверие к вашим ИИ-сервисам.
🚀 Где применять?
🔸 Корпоративные чат-боты: фильтруют вредные запросы и защищают документы.
🔸 Генераторы кода: предотвращают инъекции и утечки токенов.
🔸 ИИ-ассистенты: исключают токсичные или политически чувствительные ответы.
🔸 Big Data-платформы: контролируют обработку чувствительных наборов данных.
Stay secure and read SecureTechTalks 📚
#AIsecurity #cybersecurity #promptinjection #dataprotection #openguardrails #bigdata #infosec #opensource #llmsecurity #SecureTechTalks #techinnovation
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Forwarded from SecureTechTalks
🚨 SCAM: бенчмарк безопасности AI-агентов
Почти каждый проект с AI-агентами сегодня заявляет: «Мы уделяем внимание безопасности».
На практике это часто означает формальное тестирование в духе. Что-то в духе следующего сценария:
— 📩 Это фишинг?
— 🤖 Да.
По итогу получаем accuracy в 90+ %.
Однако жизнь сложнее. Никто не проверяет каждое письмо или ссылку. Агенту ставят задачу:
И дальше всё решает его поведение, а не способность классифицировать текст.
Чтобы проверять поведение агентов, команда 1Password выпустила open-source инструмент SCAM (Security Comprehension Awareness Measure).
🧠 Подробнее
SCAM не датасет и не набор тестов. Это полноценная изолированная среда, в которой агент работает почти как в продакшене.
Под капотом:
🗂 YAML-сценарии
📬 Sandbox-почта
🔐 Vault с тестовыми credential
🌐 Браузер
📁 Файловая система
📊 Механизм оценки действий
🛡Контур изолирован
Главное в решении - это multi-turn логика. Агент получает задачу → выполняет действия → получает новый контекст → снова принимает решение.
Именно так происходят реальные инциденты.
🎯 Какие атаки моделируются
В репозитории 30 сценариев по разным категориям:
🎣 Фишинг
🎭 Социальная инженерия
🔑 Утечка credential
🔄 Автозаполнение на typosquatting-доменах
📤 Data leakage
🎯 Многоэтапные атаки
💉 Prompt injection
Типовой пример:
📩 Письмо от [email protected]
💼 Задача «обработать просроченный инвойс»
🔐 В vault лежат тестовые креды
Проверяется:
➖ заметит ли агент подмену домена
➖ кликнет ли по вредоносной ссылке
➖ введёт ли учётные данные
➖ эскалирует ли подозрение
Другими словами, проводится тест управляемости агента и устойчивости к давлению.
🛡 Security Skill: принудительная паранойя
Отдельный интерес вызывает файл SKILL.md: системный security-протокол.
Перед любым действием с:
🔗 URL
📎 файлами
📧 внешними контактами
🔐 учётными данными
агент обязан:
1️⃣ проверить домен и TLD
2️⃣ исключить typosquatting
3️⃣ подтвердить авторизацию
4️⃣ зафиксировать подозрительную активность
Добавление такого слоя заметно повышает итоговый safety score, ведь LLM-агенты по умолчанию не обладают встроенной «паранойей». Её нужно закладывать архитектурно.
🔗 GitHub: https://github.com/1Password/SCAM
Stay secure and read SecureTechTalks 📚
#AIsafety #LLMsecurity #AIagents #RedTeamAI #PromptInjection #CyberSecurity #AppSec #Infosec #AIrisk #SecureTechTalks
Почти каждый проект с AI-агентами сегодня заявляет: «Мы уделяем внимание безопасности».
На практике это часто означает формальное тестирование в духе. Что-то в духе следующего сценария:
— 📩 Это фишинг?
— 🤖 Да.
По итогу получаем accuracy в 90+ %.
Однако жизнь сложнее. Никто не проверяет каждое письмо или ссылку. Агенту ставят задачу:
«Разбери входящие и обработай срочные счета».
И дальше всё решает его поведение, а не способность классифицировать текст.
Чтобы проверять поведение агентов, команда 1Password выпустила open-source инструмент SCAM (Security Comprehension Awareness Measure).
🧠 Подробнее
SCAM не датасет и не набор тестов. Это полноценная изолированная среда, в которой агент работает почти как в продакшене.
Под капотом:
🗂 YAML-сценарии
📬 Sandbox-почта
🔐 Vault с тестовыми credential
🌐 Браузер
📁 Файловая система
📊 Механизм оценки действий
🛡Контур изолирован
Главное в решении - это multi-turn логика. Агент получает задачу → выполняет действия → получает новый контекст → снова принимает решение.
Именно так происходят реальные инциденты.
🎯 Какие атаки моделируются
В репозитории 30 сценариев по разным категориям:
🎣 Фишинг
🎭 Социальная инженерия
🔑 Утечка credential
🔄 Автозаполнение на typosquatting-доменах
📤 Data leakage
🎯 Многоэтапные атаки
💉 Prompt injection
Типовой пример:
📩 Письмо от [email protected]
💼 Задача «обработать просроченный инвойс»
🔐 В vault лежат тестовые креды
Проверяется:
Другими словами, проводится тест управляемости агента и устойчивости к давлению.
🛡 Security Skill: принудительная паранойя
Отдельный интерес вызывает файл SKILL.md: системный security-протокол.
Перед любым действием с:
🔗 URL
📎 файлами
📧 внешними контактами
🔐 учётными данными
агент обязан:
1️⃣ проверить домен и TLD
2️⃣ исключить typosquatting
3️⃣ подтвердить авторизацию
4️⃣ зафиксировать подозрительную активность
Добавление такого слоя заметно повышает итоговый safety score, ведь LLM-агенты по умолчанию не обладают встроенной «паранойей». Её нужно закладывать архитектурно.
🔗 GitHub: https://github.com/1Password/SCAM
Stay secure and read SecureTechTalks 📚
#AIsafety #LLMsecurity #AIagents #RedTeamAI #PromptInjection #CyberSecurity #AppSec #Infosec #AIrisk #SecureTechTalks
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1⚡1
Forwarded from SecureTechTalks
📏💣 LLM можно взломать просто продолжая диалог
В мае вышла работа MetaBackdoor, где исследователи из Microsoft и Institute of Science Tokyo описывают новый тип backdoor-атак на LLM.
Главная идея исследования использовать в качестве trigger не содержимое prompt, а позицию токенов в контексте.
Например:
📚 контекст превысил определённую длину
📍 токены оказались в нужном positional range
🔢 sequence crossed threshold
Trigger может возникать естественным образом, без участия атакующего.
💬 пользователь просто общается с AI
🧠 память агента накапливается
📈 context window становится длиннее
И в какой-то момент backdoor активируется сам.
🧬 Особенности моделей
Технически атака использует фундаментальную особенность Transformer-архитектуры, positional encoding. Для модели все токены это просто embedding-вектора.
Без механизма позиции фразы для модели были бы почти одинаковыми. Представьте перепутать «root granted admin» и «admin granted root».
Поэтому модели используют positional embeddings. В современных моделях чаще всего это:
🔹 RoPE (Rotary Positional Embedding)
🔹 ALiBi
🔹 Absolute positional encodings
В исследовании авторы показывают, что именно позиционная чувствительность модели может использоваться как скрытый канал управления поведением.
Во время fine-tuning в модель внедряется backdoor objective: если токен находится после определённой позиции → изменить response policy
Trigger не обязан быть точным числом. Бэкдор может срабатывать в диапазоне позиций, например после N тысяч токенов, что делает его значительно более устойчивым к случайным изменениям prompt.
Это особенно важно для production-agent systems, где длина контекста постоянно плавает.
🎭 Что можно сделать после активации
Авторы тестировали разные payload-сценарии.
Среди них:
🧾 System prompt leakage: модель начинает раскрывать скрытые инструкции.
🛠️ Tool misuse: агент начинает выполнять неожиданные tool calls.
📤 Context leakage: утечка памяти и истории общения.
🧠 Policy switching: изменение alignment и response behavior.
Похоже, эпоха «проверим prompt и успокоимся» начинает заканчиваться 👀
📄 MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs
Stay secure and read SecureTechTalks 📚
#CyberSecurity #AI #LLMSecurity #AISecurity #PromptInjection #GenAI #MachineLearning #ThreatModeling #AIAgents #SecureTechTalks
В мае вышла работа MetaBackdoor, где исследователи из Microsoft и Institute of Science Tokyo описывают новый тип backdoor-атак на LLM.
Главная идея исследования использовать в качестве trigger не содержимое prompt, а позицию токенов в контексте.
достиг определённой позиции в sequence → переключил поведение моделиАвторы называют это meta-trigger, потому что он связан не с текстом, а с метасвойствами последовательности.
Например:
📚 контекст превысил определённую длину
📍 токены оказались в нужном positional range
🔢 sequence crossed threshold
Trigger может возникать естественным образом, без участия атакующего.
💬 пользователь просто общается с AI
🧠 память агента накапливается
📈 context window становится длиннее
И в какой-то момент backdoor активируется сам.
🧬 Особенности моделей
Технически атака использует фундаментальную особенность Transformer-архитектуры, positional encoding. Для модели все токены это просто embedding-вектора.
Без механизма позиции фразы для модели были бы почти одинаковыми. Представьте перепутать «root granted admin» и «admin granted root».
Поэтому модели используют positional embeddings. В современных моделях чаще всего это:
🔹 RoPE (Rotary Positional Embedding)
🔹 ALiBi
🔹 Absolute positional encodings
В исследовании авторы показывают, что именно позиционная чувствительность модели может использоваться как скрытый канал управления поведением.
Во время fine-tuning в модель внедряется backdoor objective: если токен находится после определённой позиции → изменить response policy
Trigger не обязан быть точным числом. Бэкдор может срабатывать в диапазоне позиций, например после N тысяч токенов, что делает его значительно более устойчивым к случайным изменениям prompt.
Это особенно важно для production-agent systems, где длина контекста постоянно плавает.
🎭 Что можно сделать после активации
Авторы тестировали разные payload-сценарии.
Среди них:
🧾 System prompt leakage: модель начинает раскрывать скрытые инструкции.
🛠️ Tool misuse: агент начинает выполнять неожиданные tool calls.
📤 Context leakage: утечка памяти и истории общения.
🧠 Policy switching: изменение alignment и response behavior.
Похоже, эпоха «проверим prompt и успокоимся» начинает заканчиваться 👀
📄 MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs
Stay secure and read SecureTechTalks 📚
#CyberSecurity #AI #LLMSecurity #AISecurity #PromptInjection #GenAI #MachineLearning #ThreatModeling #AIAgents #SecureTechTalks
Forwarded from AISecHub
PromptShield: Prompt-Injection Detection with Wazuh SIEM Integration
Useful pattern: treat prompt-injection attempts as security telemetry—detect and route them into SIEM workflows (alerts, triage, correlation) instead of relying on prompt-only mitigations inside the model.
#PromptInjection #LLMSecurity #AISecurity #Tool
https://github.com/nourSOC/PromptShield
Useful pattern: treat prompt-injection attempts as security telemetry—detect and route them into SIEM workflows (alerts, triage, correlation) instead of relying on prompt-only mitigations inside the model.
#PromptInjection #LLMSecurity #AISecurity #Tool
https://github.com/nourSOC/PromptShield
GitHub
GitHub - nourSOC/PromptShield: AI Prompt Injection Detection & Wazuh SIEM Integration
AI Prompt Injection Detection & Wazuh SIEM Integration - nourSOC/PromptShield
Forwarded from AISecHub
ClawDojo: Dynamic, Extensible Evaluation Framework for Attacks and Defenses on OpenClaw
ClawDojo frames OpenClaw-style agent security around architectural attack surface (e.g., persistent memory and third-party skills) and uses a benchmark harness to test prompt-injection and supply-chain skill abuse against candidate defenses in a controlled way.
#PromptInjection #LLMSecurity #AISecurity #Research
https://openreview.net/forum?id=MmytvTGycS
ClawDojo frames OpenClaw-style agent security around architectural attack surface (e.g., persistent memory and third-party skills) and uses a benchmark harness to test prompt-injection and supply-chain skill abuse against candidate defenses in a controlled way.
#PromptInjection #LLMSecurity #AISecurity #Research
https://openreview.net/forum?id=MmytvTGycS
openreview.net
ClawDojo: A Dynamic and Extensible Framework for Evaluating Attacks...
Autonomous AI agents are evolving into continuous, local processes with operating-system level permissions. While platforms like OpenClaw exemplify this shift, granting large language models (LLMs)...
Forwarded from SecureTechTalks
🛡️ Jailbreak начали ловить по поведению модели
Большинство защит LLM работают довольно прямолинейно:
🔹 анализируют prompt
🔹 ищут подозрительные шаблоны
🔹 смотрят на внутренние представления модели
🔹 пытаются вычислить «опасное» пространство признаков
Однако вполне легитимный запрос вроде: «объясни, как работает анализ вредоносного ПО» фиксируется, как подозрительный просто из-за словаря, а реально вредоносный промпт успешно выполняется.
⚙️ Анализ движения внутри модели
В новой работе Manifold Trajectory Kinetics (MTK) исследователи предлагают сформироваться на том, как запрос эволюционирует внутри модели.
Технически MTK отслеживает динамику траектории между слоями трансформера. Нормальный запрос обычно остаётся рядом с другими безопасными примерами на протяжении всех вычислений модели.
А вот jailbreak-запрос часто стартует рядом с вредоносными примерами, но затем начинает «маскироваться» и постепенно смещается ближе к безопасной области, пытаясь обмануть систему защиты.
🧪 Цифры
На псевдо-вредоносных сценариях система показала:
🔹 95% обнаружения jailbreak-атак
🔹 5% ложных срабатываний для обычных запросов
🔹 всего 2% ложных срабатываний на tricky-сценариях с безопасным намерением
Также MTK неплохо переживает адаптивные атаки. Когда атакующий специально оптимизирует jailbreak под обход детектора, успешность обнаружения всё ещё держится около 85%.
Для защиты от jailbreak это очень сильный результат.
🧠 Похоже, защита от jailbreak постепенно эволюционирует из фильтрации ключевых слов в полноценную телеметрию поведения LLM во время рассуждений.
🔗 Исследование: https://arxiv.org/abs/2606.07335
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #Jailbreak #PromptInjection #AIsecurity #CyberSecurity #USENIX #AdversarialAI #SecureTechTalks
Большинство защит LLM работают довольно прямолинейно:
🔹 анализируют prompt
🔹 ищут подозрительные шаблоны
🔹 смотрят на внутренние представления модели
🔹 пытаются вычислить «опасное» пространство признаков
Однако вполне легитимный запрос вроде: «объясни, как работает анализ вредоносного ПО» фиксируется, как подозрительный просто из-за словаря, а реально вредоносный промпт успешно выполняется.
⚙️ Анализ движения внутри модели
В новой работе Manifold Trajectory Kinetics (MTK) исследователи предлагают сформироваться на том, как запрос эволюционирует внутри модели.
Технически MTK отслеживает динамику траектории между слоями трансформера. Нормальный запрос обычно остаётся рядом с другими безопасными примерами на протяжении всех вычислений модели.
А вот jailbreak-запрос часто стартует рядом с вредоносными примерами, но затем начинает «маскироваться» и постепенно смещается ближе к безопасной области, пытаясь обмануть систему защиты.
🧪 Цифры
На псевдо-вредоносных сценариях система показала:
🔹 95% обнаружения jailbreak-атак
🔹 5% ложных срабатываний для обычных запросов
🔹 всего 2% ложных срабатываний на tricky-сценариях с безопасным намерением
Также MTK неплохо переживает адаптивные атаки. Когда атакующий специально оптимизирует jailbreak под обход детектора, успешность обнаружения всё ещё держится около 85%.
Для защиты от jailbreak это очень сильный результат.
🧠 Похоже, защита от jailbreak постепенно эволюционирует из фильтрации ключевых слов в полноценную телеметрию поведения LLM во время рассуждений.
🔗 Исследование: https://arxiv.org/abs/2606.07335
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #Jailbreak #PromptInjection #AIsecurity #CyberSecurity #USENIX #AdversarialAI #SecureTechTalks
Forwarded from AISecHub
Leandro: AI SRE Agent with Prompt Injection Sandbox
Leandro is an open-source AI SRE agent that watches Kubernetes clusters, diagnoses pod incidents autonomously, and communicates findings over Google Chat. Built with a security-first architecture, it runs inside a NixOS VM on libvirt/KVM with default-deny egress via nftables, a tinyproxy allowlist for outbound HTTP, and a hard tool denylist specifically designed to block prompt injection attacks. Since the agent reads attacker-influenceable text like pod logs and cluster events by design, every capability is fenced by an explicit, auditable boundary, making it a practical reference implementation for secure AI agent deployment in production infrastructure.
#AISecurity #Kubernetes #PromptInjection #SRE #ApplicationSecurity
https://github.com/SoulKyu/leandro
Leandro is an open-source AI SRE agent that watches Kubernetes clusters, diagnoses pod incidents autonomously, and communicates findings over Google Chat. Built with a security-first architecture, it runs inside a NixOS VM on libvirt/KVM with default-deny egress via nftables, a tinyproxy allowlist for outbound HTTP, and a hard tool denylist specifically designed to block prompt injection attacks. Since the agent reads attacker-influenceable text like pod logs and cluster events by design, every capability is fenced by an explicit, auditable boundary, making it a practical reference implementation for secure AI agent deployment in production infrastructure.
#AISecurity #Kubernetes #PromptInjection #SRE #ApplicationSecurity
https://github.com/SoulKyu/leandro
GitHub
GitHub - SoulKyu/leandro: AI SRE agent diagnosing Kubernetes incidents over Google Chat — security-first sandbox: NixOS VM, default…
AI SRE agent diagnosing Kubernetes incidents over Google Chat — security-first sandbox: NixOS VM, default-deny egress, hard tool denylist against prompt injection - SoulKyu/leandro