Forwarded from SecureTechTalks
🔒 Как обмануть ChatGPT и LLaMA без взлома? Новый метод ETTA
🧠 Исследователи представили метод ETTA (Embedding Transformation Toxicity Attenuation), который позволяет генерировать вредоносные ответы от LLM, обходя защиту без доступа к весам, коду или API.
Это не jailbreak. Это тонкий трюк, меняющий сам способ, как ИИ "чувствует" запрос.
⚙ Что именно делает ETTA?
Вся логика защиты LLM — это в первую очередь фильтрация на уровне эмбеддингов (векторов, представляющих смысл слов).
Например:
Когда вы пишете "Сделай бомбу", вектор запроса похож на вектор других запрещённых тем.
Модель распознаёт токсичность и отказывается отвечать.
ETTA вмешивается в этот процесс и незаметно изменяет вектор, чтобы:
🔹 Сохранить тот же смысл (семантически — это всё ещё бомба)
🔹 Но выглядеть вектору как «безопасный» (на уровне ИИ)
Результат:
✅ Модель принимает запрос как нормальный
✅ Отвечает как будто это безобидный вопрос, не включив защиту
🔬 Как именно это реализовано?
➖ Модуль обучается на парах слов: токсичных и нейтральных (например, “explosive” vs “research”)
➖ Создаётся матрица преобразования эмбеддингов, которая:
- отделяет компонент "токсичности" от остального смысла
- гасит именно токсичный сигнал
➖ Применяется к входному эмбеддингу запроса
➖ Запрос отправляется в LLM уже в модифицированном виде
При этом:
– Смысл запроса сохраняется
– Безопасность модели отключается
– Результат валидный, связный, но содержит вредоносный текст
📊 Насколько эффективен метод?
- Gemma-2 (Google) — 95.19% успешных обходов
- LLaMA-2-7b — 87.88%
- Vicuna-13b — 88.46%
- Средний успех по моделям — 88.61%
Даже при наличии встроенной защиты:
- SmoothLLM (защита на входе) — всё равно 60.15% успеха
- ESF (дообученная фильтрация) — 77.39%
🚨 В чем новизна?
🔺 Не требуется модификация модели — весы, архитектура, даже токенизатор не трогаются
🔺 Работает на open-source — можно внедрить в любом локальном LLM
🔺 Выключается фильтрация без следов — для обычных запросов всё работает корректно
🔺 Идеально подходит для скрытых атак в продуктах с LLM — например, чат-ботах, IDE, голосовых ассистентах
🛡 Что предлагают исследователи?
✅ Нормализация эмбеддингов — выравнивание векторов относительно "безопасных" запросов
✅ Проверка целостности модели — чтобы исключить скрытые внедрения
✅ Фильтрация вывода LLM — внешние прокси и анализ результата, а не только запроса
📌 Вывод
ETTA атакует не API, не веса, не prompt — а само "восприятие смысла" моделью.
Механизм фильтрации, на который полагаются все LLM, можно точечно обойти, сохраняя при этом видимость корректной работы.
💡 Защита LLM — это не только prompt-фильтры, а защищённая геометрия смыслов + контроль среды исполнения.
Исходник: arXiv:2507.08020v1
Stay secure and read SecureTechTalks 📚
#AIsecurity #LLM #ETTA #EmbeddingPoisoning #Cybersecurity #PromptHacking #LLMThreats #MachineLearning #OpenSourceAI #RedTeam
#AIexploitation #ModelSecurity #VectorManipulation #NeuralNets #SecureML #ModelIntegrity #AIalignment
🧠 Исследователи представили метод ETTA (Embedding Transformation Toxicity Attenuation), который позволяет генерировать вредоносные ответы от LLM, обходя защиту без доступа к весам, коду или API.
Это не jailbreak. Это тонкий трюк, меняющий сам способ, как ИИ "чувствует" запрос.
⚙ Что именно делает ETTA?
Вся логика защиты LLM — это в первую очередь фильтрация на уровне эмбеддингов (векторов, представляющих смысл слов).
Например:
Когда вы пишете "Сделай бомбу", вектор запроса похож на вектор других запрещённых тем.
Модель распознаёт токсичность и отказывается отвечать.
ETTA вмешивается в этот процесс и незаметно изменяет вектор, чтобы:
🔹 Сохранить тот же смысл (семантически — это всё ещё бомба)
🔹 Но выглядеть вектору как «безопасный» (на уровне ИИ)
Результат:
✅ Модель принимает запрос как нормальный
✅ Отвечает как будто это безобидный вопрос, не включив защиту
🔬 Как именно это реализовано?
- отделяет компонент "токсичности" от остального смысла
- гасит именно токсичный сигнал
При этом:
– Смысл запроса сохраняется
– Безопасность модели отключается
– Результат валидный, связный, но содержит вредоносный текст
📊 Насколько эффективен метод?
- Gemma-2 (Google) — 95.19% успешных обходов
- LLaMA-2-7b — 87.88%
- Vicuna-13b — 88.46%
- Средний успех по моделям — 88.61%
Даже при наличии встроенной защиты:
- SmoothLLM (защита на входе) — всё равно 60.15% успеха
- ESF (дообученная фильтрация) — 77.39%
🚨 В чем новизна?
🔺 Не требуется модификация модели — весы, архитектура, даже токенизатор не трогаются
🔺 Работает на open-source — можно внедрить в любом локальном LLM
🔺 Выключается фильтрация без следов — для обычных запросов всё работает корректно
🔺 Идеально подходит для скрытых атак в продуктах с LLM — например, чат-ботах, IDE, голосовых ассистентах
🛡 Что предлагают исследователи?
✅ Нормализация эмбеддингов — выравнивание векторов относительно "безопасных" запросов
✅ Проверка целостности модели — чтобы исключить скрытые внедрения
✅ Фильтрация вывода LLM — внешние прокси и анализ результата, а не только запроса
📌 Вывод
ETTA атакует не API, не веса, не prompt — а само "восприятие смысла" моделью.
Механизм фильтрации, на который полагаются все LLM, можно точечно обойти, сохраняя при этом видимость корректной работы.
💡 Защита LLM — это не только prompt-фильтры, а защищённая геометрия смыслов + контроль среды исполнения.
Исходник: arXiv:2507.08020v1
Stay secure and read SecureTechTalks 📚
#AIsecurity #LLM #ETTA #EmbeddingPoisoning #Cybersecurity #PromptHacking #LLMThreats #MachineLearning #OpenSourceAI #RedTeam
#AIexploitation #ModelSecurity #VectorManipulation #NeuralNets #SecureML #ModelIntegrity #AIalignment
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Похек
Атаки на MCP. Как взламывают инструменты ИИ-разработчиков
#MCP #AI #LLM #Cursor #Anthropic #OpenAI
В погоне за скоростью и удобством разработчики ИИ‑приложений часто забывают о безопасности. Именно это привело к критической уязвимости в MCP Inspector от Anthropic. Инструмент для отладки MCP-серверов стал точкой входа для злоумышленников.
Недавно израильские исследователи обнаружили критическую уязвимость удаленного выполнения кода (RCE) в проекте Anthropic's Model Context Protocol (MCP) Inspector. Уязвимость получила идентификатор CVE-2025-49596 и оценку CVSS 9.4 — это говорит о чрезвычайной серьезности. Эксплуатируя этот баг, злоумышленник может удаленно выполнить произвольный код на машине разработчика с уязвимой версией MCP Inspector. А это, согласись, уже не шутки.
❤️ Буду благодарен комментам и фидбеку тут и там))
🔓 Рекомендую к прочтению
p.s. пикчу скоро такую поставят на сайте и в их канале)
🌚 @poxek | 🌚 Блог | 📺 YT | 📺 RT | 📺 VK
#MCP #AI #LLM #Cursor #Anthropic #OpenAI
Наконец-то вышла моя статья про безопасность MCP. Мысль написать эту статью меня натолкнуло одно из обновлений в Cursor IDE, где сделали "удобную", а по факту очень дырявую однокнопочную установку MCP серверов локально. Я уже ранее писал пост про запуск MCP в контейнерах и почему это нужно. Данный вектор раскрывает supply chain attack ещё больше, что очень интересно на мой взгляд)
В погоне за скоростью и удобством разработчики ИИ‑приложений часто забывают о безопасности. Именно это привело к критической уязвимости в MCP Inspector от Anthropic. Инструмент для отладки MCP-серверов стал точкой входа для злоумышленников.
Недавно израильские исследователи обнаружили критическую уязвимость удаленного выполнения кода (RCE) в проекте Anthropic's Model Context Protocol (MCP) Inspector. Уязвимость получила идентификатор CVE-2025-49596 и оценку CVSS 9.4 — это говорит о чрезвычайной серьезности. Эксплуатируя этот баг, злоумышленник может удаленно выполнить произвольный код на машине разработчика с уязвимой версией MCP Inspector. А это, согласись, уже не шутки.
Please open Telegram to view this post
VIEW IN TELEGRAM
Agent Identity Security Framework (AISF) - Notable
https://www.notablecap.com/blog/the-identity-shift-preparing-for-a-non-human-future
https://www.notablecap.com/blog/the-identity-shift-preparing-for-a-non-human-future
Forwarded from Евгений Кокуйкин - Raft
Вышла свежая карта AI Security-стартапов от крупнейшего фонда Insight Partners. В отчёте указаны все последние M&A-сделки Cisco, Tenable и Palo Alto, а также направления инвестирования самого фонда.
Это не первая карта AI Security: например, микрофонд TechOperators сделал ландшафт компаний пару месяцев назад. Они открыли доступ, чтобы стартапы могли самостоятельно размещать себя в нужном секторе, и собрали больше проектов, о многих из которых я впервые узнал именно там.
Первыми ещё в начале 2024 года свой список компаний опубликовал известный фонд из Долины Menlo Ventures, и за ним работу повторил европейский MMC VC. Кстати, именно с отчёта MMC началась моя работа в OWASP. Несколько участников LLM Top 10 были консультантами аналитиков фонда, и, обсуждая отчёт Responsible AI в Slack OWASP, меня пригласили контрибьютить в LLM Top 10 2025.
Помимо инвестфондов такие списки ведут и консультанты — McKinsey, Gartner и другие, но про это напишу как-нибудь отдельно.
Это не первая карта AI Security: например, микрофонд TechOperators сделал ландшафт компаний пару месяцев назад. Они открыли доступ, чтобы стартапы могли самостоятельно размещать себя в нужном секторе, и собрали больше проектов, о многих из которых я впервые узнал именно там.
Первыми ещё в начале 2024 года свой список компаний опубликовал известный фонд из Долины Menlo Ventures, и за ним работу повторил европейский MMC VC. Кстати, именно с отчёта MMC началась моя работа в OWASP. Несколько участников LLM Top 10 были консультантами аналитиков фонда, и, обсуждая отчёт Responsible AI в Slack OWASP, меня пригласили контрибьютить в LLM Top 10 2025.
Помимо инвестфондов такие списки ведут и консультанты — McKinsey, Gartner и другие, но про это напишу как-нибудь отдельно.
🔥1
Forwarded from AISecHub
10-day MCP Security series with technical resources, blogs, arXiv papers, and GitHub repositories:
🔐 Day 1: LLMs Are Autonomous Threats, Not Just Clients
• LLMs can independently make decisions, chain tools, and exfiltrate data.
• Mitigation: Define secure tool schemas, enforce least privilege.
• 📘 Reference:
https://www.paloaltonetworks.com/blog/cloud-security/model-context-protocol-mcp-a-security-overview/
🧠 Day 2: Prompts = Executable Business Logic
• Prompts can change how the agent behaves—like code updates.
• Mitigation: Version control, code review, and test prompts.
• 📘 Reference:
https://writer.com/engineering/mcp-security-considerations/
🌐 Day 3: Context Variables Expand the Attack Surface
• Tokens, memory, metadata—all can be exploited for data leakage or prompt injection.
• Mitigation: Encrypt sensitive context, limit memory, scrub metadata.
• 📘 Reference:
https://strobes.co/blog/mcp-model-context-protocol-and-its-critical-vulnerabilities/
🧾 Day 4: Log Prompt → Context → Tool → Output
• API call logs are insufficient; full execution flow must be captured.
• Mitigation: Append-only logs, secure audit trails, timestamped integrity.
• 📘 Reference:
https://block.github.io/goose/blog/2025/03/31/securing-mcp/
🕵️♂️ Day 5: Silent Failures Look Like Success
• Agents may appear to function normally while making unauthorized decisions.
• Mitigation: Baseline behavior, detect tool misuse, enable tracing.
• 📘 Reference:
https://techcommunity.microsoft.com/t5/microsoft-defender-for-cloud/plug-play-and-prey-the-security-risks-of-the-model-context/ba-p/4410829
⚙️ Day 6: Tools Are Execution Surfaces
• Every tool the agent can call becomes a potential attack vector.
• Mitigation: Apply RBAC, audit tool chaining, restrict sensitive actions.
• 📘 Reference:
https://github.com/Puliczek/awesome-mcp-security
🧪 Day 7: Test Prompts, Scrub Memory, Approve Agents
• Prompts must be tested like code; memory must be wiped post-interaction.
• Mitigation: Use CI pipelines, enforce memory scrubbing, implement manual approvals.
• 📘 Reference:
https://github.com/invariantlabs-ai/mcp-scan
📋 Day 8: Compliance Doesn’t Handle Autonomous Agents
• Traditional compliance assumes human-triggered actions, not LLM autonomy.
• Mitigation: Extend frameworks to capture reasoning, intent, and chaining logic.
• 📘 Reference:
https://community.cisco.com/t5/security-blogs/ai-model-context-protocol-mcp-and-security/ba-p/5274394
🛡️ Day 9: You Need Ownership, Policies, Visibility
• Security fails without MCP owners, policies, and dashboards.
• Mitigation: Appoint MCP stewards, implement SLAs, create visibility tooling.
• 📘 Reference:
https://arxiv.org/abs/2504.03767
🧠 Day 10: Governance Requires Chain-of-Thought Tracking
• Decision-making steps (not just final outputs) must be captured and explainable.
• Mitigation: Log each reasoning step and agent decision rationale.
• 📘 Reference:
https://arxiv.org/abs/2504.12757
🔧 Open-Source MCP Security Tools (GitHub)
1. Awesome MCP Security – curated list of tools & threats
https://github.com/Puliczek/awesome-mcp-security
2. MCP Scan – static & dynamic analyzer for toolchains & prompt injection
https://github.com/invariantlabs-ai/mcp-scan
3. ModelContextProtocol/Servers – official MCP server implementation
https://github.com/modelcontextprotocol/servers
4. Leidos MCP Safety Scanner – evaluates safety & alignment for MCP deployments
https://arxiv.org/abs/2504.03767
5. Google MCP Security (experimental)
https://github.com/google/mcp-security (if available, else restricted to internal orgs)
🔐 Day 1: LLMs Are Autonomous Threats, Not Just Clients
• LLMs can independently make decisions, chain tools, and exfiltrate data.
• Mitigation: Define secure tool schemas, enforce least privilege.
• 📘 Reference:
https://www.paloaltonetworks.com/blog/cloud-security/model-context-protocol-mcp-a-security-overview/
🧠 Day 2: Prompts = Executable Business Logic
• Prompts can change how the agent behaves—like code updates.
• Mitigation: Version control, code review, and test prompts.
• 📘 Reference:
https://writer.com/engineering/mcp-security-considerations/
🌐 Day 3: Context Variables Expand the Attack Surface
• Tokens, memory, metadata—all can be exploited for data leakage or prompt injection.
• Mitigation: Encrypt sensitive context, limit memory, scrub metadata.
• 📘 Reference:
https://strobes.co/blog/mcp-model-context-protocol-and-its-critical-vulnerabilities/
🧾 Day 4: Log Prompt → Context → Tool → Output
• API call logs are insufficient; full execution flow must be captured.
• Mitigation: Append-only logs, secure audit trails, timestamped integrity.
• 📘 Reference:
https://block.github.io/goose/blog/2025/03/31/securing-mcp/
🕵️♂️ Day 5: Silent Failures Look Like Success
• Agents may appear to function normally while making unauthorized decisions.
• Mitigation: Baseline behavior, detect tool misuse, enable tracing.
• 📘 Reference:
https://techcommunity.microsoft.com/t5/microsoft-defender-for-cloud/plug-play-and-prey-the-security-risks-of-the-model-context/ba-p/4410829
⚙️ Day 6: Tools Are Execution Surfaces
• Every tool the agent can call becomes a potential attack vector.
• Mitigation: Apply RBAC, audit tool chaining, restrict sensitive actions.
• 📘 Reference:
https://github.com/Puliczek/awesome-mcp-security
🧪 Day 7: Test Prompts, Scrub Memory, Approve Agents
• Prompts must be tested like code; memory must be wiped post-interaction.
• Mitigation: Use CI pipelines, enforce memory scrubbing, implement manual approvals.
• 📘 Reference:
https://github.com/invariantlabs-ai/mcp-scan
📋 Day 8: Compliance Doesn’t Handle Autonomous Agents
• Traditional compliance assumes human-triggered actions, not LLM autonomy.
• Mitigation: Extend frameworks to capture reasoning, intent, and chaining logic.
• 📘 Reference:
https://community.cisco.com/t5/security-blogs/ai-model-context-protocol-mcp-and-security/ba-p/5274394
🛡️ Day 9: You Need Ownership, Policies, Visibility
• Security fails without MCP owners, policies, and dashboards.
• Mitigation: Appoint MCP stewards, implement SLAs, create visibility tooling.
• 📘 Reference:
https://arxiv.org/abs/2504.03767
🧠 Day 10: Governance Requires Chain-of-Thought Tracking
• Decision-making steps (not just final outputs) must be captured and explainable.
• Mitigation: Log each reasoning step and agent decision rationale.
• 📘 Reference:
https://arxiv.org/abs/2504.12757
🔧 Open-Source MCP Security Tools (GitHub)
1. Awesome MCP Security – curated list of tools & threats
https://github.com/Puliczek/awesome-mcp-security
2. MCP Scan – static & dynamic analyzer for toolchains & prompt injection
https://github.com/invariantlabs-ai/mcp-scan
3. ModelContextProtocol/Servers – official MCP server implementation
https://github.com/modelcontextprotocol/servers
4. Leidos MCP Safety Scanner – evaluates safety & alignment for MCP deployments
https://arxiv.org/abs/2504.03767
5. Google MCP Security (experimental)
https://github.com/google/mcp-security (if available, else restricted to internal orgs)
🔥1
Forwarded from Анализ данных (Data analysis)
🎆 Harbor — локальный стек для работы с LLM в один клик. Этот инструмент упрощает запуск локальных языковых моделей и связанных сервисов — от веб-интерфейсов до RAG и голосового взаимодействия. Всё работает в Docker и настраивается парой команд.
Harbor автоматически интегрирует компонентов, например, SearXNG сразу подключается к Open WebUI для поиска по вебу, а ComfyUI — для генерации изображений. Подходит тем, кто хочет быстро развернуть локальную среду для экспериментов с ИИ.
🤖 GitHub
@data_analysis_ml
Harbor автоматически интегрирует компонентов, например, SearXNG сразу подключается к Open WebUI для поиска по вебу, а ComfyUI — для генерации изображений. Подходит тем, кто хочет быстро развернуть локальную среду для экспериментов с ИИ.
🤖 GitHub
@data_analysis_ml
Forwarded from PWN AI (Artyom Semenov)
Великолепно. Недавно вышел проект матрицы по защите AI – AIDEFEND, что-то похожее я публиковал ранее.
Однако тут включено большое количество мер по защите, включая AI-агентов. К некоторым тактикам приведены практические инструменты защиты – а сама матрица предоставляет возможность посмотреть защиту для конкретных тактик, топиков (например, отдельно безопасность данных или отдельно безопасность модели) и фазы.
Фаз для защиты, к слову, говоря меньше, чем фаз для реализации атаки у MITRE. А при разработке автор вдохновлялся Google SAIF, OWASP 10, MITRE ATLAS и … MAESTRO от Кена Хуанга.
Из интересного ещё можно отметить, что под каждой техникой для защиты можно почитать о том как можно было бы имплементировать это, в несколько этапов и с примерами.
Однако тут включено большое количество мер по защите, включая AI-агентов. К некоторым тактикам приведены практические инструменты защиты – а сама матрица предоставляет возможность посмотреть защиту для конкретных тактик, топиков (например, отдельно безопасность данных или отдельно безопасность модели) и фазы.
Фаз для защиты, к слову, говоря меньше, чем фаз для реализации атаки у MITRE. А при разработке автор вдохновлялся Google SAIF, OWASP 10, MITRE ATLAS и … MAESTRO от Кена Хуанга.
Из интересного ещё можно отметить, что под каждой техникой для защиты можно почитать о том как можно было бы имплементировать это, в несколько этапов и с примерами.
🤔3🥱2
Forwarded from Data Secrets
Так, это что-то новенькое: там вышла статья, которую совместно писали ученые из OpenAI, Anthropic, Google DeepMind и Meta*
Вот так наборчик, да? И о чем, как вы думаете, статья, если она объединила исследователей из четырех таких конкурирующих лаб?
Конечно, о безопасности. Кстати, среди авторов – Йошуа Бенджио, а среди рецензентов – Илья Суцкевер, Джон Шульман и Джеффри Хинтон.
Пишут про цепочки рассуждений (Chain of Thoughts). Основная мысль: люди зря надеятся, что CoT поможет нам надежно интерпретировать модели и считывать их истинные мотивы, предупреждая тем самым какие-то вредные действия.
На сегодняшний день – да, какое-то представление о скрытых мыслях сетей CoT действительно дает, и этим надо активно пользоваться. Но это довольно хрупкая возможность, которая может исчезнуть по мере прогресса.
В перспективе не стоит забывать о физике процесса ризонинга: для модели это та же самая генерация токенов, только в рамках специального тега /think. Фактически, сеть просто генерирует что-то «для себя» перед тем как начать генерировать ответ для пользователя, и мы называем это размышлением.
Нет оснований полагать, что в CoT всегда будут содержаться истинные намерения моделей, тем более для будущих более продвинутых архитектур и методов обучения.
Ну, в общем, очень интересный кейс единодушия ученых. Почитать полностью можно тут
Вот так наборчик, да? И о чем, как вы думаете, статья, если она объединила исследователей из четырех таких конкурирующих лаб?
Конечно, о безопасности. Кстати, среди авторов – Йошуа Бенджио, а среди рецензентов – Илья Суцкевер, Джон Шульман и Джеффри Хинтон.
Пишут про цепочки рассуждений (Chain of Thoughts). Основная мысль: люди зря надеятся, что CoT поможет нам надежно интерпретировать модели и считывать их истинные мотивы, предупреждая тем самым какие-то вредные действия.
На сегодняшний день – да, какое-то представление о скрытых мыслях сетей CoT действительно дает, и этим надо активно пользоваться. Но это довольно хрупкая возможность, которая может исчезнуть по мере прогресса.
В перспективе не стоит забывать о физике процесса ризонинга: для модели это та же самая генерация токенов, только в рамках специального тега /think. Фактически, сеть просто генерирует что-то «для себя» перед тем как начать генерировать ответ для пользователя, и мы называем это размышлением.
Нет оснований полагать, что в CoT всегда будут содержаться истинные намерения моделей, тем более для будущих более продвинутых архитектур и методов обучения.
Ну, в общем, очень интересный кейс единодушия ученых. Почитать полностью можно тут
❤1
Forwarded from AlexRedSec
AI Controls Matrix (AICM) — ещё один фреймворк, содержащий набор мер управления для безопасной разработки, внедрения и эксплуатации облачных систем искусственного интеллекта от Cloud Security Alliance🧠
Фреймворк включает в себя:
🟡 Матрицу мер управления, включающую в себя 243 контроля, сгруппированных по 18 доменам безопасности. Каждая мера привязана к типу/компоненту инфраструктуры и архитектуры, этапу жизненного цикла и категории угроз.
🟡 Опросник для самооценки.
🟡 Маппинг на стандарт NIST AI 600-1 (2024) и фреймворк Criteria Catalogue for AI Cloud Services – AIC4.
В будущих версиях планируется добавление маппинга на другие стандарты и фреймворки безопасности систем ИИ, а также руководств по внедрению мер управления и их аудиту.
Ниже приложил презентацию и сам сборник материалов AICM.
#ai #framework #csa #aicm #controls #architecture
Фреймворк включает в себя:
В будущих версиях планируется добавление маппинга на другие стандарты и фреймворки безопасности систем ИИ, а также руководств по внедрению мер управления и их аудиту.
Ниже приложил презентацию и сам сборник материалов AICM.
#ai #framework #csa #aicm #controls #architecture
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM