Forwarded from Похек
Атаки на MCP. Как взламывают инструменты ИИ-разработчиков
#MCP #AI #LLM #Cursor #Anthropic #OpenAI
В погоне за скоростью и удобством разработчики ИИ‑приложений часто забывают о безопасности. Именно это привело к критической уязвимости в MCP Inspector от Anthropic. Инструмент для отладки MCP-серверов стал точкой входа для злоумышленников.
Недавно израильские исследователи обнаружили критическую уязвимость удаленного выполнения кода (RCE) в проекте Anthropic's Model Context Protocol (MCP) Inspector. Уязвимость получила идентификатор CVE-2025-49596 и оценку CVSS 9.4 — это говорит о чрезвычайной серьезности. Эксплуатируя этот баг, злоумышленник может удаленно выполнить произвольный код на машине разработчика с уязвимой версией MCP Inspector. А это, согласись, уже не шутки.
❤️ Буду благодарен комментам и фидбеку тут и там))
🔓 Рекомендую к прочтению
p.s. пикчу скоро такую поставят на сайте и в их канале)
🌚 @poxek | 🌚 Блог | 📺 YT | 📺 RT | 📺 VK
#MCP #AI #LLM #Cursor #Anthropic #OpenAI
Наконец-то вышла моя статья про безопасность MCP. Мысль написать эту статью меня натолкнуло одно из обновлений в Cursor IDE, где сделали "удобную", а по факту очень дырявую однокнопочную установку MCP серверов локально. Я уже ранее писал пост про запуск MCP в контейнерах и почему это нужно. Данный вектор раскрывает supply chain attack ещё больше, что очень интересно на мой взгляд)
В погоне за скоростью и удобством разработчики ИИ‑приложений часто забывают о безопасности. Именно это привело к критической уязвимости в MCP Inspector от Anthropic. Инструмент для отладки MCP-серверов стал точкой входа для злоумышленников.
Недавно израильские исследователи обнаружили критическую уязвимость удаленного выполнения кода (RCE) в проекте Anthropic's Model Context Protocol (MCP) Inspector. Уязвимость получила идентификатор CVE-2025-49596 и оценку CVSS 9.4 — это говорит о чрезвычайной серьезности. Эксплуатируя этот баг, злоумышленник может удаленно выполнить произвольный код на машине разработчика с уязвимой версией MCP Inspector. А это, согласись, уже не шутки.
Please open Telegram to view this post
VIEW IN TELEGRAM
Agent Identity Security Framework (AISF) - Notable
https://www.notablecap.com/blog/the-identity-shift-preparing-for-a-non-human-future
https://www.notablecap.com/blog/the-identity-shift-preparing-for-a-non-human-future
Forwarded from Евгений Кокуйкин - Raft
Вышла свежая карта AI Security-стартапов от крупнейшего фонда Insight Partners. В отчёте указаны все последние M&A-сделки Cisco, Tenable и Palo Alto, а также направления инвестирования самого фонда.
Это не первая карта AI Security: например, микрофонд TechOperators сделал ландшафт компаний пару месяцев назад. Они открыли доступ, чтобы стартапы могли самостоятельно размещать себя в нужном секторе, и собрали больше проектов, о многих из которых я впервые узнал именно там.
Первыми ещё в начале 2024 года свой список компаний опубликовал известный фонд из Долины Menlo Ventures, и за ним работу повторил европейский MMC VC. Кстати, именно с отчёта MMC началась моя работа в OWASP. Несколько участников LLM Top 10 были консультантами аналитиков фонда, и, обсуждая отчёт Responsible AI в Slack OWASP, меня пригласили контрибьютить в LLM Top 10 2025.
Помимо инвестфондов такие списки ведут и консультанты — McKinsey, Gartner и другие, но про это напишу как-нибудь отдельно.
Это не первая карта AI Security: например, микрофонд TechOperators сделал ландшафт компаний пару месяцев назад. Они открыли доступ, чтобы стартапы могли самостоятельно размещать себя в нужном секторе, и собрали больше проектов, о многих из которых я впервые узнал именно там.
Первыми ещё в начале 2024 года свой список компаний опубликовал известный фонд из Долины Menlo Ventures, и за ним работу повторил европейский MMC VC. Кстати, именно с отчёта MMC началась моя работа в OWASP. Несколько участников LLM Top 10 были консультантами аналитиков фонда, и, обсуждая отчёт Responsible AI в Slack OWASP, меня пригласили контрибьютить в LLM Top 10 2025.
Помимо инвестфондов такие списки ведут и консультанты — McKinsey, Gartner и другие, но про это напишу как-нибудь отдельно.
🔥1
Forwarded from AISecHub
10-day MCP Security series with technical resources, blogs, arXiv papers, and GitHub repositories:
🔐 Day 1: LLMs Are Autonomous Threats, Not Just Clients
• LLMs can independently make decisions, chain tools, and exfiltrate data.
• Mitigation: Define secure tool schemas, enforce least privilege.
• 📘 Reference:
https://www.paloaltonetworks.com/blog/cloud-security/model-context-protocol-mcp-a-security-overview/
🧠 Day 2: Prompts = Executable Business Logic
• Prompts can change how the agent behaves—like code updates.
• Mitigation: Version control, code review, and test prompts.
• 📘 Reference:
https://writer.com/engineering/mcp-security-considerations/
🌐 Day 3: Context Variables Expand the Attack Surface
• Tokens, memory, metadata—all can be exploited for data leakage or prompt injection.
• Mitigation: Encrypt sensitive context, limit memory, scrub metadata.
• 📘 Reference:
https://strobes.co/blog/mcp-model-context-protocol-and-its-critical-vulnerabilities/
🧾 Day 4: Log Prompt → Context → Tool → Output
• API call logs are insufficient; full execution flow must be captured.
• Mitigation: Append-only logs, secure audit trails, timestamped integrity.
• 📘 Reference:
https://block.github.io/goose/blog/2025/03/31/securing-mcp/
🕵️♂️ Day 5: Silent Failures Look Like Success
• Agents may appear to function normally while making unauthorized decisions.
• Mitigation: Baseline behavior, detect tool misuse, enable tracing.
• 📘 Reference:
https://techcommunity.microsoft.com/t5/microsoft-defender-for-cloud/plug-play-and-prey-the-security-risks-of-the-model-context/ba-p/4410829
⚙️ Day 6: Tools Are Execution Surfaces
• Every tool the agent can call becomes a potential attack vector.
• Mitigation: Apply RBAC, audit tool chaining, restrict sensitive actions.
• 📘 Reference:
https://github.com/Puliczek/awesome-mcp-security
🧪 Day 7: Test Prompts, Scrub Memory, Approve Agents
• Prompts must be tested like code; memory must be wiped post-interaction.
• Mitigation: Use CI pipelines, enforce memory scrubbing, implement manual approvals.
• 📘 Reference:
https://github.com/invariantlabs-ai/mcp-scan
📋 Day 8: Compliance Doesn’t Handle Autonomous Agents
• Traditional compliance assumes human-triggered actions, not LLM autonomy.
• Mitigation: Extend frameworks to capture reasoning, intent, and chaining logic.
• 📘 Reference:
https://community.cisco.com/t5/security-blogs/ai-model-context-protocol-mcp-and-security/ba-p/5274394
🛡️ Day 9: You Need Ownership, Policies, Visibility
• Security fails without MCP owners, policies, and dashboards.
• Mitigation: Appoint MCP stewards, implement SLAs, create visibility tooling.
• 📘 Reference:
https://arxiv.org/abs/2504.03767
🧠 Day 10: Governance Requires Chain-of-Thought Tracking
• Decision-making steps (not just final outputs) must be captured and explainable.
• Mitigation: Log each reasoning step and agent decision rationale.
• 📘 Reference:
https://arxiv.org/abs/2504.12757
🔧 Open-Source MCP Security Tools (GitHub)
1. Awesome MCP Security – curated list of tools & threats
https://github.com/Puliczek/awesome-mcp-security
2. MCP Scan – static & dynamic analyzer for toolchains & prompt injection
https://github.com/invariantlabs-ai/mcp-scan
3. ModelContextProtocol/Servers – official MCP server implementation
https://github.com/modelcontextprotocol/servers
4. Leidos MCP Safety Scanner – evaluates safety & alignment for MCP deployments
https://arxiv.org/abs/2504.03767
5. Google MCP Security (experimental)
https://github.com/google/mcp-security (if available, else restricted to internal orgs)
🔐 Day 1: LLMs Are Autonomous Threats, Not Just Clients
• LLMs can independently make decisions, chain tools, and exfiltrate data.
• Mitigation: Define secure tool schemas, enforce least privilege.
• 📘 Reference:
https://www.paloaltonetworks.com/blog/cloud-security/model-context-protocol-mcp-a-security-overview/
🧠 Day 2: Prompts = Executable Business Logic
• Prompts can change how the agent behaves—like code updates.
• Mitigation: Version control, code review, and test prompts.
• 📘 Reference:
https://writer.com/engineering/mcp-security-considerations/
🌐 Day 3: Context Variables Expand the Attack Surface
• Tokens, memory, metadata—all can be exploited for data leakage or prompt injection.
• Mitigation: Encrypt sensitive context, limit memory, scrub metadata.
• 📘 Reference:
https://strobes.co/blog/mcp-model-context-protocol-and-its-critical-vulnerabilities/
🧾 Day 4: Log Prompt → Context → Tool → Output
• API call logs are insufficient; full execution flow must be captured.
• Mitigation: Append-only logs, secure audit trails, timestamped integrity.
• 📘 Reference:
https://block.github.io/goose/blog/2025/03/31/securing-mcp/
🕵️♂️ Day 5: Silent Failures Look Like Success
• Agents may appear to function normally while making unauthorized decisions.
• Mitigation: Baseline behavior, detect tool misuse, enable tracing.
• 📘 Reference:
https://techcommunity.microsoft.com/t5/microsoft-defender-for-cloud/plug-play-and-prey-the-security-risks-of-the-model-context/ba-p/4410829
⚙️ Day 6: Tools Are Execution Surfaces
• Every tool the agent can call becomes a potential attack vector.
• Mitigation: Apply RBAC, audit tool chaining, restrict sensitive actions.
• 📘 Reference:
https://github.com/Puliczek/awesome-mcp-security
🧪 Day 7: Test Prompts, Scrub Memory, Approve Agents
• Prompts must be tested like code; memory must be wiped post-interaction.
• Mitigation: Use CI pipelines, enforce memory scrubbing, implement manual approvals.
• 📘 Reference:
https://github.com/invariantlabs-ai/mcp-scan
📋 Day 8: Compliance Doesn’t Handle Autonomous Agents
• Traditional compliance assumes human-triggered actions, not LLM autonomy.
• Mitigation: Extend frameworks to capture reasoning, intent, and chaining logic.
• 📘 Reference:
https://community.cisco.com/t5/security-blogs/ai-model-context-protocol-mcp-and-security/ba-p/5274394
🛡️ Day 9: You Need Ownership, Policies, Visibility
• Security fails without MCP owners, policies, and dashboards.
• Mitigation: Appoint MCP stewards, implement SLAs, create visibility tooling.
• 📘 Reference:
https://arxiv.org/abs/2504.03767
🧠 Day 10: Governance Requires Chain-of-Thought Tracking
• Decision-making steps (not just final outputs) must be captured and explainable.
• Mitigation: Log each reasoning step and agent decision rationale.
• 📘 Reference:
https://arxiv.org/abs/2504.12757
🔧 Open-Source MCP Security Tools (GitHub)
1. Awesome MCP Security – curated list of tools & threats
https://github.com/Puliczek/awesome-mcp-security
2. MCP Scan – static & dynamic analyzer for toolchains & prompt injection
https://github.com/invariantlabs-ai/mcp-scan
3. ModelContextProtocol/Servers – official MCP server implementation
https://github.com/modelcontextprotocol/servers
4. Leidos MCP Safety Scanner – evaluates safety & alignment for MCP deployments
https://arxiv.org/abs/2504.03767
5. Google MCP Security (experimental)
https://github.com/google/mcp-security (if available, else restricted to internal orgs)
🔥1
Forwarded from Анализ данных (Data analysis)
🎆 Harbor — локальный стек для работы с LLM в один клик. Этот инструмент упрощает запуск локальных языковых моделей и связанных сервисов — от веб-интерфейсов до RAG и голосового взаимодействия. Всё работает в Docker и настраивается парой команд.
Harbor автоматически интегрирует компонентов, например, SearXNG сразу подключается к Open WebUI для поиска по вебу, а ComfyUI — для генерации изображений. Подходит тем, кто хочет быстро развернуть локальную среду для экспериментов с ИИ.
🤖 GitHub
@data_analysis_ml
Harbor автоматически интегрирует компонентов, например, SearXNG сразу подключается к Open WebUI для поиска по вебу, а ComfyUI — для генерации изображений. Подходит тем, кто хочет быстро развернуть локальную среду для экспериментов с ИИ.
🤖 GitHub
@data_analysis_ml
Forwarded from PWN AI (Artyom Semenov)
Великолепно. Недавно вышел проект матрицы по защите AI – AIDEFEND, что-то похожее я публиковал ранее.
Однако тут включено большое количество мер по защите, включая AI-агентов. К некоторым тактикам приведены практические инструменты защиты – а сама матрица предоставляет возможность посмотреть защиту для конкретных тактик, топиков (например, отдельно безопасность данных или отдельно безопасность модели) и фазы.
Фаз для защиты, к слову, говоря меньше, чем фаз для реализации атаки у MITRE. А при разработке автор вдохновлялся Google SAIF, OWASP 10, MITRE ATLAS и … MAESTRO от Кена Хуанга.
Из интересного ещё можно отметить, что под каждой техникой для защиты можно почитать о том как можно было бы имплементировать это, в несколько этапов и с примерами.
Однако тут включено большое количество мер по защите, включая AI-агентов. К некоторым тактикам приведены практические инструменты защиты – а сама матрица предоставляет возможность посмотреть защиту для конкретных тактик, топиков (например, отдельно безопасность данных или отдельно безопасность модели) и фазы.
Фаз для защиты, к слову, говоря меньше, чем фаз для реализации атаки у MITRE. А при разработке автор вдохновлялся Google SAIF, OWASP 10, MITRE ATLAS и … MAESTRO от Кена Хуанга.
Из интересного ещё можно отметить, что под каждой техникой для защиты можно почитать о том как можно было бы имплементировать это, в несколько этапов и с примерами.
🤔3🥱2
Forwarded from Data Secrets
Так, это что-то новенькое: там вышла статья, которую совместно писали ученые из OpenAI, Anthropic, Google DeepMind и Meta*
Вот так наборчик, да? И о чем, как вы думаете, статья, если она объединила исследователей из четырех таких конкурирующих лаб?
Конечно, о безопасности. Кстати, среди авторов – Йошуа Бенджио, а среди рецензентов – Илья Суцкевер, Джон Шульман и Джеффри Хинтон.
Пишут про цепочки рассуждений (Chain of Thoughts). Основная мысль: люди зря надеятся, что CoT поможет нам надежно интерпретировать модели и считывать их истинные мотивы, предупреждая тем самым какие-то вредные действия.
На сегодняшний день – да, какое-то представление о скрытых мыслях сетей CoT действительно дает, и этим надо активно пользоваться. Но это довольно хрупкая возможность, которая может исчезнуть по мере прогресса.
В перспективе не стоит забывать о физике процесса ризонинга: для модели это та же самая генерация токенов, только в рамках специального тега /think. Фактически, сеть просто генерирует что-то «для себя» перед тем как начать генерировать ответ для пользователя, и мы называем это размышлением.
Нет оснований полагать, что в CoT всегда будут содержаться истинные намерения моделей, тем более для будущих более продвинутых архитектур и методов обучения.
Ну, в общем, очень интересный кейс единодушия ученых. Почитать полностью можно тут
Вот так наборчик, да? И о чем, как вы думаете, статья, если она объединила исследователей из четырех таких конкурирующих лаб?
Конечно, о безопасности. Кстати, среди авторов – Йошуа Бенджио, а среди рецензентов – Илья Суцкевер, Джон Шульман и Джеффри Хинтон.
Пишут про цепочки рассуждений (Chain of Thoughts). Основная мысль: люди зря надеятся, что CoT поможет нам надежно интерпретировать модели и считывать их истинные мотивы, предупреждая тем самым какие-то вредные действия.
На сегодняшний день – да, какое-то представление о скрытых мыслях сетей CoT действительно дает, и этим надо активно пользоваться. Но это довольно хрупкая возможность, которая может исчезнуть по мере прогресса.
В перспективе не стоит забывать о физике процесса ризонинга: для модели это та же самая генерация токенов, только в рамках специального тега /think. Фактически, сеть просто генерирует что-то «для себя» перед тем как начать генерировать ответ для пользователя, и мы называем это размышлением.
Нет оснований полагать, что в CoT всегда будут содержаться истинные намерения моделей, тем более для будущих более продвинутых архитектур и методов обучения.
Ну, в общем, очень интересный кейс единодушия ученых. Почитать полностью можно тут
❤1
Forwarded from AlexRedSec
AI Controls Matrix (AICM) — ещё один фреймворк, содержащий набор мер управления для безопасной разработки, внедрения и эксплуатации облачных систем искусственного интеллекта от Cloud Security Alliance🧠
Фреймворк включает в себя:
🟡 Матрицу мер управления, включающую в себя 243 контроля, сгруппированных по 18 доменам безопасности. Каждая мера привязана к типу/компоненту инфраструктуры и архитектуры, этапу жизненного цикла и категории угроз.
🟡 Опросник для самооценки.
🟡 Маппинг на стандарт NIST AI 600-1 (2024) и фреймворк Criteria Catalogue for AI Cloud Services – AIC4.
В будущих версиях планируется добавление маппинга на другие стандарты и фреймворки безопасности систем ИИ, а также руководств по внедрению мер управления и их аудиту.
Ниже приложил презентацию и сам сборник материалов AICM.
#ai #framework #csa #aicm #controls #architecture
Фреймворк включает в себя:
В будущих версиях планируется добавление маппинга на другие стандарты и фреймворки безопасности систем ИИ, а также руководств по внедрению мер управления и их аудиту.
Ниже приложил презентацию и сам сборник материалов AICM.
#ai #framework #csa #aicm #controls #architecture
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Security Vision
В новой статье в блоге рассмотрели применение больших языковых моделей (LLM, Large Language Model) и их «братьев» из мира искусственного интеллекта (AI, Artificial Intelligence) в решении задач кибербезопасности.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Forwarded from Al Talent Hub
ИИ-агенты вошли в топ‑5 на CTF, они решают задачи по безопасности быстрее и точнее, чем большинство участников…но не ты — с этой подборкой ⬇️
📌 Ассистенты и фреймворки для автоматического тестирования и поиска уязвимостей и багов
🔥 Агенты
✔️ Diffblue — генерация юнит–тестов для кода на Java.
✔️ Qod — два агента: один пишет, другой тестирует.
✔️ CodeQL — мощный семантический анализатор уязвимостей от GitHub, open-source.
✔️ Semgrep — кастомный поиск уязвимостей и багов.
✔️ Snyk — ассистент безопасной разработки.
✔️ TestSpark — плагин в IntelliJ: LLM-тесты, EvoSuite и Kex.
✔️ Codiga — code review и безопасность на всех языках.
✔️ Sourcegraph — поддерживает разные LLM и интеграции.
✔️ VulnBuster — агент-помощник от магистрантов AI Talent Hub. Использует 5 MCP-тулзов и выдает отчёт с предложениями по улучшению.
📌 Фреймворки
✔️ MLGym — открытый фреймворк и бенчмарк для агентов в автоматизации ML-задач
✔️ Voice Lab — тестирование голосовых агентов
✔️ AgentOps — мониторинг и бенчмаркинг производительности
✔️ AgentBench — набор тестов для оценки LLM-агентов в окружениях
✔️ LLAMATOR — фреймворк тестирования безопасности LLM-приложений. Продукт AI Security Lab ◾️
➡️ Хочешь находить и анализировать уязвимости с помощью ИИ?
Присоединяйся к AI Security Lab — исследовательской лаборатории AI Talent Hub х Raft. Здесь мы создаём собственные инструменты, участвуем в CTF и прокачиваемся в кибербезе на практике.
🐱 — если узнал рокеров на картинке
#ПолезнаяПодборка
#AITalentHub #ITMO #NapoleonIT
Присоединяйся к AI Security Lab — исследовательской лаборатории AI Talent Hub х Raft. Здесь мы создаём собственные инструменты, участвуем в CTF и прокачиваемся в кибербезе на практике.
#ПолезнаяПодборка
#AITalentHub #ITMO #NapoleonIT
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Forwarded from База знаний AI
В T-Bank AI Research разработали подход к интерпретации и управлению смысловыми процессами LLM
Подход основан на методе SAE Match, который был представлен командой ранее. Исследователи предложили концепцию графа потока признаков — это карта, которая отражает, где, когда и как в ИИ-модели появляются, трансформируются или исчезают важные смысловые элементы. Эту информацию можно использовать для активного управления LLM.
Новый метод позволяет проводить анализ как между слоями модели, так и внутри самих слоев: между такими модулями как Attention (механизм внимания, анализирует контекст) и Feedforward (отвечает за использование внутренних знаний модели). Как утверждают исследователи, вмешательство сразу на нескольких слоях и модулях позволяет управлять моделью точнее и с меньшими потерями в качестве текста, чем попытки повлиять на отдельный уровень.
Решение исследователей T-Bank AI Research позволяет усиливать или подавлять определенные признаки на разных этапах обработки без изменения параметров модели и без дообучения. Таким образом можно изменять стиль, тематику или тональность генерируемого текста.
🔗Источник: https://www.tbank.ru/about/news/23072025-researchers-from-t-bank-ai-research-have-learned-to-track-and-control-semantic-processes-within-ai/
***
📎Специалисты T-Bank AI Research представили метод SAE Match в апреле 2025 года. Он позволяет понять, в какой момент ИИ-модель начинает давать неправильные или нежелательные ответы и скорректировать их.
Подход основан на методе SAE Match, который был представлен командой ранее. Исследователи предложили концепцию графа потока признаков — это карта, которая отражает, где, когда и как в ИИ-модели появляются, трансформируются или исчезают важные смысловые элементы. Эту информацию можно использовать для активного управления LLM.
Новый метод позволяет проводить анализ как между слоями модели, так и внутри самих слоев: между такими модулями как Attention (механизм внимания, анализирует контекст) и Feedforward (отвечает за использование внутренних знаний модели). Как утверждают исследователи, вмешательство сразу на нескольких слоях и модулях позволяет управлять моделью точнее и с меньшими потерями в качестве текста, чем попытки повлиять на отдельный уровень.
Решение исследователей T-Bank AI Research позволяет усиливать или подавлять определенные признаки на разных этапах обработки без изменения параметров модели и без дообучения. Таким образом можно изменять стиль, тематику или тональность генерируемого текста.
🔗Источник: https://www.tbank.ru/about/news/23072025-researchers-from-t-bank-ai-research-have-learned-to-track-and-control-semantic-processes-within-ai/
***
📎Специалисты T-Bank AI Research представили метод SAE Match в апреле 2025 года. Он позволяет понять, в какой момент ИИ-модель начинает давать неправильные или нежелательные ответы и скорректировать их.