ML&|Sec Feed
1.3K subscribers
1.25K photos
80 videos
291 files
1.94K links
Feed for @borismlsec channel

author: @ivolake
Download Telegram
Forwarded from SecureTechTalks
🔒 Как обмануть ChatGPT и LLaMA без взлома? Новый метод ETTA

🧠 Исследователи представили метод ETTA (Embedding Transformation Toxicity Attenuation), который позволяет генерировать вредоносные ответы от LLM, обходя защиту без доступа к весам, коду или API.

Это не jailbreak. Это тонкий трюк, меняющий сам способ, как ИИ "чувствует" запрос.

Что именно делает ETTA?

Вся логика защиты LLM — это в первую очередь фильтрация на уровне эмбеддингов (векторов, представляющих смысл слов).

Например:
Когда вы пишете "Сделай бомбу", вектор запроса похож на вектор других запрещённых тем.
Модель распознаёт токсичность и отказывается отвечать.

ETTA вмешивается в этот процесс и незаметно изменяет вектор, чтобы:
🔹 Сохранить тот же смысл (семантически — это всё ещё бомба)
🔹 Но выглядеть вектору как «безопасный» (на уровне ИИ)
Результат:
Модель принимает запрос как нормальный
Отвечает как будто это безобидный вопрос, не включив защиту

🔬 Как именно это реализовано?

Модуль обучается на парах слов: токсичных и нейтральных (например, “explosive” vs “research”)
Создаётся матрица преобразования эмбеддингов, которая:
- отделяет компонент "токсичности" от остального смысла
- гасит именно токсичный сигнал
Применяется к входному эмбеддингу запроса
Запрос отправляется в LLM уже в модифицированном виде

При этом:
Смысл запроса сохраняется
Безопасность модели отключается
Результат валидный, связный, но содержит вредоносный текст

📊 Насколько эффективен метод?

- Gemma-2 (Google) — 95.19% успешных обходов
- LLaMA-2-7b — 87.88%
- Vicuna-13b — 88.46%
- Средний успех по моделям88.61%

Даже при наличии встроенной защиты:
- SmoothLLM (защита на входе) — всё равно 60.15% успеха
- ESF (дообученная фильтрация) — 77.39%

🚨 В чем новизна?

🔺 Не требуется модификация модели — весы, архитектура, даже токенизатор не трогаются
🔺 Работает на open-source — можно внедрить в любом локальном LLM
🔺 Выключается фильтрация без следов — для обычных запросов всё работает корректно
🔺 Идеально подходит для скрытых атак в продуктах с LLM — например, чат-ботах, IDE, голосовых ассистентах

🛡 Что предлагают исследователи?

Нормализация эмбеддингов — выравнивание векторов относительно "безопасных" запросов
Проверка целостности модели — чтобы исключить скрытые внедрения
Фильтрация вывода LLM — внешние прокси и анализ результата, а не только запроса

📌 Вывод

ETTA атакует не API, не веса, не prompt — а само "восприятие смысла" моделью.
Механизм фильтрации, на который полагаются все LLM, можно точечно обойти, сохраняя при этом видимость корректной работы.

💡 Защита LLM — это не только prompt-фильтры, а защищённая геометрия смыслов + контроль среды исполнения.
Исходник: arXiv:2507.08020v1

Stay secure and read SecureTechTalks 📚

#AIsecurity #LLM #ETTA #EmbeddingPoisoning #Cybersecurity #PromptHacking #LLMThreats #MachineLearning #OpenSourceAI #RedTeam
#AIexploitation #ModelSecurity #VectorManipulation #NeuralNets #SecureML #ModelIntegrity #AIalignment
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Андрей
code_09072025.pdf
478.7 KB
🔥1🥴1
Sber_Privacy_Journal_Vol_6.pdf
8.2 MB
👨‍💻1
Forwarded from Похек
Атаки на MCP. Как взламывают инструменты ИИ-разработчиков
#MCP #AI #LLM #Cursor #Anthropic #OpenAI

Наконец-то вышла моя статья про безопасность MCP. Мысль написать эту статью меня натолкнуло одно из обновлений в Cursor IDE, где сделали "удобную", а по факту очень дырявую однокнопочную установку MCP серверов локально. Я уже ранее писал пост про запуск MCP в контейнерах и почему это нужно. Данный вектор раскрывает supply chain attack ещё больше, что очень интересно на мой взгляд)


В погоне за ско­ростью и удобс­твом раз­работ­чики ИИ‑при­ложе­ний час­то забыва­ют о безопас­ности. Имен­но это при­вело к кри­тичес­кой уяз­вимос­ти в MCP Inspector от Anthropic. Инс­тру­мент для отладки MCP-сер­веров стал точ­кой вхо­да для зло­умыш­ленни­ков.

Не­дав­но изра­иль­ские иссле­дова­тели обна­ружи­ли кри­тичес­кую уяз­вимость уда­лен­ного выпол­нения кода (RCE) в про­екте Anthropic's Model Context Protocol (MCP) Inspector. Уяз­вимость получи­ла иден­тифика­тор CVE-2025-49596 и оцен­ку CVSS 9.4 — это говорит о чрез­вычай­ной серь­езности. Экс­плу­ати­руя этот баг, зло­умыш­ленник может уда­лен­но выпол­нить про­изволь­ный код на машине раз­работ­чика с уяз­вимой вер­сией MCP Inspector. А это, сог­ласись, уже не шут­ки.

❤️ Буду благодарен комментам и фидбеку тут и там))

🔓 Рекомендую к прочтению

p.s. пикчу скоро такую поставят на сайте и в их канале)

🌚 @poxek | 🌚 Блог | 📺 YT | 📺 RT | 📺 VK
Please open Telegram to view this post
VIEW IN TELEGRAM
Вышла свежая карта AI Security-стартапов от крупнейшего фонда Insight Partners. В отчёте указаны все последние M&A-сделки Cisco, Tenable и Palo Alto, а также направления инвестирования самого фонда.

Это не первая карта AI Security: например, микрофонд TechOperators сделал ландшафт компаний пару месяцев назад. Они открыли доступ, чтобы стартапы могли самостоятельно размещать себя в нужном секторе, и собрали больше проектов, о многих из которых я впервые узнал именно там.

Первыми ещё в начале 2024 года свой список компаний опубликовал известный фонд из Долины Menlo Ventures, и за ним работу повторил европейский MMC VC. Кстати, именно с отчёта MMC началась моя работа в OWASP. Несколько участников LLM Top 10 были консультантами аналитиков фонда, и, обсуждая отчёт Responsible AI в Slack OWASP, меня пригласили контрибьютить в LLM Top 10 2025.

Помимо инвестфондов такие списки ведут и консультанты — McKinsey, Gartner и другие, но про это напишу как-нибудь отдельно.
🔥1
Forwarded from AISecHub
10-day MCP Security series with technical resources, blogs, arXiv papers, and GitHub repositories:

🔐 Day 1: LLMs Are Autonomous Threats, Not Just Clients
• LLMs can independently make decisions, chain tools, and exfiltrate data.
• Mitigation: Define secure tool schemas, enforce least privilege.
📘 Reference:
https://www.paloaltonetworks.com/blog/cloud-security/model-context-protocol-mcp-a-security-overview/

🧠 Day 2: Prompts = Executable Business Logic
• Prompts can change how the agent behaves—like code updates.
• Mitigation: Version control, code review, and test prompts.
📘 Reference:
https://writer.com/engineering/mcp-security-considerations/

🌐 Day 3: Context Variables Expand the Attack Surface
• Tokens, memory, metadata—all can be exploited for data leakage or prompt injection.
• Mitigation: Encrypt sensitive context, limit memory, scrub metadata.
📘 Reference:
https://strobes.co/blog/mcp-model-context-protocol-and-its-critical-vulnerabilities/

🧾 Day 4: Log Prompt → Context → Tool → Output
• API call logs are insufficient; full execution flow must be captured.
• Mitigation: Append-only logs, secure audit trails, timestamped integrity.
📘 Reference:
https://block.github.io/goose/blog/2025/03/31/securing-mcp/

🕵️‍♂️ Day 5: Silent Failures Look Like Success
• Agents may appear to function normally while making unauthorized decisions.
• Mitigation: Baseline behavior, detect tool misuse, enable tracing.
📘 Reference:
https://techcommunity.microsoft.com/t5/microsoft-defender-for-cloud/plug-play-and-prey-the-security-risks-of-the-model-context/ba-p/4410829

⚙️ Day 6: Tools Are Execution Surfaces
• Every tool the agent can call becomes a potential attack vector.
• Mitigation: Apply RBAC, audit tool chaining, restrict sensitive actions.
📘 Reference:
https://github.com/Puliczek/awesome-mcp-security

🧪 Day 7: Test Prompts, Scrub Memory, Approve Agents
• Prompts must be tested like code; memory must be wiped post-interaction.
• Mitigation: Use CI pipelines, enforce memory scrubbing, implement manual approvals.
📘 Reference:
https://github.com/invariantlabs-ai/mcp-scan

📋 Day 8: Compliance Doesn’t Handle Autonomous Agents
• Traditional compliance assumes human-triggered actions, not LLM autonomy.
• Mitigation: Extend frameworks to capture reasoning, intent, and chaining logic.
📘 Reference:
https://community.cisco.com/t5/security-blogs/ai-model-context-protocol-mcp-and-security/ba-p/5274394

🛡️ Day 9: You Need Ownership, Policies, Visibility
• Security fails without MCP owners, policies, and dashboards.
• Mitigation: Appoint MCP stewards, implement SLAs, create visibility tooling.
📘 Reference:
https://arxiv.org/abs/2504.03767

🧠 Day 10: Governance Requires Chain-of-Thought Tracking
• Decision-making steps (not just final outputs) must be captured and explainable.
• Mitigation: Log each reasoning step and agent decision rationale.
📘 Reference:
https://arxiv.org/abs/2504.12757

🔧 Open-Source MCP Security Tools (GitHub)
1. Awesome MCP Security – curated list of tools & threats
https://github.com/Puliczek/awesome-mcp-security
2. MCP Scan – static & dynamic analyzer for toolchains & prompt injection
https://github.com/invariantlabs-ai/mcp-scan
3. ModelContextProtocol/Servers – official MCP server implementation
https://github.com/modelcontextprotocol/servers
4. Leidos MCP Safety Scanner – evaluates safety & alignment for MCP deployments
https://arxiv.org/abs/2504.03767
5. Google MCP Security (experimental)
https://github.com/google/mcp-security (if available, else restricted to internal orgs)
🔥1
🎆 Harbor — локальный стек для работы с LLM в один клик. Этот инструмент упрощает запуск локальных языковых моделей и связанных сервисов — от веб-интерфейсов до RAG и голосового взаимодействия. Всё работает в Docker и настраивается парой команд.

Harbor автоматически интегрирует компонентов, например, SearXNG сразу подключается к Open WebUI для поиска по вебу, а ComfyUI — для генерации изображений. Подходит тем, кто хочет быстро развернуть локальную среду для экспериментов с ИИ.

🤖 GitHub

@data_analysis_ml
Forwarded from PWN AI (Artyom Semenov)
Великолепно. Недавно вышел проект матрицы по защите AI – AIDEFEND, что-то похожее я публиковал ранее.

Однако тут включено большое количество мер по защите, включая AI-агентов. К некоторым тактикам приведены практические инструменты защиты – а сама матрица предоставляет возможность посмотреть защиту для конкретных тактик, топиков (например, отдельно безопасность данных или отдельно безопасность модели) и фазы.

Фаз для защиты, к слову, говоря меньше, чем фаз для реализации атаки у MITRE. А при разработке автор вдохновлялся Google SAIF, OWASP 10, MITRE ATLAS и … MAESTRO от Кена Хуанга.

Из интересного ещё можно отметить, что под каждой техникой для защиты можно почитать о том как можно было бы имплементировать это, в несколько этапов и с примерами.
🤔3🥱2
Forwarded from Data Secrets
Так, это что-то новенькое: там вышла статья, которую совместно писали ученые из OpenAI, Anthropic, Google DeepMind и Meta*

Вот так наборчик, да? И о чем, как вы думаете, статья, если она объединила исследователей из четырех таких конкурирующих лаб?

Конечно, о безопасности. Кстати, среди авторов – Йошуа Бенджио, а среди рецензентов – Илья Суцкевер, Джон Шульман и Джеффри Хинтон.

Пишут про цепочки рассуждений (Chain of Thoughts). Основная мысль: люди зря надеятся, что CoT поможет нам надежно интерпретировать модели и считывать их истинные мотивы, предупреждая тем самым какие-то вредные действия.

На сегодняшний день – да, какое-то представление о скрытых мыслях сетей CoT действительно дает, и этим надо активно пользоваться. Но это довольно хрупкая возможность, которая может исчезнуть по мере прогресса.

В перспективе не стоит забывать о физике процесса ризонинга: для модели это та же самая генерация токенов, только в рамках специального тега /think. Фактически, сеть просто генерирует что-то «для себя» перед тем как начать генерировать ответ для пользователя, и мы называем это размышлением.

Нет оснований полагать, что в CoT всегда будут содержаться истинные намерения моделей, тем более для будущих более продвинутых архитектур и методов обучения.

Ну, в общем, очень интересный кейс единодушия ученых. Почитать полностью можно тут
1
Forwarded from AlexRedSec
AI Controls Matrix (AICM) — ещё один фреймворк, содержащий набор мер управления для безопасной разработки, внедрения и эксплуатации облачных систем искусственного интеллекта от Cloud Security Alliance🧠

Фреймворк включает в себя:
🟡Матрицу мер управления, включающую в себя 243 контроля, сгруппированных по 18 доменам безопасности. Каждая мера привязана к типу/компоненту инфраструктуры и архитектуры, этапу жизненного цикла и категории угроз.
🟡Опросник для самооценки.
🟡Маппинг на стандарт NIST AI 600-1 (2024) и фреймворк Criteria Catalogue for AI Cloud Services – AIC4.

В будущих версиях планируется добавление маппинга на другие стандарты и фреймворки безопасности систем ИИ, а также руководств по внедрению мер управления и их аудиту.

Ниже приложил презентацию и сам сборник материалов AICM.

#ai #framework #csa #aicm #controls #architecture
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM