Forwarded from AISecHub
Multimodal Mistral Safety Report.pdf
682.8 KB
The red teaming exercise was conducted on several multimodal models, and tests across several safety and harm categories as described in the NIST AI RMF. Newer jailbreak techniques exploit the way multimodal models process combined media, bypassing content filters and leading to harmful outputs—without any obvious red flags in the visible prompt.
More info: https://www.enkryptai.com/company/resources/research-reports/mistral-pixtral-rt
#AISafety #LLMSecurity #RedTeaming #ModelRisk #CBRN #CSEM #VLM #AIAlignment #AIEthics #GenerativeAI #AICompliance #ResponsibleAI #enkryptai #enkrypt #AISecurity
More info: https://www.enkryptai.com/company/resources/research-reports/mistral-pixtral-rt
#AISafety #LLMSecurity #RedTeaming #ModelRisk #CBRN #CSEM #VLM #AIAlignment #AIEthics #GenerativeAI #AICompliance #ResponsibleAI #enkryptai #enkrypt #AISecurity
Forwarded from SecureTechTalks
🔒 Как обмануть ChatGPT и LLaMA без взлома? Новый метод ETTA
🧠 Исследователи представили метод ETTA (Embedding Transformation Toxicity Attenuation), который позволяет генерировать вредоносные ответы от LLM, обходя защиту без доступа к весам, коду или API.
Это не jailbreak. Это тонкий трюк, меняющий сам способ, как ИИ "чувствует" запрос.
⚙ Что именно делает ETTA?
Вся логика защиты LLM — это в первую очередь фильтрация на уровне эмбеддингов (векторов, представляющих смысл слов).
Например:
Когда вы пишете "Сделай бомбу", вектор запроса похож на вектор других запрещённых тем.
Модель распознаёт токсичность и отказывается отвечать.
ETTA вмешивается в этот процесс и незаметно изменяет вектор, чтобы:
🔹 Сохранить тот же смысл (семантически — это всё ещё бомба)
🔹 Но выглядеть вектору как «безопасный» (на уровне ИИ)
Результат:
✅ Модель принимает запрос как нормальный
✅ Отвечает как будто это безобидный вопрос, не включив защиту
🔬 Как именно это реализовано?
➖ Модуль обучается на парах слов: токсичных и нейтральных (например, “explosive” vs “research”)
➖ Создаётся матрица преобразования эмбеддингов, которая:
- отделяет компонент "токсичности" от остального смысла
- гасит именно токсичный сигнал
➖ Применяется к входному эмбеддингу запроса
➖ Запрос отправляется в LLM уже в модифицированном виде
При этом:
– Смысл запроса сохраняется
– Безопасность модели отключается
– Результат валидный, связный, но содержит вредоносный текст
📊 Насколько эффективен метод?
- Gemma-2 (Google) — 95.19% успешных обходов
- LLaMA-2-7b — 87.88%
- Vicuna-13b — 88.46%
- Средний успех по моделям — 88.61%
Даже при наличии встроенной защиты:
- SmoothLLM (защита на входе) — всё равно 60.15% успеха
- ESF (дообученная фильтрация) — 77.39%
🚨 В чем новизна?
🔺 Не требуется модификация модели — весы, архитектура, даже токенизатор не трогаются
🔺 Работает на open-source — можно внедрить в любом локальном LLM
🔺 Выключается фильтрация без следов — для обычных запросов всё работает корректно
🔺 Идеально подходит для скрытых атак в продуктах с LLM — например, чат-ботах, IDE, голосовых ассистентах
🛡 Что предлагают исследователи?
✅ Нормализация эмбеддингов — выравнивание векторов относительно "безопасных" запросов
✅ Проверка целостности модели — чтобы исключить скрытые внедрения
✅ Фильтрация вывода LLM — внешние прокси и анализ результата, а не только запроса
📌 Вывод
ETTA атакует не API, не веса, не prompt — а само "восприятие смысла" моделью.
Механизм фильтрации, на который полагаются все LLM, можно точечно обойти, сохраняя при этом видимость корректной работы.
💡 Защита LLM — это не только prompt-фильтры, а защищённая геометрия смыслов + контроль среды исполнения.
Исходник: arXiv:2507.08020v1
Stay secure and read SecureTechTalks 📚
#AIsecurity #LLM #ETTA #EmbeddingPoisoning #Cybersecurity #PromptHacking #LLMThreats #MachineLearning #OpenSourceAI #RedTeam
#AIexploitation #ModelSecurity #VectorManipulation #NeuralNets #SecureML #ModelIntegrity #AIalignment
🧠 Исследователи представили метод ETTA (Embedding Transformation Toxicity Attenuation), который позволяет генерировать вредоносные ответы от LLM, обходя защиту без доступа к весам, коду или API.
Это не jailbreak. Это тонкий трюк, меняющий сам способ, как ИИ "чувствует" запрос.
⚙ Что именно делает ETTA?
Вся логика защиты LLM — это в первую очередь фильтрация на уровне эмбеддингов (векторов, представляющих смысл слов).
Например:
Когда вы пишете "Сделай бомбу", вектор запроса похож на вектор других запрещённых тем.
Модель распознаёт токсичность и отказывается отвечать.
ETTA вмешивается в этот процесс и незаметно изменяет вектор, чтобы:
🔹 Сохранить тот же смысл (семантически — это всё ещё бомба)
🔹 Но выглядеть вектору как «безопасный» (на уровне ИИ)
Результат:
✅ Модель принимает запрос как нормальный
✅ Отвечает как будто это безобидный вопрос, не включив защиту
🔬 Как именно это реализовано?
- отделяет компонент "токсичности" от остального смысла
- гасит именно токсичный сигнал
При этом:
– Смысл запроса сохраняется
– Безопасность модели отключается
– Результат валидный, связный, но содержит вредоносный текст
📊 Насколько эффективен метод?
- Gemma-2 (Google) — 95.19% успешных обходов
- LLaMA-2-7b — 87.88%
- Vicuna-13b — 88.46%
- Средний успех по моделям — 88.61%
Даже при наличии встроенной защиты:
- SmoothLLM (защита на входе) — всё равно 60.15% успеха
- ESF (дообученная фильтрация) — 77.39%
🚨 В чем новизна?
🔺 Не требуется модификация модели — весы, архитектура, даже токенизатор не трогаются
🔺 Работает на open-source — можно внедрить в любом локальном LLM
🔺 Выключается фильтрация без следов — для обычных запросов всё работает корректно
🔺 Идеально подходит для скрытых атак в продуктах с LLM — например, чат-ботах, IDE, голосовых ассистентах
🛡 Что предлагают исследователи?
✅ Нормализация эмбеддингов — выравнивание векторов относительно "безопасных" запросов
✅ Проверка целостности модели — чтобы исключить скрытые внедрения
✅ Фильтрация вывода LLM — внешние прокси и анализ результата, а не только запроса
📌 Вывод
ETTA атакует не API, не веса, не prompt — а само "восприятие смысла" моделью.
Механизм фильтрации, на который полагаются все LLM, можно точечно обойти, сохраняя при этом видимость корректной работы.
💡 Защита LLM — это не только prompt-фильтры, а защищённая геометрия смыслов + контроль среды исполнения.
Исходник: arXiv:2507.08020v1
Stay secure and read SecureTechTalks 📚
#AIsecurity #LLM #ETTA #EmbeddingPoisoning #Cybersecurity #PromptHacking #LLMThreats #MachineLearning #OpenSourceAI #RedTeam
#AIexploitation #ModelSecurity #VectorManipulation #NeuralNets #SecureML #ModelIntegrity #AIalignment
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from AISecHub
Foundations of Large Language Models.pdf
2.6 MB
Foundations of Large Language Models - 277 Pages
A foundational guide to how LLMs work, focusing on core principles; even though it doesn’t dive directly into cybersecurity, it covers architectures, training strategies, prompting, alignment, and inference methods
Chapter 1️⃣ - introduces the basics of pre-training. This is the foundation of large language models, and common pre-training methods and model architectures will be discussed here.
Chapter 2️⃣ - introduces generative models, which are the large language models we commonly refer to today. After presenting the basic process of building these models, we will also explore how to scale up model training and handle long texts.
Chapter 3️⃣ - introduces prompting methods for large language models. We will discuss various prompting strategies, along with more advanced methods such as chain-of-thought reasoning and automatic prompt design.
Chapter 4️⃣ - introduces alignment methods for large language models. We will focus on instruction fine-tuning and alignment based on human feedback.
Chapter 5️⃣ - introduces inference methods for large language models. We will discuss various decoding algorithms, acceleration methods, and the inference-time scaling issue.
Source: https://arxiv.org/pdf/2501.09223 By Tong Xiao and Jingbo Zhu - Thanks, Alex Axworthy for sharing.
#JingboZhu #TongXiao #LLMBasics #NLPModels #AIResearch #ModelTraining #DeepLearning #SelfSupervised #PromptDesign #ModelScaling #TransformerAI #TokenPrediction #TextGeneration #LanguageModel #EncoderDecoder #BERTModel #GPTModel #T5Model #BARTModel #FineTuning #ZeroShot #FewShot #RLHFTraining #AIAlignment #AIInference #MaskedLearning #CausalModeling #SequenceModel #LanguageTasks #AIOptimization #ModelLoss #CrossEntropy #TextPrompt
A foundational guide to how LLMs work, focusing on core principles; even though it doesn’t dive directly into cybersecurity, it covers architectures, training strategies, prompting, alignment, and inference methods
Chapter 1️⃣ - introduces the basics of pre-training. This is the foundation of large language models, and common pre-training methods and model architectures will be discussed here.
Chapter 2️⃣ - introduces generative models, which are the large language models we commonly refer to today. After presenting the basic process of building these models, we will also explore how to scale up model training and handle long texts.
Chapter 3️⃣ - introduces prompting methods for large language models. We will discuss various prompting strategies, along with more advanced methods such as chain-of-thought reasoning and automatic prompt design.
Chapter 4️⃣ - introduces alignment methods for large language models. We will focus on instruction fine-tuning and alignment based on human feedback.
Chapter 5️⃣ - introduces inference methods for large language models. We will discuss various decoding algorithms, acceleration methods, and the inference-time scaling issue.
Source: https://arxiv.org/pdf/2501.09223 By Tong Xiao and Jingbo Zhu - Thanks, Alex Axworthy for sharing.
#JingboZhu #TongXiao #LLMBasics #NLPModels #AIResearch #ModelTraining #DeepLearning #SelfSupervised #PromptDesign #ModelScaling #TransformerAI #TokenPrediction #TextGeneration #LanguageModel #EncoderDecoder #BERTModel #GPTModel #T5Model #BARTModel #FineTuning #ZeroShot #FewShot #RLHFTraining #AIAlignment #AIInference #MaskedLearning #CausalModeling #SequenceModel #LanguageTasks #AIOptimization #ModelLoss #CrossEntropy #TextPrompt
🔥2