🧨 LLM научились ловить ботов. Теперь боты учатся обманывать LLM
Соцсети всё чаще используют LLM для поиска ботов. Модель читает профиль, историю публикаций и пытается понять, перед ней человек или автоматизированный аккаунт.
Проблема начинается в тот момент, когда атакующий понимает, как работает детектор.
⚙️ Достаточно переписать запрос
Исследователи из Reichman University проверили три open source модели: Llama 3 8B, Gemma 7B и Mistral 7B.
Они использовали два класса атак.
🔹 Content Manipulation: AI переписывает публикации бота так, чтобы они выглядели более естественно.
🔹 LLM Manipulation: в данные добавляется prompt injection, который пытается заставить классификатор забыть исходную задачу.
У Llama точность детектирования после некоторых атак падала примерно с 91% до 75%. Для Gemma падение доходило примерно до 35%.
🧠 Атака на сам детектор
Самый действенный результат связан с prompt injection. Для Llama и Gemma некоторые варианты атак снижали качество классификации примерно на 46% и 48% соответственно. Причём модель могла начать выполнять инструкции из анализируемого контента вместо первоначальной задачи определения бота.
Таким образом, система безопасности сама становится объектом атаки.
🔥 Один LLM против другой
Авторы проверили несколько защитных подходов: delimiters, self examination, in context learning, feature guidance и проверки known answer.
Универсального решения не нашлось. Например, для Llama feature guidance помогал против reasoning injection, а known answer оказался особенно эффективен против некоторых других вариантов атак. Поэтому исследователи собрали LSABRE, ансамбль из нескольких LLM.
Он работает в три этапа:
Detection → Prevention → Classification
Сначала несколько моделей ищут признаки манипуляции. Подозрительный контент получает дополнительную защиту. После этого основная модель выполняет классификацию.
В эксперименте LSABRE достиг 86,2% accuracy при атаке и сохранил FPR около 13%.
🔗 Исследование: https://arxiv.org/abs/2608.15893
🔗 GitHub LSABRE: https://github.com/runi-cyber-ai/LSABRE
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #BotDetection #PromptInjection #AISecurity #RedTeaming #CyberSecurity #SecureTechTalks
Соцсети всё чаще используют LLM для поиска ботов. Модель читает профиль, историю публикаций и пытается понять, перед ней человек или автоматизированный аккаунт.
Проблема начинается в тот момент, когда атакующий понимает, как работает детектор.
⚙️ Достаточно переписать запрос
Исследователи из Reichman University проверили три open source модели: Llama 3 8B, Gemma 7B и Mistral 7B.
Они использовали два класса атак.
🔹 Content Manipulation: AI переписывает публикации бота так, чтобы они выглядели более естественно.
🔹 LLM Manipulation: в данные добавляется prompt injection, который пытается заставить классификатор забыть исходную задачу.
У Llama точность детектирования после некоторых атак падала примерно с 91% до 75%. Для Gemma падение доходило примерно до 35%.
🧠 Атака на сам детектор
Самый действенный результат связан с prompt injection. Для Llama и Gemma некоторые варианты атак снижали качество классификации примерно на 46% и 48% соответственно. Причём модель могла начать выполнять инструкции из анализируемого контента вместо первоначальной задачи определения бота.
Таким образом, система безопасности сама становится объектом атаки.
🔥 Один LLM против другой
Авторы проверили несколько защитных подходов: delimiters, self examination, in context learning, feature guidance и проверки known answer.
Универсального решения не нашлось. Например, для Llama feature guidance помогал против reasoning injection, а known answer оказался особенно эффективен против некоторых других вариантов атак. Поэтому исследователи собрали LSABRE, ансамбль из нескольких LLM.
Он работает в три этапа:
Detection → Prevention → Classification
Сначала несколько моделей ищут признаки манипуляции. Подозрительный контент получает дополнительную защиту. После этого основная модель выполняет классификацию.
В эксперименте LSABRE достиг 86,2% accuracy при атаке и сохранил FPR около 13%.
🔗 Исследование: https://arxiv.org/abs/2608.15893
🔗 GitHub LSABRE: https://github.com/runi-cyber-ai/LSABRE
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #BotDetection #PromptInjection #AISecurity #RedTeaming #CyberSecurity #SecureTechTalks
❤1👍1