SecureTechTalks
303 subscribers
805 photos
1 video
1 file
803 links
Добро пожаловать на канал "SecureTechTalks"! Мы предлагаем вам увлекательное и информативное погружение в мир кибербезопасности. Здесь вы найдете актуальные новости, советы, методы и инсайты по инфобезу.
Download Telegram
🧨 LLM научились ловить ботов. Теперь боты учатся обманывать LLM

Соцсети всё чаще используют LLM для поиска ботов. Модель читает профиль, историю публикаций и пытается понять, перед ней человек или автоматизированный аккаунт.

Проблема начинается в тот момент, когда атакующий понимает, как работает детектор.

⚙️ Достаточно переписать запрос

Исследователи из Reichman University проверили три open source модели: Llama 3 8B, Gemma 7B и Mistral 7B.

Они использовали два класса атак.

🔹 Content Manipulation: AI переписывает публикации бота так, чтобы они выглядели более естественно.

🔹 LLM Manipulation: в данные добавляется prompt injection, который пытается заставить классификатор забыть исходную задачу.

У Llama точность детектирования после некоторых атак падала примерно с 91% до 75%. Для Gemma падение доходило примерно до 35%.

🧠 Атака на сам детектор

Самый действенный результат связан с prompt injection. Для Llama и Gemma некоторые варианты атак снижали качество классификации примерно на 46% и 48% соответственно. Причём модель могла начать выполнять инструкции из анализируемого контента вместо первоначальной задачи определения бота.

Таким образом, система безопасности сама становится объектом атаки.

🔥 Один LLM против другой

Авторы проверили несколько защитных подходов: delimiters, self examination, in context learning, feature guidance и проверки known answer.

Универсального решения не нашлось. Например, для Llama feature guidance помогал против reasoning injection, а known answer оказался особенно эффективен против некоторых других вариантов атак. Поэтому исследователи собрали LSABRE, ансамбль из нескольких LLM.

Он работает в три этапа:
Detection → Prevention → Classification

Сначала несколько моделей ищут признаки манипуляции. Подозрительный контент получает дополнительную защиту. После этого основная модель выполняет классификацию.

В эксперименте LSABRE достиг 86,2% accuracy при атаке и сохранил FPR около 13%.

🔗 Исследование: https://arxiv.org/abs/2608.15893
🔗 GitHub LSABRE: https://github.com/runi-cyber-ai/LSABRE

Stay secure and read SecureTechTalks 📚

#кибербезопасность #AI #LLM #AgenticAI #BotDetection #PromptInjection #AISecurity #RedTeaming #CyberSecurity #SecureTechTalks
1👍1