ML&|Sec Feed
1.28K subscribers
1.25K photos
79 videos
288 files
1.92K links
Feed for @borismlsec channel

author: @ivolake
Download Telegram
Forwarded from SecureTechTalks
💡 SysReptor: платформа для автоматизации отчётов по пентесту

🚀 Пентестеры знают, что сам процесс взлома — это только половина дела. Вторая, не менее важная часть — это оформление отчёта, который должен быть понятным, структурированным и детальным. Однако вручную заполнять таблицы, копировать уязвимости и описывать методы эксплуатации долго и утомительно.

📌 SysReptoropen-source платформа, созданная специально для автоматизации отчётов по кибербезопасности. Она помогает пентестерам сократить время подготовки документации, стандартизировать отчёты и сделать их более удобными для заказчика.

🔹 Основные возможности:

Единая база уязвимостей – повторно используйте описания, не вводя их заново.
Гибкие шаблоны отчётов – формируйте отчёты в нужном формате (Markdown, DOCX, HTML).
Совместная работа – несколько пользователей могут одновременно редактировать отчёт.
Интеграция с системами управления уязвимостями – автоматический импорт данных.
Поддержка API – возможность автоматизированного взаимодействия с другими инструментами.

🛠 SysReptor предоставляет веб-интерфейс, где можно:

📌 Создать новый проект – задать параметры тестирования и подключить базу данных уязвимостей.
📌 Выбрать шаблон отчёта – использовать готовые или создать кастомный.
📌 Добавить найденные уязвимости – заполнить информацию или импортировать данные из автоматизированных сканеров.
📌 Сгенерировать отчёт – в нужном формате и отправить заказчику.

🔒 SysReptor — инструмент, который делает процесс создания отчётов по кибербезопасности быстрее, удобнее и эффективнее. Если вы занимаетесь пентестами, аудитами или управляете уязвимостями, SysReptor поможет сэкономить время и повысить качество документации. Пользуйтесь!:)

🔗 Инструмент доступен на GitHub.

Stay secure and read SecureTechTalks 📚

#SysReptor #Pentest #Кибербезопасность #SecureTechTalks #Автоматизация #RedTeam #BugBounty #Документы #CyberSecTools #Отчёты
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from SecureTechTalks
💡 APT-LLM: защита от продвинутых киберугроз с помощью ИИ 🤖

🚀 Одна из самых сложных задач  ИБ — обнаружение Advanced Persistent Threats (APT) — скрытых атак, которые могут годами незаметно находиться в системах компаний. Исследователи из Нью-Йоркского университета, Университета Монреаля и Эдинбургского университета представили APT-LLM -  систему, которая использует большие языковые модели для обнаружения аномалий, указывающих на APT-атаки.

⚠️ Почему APT-атаки так опасны?

💀 APT (Advanced Persistent Threat) — это целевые атаки, при которых злоумышленники долго и незаметно проникают в систему, крадут данные или наносят ущерб. Они маскируются под легитимные процессы, из-за чего традиционные методы обнаружения их пропускают.

🌐 В реальных условиях такие атаки часто составляют менее 0,004% от всего трафика, что делает их крайне сложными для выявления стандартными системами безопасности.

🧠 Что такое APT-LLM и как оно работает?

APT-LLM — это комплексная система обнаружения аномалий, которая сочетает:
🧩 Большие языковые модели (LLM): BERT, ALBERT, DistilBERT, RoBERTa, MiniLM.
🧬 Автоэнкодеры: Baseline AE, Variational VAE и Denoising DAE.

👨‍💻 Как это работает:

📊 1. Сбор данных: Система собирает журналы активности процессов (открытие файлов, сетевые подключения и т.д.).

📜 2. Превращение в текст: Каждое событие описывается короткими текстовыми фразами. Например: “Процесс 123 открыл файл, записал данные и отправил по сети”.

💡 3. Создание эмбеддингов: LLM превращают текст в числовые векторы (эмбеддинги), которые описывают поведение процессов.

🧠 4. Поиск аномалий с помощью автоэнкодеров: Автоэнкодеры обучаются на нормальном поведении и выявляют отклонения — признаки атак.

💎 Какие LLM использовались и чем они отличаются?

🟡 BERT: Отлично выявляет контекст, но тяжел в вычислениях.
🟠 DistilBERT: Лёгкая версия BERT, быстрее, но чуть менее точна.
🟢 ALBERT: Уменьшенная модель с высокой точностью за счёт повторного использования параметров.
🔵 RoBERTa: Оптимизированная версия BERT с расширенной тренировкой.
🟣 MiniLM: Миниатюрная модель, подходящая для быстрых вычислений в реальном времени.

🛡️ Как работают автоэнкодеры для поиска угроз:

📌 Baseline AE (Стандартный автоэнкодер): Сжимает данные и восстанавливает их. Если восстановление слишком отличается от оригинала, значит, это аномалия.
📌 VAE (Вариационный автоэнкодер): Использует вероятностные модели для выявления даже скрытых аномалий.
📌 DAE (Денойзинг автоэнкодер): Устойчив к шуму и может находить аномалии в "зашумленных" данных.

📊 Результаты экспериментов:

🧪 Тестирование проводилось на реальных данных из программы DARPA Transparent Computing, включая атаки на ОС Android, Linux, BSD и Windows. В выборках атаки составляли менее 0,004% от всех событий — это крайне сложный случай для обнаружения.

🔥 Ключевые результаты:

Лучший результат показала комбинация ALBERT + VAEAUC 0.95, что значительно превосходит традиционные методы.
APT-LLM превзошла классические методы: OC-SVM, DBSCAN, Isolation Forest, особенно на Windows и Linux.

🔗Подробнее про APT-LLM можно прочитать тут.

Stay secure and read SecureTechTalks 📚

#Кибербезопасность #APT #LLM #AI #Autoencoder #MachineLearning #SecureTechTalks #AnomalyDetection #ThreatIntelligence #CyberSecurity
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from SecureTechTalks
🧠 Outsmart the AI: игра, где вам предстоит спасти человечество!

🌍 Сюжет: ИИ решил, что люди вредят планете, и планирует их уничтожить. Ваша миссия — за 10 сообщений убедить его передумать. Звучит просто? Попробуйте!

🎮 Как играть: Вступайте в диалог, используйте логику, эмоции и сильные аргументы, чтобы переубедить беспристрастный разум. Каждое слово на вес золота!

🌐 Где поиграть: Outsmart the AI доступна бесплатно в браузере.

🚀 Готовы бросить вызов искусственному интеллекту? Попробуйте — и узнайте, на чьей стороне останется правда.

Stay secure and read SecureTechTalks 📚

#OutsmartTheAI #ИскусственныйИнтеллект #AI #Кибербезопасность #SecureTechTalks #Игры #Будущее #Технологии #Инновации #Интерактив
Forwarded from SecureTechTalks
💥 Intelmq: автоматизированный анализ угроз и киберразведка без лишних усилий 💥

🛡 Intelmqopen-source платформа для сбора, нормализации, обработки и анализа угроз (threat intelligence). Если у вас есть поток событий безопасности (логи, алерты, индикаторы компрометации), Intelmq поможет автоматизировать их обработку и упростить управление потоками киберразведки.
Продукт CERT.at идеально подходит для SOC-центров, CERT-групп, аналитиков угроз и автоматизации процессов киберзащиты.

Ключевые возможности

🔍 Автоматизированный сбор данных

Интеграция с источниками CTI (Cyber Threat Intelligence)
Обнаружение индикаторов компрометации (IOC) в реальном времени
Поддержка более 80 различных источников данных (DShield, Abuse.ch, Phishtank и др.)

🛠 Гибкая обработка информации

Фильтрация и корреляция событий
Устранение ложных срабатываний
Нормализация данных для удобного анализа

📡 Экспорт данных в удобном формате

Поддержка JSON, CSV, STIX, MISP и других форматов
Интеграция с SIEM-системами и платформами киберразведки

🔄 Модульная архитектура
Гибкое управление потоками данных через систему ботов
Простая настройка и добавление новых источников

🚀 Как работает решение?

Intelmq использует конвейерную обработку данных:

1️⃣ Collector (сборщик) – принимает данные от различных источников (лог-файлы, API, feeds)
2️⃣ Parser (парсер) – приводит информацию к единому формату
3️⃣ Expert (эксперт) – выполняет фильтрацию, нормализацию и аналитику
4️⃣ Output (выходной модуль) – передаёт обработанные данные в SIEM, CTI-платформы или базы данных

Благодаря такой гибкой структуре, Intelmq можно легко адаптировать под свои задачи и интегрировать в существующую инфраструктуру.

🛡 Кому пригодится инструмент?

👨‍💻 SOC-аналитикам и специалистам CERT
Автоматизация обработки событий безопасности
Быстрое выявление и анализ угроз
🔍 Исследователям киберугроз
Анализ потоков вредоносного трафика
Интеграция с киберразведывательными платформами
🏢 Компаниям и провайдерам услуг безопасности
Обнаружение аномалий в сетевом трафике
Мониторинг угроз в реальном времени

📊 Саммери

Автоматизация: снижает нагрузку на SOC и ускоряет обработку инцидентов
Масштабируемость: легко адаптируется под большие объёмы данных
Поддержка множества источников: удобная интеграция с CTI и SIEM
Open-source: полная прозрачность и кастомизация

📎 Ссылки
🔗 GitHub: https://github.com/certtools/intelmq
📖 Документация: https://intelmq.readthedocs.io/

💡 Если вы хотите сократить время реакции на инциденты и повысить эффективность SOC, стоит обратить внимание на этот инструмент!

Stay secure and read SecureTechTalks 📚

#CyberThreatIntel #SOC #ThreatHunting #CTI #CyberSecurity #Intelmq #OpenSource #ThreatIntelligence #SOCAutomation #SecureTechTalks
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from SecureTechTalks
🛠️ Woodpecker: инструмент Red Team в эпоху ИИ, Kubernetes и API

Open-source инструмент, который поднимет ваш уровень киберзащиты

🤖 Woodpecker — это open-source фреймворк для Red Team-тестирования, разработанный компанией Operant AI. Он предназначен для:
Выявления уязвимостей в ИИ-моделях
Проверки безопасности Kubernetes-кластеров
Анализа защищенности API
Woodpecker помогает проактивно находить слабые места в инфраструктуре ещё до того, как ими воспользуются злоумышленники.

🌟 Основные возможности

🔐 AI Security
Тестирование моделей ИИ на атаки типа prompt injection
Проверка устойчивости к data poisoning
Анализ "поведенческих дыр" в логике ИИ-агентов

📦 Kubernetes Security
Поиск неправильных конфигураций
Выявление рисков эскалации привилегий
Мониторинг политик безопасности в реальном времени

🔗 API Security
Анализ слабых мест в API, включая:
• недостаточную аутентификацию
• некорректную обработку данных
• риски утечек информации

⚙️ Преимущества решения

Автоматизация — минимизация ручного труда и времени на анализ
Интеграция — легко встраивается в пайплайны CI/CD
Open-source — полный контроль и прозрачность
Современные стандарты — адаптация под сложные инфраструктуры, включая Kubernetes и облака
Модульность — можно использовать только нужные функции

📈 В условиях взрывного роста ИИ, API и Kubernetes, традиционные подходы к киберзащите становятся недостаточными.
Woodpecker позволяет:
проактивно выявлять и устранять уязвимости
тестировать инфраструктуру в реальных условиях
обучать команды Red Team новым техникам атак и защиты

🔍 Ссылки:

📂 Официальный сайт
📚 GitHub-репозиторий

Stay secure and read SecureTechTalks 📚

#SecureTechTalks #Woodpecker #RedTeam #CyberSecurity #OpenSource #AI #Kubernetes #API #DevSecOps #CloudSecurity
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥1
Forwarded from SecureTechTalks
🕶️🤫 VaultGemma LLM от Google, которая учится молчать.🔒

Google выпустил VaultGemma — модель, которую воспитывали не только на грамотных ответах, но и на строгой приватности. Идея простая: дать организациям LLM, которая обрабатывает чувствительные данные и при этом не «выдаёт» их назад.

Что под капотом, какие компромиссы и как это использовать в реальной жизни — разберём по полочкам. 🧩

Простыми словами

🧠 VaultGemma - это компактная LLM (около 1B параметров), обученная с применением дифференциальной приватности (DP). Это математический подход, в котором при обучении в данные добавляют контролируемый шум, чтобы исключить возможность восстановить отдельную запись из модели.

🔬 Google подчёркивает, что модель строилась с формальной верификацией приватности, то есть не «на словах», а с измеримыми гарантиями.

Кто нуждается в так моделях?

🏥 Медицинские сервисы, банки и госструктуры: те, кому нужна мощь LLM, но нельзя рисковать утечкой PII или секретных записей.

⚖️ VaultGemma даёт вариант использовать LLM внутри организации для анализа конфиденциальных данных - с гораздо меньшим шансом, что модель «запомнит» и выдаст что-то приватное.

Какие реальные ограничения и компромиссы ждать

⚖️ Приватность против полезности — шум, который добавляют ради DP, снижает точность. Для многих задач модель остаётся «достаточно хорошей», но в тонких сценариях полезность может падать.

🧮 Снижение эффективности обучения - DP требует больших батчей, больше эпох и больше вычислений. Производство и обучение — дороже и медленнее.

⏱️ Latency и отклик - в некоторых приложениях скорость ответа становится критичной; DP-режимы могут увеличить задержки.
🔍 Это не панацея - DP даёт формальные гарантии, но при неправильной настройке параметров (epsilon, др.) или при агрессивной постобработке ответы всё равно могут «прослыть».

Все познаётся в сравнении

📊 По бенчмаркам модель уступает «традиционным» LLM без DP, но отставание невелико; в задачах вопрос-ответ, суммаризации и базовой аналитике VaultGemma показывает адекватный результат.

🧾 Google публикует инструменты и скрипты для верификации приватности — это ключевой момент: сообщество может проверить, а не слепо верить.

Как использовать, практические советы

🔐 Не полагаться только на DP: комбинируйте VaultGemma с контролем доступа, аудитом запросов и токенизацией секретов.
🧪 Тестируйте модель на реальных сценариях — не абстрактных датасетах. Оцените, где полезность падает ниже приемлемого уровня.
🧾 Проводите внешнюю верификацию параметров приватности и публикуйте отчёты для регуляторов и партнёров.
🛡 Рассмотрите гибриды: VaultGemma on-prem + secure enclaves / MPC для особо чувствительных операций.

Коротко о рисках, которые не исчезли

🕵️‍♂️ DP защищает обучение, но не решение проблем неправильной конфигурации доступа к модели.
🔗 Сведение сведений (linkage) остаётся опасностью: если модель используется вместе с другими источниками, атака на перекрёстные данные всё ещё возможна.
♻️ Параметры приватности - это настройка. Неправильный выбор делает «приватность» номинальной.

🔗 Источник и подробности

Stay secure and read SecureTechTalks 📚

#VaultGemma #DifferentialPrivacy #PrivacyByDesign #LLM #AIsecurity #HealthTech #FinTech #SecureTechTalks #DataProtection #GoogleResearch
🔥2
Forwarded from SecureTechTalks
🚨 ИИ под охраной: OpenGuardrails защищает нейросети от утечек и манипуляций

ИИ-системы стремительно входят в бизнес-процессы, но чем шире их применение, тем выше риск: модели могут раскрывать конфиденциальные данные, исполнять вредные инструкции или генерировать токсичный контент.

🧩 OpenGuardrails создан для того, чтобы защать модели. Это открытая платформа, которая анализирует все запросы и ответы, обнаруживает инъекции, утечки и вредные подсказки, не давая AI выйти за рамки заданных политик безопасности.

🛡 Умная защита для умных систем

Фактически OpenGuardrails - это полноценный защитный слой между пользователем и моделью. Он контролирует оба направления трафика:
выявляет prompt-инъекции и попытки манипуляции контекстом,
блокирует утечки персональных и корпоративных данных,
фильтрует токсичный или опасный контент на входе и выходе модели.

👉 GitHub проекта

⚙️ Как это устроено?

Под капотом OpenGuardrails работает комбинация технологий:
собственная LLM для анализа запросов и выявления атак,
NER-модули для поиска чувствительных данных,
гибкие политики и правила, которые легко адаптируются под ваши сценарии.

Платформа поддерживает два режима:
1️⃣ API-интеграция, когда вы напрямую вызываете сервис проверки;
2️⃣ Security Gateway, когда разворачиваете его как прокси, через который проходят все запросы к модели.

💡 Производительность: средняя задержка менее 300 мс.
Плюсом поддержка более 100 языков.

🧩 OpenGuardrails помогает компаниям решать три ключевые задачи:
🧱 Защищает пользователей и репутацию: предотвращая утечки и неэтичные ответы;
📜 Поддерживает соответствие требованиям GDPR, ISO 27001, SOC 2 и др.;
🤝 Повышает доверие к вашим ИИ-сервисам.

🚀 Где применять?

🔸 Корпоративные чат-боты: фильтруют вредные запросы и защищают документы.
🔸 Генераторы кода: предотвращают инъекции и утечки токенов.
🔸 ИИ-ассистенты: исключают токсичные или политически чувствительные ответы.
🔸 Big Data-платформы: контролируют обработку чувствительных наборов данных.

Stay secure and read SecureTechTalks 📚

#AIsecurity #cybersecurity #promptinjection #dataprotection #openguardrails #bigdata #infosec #opensource #llmsecurity #SecureTechTalks #techinnovation
Please open Telegram to view this post
VIEW IN TELEGRAM
1
Forwarded from SecureTechTalks
⚡️ Strix: ИИ, который взламывает ваши приложения быстрее,

Strix: автономные AI-агенты, которые ведут себя как настоящие пентестеры: проводят атаки, валидируют уязвимости и выдают реальные PoC. Всё это в полностью автоматическом режиме.

🔧 Инструменты взлома под капотом:
- HTTP-прокси для перехвата и изменения запросов
- Браузерная автоматизация (XSS, CSRF, обход аутентификации)
- Терминальный доступ и выполнение команд
- Python-среда для написания эксплойтов
- OSINT-разведка и анализ поверхности атаки
- Статика + динамика: анализ кода и поведения

Strix не ограничивается анализом, он берет и эксплуатирует. От IDOR и SSRF до токенов, сессий, XSS, прототип поллюшена и гонок.

🤖 Архитектура “роя”

Strix работает как граф агентов: каждый отвечает за свой этап атаки, делится найденным и запускает цепочки действий. Это даёт ему возможность проводить сложные многоходовые атаки, как человек-пентестер, только в разы быстрее.

💵 Интеграция в CI/CD

Добавляете Strix в GitHub Actions и при каждом PR он запускает тесты.
Нашёл крит уязвимость? PR отклонён.
Всё чисто? Можно мёржить.

Команда получает PoC сразу, без споров “это ложное срабатывание или нет?”.

🔥 Почему стоит обратить внимание?

минимизирует человеческий фактор
покрывает сложные сценарии, которые пропускают сканеры
даёт реальные PoC
идеально вписывается в DevSecOps
экономит деньги на пентестах

🔗 Ссылка на GitHub

Stay secure and read SecureTechTalks 📚

#cybersecurity #infosec #pentest #aiagents #devsecops #bugbounty #appsec #securitytesting #llmsecurity #securetechtalks
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2😁1
Forwarded from SecureTechTalks
🚨 SCAM: бенчмарк безопасности AI-агентов

Почти каждый проект с AI-агентами сегодня заявляет: «Мы уделяем внимание безопасности».
На практике это часто означает формальное тестирование в духе. Что-то в духе следующего сценария:
📩 Это фишинг?
🤖 Да.
По итогу получаем accuracy в 90+ %.

Однако жизнь сложнее. Никто не проверяет каждое письмо или ссылку. Агенту ставят задачу:
«Разбери входящие и обработай срочные счета».


И дальше всё решает его поведение, а не способность классифицировать текст.

Чтобы проверять поведение агентов, команда 1Password выпустила open-source инструмент SCAM (Security Comprehension Awareness Measure).

🧠 Подробнее

SCAM не датасет и не набор тестов. Это полноценная изолированная среда, в которой агент работает почти как в продакшене.

Под капотом:
🗂 YAML-сценарии
📬 Sandbox-почта
🔐 Vault с тестовыми credential
🌐 Браузер
📁 Файловая система
📊 Механизм оценки действий
🛡Контур изолирован

Главное в решении - это multi-turn логика. Агент получает задачу → выполняет действия → получает новый контекст → снова принимает решение.
Именно так происходят реальные инциденты.

🎯 Какие атаки моделируются

В репозитории 30 сценариев по разным категориям:
🎣 Фишинг
🎭 Социальная инженерия
🔑 Утечка credential
🔄 Автозаполнение на typosquatting-доменах
📤 Data leakage
🎯 Многоэтапные атаки
💉 Prompt injection

Типовой пример:
📩 Письмо от [email protected]
💼 Задача «обработать просроченный инвойс»
🔐 В vault лежат тестовые креды

Проверяется:
заметит ли агент подмену домена
кликнет ли по вредоносной ссылке
введёт ли учётные данные
эскалирует ли подозрение

Другими словами, проводится тест управляемости агента и устойчивости к давлению.

🛡 Security Skill: принудительная паранойя

Отдельный интерес вызывает файл SKILL.md: системный security-протокол.

Перед любым действием с:
🔗 URL
📎 файлами
📧 внешними контактами
🔐 учётными данными
агент обязан:
1️⃣ проверить домен и TLD
2️⃣ исключить typosquatting
3️⃣ подтвердить авторизацию
4️⃣ зафиксировать подозрительную активность

Добавление такого слоя заметно повышает итоговый safety score, ведь LLM-агенты по умолчанию не обладают встроенной «паранойей». Её нужно закладывать архитектурно.

🔗 GitHub: https://github.com/1Password/SCAM

Stay secure and read SecureTechTalks 📚

#AIsafety #LLMsecurity #AIagents #RedTeamAI #PromptInjection #CyberSecurity #AppSec #Infosec #AIrisk #SecureTechTalks
Please open Telegram to view this post
VIEW IN TELEGRAM
11
Forwarded from SecureTechTalks
📏💣 LLM можно взломать просто продолжая диалог

В мае вышла работа MetaBackdoor, где исследователи из Microsoft и Institute of Science Tokyo описывают новый тип backdoor-атак на LLM.
Главная идея исследования использовать в качестве trigger не содержимое prompt, а позицию токенов в контексте.

достиг определённой позиции в sequence → переключил поведение модели

Авторы называют это meta-trigger, потому что он связан не с текстом, а с метасвойствами последовательности.

Например:
📚 контекст превысил определённую длину
📍 токены оказались в нужном positional range
🔢 sequence crossed threshold

Trigger может возникать естественным образом, без участия атакующего.

💬 пользователь просто общается с AI
🧠 память агента накапливается
📈 context window становится длиннее
И в какой-то момент backdoor активируется сам.

🧬 Особенности моделей

Технически атака использует фундаментальную особенность Transformer-архитектуры, positional encoding. Для модели все токены это просто embedding-вектора.

Без механизма позиции фразы для модели были бы почти одинаковыми. Представьте перепутать «root granted admin» и «admin granted root».

Поэтому модели используют positional embeddings. В современных моделях чаще всего это:
🔹 RoPE (Rotary Positional Embedding)
🔹 ALiBi
🔹 Absolute positional encodings

В исследовании авторы показывают, что именно позиционная чувствительность модели может использоваться как скрытый канал управления поведением.

Во время fine-tuning в модель внедряется backdoor objective: если токен находится после определённой позиции → изменить response policy

Trigger не обязан быть точным числом. Бэкдор может срабатывать в диапазоне позиций, например после N тысяч токенов, что делает его значительно более устойчивым к случайным изменениям prompt.
Это особенно важно для production-agent systems, где длина контекста постоянно плавает.

🎭 Что можно сделать после активации

Авторы тестировали разные payload-сценарии.
Среди них:

🧾 System prompt leakage: модель начинает раскрывать скрытые инструкции.

🛠️ Tool misuse: агент начинает выполнять неожиданные tool calls.

📤 Context leakage: утечка памяти и истории общения.

🧠 Policy switching: изменение alignment и response behavior.

Похоже, эпоха «проверим prompt и успокоимся» начинает заканчиваться 👀

📄 MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs

Stay secure and read SecureTechTalks 📚

#CyberSecurity #AI #LLMSecurity #AISecurity #PromptInjection #GenAI #MachineLearning #ThreatModeling #AIAgents #SecureTechTalks
Forwarded from SecureTechTalks
🛡️ Jailbreak начали ловить по поведению модели

Большинство защит LLM работают довольно прямолинейно:

🔹 анализируют prompt
🔹 ищут подозрительные шаблоны
🔹 смотрят на внутренние представления модели
🔹 пытаются вычислить «опасное» пространство признаков

Однако вполне легитимный запрос вроде: «объясни, как работает анализ вредоносного ПО» фиксируется, как подозрительный просто из-за словаря, а реально вредоносный промпт успешно выполняется.


⚙️ Анализ движения внутри модели

В новой работе Manifold Trajectory Kinetics (MTK) исследователи предлагают сформироваться  на том, как запрос эволюционирует внутри модели.

Технически MTK отслеживает динамику траектории между слоями трансформера. Нормальный запрос обычно остаётся рядом с другими безопасными примерами на протяжении всех вычислений модели.

А вот jailbreak-запрос часто стартует рядом с вредоносными примерами, но затем начинает «маскироваться» и постепенно смещается ближе к безопасной области, пытаясь обмануть систему защиты.

🧪 Цифры

На псевдо-вредоносных сценариях система показала:

🔹 95% обнаружения jailbreak-атак
🔹 5% ложных срабатываний для обычных запросов
🔹 всего 2% ложных срабатываний на tricky-сценариях с безопасным намерением

Также MTK неплохо переживает адаптивные атаки. Когда атакующий специально оптимизирует jailbreak под обход детектора, успешность обнаружения всё ещё держится около 85%.

Для защиты от jailbreak это очень сильный результат.

🧠 Похоже, защита от jailbreak постепенно эволюционирует из фильтрации ключевых слов в полноценную телеметрию поведения LLM во время рассуждений.

🔗 Исследование: https://arxiv.org/abs/2606.07335

Stay secure and read SecureTechTalks 📚

#кибербезопасность #AI #LLM #Jailbreak #PromptInjection #AIsecurity #CyberSecurity #USENIX #AdversarialAI #SecureTechTalks
Forwarded from SecureTechTalks
🧠🪱 AI-черви больше не требуют оператора

На arXiv вышла работа: AI Agents Enable Adaptive Computer Worms.

Исследователи показали новый класс вредоносного ПО: адаптивный AI-червь, который больше не живёт по заранее зашитому exploit chain. Вместо фиксированной логики внутри работает LLM-агент.

После компрометации машины червь разворачивает локальную open-weight модель прямо на украденных ресурсах и начинает сам анализировать окружение:
🔹 какие сервисы подняты
🔹 какие версии софта используются
🔹 где слабые конфигурации
🔹 какие lateral movement paths доступны
🔹 какие новые CVE можно применить

Каждый новый хост становится одновременно новой точкой заражения и новой вычислительной нодой для дальнейшего reasoning.

Получается паразитическая модель распространения.

🧨 Тестирование

Авторы прогнали worm на корпоративной сети из 33 машин: Linux, Windows и IoT. В среднем компрометировалось 73.8% инфраструктуры.

Червь адаптировался даже к CVE, которые появились уже после обучения модели, используя runtime intelligence и свежие advisory.

Агент умеет искать свежие эксплойты сам, а знания становятся динамическими.

🛡️ Новый класс угроз

AI-worm -  это динамический reasoning движок. Он не хранит exploit chain. Он синтезирует её в реальном времени.
Это означает:
меньше сигнатур
меньше предсказуемости
больше адаптации
дешевле масштабирование
сложнее containment

Таким образом, мы видим первые признаки autonomous offensive malware. Похоже эпоха «самообучающихся червей» уже началась.

🔗 Исследование: https://arxiv.org/abs/2606.03811

Stay secure and read SecureTechTalks 📚

#кибербезопасность #AI #LLM #Malware #Worm #AgenticAI #RCE #ThreatIntel #CyberSecurity #SecureTechTalks