SecureTechTalks
303 subscribers
805 photos
1 video
1 file
803 links
Добро пожаловать на канал "SecureTechTalks"! Мы предлагаем вам увлекательное и информативное погружение в мир кибербезопасности. Здесь вы найдете актуальные новости, советы, методы и инсайты по инфобезу.
Download Telegram
🔥🛡 FRAME: фреймворк для оценки рисков атак на ML-модели!

👾 Adversarial Machine Learning (AML) - это реальная угроза. Вашу ML-модель можно атаковать так же, как сервер или веб-приложение. Но как понять, какие атаки действительно угрожают именно вашей системе?

До сих пор у нас не было универсального ответа.
Команда из Университета Бен-Гуриона представила FRAME - комплексный и автоматизированный инструмент для оценки рисков AML-атак. Это рабочий фреймворк, проверенный на реальных сценариях.

🤔 Где скрывалась проблема?

Классические системы анализа киберрисков (CVSS, MITRE ATT&CK) не учитывают уникальные уязвимости ML-моделей.
А существующие AML-инструменты (например, ART) оценивают лишь «устойчивость» модели к отдельным атакам, но игнорируют:
🌐 где развёрнута система,
🕵️ кто атакует (хакер, инсайдер, клиент),
⚖️ насколько реальна атака,
💥 какой бизнес-ущерб она нанесёт.

FRAME решает все эти вопросы системно.

⚙️ Как работает FRAME

Фреймворк построен из пяти взаимосвязанных компонентов:

📋 System Profiling - владелец системы заполняет анкету. LLM помогает адаптировать вопросы под конкретный use-case. Сразу оцениваются архитектура модели, данные, безопасность и критичность атак.

🗺 Attack Feasibility Mapping - карта из 86 атак AML (от Membership Inference до Evasion), связанная с факторами успешности и последствий.

📊 Performance Data Integration - база знаний из 1000+ научных статей, где описана успешность атак в реальных условиях.

🧮 Risk Modeling - расчёт итогового риска:
Риск = (Возможность атаки) × (Успешность) × (Воздействие)
Учитываются цифровые и физические атаки.

📈 Risk Ranking - ранжированный список TOP-угроз для вашей системы, плюс сгенерированные LLM сценарии атак.

🚨 Пример: E-commerce

ML-модель сортирует отзывы покупателей. Недобросовестный продавец решает обмануть систему:
🥇 Black-Box Interactive Evasion (риск ~6/10). Злоумышленник подбирает тексты до тех пор, пока модель не даёт нужный результат.
🥈 Black-Box Transferable Evasion (риск ~5.6/10). Тренирует surrogate-модель и создаёт «ядовитые» примеры.
🥉 Resource-Latency Attack (риск ~2.8/10). Создаёт отзывы, перегружающие систему, снижая доступность.

💡 Инсайты исследования

👑 Integrity-атаки доминируют (80%+ случаев). В NLP их доля доходит до 94%!

💻 Цифровые атаки эффективнее физических. Исключение — голосовые системы, где физические приёмы работают лучше.

⚖️ White-Box vs Black-Box почти 50/50, но домен решает:
NLP и Cyber - чаще Black-Box,
CV - White-Box.

Атаки на доступность редки (4%), но критически важны для real-time систем (например, спутниковая связь).

Проверка боем

FRAME уже протестирован на 6 реальных кейсах (от антиспама до спутниковых сигналов).

Эксперты по AML оценили точность работы:
🎯 Overall Accuracy: 9/10
📌 Релевантность TOP-5 атак: ~9/10
Вывод: FRAME не просто генерирует список атак, а правильно расставляет приоритеты.

🔮 Планы на будущее

Авторы планируют добавить:
🛡️ автоматические рекомендации по защите (например, как adversarial training меняет оценку риска),
🤖 поддержку многомодельных систем,
📂 открытый доступ к коду и датасету.

🔗 Подробнее читайте в статье

Stay secure and read SecureTechTalks 📚

#FRAME #AdversarialML #MachineLearning #AIsecurity #RiskAssessment #Кибербезопасность #ML #ИБ
🤖 LLM и приватность данных: почему исследования ИИ смотрят не туда

Недавнее исследование от Carnegie Mellon University и Northeastern University показало любопытную (и немного тревожную) картину:
большинство научных работ по приватности в ИИ сосредоточено не там, где реально горит 🔥

🧠 Спойлер: учёные посмотрели на 1 322 публикации за последние 9 лет и поняли - 9 из 10 исследователей копают один и тот же узкий участок,
в то время как поле вокруг уже тлеет по периметру.


📚 Что обнаружили?

📊 92% исследований касаются двух тем:
1️⃣ защиты обучающих данных
2️⃣ утечек истории чатов пользователей
💡 Остальные 8% - это всё, что происходит за пределами лаборатории:
🕵️ инференс-атаки
🔌 утечки через агентные системы
🧩 сбор и корреляция данных между сервисами
🗂️ скрытые профили пользователей

Итог: сотни статей о том, как не дать модели запомнить пароль,
но почти ни одной - о том, куда потом улетает ваш разговор с моделью,
если она встроена в корпоративного помощника 🤷‍♂️

🧩 Приватность ≠ конфиденциальность

Учёные предлагают новую таксономию утечек:
1️⃣ 🧠 Утечки обучающих данных
2️⃣ 💬 Прямая утечка чатов
3️⃣ 🔗 Косвенные утечки через интеграции и плагины
4️⃣ 🧮 Инференс - когда модель «угадывает» ваши данные
5️⃣ 🧱 Агрегация - сбор публичной информации в личные профили

🔎 Ключевая мысль:
данные утекают не потому, что «хакнули базу»,
а потому, что модель слишком хорошо связывает точки 🕸️

🧱 Иллюзия выбора

Контроль чаще всего иллюзия:
формы обратной связи продолжают храниться
данные остаются «для безопасности» или «комплаенса»
удаление можно отменить внутренним регламентом
🧨 Учёные называют это «эрозией приватности под маской выбора».


Иными словами: галочка «не использовать мои данные» может быть просто декоративной...

⚙️ Новое вызовы - агентные системы

Когда LLM превращаются в агентов, которые ходят в базы данных, CRM, Jira или Slack -
начинается настоящий ад!

🕳️ Пользователь не видит, что именно делает агент:
ищет отчёт... или выгружает фрагменты данных из другой системы?
👁️‍🗨️ Контроль за агентами - почти «чёрный ящик».
И надеяться, что пользователи сами будут следить за этим, наивно.
💡 Приватность должна быть встроена в дизайн, а не прикручена сверху.

🧠 Что же делать?

🧰 5 правил кибер-гигиены для LLM-систем:
1️⃣ Проверяйте LLM-поставщиков.
🔍 Запрашивайте отчёты: где и как хранятся пользовательские данные.
2️⃣ Минимизируйте сбор данных.
🧹 Чем меньше храните - тем меньше сможете потерять.
3️⃣ Аудитируйте агентов.
🧾 Даже внутренних. Логируйте контексты и действия.
4️⃣ Встраивайте приватность в архитектуру.
🧱 Не плагином, а фундаментом.
5️⃣ Обучайте пользователей.
💬 Разговор с ИИ = API-запрос с контекстом, а не безобидный чат.

➡️ ИИ умеет помнить, обобщать и делать выводы -
а значит, ошибок «по невнимательности» больше не бывает.

🔗 Источник: arxive.org

Stay secure and read SecureTechTalks 📚

#cybersecurity #infosec #LLM #AIprivacy #dataprotection #securedevelopment #cyberthreats #securityawareness #machinelearning #SecureTechTalks
11👍1🔥1🤝1
🚨 OpenAI выпустила GPT-OSS Safeguard: открытую систему безопасности для ИИ

Компания OpenAI представила GPT-OSS Safeguard: набор открытых моделей, которые помогают проверять безопасность контента и отслеживать корректность работы других нейросетей.

Это шаг к тому, чтобы сделать процессы Trust & Safety прозрачнее и управляемее.

🧩 OpenAI выпустила две модели: gpt-oss-safeguard-120B и gpt-oss-safeguard-20B.
Обе доступны с открытыми весами по лицензии Apache 2.0 их можно использовать, модифицировать и запускать локально.
📜  Модель принимает правила безопасности (policy) во время выполнения.
Разработчик может задать собственные критерии, и Safeguard классифицирует запросы или ответы по этим правилам.

💬 Ещё одно преимущество в том, что модель возвращает обоснование решения (chain-of-thought), что делает проверку прозрачной и в теории пригодной для аудита.

Подробнее в официальном блоге OpenAI.

🧠 Что умеет модель?

🤖 Модель анализирует текст, сопоставляет его с правилами и выдает оценку риска.
Например, она может определить, что сообщение содержит обход фильтра, и пометить его как «high risk».

📊 Вместо обычного «разрешено/запрещено» Safeguard объясняет, почему принято то или иное решение.
Это можно использовать для логирования, расследований и улучшения политики безопасности.

🔐 Новые возможности

Safeguard позволяет:
⚙️ внедрять собственные правила и политики проверки;
🔒 запускать модель внутри корпоративного периметра;
📑 анализировать reasoning-цепочки при расследованиях;
🧠 адаптировать правила без повторного обучения модели.

Открытые веса делают систему гибкой и позволяют интегрировать её в решения, где важно хранить данные локально.

⚠️ Риски

🔓 Открытые модели это не только гибкость, но и сложность настройки.
Если политика безопасности описана неточно, возможны ошибки классификации и ложные срабатывания.
🧨 Reasoning-модели можно обмануть подобранными запросами (prompt injection), поэтому нужно внедрять дополнительные инструменты защиты.

💬 Вопросы, на которые предстоит ответить

Насколько reasoning реально помогает в аудите?
🧩 Можно ли избежать утечек через объяснения модели?
Подходит ли Safeguard для real-time систем?

Stay secure and read SecureTechTalks 📚

#OpenAI #ИИ #Кибербезопасность #TrustAndSafety #AIsecurity #MachineLearning #DataProtection #CyberThreats #TechNews #SecureTechTalks
🔥2
🕵️‍♂️ Почему «сильные» пароли это обман.

Большинство популярных сервисов уверенно ставят вам зелёную галочку “Strong Password”.
Однако эта галочка почти ничего не значит.

🔍 Как индустрия годами вводила пользователей в заблуждение

Правила LUDS (заглавная, цифра, спецсимвол) породили миллионы одинаковых «сложных» паролей:
P@ssw0rd123!, Qwerty2024!, Admin!2023.

Они проходят проверки, но ломаются мгновенно, потому что построены на предсказуемых паттернах.

🧬  Исследование

Для оценки был создан гибридный feature set, который:
- нормализует leetspeak (P@ssw0rd → password);
- ищет клавиатурные паттерны (1234, qwerty, asdf);
- анализирует n-граммы через TF-IDF;
- выявляет dictionary words;
учитывает реальный charset.

Затем обучены 4 модели: Random Forest, SVM, CNN, Logistic Regression.

По итогу лучше всех с задачей справляется Random Forest: 99.12% по F1 score.

⚠️ Что является «серой зоной»?

Средняя категория самое интересное место:
- P@ssword123!: выглядит сложно, но внутри dictionary + predictable pattern.
- boatboatboat1: длинный, но энтропия низкая.
- asdf!@#$: декоративный шум, но является клавиатурной последовательностью.

Традиционные проверялки ставят этим паролям “хорошо”.
Модель говорит - “опасно”.

🧨 Что по итогу?

LUDS-правила устарели.
Популярные password meters создают ложную уверенность.
Реальную сложность определяют не символы, а непредсказуемость структуры.

Stay secure and read SecureTechTalks 📚

#cybersecurity #passwords #infosec #investigation #machinelearning #randomforest #entropy #SecureTechTalks
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Ваша ML-модель может выдавать приватные данные

Исследователи предложили метод наблюдательного аудита, который позволяет проверить, насколько обученная ML-модель невольно «запоминает» исходные данные и может ли она сливать информацию о метках (labels). Главное преимущество, что метод не требует изменения тестового пайплайна и не использует фиктивные записи.

🔗 Исследование: https://arxiv.org/abs/2411.18644

Чтобы провести аудит, после завершения обучения модели создают набор меток, представляющий собой смесь из:
реальных меток, действительно использованных при обучении,
прокси-меток, сгенерированных другой моделью или более ранним чекпоинтом той же модели.

Далее «атакующая» сторона получает задачу отличить настоящие метки от искусственно сгенерированных. Логика проста:
Если модель выдаёт слишком много подсказок о настоящих метках, это означает, что она их запомнила и значит, существует риск утечек.
То есть, чем менее различимы настоящие и прокси-метки, тем лучше модель защищена.

📊 Глубже в эксперимент

Исследователи протестировали метод на двух типах данных:
• небольшом визуальном датасете с изображениями;
• крупном кликовом датасете (click data), который лучше отражает реальные промышленные условия.

🔍 Результаты:

при жёстких параметрах приватности модель переставала «выдавать» настоящие метки. Атака оказывалась беспомощной;
при ослабленных параметрах приватности различить настоящие метки становилось проще, и атака уверенно угадывала значительную их часть.

По факту результаты совпадают с классическими тестами на канарейках. Это значит, что новый метод действительно способен обнаруживать утечки, но при этом не требует изменения структуры данных или вмешательства в процесс обучения.

🧩 В чем профит?

Метод устраняет инженерный барьер, который существовал в классической модели канареек, где требовалось добавлять искусственные записи.
Теперь проверка приватности может проводиться часто и автоматически, без риска нарушить рабочий ML-pipeline.
Благодаря тому, что атака опирается на способность модели различать реальные и искусственные метки, она хорошо отражает именно то, что происходит внутри модели, то есть её склонность к меморизации.
Подход универсален: его можно применять как к небольшим экспериментальным моделям, так и к реальным коммерческим системам, где любые изменения данных затруднены.

Stay secure and read SecureTechTalks 📚

#cybersecurity #mlsecurity #privacy #machinelearning #infosec #deeplearning #dataleakage #AIprivacy #securityresearch #SecureTechTalks
Please open Telegram to view this post
VIEW IN TELEGRAM
🧠 Как взломать нейросеть, не трогая её весов

Когда говорят об атаках на ИИ, в первую очередь вспоминают про два сценария:
🔐 либо атакующий крадёт веса модели,
🎯 либо подсовывает ей очевидные adversarial-примеры с шумом, которые выглядят странно даже для человека.

Но есть нще множество других уязвимостей. Например, нейросеть можно системно ломать, не имея доступа ни к весам, ни к обучающим данным, и при этом атака будет выглядеть как «нормальная работа системы».

🔧 Как выглядит типичная AI-система

Если отбросить маркетинг, почти любая production-система с ИИ устроена примерно одинаково:
1️⃣ Источник данных: камера, микрофон, лог, поток транзакций
2️⃣ Предобработка: драйверы, кодеки, SDK, нормализация
3️⃣ Модель, чаще всего закрытая и недоступная извне
4️⃣ Бизнес-логика: принимает решения на основе вывода модели

Второй пункт часто считают «технической деталью», а не частью attack surface, однако именно здесь находится точка входа атаки про которую пойдет речь.

🎯 В чём идея

Ключевая мысль:
🧩 Если атакующий управляет тем, как данные подаются в модель,
он управляет решениями модели, не трогая её веса.


Атака строится так, чтобы:
данные выглядели валидными
человек визуально или логически не замечал изменений
инфраструктура не генерировала ошибок
модель начинала систематически ошибаться

🪜 Атака шаг за шагом

🔹 Шаг 1. Модель
Атакующий:
- не знает архитектуру 🧠
- не имеет доступа к весам 🔒
- не управляет обучением 📚

🔹 Шаг 2. Контроль над ранним этапом обработки
Зато атакующий может влиять на компонент, который формально не считается частью ИИ:
📷 прошивка камеры
🎞️ видеокодек
🧩 библиотека нормализации
⚙️ edge-модуль
🌐 прокси перед моделью

Эти элементы обычно:
работают автоматически
считаются доверенными
редко проходят security-аудит как часть ML-системы

🔹 Шаг 3. Атакуют трансформацию, а не модель
Дальше атакующий оптимизирует преобразование входных данных.

🎯 Цель:
минимально изменить вход
сохранить «нормальный» вид для человека
сломать признаки, на которых обучалась модель

В результате модель:
🚫 перестаёт видеть объекты
🔀 путает классы
🙈 игнорирует нужные сигналы
При этом inference работает штатно, а ошибки выглядят «естественными».

🔹 Шаг 4. Масштабирование атаки
Атака оказывается универсальной.
⚠️ Одна трансформация:
работает на тысячах входов
сохраняется при смене сцен
часто переживает дообучение модели
Фактически, один скомпрометированный препроцессор начинает определять, что именно “видит” ИИ.

🧪 Почему это не классические adversarial examples
Классические adversarial-атаки:
- хрупкие
- плохо масштабируются
- ломаются при изменении модели

Здесь же речь идёт об инфраструктурной атаке:
встроенной в pipeline

По сути 🧨 supply-chain атака на AI-систему.

🌍 Практические сценарии

📹 Видеонаблюдение
Человек видит сцену,
ИИ «не видит» людей или предметы.

💳 Антифрод
Транзакции выглядят валидно,
но модель не распознаёт мошенничество.

🏥 Медицина
Изображение корректно,
но патология «исчезает» для ИИ, влияя на приоритезацию.

Во всех случаях это выглядит как деградация качества, а не как атака.

➡️ Пока внимание сосредоточено на весах и датасетах, реальные атаки уходят в инфраструктуру вокруг модели. Именно там сегодня находится самая недооценённая поверхность атаки.

🔗 Оригинальная работа:
https://arxiv.org/abs/2512.06914

Stay secure and read SecureTechTalks 📚

#AISecurity #MachineLearning #CyberSecurity #AdversarialAI #SupplyChainSecurity #AppSec #Infosec #ComputerVision #MLSecurity
🚨 GPT проигрывает классическим подходам ИБ

Разметка MITRE ATT&CK показала пределы LLM

🧠 Автоматическая разметка текстов по MITRE

ATT&CK
давно остаётся одной из самых востребованных задач в кибербезопасности. Каждый день аналитики читают отчёты, threat intelligence, сценарии атак и описания уязвимостей, связывая их с тактиками и техниками противника. Это монотонная, дорогая и плохо масштабируемая работа. Не удивительно, что попытки её автоматизировать ведутся уже больше десяти лет.

📄 В январе 2026 года команда JPMorgan Chase опубликовала техническую работу, которая пытаеся решить проблему в новом ключе. Авторы напрямую сравнили GPT-4o и классический машинный подход, SGD-классификатор на TF-IDF.
👉 Arxiv

⚙️ Эксперимент был предельно прагматичным. Моделям давали отдельные предложения из threat intelligence и просили определить соответствующую тактику MITRE ATT&CK. 

Классическая модель показала около 82% точности, GPT-4o остановился примерно на 59%. Разница особенно заметна в редких тактиках и в ситуациях, где требуется строгое соответствие идентификаторам и терминологии ATT&CK.

🧩 Как авторы посмотрели на задачу.

«Разметка MITRE» не один шаг, а целый спектр задач разной сложности. В реальности один текст может соответствовать сразу нескольким тактикам, а каждая тактика нескольким техникам, связанным иерархически. Такая структура зачастую теряется в автоматизации.

🏗️ Решение JPMorgan построено снизу вверх и повторяет логику мышления аналитика. Текст разбивается на предложения, каждое предложение превращается в TF-IDF-вектор, после чего на первом уровне модель предсказывает несколько наиболее вероятных тактик. На втором уровне для каждой тактики используются отдельные модели, определяющие подходящие техники. В результате получается иерархическая мульти-лейбл разметка вида «тактика → техника», а не плоский список тегов.

📊 Этот подход даёт ощутимый прирост качества. При выборе трёх наиболее вероятных тактик точность на уровне тактик достигает около 94%, а при иерархической классификации техник примерно 82%. Важно и то, что система не допускает логических ошибок, когда техника предсказана без соответствующей ей тактики.

🔐 Отдельного внимания заслуживает инженерная деталь: авторы добавили хеширование признаков на этапе векторизации. Это позволяет защищать чувствительные данные и почти не влияет на качество модели. Благодаря этому решения можно безопасно распространять.

🧭 В итоге работа формулирует спокойный, но важный вывод. Ограничения автоматизации MITRE ATT&CK связаны не с тем, насколько «умна» модель, а с тем, насколько точно мы формализуем задачу. Иерархия, мульти-лейблы, строгие таксономии и объяснимость здесь важнее универсальной генерации текста.

Stay secure and read SecureTechTalks 📚

#SecureTechTalks #CyberSecurity #MITREATTACK #ThreatIntelligence #MachineLearning #LLM #SOC #AIinSecurity #BlueTeam #InfoSec
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
🧪 Продолжаем тестирования AI: взгляд на ASQAV SDK

В какой-то момент стало очевидно: привычные методы тестирования плохо применимы к AI-системам.

Раньше можно было сопоставить вход и ожидаемый результат. Теперь с LLM всё иначе.
Ответы вариативны, поведение зависит от контекста, а в случае агентных систем ещё и от цепочки решений, которая формируется прямо в процессе выполнения.

Не удивительно, что появляется все больше специализированных инструментов. Сегодня разберем еще один из них - ASQAV SDK.

⚙️ Изучаем поведение

ASQAV - open-source SDK для оценки и тестирования AI-приложений. Инструмент прежде всего пригодится там, где используются:

языковые модели
агенты
интеграции с внешними сервисами и данными

Его ключевая особенность в смещение фокуса. Он проверяет не «правильность ответа», а устойчивость системы. То есть, как она реагирует на некорректные, провокационные или откровенно вредоносные входные данные.

🔍 Подход ASQAV

Инструмент позволяет задавать сценарии, которые можно назвать «стрессовыми» для модели:

попытки prompt injection
обход ограничений (jailbreak)
провокации на утечку данных
некорректные или неоднозначные входные данные

Система проходит через сценарии последовательно, а результаты можно воспроизводить и встраивать в CI/CD.

Это приближает тестирование AI к тому, что в классической безопасности называется adversarial-подходом.

⚠️ Важное уточнение

ASQAV не определяет, что считать критичным,
не строит модель угроз и не заменяет архитектурные решения.

Инструмент позволяет регулярно проверять систему на устойчивость, а не полагаться на интуицию.

То есть, без классических инструментов все-таки не обойтись.

🧩 Немного по техничке

ASQAV строится вокруг идеи сценарного тестирования. Разработчик описывает набор кейсов (prompts, контекст, ожидаемые ограничения), после чего SDK прогоняет их через модель и фиксирует отклонения.

Тесты можно параметризовать, комбинировать и запускать пакетно. Этакие unit/integration-тесты для LLM-поведения. Результаты структурируются (оценки, флаги нарушений, логи ответов), что позволяет интегрировать проверки в пайплайны CI/CD и отслеживать деградацию модели со временем.

Инструмент работает на уровне API-взаимодействия с моделью, поэтому легко встраивается в существующую архитектуру без изменения самой LLM.

🔗 Репозиторий:

https://github.com/jagmarques/asqav-sdk

Stay secure and read SecureTechTalks 📚

#кибербезопасность #информационнаябезопасность #AIsecurity #LLM #AgenticAI #PromptInjection #AdversarialTesting #MachineLearning #DevSecOps #SecureTechTalks
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
🚨 Claude Code раскрывает секреты

31 марта 2026 года Claude Code утёк без взлома.
В npm-пакет не добавили *.map, и наружу ушёл bundle ~60 МБ с 500+ тыс. строк TypeScript-кода, включая внутреннюю логику, комментарии и feature-флаги.

🧠 Что именно утекло

В сети оказалась reference-реализация того,
как LLM превращается в исполняемого агента:
оркестрация вызовов инструментов
планирование задач
управление состоянием
enforcement ограничений

⚙️ Execution loop вместо «prompt → response»

Внутри есть цикл выполнения, где модель:
декомпозирует задачу
выбирает инструменты
получает результаты
пересобирает план

Причём цепочка не фиксирована и может ветвиться, этакий event-driven runtime.

🔄 KAIROS: фоновый агент

Отдельного внимание заслуживает режим KAIROS.

Это long-running процесс, который:
реагирует на события (например GitHub)
работает по «тикам»
поддерживает собственное состояние
инициирует действия без прямого запроса

Таким образом, агент становится проактивным, а не реактивным.

💤 AutoDream: работа с памятью

Механизм AutoDream отвечает за постобработку.
В idle-состоянии система:
пересматривает прошлые трейсы
устраняет противоречия
сжимает и нормализует контекст

В итоге имеем state reconciliation между сессиями.

🕵️ Undercover Mode

В коде явно выделен режим ограничения экспозиции:
подавление самореференций
фильтрация внутренних деталей
контроль формулировок ответов

Другими словами реализован слой output sanitization + policy enforcement.

🛡 Защита от model extraction

Отдельный блок посвящён защите от копирования:
искажение reasoning chain в ответах
внедрение «шумовых» инструментов
усложнение реконструкции логики

🎯 Архитектурный вывод

Claude Code не «обёртка над LLM», а полноценный стек. LLM выступает, как планировщик, runtime как исполнитель, а инструменты как расширение capability.
Что это, если не agent OS?

Stay secure and read SecureTechTalks 📚

#кибербезопасность #информационнаябезопасность #AIsecurity #LLM #AgenticAI #CyberThreats #MachineLearning #DevSecOps #ThreatIntelligence #SecureTechTalks
Please open Telegram to view this post
VIEW IN TELEGRAM
📏💣 LLM можно взломать просто продолжая диалог

В мае вышла работа MetaBackdoor, где исследователи из Microsoft и Institute of Science Tokyo описывают новый тип backdoor-атак на LLM.
Главная идея исследования использовать в качестве trigger не содержимое prompt, а позицию токенов в контексте.

достиг определённой позиции в sequence → переключил поведение модели

Авторы называют это meta-trigger, потому что он связан не с текстом, а с метасвойствами последовательности.

Например:
📚 контекст превысил определённую длину
📍 токены оказались в нужном positional range
🔢 sequence crossed threshold

Trigger может возникать естественным образом, без участия атакующего.

💬 пользователь просто общается с AI
🧠 память агента накапливается
📈 context window становится длиннее
И в какой-то момент backdoor активируется сам.

🧬 Особенности моделей

Технически атака использует фундаментальную особенность Transformer-архитектуры, positional encoding. Для модели все токены это просто embedding-вектора.

Без механизма позиции фразы для модели были бы почти одинаковыми. Представьте перепутать «root granted admin» и «admin granted root».

Поэтому модели используют positional embeddings. В современных моделях чаще всего это:
🔹 RoPE (Rotary Positional Embedding)
🔹 ALiBi
🔹 Absolute positional encodings

В исследовании авторы показывают, что именно позиционная чувствительность модели может использоваться как скрытый канал управления поведением.

Во время fine-tuning в модель внедряется backdoor objective: если токен находится после определённой позиции → изменить response policy

Trigger не обязан быть точным числом. Бэкдор может срабатывать в диапазоне позиций, например после N тысяч токенов, что делает его значительно более устойчивым к случайным изменениям prompt.
Это особенно важно для production-agent systems, где длина контекста постоянно плавает.

🎭 Что можно сделать после активации

Авторы тестировали разные payload-сценарии.
Среди них:

🧾 System prompt leakage: модель начинает раскрывать скрытые инструкции.

🛠️ Tool misuse: агент начинает выполнять неожиданные tool calls.

📤 Context leakage: утечка памяти и истории общения.

🧠 Policy switching: изменение alignment и response behavior.

Похоже, эпоха «проверим prompt и успокоимся» начинает заканчиваться 👀

📄 MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs

Stay secure and read SecureTechTalks 📚

#CyberSecurity #AI #LLMSecurity #AISecurity #PromptInjection #GenAI #MachineLearning #ThreatModeling #AIAgents #SecureTechTalks
👍2
🧠 Федеративное обучение: AI учится на данных, которых никогда не видел

Федеративное обучение всё чаще рассматривают для задач ИБ:

🔹 обнаружение атак
🔹 антифрод
🔹 анализ телеметрии SOC
🔹 поиск аномалий

Компании не готовы делиться сырыми логами, сетевым трафиком и инцидентами. Вместо централизации данных модель обучается распределённо.

⚙️ Как работает федеративное обучение?

Типовая схема выглядит следующим образом:

1⃣ сервер рассылает базовую модель

2⃣ участники обучают её локально на своей телеметрии;

3⃣ наружу уходят только обновления весов, эмбединги и параметры обучения;

4⃣ сервер объединяет изменения (обычно через  усреднение данных) и формирует новую глобальную модель.

Цикл повторяется множество раз. Данные инфраструктуру не покидают.

🧨 Поверхность атак

Федеративное обучение создаёт отдельную поверхность атак в виде самого процесса обучения.

1⃣ Отравление обучения

Скомпрометированный участник начинает отправлять вредоносные обновления, чтобы ухудшить обнаружение конкретных угроз или сместить поведение модели.

2⃣ Скрытые закладки

В модель встраивается скрытый триггер. Например, система обнаружения атак начинает пропускать вредоносный трафик только при определённой сетевой сигнатуре.

3⃣ Утечка через обновления модели

Даже без доступа к исходным данным иногда можно частично восстановить свойства обучающих примеров через анализ эмбеддингов.

То есть:

🛡️ Защита подхода FL

Лучшая практика защищать не только модель, но и весь цикл обучения. Обычно используют комбинацию мер:

🔹 Безопасная агрегация Сервер видит только итоговый результат объединения, а не вклад конкретной организации. Это снижает риск утечки через отдельные обновления.

🔹 Дифференциальная приватность
В обновления добавляется контролируемый шум, чтобы усложнить восстановление исходных данных по параметрам модели.

🔹 Фильтрация аномалий Система ищет подозрительные обновления: резкие отклонения весов, необычные градиенты или клиентов, чьё влияние слишком сильно отличается от остальных.

🔗 Исследование: https://arxiv.org/abs/2602.16480

Stay secure and read SecureTechTalks 📚

#кибербезопасность #AI #MachineLearning #FederatedLearning #Privacy #CyberSecurity #SOC #AIsecurity #ThreatDetection #SecureTechTalks
👍2