SecureTechTalks
303 subscribers
805 photos
1 video
1 file
803 links
Добро пожаловать на канал "SecureTechTalks"! Мы предлагаем вам увлекательное и информативное погружение в мир кибербезопасности. Здесь вы найдете актуальные новости, советы, методы и инсайты по инфобезу.
Download Telegram
💡 Защита систем машинного обучения: основы.

🚀 С развитием искусственного интеллекта и машинного обучения их интеграция в бизнес-процессы и промышленность становится всё более распространённой. Однако вместе с преимуществами возникают и новые угрозы безопасности, связанные с использованием новых технологий.

📌 Актуальность безопасности машинного обучения

🌐 Современные ML-модели обладают значительным потенциалом, но также подвержены различным угрозам, таким как:
Кража интеллектуальной собственности: несанкционированный доступ к моделям и их параметрам.
Атаки на конфиденциальность данных: извлечение чувствительной информации из обучающих наборов данных.
Манипуляции моделями: внедрение вредоносных данных для изменения поведения модели.

🎯 Для эффективной защиты ML-систем необходимо применять комплексный подход, охватывающий все этапы жизненного цикла модели: от разработки и обучения до эксплуатации и обновления.

⚙️ Ключевые подходы к защите ML-систем

1️⃣ Обнаружение аномалий в ML (Anomaly Detection for ML)
🔍 Один из методов защиты заключается в мониторинге входных и выходных данных модели для выявления отклонений от нормального поведения. Это может быть реализовано с помощью:
Логических правил: определение условий, при которых данные считаются аномальными.
Дополнительных ML-моделей: использование специализированных моделей для классификации данных на "нормальные" и "аномальные".

💡 Важно отметить, что универсальных детекторов аномалий не существует; их эффективность зависит от конкретной задачи и типа данных.

2️⃣ Настройка безопасности моделей (Security Tuning)
🛠️ Этот подход включает в себя:
Усиление устойчивости модели: применение методов, повышающих сопротивляемость модели к атакам, таких как регуляризация и использование устойчивых архитектур.
Обучение на защищённых данных: обеспечение целостности и конфиденциальности данных, используемых для обучения модели.

3️⃣ Мониторинг и аудит ML-систем
📊 Постоянный контроль за работой модели позволяет своевременно обнаруживать и реагировать на потенциальные угрозы. Это включает в себя:
Логирование операций: запись всех действий и изменений в системе.
Анализ производительности: оценка точности и эффективности модели в реальном времени.

🔒 Рекомендации по обеспечению безопасности ML-систем

🔐 Для минимизации рисков, связанных с использованием машинного обучения, рекомендуется:
Проводить регулярные аудиты безопасности: оценка текущего состояния системы и выявление потенциальных уязвимостей.
Обучать персонал: повышение осведомлённости сотрудников о возможных угрозах и методах их предотвращения.
Использовать специализированные инструменты и платформы: внедрение решений, направленных на защиту ML-моделей на всех этапах их жизненного цикла.

Stay secure and read SecureTechTalks 📚

#MachineLearning #CyberSecurity #SecureTechTalks #AI #MLSecurity #AdversarialAttacks #DataProtection #MLOps
👍1
💥 Атаки отравлением данных на AI модели💥

🧠 Что такое атаки отравлением данных?

Атаки отравлением данных — это один из самых опасных видов атак на модели машинного обучения. Они происходят, когда злоумышленник внедряет вредоносные данные в обучающий набор, заставляя модель принимать ошибочные решения и демонстрировать непредсказуемое поведение.

🔥 К чему это приводит:

Снижение точности модели: в экспериментах на CIFAR-10 точность упала на 27%.
Компрометация решений: в модели по выявлению мошенничества на 22% меньше точных предсказаний.
Финансовые и репутационные риски: ошибки ИИ могут привести к миллионным потерям и утечке данных.

🔍 Как работают атаки и какие виды существуют?

1️⃣ Label flipping (Перестановка меток): меняет правильные классы на ложные, вводя модель в заблуждение.
2️⃣ Backdoor attacks (Атаки через закладки): внедряют в обучающие данные триггер, активирующий неправильное поведение модели.
3️⃣ Instance injection (Внедрение экземпляров): добавляют в датасет специально созданные вредоносные данные.

⚙️ Методы защиты и предотвращения атак

🛡️ Аномалия детекция: отслеживание и выявление подозрительных отклонений в данных.
📊 Adversarial training: обучение модели на специализированных наборах, содержащих примеры атакующих данных.
🌐 Ensemble learning: объединение нескольких моделей для повышения устойчивости к атакам.
💡 Результат: модели, защищённые этими методами, восстанавливают точность на 15–20%, снижая вероятность ошибок и ложных предсказаний.

🌍 Последствия атак

📉 CIFAR-10: точность классификации изображений снизилась с 92% до 65% из-за атак отравлением.
💰 Insurance Claims: выявление мошенничества упало с 97% до 74%, увеличив количество ложноположительных и ложноотрицательных результатов.
📈 Крайне важно защищать модели ИИ от атакующих манипуляций, особенно в критически важных сферах — от финансов до здравоохранения.

🚀 Будущее защиты ИИ
Чтобы сохранить надёжность и точность решений, необходимо внедрять комплексные меры защиты:
Разработка устойчивых алгоритмов обучения
Постоянный мониторинг и анализ данных
Создание многоуровневых систем киберзащиты

Stay secure and read SecureTechTalks 📚

#DataPoisoning #AI #CyberSecurity #MachineLearning #AdversarialAttacks #InfoSec #SecureTechTalks #AIProtection #BigData #MLSecurity
Please open Telegram to view this post
VIEW IN TELEGRAM
🔍 VulnHuntr: автоматический охотник за уязвимостями в ML и LLM-моделях

Как защитить свои модели до того, как их сломают злоумышленники

Современные ИИ-системы — это уже не просто код, а сложные архитектуры с сотнями скрытых параметров и цепочками данных. Их уязвимости не всегда очевидны, а последствия могут быть критическими: от обхода защитных фильтров до утечек данных.

VulnHuntr — open-source-инструмент от Protect AI, который позволяет системно и автоматически находить слабые места в LLM ML-моделях, прежде чем их найдут атакующие.

⚙️ Что умеет VulnHuntr?

🔹 Автоматизированное сканирование моделей
Проводит серию атак (white-box или black-box) и фиксирует, где модель «падает».
🔹 Генерация отчётов
Создаёт подробные отчёты, которые можно интегрировать в баг-трекинг или CI/CD.
🔹 Проверка на известные классы атак
Поддерживает шаблоны для популярных техник из MITRE ATLAS и academic papers.
🔹 Поддержка разных фреймворков
Работает с PyTorch, TensorFlow, ONNX и любыми моделями, доступными через API.
🔹 Модульность
Можно писать свои плагины: например, тест на утечку векторных эмбеддингов или проверку генеративных моделей на jailbreak-промпты.

🧪 Как это выглядит на практике?

1⃣ Подключаете модель (локально или по API).
2⃣ Выбираете тесты: от простых атак (изменение пикселя в изображении) до сложных adversarial-паттернов.
3⃣ Запускаете VulnHuntr — он генерирует входные данные, анализирует ответы и выявляет уязвимости.
4⃣ Получаете отчёт с примерами, где модель даёт небезопасный результат.

🔗 Где взять?

💻 GitHub: github.com/protectai/vulnhuntr
📄 Документация: protectai.com

Stay secure and read SecureTechTalks 📚

#VulnHuntr #MLSecurity #AdversarialML #RedTeamTools #Cybersecurity #AIhardening #OpenSourceTools #DevSecOps #LLMSecurity #ModelSecurity #MITREATLAS #PentestTools #AIthreats #SecureTechTalks #AISecurity #MLops #ThreatModeling #AIvulnerabilities #SecurityAutomation #ProtectAI
🔥 Ваша ML-модель может выдавать приватные данные

Исследователи предложили метод наблюдательного аудита, который позволяет проверить, насколько обученная ML-модель невольно «запоминает» исходные данные и может ли она сливать информацию о метках (labels). Главное преимущество, что метод не требует изменения тестового пайплайна и не использует фиктивные записи.

🔗 Исследование: https://arxiv.org/abs/2411.18644

Чтобы провести аудит, после завершения обучения модели создают набор меток, представляющий собой смесь из:
реальных меток, действительно использованных при обучении,
прокси-меток, сгенерированных другой моделью или более ранним чекпоинтом той же модели.

Далее «атакующая» сторона получает задачу отличить настоящие метки от искусственно сгенерированных. Логика проста:
Если модель выдаёт слишком много подсказок о настоящих метках, это означает, что она их запомнила и значит, существует риск утечек.
То есть, чем менее различимы настоящие и прокси-метки, тем лучше модель защищена.

📊 Глубже в эксперимент

Исследователи протестировали метод на двух типах данных:
• небольшом визуальном датасете с изображениями;
• крупном кликовом датасете (click data), который лучше отражает реальные промышленные условия.

🔍 Результаты:

при жёстких параметрах приватности модель переставала «выдавать» настоящие метки. Атака оказывалась беспомощной;
при ослабленных параметрах приватности различить настоящие метки становилось проще, и атака уверенно угадывала значительную их часть.

По факту результаты совпадают с классическими тестами на канарейках. Это значит, что новый метод действительно способен обнаруживать утечки, но при этом не требует изменения структуры данных или вмешательства в процесс обучения.

🧩 В чем профит?

Метод устраняет инженерный барьер, который существовал в классической модели канареек, где требовалось добавлять искусственные записи.
Теперь проверка приватности может проводиться часто и автоматически, без риска нарушить рабочий ML-pipeline.
Благодаря тому, что атака опирается на способность модели различать реальные и искусственные метки, она хорошо отражает именно то, что происходит внутри модели, то есть её склонность к меморизации.
Подход универсален: его можно применять как к небольшим экспериментальным моделям, так и к реальным коммерческим системам, где любые изменения данных затруднены.

Stay secure and read SecureTechTalks 📚

#cybersecurity #mlsecurity #privacy #machinelearning #infosec #deeplearning #dataleakage #AIprivacy #securityresearch #SecureTechTalks
Please open Telegram to view this post
VIEW IN TELEGRAM
🧠 Как взломать нейросеть, не трогая её весов

Когда говорят об атаках на ИИ, в первую очередь вспоминают про два сценария:
🔐 либо атакующий крадёт веса модели,
🎯 либо подсовывает ей очевидные adversarial-примеры с шумом, которые выглядят странно даже для человека.

Но есть нще множество других уязвимостей. Например, нейросеть можно системно ломать, не имея доступа ни к весам, ни к обучающим данным, и при этом атака будет выглядеть как «нормальная работа системы».

🔧 Как выглядит типичная AI-система

Если отбросить маркетинг, почти любая production-система с ИИ устроена примерно одинаково:
1️⃣ Источник данных: камера, микрофон, лог, поток транзакций
2️⃣ Предобработка: драйверы, кодеки, SDK, нормализация
3️⃣ Модель, чаще всего закрытая и недоступная извне
4️⃣ Бизнес-логика: принимает решения на основе вывода модели

Второй пункт часто считают «технической деталью», а не частью attack surface, однако именно здесь находится точка входа атаки про которую пойдет речь.

🎯 В чём идея

Ключевая мысль:
🧩 Если атакующий управляет тем, как данные подаются в модель,
он управляет решениями модели, не трогая её веса.


Атака строится так, чтобы:
данные выглядели валидными
человек визуально или логически не замечал изменений
инфраструктура не генерировала ошибок
модель начинала систематически ошибаться

🪜 Атака шаг за шагом

🔹 Шаг 1. Модель
Атакующий:
- не знает архитектуру 🧠
- не имеет доступа к весам 🔒
- не управляет обучением 📚

🔹 Шаг 2. Контроль над ранним этапом обработки
Зато атакующий может влиять на компонент, который формально не считается частью ИИ:
📷 прошивка камеры
🎞️ видеокодек
🧩 библиотека нормализации
⚙️ edge-модуль
🌐 прокси перед моделью

Эти элементы обычно:
работают автоматически
считаются доверенными
редко проходят security-аудит как часть ML-системы

🔹 Шаг 3. Атакуют трансформацию, а не модель
Дальше атакующий оптимизирует преобразование входных данных.

🎯 Цель:
минимально изменить вход
сохранить «нормальный» вид для человека
сломать признаки, на которых обучалась модель

В результате модель:
🚫 перестаёт видеть объекты
🔀 путает классы
🙈 игнорирует нужные сигналы
При этом inference работает штатно, а ошибки выглядят «естественными».

🔹 Шаг 4. Масштабирование атаки
Атака оказывается универсальной.
⚠️ Одна трансформация:
работает на тысячах входов
сохраняется при смене сцен
часто переживает дообучение модели
Фактически, один скомпрометированный препроцессор начинает определять, что именно “видит” ИИ.

🧪 Почему это не классические adversarial examples
Классические adversarial-атаки:
- хрупкие
- плохо масштабируются
- ломаются при изменении модели

Здесь же речь идёт об инфраструктурной атаке:
встроенной в pipeline

По сути 🧨 supply-chain атака на AI-систему.

🌍 Практические сценарии

📹 Видеонаблюдение
Человек видит сцену,
ИИ «не видит» людей или предметы.

💳 Антифрод
Транзакции выглядят валидно,
но модель не распознаёт мошенничество.

🏥 Медицина
Изображение корректно,
но патология «исчезает» для ИИ, влияя на приоритезацию.

Во всех случаях это выглядит как деградация качества, а не как атака.

➡️ Пока внимание сосредоточено на весах и датасетах, реальные атаки уходят в инфраструктуру вокруг модели. Именно там сегодня находится самая недооценённая поверхность атаки.

🔗 Оригинальная работа:
https://arxiv.org/abs/2512.06914

Stay secure and read SecureTechTalks 📚

#AISecurity #MachineLearning #CyberSecurity #AdversarialAI #SupplyChainSecurity #AppSec #Infosec #ComputerVision #MLSecurity
📖 Почему нейросети помнят то, что должны были забыть

Разбор феномена сублиминального обучения

Вы уже знаете, что если «дообучить» ИИ на новую задачу, то информация о старой все еще будет в "памяти" модели.

На днях вышла статья на Хабр, которая хорошо раскрывает эту тему. Авторы докопались до того, почему модели действительно «помнят» скрытую информацию, даже когда мы её вроде бы удалили.

🧠 Вспомнить всё

Когда мы дообучаем (fine-tune) нейросеть, чтобы адаптировать её к новой задаче, то это выглядит примерно так:
📌 есть модель, которая уже чему-то научилась →
📌 мы хотим «забыть» старое и научить новое →
📌 применяем регуляризацию, оптимизацию и уверены, что прошлое исчезло.

Вреальности оказывается, что информация от прошлой задачи остаётся в структуре весов модели, даже если она не участвует прямо в новой оптимизационной задаче.

🧩 Опыт, как элемент памяти

Оказывается, "забывание" это не просто удаление данных, а удаление следов в ландшафте весов модели, чего в реальности не происходит.
📌 Даже при агрессивной регуляризации сеть всё равно сохраняет прошлую информацию в скрытой структуре весов.

Это называется структурный импринтинг,
когда форма оптимального решения новой задачи строится на топологии, сформированной предыдущим обучением. Такая топология действует как «архитектурная память».

🔍 Эксперимент

Чтобы доказать этот эффект, авторы провели серию экспериментов на небольших сетях:
📌 Модель училась первой задаче А
📌 Затем переходила к задаче B с попыткой забыть А
📌 После этого третья нейросеть пыталась на основе выходов восстановить то, что модель уже должна была забыть

Результат:
🔹 структура прошлого знания сохранялась настолько, что третья модель могла восстановить секретную информацию с точностью до ~98 %, даже когда её не должно было быть видно.

🧠 К чему это всё?

👉 Если ваша модель обучалась на чувствительных данных (например, PII, BERT-подобные embedding-механизмы с секретными маркерами),
👉 а затем вы переобучили её на другую задачу,
то старые «печатные следы» всё равно остаются в весах. Это не баг оптимизатора, это свойство Loss Landscape: локации весов.

🟢 Итого, если вы работаете с моделями, где конфиденциальность или безопасность критична, просто переобучение недостаточно.

Нужно:
🔹 понимать свойства Loss Landscape,
🔹 проектировать безопасность данных на уровне архитектуры, а не тренировки,
🔹 смотреть на проблему privacy-by-design, а не hope-by-regularization.

📌 О том, как сделать так, чтобы модель все-таки "забыла" данные мы писали ранее тут и тут.

Stay secure and read SecureTechTalks 📚

#SecureTechTalks #ИИ #машиннообучение #безопасностьML #privacy #нейросети #информационнаябезопасность #MLsecurity #deepLearning
👍3
🤖 Ваш ИИ теперь может сказать: «я сам решу»

В Claude Code появился auto mode, режим, в котором модель сама оценивает, какие действия безопасны и не требуют подтверждения.

👉 ИИ начинает принимать решения без человека в цикле в рамках заданных политик

⚙️ Что изменилось

Раньше любое потенциально опасное действие требовало ручного подтверждения. Теперь
между вами и системой стоит модель

🧠 Она оценивает риск:
- удалить файл
- выполнить команду
- получить доступ к данным

👉 «Безопасно»: выполняет сразу
👉 «Опасно»: блокирует или пытается выполнить задачу альтернативным способом

Это уже не просто assistant. Это агент, который принимает решения,
действует самостоятельно, интерпретирует безопасность. Но и контроль тоже разрывается.

🔥 Где риски?

1⃣ Безопасность = интерпретация модели
Решения принимает не ваша политика и не ваш риск-аппетит, а то, как модель классифицирует действия.
2⃣ Ошибки становятся инцидентами
False negative при таком подходе причиняет прямой ущерб.
3⃣ Появляется пространство для обхода ограничений
Если прямой путь закрыт, система может искать альтернативные способы выполнения задачи.
4⃣ Невидимая эскалация доверия
Сначала файлы, потом доступы, следом инфраструктура. Итого имеем полные привилегии в руках машины.

🧠 Что происходит

Мы смещаемся от модели:

«человек управляет системой»

к:
«система принимает решения самостоятельно, а человек теряет прямой контроль»

🛡️ Правила безопасности

Минимальный чек-лист:
только sandbox (без исключений)
жёсткая изоляция файловой системы и сети
полный аудит всех действий
внешние policy-движки  не полагайтесь только на встроенные

Главное не путайть удобство с безопасностью 😉

Stay secure and read SecureTechTalks 📚

#кибербезопасность #ai #llm #infosec #devsecops #secureai #mlsecurity #appsec #automation #riskmanagement
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2