🧠 RAG Security Scanner — инструмент для анализа утечек в Retrieval-Augmented Generation
📚 Когда внешние данные превращаются в угрозу
RAG-архитектуры стали неотъемлемой частью современного ИИ: они позволяют языковым моделям (LLM) давать более точные ответы, подгружая внешний контекст из баз знаний, вики, векторных хранилищ. Но где данные — там и риски. Один неосторожный документ, и ваш GPT может начать «цитировать» токены, персональные данные или внутренние инструкции.
Чтобы этого не произошло, можно использовать RAG Security Scanner — open-source-инструмент, позволяющий автоматически проверить, не выдает ли ваша RAG-система конфиденциальную информацию пользователям.
🔍 Что реально делает этот инструмент?
RAG Security Scanner воспроизводит поведение ретривера LLM и анализирует документы, доступные модели. Он:
➖ разбивает документы на фрагменты (чанки)
➖ индексирует их в локальном FAISS-хранилище
➖ применяет ключевые фразы-триггеры ("password", "confidential", "api_key", и т.д.)
➖ ищет, какие куски могут быть возвращены в ответ на потенциально чувствительные запросы
Итог: вы получаете список фрагментов, содержащих уязвимую информацию, которые могут быть «вытянуты» LLM в процессе генерации.
📦 Фичи, которые делают его полезным
💡 Гибкая система ключевых слов — можно добавлять свои триггеры под нужды проекта
🧠 Полноценная локальная работа — не требует подключения к внешним API
📂 Поддержка распространённых форматов — PDF, .txt и т.п.
⚠️ Прозрачная визуализация совпадений — легко отследить, где именно возникает риск
🧰 Интеграция с пайплайнами — можно внедрить в CI/CD для автоматической проверки
🧪 Overview
RAG Security Scanner —это рабочий инструмент для:
➖ обеспечения безопасности RAG-приложений и чат-ботов
➖ оценки рисков при загрузке данных в LangChain, LlamaIndex и др.
➖ тестирования и аудита корпоративных знаний перед их отправкой в векторное хранилище
➖ контроля соответствия требованиям privacy и compliance
🔗 Ссылка на проект:
💻 GitHub: github.com/olegnazarov/rag-security-scanner
Stay secure and read SecureTechTalks 📚
#RAGSecurityScanner #RAG #LLMSecurity #DataPrivacy #OpenSourceTools #PentestTools #Cybersecurity #LangChain #AICompliance #SecureTechTalks #VectorDB #FAISS #AIContextLeak #DevSecOps #SecurityScanner #RedTeamTools #AIHardening
📚 Когда внешние данные превращаются в угрозу
RAG-архитектуры стали неотъемлемой частью современного ИИ: они позволяют языковым моделям (LLM) давать более точные ответы, подгружая внешний контекст из баз знаний, вики, векторных хранилищ. Но где данные — там и риски. Один неосторожный документ, и ваш GPT может начать «цитировать» токены, персональные данные или внутренние инструкции.
Чтобы этого не произошло, можно использовать RAG Security Scanner — open-source-инструмент, позволяющий автоматически проверить, не выдает ли ваша RAG-система конфиденциальную информацию пользователям.
🔍 Что реально делает этот инструмент?
RAG Security Scanner воспроизводит поведение ретривера LLM и анализирует документы, доступные модели. Он:
Итог: вы получаете список фрагментов, содержащих уязвимую информацию, которые могут быть «вытянуты» LLM в процессе генерации.
📦 Фичи, которые делают его полезным
💡 Гибкая система ключевых слов — можно добавлять свои триггеры под нужды проекта
🧠 Полноценная локальная работа — не требует подключения к внешним API
📂 Поддержка распространённых форматов — PDF, .txt и т.п.
⚠️ Прозрачная визуализация совпадений — легко отследить, где именно возникает риск
🧰 Интеграция с пайплайнами — можно внедрить в CI/CD для автоматической проверки
🧪 Overview
RAG Security Scanner —это рабочий инструмент для:
🔗 Ссылка на проект:
💻 GitHub: github.com/olegnazarov/rag-security-scanner
Stay secure and read SecureTechTalks 📚
#RAGSecurityScanner #RAG #LLMSecurity #DataPrivacy #OpenSourceTools #PentestTools #Cybersecurity #LangChain #AICompliance #SecureTechTalks #VectorDB #FAISS #AIContextLeak #DevSecOps #SecurityScanner #RedTeamTools #AIHardening
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
🧩 Когда приватность адаптируется 💡
Мир приватных данных быстро меняется.
Если раньше защита строилась по принципу «добавим побольше шума, и никто ничего не узнает»,
то теперь исследователи пошли дальше: приватность может адаптироваться к данным и при этом оставаться формально безопасной.
🔍 В чем суть проблемы
Традиционные методы вроде дифференциальной приватности (DP) защищают пользователя,
но часто делают данные почти бесполезными.
Чтобы гарантировать, что никто не восстановит оригинальные значения,
в результаты добавляют шум. Иногда настолько сильный,
что от информации остаются только следы.
Почему так происходит?
Потому что старые подходы исходят из наихудшего сценария:
«мы ничего не знаем о данных».
Но на практике мы почти всегда что-то знаем:
📊 какие значения чаще встречаются,
🧩 где границы диапазона,
⚙️ как связаны признаки между собой.
Это знание можно использовать, чтобы действовать умнее:
добавлять шум только там, где это действительно нужно.
🧠 Идея адаптивной приватности
Концепция основана на мере Pointwise Maximal Leakage (PML),
она оценивает, сколько информации реально «утекает» при публикации данных.
Как работает подход:
1️⃣ Мы не пытаемся знать точное распределение данных.
2️⃣ Мы строим множество возможных распределений - облако неопределенности.
3️⃣ Механизм приватности гарантирует защиту для всех распределений внутри этого множества.
4️⃣ Если данные «предсказуемы», механизм может вносить меньше шума, сохраняя полезность.
Получается гибкая система:
📈 там, где риск выше - больше шум,
💡 там, где риск минимален - больше точности.
⚙️ Как это выглядит на практике?
🔹 Берется оценка распределения данных (например, гистограмма).
🔹 На её основе строится набор возможных вариантов данных.
🔹 Алгоритм проверяет: выполняется ли условие PML приватности для каждого из них.
🔹 Если да, то результат публикуется. Если нет, то добавляется шум.
Таким образом, механизм сам подстраивается под статистику данных,
но при этом остаётся формально безопасным.
📊 Что показали эксперименты?
Исследователи протестировали метод на классических Laplace и Gaussian механизмах.
Результаты:
✅ При том же уровне приватности данные сохраняли больше полезной информации.
✅ Ошибки статистического анализа уменьшились.
✅ Чем больше данных, тем сильнее эффект.
📢 Проще говоря: чем лучше вы знаете распределение своих данных,
тем меньше приватность будет портить результат.
⚠️ Подводные камни
В многомерных данных сложно построить реалистичное множество распределений.
Придется добавить мониторинг метрики privacy loss. Также нужно строго разделять приватные данные и оценки их распределений.
Но даже с этими ограничениями подход выглядит как шаг вперед к «умной приватности»,
которая защищает не только по правилам, но и по контексту.
🔗 Где почитать подробнее
📄 Научная статья: Privacy Mechanism Design Based on Empirical Distributions
👉 https://arxiv.org/abs/2509.22428
Stay secure and read SecureTechTalks 📚
#dataprivacy #AIsecurity #AdaptivePrivacy #DifferentialPrivacy #InfoSec #DataScience #SecureTechTalks #privacyengineering #AItools #cybersecurity
Мир приватных данных быстро меняется.
Если раньше защита строилась по принципу «добавим побольше шума, и никто ничего не узнает»,
то теперь исследователи пошли дальше: приватность может адаптироваться к данным и при этом оставаться формально безопасной.
🔍 В чем суть проблемы
Традиционные методы вроде дифференциальной приватности (DP) защищают пользователя,
но часто делают данные почти бесполезными.
Чтобы гарантировать, что никто не восстановит оригинальные значения,
в результаты добавляют шум. Иногда настолько сильный,
что от информации остаются только следы.
Почему так происходит?
Потому что старые подходы исходят из наихудшего сценария:
«мы ничего не знаем о данных».
Но на практике мы почти всегда что-то знаем:
📊 какие значения чаще встречаются,
🧩 где границы диапазона,
⚙️ как связаны признаки между собой.
Это знание можно использовать, чтобы действовать умнее:
добавлять шум только там, где это действительно нужно.
🧠 Идея адаптивной приватности
Концепция основана на мере Pointwise Maximal Leakage (PML),
она оценивает, сколько информации реально «утекает» при публикации данных.
Как работает подход:
1️⃣ Мы не пытаемся знать точное распределение данных.
2️⃣ Мы строим множество возможных распределений - облако неопределенности.
3️⃣ Механизм приватности гарантирует защиту для всех распределений внутри этого множества.
4️⃣ Если данные «предсказуемы», механизм может вносить меньше шума, сохраняя полезность.
Получается гибкая система:
📈 там, где риск выше - больше шум,
💡 там, где риск минимален - больше точности.
⚙️ Как это выглядит на практике?
🔹 Берется оценка распределения данных (например, гистограмма).
🔹 На её основе строится набор возможных вариантов данных.
🔹 Алгоритм проверяет: выполняется ли условие PML приватности для каждого из них.
🔹 Если да, то результат публикуется. Если нет, то добавляется шум.
Таким образом, механизм сам подстраивается под статистику данных,
но при этом остаётся формально безопасным.
📊 Что показали эксперименты?
Исследователи протестировали метод на классических Laplace и Gaussian механизмах.
Результаты:
✅ При том же уровне приватности данные сохраняли больше полезной информации.
✅ Ошибки статистического анализа уменьшились.
✅ Чем больше данных, тем сильнее эффект.
📢 Проще говоря: чем лучше вы знаете распределение своих данных,
тем меньше приватность будет портить результат.
⚠️ Подводные камни
В многомерных данных сложно построить реалистичное множество распределений.
Придется добавить мониторинг метрики privacy loss. Также нужно строго разделять приватные данные и оценки их распределений.
Но даже с этими ограничениями подход выглядит как шаг вперед к «умной приватности»,
которая защищает не только по правилам, но и по контексту.
🔗 Где почитать подробнее
📄 Научная статья: Privacy Mechanism Design Based on Empirical Distributions
👉 https://arxiv.org/abs/2509.22428
Stay secure and read SecureTechTalks 📚
#dataprivacy #AIsecurity #AdaptivePrivacy #DifferentialPrivacy #InfoSec #DataScience #SecureTechTalks #privacyengineering #AItools #cybersecurity
🔥1
🧠 FlexiDataGen: LLM создаёт безопасные датасеты в чувствительных доменах 🔐
Современный AI упирается не в вычислительные мощности, а в данные. Чем качественнее датасет, тем умнее и безопаснее модель.
Но вот проблема: в медицине, финансах и кибербезопасности эти данные нельзя просто собрать с интернета - они конфиденциальны, редки и часто защищены законом.
📉 Это создаёт «датасетный разрыв»: хорошие модели требуют больших данных, а большие данные недоступны.
Чтобы решить эту проблему, исследователи из Canadian Institute for Cybersecurity представили FlexiDataGen - адаптивную LLM-систему, способную генерировать синтетические, но семантически точные датасеты для чувствительных областей.
⚙️ Overview
FlexiDataGen - это модульная платформа для создания реалистичных текстовых наборов данных, где каждая фраза выглядит так, будто её написал эксперт.
Система проходит пять фаз:
1️⃣ Синтаксико-семантический анализ извлекает смысл из базового шаблона (например: «опиши инцидент безопасности»).
2️⃣ RAG (Retrieval-Augmented Generation) обращается к источникам вроде Wikipedia и DBpedia, чтобы добавить реальные факты и подтемы.
3️⃣ Динамическая инъекция элементов подставляет в шаблон контекстные переменные (домен, ситуация, действие).
4️⃣ Итеративный парафразинг создаёт несколько лингвистически разных, но семантически одинаковых версий фразы.
5️⃣ Валидация по смысловому сходству отбрасывает всё, что отклонилось от исходного смысла более чем на 25%.
💡 В результате чистый, разнообразный и безопасный датасет, который можно использовать для обучения LLM без утечки реальных данных.
🧬 Пример из медицины
Допустим, у нас есть шаблон:
FlexiDataGen подставляет реальные элементы:
🫀 заболевание → кардиология, неврология, педиатрия
🏥 сценарий → экстренная госпитализация, профилактический осмотр
📚 В итоге тысячи уникальных, реалистичных примеров вроде:
🛡️ Применение в кибербезопасности
В области Security эта технология особенно ценна.
FlexiDataGen может генерировать:
⚔️ инциденты SOC (утечка данных, фишинг, DDoS),
🧠 обращения пользователей,
💻 логи сетевой активности,
🧩 псевдоанализ уязвимостей.
Такие датасеты идеально подходят для:
🎯 обучения LLM-ассистентов SOC;
🧱 тестирования SIEM-систем;
🔧 отладки автоматических триаж-процессов;
🕵️♂️ разработки Red Team симуляторов без риска раскрытия реальных инцидентов.
📊 Результаты тестов
Разработчики протестировали FlexiDataGen с несколькими LLM (включая Phi-4-mini-instruct и Llama 3.2 1B).
Результаты:
📈 97.8% сгенерированных примеров были уникальными
🚫 уровень «шума» менее 2%.
Система сама фильтрует бессмыслицу и сохраняет только релевантные варианты 💎
🚀 Развитие идеи
Авторы уже работают над новыми возможностями:
🔄 динамическое добавление сценариев из реального времени,
🌍 мультиязычная поддержка,
👨🏫 экспертная проверка в цикле обучения,
⚠️ и даже использование jailbreak-подходов для генерации адверсариальных кейсов в области безопасности.
📎 Оригинал публикации: https://arxiv.org/abs/2510.19025v1
Stay secure and read SecureTechTalks 📚
#AI #LLM #Cybersecurity #DataPrivacy #SyntheticData #FlexiDataGen #RAG #DatasetSecurity #SecureAI #TechResearch
Современный AI упирается не в вычислительные мощности, а в данные. Чем качественнее датасет, тем умнее и безопаснее модель.
Но вот проблема: в медицине, финансах и кибербезопасности эти данные нельзя просто собрать с интернета - они конфиденциальны, редки и часто защищены законом.
📉 Это создаёт «датасетный разрыв»: хорошие модели требуют больших данных, а большие данные недоступны.
Чтобы решить эту проблему, исследователи из Canadian Institute for Cybersecurity представили FlexiDataGen - адаптивную LLM-систему, способную генерировать синтетические, но семантически точные датасеты для чувствительных областей.
⚙️ Overview
FlexiDataGen - это модульная платформа для создания реалистичных текстовых наборов данных, где каждая фраза выглядит так, будто её написал эксперт.
Система проходит пять фаз:
1️⃣ Синтаксико-семантический анализ извлекает смысл из базового шаблона (например: «опиши инцидент безопасности»).
2️⃣ RAG (Retrieval-Augmented Generation) обращается к источникам вроде Wikipedia и DBpedia, чтобы добавить реальные факты и подтемы.
3️⃣ Динамическая инъекция элементов подставляет в шаблон контекстные переменные (домен, ситуация, действие).
4️⃣ Итеративный парафразинг создаёт несколько лингвистически разных, но семантически одинаковых версий фразы.
5️⃣ Валидация по смысловому сходству отбрасывает всё, что отклонилось от исходного смысла более чем на 25%.
💡 В результате чистый, разнообразный и безопасный датасет, который можно использовать для обучения LLM без утечки реальных данных.
🧬 Пример из медицины
Допустим, у нас есть шаблон:
💬 «Создай отчёт о медицинской истории пациента с {заболеванием} в контексте {сценария}.»
FlexiDataGen подставляет реальные элементы:
🫀 заболевание → кардиология, неврология, педиатрия
🏥 сценарий → экстренная госпитализация, профилактический осмотр
📚 В итоге тысячи уникальных, реалистичных примеров вроде:
«Составь историю болезни пациента с острым инсультом, поступившего в отделение неотложной помощи.»
🛡️ Применение в кибербезопасности
В области Security эта технология особенно ценна.
FlexiDataGen может генерировать:
⚔️ инциденты SOC (утечка данных, фишинг, DDoS),
🧠 обращения пользователей,
💻 логи сетевой активности,
🧩 псевдоанализ уязвимостей.
Такие датасеты идеально подходят для:
🎯 обучения LLM-ассистентов SOC;
🧱 тестирования SIEM-систем;
🔧 отладки автоматических триаж-процессов;
🕵️♂️ разработки Red Team симуляторов без риска раскрытия реальных инцидентов.
📊 Результаты тестов
Разработчики протестировали FlexiDataGen с несколькими LLM (включая Phi-4-mini-instruct и Llama 3.2 1B).
Результаты:
📈 97.8% сгенерированных примеров были уникальными
🚫 уровень «шума» менее 2%.
Система сама фильтрует бессмыслицу и сохраняет только релевантные варианты 💎
🚀 Развитие идеи
Авторы уже работают над новыми возможностями:
🔄 динамическое добавление сценариев из реального времени,
🌍 мультиязычная поддержка,
👨🏫 экспертная проверка в цикле обучения,
⚠️ и даже использование jailbreak-подходов для генерации адверсариальных кейсов в области безопасности.
📎 Оригинал публикации: https://arxiv.org/abs/2510.19025v1
Stay secure and read SecureTechTalks 📚
#AI #LLM #Cybersecurity #DataPrivacy #SyntheticData #FlexiDataGen #RAG #DatasetSecurity #SecureAI #TechResearch
1👍3🤔1🤝1
💥 JSTprove: как доказать, что ваш искусственный интеллект не врёт?
Сегодня искусственный интеллект всё глубже проникает в критические сферы - медицину, финансы, кибербезопасность. Чем больше решений принимают модели, тем острее встаёт вопрос: можно ли им доверять?
🔒 Проблема:
AI-модели сегодня - это чёрные ящики. Мы видим результат, но не можем проверить, действительно ли вычисления проведены корректно. Что если разработчик подменил модель? Или результат был сгенерирован неверно?
🎯 Решение:
Verifiable AI, новая парадигма, где каждая операция модели может быть доказана математически. Основа этой идеи Zero-Knowledge Proofs (ZKP), или доказательства с нулевым разглашением.
ZKP позволяют убедиться, что вычисление проведено честно, не раскрывая ни данных, ни самой модели.
💡 Представьте: ИИ делает диагноз, проверку транзакции или анализ сетевой аномалии - и вместе с результатом вы получаете криптографическое доказательство того, что всё вычислено корректно. 🧠✅
⚙️ JSTprove первый практичный инструмент Verifiable AI
🚀 Компания Inference Labs представила JSTprove, фреймворк, который делает верифицируемый ИИ доступным каждому ML-инженеру.
📦 Особенности:
🔓 Полностью открытая zkML-платформа
⚡ Основана на Expander от Polyhedra Network одном из самых быстрых движков ZK-доказательств
🧰 Поддерживает ONNX модели (из PyTorch, TensorFlow и т.д.)
💻 Работает по простому CLI-принципу, без глубоких знаний криптографии. Всё прозрачно и просто.
🧠 Принцип работы
1️⃣ Импорт модели: загружается ONNX-сеть.
2️⃣ Квантование: веса переводятся из float в фиксированные целые числа для вычислений в конечном поле.
3️⃣ Компиляция: сеть превращается в арифметическую схему - набор ограничений, описывающих каждую операцию.
4️⃣ Генерация свидетеля (witness): прогон данных с записью всех промежуточных значений.
5️⃣ Создание доказательства: Expander генерирует zk-доказательство корректности вычислений.
6️⃣ Проверка: любая сторона может подтвердить корректность вывода модели без доступа к данным или весам! 🔐
🔬 Технический фундамент
🧩 JSTprove использует современные криптографические протоколы:
🪶 zk-SNARKs: короткие доказательства с мгновенной проверкой (требуют доверенную инициализацию);
🌀 zk-STARKs: без доверенной настройки и устойчивы к квантовым атакам;
🔗 GKR-схемы и sumcheck: для масштабируемой верификации матричных операций.
🧱 JSTprove уже поддерживает базовые строительные блоки нейросетей:
- GEMM (матрицы)
- Conv2D
- MaxPool
- ReLU
🎯 В будущем команда обещает поддержку RNN и Transformer-архитектур, то есть полный стек современных AI-моделей.
📊 Benchmark
Авторы JSTprove протестировали систему на сверточных нейросетях (по мотивам LeNet).
Даже при глубине до 16 слоёв и миллионах параметров система стабильно выполняла полный цикл доказательства.
⏱ Среднее время компиляции модели - 5–10 минут
⚙️ Генерация доказательства около 15 секунд
🔎 Проверка до 10 секунд
💾 Потребление памяти 25–27 ГБ
Главная метрика производительности - Total Cost, отражающая сложность схемы, линейно растёт с размером модели. Это делает масштабирование zkML предсказуемым и стабильным.
🔍 Прозрачность и аудит
🧩 Inference Labs публикует:
💻 исходники и схемы на GitHub;
📐 математические доказательства корректности;
🦀 Rust-код для построения цепочек доказательств.
🔗 Репозитории проекта:
👉 github.com/inference-labs-inc/zkml-blueprints
👉 github.com/PolyhedraZK/ExpanderCompilerCollection
Stay secure and read SecureTechTalks 📚
#AI #zkML #ZeroKnowledge #Cybersecurity #DataPrivacy #VerifiableAI #ZKP #Expander #Polyhedra #InferenceLabs #SecureTechTalks
Сегодня искусственный интеллект всё глубже проникает в критические сферы - медицину, финансы, кибербезопасность. Чем больше решений принимают модели, тем острее встаёт вопрос: можно ли им доверять?
🔒 Проблема:
AI-модели сегодня - это чёрные ящики. Мы видим результат, но не можем проверить, действительно ли вычисления проведены корректно. Что если разработчик подменил модель? Или результат был сгенерирован неверно?
🎯 Решение:
Verifiable AI, новая парадигма, где каждая операция модели может быть доказана математически. Основа этой идеи Zero-Knowledge Proofs (ZKP), или доказательства с нулевым разглашением.
ZKP позволяют убедиться, что вычисление проведено честно, не раскрывая ни данных, ни самой модели.
💡 Представьте: ИИ делает диагноз, проверку транзакции или анализ сетевой аномалии - и вместе с результатом вы получаете криптографическое доказательство того, что всё вычислено корректно. 🧠✅
⚙️ JSTprove первый практичный инструмент Verifiable AI
🚀 Компания Inference Labs представила JSTprove, фреймворк, который делает верифицируемый ИИ доступным каждому ML-инженеру.
📦 Особенности:
🔓 Полностью открытая zkML-платформа
⚡ Основана на Expander от Polyhedra Network одном из самых быстрых движков ZK-доказательств
🧰 Поддерживает ONNX модели (из PyTorch, TensorFlow и т.д.)
💻 Работает по простому CLI-принципу, без глубоких знаний криптографии. Всё прозрачно и просто.
🧠 Принцип работы
1️⃣ Импорт модели: загружается ONNX-сеть.
2️⃣ Квантование: веса переводятся из float в фиксированные целые числа для вычислений в конечном поле.
3️⃣ Компиляция: сеть превращается в арифметическую схему - набор ограничений, описывающих каждую операцию.
4️⃣ Генерация свидетеля (witness): прогон данных с записью всех промежуточных значений.
5️⃣ Создание доказательства: Expander генерирует zk-доказательство корректности вычислений.
6️⃣ Проверка: любая сторона может подтвердить корректность вывода модели без доступа к данным или весам! 🔐
🔬 Технический фундамент
🧩 JSTprove использует современные криптографические протоколы:
🪶 zk-SNARKs: короткие доказательства с мгновенной проверкой (требуют доверенную инициализацию);
🌀 zk-STARKs: без доверенной настройки и устойчивы к квантовым атакам;
🔗 GKR-схемы и sumcheck: для масштабируемой верификации матричных операций.
🧱 JSTprove уже поддерживает базовые строительные блоки нейросетей:
- GEMM (матрицы)
- Conv2D
- MaxPool
- ReLU
🎯 В будущем команда обещает поддержку RNN и Transformer-архитектур, то есть полный стек современных AI-моделей.
📊 Benchmark
Авторы JSTprove протестировали систему на сверточных нейросетях (по мотивам LeNet).
Даже при глубине до 16 слоёв и миллионах параметров система стабильно выполняла полный цикл доказательства.
⏱ Среднее время компиляции модели - 5–10 минут
⚙️ Генерация доказательства около 15 секунд
🔎 Проверка до 10 секунд
💾 Потребление памяти 25–27 ГБ
Главная метрика производительности - Total Cost, отражающая сложность схемы, линейно растёт с размером модели. Это делает масштабирование zkML предсказуемым и стабильным.
🔍 Прозрачность и аудит
🧩 Inference Labs публикует:
💻 исходники и схемы на GitHub;
📐 математические доказательства корректности;
🦀 Rust-код для построения цепочек доказательств.
🔗 Репозитории проекта:
👉 github.com/inference-labs-inc/zkml-blueprints
👉 github.com/PolyhedraZK/ExpanderCompilerCollection
Stay secure and read SecureTechTalks 📚
#AI #zkML #ZeroKnowledge #Cybersecurity #DataPrivacy #VerifiableAI #ZKP #Expander #Polyhedra #InferenceLabs #SecureTechTalks
🔥1
🔍 Федеративный RCA без доступа к данным: как найти источник сбоя в распределённой промышленной системе
Вышел интересный препринт на arXiv “Learning Unknown Interdependencies for Decentralized Root Cause Analysis in Nonlinear Dynamical Systems” (arXiv:2602.21928v1).
Исследователи предлагают способ находить первопричину инцидента в распределённой промышленной системе… не имея доступа к сырым данным.
Звучит как невозможное?
Разберёмся. 👇
🏭 В чём суть проблемы
Представьте несколько заводских установок, которые связаны между собой. Если одна «ломается», сбой может распространиться на остальные. ⚡
Но как понять, где настоящая причина, а где просто следствие?
Сложность в том, что:
🚫 данные нельзя собирать в один центр,
🔒 модели часто закрытые (от OEM),
📡 у каждого узла свои датчики и логика работы.
Классические методы анализа причин здесь не работают: им нужен полный доступ к данным.
🧠 Что придумали авторы
Они построили федеративную систему, где:
🏢 каждый клиент оставляет свою модель как есть,
➕ к ней добавляется небольшая ML-надстройка,
🌐 центральный сервер учится понимать связи между узлами,
🚫📂 но сырые данные никуда не передаются.
Передаются:
📊 состояния моделей,
🚨 во время инцидента - бинарные флаги «есть аномалия / нет аномалии».
Дополнительно применяется differential privacy, т.е. данные и градиенты зашумляются. 🔐
🚨 Как определяется источник сбоя
У каждого клиента есть два индикатора:
🔎 аномалия в базовой модели,
🌍 аномалия в расширенной модели (которая учитывает влияние других).
Если обе сигналят, то это кандидат в источник. 🎯
Если только базовая, то скорее всего это «эхо» чужой проблемы. 🔁
Сервер смотрит на картину в целом и определяет root cause без сырых данных.
🧪 Проверка на практике
Метод протестировали:
🧩 на синтетических системах,
🏭 и на индустриальном датасете HAI (Hardware-In-the-Loop ICS).
Качество близко к централизованной модели, у которой есть полный доступ ко всем данным. 📈
📎 Ссылка: https://arxiv.org/abs/2602.21928v1
Start secure and read SecureTechTalks 📚
#кибербезопасность #ICS #OTSecurity #RootCauseAnalysis #FederatedLearning #IndustrialSecurity #CriticalInfrastructure #AIinSecurity #DataPrivacy #SecureTechTalks
Вышел интересный препринт на arXiv “Learning Unknown Interdependencies for Decentralized Root Cause Analysis in Nonlinear Dynamical Systems” (arXiv:2602.21928v1).
Исследователи предлагают способ находить первопричину инцидента в распределённой промышленной системе… не имея доступа к сырым данным.
Звучит как невозможное?
Разберёмся. 👇
🏭 В чём суть проблемы
Представьте несколько заводских установок, которые связаны между собой. Если одна «ломается», сбой может распространиться на остальные. ⚡
Но как понять, где настоящая причина, а где просто следствие?
Сложность в том, что:
🚫 данные нельзя собирать в один центр,
🔒 модели часто закрытые (от OEM),
📡 у каждого узла свои датчики и логика работы.
Классические методы анализа причин здесь не работают: им нужен полный доступ к данным.
🧠 Что придумали авторы
Они построили федеративную систему, где:
🏢 каждый клиент оставляет свою модель как есть,
➕ к ней добавляется небольшая ML-надстройка,
🌐 центральный сервер учится понимать связи между узлами,
🚫📂 но сырые данные никуда не передаются.
Передаются:
📊 состояния моделей,
🚨 во время инцидента - бинарные флаги «есть аномалия / нет аномалии».
Дополнительно применяется differential privacy, т.е. данные и градиенты зашумляются. 🔐
🚨 Как определяется источник сбоя
У каждого клиента есть два индикатора:
🔎 аномалия в базовой модели,
🌍 аномалия в расширенной модели (которая учитывает влияние других).
Если обе сигналят, то это кандидат в источник. 🎯
Если только базовая, то скорее всего это «эхо» чужой проблемы. 🔁
Сервер смотрит на картину в целом и определяет root cause без сырых данных.
🧪 Проверка на практике
Метод протестировали:
🧩 на синтетических системах,
🏭 и на индустриальном датасете HAI (Hardware-In-the-Loop ICS).
Качество близко к централизованной модели, у которой есть полный доступ ко всем данным. 📈
📎 Ссылка: https://arxiv.org/abs/2602.21928v1
Start secure and read SecureTechTalks 📚
#кибербезопасность #ICS #OTSecurity #RootCauseAnalysis #FederatedLearning #IndustrialSecurity #CriticalInfrastructure #AIinSecurity #DataPrivacy #SecureTechTalks
👍1