SecureTechTalks
303 subscribers
805 photos
1 video
1 file
803 links
Добро пожаловать на канал "SecureTechTalks"! Мы предлагаем вам увлекательное и информативное погружение в мир кибербезопасности. Здесь вы найдете актуальные новости, советы, методы и инсайты по инфобезу.
Download Telegram
💢 12 КРИТИЧЕСКИХ ПРОБЛЕМ ВНЕДРЕНИЯ RAG

Разбираем "подводные камни" RAG-систем, выявленные при работе с реальными проектами.

OCR-шум: Тихий убийца точности 

Проблема: Распознавание сканированных PDF (отчёты, документы инцидентов) даёт до 37% ошибок → эмбеддинги мусорных фрагментов → ложные ответы. 

🛡Решение: Каскадная очистка через Tesseract + easyOCR + regex-фильтры + ручная верификация *ключевых документов*. 

Чанкинг: Невидимая грань сбоя 

Проблема:
- Чанки <200 токенов = фрагментация контекста (потеря связей IoC-тактик) 
- Чанки >500 токенов = высокие латенции

🛡 Вывод: 200-500 токенов — золотая середина. Меньше = лаги, больше = потеря контекста»

FAISS: Магия, которая ломается в scale 

Проблема: При >10 000 эмбеддингов время поиска растёт экспоненциально (с 50 мс до 1.2 сек!). 

🛡Решение: Жёсткая фильтрация по метатегам (тип документа, дата, критичность)

Многоязычные провалы 

Проблема: GPT-4o/Claude игнорируют нюансы локалей → ошибки в терминах типа «стековый буфер» (RU) vs «stack buffer» (EN). 

🛡 Решение: DeepSeek-R1 для русского + кастомные эмбеддинг-модели, дообученные на доменных глоссариях. 

Ад зависимостей 

Проблема: Конфликты версий PyTorch + FAISS + OCR-libs → падения в продакшене. 

🛡 Решение: Docker-контейнеризация с фиксацией версий + тестирование на совместимость перед обновлениями. 

💻 Операционные Косяки 

Хрупкость scraping-пайплайнов

Проблема: Изменения структуры сайтов (например, порталов киберугроз) ломают 68% парсеров.

🛡 Решение: Приоритет API (где есть) + Scrapy + Selenium с ежедневным мониторингом сломанных XPath. 

GDPR/Compliance-ловушка 

Проблема: Облачные LLM (OpenAI и т.д.) = риски утечки sensitive data (лог-файлы, метаданные атак).

🛡 Решение: Самохостинг Ollama/Llama.cpp + шифрование эмбеддингов AES-256-GCM

Токсичные данные 

Проблема: Дупликаты, устаревшие IoC, битые PDF в корпусе → ложные паттерны угроз

🛡 Решение: Скрипты дедупликации + периодическая реиндексация + инструменты типа Great Expectations для валидации. 

Слепота без логов 

Проблема: Без анализа запросов/ответов невозможно выявить уязвимости RAG (например, утечка контекста). 

🛡 Решение: SQLite + Grafana для трекинга: пользователь, промт, рейтинг ответа, источник данных. 

Этичные и Системные Риски 

Дилемма прозрачности

Проблема: Показ источников → риски OSINT-разведки злоумышленниками

🛡 Решение: Динамическая политика (показ источников для SOC, скрытие для threat hunting). 

Смещение данных → ложные выводы 

Проблема: Перекос в источниках (например, 80% отчётов Red Team) → RAG недооценивает Blue Team тактики

🛡 Решение: Балансировка весов документов + re-ranking с приоритетом сбалансированных источников

Иллюзия "умного" ИИ
 
Проблема: Пользователи переоценивают точность RAG → принятие решений на основе ошибо. 

🛡 Решение: Жёсткие предупреждения в интерфейсе + Evaluation Agent (автопроверка ответов перед показом). 

💎 Вывод: 
RAG — сложная инфраструктура, успех зависит от: 
1⃣ Качества данных (нет OCR-шума, актуальные IoC) 
2⃣ Инженерных решений (чанкинг, метатеги, логи) 
3⃣ Этичного проектирования («что скрыть» важнее чем «что показать») 

Stay secure and read SecureTechTalks 📚

#RAG#Кибербезопасность #AI #LLM #DisarmRAG #ThreatIntelligence #DataEngineering #GDPR #MLOps #SecureTechTalks #ИскусственныйИнтеллект
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥1
🕸️ Как вытащить кибербезопасность из 468 ТБ веб-данных и не разориться

На arXiv вышла работа " Cybersecurity Data Extraction from Common Crawl".

Авторы решают практичную задачу: как собрать специализированный pretraining-датасет по кибербезопасности, не прогоняя через классификатор весь интернет.

🚨 В чём проблема

Современные LLM обучаются на гигантских массивах данных вроде:
Common Crawl
The Pile
C4
FineWeb

Это огромные сборники текстов из интернета на самые разные темы.

Они отлично подходят для «общего интеллекта», но если вам нужна модель, которая глубоко понимает:
🔐 криптографические протоколы
💣 уязвимости вроде buffer overflow
🧱 модели контроля доступа
🌐 сетевую безопасность

То таких данных часто недостаточно.

До недавнего времени фактически единственным публичным security-pretraining-датасетом был PRIMUS.

Он строился через контентную фильтрацию. То есть, классификатор определял, относится ли текст к cybersecurity.

🧠 Новый подход: фильтруем не текст, а домены

У Common Crawl есть не только тексты, но и web-граф:
📌 более 100 млн доменов
🔗 более 1.8 млрд ссылок
Если сайты часто ссылаются друг на друга, то они, скорее всего, тематически связаны.

Логика авторов:
1️⃣ Берём список seed-доменов по security.
2️⃣ Запускаем поиск сообщества в графе.
3️⃣ Получаем кластер доменов, связанных с кибербезопасностью.
4️⃣ Уже из них собираем тексты.

Для поиска использовался Leiden algorithm, современный алгоритм обнаружения сообществ в больших графах.

Это структурная фильтрация. Сначала находим «security-комьюнити» в интернете, а потом работаем только с ним.

⚙️ Немного инженерной реальности

Работа с графом такого масштаба это отдельный челлендж:
edge list вместо adjacency list
сотни миллионов узлов
миллиарды рёбер

Авторы использовали memory-mapped sparse matrix (CSR), задействовали GPU-библиотеки, разбивали граф на части через split.

Отдельная боль, как вы уже догадались, скачивание данных: 70 млн URL из S3 при лимите ~30 запросов в секунду →
30–36 дней только на загрузку.

Поэтому они пошли рациональным путём:
не скачивать всё, а отфильтровать FineWeb-Edu по найденным URL и уложились примерно в 8 часов.

📦 Что получилось

Датасет Alpha-Root:
📎 2.8 млн URL
📚 ~3 млрд токенов
🌍 15 240 доменов
Для сравнения:
PRIMUS-FineWeb содержит около 2.57 млрд токенов,
Alpha-Root около 3 млрд токенов.

Интересный момент:
9250 доменов пересекаются с PRIMUS. Это означает, что графовый метод находит те же релевантные источники, но без анализа содержимого каждой страницы.

🧪 Обучение и проверка

В качестве базы использовалась модель SmolLM-1.7B, дообученная через LoRA с 4-битной квантизацией.

📊 Результат:

Alpha-Root показывает метрики на уровне PRIMUS, а
в ряде сценариев немного лучше. При этом сбор датасета требует меньше вычислительных ресурсов

Stay secure and read SecureTechTalks 📚

#CyberSecurity #LLM #CommonCrawl #GraphAnalytics #AIinSecurity
#DataEngineering #MMLU #DomainLLM #ThreatIntel
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1