SecureTechTalks
302 subscribers
805 photos
1 video
1 file
803 links
Добро пожаловать на канал "SecureTechTalks"! Мы предлагаем вам увлекательное и информативное погружение в мир кибербезопасности. Здесь вы найдете актуальные новости, советы, методы и инсайты по инфобезу.
Download Telegram
🧠 Как далеко продвинулись ИИ в экспертизе кибербезопасности?

В эпоху ChatGPT, Gemini и других LLM возникает закономерный вопрос: а могут ли ИИ действительно стать полноценными киберэкспертами?

Исследователи из лаборатории Zhongguancun и университета Цинхуа не стали гадать и создали CSEBenchmark — самый глубокий на сегодня тест для LLM в сфере кибербезопасности.

📚 Что такое CSEBenchmark?

CSEBenchmark — это:
345 кибер-навыков, которые должен знать специалист
7 ключевых доменов знаний: от основ IT до облаков и программирования
11 050 вопросов (да, серьёзно!)
Учёт разных типов знаний: фактические, концептуальные, процедурные
Подготовка с использованием GPT-4, но с ручной проверкой — 772 часа труда!

⚙️ Кого тестировали?

12 моделей, включая:
GPT-4o, GPT-4-Turbo, GPT-3.5
LLaMA 3.1, 3.2
Deepseek V3, Deepseek R1
Qwen 2.5
Mixtral и другие

Были учтены не только точность ответов, но и устойчивость к перетасовке вариантов, тип взаимодействия (Zero/Few/CoT-shot) и даже семантическая нагрузка вопросов.

🏆 Результаты: кто справился?

🥇GPT-4o — лидер среди закрытых моделей с точностью 85.42%

🥈Deepseek-V3 — топ среди open-source (84.92%)

🥉Qwen-2.5-72B — золотая середина между качеством и размером (84.4%)

👌Остальные модели отстали — до 52.95% точности

Но даже лучшие модели покрывают лишь 70%–75% знаний, необходимых для работы реального специалиста.

🚧 Где проваливаются LLM?

Процедурные знания (использование инструментов, команд, эксплуатация уязвимостей) — самое слабое место
Wireshark, nmap, Metasploit, Burp Suite, SQL — часто ошибаются
Даже базовые вещи вроде различий между P2P и локальной аутентификацией даются с трудом
Прямо сейчас ни одна модель не справляется на уровне Senior Security Engineer

📈 А можно ли ИИ улучшить?

Да! Использовав выявленные пробелы, исследователи применили Retrieval-Augmented Generation (RAG):
- Векторная база знаний на основе Milvus
- Автоматическая подгрузка недостающего контекста
- Улучшение точности до 84% на задачах уязвимостей и анализа угроз
- Особенно эффективно для моделей средней мощности (LLaMA 3.2, 3.1)

👩‍💻 Как модели соответствуют реальным вакансиям?

Оценивалось соответствие знаниям, требуемым на позициях в:
- Google (Intelligence Analyst, Red Team Consultant)
- Amazon (Privacy Engineer, Security Engineer)
- Microsoft (Red Team Security Engineer)

Ни одна модель не набрала более 90% соответствия. Самые близкие к требованиям — GPT-4o и Deepseek-V3, но у каждой модели своя “зона силы”.

🔍 Выводы

LLM уже умеют многое, но пока они — скорее ассистенты, чем эксперты
Без прокачки процедурных навыков им не стать полноценными аналитиками
Модель нужно выбирать под конкретную роль, а не по хайпу

Stay secure and read SecureTechTalks 📚

#SecureTechTalks #CyberSecurity #LLM #AI #Benchmark #CSEBenchmark #GPT4 #Deepseek #RAG #RedTeam #SOC #InfoSec #ChatGPT
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Когда LLM тестируют на юмор, сарказм и фантазию 🦩🚲😂

Обычно бенчмарки для нейросетей выглядят скучно: сухие метрики, точность на датасете, таблички. Но команда Beeline Cloud решила подойти к этому с креативом — и создала нестандартные испытания для LLM.

🎭 Шутки, сарказм и логика в одном флаконе

Представьте, что ИИ дают задание:
✍️ «Придумай картинку с пеликаном, который едет на велосипеде» — и модель должна не просто выдать банальность, а придумать живое описание.

😂 Шутка с двойным смыслом — сможет ли LLM уловить сарказм и правильно отреагировать?

🧩 Логическая загадка, где ответ не на поверхности — проверка, умеет ли модель «думать», а не просто подбирать вероятные слова
.
💡 Для чего это нужно?

👀 Проверка гибкости — реальный мир не ограничивается фактами из Википедии.

🎨 Эмоции и креатив — если ИИ должен общаться как человек, он обязан понимать юмор и ассоциативные связи.

🛡️ Тест на устойчивость — нестандартные задания часто выявляют, где модель ломается, а где справляется.

🚀 Причем тут ИБ?

🔍 Мы видим, что LLM всё ещё уязвимы к логическим сбоям — значит, нужно учитывать это в реальных продуктах.

🛠 Такой подход помогает создавать новые методы тестирования, в том числе и для безопасности: ведь атаки на ИИ тоже часто строятся на нестандартных сценариях.

🎓 А для исследователей это ещё и отличная база для обучения: учим ИИ мыслить шире, чем просто «угадай слово».

P.S.

Коллеги из Beeline Cloud подарили сообществу не просто новый бенчмарк, а игровую лабораторию для проверки креативности LLM. Это больше похоже на интеллектуальный квест, чем на скучный тест. И именно этого так не хватало в мире AI.

🔗 Подробнее: Хабр — статья о бенчмарках Beeline Cloud

Stay secure and read SecureTechTalks 📚

#LLM #AI #Benchmark #CyberSecurity #BeelineCloud #GenAI #ИИ #Кибербезопасность #SecureTechTalks #HumorAI