🧠 Как далеко продвинулись ИИ в экспертизе кибербезопасности?
⚡ В эпоху ChatGPT, Gemini и других LLM возникает закономерный вопрос: а могут ли ИИ действительно стать полноценными киберэкспертами?
Исследователи из лаборатории Zhongguancun и университета Цинхуа не стали гадать и создали CSEBenchmark — самый глубокий на сегодня тест для LLM в сфере кибербезопасности.
📚 Что такое CSEBenchmark?
CSEBenchmark — это:
➖ 345 кибер-навыков, которые должен знать специалист
➖ 7 ключевых доменов знаний: от основ IT до облаков и программирования
➖ 11 050 вопросов (да, серьёзно!)
➖ Учёт разных типов знаний: фактические, концептуальные, процедурные
➖ Подготовка с использованием GPT-4, но с ручной проверкой — 772 часа труда!
⚙️ Кого тестировали?
12 моделей, включая:
GPT-4o, GPT-4-Turbo, GPT-3.5
LLaMA 3.1, 3.2
Deepseek V3, Deepseek R1
Qwen 2.5
Mixtral и другие
Были учтены не только точность ответов, но и устойчивость к перетасовке вариантов, тип взаимодействия (Zero/Few/CoT-shot) и даже семантическая нагрузка вопросов.
🏆 Результаты: кто справился?
🥇GPT-4o — лидер среди закрытых моделей с точностью 85.42%
🥈Deepseek-V3 — топ среди open-source (84.92%)
🥉Qwen-2.5-72B — золотая середина между качеством и размером (84.4%)
👌Остальные модели отстали — до 52.95% точности
Но даже лучшие модели покрывают лишь 70%–75% знаний, необходимых для работы реального специалиста.
🚧 Где проваливаются LLM?
➖ Процедурные знания (использование инструментов, команд, эксплуатация уязвимостей) — самое слабое место
Wireshark, nmap, Metasploit, Burp Suite, SQL — часто ошибаются
➖ Даже базовые вещи вроде различий между P2P и локальной аутентификацией даются с трудом
➖ Прямо сейчас ни одна модель не справляется на уровне Senior Security Engineer
📈 А можно ли ИИ улучшить?
Да! Использовав выявленные пробелы, исследователи применили Retrieval-Augmented Generation (RAG):
- Векторная база знаний на основе Milvus
- Автоматическая подгрузка недостающего контекста
- Улучшение точности до 84% на задачах уязвимостей и анализа угроз
- Особенно эффективно для моделей средней мощности (LLaMA 3.2, 3.1)
👩💻 Как модели соответствуют реальным вакансиям?
Оценивалось соответствие знаниям, требуемым на позициях в:
- Google (Intelligence Analyst, Red Team Consultant)
- Amazon (Privacy Engineer, Security Engineer)
- Microsoft (Red Team Security Engineer)
Ни одна модель не набрала более 90% соответствия. Самые близкие к требованиям — GPT-4o и Deepseek-V3, но у каждой модели своя “зона силы”.
🔍 Выводы
➖ LLM уже умеют многое, но пока они — скорее ассистенты, чем эксперты
➖ Без прокачки процедурных навыков им не стать полноценными аналитиками
➖ Модель нужно выбирать под конкретную роль, а не по хайпу
Stay secure and read SecureTechTalks 📚
#SecureTechTalks #CyberSecurity #LLM #AI #Benchmark #CSEBenchmark #GPT4 #Deepseek #RAG #RedTeam #SOC #InfoSec #ChatGPT
⚡ В эпоху ChatGPT, Gemini и других LLM возникает закономерный вопрос: а могут ли ИИ действительно стать полноценными киберэкспертами?
Исследователи из лаборатории Zhongguancun и университета Цинхуа не стали гадать и создали CSEBenchmark — самый глубокий на сегодня тест для LLM в сфере кибербезопасности.
📚 Что такое CSEBenchmark?
CSEBenchmark — это:
⚙️ Кого тестировали?
12 моделей, включая:
GPT-4o, GPT-4-Turbo, GPT-3.5
LLaMA 3.1, 3.2
Deepseek V3, Deepseek R1
Qwen 2.5
Mixtral и другие
Были учтены не только точность ответов, но и устойчивость к перетасовке вариантов, тип взаимодействия (Zero/Few/CoT-shot) и даже семантическая нагрузка вопросов.
🏆 Результаты: кто справился?
🥇GPT-4o — лидер среди закрытых моделей с точностью 85.42%
🥈Deepseek-V3 — топ среди open-source (84.92%)
🥉Qwen-2.5-72B — золотая середина между качеством и размером (84.4%)
👌Остальные модели отстали — до 52.95% точности
Но даже лучшие модели покрывают лишь 70%–75% знаний, необходимых для работы реального специалиста.
🚧 Где проваливаются LLM?
Wireshark, nmap, Metasploit, Burp Suite, SQL — часто ошибаются
📈 А можно ли ИИ улучшить?
Да! Использовав выявленные пробелы, исследователи применили Retrieval-Augmented Generation (RAG):
- Векторная база знаний на основе Milvus
- Автоматическая подгрузка недостающего контекста
- Улучшение точности до 84% на задачах уязвимостей и анализа угроз
- Особенно эффективно для моделей средней мощности (LLaMA 3.2, 3.1)
👩💻 Как модели соответствуют реальным вакансиям?
Оценивалось соответствие знаниям, требуемым на позициях в:
- Google (Intelligence Analyst, Red Team Consultant)
- Amazon (Privacy Engineer, Security Engineer)
- Microsoft (Red Team Security Engineer)
Ни одна модель не набрала более 90% соответствия. Самые близкие к требованиям — GPT-4o и Deepseek-V3, но у каждой модели своя “зона силы”.
🔍 Выводы
Stay secure and read SecureTechTalks 📚
#SecureTechTalks #CyberSecurity #LLM #AI #Benchmark #CSEBenchmark #GPT4 #Deepseek #RAG #RedTeam #SOC #InfoSec #ChatGPT
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Когда LLM тестируют на юмор, сарказм и фантазию 🦩🚲😂
Обычно бенчмарки для нейросетей выглядят скучно: сухие метрики, точность на датасете, таблички. Но команда Beeline Cloud решила подойти к этому с креативом — и создала нестандартные испытания для LLM.
🎭 Шутки, сарказм и логика в одном флаконе
Представьте, что ИИ дают задание:
✍️ «Придумай картинку с пеликаном, который едет на велосипеде» — и модель должна не просто выдать банальность, а придумать живое описание.
😂 Шутка с двойным смыслом — сможет ли LLM уловить сарказм и правильно отреагировать?
🧩 Логическая загадка, где ответ не на поверхности — проверка, умеет ли модель «думать», а не просто подбирать вероятные слова
.
💡 Для чего это нужно?
👀 Проверка гибкости — реальный мир не ограничивается фактами из Википедии.
🎨 Эмоции и креатив — если ИИ должен общаться как человек, он обязан понимать юмор и ассоциативные связи.
🛡️ Тест на устойчивость — нестандартные задания часто выявляют, где модель ломается, а где справляется.
🚀 Причем тут ИБ?
🔍 Мы видим, что LLM всё ещё уязвимы к логическим сбоям — значит, нужно учитывать это в реальных продуктах.
🛠 Такой подход помогает создавать новые методы тестирования, в том числе и для безопасности: ведь атаки на ИИ тоже часто строятся на нестандартных сценариях.
🎓 А для исследователей это ещё и отличная база для обучения: учим ИИ мыслить шире, чем просто «угадай слово».
P.S.
✨ Коллеги из Beeline Cloud подарили сообществу не просто новый бенчмарк, а игровую лабораторию для проверки креативности LLM. Это больше похоже на интеллектуальный квест, чем на скучный тест. И именно этого так не хватало в мире AI.
🔗 Подробнее: Хабр — статья о бенчмарках Beeline Cloud
Stay secure and read SecureTechTalks 📚
#LLM #AI #Benchmark #CyberSecurity #BeelineCloud #GenAI #ИИ #Кибербезопасность #SecureTechTalks #HumorAI
Обычно бенчмарки для нейросетей выглядят скучно: сухие метрики, точность на датасете, таблички. Но команда Beeline Cloud решила подойти к этому с креативом — и создала нестандартные испытания для LLM.
🎭 Шутки, сарказм и логика в одном флаконе
Представьте, что ИИ дают задание:
✍️ «Придумай картинку с пеликаном, который едет на велосипеде» — и модель должна не просто выдать банальность, а придумать живое описание.
😂 Шутка с двойным смыслом — сможет ли LLM уловить сарказм и правильно отреагировать?
🧩 Логическая загадка, где ответ не на поверхности — проверка, умеет ли модель «думать», а не просто подбирать вероятные слова
.
💡 Для чего это нужно?
👀 Проверка гибкости — реальный мир не ограничивается фактами из Википедии.
🎨 Эмоции и креатив — если ИИ должен общаться как человек, он обязан понимать юмор и ассоциативные связи.
🛡️ Тест на устойчивость — нестандартные задания часто выявляют, где модель ломается, а где справляется.
🚀 Причем тут ИБ?
🔍 Мы видим, что LLM всё ещё уязвимы к логическим сбоям — значит, нужно учитывать это в реальных продуктах.
🛠 Такой подход помогает создавать новые методы тестирования, в том числе и для безопасности: ведь атаки на ИИ тоже часто строятся на нестандартных сценариях.
🎓 А для исследователей это ещё и отличная база для обучения: учим ИИ мыслить шире, чем просто «угадай слово».
P.S.
✨ Коллеги из Beeline Cloud подарили сообществу не просто новый бенчмарк, а игровую лабораторию для проверки креативности LLM. Это больше похоже на интеллектуальный квест, чем на скучный тест. И именно этого так не хватало в мире AI.
🔗 Подробнее: Хабр — статья о бенчмарках Beeline Cloud
Stay secure and read SecureTechTalks 📚
#LLM #AI #Benchmark #CyberSecurity #BeelineCloud #GenAI #ИИ #Кибербезопасность #SecureTechTalks #HumorAI