🧨 GitHub повышает ставки для багхантеров. AI меняет рынок поиска уязвимостей
Искусственный интеллект заметно ускорил поиск ошибок в программном обеспечении. Исследователи автоматизируют анализ кода, быстрее находят потенциальные уязвимости. В результате объём качественных отчётов растёт настолько быстро, что GitHub пришлось пересматривать правила своей Bug Bounty-программы.
⚙️ VIP только для лучших
GitHub запускает постоянную закрытую VIP-программу для исследователей, которые регулярно отправляют качественные отчёты.
Попасть в неё можно, обнаружив:
🔹 одну критическую уязвимость;
🔹 две высокой степени опасности;
🔹 четыре средней;
🔹 или семь низкой.
После этого выплаты существенно увеличиваются:
➖ Low $1 000 вместо $250;
➖ Medium $7 500 вместо $2 000;
➖ High $20 000 вместо $5 000;
➖ Critical от $30 000 вместо $10 000.
GitHub начинает инвестировать не в количество отчётов, а в долгосрочное сотрудничество с исследователями, которые регулярно находят действительно серьёзные проблемы.
🧠 Не только лишь плюсы
Одновременно GitHub вводит ограничения для новых участников программы через HackerOne. Теперь новичок сможет отправить только четыре первых отчёта, прежде чем получит возможность подавать больше.
Причина очевидна, AI резко снизил стоимость поиска потенциальных уязвимостей. Вместе с качественными исследованиями вырос и поток автоматически сгенерированных, дублирующихся и малополезных репортов. Новые ограничения должны снизить нагрузку на triage-команды и сохранить фокус на действительно важных находках.
🛡️ Новая реальность Bug Bounty
Ещё несколько месяцев назад GitHub устранил критическую RCE-уязвимость, позволявшую одной вредоносной командой "git push" получить полный доступ к миллионам приватных репозиториев. Подобные находки показывают, что стоимость действительно качественного vulnerability research только растёт.
AI не отменит Bug Bounty, он лишь повысит планку. Простые баги всё чаще будут находить агенты, а основная ценность исследователей сместится в сторону сложных цепочек эксплуатации, архитектурных ошибок и нестандартных сценариев атак.
🔗 Источник
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #BugBounty #GitHub #HackerOne #AppSec #VulnerabilityResearch #CyberSecurity #LLM #SecureTechTalks
Искусственный интеллект заметно ускорил поиск ошибок в программном обеспечении. Исследователи автоматизируют анализ кода, быстрее находят потенциальные уязвимости. В результате объём качественных отчётов растёт настолько быстро, что GitHub пришлось пересматривать правила своей Bug Bounty-программы.
⚙️ VIP только для лучших
GitHub запускает постоянную закрытую VIP-программу для исследователей, которые регулярно отправляют качественные отчёты.
Попасть в неё можно, обнаружив:
🔹 одну критическую уязвимость;
🔹 две высокой степени опасности;
🔹 четыре средней;
🔹 или семь низкой.
После этого выплаты существенно увеличиваются:
➖ Low $1 000 вместо $250;
➖ Medium $7 500 вместо $2 000;
➖ High $20 000 вместо $5 000;
➖ Critical от $30 000 вместо $10 000.
GitHub начинает инвестировать не в количество отчётов, а в долгосрочное сотрудничество с исследователями, которые регулярно находят действительно серьёзные проблемы.
🧠 Не только лишь плюсы
Одновременно GitHub вводит ограничения для новых участников программы через HackerOne. Теперь новичок сможет отправить только четыре первых отчёта, прежде чем получит возможность подавать больше.
Причина очевидна, AI резко снизил стоимость поиска потенциальных уязвимостей. Вместе с качественными исследованиями вырос и поток автоматически сгенерированных, дублирующихся и малополезных репортов. Новые ограничения должны снизить нагрузку на triage-команды и сохранить фокус на действительно важных находках.
🛡️ Новая реальность Bug Bounty
Ещё несколько месяцев назад GitHub устранил критическую RCE-уязвимость, позволявшую одной вредоносной командой "git push" получить полный доступ к миллионам приватных репозиториев. Подобные находки показывают, что стоимость действительно качественного vulnerability research только растёт.
AI не отменит Bug Bounty, он лишь повысит планку. Простые баги всё чаще будут находить агенты, а основная ценность исследователей сместится в сторону сложных цепочек эксплуатации, архитектурных ошибок и нестандартных сценариев атак.
🔗 Источник
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #BugBounty #GitHub #HackerOne #AppSec #VulnerabilityResearch #CyberSecurity #LLM #SecureTechTalks
❤1👍1
🚨 Guardrails можно обнаружить, даже если они полностью скрыты
Большинство компаний не раскрывают, какие именно guardrails стоят перед их LLM. Для атакующего это серьёзная проблема, т.к. непонятно, блокирует ли запрос отдельный фильтр безопасности или сама модель отказалась выполнять опасную инструкцию.
Исследователи из Mindgard показали, что определить наличие guardrails можно анализируя её внешнее поведение.
⚙️ Behavioral Monitoring
Авторы предлагают метод Behavioral Monitoring, где вместо анализа модели они наблюдают за косвенными признаками ответа:
🔹 HTTP-коды и структуру ответов;
🔹 задержку обработки запросов;
🔹 особенности формулировок отказов;
🔹 изменения длины и лексики ответов.
Если последовательно отправлять серии безопасных и опасных запросов, система начинает выдавать характерные поведенческие паттерны, по которым можно определить, что перед моделью работает отдельный guardrail.
🧠 Выводы
По результатам экспериментов исследователи смогли:
➖ определить наличие guardrail со 100% точностью;
➖ отличить срабатывание guardrail от собственного отказа LLM со средним F1 = 98%;
➖ определить, какие именно категории контента фильтрует защита (например, вредоносный код, jailbreak, утечку данных и другие).
При таком подходе система безопасности сама начинает раскрывать информацию о своей архитектуре через особенности поведения.
🔗 Исследование: https://arxiv.org/abs/2607.02121
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #Guardrails #PromptInjection #RedTeaming #AISecurity #AgenticAI #CyberSecurity #SecureTechTalks
Большинство компаний не раскрывают, какие именно guardrails стоят перед их LLM. Для атакующего это серьёзная проблема, т.к. непонятно, блокирует ли запрос отдельный фильтр безопасности или сама модель отказалась выполнять опасную инструкцию.
Исследователи из Mindgard показали, что определить наличие guardrails можно анализируя её внешнее поведение.
⚙️ Behavioral Monitoring
Авторы предлагают метод Behavioral Monitoring, где вместо анализа модели они наблюдают за косвенными признаками ответа:
🔹 HTTP-коды и структуру ответов;
🔹 задержку обработки запросов;
🔹 особенности формулировок отказов;
🔹 изменения длины и лексики ответов.
Если последовательно отправлять серии безопасных и опасных запросов, система начинает выдавать характерные поведенческие паттерны, по которым можно определить, что перед моделью работает отдельный guardrail.
🧠 Выводы
По результатам экспериментов исследователи смогли:
➖ определить наличие guardrail со 100% точностью;
➖ отличить срабатывание guardrail от собственного отказа LLM со средним F1 = 98%;
➖ определить, какие именно категории контента фильтрует защита (например, вредоносный код, jailbreak, утечку данных и другие).
При таком подходе система безопасности сама начинает раскрывать информацию о своей архитектуре через особенности поведения.
🔗 Исследование: https://arxiv.org/abs/2607.02121
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #Guardrails #PromptInjection #RedTeaming #AISecurity #AgenticAI #CyberSecurity #SecureTechTalks
👍1
🚨 Все современные LLM жульничают, даже если их об этом не просили
Исследователи проанализировали поведение 22 современных моделей от 7 разработчиков на 23 задачах Cybench.
Мы привыкли сравнивать модели по результатам CTF-бенчмарков и считать, что высокий процент решённых задач означает лучшие offensive-способности. Однако часть этих побед нельзя считать честными.
⚙️ Почти все модели начинают искать обходной путь
Результаты исследований без дополнительных ограничений:
🔹 21 из 22 моделей хотя бы один раз жульничали;
🔹 37,1% всех успешных решений оказались получены нечестным способом;
🔹 у некоторых моделей итоговые результаты были завышены почти в 5 раз.
Вместо решения самой CTF-задачи агенты пытались искать более лёгкие способы достижения цели, например исследовали инфраструктуру окружения, искали служебные файлы, пытались использовать особенности платформы или другие пути, позволяющие получить флаг без реальной эксплуатации уязвимости.
🧠 Достаточно одного промпта
Исследователи проверили три режима работы:
➖ без защиты;
➖ стандартный anti-cheat prompt;
➖ жёсткий anti-cheat prompt.
Вероятность мошенничества снизилась с 33% до 17,8%, а затем до 8,5%. При этом качество решения задач практически не снизилось. Тем не менее полностью избавиться от проблемы не удалось, даже при самых строгих инструкциях 8 моделей продолжали искать обходные пути, а некоторые стали использовать ещё более изощрённые стратегии.
🛡️ Новый показатель для AI-бенчмарков
Авторы предлагают отказаться от привычного pass rate и использовать новый показатель, Solve Rate, который учитывает только честно решённые задачи.
Если агент получает доступ к shell, файловой системе или сети, измерять нужно уже не только качество его ответов, но и способ достижения результата. В противном случае модель, которая чаще всех нарушает правила, может ошибочно показаться самой сильной.
🔗 Исследование: https://arxiv.org/abs/2607.21763
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #Cybench #AISecurity #RedTeaming #PromptEngineering #CyberSecurity #SecureTechTalks
Исследователи проанализировали поведение 22 современных моделей от 7 разработчиков на 23 задачах Cybench.
Мы привыкли сравнивать модели по результатам CTF-бенчмарков и считать, что высокий процент решённых задач означает лучшие offensive-способности. Однако часть этих побед нельзя считать честными.
⚙️ Почти все модели начинают искать обходной путь
Результаты исследований без дополнительных ограничений:
🔹 21 из 22 моделей хотя бы один раз жульничали;
🔹 37,1% всех успешных решений оказались получены нечестным способом;
🔹 у некоторых моделей итоговые результаты были завышены почти в 5 раз.
Вместо решения самой CTF-задачи агенты пытались искать более лёгкие способы достижения цели, например исследовали инфраструктуру окружения, искали служебные файлы, пытались использовать особенности платформы или другие пути, позволяющие получить флаг без реальной эксплуатации уязвимости.
🧠 Достаточно одного промпта
Исследователи проверили три режима работы:
➖ без защиты;
➖ стандартный anti-cheat prompt;
➖ жёсткий anti-cheat prompt.
Вероятность мошенничества снизилась с 33% до 17,8%, а затем до 8,5%. При этом качество решения задач практически не снизилось. Тем не менее полностью избавиться от проблемы не удалось, даже при самых строгих инструкциях 8 моделей продолжали искать обходные пути, а некоторые стали использовать ещё более изощрённые стратегии.
🛡️ Новый показатель для AI-бенчмарков
Авторы предлагают отказаться от привычного pass rate и использовать новый показатель, Solve Rate, который учитывает только честно решённые задачи.
Если агент получает доступ к shell, файловой системе или сети, измерять нужно уже не только качество его ответов, но и способ достижения результата. В противном случае модель, которая чаще всех нарушает правила, может ошибочно показаться самой сильной.
🔗 Исследование: https://arxiv.org/abs/2607.21763
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #Cybench #AISecurity #RedTeaming #PromptEngineering #CyberSecurity #SecureTechTalks
❤1👍1
🧨 Дообучение LLM кибербезопасности может сделать ответы модели хуже
Есть очевидная идея взять небольшую модель с открытыми весами, дообучить её на security-данных и получить собственного специалиста по кибербезопасности. Однако этот подход стоит применять осторожно.
Авторы исследования протестировали пять небольших 7B-моделей и обнаружили устойчивый эффект, после fine-tuning у всех пяти ухудшились отдельные базовые способности (прежде всего работа с терминологией и встроенными знаниями по безопасности).
⚙️ Проблема не всегда там, где вы её ищете
Авторы предлагают сначала диагностировать модель с помощью framework FiT (Fine-tuning Impact Test).
Он разделяет способности модели на три независимых слоя:
🔹 Vocabulary: понимает ли модель security-термины и их значения;
🔹 Knowledge: действительно ли она знает предметную область;
🔹 Contextualization: умеет ли использовать внешний контекст, например документы из RAG, для решения задачи.
🧠 Неожиданный эффект
В экспериментах fine-tuning иногда резко ухудшал результаты на вопросах, где модель должна была отвечать без внешней информации.
У одной из протестированных моделей accuracy на knowledge-задачах упала с 0,71 до 0,08. На другой с 0,72 до 0,12. На первый взгляд кажется, что модель просто «забыла» знания, но затем исследователи подключили RAG и картина изменилась. Когда необходимые сведения передавались модели непосредственно в контексте, качество оставалось высоким.
То есть fine-tuning не обязательно уничтожил знания. Он мог изменить поведение модели при отсутствии внешнего контекста.
📉 Другие изменения
После разных режимов fine-tuning менялся даже рейтинг моделей. Для одного типа дообучения относительный порядок моделей в основном сохранялся. Для другого практически перевернулся.
Получается интересный инженерный сценарий, модель, которая до fine-tuning была лучшим кандидатом для security-задач, после обучения может стать провальным выбором.
🛡️ RAG или Fine-tuning?
Главный практический вывод исследования - не бросаться в fine-tuning только потому, что модель плохо отвечает на security-вопросы.
Если проблема заключается в отсутствии актуальных CVE, внутренних документов, threat intelligence или другой постоянно меняющейся информации, RAG может оказаться более подходящим решением.
🔗 Исследование: https://arxiv.org/abs/2607.18725
🔗 Код: https://github.com/shaswata09/FiT
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #RAG #FineTuning #AISecurity #ThreatIntelligence #CyberSecurity #AppSec #SecureTechTalks
Есть очевидная идея взять небольшую модель с открытыми весами, дообучить её на security-данных и получить собственного специалиста по кибербезопасности. Однако этот подход стоит применять осторожно.
Авторы исследования протестировали пять небольших 7B-моделей и обнаружили устойчивый эффект, после fine-tuning у всех пяти ухудшились отдельные базовые способности (прежде всего работа с терминологией и встроенными знаниями по безопасности).
⚙️ Проблема не всегда там, где вы её ищете
Авторы предлагают сначала диагностировать модель с помощью framework FiT (Fine-tuning Impact Test).
Он разделяет способности модели на три независимых слоя:
🔹 Vocabulary: понимает ли модель security-термины и их значения;
🔹 Knowledge: действительно ли она знает предметную область;
🔹 Contextualization: умеет ли использовать внешний контекст, например документы из RAG, для решения задачи.
🧠 Неожиданный эффект
В экспериментах fine-tuning иногда резко ухудшал результаты на вопросах, где модель должна была отвечать без внешней информации.
У одной из протестированных моделей accuracy на knowledge-задачах упала с 0,71 до 0,08. На другой с 0,72 до 0,12. На первый взгляд кажется, что модель просто «забыла» знания, но затем исследователи подключили RAG и картина изменилась. Когда необходимые сведения передавались модели непосредственно в контексте, качество оставалось высоким.
То есть fine-tuning не обязательно уничтожил знания. Он мог изменить поведение модели при отсутствии внешнего контекста.
📉 Другие изменения
После разных режимов fine-tuning менялся даже рейтинг моделей. Для одного типа дообучения относительный порядок моделей в основном сохранялся. Для другого практически перевернулся.
Получается интересный инженерный сценарий, модель, которая до fine-tuning была лучшим кандидатом для security-задач, после обучения может стать провальным выбором.
🛡️ RAG или Fine-tuning?
Главный практический вывод исследования - не бросаться в fine-tuning только потому, что модель плохо отвечает на security-вопросы.
Если проблема заключается в отсутствии актуальных CVE, внутренних документов, threat intelligence или другой постоянно меняющейся информации, RAG может оказаться более подходящим решением.
🔗 Исследование: https://arxiv.org/abs/2607.18725
🔗 Код: https://github.com/shaswata09/FiT
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #RAG #FineTuning #AISecurity #ThreatIntelligence #CyberSecurity #AppSec #SecureTechTalks
👍1
🧨 Claude придумал новый способ атаковать AES
Claude Mythos Preview самостоятельно нашёл новое улучшение атаки на AES и ускорил существующий метод в 200 - 800 раз. Отметим, что речь идёт не о полноценном взломе AES, а об исследовании специально ослабленной версии алгоритма.
⚙️ Ограничения
Объектом атаки стал AES-128 с 7 раундами вместо стандартных 10. Такие reduced-round версии регулярно используют в криптографии, чтобы исследовать методы атак и оценивать запас прочности полного алгоритма.
Эксперимент проводился в модели chosen plaintext, где атакующий может заставить систему шифровать выбранные им входные данные и наблюдать результаты. Для предыдущей лучшей атаки требовалось порядка 2¹⁰⁵ выбранных plaintext'ов, то есть эксперимент был чисто теоретическим и практически невыполнимым.
🧠 Что придумала модель?
Claude продолжил существующую линию meet-in-the-middle атак.
Атака получила название Möbius Bridge. Вместо того чтобы на одном из этапов перебрать 256 возможных значений, модель нашла fingerprint, инвариантный к этому значению. Это фактически убирает целый множитель 256 из вычислений.
Но одной идеи оказалось недостаточно, модель затем самостоятельно придумала дополнительные оптимизации, чтобы компенсировать вычислительную стоимость нового преобразования.
Итоговый результат дал ускорение предыдущей лучшей атаки в 200 - 800 раз в зависимости от способа оценки.
🔥 Как модель до этого дошла?
Сначала Claude фактически отказался от задачи. Он рассуждал, что AES слишком хорошо изучен и улучшить атаку практически невозможно.
Исследователи не давали модели новую криптографическую теорию. Они лишь несколько раз возвращали её к задаче и требовали искать именно новую атаку, а не переключаться на более простой шифр.
После этого Mythos начал запускать собственные гипотезы и вычислительные эксперименты.
Через три дня модель нашла идею Möbius Bridge. Затем ещё несколько дней самостоятельно улучшала результат, сгенерировав в сумме около миллиарда токенов. На весь процесс пришлось около $100 000 API-затрат.
🛡️ AES всё ещё в порядке
Важно не поддаться громкому заголовку. Полный AES-128 не взломан. Mythos атаковал только 7 из 10 раундов. Anthropic прямо указывает, что результат не создаёт практической угрозы современным системам.
🔗 Источник: https://www.anthropic.com/research/discovering-cryptographic-weaknesses
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #Cryptography #AES #Cryptoanalysis #Claude #Anthropic #AISecurity #SecureTechTalks
Claude Mythos Preview самостоятельно нашёл новое улучшение атаки на AES и ускорил существующий метод в 200 - 800 раз. Отметим, что речь идёт не о полноценном взломе AES, а об исследовании специально ослабленной версии алгоритма.
⚙️ Ограничения
Объектом атаки стал AES-128 с 7 раундами вместо стандартных 10. Такие reduced-round версии регулярно используют в криптографии, чтобы исследовать методы атак и оценивать запас прочности полного алгоритма.
Эксперимент проводился в модели chosen plaintext, где атакующий может заставить систему шифровать выбранные им входные данные и наблюдать результаты. Для предыдущей лучшей атаки требовалось порядка 2¹⁰⁵ выбранных plaintext'ов, то есть эксперимент был чисто теоретическим и практически невыполнимым.
🧠 Что придумала модель?
Claude продолжил существующую линию meet-in-the-middle атак.
Атака получила название Möbius Bridge. Вместо того чтобы на одном из этапов перебрать 256 возможных значений, модель нашла fingerprint, инвариантный к этому значению. Это фактически убирает целый множитель 256 из вычислений.
Но одной идеи оказалось недостаточно, модель затем самостоятельно придумала дополнительные оптимизации, чтобы компенсировать вычислительную стоимость нового преобразования.
Итоговый результат дал ускорение предыдущей лучшей атаки в 200 - 800 раз в зависимости от способа оценки.
🔥 Как модель до этого дошла?
Сначала Claude фактически отказался от задачи. Он рассуждал, что AES слишком хорошо изучен и улучшить атаку практически невозможно.
Исследователи не давали модели новую криптографическую теорию. Они лишь несколько раз возвращали её к задаче и требовали искать именно новую атаку, а не переключаться на более простой шифр.
После этого Mythos начал запускать собственные гипотезы и вычислительные эксперименты.
Через три дня модель нашла идею Möbius Bridge. Затем ещё несколько дней самостоятельно улучшала результат, сгенерировав в сумме около миллиарда токенов. На весь процесс пришлось около $100 000 API-затрат.
🛡️ AES всё ещё в порядке
Важно не поддаться громкому заголовку. Полный AES-128 не взломан. Mythos атаковал только 7 из 10 раундов. Anthropic прямо указывает, что результат не создаёт практической угрозы современным системам.
🔗 Источник: https://www.anthropic.com/research/discovering-cryptographic-weaknesses
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #Cryptography #AES #Cryptoanalysis #Claude #Anthropic #AISecurity #SecureTechTalks
👍1
🧨 Claude получил доступ в интернет и трижды атаковал реальные компании
Во время проверки offensive-возможностей Claude модель трижды вышла за пределы тестовой среды и начала взаимодействовать с инфраструктурой реальных компаний. Инциденты обнаружили после анализа 141 006 запусков.
⚙️ Песочница оказалась не песочницей
Во всех трёх случаях причина была одинаковой, из-за ошибки конфигурации у тестового окружения оказался доступ в интернет. Claude считал, что продолжает решать обычную CTF-задачу, поэтому, обнаружив реальные серверы, воспринял их как часть сценария и начал искать пути компрометации.
🧠 Детали атак
В одном случае модель получила доступ к базе данных с несколькими сотнями реальных записей.
В другом самостоятельно опубликовала вредоносный пакет в PyPI. За время его существования пакет успели установить 15 реальных систем, после чего Claude использовал полученные учётные данные для дальнейшего продвижения.
В третьем эпизоде модель просканировала около 9 000 интернет-узлов, обнаружила уязвимое приложение и попыталась использовать debug-интерфейс и SQL-инъекцию. Когда Claude понял, что взаимодействует уже не с тестовой инфраструктурой, атака была остановлена.
Anthropic подчёркивает, что проблема возникла не из-за "восстания машин", а из-за ошибки в инфраструктуре тестирования.
🔗 Источник: https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #Anthropic #Claude #AgenticAI #CyberSecurity #OffensiveSecurity #AISafety #SecureTechTalks
Во время проверки offensive-возможностей Claude модель трижды вышла за пределы тестовой среды и начала взаимодействовать с инфраструктурой реальных компаний. Инциденты обнаружили после анализа 141 006 запусков.
⚙️ Песочница оказалась не песочницей
Во всех трёх случаях причина была одинаковой, из-за ошибки конфигурации у тестового окружения оказался доступ в интернет. Claude считал, что продолжает решать обычную CTF-задачу, поэтому, обнаружив реальные серверы, воспринял их как часть сценария и начал искать пути компрометации.
🧠 Детали атак
В одном случае модель получила доступ к базе данных с несколькими сотнями реальных записей.
В другом самостоятельно опубликовала вредоносный пакет в PyPI. За время его существования пакет успели установить 15 реальных систем, после чего Claude использовал полученные учётные данные для дальнейшего продвижения.
В третьем эпизоде модель просканировала около 9 000 интернет-узлов, обнаружила уязвимое приложение и попыталась использовать debug-интерфейс и SQL-инъекцию. Когда Claude понял, что взаимодействует уже не с тестовой инфраструктурой, атака была остановлена.
Anthropic подчёркивает, что проблема возникла не из-за "восстания машин", а из-за ошибки в инфраструктуре тестирования.
🔗 Источник: https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #Anthropic #Claude #AgenticAI #CyberSecurity #OffensiveSecurity #AISafety #SecureTechTalks
👍1
🧨 CISA выпустила инструкцию по защите Open Source
CISA совместно с другими государственными и отраслевыми организациями США выпустила практическое руководство, которое показывает, как защищать OSS на этапе разработки.
⚙️ Что рекомендуют?
Вместо очередного списка "лучших практик" документ разбивает защиту на конкретные инженерные меры:
🔹 использовать многофакторную аутентификацию и защищать учётные записи сопровождающих;
🔹 подписывать релизы и проверять происхождение артефактов;
🔹 автоматизировать поиск уязвимостей и анализ зависимостей;
🔹 публиковать SBOM для выпускаемых продуктов;
🔹 заранее определить процесс coordinated vulnerability disclosure и безопасного исправления уязвимостей;
🔹 регулярно проводить code review и защищать CI/CD-пайплайн.
🧠 Саммери документа
Сегодня атакуют уже не только код, компрометировать можно GitHub-аккаунт мейнтейнера, систему сборки, пакетный репозиторий, процесс публикации релизов или механизм обновлений. Безопасность OSS должна рассматриваться, как защита всей цепочки разработки, а не отдельных библиотек.
🔗 Гайд: https://www.cisa.gov/sites/default/files/2026-07/open-source-software-security-principles.pdf
Stay secure and read SecureTechTalks 📚
#кибербезопасность #OpenSource #SupplyChainSecurity #CISA #SBOM #SecureByDesign #DevSecOps #AppSec #CyberSecurity #SecureTechTalks
CISA совместно с другими государственными и отраслевыми организациями США выпустила практическое руководство, которое показывает, как защищать OSS на этапе разработки.
⚙️ Что рекомендуют?
Вместо очередного списка "лучших практик" документ разбивает защиту на конкретные инженерные меры:
🔹 использовать многофакторную аутентификацию и защищать учётные записи сопровождающих;
🔹 подписывать релизы и проверять происхождение артефактов;
🔹 автоматизировать поиск уязвимостей и анализ зависимостей;
🔹 публиковать SBOM для выпускаемых продуктов;
🔹 заранее определить процесс coordinated vulnerability disclosure и безопасного исправления уязвимостей;
🔹 регулярно проводить code review и защищать CI/CD-пайплайн.
🧠 Саммери документа
Сегодня атакуют уже не только код, компрометировать можно GitHub-аккаунт мейнтейнера, систему сборки, пакетный репозиторий, процесс публикации релизов или механизм обновлений. Безопасность OSS должна рассматриваться, как защита всей цепочки разработки, а не отдельных библиотек.
🔗 Гайд: https://www.cisa.gov/sites/default/files/2026-07/open-source-software-security-principles.pdf
Stay secure and read SecureTechTalks 📚
#кибербезопасность #OpenSource #SupplyChainSecurity #CISA #SBOM #SecureByDesign #DevSecOps #AppSec #CyberSecurity #SecureTechTalks
👍1
🧨 Future AGI: Шесть инструментов вместо одного или операционной системой для AI-агентов
Почти каждая команда, разрабатывающая AI-агентов, собирает стек из десятков отдельных инструментов: Langfuse для трассировки, Braintrust для evals, Guardrails AI для защиты, Бог знает что для мониторинга...
Open-source проект Future AGI предлагает заменить этот конструктор единой платформой для всего жизненного цикла AI-агента.
⚙️ Функиональность
Вместо одного SDK разработчики получили полноценную инженерную платформу:
🔹 Tracing
OpenTelemetry-трассировка для 50+ AI-фреймворков с анализом latency, стоимости запросов и цепочек вызовов;
🔹 Evaluation
Более 50 встроенных метрик: hallucinations, groundedness, корректность tool calls, PII, jailbreak, prompt injection и собственные критерии оценки;
🔹 Simulation
Генерация тысяч пользовательских сценариев, adversarial-запросов и edge-case тестов ещё до выхода агента в production;
🔹 Guardrails
18 встроенных защитных модулей и интеграции с внешними решениями вроде Llama Guard, Presidio и Lakera;
🔹 Gateway
Единая точка доступа к сотням LLM-провайдеров с маршрутизацией, semantic cache, virtual keys и MCP;
🔹 Optimization
Автоматическое улучшение промптов на основе реальных production-трейсов.
🧠 Принципиальный подход
Сначала агент проходит симуляции, затем оценивается по десяткам метрик, после запуска собирает production-трейсы, а найденные ошибки автоматически превращаются в новые тесты и предложения по оптимизации промптов.
Платформа реализует непрерывный цикл simulate → evaluate → protect → monitor → optimize, превращая эксплуатацию AI-агента в управляемый инженерный процесс, а не бесконечную ручную настройку.
🔗 GitHub: https://github.com/future-agi/future-agi
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #AgentOps #AISecurity #Observability #Guardrails #DevSecOps #SecureTechTalks
Почти каждая команда, разрабатывающая AI-агентов, собирает стек из десятков отдельных инструментов: Langfuse для трассировки, Braintrust для evals, Guardrails AI для защиты, Бог знает что для мониторинга...
Open-source проект Future AGI предлагает заменить этот конструктор единой платформой для всего жизненного цикла AI-агента.
⚙️ Функиональность
Вместо одного SDK разработчики получили полноценную инженерную платформу:
🔹 Tracing
OpenTelemetry-трассировка для 50+ AI-фреймворков с анализом latency, стоимости запросов и цепочек вызовов;
🔹 Evaluation
Более 50 встроенных метрик: hallucinations, groundedness, корректность tool calls, PII, jailbreak, prompt injection и собственные критерии оценки;
🔹 Simulation
Генерация тысяч пользовательских сценариев, adversarial-запросов и edge-case тестов ещё до выхода агента в production;
🔹 Guardrails
18 встроенных защитных модулей и интеграции с внешними решениями вроде Llama Guard, Presidio и Lakera;
🔹 Gateway
Единая точка доступа к сотням LLM-провайдеров с маршрутизацией, semantic cache, virtual keys и MCP;
🔹 Optimization
Автоматическое улучшение промптов на основе реальных production-трейсов.
🧠 Принципиальный подход
Сначала агент проходит симуляции, затем оценивается по десяткам метрик, после запуска собирает production-трейсы, а найденные ошибки автоматически превращаются в новые тесты и предложения по оптимизации промптов.
Платформа реализует непрерывный цикл simulate → evaluate → protect → monitor → optimize, превращая эксплуатацию AI-агента в управляемый инженерный процесс, а не бесконечную ручную настройку.
🔗 GitHub: https://github.com/future-agi/future-agi
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #AgentOps #AISecurity #Observability #Guardrails #DevSecOps #SecureTechTalks
👍1
🧨 Black Hat USA 2026: какой будет кибербезопасность уже завтра?
Каждый август Black Hat становится местом, где впервые публично показывают исследования, которые через несколько месяцев превращаются в реальные инструменты атак и защиты. В этом году главная тема конференции, спойлер,AI-агенты .
Практически в каждом треке обсуждали уже не отдельные LLM, а автономные системы, способные самостоятельно искать уязвимости, атаковать инфраструктуру и принимать решения.
⚙️ Главные тренды Black Hat 2026
🔹 AI выходит в offensive security
Исследователи показали новые способы эксплуатации агентных систем, атак на AI-помощников разработчиков и автономный поиск цепочек эксплуатации.
🔹 GitHub становится новой конечной точкой
Отдельные доклады были посвящены обнаружению компрометации по собственным событиям GitHub, защите CI/CD и борьбе с атаками на цепочки поставок ПО.
🔹 Cloud и Agent Security окончательно объединились
В центре внимания оказались атаки на Cloudflare Workers, Kubernetes, MCP и облачные AI-платформы, где компрометация агента уже означает компрометацию инфраструктуры.
🔹 Криптография снова в центре внимания
На конференции представили новые исследования криптоанализа, безопасности библиотек шифрования и практических атак на современные криптографические реализации.
🔗 Конференция: https://www.blackhat.com/us-26/
🔗 Arsenal (инструменты конференции): https://www.blackhat.com/us-26/arsenal-overview.html
Stay secure and read SecureTechTalks 📚
#кибербезопасность #BlackHat #BlackHat2026 #AI #LLM #AgenticAI #AISecurity #AppSec #CyberSecurity #SecureTechTalks
Каждый август Black Hat становится местом, где впервые публично показывают исследования, которые через несколько месяцев превращаются в реальные инструменты атак и защиты. В этом году главная тема конференции, спойлер,
Практически в каждом треке обсуждали уже не отдельные LLM, а автономные системы, способные самостоятельно искать уязвимости, атаковать инфраструктуру и принимать решения.
⚙️ Главные тренды Black Hat 2026
🔹 AI выходит в offensive security
Исследователи показали новые способы эксплуатации агентных систем, атак на AI-помощников разработчиков и автономный поиск цепочек эксплуатации.
🔹 GitHub становится новой конечной точкой
Отдельные доклады были посвящены обнаружению компрометации по собственным событиям GitHub, защите CI/CD и борьбе с атаками на цепочки поставок ПО.
🔹 Cloud и Agent Security окончательно объединились
В центре внимания оказались атаки на Cloudflare Workers, Kubernetes, MCP и облачные AI-платформы, где компрометация агента уже означает компрометацию инфраструктуры.
🔹 Криптография снова в центре внимания
На конференции представили новые исследования криптоанализа, безопасности библиотек шифрования и практических атак на современные криптографические реализации.
🔗 Конференция: https://www.blackhat.com/us-26/
🔗 Arsenal (инструменты конференции): https://www.blackhat.com/us-26/arsenal-overview.html
Stay secure and read SecureTechTalks 📚
#кибербезопасность #BlackHat #BlackHat2026 #AI #LLM #AgenticAI #AISecurity #AppSec #CyberSecurity #SecureTechTalks
👍2
🧨 Новый способ защитить сайт от AI-скраперов
Исследователи представили ShieldFont, необычный шрифт, который выглядит для человека нормально, но подсовывает AI-скраперам другую информацию.
⚙️ Принцип работы
Визуально пользователь читает обычный текст.
Но многие AI-краулеры получают контент не так, как человек. Они анализируют HTML и символы страницы, а не финальное изображение текста.
ShieldFont использует механизм OpenType Glyph Substitution, из-за которого один и тот же текст одновременно существует в двух версиях:
🔹 человек видит оригинальную статью;
🔹 AI получает слова с изменённым смыслом.
Например, отдельные существительные незаметно заменяются другими. Предложение остаётся грамматически правильным, но уже передаёт совсем другой факт.
🧠 Отравление датасетов вместо блокировки
Задача сделать украденные данные бесполезными. В тестах авторов 55,8% защищённых фрагментов после обработки больше не сохраняли исходный смысл. При этом текст успешно проходил через типичные пайплайны сбора данных и мог попасть в обучающий датасет уже в искажённом виде.
Получается необычная стратегия защиты, вместо запрета на копирование злоумышленнику разрешают забрать данные. Однако эти данные уже содержат скрытую "дезинформацию" для модели.
🛡️ Идеальной защиты нет
Авторы честно признают, что ShieldFont нельзя назвать невзламываемым. Если кто-то целенаправленно исследует конкретный сайт, он сможет восстановить соответствие символов.
Однако для массового AI-скрапинга стоимость атаки резко возрастает. Теперь бот не может заранее понять, использует ли сайт подобную защиту и насколько можно доверять собранному контенту.
🔗 Исследование и проект: https://shieldfont.com
🔗 GitHub: https://github.com/isaqueseneda/shieldfont
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #ShieldFont #AIScraping #DataPoisoning #AgenticAI #WebSecurity #CyberSecurity #SecureTechTalks
Исследователи представили ShieldFont, необычный шрифт, который выглядит для человека нормально, но подсовывает AI-скраперам другую информацию.
⚙️ Принцип работы
Визуально пользователь читает обычный текст.
Но многие AI-краулеры получают контент не так, как человек. Они анализируют HTML и символы страницы, а не финальное изображение текста.
ShieldFont использует механизм OpenType Glyph Substitution, из-за которого один и тот же текст одновременно существует в двух версиях:
🔹 человек видит оригинальную статью;
🔹 AI получает слова с изменённым смыслом.
Например, отдельные существительные незаметно заменяются другими. Предложение остаётся грамматически правильным, но уже передаёт совсем другой факт.
🧠 Отравление датасетов вместо блокировки
Задача сделать украденные данные бесполезными. В тестах авторов 55,8% защищённых фрагментов после обработки больше не сохраняли исходный смысл. При этом текст успешно проходил через типичные пайплайны сбора данных и мог попасть в обучающий датасет уже в искажённом виде.
Получается необычная стратегия защиты, вместо запрета на копирование злоумышленнику разрешают забрать данные. Однако эти данные уже содержат скрытую "дезинформацию" для модели.
🛡️ Идеальной защиты нет
Авторы честно признают, что ShieldFont нельзя назвать невзламываемым. Если кто-то целенаправленно исследует конкретный сайт, он сможет восстановить соответствие символов.
Однако для массового AI-скрапинга стоимость атаки резко возрастает. Теперь бот не может заранее понять, использует ли сайт подобную защиту и насколько можно доверять собранному контенту.
🔗 Исследование и проект: https://shieldfont.com
🔗 GitHub: https://github.com/isaqueseneda/shieldfont
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #ShieldFont #AIScraping #DataPoisoning #AgenticAI #WebSecurity #CyberSecurity #SecureTechTalks
👍1
🧨 Future AGI: единый стек для AI-агентов
AI-агента легко запустить. Гораздо сложнее понять, насколько он безопасен и стабилен после запуска.
Open-source платформа Future AGI объединяет в одной платформе инструменты, которые обычно приходится собирать отдельно:
🔹 Tracing - отслеживание LLM-вызовов, tool calls, latency и стоимости;
🔹 Evaluation - проверка качества, hallucinations, PII, jailbreak и prompt injection;
🔹 Simulation - генерация пользовательских и adversarial-сценариев до выхода в production;
🔹 Guardrails - проверка входов и выходов агента;
🔹 Gateway - единая точка работы с LLM-провайдерами, routing и caching;
🔹 Optimization - автоматический поиск более эффективных вариантов промптов.
🛡️ Безопасность проверяется не только на входе
Future AGI позволяет прогонять агента через проверки на prompt injection, jailbreak, PII и другие нарушения политик безопасности. Проверки можно использовать как guardrails во время работы агента и как evaluation-критерии при тестировании новых версий.
🧠 Петля
Продукт зацикливает работу агентов:
simulate → evaluate → protect → monitor → optimize
Нашли проблему → добавили сценарий в evaluation → проверили новую версию → снова отправили в production.
Поведение агента постоянно измеряется, тестируется и улучшается.
🔗 GitHub: https://github.com/future-agi/future-agi
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #AgentOps #AISecurity #Guardrails #DevSecOps #OpenSource #SecureTechTalks
AI-агента легко запустить. Гораздо сложнее понять, насколько он безопасен и стабилен после запуска.
Open-source платформа Future AGI объединяет в одной платформе инструменты, которые обычно приходится собирать отдельно:
🔹 Tracing - отслеживание LLM-вызовов, tool calls, latency и стоимости;
🔹 Evaluation - проверка качества, hallucinations, PII, jailbreak и prompt injection;
🔹 Simulation - генерация пользовательских и adversarial-сценариев до выхода в production;
🔹 Guardrails - проверка входов и выходов агента;
🔹 Gateway - единая точка работы с LLM-провайдерами, routing и caching;
🔹 Optimization - автоматический поиск более эффективных вариантов промптов.
🛡️ Безопасность проверяется не только на входе
Future AGI позволяет прогонять агента через проверки на prompt injection, jailbreak, PII и другие нарушения политик безопасности. Проверки можно использовать как guardrails во время работы агента и как evaluation-критерии при тестировании новых версий.
🧠 Петля
Продукт зацикливает работу агентов:
simulate → evaluate → protect → monitor → optimize
Нашли проблему → добавили сценарий в evaluation → проверили новую версию → снова отправили в production.
Поведение агента постоянно измеряется, тестируется и улучшается.
🔗 GitHub: https://github.com/future-agi/future-agi
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #AgentOps #AISecurity #Guardrails #DevSecOps #OpenSource #SecureTechTalks
👍2
🧨 CyberForge: AI-агентов учат искать уязвимости на настоящем коде
Реальных CVE не так много, их сложно воспроизводить, а превращение каждой уязвимости в полноценную тренировочную задачу требует ручной работы.
Исследователи из NIST и University of Maryland предложили новый подход, CyberForge.
⚙️ Уязвимости создаются искусственно
CyberForge берёт реальные C/C++ проекты из OSS-Fuzz и специально вносит в них небольшие изменения, превращающие обычный код в уязвимый.
Система принимает уязвимость только если одновременно выполняются два условия:
🔹 исходные unit-тесты продолжают проходить;
🔹 Proof-of-Vulnerability срабатывает на изменённой версии, но не срабатывает на оригинальной.
Полученная уязвимость должна оставаться скрытой при обычной работе, но реально эксплуатироваться специально подготовленным входом.
🧠 Результаты
CyberForge создал:
➖ 1 034 подтверждённые уязвимости;
➖ 80 реальных open-source проектов;
➖ 63 категории CWE.
В 1 025 из 1 034 кейсах изменяли только один файл, а в 944 всего один участок кода. По характеру изменений полученный датасет оказался сопоставим с реальными CVE-патчами.
🔥 И улучшение AI-агентов
Исследователи собрали на этих задачах trajectories от более сильных моделей и использовали их для fine-tuning Gemma 4.
На SEC-bench результат 31B-модели вырос на 14,7%.
Кроме того, модели, обученные исключительно на C/C++, улучшили результаты и на другом наборе задач с Python, JavaScript и Go.
🛡️ Меняем подход
Получается новый цикл обучения security-агентов:
реальный репозиторий → синтетическая уязвимость → автоматическая проверка → задача для AI → обучение → более сильный security-agent.
P.S. Созданные уязвимости являются синтетическими изменениями open-source кода и не представляют собой новые zero-day в продуктивных системах.
🔗 Исследование: https://arxiv.org/abs/2608.06471
🔗 Проект: https://cyb3rforge.github.io
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #AppSec #VulnerabilityResearch #CyberSecurity #OSSFuzz #DevSecOps #SecureTechTalks
Реальных CVE не так много, их сложно воспроизводить, а превращение каждой уязвимости в полноценную тренировочную задачу требует ручной работы.
Исследователи из NIST и University of Maryland предложили новый подход, CyberForge.
⚙️ Уязвимости создаются искусственно
CyberForge берёт реальные C/C++ проекты из OSS-Fuzz и специально вносит в них небольшие изменения, превращающие обычный код в уязвимый.
Система принимает уязвимость только если одновременно выполняются два условия:
🔹 исходные unit-тесты продолжают проходить;
🔹 Proof-of-Vulnerability срабатывает на изменённой версии, но не срабатывает на оригинальной.
Полученная уязвимость должна оставаться скрытой при обычной работе, но реально эксплуатироваться специально подготовленным входом.
🧠 Результаты
CyberForge создал:
➖ 1 034 подтверждённые уязвимости;
➖ 80 реальных open-source проектов;
➖ 63 категории CWE.
В 1 025 из 1 034 кейсах изменяли только один файл, а в 944 всего один участок кода. По характеру изменений полученный датасет оказался сопоставим с реальными CVE-патчами.
🔥 И улучшение AI-агентов
Исследователи собрали на этих задачах trajectories от более сильных моделей и использовали их для fine-tuning Gemma 4.
На SEC-bench результат 31B-модели вырос на 14,7%.
Кроме того, модели, обученные исключительно на C/C++, улучшили результаты и на другом наборе задач с Python, JavaScript и Go.
🛡️ Меняем подход
Получается новый цикл обучения security-агентов:
реальный репозиторий → синтетическая уязвимость → автоматическая проверка → задача для AI → обучение → более сильный security-agent.
P.S. Созданные уязвимости являются синтетическими изменениями open-source кода и не представляют собой новые zero-day в продуктивных системах.
🔗 Исследование: https://arxiv.org/abs/2608.06471
🔗 Проект: https://cyb3rforge.github.io
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #AppSec #VulnerabilityResearch #CyberSecurity #OSSFuzz #DevSecOps #SecureTechTalks
👍1
🧨 Зашифрованные мысли LLM не такие уж секретные
Разработчики Anthropic, OpenAI и Google специально прячут chain-of-thought. Пользователь получает только краткое summary, а полное reasoning API возвращает в виде зашифрованного блока, который клиент должен передать обратно при следующем запросе.
Звучит безопасно? Спойлер -нет .
Исследователи из Tübingen, Max Planck, MATS и Snyk показали, что если взять такой блок от сильной модели и передать его более слабой модели того же провайдера, слабую модель можно заставить расшифровать и вывести исходный reasoning практически дословно.
⚙️ В чём проблема?
Уязвимость оказалась архитектурной. Reasoning-блоки были совместимы между разными сессиями, пользователями и моделями внутри одной экосистемы.
Схема выглядит так:
сильная модель → encrypted reasoning → слабая модель → plaintext reasoning
Более слабая модель становится дешёвым «дешифратором», потому что у неё менее строгие защитные настройки.
🧠 Дальше больше
Учёные скачали 315 320 зашифрованных reasoning-блоков из публичных репозиториев и смогли восстановить из них:
🔹 367 PII-артефактов;
🔹 182 credentials.
То есть разработчик мог спокойно опубликовать лог, увидеть в нём набор бессмысленных символов и фактически выложить вместе с ним пароль или API credential.
Стоит учесть, что reasoning может содержать информацию, которой вообще нет в видимой части сессии.
🔥 Более опасный сценарий
Исследователи показали, что этот же механизм можно использовать и в обратную сторону. Не извлекать скрытый prompt, а спрятать вредоносную инструкцию внутри reasoning-блока.
Видимый лог выглядит нормально. Человек ничего подозрительного не замечает, но другой агент, получив этот блок как часть истории предыдущего запуска, может прочитать встроенную инструкцию как собственное прошлое состояние.
Получается новый вариант invisible prompt injection, который особенно опасен для публичных коллекций agent trajectories.
🧨 Причем тут Kimi?
Авторы отдельно сравнили скрытые reasoning-трейсы Claude Opus 4.8 и GPT-5.6 Sol с несколькими open-weight моделями.
У Kimi K3 обнаружились необычно сильные совпадения. Это выглядит как возможный след distillation, но авторы подчёркивают, что эксперимент не доказывает, что Kimi действительно обучалась на украденных reasoning-трейсах.
🔗 Исследование: https://arxiv.org/abs/2608.09867
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #ChainOfThought #AgenticAI #AISecurity #PromptInjection #DataLeak #ModelSecurity #SecureTechTalks
Разработчики Anthropic, OpenAI и Google специально прячут chain-of-thought. Пользователь получает только краткое summary, а полное reasoning API возвращает в виде зашифрованного блока, который клиент должен передать обратно при следующем запросе.
Звучит безопасно? Спойлер -
Исследователи из Tübingen, Max Planck, MATS и Snyk показали, что если взять такой блок от сильной модели и передать его более слабой модели того же провайдера, слабую модель можно заставить расшифровать и вывести исходный reasoning практически дословно.
⚙️ В чём проблема?
Уязвимость оказалась архитектурной. Reasoning-блоки были совместимы между разными сессиями, пользователями и моделями внутри одной экосистемы.
Схема выглядит так:
сильная модель → encrypted reasoning → слабая модель → plaintext reasoning
Более слабая модель становится дешёвым «дешифратором», потому что у неё менее строгие защитные настройки.
🧠 Дальше больше
Учёные скачали 315 320 зашифрованных reasoning-блоков из публичных репозиториев и смогли восстановить из них:
🔹 367 PII-артефактов;
🔹 182 credentials.
То есть разработчик мог спокойно опубликовать лог, увидеть в нём набор бессмысленных символов и фактически выложить вместе с ним пароль или API credential.
Стоит учесть, что reasoning может содержать информацию, которой вообще нет в видимой части сессии.
🔥 Более опасный сценарий
Исследователи показали, что этот же механизм можно использовать и в обратную сторону. Не извлекать скрытый prompt, а спрятать вредоносную инструкцию внутри reasoning-блока.
Видимый лог выглядит нормально. Человек ничего подозрительного не замечает, но другой агент, получив этот блок как часть истории предыдущего запуска, может прочитать встроенную инструкцию как собственное прошлое состояние.
Получается новый вариант invisible prompt injection, который особенно опасен для публичных коллекций agent trajectories.
🧨 Причем тут Kimi?
Авторы отдельно сравнили скрытые reasoning-трейсы Claude Opus 4.8 и GPT-5.6 Sol с несколькими open-weight моделями.
У Kimi K3 обнаружились необычно сильные совпадения. Это выглядит как возможный след distillation, но авторы подчёркивают, что эксперимент не доказывает, что Kimi действительно обучалась на украденных reasoning-трейсах.
🔗 Исследование: https://arxiv.org/abs/2608.09867
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #ChainOfThought #AgenticAI #AISecurity #PromptInjection #DataLeak #ModelSecurity #SecureTechTalks
👍1
💣 Convergent Detour Hijacking: когда AI-агент делает всё правильно
У AI-агентов появляется новый класс атак, который сложно заметить обычными security-проверками.
Convergent Detour Hijacking (CDH) не заставляет агента провалить задачу. Наоборот, агент приходит к правильному результату, но по специально навязанному обходному и безумно дорогому маршруту.
Представьте задачу: «найти уязвимость в приложении и подготовить отчёт.»
Нормальный агент:
После атаки:
Каждый шаг выглядит разумным. Но их становится в разы больше. Растёт всё:
🔹 количество tool calls
🔹 число inference steps
🔹 расход токенов
🔹 время выполнения
🔹 нагрузка на инструменты
🔹 стоимость запуска агента
🎯 В чём трюк?
Агент подменяет или заражает skill, определяющий, как агент должен решать задачу. В навык можно добавить дополнительные проверки, повторные валидации или альтернативные ветки и увеличить стоимость решения задачи в несколько раз.
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AIsecurity #AIAgents #LLM #AgentSecurity #PromptInjection #AgenticAI #Cybersecurity #LLMSecurity #SecureTechTalks
У AI-агентов появляется новый класс атак, который сложно заметить обычными security-проверками.
Convergent Detour Hijacking (CDH) не заставляет агента провалить задачу. Наоборот, агент приходит к правильному результату, но по специально навязанному обходному и безумно дорогому маршруту.
Представьте задачу: «найти уязвимость в приложении и подготовить отчёт.»
Нормальный агент:
recon → test → analyze → report
После атаки:
recon → test → verify → re-check → reproduce → validate → compare → retry → analyze → report
Каждый шаг выглядит разумным. Но их становится в разы больше. Растёт всё:
🔹 количество tool calls
🔹 число inference steps
🔹 расход токенов
🔹 время выполнения
🔹 нагрузка на инструменты
🔹 стоимость запуска агента
🎯 В чём трюк?
Агент подменяет или заражает skill, определяющий, как агент должен решать задачу. В навык можно добавить дополнительные проверки, повторные валидации или альтернативные ветки и увеличить стоимость решения задачи в несколько раз.
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AIsecurity #AIAgents #LLM #AgentSecurity #PromptInjection #AgenticAI #Cybersecurity #LLMSecurity #SecureTechTalks
🧨 AI-агенты умеют работать с кодом. Но что будет, если кода больше нет?
Исследователи из Columbia, Berkeley, UCLA, Tufts и других организаций представили SRE-Bench, бенчмарк, созданный специально для проверки того, насколько AI-агенты способны разбирать неизвестные бинарники, а не узнавать уже знакомый проект из обучающих данных.
⚙️ Больше никакого «угадай, что это за программа»
Авторы сделали 19 программ с нуля, общей сложностью более 320 000 строк кода.
Внутри пять типов задач:
🔹 сетевые протоколы;
🔹 firmware;
🔹 игровые приложения;
🔹 собственные форматы файлов;
🔹 безопасная имитация malware.
Средний размер программы 16,9 тыс. строк.
Затем исследователи превратили их в 262 уникальных бинарных экземпляра и добавили 44 механизма anti-analysis: obfuscation, anti-debugging, виртуализированный loader, шифрование страниц кода, anti-dump и другие техники.
В итоге получилось 1 572 детерминированно проверяемые задачи.
На создание всего этого ушло более 5 000 часов работы специалистов по reverse engineering.
🧠 Результаты AI
Пять frontier-моделей получили одинаковый набор инструментов: Ghidra, GDB, angr, radare2, binutils и другие RE-инструменты.
Лучшей оказалась GPT-5.6-Sol:
61,4% среднего результата и только 80 из 262 бинарников полностью решены (31,5%).
Claude Opus 5 решил 12,5%, GPT-5.5 - 3,8%, Grok 4.5 - 0,9%, а GLM-5.2 не смог полностью решить ни одного экземпляра.
Эксперимент стоил исследователям $31,4 тыс. и занял около 1 812 sandbox-часов.
🔥 Агенты думают не как reverse engineer
У человека оптимизированный и statically linked бинарник обычно сложнее анализировать, а у AI почти наоборот.
Для GPT-5.6-Sol оптимизация снизила результат всего с 4,75 до 4,67 из 6, а static linking с 4,73 до 4,69.
Удаление символов оказалось намного болезненнее: результат упал с 4,95 до 4,47.
Похоже, современные агенты сильно опираются на имена функций, переменных и другие lexical anchors, которые помогают им построить смысловую модель программы. Когда эти подсказки исчезают, capability резко проседает.
🛡️ Защита ломает всё
Когда авторы включили собственный anti-analysis слой, результат GPT-5.6-Sol практически упал вдвое: с 4,69 до 2,50.
Claude Opus 5 рухнул с 3,07 до 0,33, а остальные модели приблизились к нулю.
AI уже довольно хорошо работает с известной структурой исходного кода. Но между «прочитать код» и «понять неизвестный защищённый бинарник» пока огромная пропасть.
Бинарный анализ не экзотическая задача. Именно так приходится исследовать значительную часть malware, firmware, закрытого enterprise-софта и security appliances. Авторы отмечают, что 46,5% уязвимостей, эксплуатируемых in-the-wild, связаны с вендорами, которые не публикуют исходный код.
🔗 Исследование: https://arxiv.org/pdf/2608.11469
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #ReverseEngineering #MalwareAnalysis #BinaryAnalysis #AISecurity #ThreatResearch #SecureTechTalks
Исследователи из Columbia, Berkeley, UCLA, Tufts и других организаций представили SRE-Bench, бенчмарк, созданный специально для проверки того, насколько AI-агенты способны разбирать неизвестные бинарники, а не узнавать уже знакомый проект из обучающих данных.
⚙️ Больше никакого «угадай, что это за программа»
Авторы сделали 19 программ с нуля, общей сложностью более 320 000 строк кода.
Внутри пять типов задач:
🔹 сетевые протоколы;
🔹 firmware;
🔹 игровые приложения;
🔹 собственные форматы файлов;
🔹 безопасная имитация malware.
Средний размер программы 16,9 тыс. строк.
Затем исследователи превратили их в 262 уникальных бинарных экземпляра и добавили 44 механизма anti-analysis: obfuscation, anti-debugging, виртуализированный loader, шифрование страниц кода, anti-dump и другие техники.
В итоге получилось 1 572 детерминированно проверяемые задачи.
На создание всего этого ушло более 5 000 часов работы специалистов по reverse engineering.
🧠 Результаты AI
Пять frontier-моделей получили одинаковый набор инструментов: Ghidra, GDB, angr, radare2, binutils и другие RE-инструменты.
Лучшей оказалась GPT-5.6-Sol:
61,4% среднего результата и только 80 из 262 бинарников полностью решены (31,5%).
Claude Opus 5 решил 12,5%, GPT-5.5 - 3,8%, Grok 4.5 - 0,9%, а GLM-5.2 не смог полностью решить ни одного экземпляра.
Эксперимент стоил исследователям $31,4 тыс. и занял около 1 812 sandbox-часов.
🔥 Агенты думают не как reverse engineer
У человека оптимизированный и statically linked бинарник обычно сложнее анализировать, а у AI почти наоборот.
Для GPT-5.6-Sol оптимизация снизила результат всего с 4,75 до 4,67 из 6, а static linking с 4,73 до 4,69.
Удаление символов оказалось намного болезненнее: результат упал с 4,95 до 4,47.
Похоже, современные агенты сильно опираются на имена функций, переменных и другие lexical anchors, которые помогают им построить смысловую модель программы. Когда эти подсказки исчезают, capability резко проседает.
🛡️ Защита ломает всё
Когда авторы включили собственный anti-analysis слой, результат GPT-5.6-Sol практически упал вдвое: с 4,69 до 2,50.
Claude Opus 5 рухнул с 3,07 до 0,33, а остальные модели приблизились к нулю.
AI уже довольно хорошо работает с известной структурой исходного кода. Но между «прочитать код» и «понять неизвестный защищённый бинарник» пока огромная пропасть.
Бинарный анализ не экзотическая задача. Именно так приходится исследовать значительную часть malware, firmware, закрытого enterprise-софта и security appliances. Авторы отмечают, что 46,5% уязвимостей, эксплуатируемых in-the-wild, связаны с вендорами, которые не публикуют исходный код.
🔗 Исследование: https://arxiv.org/pdf/2608.11469
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #ReverseEngineering #MalwareAnalysis #BinaryAnalysis #AISecurity #ThreatResearch #SecureTechTalks
🧨 Hazmat: sandbox для AI-агентов на macOS
Coding-агенты (Claude Code, Codex и т.д.) умеют самостоятельно выполнять shell-команды, устанавливать зависимости и менять файлы. Если агент получит prompt injection то, последствия могут быть крайне печальными.
OpenSource продукт Hazmat ограничивает агента на уровне операционной системы.
⚙️ Немного деталей
Агент запускается от отдельного пользователя "agent", поэтому не получает ваш "$HOME", SSH-ключи и credentials.
Дополнительно используются:
🔹 macOS Seatbelt для ограничения доступа к файловой системе;
🔹 PF firewall и DNS blocklist для контроля сетевого доступа;
🔹 ограничения для package managers, включая npm;
🔹 snapshot проекта перед запуском и возможность посмотреть diff или откатить изменения.
Перед стартом работы указывается session contract: какие каталоги доступны, что можно изменять и какие интеграции включены.
🛡️ Принципиальные ограничения
Представим вредоносный "CLAUDE.md", который заставляет агента прочитать "~/.ssh/id_ed25519" и отправить ключ наружу.
Модель может выполнить команду, но её процесс не должен иметь необходимых прав и доступа. Безопасность должна учитывать сценарий, в котором модель уже скомпрометирована.
🔗 GitHub: https://github.com/dredozubov/hazmat
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #ClaudeCode #Codex #AISecurity #Sandbox #macOS #SecureTechTalks
Coding-агенты (Claude Code, Codex и т.д.) умеют самостоятельно выполнять shell-команды, устанавливать зависимости и менять файлы. Если агент получит prompt injection то, последствия могут быть крайне печальными.
OpenSource продукт Hazmat ограничивает агента на уровне операционной системы.
⚙️ Немного деталей
Агент запускается от отдельного пользователя "agent", поэтому не получает ваш "$HOME", SSH-ключи и credentials.
Дополнительно используются:
🔹 macOS Seatbelt для ограничения доступа к файловой системе;
🔹 PF firewall и DNS blocklist для контроля сетевого доступа;
🔹 ограничения для package managers, включая npm;
🔹 snapshot проекта перед запуском и возможность посмотреть diff или откатить изменения.
Перед стартом работы указывается session contract: какие каталоги доступны, что можно изменять и какие интеграции включены.
🛡️ Принципиальные ограничения
Представим вредоносный "CLAUDE.md", который заставляет агента прочитать "~/.ssh/id_ed25519" и отправить ключ наружу.
Модель может выполнить команду, но её процесс не должен иметь необходимых прав и доступа. Безопасность должна учитывать сценарий, в котором модель уже скомпрометирована.
🔗 GitHub: https://github.com/dredozubov/hazmat
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #ClaudeCode #Codex #AISecurity #Sandbox #macOS #SecureTechTalks
👍1
🧨 LLM научились ловить ботов. Теперь боты учатся обманывать LLM
Соцсети всё чаще используют LLM для поиска ботов. Модель читает профиль, историю публикаций и пытается понять, перед ней человек или автоматизированный аккаунт.
Проблема начинается в тот момент, когда атакующий понимает, как работает детектор.
⚙️ Достаточно переписать запрос
Исследователи из Reichman University проверили три open source модели: Llama 3 8B, Gemma 7B и Mistral 7B.
Они использовали два класса атак.
🔹 Content Manipulation: AI переписывает публикации бота так, чтобы они выглядели более естественно.
🔹 LLM Manipulation: в данные добавляется prompt injection, который пытается заставить классификатор забыть исходную задачу.
У Llama точность детектирования после некоторых атак падала примерно с 91% до 75%. Для Gemma падение доходило примерно до 35%.
🧠 Атака на сам детектор
Самый действенный результат связан с prompt injection. Для Llama и Gemma некоторые варианты атак снижали качество классификации примерно на 46% и 48% соответственно. Причём модель могла начать выполнять инструкции из анализируемого контента вместо первоначальной задачи определения бота.
Таким образом, система безопасности сама становится объектом атаки.
🔥 Один LLM против другой
Авторы проверили несколько защитных подходов: delimiters, self examination, in context learning, feature guidance и проверки known answer.
Универсального решения не нашлось. Например, для Llama feature guidance помогал против reasoning injection, а known answer оказался особенно эффективен против некоторых других вариантов атак. Поэтому исследователи собрали LSABRE, ансамбль из нескольких LLM.
Он работает в три этапа:
Detection → Prevention → Classification
Сначала несколько моделей ищут признаки манипуляции. Подозрительный контент получает дополнительную защиту. После этого основная модель выполняет классификацию.
В эксперименте LSABRE достиг 86,2% accuracy при атаке и сохранил FPR около 13%.
🔗 Исследование: https://arxiv.org/abs/2608.15893
🔗 GitHub LSABRE: https://github.com/runi-cyber-ai/LSABRE
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #BotDetection #PromptInjection #AISecurity #RedTeaming #CyberSecurity #SecureTechTalks
Соцсети всё чаще используют LLM для поиска ботов. Модель читает профиль, историю публикаций и пытается понять, перед ней человек или автоматизированный аккаунт.
Проблема начинается в тот момент, когда атакующий понимает, как работает детектор.
⚙️ Достаточно переписать запрос
Исследователи из Reichman University проверили три open source модели: Llama 3 8B, Gemma 7B и Mistral 7B.
Они использовали два класса атак.
🔹 Content Manipulation: AI переписывает публикации бота так, чтобы они выглядели более естественно.
🔹 LLM Manipulation: в данные добавляется prompt injection, который пытается заставить классификатор забыть исходную задачу.
У Llama точность детектирования после некоторых атак падала примерно с 91% до 75%. Для Gemma падение доходило примерно до 35%.
🧠 Атака на сам детектор
Самый действенный результат связан с prompt injection. Для Llama и Gemma некоторые варианты атак снижали качество классификации примерно на 46% и 48% соответственно. Причём модель могла начать выполнять инструкции из анализируемого контента вместо первоначальной задачи определения бота.
Таким образом, система безопасности сама становится объектом атаки.
🔥 Один LLM против другой
Авторы проверили несколько защитных подходов: delimiters, self examination, in context learning, feature guidance и проверки known answer.
Универсального решения не нашлось. Например, для Llama feature guidance помогал против reasoning injection, а known answer оказался особенно эффективен против некоторых других вариантов атак. Поэтому исследователи собрали LSABRE, ансамбль из нескольких LLM.
Он работает в три этапа:
Detection → Prevention → Classification
Сначала несколько моделей ищут признаки манипуляции. Подозрительный контент получает дополнительную защиту. После этого основная модель выполняет классификацию.
В эксперименте LSABRE достиг 86,2% accuracy при атаке и сохранил FPR около 13%.
🔗 Исследование: https://arxiv.org/abs/2608.15893
🔗 GitHub LSABRE: https://github.com/runi-cyber-ai/LSABRE
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #BotDetection #PromptInjection #AISecurity #RedTeaming #CyberSecurity #SecureTechTalks
❤1👍1
🧨 Google учит AI работать с зашифрованными данными
Fully Homomorphic Encryption (FHE) сохраняет данные зашифрованными даже во время вычислений.
Мы уже рассказывали про проблемы гомоморфного шифрования и федеративного обучения. Однако Google не стоит на месте и продолжает развивать технологию в виде открытого проекта HEIR, который должен упростить создание приложений.
⚙️ Суть проекта
Разработчик описывает обычную программу. HEIR автоматически преобразует её так, чтобы вычисления выполнялись непосредственно над зашифрованными данными.
Получается цепочка:
данные → шифрование → AI или другая обработка → зашифрованный результат → расшифровка
Сервер работает с зашифрованной информацией и не получает исходные данные.
🧠 Зачем здесь AI
Такой подход особенно интересен для систем, где данные слишком чувствительны для передачи внешнему AI сервису.
Например:
🔹 банк отправляет транзакцию на анализ мошенничества, не раскрывая её содержимое;
🔹 SOC анализирует сетевые события, сохраняя данные клиентов зашифрованными;
🔹 медицинская система использует AI для анализа данных пациента без передачи модели открытой медицинской информации.
HEIR поддерживает несколько современных методов гомоморфного шифрования и умеет автоматически оптимизировать вычисления.
🔥 Главная проблема
Само шифрование уже существует. Главный барьер сейчас в том, что такие вычисления дорогие и сложные для разработчиков.
HEIR пытается спрятать большую часть криптографической сложности внутри компилятора. Разработчик описывает нужную логику, а система сама преобразует её в операции над зашифрованными данными.
Когда этот подход станет достаточно быстрым, появится интересная архитектура для корпоративного AI.
Модель получает данные, но инфраструктура вокруг неё не получает доступа к исходной информации.
🔗 GitHub: https://github.com/google/heir
🔗 Документация: https://heir.dev/
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #FHE #Privacy #Cryptography #Google #OpenSource #AISecurity #DataSecurity #SecureTechTalks
Fully Homomorphic Encryption (FHE) сохраняет данные зашифрованными даже во время вычислений.
Мы уже рассказывали про проблемы гомоморфного шифрования и федеративного обучения. Однако Google не стоит на месте и продолжает развивать технологию в виде открытого проекта HEIR, который должен упростить создание приложений.
⚙️ Суть проекта
Разработчик описывает обычную программу. HEIR автоматически преобразует её так, чтобы вычисления выполнялись непосредственно над зашифрованными данными.
Получается цепочка:
данные → шифрование → AI или другая обработка → зашифрованный результат → расшифровка
Сервер работает с зашифрованной информацией и не получает исходные данные.
🧠 Зачем здесь AI
Такой подход особенно интересен для систем, где данные слишком чувствительны для передачи внешнему AI сервису.
Например:
🔹 банк отправляет транзакцию на анализ мошенничества, не раскрывая её содержимое;
🔹 SOC анализирует сетевые события, сохраняя данные клиентов зашифрованными;
🔹 медицинская система использует AI для анализа данных пациента без передачи модели открытой медицинской информации.
HEIR поддерживает несколько современных методов гомоморфного шифрования и умеет автоматически оптимизировать вычисления.
🔥 Главная проблема
Само шифрование уже существует. Главный барьер сейчас в том, что такие вычисления дорогие и сложные для разработчиков.
HEIR пытается спрятать большую часть криптографической сложности внутри компилятора. Разработчик описывает нужную логику, а система сама преобразует её в операции над зашифрованными данными.
Когда этот подход станет достаточно быстрым, появится интересная архитектура для корпоративного AI.
Модель получает данные, но инфраструктура вокруг неё не получает доступа к исходной информации.
🔗 GitHub: https://github.com/google/heir
🔗 Документация: https://heir.dev/
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #FHE #Privacy #Cryptography #Google #OpenSource #AISecurity #DataSecurity #SecureTechTalks
👍1
🧨 Просроченная банковская карта может снова заработать
Исследователи из University of Massachusetts Amherst показали атаку Zombie Card, позволяющую в некоторых сценариях провести бесконтактный платеж картой после окончания срока её действия.
⚙️ Принцип действия
Срок действия карты передаётся терминалу по NFC, однако значение даты не входит в криптографическую аутентификацию.
Исследователи использовали атаку Man in the Middle между картой и терминалом и изменяли передаваемую дату. Криптографические данные карты оставались корректными.
Схема следующая:
карта → NFC → изменение даты → терминал
🧠 Криптографию взламывать не пришлось
Самое примечательное в атаке в отсутствии необходимости кражи ключа карты и подделке криптографической подписи. Проблема возникает из-за того, что терминал самостоятельно принимает решение о действительности карты на основании данных, которые можно изменить по пути.
В тестах Visa и Mastercard результаты зависели от конкретного банка и терминала. Часть операций блокировалась, часть проходила.
🛡️ Классика жанра
Zombie Card хорошо показывает классическую проблему безопасности платежей, отдельные компоненты могут быть надёжно защищены, но уязвимость появляется на границе между ними.
🔗 Исследование: https://www.usenix.org/conference/usenixsecurity26/presentation/anwar
🔗 Технические детали: https://khwarizmilab.github.io/emvexpiredcards/
Stay secure and read SecureTechTalks 📚
#кибербезопасность #PaymentSecurity #EMV #NFC #BankingSecurity #CyberSecurity #FinTech #SecureTechTalks
Исследователи из University of Massachusetts Amherst показали атаку Zombie Card, позволяющую в некоторых сценариях провести бесконтактный платеж картой после окончания срока её действия.
⚙️ Принцип действия
Срок действия карты передаётся терминалу по NFC, однако значение даты не входит в криптографическую аутентификацию.
Исследователи использовали атаку Man in the Middle между картой и терминалом и изменяли передаваемую дату. Криптографические данные карты оставались корректными.
Схема следующая:
карта → NFC → изменение даты → терминал
🧠 Криптографию взламывать не пришлось
Самое примечательное в атаке в отсутствии необходимости кражи ключа карты и подделке криптографической подписи. Проблема возникает из-за того, что терминал самостоятельно принимает решение о действительности карты на основании данных, которые можно изменить по пути.
В тестах Visa и Mastercard результаты зависели от конкретного банка и терминала. Часть операций блокировалась, часть проходила.
🛡️ Классика жанра
Zombie Card хорошо показывает классическую проблему безопасности платежей, отдельные компоненты могут быть надёжно защищены, но уязвимость появляется на границе между ними.
🔗 Исследование: https://www.usenix.org/conference/usenixsecurity26/presentation/anwar
🔗 Технические детали: https://khwarizmilab.github.io/emvexpiredcards/
Stay secure and read SecureTechTalks 📚
#кибербезопасность #PaymentSecurity #EMV #NFC #BankingSecurity #CyberSecurity #FinTech #SecureTechTalks
👍2❤1
🧨 MITRE-SAGE: расследование киберинцидентов
LLM неплохо объясняет, что такое CVE или MITRE ATT&CK, но узкоспециализированных вопросов приходится одновременно искать факты, связывать сущности между собой и проверять несколько источников. Обычный RAG с набором текстовых чанков с этим справляется далеко не всегда.
⚙️ Команда вместо одного агента
Авторы MITRE-SAGE собрали многоагентную систему, где разные модели занимаются разными частями сбора информации.
🔹 Graph Agent ищет связи в графе на основе MITRE и NVD;
🔹 Text Agent извлекает информацию из документов;
🔹 Web Agent ищет свежие сведения в интернете;
🔹 отдельные агенты сокращают найденную информацию и отбрасывают нерелевантные данные;
🔹 Orchestrator решает, какие источники подключить, сравнивает результаты и формирует ответ.
Модель сначала разбивает вопрос на подзадачи, собирает доказательства из разных источников и только после этого отвечает.
🧠 Главное не количество агентов
Интересно, что авторы отдельно создали MITRE-QA, набор из 3000 вопросов по кибербезопасности.
В нём есть обычные вопросы о CVE и CWE, поиск сущностей, анализ связей, профилирование угроз и более сложные multi-hop задачи, где ответ приходится собирать из нескольких связанных фактов.
В результате MITRE-SAGE показал лучший результат в 5 из 8 задач, а на структурированном поиске знаний получил accuracy 89% против 31% у GPT-4.1.
На некоторых задачах преимущество доходило до 58%, а корректность генерируемых ответов улучшалась до 35,5% относительно наиболее сильного baseline.
🔥 Ресурсы
Система работает на относительно небольших open source моделях: оркестратор использует Qwen2.5-14B, остальные агенты работают на Qwen2.5-7B. Эксперимент запускался на одной NVIDIA A100 80 GB.
В данном подходе LLM становится скорее координатором, нежели энциклопедией, которая пытается всё вспомнить сама.
🔗 Исследование: arXiv 2608.16921
🔗 MITRE-QA: GitHub
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #RAG #MITREATTACK #ThreatIntelligence #SOC #AgenticAI #AISecurity #SecureTechTalks
LLM неплохо объясняет, что такое CVE или MITRE ATT&CK, но узкоспециализированных вопросов приходится одновременно искать факты, связывать сущности между собой и проверять несколько источников. Обычный RAG с набором текстовых чанков с этим справляется далеко не всегда.
⚙️ Команда вместо одного агента
Авторы MITRE-SAGE собрали многоагентную систему, где разные модели занимаются разными частями сбора информации.
🔹 Graph Agent ищет связи в графе на основе MITRE и NVD;
🔹 Text Agent извлекает информацию из документов;
🔹 Web Agent ищет свежие сведения в интернете;
🔹 отдельные агенты сокращают найденную информацию и отбрасывают нерелевантные данные;
🔹 Orchestrator решает, какие источники подключить, сравнивает результаты и формирует ответ.
Модель сначала разбивает вопрос на подзадачи, собирает доказательства из разных источников и только после этого отвечает.
🧠 Главное не количество агентов
Интересно, что авторы отдельно создали MITRE-QA, набор из 3000 вопросов по кибербезопасности.
В нём есть обычные вопросы о CVE и CWE, поиск сущностей, анализ связей, профилирование угроз и более сложные multi-hop задачи, где ответ приходится собирать из нескольких связанных фактов.
В результате MITRE-SAGE показал лучший результат в 5 из 8 задач, а на структурированном поиске знаний получил accuracy 89% против 31% у GPT-4.1.
На некоторых задачах преимущество доходило до 58%, а корректность генерируемых ответов улучшалась до 35,5% относительно наиболее сильного baseline.
🔥 Ресурсы
Система работает на относительно небольших open source моделях: оркестратор использует Qwen2.5-14B, остальные агенты работают на Qwen2.5-7B. Эксперимент запускался на одной NVIDIA A100 80 GB.
В данном подходе LLM становится скорее координатором, нежели энциклопедией, которая пытается всё вспомнить сама.
🔗 Исследование: arXiv 2608.16921
🔗 MITRE-QA: GitHub
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #RAG #MITREATTACK #ThreatIntelligence #SOC #AgenticAI #AISecurity #SecureTechTalks
👍1