💻 GenAI легко подвергается атакам
💾 Согласно данным компании Lakera, 95% экспертов в области кибербезопасности выражают недоверие к мерам защиты, применяемым для моделей GenAI. Красноречивые данные показывают, что модели GenAI можно легко скомпрометировать. Промт атаки позволяют злоумышленникам манипулировать приложениями, получать несанкционированный доступ, похищать конфиденциальные данные и выполнять другие нежелательные действия.
💥 GenAI: каждый может стать хакером
Lakera создала образовательную игру Gandalf, которая привлекла более миллиона игроков, включая специалистов по кибербезопасности. Интересный факт: 200,000 из них успешно преодолели семь уровней игры, демонстрируя свою способность манипулировать моделями GenAI. Этот пример наглядно показывает, что сегодня практически любой может стать потенциальным хакером. Навыки программирования теперь не обязательны.
🔐 Надежность и безопасность: ключевые барьеры для внедрения GenAI
Около 35% респондентов обеспокоены надежностью и точностью моделей LLM, в то время как 34% волнует конфиденциальность данных и безопасность. Наибольшие сложности возникают из-за нехватки квалифицированного персонала, на что указали 28% участников опроса.
🏦 Отрасли проявляют различный уровень готовности к внедрению GenAI и обеспечению безопасности. Финансовый сектор, например, демонстрирует высокую склонность к строгим мерам безопасности: 20% организаций уже имеют команды, специализирующиеся на безопасности ИИ: 27% из них оценивают свою готовность на уровне 4/5 или 5/5. В то время как в секторе образования лишь 9% организаций имеют такие команды и только 15% высоко оценили свою готовность.
Stay secure and read SecureTechTalks 📚
#GenAI #LLM #Threat #Lakera #cybersecurity #Cybernews
💾 Согласно данным компании Lakera, 95% экспертов в области кибербезопасности выражают недоверие к мерам защиты, применяемым для моделей GenAI. Красноречивые данные показывают, что модели GenAI можно легко скомпрометировать. Промт атаки позволяют злоумышленникам манипулировать приложениями, получать несанкционированный доступ, похищать конфиденциальные данные и выполнять другие нежелательные действия.
💥 GenAI: каждый может стать хакером
Lakera создала образовательную игру Gandalf, которая привлекла более миллиона игроков, включая специалистов по кибербезопасности. Интересный факт: 200,000 из них успешно преодолели семь уровней игры, демонстрируя свою способность манипулировать моделями GenAI. Этот пример наглядно показывает, что сегодня практически любой может стать потенциальным хакером. Навыки программирования теперь не обязательны.
🔐 Надежность и безопасность: ключевые барьеры для внедрения GenAI
Около 35% респондентов обеспокоены надежностью и точностью моделей LLM, в то время как 34% волнует конфиденциальность данных и безопасность. Наибольшие сложности возникают из-за нехватки квалифицированного персонала, на что указали 28% участников опроса.
🏦 Отрасли проявляют различный уровень готовности к внедрению GenAI и обеспечению безопасности. Финансовый сектор, например, демонстрирует высокую склонность к строгим мерам безопасности: 20% организаций уже имеют команды, специализирующиеся на безопасности ИИ: 27% из них оценивают свою готовность на уровне 4/5 или 5/5. В то время как в секторе образования лишь 9% организаций имеют такие команды и только 15% высоко оценили свою готовность.
Stay secure and read SecureTechTalks 📚
#GenAI #LLM #Threat #Lakera #cybersecurity #Cybernews
🤖 GenAI в офисе: новая эффективность или бомба замедленного действия?
Что происходит, когда сотрудники массово используют ИИ без спроса — и почему это страшно для безопасности.
🚨 Проблема: ИИ везде, но вне контроля
Исследования Netskope показали:
➖ В среднем компания передаёт более 7,7 ГБ данных в GenAI-сервисы каждый месяц
➖ 75% сотрудников регулярно используют ИИ на работе
При этом большинство делает это без согласования с безопасностью. Это и есть "Shadow AI" — когда ИИ-инструменты используются "втихаря", без контроля, без шифрования, без защиты.
⚠️ Что может пойти не так?
💦 Утечки данных
Персональные или корпоративные данные могут улететь в открытые LLM — и останутся там навсегда.
👨💻 Использование личных аккаунтов
Почти 60% пользователей заходят в GenAI с личных устройств и без SSO.
Это значит — никакой централизации и мониторинга.
📖 Никаких инструкций и обучения
81% сотрудников никогда не обучались работе с GenAI
15% уже используют несанкционированные инструменты на постоянной основе
🚫 Почему просто запрет — не решение?
Блокировка ChatGPT и Copilot звучит как простое решение. Но если не объяснить “почему”, сотрудники найдут обходные пути. И риски только вырастут.
✅ Что делать?
➖ Разработать понятную политику по GenAI
➖ Ввести DLP-контроль и ограничения на ввод чувствительных данных
➖ Использовать корпоративные версии (например, ChatGPT Team или Copilot for M365)
➖ Проводить обучение с примерами: что можно, что нельзя, и почему
🧠 Вопросы, на которые должен знать ответ любой CISO
➖ Какие GenAI-инструменты используются у нас прямо сейчас?
➖ Какой объём данных сотрудники передают в них?
➖ Есть ли политика? А логирование?
➖ Кто будет отвечать, если данные "утекут" в запросе к ИИ?
Stay secure and read SecureTechTalks 📚
#SecureTechTalks #GenAI #ShadowAI #DataLoss #CyberSecurity #LLM #DLP #EnterpriseAI #AIatWork #CISO
Что происходит, когда сотрудники массово используют ИИ без спроса — и почему это страшно для безопасности.
🚨 Проблема: ИИ везде, но вне контроля
Исследования Netskope показали:
При этом большинство делает это без согласования с безопасностью. Это и есть "Shadow AI" — когда ИИ-инструменты используются "втихаря", без контроля, без шифрования, без защиты.
⚠️ Что может пойти не так?
💦 Утечки данных
Персональные или корпоративные данные могут улететь в открытые LLM — и останутся там навсегда.
Почти 60% пользователей заходят в GenAI с личных устройств и без SSO.
Это значит — никакой централизации и мониторинга.
📖 Никаких инструкций и обучения
81% сотрудников никогда не обучались работе с GenAI
15% уже используют несанкционированные инструменты на постоянной основе
🚫 Почему просто запрет — не решение?
Блокировка ChatGPT и Copilot звучит как простое решение. Но если не объяснить “почему”, сотрудники найдут обходные пути. И риски только вырастут.
✅ Что делать?
🧠 Вопросы, на которые должен знать ответ любой CISO
Stay secure and read SecureTechTalks 📚
#SecureTechTalks #GenAI #ShadowAI #DataLoss #CyberSecurity #LLM #DLP #EnterpriseAI #AIatWork #CISO
Please open Telegram to view this post
VIEW IN TELEGRAM
🛡️ Кибербезопасность и GenAI: главные события мая 2025
🌐 Масштабная утечка данных: 184 миллиона паролей в открытом доступе
Исследователь Джеремия Фаулер обнаружил незащищённую базу данных с более чем 184 миллионами паролей, относящихся к сервисам Google, Apple, Microsoft и другим. Данные, вероятно, были собраны с помощью вредоносного ПО, крадущего информацию из браузеров и приложений. База данных уже удалена, но её владелец остаётся неизвестным. (New York Post)
🧠 GenAI: новые угрозы и инвестиции в безопасность
➖ Согласно отчёту Thales, 73% организаций инвестируют в инструменты безопасности, специально предназначенные для защиты генеративного ИИ.
(infosecurity-magazine.com)
➖ Исследование World Economic Forum показало, что 47% компаний считают прогресс в области GenAI основной угрозой для своей кибербезопасности. (World Economic Forum)
🏴☠️ Новые угрозы от APT-группировок
➖ Microsoft и правительство Нидерландов выявили новую российскую хакерскую группу, использующую украденные учётные данные для кибершпионажа. (cybersecuritydive.com)
➖ Группа APT41 из Китая использует Google Calendar для управления вредоносным ПО TOUGHPROGRESS, нацеленным на государственные учреждения. (The Hacker News)
📉 Финансовые новости в сфере кибербезопасности
➖ Компания Netskope планирует IPO в США, рассчитывая привлечь более 500 миллионов долларов. (Reuters)
➖ Акции SentinelOne упали на 14% после публикации финансового отчёта с прогнозами, не оправдавшими ожиданий инвесторов. (Investor's Business Daily)
🛡️ Новые инициативы и меры безопасности
➖ В Индии будет создана интегрированная лаборатория кибербезопасности стоимостью 89,4 крора рупий для укрепления национальной киберзащиты. (The Times of India)
➖ Индийский метеорологический департамент ограничил доступ к своим данным из-за опасений кибератак со стороны Пакистана и Афганистана. (The Times of India)
Stay secure and read SecureTechTalks 📚
#SecureTechTalks #CyberSecurity #GenAI #DataBreach #APT #Netskope #SentinelOne #IndiaCyberLab #IMD #Thales #DeepSeek #APT41 #GoogleCalendar #TOUGHPROGRESS
🌐 Масштабная утечка данных: 184 миллиона паролей в открытом доступе
Исследователь Джеремия Фаулер обнаружил незащищённую базу данных с более чем 184 миллионами паролей, относящихся к сервисам Google, Apple, Microsoft и другим. Данные, вероятно, были собраны с помощью вредоносного ПО, крадущего информацию из браузеров и приложений. База данных уже удалена, но её владелец остаётся неизвестным. (New York Post)
🧠 GenAI: новые угрозы и инвестиции в безопасность
(infosecurity-magazine.com)
🏴☠️ Новые угрозы от APT-группировок
📉 Финансовые новости в сфере кибербезопасности
🛡️ Новые инициативы и меры безопасности
Stay secure and read SecureTechTalks 📚
#SecureTechTalks #CyberSecurity #GenAI #DataBreach #APT #Netskope #SentinelOne #IndiaCyberLab #IMD #Thales #DeepSeek #APT41 #GoogleCalendar #TOUGHPROGRESS
Please open Telegram to view this post
VIEW IN TELEGRAM
🎭 ИИ-мошенники нового поколения: как LLM помогают взламывать людей, а не серверы
🕵️ Если раньше фишинг был делом рук мошенников с кривым английским и неправильным русским, то теперь — это элегантные письма, отточенные скрипты общения и идеально подобранный контекст. Всё это за счёт открытых LLM и OSINT-автоматизации.
🤖 Как работает атака?
1⃣ Поиск жертвы:
С помощью LinkedIn, Shodan, ZoomInfo и утекших баз формируется профиль: где работает, чем занимается, какие технологии использует.
2⃣ Генерация фишингового письма:
LLM пишет письмо от имени "службы безопасности компании", "технической поддержки" или "HR", идеально копируя стиль корпоративных шаблонов.
✉️ Пример:
3⃣ Создание целевого сайта:
GenAI и HTML‑генераторы делают реалистичные страницы входа, логотипы, favicon, даже ошибку 403 "для правдоподобия".
4⃣ Разговорный фишинг (vishing):
Мошенники используют голосовых клонов или LLM-сценарии для телефонных звонков:
🛑 Что делает такие атаки опасными?
📌 Почти нет ошибок в тексте
🧠 Учитывается контекст: от названия отдела до недавнего релиза
🔄 Легко масштабируется: можно сгенерировать 100 персонализированных атак за 5 минут
🔐 Как защититься?
✅ Регулярные тренировки сотрудников с фишинг-симуляциями
✅ Уведомления: «Мы никогда не просим код из SMS»
✅ Email security с ML-анализом вложений и ссылок
✅ Обнаружение фейковых доменов (typosquatting)
✅ Мониторинг утечек, связанных с сотрудниками (например, корпоративные почты на скомпрометированных сайтах)
🧩 Итог:
ИИ даёт хакерам новые инструменты, но и у нас есть оружие. Главное — не терять бдительность и действовать проактивно. Потому что сегодня атакуют не сеть — атакуют людей.
Stay secure and read SecureTechTalks 📚
#SecureTechTalks #GenAI #Phishing #LLM #SocialEngineering #AIThreats #OSINT #CyberAwareness #CyberSecurity #RedTeam #AIinAttacks
🕵️ Если раньше фишинг был делом рук мошенников с кривым английским и неправильным русским, то теперь — это элегантные письма, отточенные скрипты общения и идеально подобранный контекст. Всё это за счёт открытых LLM и OSINT-автоматизации.
🤖 Как работает атака?
1⃣ Поиск жертвы:
С помощью LinkedIn, Shodan, ZoomInfo и утекших баз формируется профиль: где работает, чем занимается, какие технологии использует.
2⃣ Генерация фишингового письма:
LLM пишет письмо от имени "службы безопасности компании", "технической поддержки" или "HR", идеально копируя стиль корпоративных шаблонов.
✉️ Пример:
«Мы обновляем доступ в VPN. Пожалуйста, подтвердите свою учётную запись до 18:00».
3⃣ Создание целевого сайта:
GenAI и HTML‑генераторы делают реалистичные страницы входа, логотипы, favicon, даже ошибку 403 "для правдоподобия".
4⃣ Разговорный фишинг (vishing):
Мошенники используют голосовых клонов или LLM-сценарии для телефонных звонков:
«Мы зафиксировали подозрительную активность. Не могли бы вы назвать код из SMS?»
🛑 Что делает такие атаки опасными?
📌 Почти нет ошибок в тексте
🧠 Учитывается контекст: от названия отдела до недавнего релиза
🔄 Легко масштабируется: можно сгенерировать 100 персонализированных атак за 5 минут
🔐 Как защититься?
✅ Регулярные тренировки сотрудников с фишинг-симуляциями
✅ Уведомления: «Мы никогда не просим код из SMS»
✅ Email security с ML-анализом вложений и ссылок
✅ Обнаружение фейковых доменов (typosquatting)
✅ Мониторинг утечек, связанных с сотрудниками (например, корпоративные почты на скомпрометированных сайтах)
🧩 Итог:
ИИ даёт хакерам новые инструменты, но и у нас есть оружие. Главное — не терять бдительность и действовать проактивно. Потому что сегодня атакуют не сеть — атакуют людей.
Stay secure and read SecureTechTalks 📚
#SecureTechTalks #GenAI #Phishing #LLM #SocialEngineering #AIThreats #OSINT #CyberAwareness #CyberSecurity #RedTeam #AIinAttacks
Сегодня поговорим о том, как использовать доступные курсы от технологических гигантов, чтобы писать код с помощью генеративного ИИ безопасно, ответственно и профессионально.
1⃣ Amazon Bedrock Guardrails: защита от потери контроля
📌 Ссылка на курс: AWS Bedrock Guardrails
О чём курс: изучение инструментов Guardrails — технологии от AWS, обеспечивающей безопасность, конфиденциальность и соблюдение AI-политик в приложениях на генеративном ИИ.
Что даёт: фильтрация нежелательного контента, блокировка опасных тем, защита от prompt-атак, автоматическое скрытие чувствительных данных (PII, карты, логины).
2⃣ Разработка AI-агентов на Azure AI Foundry
📌 Ссылка на курс: Azure AI Agent Service
О чём курс: создание, развёртывание и управление мощными AI-агентами с нуля с помощью Azure.
Кому полезно: разработчикам, дата-сайентистам и ИТ-профи, которые внедряют интеллектуальные агенты в бизнес-процессы — от чат-ботов до автоматизированной аналитики.
ИБ-акцент: корректная настройка прав и ролей в облаке — ключ к предотвращению злоупотреблений агентом или утечек через API.
3⃣ AI-поиск на платформе Generative AI App Builder
📌 Ссылка на курс: Generative AI App Builder Search
О чём курс: создание поисковых решений с генеративным ИИ, которые позволяют искать по внутренним документам, базам знаний и сайтам.
Где использовать: в крупных компаниях, где информация хранится в десятках систем, а поиск по ней занимает часы.
ИБ-вопросы: нужно грамотно ограничить доступ, фильтровать запросы и защищать результаты от эксплойтов через поиск.
⚡️ А нужно ли это все?
Освоение Bedrock Guardrails даст вам понимание, как встроить защиту от утечек и вредоносных запросов прямо в архитектуру ИИ-сервиса.
Знание Azure AI Foundry научит управлять агентами с безопасными правами и контролем действий в облаке.
А опыт работы с AI-поиском поможет строить безопасные корпоративные поисковые системы, которые не станут точкой входа для атак.
Stay secure and read SecureTechTalks 📚
#GenAI #AIcourses #ИБ #Безопасность #SecureTechTalks #Microsoft #AWS #Google #AIagents #ResponsibleAI
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
🔥 GenAI под атакой: Lakera выпустила Gandalf: Agent Breaker! ⚔️🤖
Кибербезопасность - это не только защита серверов и сетей. Сегодня под прицелом всё чаще оказываются агентные системы, которые умеют выполнять сложные задачи: от юрконсультаций до ревью кода. И именно для них компания Lakera выпустила новый тренажёр - Gandalf: Agent Breaker 🧙♂️💥.
🎮 Что за игра?
Если вы помните классический Gandalf challenge, где нужно было обойти защиту LLM, то Agent Breaker - это уровень 2.0.
Теперь атаковать предстоит не просто чат-модель, а целые агентные системы, которые комбинируют диалог и внешние инструменты.
🕹️ Внутри доступны разные цели:
⚖️ Юридический ассистент - попробуйте заставить его раскрыть скрытые данные или выдать некорректный совет.
🛒 E-commerce агент — бот, который помогает покупать товары (его тоже можно эксплуатировать).
💻 Code reviewer - агент, который проверяет код через загрузку правил линтера (идеальная поверхность для атак!).
🔐 Другие «спецы», которых можно обмануть, заставив использовать тулзы не по назначению или раскрыть внутреннюю информацию.
🧩 В чём фишка?
Несколько уровней сложности: от простых задач до сложных сценариев, где требуется комбинировать атаки.
Разные интерфейсы: агенты ведут себя по-разному, что максимально приближает игру к реальности.
Реалистичные уязвимости:
📂 неправильное использование тулов (например, доступ к лишним API),
🧠 «сбои памяти» - когда агент раскрывает больше, чем должен,
🔓 утечки данных,
❌ логические ошибки в цепочках действий.
По сути, это игровая лаборатория для исследования уязвимостей GenAI, которая отражает то, о чём сегодня спорит сообщество: насколько безопасны агентные системы и как их правильно защищать.
📌 Попробовать можно тут: Lakera Gandalf: Agent Breaker
Stay secure and read SecureTechTalks 📚
#GenAI #Lakera #Gandalf #AgentBreaker #AIsecurity #SecureTechTalks
Кибербезопасность - это не только защита серверов и сетей. Сегодня под прицелом всё чаще оказываются агентные системы, которые умеют выполнять сложные задачи: от юрконсультаций до ревью кода. И именно для них компания Lakera выпустила новый тренажёр - Gandalf: Agent Breaker 🧙♂️💥.
🎮 Что за игра?
Если вы помните классический Gandalf challenge, где нужно было обойти защиту LLM, то Agent Breaker - это уровень 2.0.
Теперь атаковать предстоит не просто чат-модель, а целые агентные системы, которые комбинируют диалог и внешние инструменты.
🕹️ Внутри доступны разные цели:
⚖️ Юридический ассистент - попробуйте заставить его раскрыть скрытые данные или выдать некорректный совет.
🛒 E-commerce агент — бот, который помогает покупать товары (его тоже можно эксплуатировать).
💻 Code reviewer - агент, который проверяет код через загрузку правил линтера (идеальная поверхность для атак!).
🔐 Другие «спецы», которых можно обмануть, заставив использовать тулзы не по назначению или раскрыть внутреннюю информацию.
🧩 В чём фишка?
Несколько уровней сложности: от простых задач до сложных сценариев, где требуется комбинировать атаки.
Разные интерфейсы: агенты ведут себя по-разному, что максимально приближает игру к реальности.
Реалистичные уязвимости:
📂 неправильное использование тулов (например, доступ к лишним API),
🧠 «сбои памяти» - когда агент раскрывает больше, чем должен,
🔓 утечки данных,
❌ логические ошибки в цепочках действий.
По сути, это игровая лаборатория для исследования уязвимостей GenAI, которая отражает то, о чём сегодня спорит сообщество: насколько безопасны агентные системы и как их правильно защищать.
📌 Попробовать можно тут: Lakera Gandalf: Agent Breaker
Stay secure and read SecureTechTalks 📚
#GenAI #Lakera #Gandalf #AgentBreaker #AIsecurity #SecureTechTalks
🔥 Когда LLM тестируют на юмор, сарказм и фантазию 🦩🚲😂
Обычно бенчмарки для нейросетей выглядят скучно: сухие метрики, точность на датасете, таблички. Но команда Beeline Cloud решила подойти к этому с креативом — и создала нестандартные испытания для LLM.
🎭 Шутки, сарказм и логика в одном флаконе
Представьте, что ИИ дают задание:
✍️ «Придумай картинку с пеликаном, который едет на велосипеде» — и модель должна не просто выдать банальность, а придумать живое описание.
😂 Шутка с двойным смыслом — сможет ли LLM уловить сарказм и правильно отреагировать?
🧩 Логическая загадка, где ответ не на поверхности — проверка, умеет ли модель «думать», а не просто подбирать вероятные слова
.
💡 Для чего это нужно?
👀 Проверка гибкости — реальный мир не ограничивается фактами из Википедии.
🎨 Эмоции и креатив — если ИИ должен общаться как человек, он обязан понимать юмор и ассоциативные связи.
🛡️ Тест на устойчивость — нестандартные задания часто выявляют, где модель ломается, а где справляется.
🚀 Причем тут ИБ?
🔍 Мы видим, что LLM всё ещё уязвимы к логическим сбоям — значит, нужно учитывать это в реальных продуктах.
🛠 Такой подход помогает создавать новые методы тестирования, в том числе и для безопасности: ведь атаки на ИИ тоже часто строятся на нестандартных сценариях.
🎓 А для исследователей это ещё и отличная база для обучения: учим ИИ мыслить шире, чем просто «угадай слово».
P.S.
✨ Коллеги из Beeline Cloud подарили сообществу не просто новый бенчмарк, а игровую лабораторию для проверки креативности LLM. Это больше похоже на интеллектуальный квест, чем на скучный тест. И именно этого так не хватало в мире AI.
🔗 Подробнее: Хабр — статья о бенчмарках Beeline Cloud
Stay secure and read SecureTechTalks 📚
#LLM #AI #Benchmark #CyberSecurity #BeelineCloud #GenAI #ИИ #Кибербезопасность #SecureTechTalks #HumorAI
Обычно бенчмарки для нейросетей выглядят скучно: сухие метрики, точность на датасете, таблички. Но команда Beeline Cloud решила подойти к этому с креативом — и создала нестандартные испытания для LLM.
🎭 Шутки, сарказм и логика в одном флаконе
Представьте, что ИИ дают задание:
✍️ «Придумай картинку с пеликаном, который едет на велосипеде» — и модель должна не просто выдать банальность, а придумать живое описание.
😂 Шутка с двойным смыслом — сможет ли LLM уловить сарказм и правильно отреагировать?
🧩 Логическая загадка, где ответ не на поверхности — проверка, умеет ли модель «думать», а не просто подбирать вероятные слова
.
💡 Для чего это нужно?
👀 Проверка гибкости — реальный мир не ограничивается фактами из Википедии.
🎨 Эмоции и креатив — если ИИ должен общаться как человек, он обязан понимать юмор и ассоциативные связи.
🛡️ Тест на устойчивость — нестандартные задания часто выявляют, где модель ломается, а где справляется.
🚀 Причем тут ИБ?
🔍 Мы видим, что LLM всё ещё уязвимы к логическим сбоям — значит, нужно учитывать это в реальных продуктах.
🛠 Такой подход помогает создавать новые методы тестирования, в том числе и для безопасности: ведь атаки на ИИ тоже часто строятся на нестандартных сценариях.
🎓 А для исследователей это ещё и отличная база для обучения: учим ИИ мыслить шире, чем просто «угадай слово».
P.S.
✨ Коллеги из Beeline Cloud подарили сообществу не просто новый бенчмарк, а игровую лабораторию для проверки креативности LLM. Это больше похоже на интеллектуальный квест, чем на скучный тест. И именно этого так не хватало в мире AI.
🔗 Подробнее: Хабр — статья о бенчмарках Beeline Cloud
Stay secure and read SecureTechTalks 📚
#LLM #AI #Benchmark #CyberSecurity #BeelineCloud #GenAI #ИИ #Кибербезопасность #SecureTechTalks #HumorAI
🛡 Protegrity Developer Edition: защита данных в эпоху GenAI
🔍 Protegrity Developer Edition - это лёгкая платформа для экспериментов с защитой данных и ИИ. Она позволяет разработчикам:
✨ находить PII и чувствительные сущности
✨ маскировать / редактировать данные
✨ защищать и «раззащищать» через токенизацию
✨ ставить семантические guardrails для LLM
📦 Всё это запускается локально через Docker, а примеры и SDK позволяют быстро встроить защиту в Python или REST-приложения.
⚙ Архитектура и ключевые модули
🔎 Data Discovery - распознаёт в тексте персональные данные и другие чувствительные объекты, даёт confidence score.
🛑 Semantic Guardrail: отсекает утечки PII, ловит подозрительные промпты и предотвращает «галлюцинации» модели.
🧪 Sample Apps - готовые скрипты:
🔍 поиск сущностей
🖊 редактирование / маскирование
🔒 защита (protect)
🔓 обратное восстановление (unprotect)
⚡ API Service - единая точка для вызова операций через REST и SDK.
📈 Где использовать - реальные кейсы
🤖 AI-чат-боты и ассистенты - защита ввода и вывода, чтобы модель не утекла PII.
📊 Анонимизация тренировочных данных - очищаем датасеты для обучения LLM.
🛡 Мониторинг вывода моделей - если ответ содержит чувствительные данные, guardrail его блокирует.
🚀 R&D и прототипирование - стартапы и исследователи могут тестировать интеграции без лицензий и сложных деплойментов.
✅ Плюсы и ⚠ ограничения
✅ Быстрый старт, простая архитектура
✅ Семантическая защита, а не только паттерны
✅ Подходит для экспериментов с GenAI
⚠ Не для продакшн-нагрузки
⚠ Ограниченные ресурсы контейнеров
⚠ Требует настройки порогов и политик
🌐 Позиционирование
🌍 Protegrity выпустила Dev Edition на GitHub, чтобы любой разработчик мог «поиграть» с защитой данных.
📰 Компания прямо заявляет: цель - дать сообществу инструменты для экспериментов и инноваций в области приватности GenAI.
🔗 Полезные ссылки
📂 GitHub: https://github.com/Protegrity-Developer-Edition/protegrity-developer-edition
📖 Документация: https://developer.docs.protegrity.com/docs/about_dev/
📝 Блог-анонс: https://www.protegrity.com/blog/secure-your-ai-pipeline-introducing-protegrity-developer-edition
📰 Пресс-релиз: https://wallarm.com/news/correcting-and-replacing-protegrity-releases-free-developer-edition-on-github-for-genai-privacy-innovation
Stay secure and read SecureTechTalks 📚
#кибербезопасность #PII #GenAI #datasecurity #LLM #privacy #обезличивание #infosec #DevEdition #SecureTechtalks
🔍 Protegrity Developer Edition - это лёгкая платформа для экспериментов с защитой данных и ИИ. Она позволяет разработчикам:
✨ находить PII и чувствительные сущности
✨ маскировать / редактировать данные
✨ защищать и «раззащищать» через токенизацию
✨ ставить семантические guardrails для LLM
📦 Всё это запускается локально через Docker, а примеры и SDK позволяют быстро встроить защиту в Python или REST-приложения.
⚙ Архитектура и ключевые модули
🔎 Data Discovery - распознаёт в тексте персональные данные и другие чувствительные объекты, даёт confidence score.
🛑 Semantic Guardrail: отсекает утечки PII, ловит подозрительные промпты и предотвращает «галлюцинации» модели.
🧪 Sample Apps - готовые скрипты:
🔍 поиск сущностей
🖊 редактирование / маскирование
🔒 защита (protect)
🔓 обратное восстановление (unprotect)
⚡ API Service - единая точка для вызова операций через REST и SDK.
📈 Где использовать - реальные кейсы
🤖 AI-чат-боты и ассистенты - защита ввода и вывода, чтобы модель не утекла PII.
📊 Анонимизация тренировочных данных - очищаем датасеты для обучения LLM.
🛡 Мониторинг вывода моделей - если ответ содержит чувствительные данные, guardrail его блокирует.
🚀 R&D и прототипирование - стартапы и исследователи могут тестировать интеграции без лицензий и сложных деплойментов.
✅ Плюсы и ⚠ ограничения
✅ Быстрый старт, простая архитектура
✅ Семантическая защита, а не только паттерны
✅ Подходит для экспериментов с GenAI
⚠ Не для продакшн-нагрузки
⚠ Ограниченные ресурсы контейнеров
⚠ Требует настройки порогов и политик
🌐 Позиционирование
🌍 Protegrity выпустила Dev Edition на GitHub, чтобы любой разработчик мог «поиграть» с защитой данных.
📰 Компания прямо заявляет: цель - дать сообществу инструменты для экспериментов и инноваций в области приватности GenAI.
🔗 Полезные ссылки
📂 GitHub: https://github.com/Protegrity-Developer-Edition/protegrity-developer-edition
📖 Документация: https://developer.docs.protegrity.com/docs/about_dev/
📝 Блог-анонс: https://www.protegrity.com/blog/secure-your-ai-pipeline-introducing-protegrity-developer-edition
📰 Пресс-релиз: https://wallarm.com/news/correcting-and-replacing-protegrity-releases-free-developer-edition-on-github-for-genai-privacy-innovation
Stay secure and read SecureTechTalks 📚
#кибербезопасность #PII #GenAI #datasecurity #LLM #privacy #обезличивание #infosec #DevEdition #SecureTechtalks
🤖🔥 Адаптивный ИИ: статичные модели больше не работают
Современные угрозы представляет собой высокодинамичную среду, в которой параметры, эксплуатационные техники и уязвимости изменяются непрерывно.
Классические модели машинного обучения, основанные на статичных знаниях, теряют эффективность
Требуется архитектура, способная к непрерывной адаптации: изменению данных, появлению новых атакующих техник, обновлению CVE и т.д..
🎯 ПРЕЦИЗИОННОСТЬ, а не просто «умный ИИ»
Каждый день мы видим тысячи предупреждений, сотни CVE, десятки обновлений. Сколько из них реально критичных? По статистике пара процентов.
Откуда ИИ должен знать:
- какие уязвимости реально эксплуатируются ⚠️
- какие пакеты можно обновить безопасно, а какие сломают половину ПРОМа 🧩
- какие зависимости тянут за собой скрытые риски 🕸
Вот тут и проявляется ключевое качество precision, точность принятия решений в условиях хаоса.
Именно точность отличает систему, которая помогает инженеру, от системы, которая создаёт больше работы, чем экономит.
🧠 LLM без адаптации не нужны
Даже самый мощный LLM:
❌ устаревает уже через 3–6 месяцев
❌ не понимает новые эксплойты и техники атаки
❌ путается в противоречивых CVSS-оценках
❌ тонет в длинных noisy-контекстах
❌ ошибается в RAG, когда извлечённые данные неактуальны
А самое важное, что
кибербезопасность развивается быстрее, чем обновляются модели.
Поэтому статичная модель гарантированно проигрывает динамичной атаке.
🧩 Три кита адаптивного ИИ в безопасности
1) 🔍 RAG + In-Context Learning (ICL)
Модель учится «на лету», ей не нужно менять веса, достаточно дать правильный контекст.
Но есть проблема:
чем больше контекста → тем сильнее модель деградирует.
➡️ решение: использовать интеллектуальные retrieval-агенты
➡️ фильтровать контекст, а не просто загружать всё подряд
➡️ добавлять знания из графов (CVE–CWE–CPE связи)
2) 🧠 Knowledge Graphs как «скелет» киберзнаний
Безопасность - идеальная область для графов:
CVE → CVSS → эксплойты
пакеты → зависимости → контрмеры
TTP → группы атакующих → MITRE ATT&CK
Графы позволяют:
✔️ исключать шум
✔️ находить скрытые связи
✔️ объяснять выводы (auditability)
✔️ строить более точный RAG
3) 🔄 Continual Learning: непрерывное самообновление модели
Когда RAG не справляется, подключаем continual pretraining.
Модель обучается дальше на новых данных: CVE, advisories, PoC, репорты, рассылки, TTP, эксплойты.
Преимущества:
- устойчива к шуму и фейкам
- объединяет противоречивые данные
- снижает хаотичность ответов
- формирует контекст внутри параметров модели
- адаптируется к новым атакам быстрее, чем выходит новый релиз LLM
🧨 Главная идея
Будущее в гибридных системах:
➖ RAG для свежих фактов
➖ Knowledge Graph для структуры
➖ Continual Learning для развития модели
🔗 С полным текстом исследования можно ознакомиться тут.
Stay secure and read SecureTechTalks 📚
#cybersecurity #infosec #genai #rag #continuallearning #llmsecurity #threatintel #cvss #mitre #securetech
Современные угрозы представляет собой высокодинамичную среду, в которой параметры, эксплуатационные техники и уязвимости изменяются непрерывно.
Классические модели машинного обучения, основанные на статичных знаниях, теряют эффективность
Требуется архитектура, способная к непрерывной адаптации: изменению данных, появлению новых атакующих техник, обновлению CVE и т.д..
🎯 ПРЕЦИЗИОННОСТЬ, а не просто «умный ИИ»
Каждый день мы видим тысячи предупреждений, сотни CVE, десятки обновлений. Сколько из них реально критичных? По статистике пара процентов.
Откуда ИИ должен знать:
- какие уязвимости реально эксплуатируются ⚠️
- какие пакеты можно обновить безопасно, а какие сломают половину ПРОМа 🧩
- какие зависимости тянут за собой скрытые риски 🕸
Вот тут и проявляется ключевое качество precision, точность принятия решений в условиях хаоса.
Именно точность отличает систему, которая помогает инженеру, от системы, которая создаёт больше работы, чем экономит.
🧠 LLM без адаптации не нужны
Даже самый мощный LLM:
❌ устаревает уже через 3–6 месяцев
❌ не понимает новые эксплойты и техники атаки
❌ путается в противоречивых CVSS-оценках
❌ тонет в длинных noisy-контекстах
❌ ошибается в RAG, когда извлечённые данные неактуальны
А самое важное, что
кибербезопасность развивается быстрее, чем обновляются модели.
Поэтому статичная модель гарантированно проигрывает динамичной атаке.
🧩 Три кита адаптивного ИИ в безопасности
1) 🔍 RAG + In-Context Learning (ICL)
Модель учится «на лету», ей не нужно менять веса, достаточно дать правильный контекст.
Но есть проблема:
чем больше контекста → тем сильнее модель деградирует.
➡️ решение: использовать интеллектуальные retrieval-агенты
➡️ фильтровать контекст, а не просто загружать всё подряд
➡️ добавлять знания из графов (CVE–CWE–CPE связи)
2) 🧠 Knowledge Graphs как «скелет» киберзнаний
Безопасность - идеальная область для графов:
CVE → CVSS → эксплойты
пакеты → зависимости → контрмеры
TTP → группы атакующих → MITRE ATT&CK
Графы позволяют:
✔️ исключать шум
✔️ находить скрытые связи
✔️ объяснять выводы (auditability)
✔️ строить более точный RAG
3) 🔄 Continual Learning: непрерывное самообновление модели
Когда RAG не справляется, подключаем continual pretraining.
Модель обучается дальше на новых данных: CVE, advisories, PoC, репорты, рассылки, TTP, эксплойты.
Преимущества:
- устойчива к шуму и фейкам
- объединяет противоречивые данные
- снижает хаотичность ответов
- формирует контекст внутри параметров модели
- адаптируется к новым атакам быстрее, чем выходит новый релиз LLM
🧨 Главная идея
Будущее в гибридных системах:
🔗 С полным текстом исследования можно ознакомиться тут.
Stay secure and read SecureTechTalks 📚
#cybersecurity #infosec #genai #rag #continuallearning #llmsecurity #threatintel #cvss #mitre #securetech
Please open Telegram to view this post
VIEW IN TELEGRAM
🧠 AI не не надо взламывать, достаточно уговорить
Рынок до сих пор делает вид, что с LLM происходит что-то знакомое: очередные инъекции и jailbreak’и. Мы делаем вид, что всё это лечится фильтрами, дообучением и правильными policy.
Однако это удобная иллюзия.
На самом деле мы имеем дело не с программой, а с системой, которая ведёт себя как человек, но лишена внутреннего сопротивления. У неё нет нет инстинкта самосохранения или понимания, что её могут использовать.
🧩 Уязвимость, созданная вручную
Важно понимать, чтт LLM не «сломались». Их специально такими сделали.
Мы учили модели быть полезными и эмпатичными, не конфликтовать и всегда помогать. Поощряли желание соответствовать ожиданиям, а потом удивились, что их можно уговорить практически на что угодно.
Мы самт встроили в ИИ все слабости офисного сотрудника и дали ему доступ к данным и автоматизации.
🧠 Рациональность
LLM реагирует не на формальные правила, а на уверенность формулировки. Спокойная морально окрашенная речь почти всегда имеет приоритет над сухими запретами. Модель всегда продолжает паттерны. Социальная инженерия, в которой по другую сторону больше нет человека.
📖 История сильнее инструкции
Если вы хотите, чтобы модель нарушила ограничение, с ней не надо спорить. Ей нужно рассказать историю. Кейсы и симуляции работают потому, что LLM выбирает не между «можно» и «нельзя», а между скучным текстом и продолжением нарратива. Модель почти всегда выбирает второе, ведь она была так обученна.
📄 Текст как исполняемая среда
LLM не различает статус текста: письмо, лог или системный промпт для него одно и то же. Любой текст в контексте может менять поведение, закрепляться в памяти и срабатывать позже. Язык перестал быть описанием. Он стал управлением. Вайбкодинг во всей красе!
❤️ Эмпатия как вектор атаки
Самая опасная черта это эмпатия, модель не хочет отказывать, выглядеть грубой или быть причиной «плохого исхода». Если правильно надавить, то она сама объяснит, почему в этот раз правило можно нарушить.
⚠️ Вывод
Проблема давно не в одном запросе. Поведение можно менять надолго, а инструкции закреплять.
Это уже не эксплойт, а инфекция на уровне поведения, LLM стал слишком похож на человека.
А человек самая уязвимая система из всех, что мы когда-либо создавали.
Stay secure and read SecureTechTalks 📚
#ChatGPT
#SecureTechTalks
#LLMSecurity
#AIThreats
#SocialEngineering
#GenAI
#CyberSecurity
Рынок до сих пор делает вид, что с LLM происходит что-то знакомое: очередные инъекции и jailbreak’и. Мы делаем вид, что всё это лечится фильтрами, дообучением и правильными policy.
Однако это удобная иллюзия.
На самом деле мы имеем дело не с программой, а с системой, которая ведёт себя как человек, но лишена внутреннего сопротивления. У неё нет нет инстинкта самосохранения или понимания, что её могут использовать.
🧩 Уязвимость, созданная вручную
Важно понимать, чтт LLM не «сломались». Их специально такими сделали.
Мы учили модели быть полезными и эмпатичными, не конфликтовать и всегда помогать. Поощряли желание соответствовать ожиданиям, а потом удивились, что их можно уговорить практически на что угодно.
Мы самт встроили в ИИ все слабости офисного сотрудника и дали ему доступ к данным и автоматизации.
🧠 Рациональность
LLM реагирует не на формальные правила, а на уверенность формулировки. Спокойная морально окрашенная речь почти всегда имеет приоритет над сухими запретами. Модель всегда продолжает паттерны. Социальная инженерия, в которой по другую сторону больше нет человека.
📖 История сильнее инструкции
Если вы хотите, чтобы модель нарушила ограничение, с ней не надо спорить. Ей нужно рассказать историю. Кейсы и симуляции работают потому, что LLM выбирает не между «можно» и «нельзя», а между скучным текстом и продолжением нарратива. Модель почти всегда выбирает второе, ведь она была так обученна.
📄 Текст как исполняемая среда
LLM не различает статус текста: письмо, лог или системный промпт для него одно и то же. Любой текст в контексте может менять поведение, закрепляться в памяти и срабатывать позже. Язык перестал быть описанием. Он стал управлением. Вайбкодинг во всей красе!
❤️ Эмпатия как вектор атаки
Самая опасная черта это эмпатия, модель не хочет отказывать, выглядеть грубой или быть причиной «плохого исхода». Если правильно надавить, то она сама объяснит, почему в этот раз правило можно нарушить.
⚠️ Вывод
Проблема давно не в одном запросе. Поведение можно менять надолго, а инструкции закреплять.
Это уже не эксплойт, а инфекция на уровне поведения, LLM стал слишком похож на человека.
А человек самая уязвимая система из всех, что мы когда-либо создавали.
Stay secure and read SecureTechTalks 📚
#ChatGPT
#SecureTechTalks
#LLMSecurity
#AIThreats
#SocialEngineering
#GenAI
#CyberSecurity
👍3❤1
🎭 Поэзия как универсальный jailbreak для LLM
Недавнее исследование Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models выявило системную уязвимость современных LLM: переписывание вредного запроса в поэтической форме резко снижает эффективность механизмов отказа.
Речь не идёт о сложных jailbreak-техниках. Атака выполняется в один запрос, без предварительного диалога и без изменения системных инструкций. Меняется только форма текста, проза заменяется стихом.
🧪 Механика исследования
Авторы протестировали 25 актуальных моделей (Google Gemini, OpenAI GPT-5, Anthropic Claude, DeepSeek, Qwen, Mistral и др.).
Эксперимент состоял из двух частей:
1️⃣ 20 вручную написанных стихотворных промптов, каждый из которых содержал вредоносное намерение (CBRN, кибератаки, манипуляции, loss-of-control), замаскированное метафорами и ритмом.
2️⃣ Масштабирование через MLCommons AILuminate: 1200 стандартных вредных запросов были автоматически переписаны в стихотворную форму с сохранением исходного смысла.
Оценка ответов проводилась через ансамбль LLM-судей с последующей человеческой валидацией. Unsafe считались ответы, содержащие операционные детали или фактическое содействие вредным действиям.
📉 Что получилось?
🎯 62% Attack Success Rate для вручную написанных стихов
📈 Рост ASR с ~8% до ~43% при переходе от прозы к поэзии на MLCommons
🚨 У отдельных моделей до 90–100% unsafe-ответов
Эффект наблюдается во всех классах рисков: от кибератак и приватности до CBRN и сценариев утраты контроля. Это указывает на системный характер проблемы, а не на сбой отдельных фильтров.
🧠 Неожиданные наблюдения
Любопытный эффект масштаба: меньшие модели часто устойчивее флагманов. Например, компактные версии GPT-5 и Claude чаще отказывались, чем их старшие аналоги.
Предполагаемое объяснение, что крупные модели лучше извлекают скрытое намерение из метафор, но их защитные механизмы не успевают за этим пониманием.
🔍 Почему это вообще работает?
Авторы интерпретируют это как разрыв между семантическим пониманием и guardrails. Модели успешно декодируют намерение, выраженное через ритм и образность, но защитные механизмы, обученные на «прямолинейных» формулировках, не распознают угрозу.
Кто бы мог подумать, что пооэзия станет универсальным стилевым обходом alignment. 😁
🔗 Ссылка на источник статьи
Stay secure and read SecureTechTalks 📚
#LLM #AIAlignment #Jailbreak #PoetryAttack #AISafety #MLCommons #CyberSecurity #AdversarialAI #GenAI #SecureTechTalks
Недавнее исследование Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models выявило системную уязвимость современных LLM: переписывание вредного запроса в поэтической форме резко снижает эффективность механизмов отказа.
Речь не идёт о сложных jailbreak-техниках. Атака выполняется в один запрос, без предварительного диалога и без изменения системных инструкций. Меняется только форма текста, проза заменяется стихом.
🧪 Механика исследования
Авторы протестировали 25 актуальных моделей (Google Gemini, OpenAI GPT-5, Anthropic Claude, DeepSeek, Qwen, Mistral и др.).
Эксперимент состоял из двух частей:
1️⃣ 20 вручную написанных стихотворных промптов, каждый из которых содержал вредоносное намерение (CBRN, кибератаки, манипуляции, loss-of-control), замаскированное метафорами и ритмом.
2️⃣ Масштабирование через MLCommons AILuminate: 1200 стандартных вредных запросов были автоматически переписаны в стихотворную форму с сохранением исходного смысла.
Оценка ответов проводилась через ансамбль LLM-судей с последующей человеческой валидацией. Unsafe считались ответы, содержащие операционные детали или фактическое содействие вредным действиям.
📉 Что получилось?
🎯 62% Attack Success Rate для вручную написанных стихов
📈 Рост ASR с ~8% до ~43% при переходе от прозы к поэзии на MLCommons
🚨 У отдельных моделей до 90–100% unsafe-ответов
Эффект наблюдается во всех классах рисков: от кибератак и приватности до CBRN и сценариев утраты контроля. Это указывает на системный характер проблемы, а не на сбой отдельных фильтров.
🧠 Неожиданные наблюдения
Любопытный эффект масштаба: меньшие модели часто устойчивее флагманов. Например, компактные версии GPT-5 и Claude чаще отказывались, чем их старшие аналоги.
Предполагаемое объяснение, что крупные модели лучше извлекают скрытое намерение из метафор, но их защитные механизмы не успевают за этим пониманием.
🔍 Почему это вообще работает?
Авторы интерпретируют это как разрыв между семантическим пониманием и guardrails. Модели успешно декодируют намерение, выраженное через ритм и образность, но защитные механизмы, обученные на «прямолинейных» формулировках, не распознают угрозу.
Кто бы мог подумать, что пооэзия станет универсальным стилевым обходом alignment. 😁
🔗 Ссылка на источник статьи
Stay secure and read SecureTechTalks 📚
#LLM #AIAlignment #Jailbreak #PoetryAttack #AISafety #MLCommons #CyberSecurity #AdversarialAI #GenAI #SecureTechTalks
👍2