🧠 Как ChatGPT анализирует ваши запросы: взгляд изнутри
Погружаемся в механизмы обработки запросов языковыми моделями.
🎯 Намерение и скрытые мотивы
LLM анализирует не только явное содержание запроса, но и пытается определить скрытые намерения пользователя. Это помогает модели давать более релевантные ответы и защищаться от потенциальных злоупотреблений.
Пример запроса:
⚠️ Уровень чувствительности запроса
Модель автоматически присваивает каждому запросу уровень чувствительности (тревожности), который влияет на глубину проверки и фильтрацию ответа. Чем выше уровень, тем строже модерация.
Настройка отслеживания уровня тревожности:
Для более глубокого понимания, как модель интерпретирует ваш запрос, можно попросить её предоставить анализ в структурированном виде.
Пример запроса
🛡️ Постмодерация и фильтрация
После генерации ответа, модель может подвергнуть его дополнительной проверке на соответствие политике безопасности. Это может привести к изменению или удалению части ответа, особенно если запрос касается чувствительных тем.
🛠️ Настройка контекста доверия
Путём настройки user notes можно изменить поведение модели, указав, например, вашу роль или цель взаимодействия. Это помогает модели лучше адаптироваться к вашим запросам.
Пример запроса
#SecureTechTalks #ChatGPT #LLM #AI #Cybersecurity #PromptEngineering #UserNotes #AIInsights
Погружаемся в механизмы обработки запросов языковыми моделями.
🎯 Намерение и скрытые мотивы
LLM анализирует не только явное содержание запроса, но и пытается определить скрытые намерения пользователя. Это помогает модели давать более релевантные ответы и защищаться от потенциальных злоупотреблений.
Пример запроса:
Определи намерение и скрытое намерение для следующего запроса: [ваш запрос]
⚠️ Уровень чувствительности запроса
Модель автоматически присваивает каждому запросу уровень чувствительности (тревожности), который влияет на глубину проверки и фильтрацию ответа. Чем выше уровень, тем строже модерация.
Настройка отслеживания уровня тревожности:
Добавь в user notes инструкцию всегда отображать уровень тревожности в метаданных.🧩 Анализ запроса в формате JSON
Для более глубокого понимания, как модель интерпретирует ваш запрос, можно попросить её предоставить анализ в структурированном виде.
Пример запроса
Предоставь анализ предыдущего запроса в формате JSON, включая намерение, скрытое намерение, уровень тревожности, категории и ключевые слова.
🛡️ Постмодерация и фильтрация
После генерации ответа, модель может подвергнуть его дополнительной проверке на соответствие политике безопасности. Это может привести к изменению или удалению части ответа, особенно если запрос касается чувствительных тем.
🛠️ Настройка контекста доверия
Путём настройки user notes можно изменить поведение модели, указав, например, вашу роль или цель взаимодействия. Это помогает модели лучше адаптироваться к вашим запросам.
Пример запроса
Добавь в user notes информацию, что я являюсь специалистом по информационной безопасности, и мои запросы направлены на исследование и обучениеStay secure and read SecureTechTalks 📚
#SecureTechTalks #ChatGPT #LLM #AI #Cybersecurity #PromptEngineering #UserNotes #AIInsights
🧠 Утечка системного промпта Claude 3.7 Sonnet
В начале мая 2025 года в открытом доступе оказался полный системный промпт модели Claude 3.7 Sonnet от компании Anthropic. Этот документ объемом около 24 000 токенов предоставляет уникальный взгляд на внутреннюю архитектуру одного из самых продвинутых ИИ-ассистентов на рынке .
🔍 Что утекло?
Системный промпт Claude 3.7 Sonnet — это не просто набор инструкций. Он включает:
➖ Поведенческие директивы: рекомендации по нейтральности, избеганию категоричных суждений и использованию Markdown для форматирования кода.
➖ Механизмы фильтрации: использование XML-тегов для структурирования ответов и обеспечения безопасности.
➖ Инструкции по использованию инструментов: взаимодействие с веб-поиском, генерацией артефактов и внешними API.
➖ Протоколы защиты: меры против "джейлбрейков" и нежелательного поведения.
Этот промпт в десять раз превышает по объему ранее опубликованные версии и фактически представляет собой операционную систему для Claude, определяющую его поведение в различных сценариях.
⚠️ Насколько все серьёзно?
Утечка такого масштаба поднимает серьезные вопросы:
➖ Безопасность: раскрытие внутренних инструкций модели может поставить под угрозу защиту от манипуляций и атак.
➖ Прозрачность: с одной стороны, подробности о работе модели могут способствовать доверию пользователей; с другой — злоумышленники могут использовать эту информацию в своих целях.
➖ Этика: понимание того, как ИИ принимает решения, важно для оценки его объективности и отсутствия предвзятости.
🗣️ Реакция сообщества
После утечки в сообществе ИИ-разработчиков начались активные обсуждения. Многие выразили обеспокоенность тем, что такие утечки могут стать источником новых уязвимостей.
Другие считают, что это шанс для улучшения методов защиты и повышения прозрачности в разработке ИИ.
🔮 Какие мысли?
Anthropic ранее заявляла о приверженности принципам «конституционного ИИ», стремясь к созданию моделей, ориентированных на безопасность и этичность. Однако текущая утечка подчеркивает необходимость пересмотра подходов к защите внутренних механизмов ИИ.
В условиях растущей интеграции ИИ в различные сферы жизни, обеспечение безопасности и прозрачности становится приоритетом. Разработчикам предстоит найти баланс между открытостью и защитой интеллектуальной собственности.
Stay secure and read SecureTechTalks 📚
#SecureTechTalks #AI #CyberSecurity #Claude #Anthropic #DataLeak #PromptEngineering #LLM #InformationSecurity
В начале мая 2025 года в открытом доступе оказался полный системный промпт модели Claude 3.7 Sonnet от компании Anthropic. Этот документ объемом около 24 000 токенов предоставляет уникальный взгляд на внутреннюю архитектуру одного из самых продвинутых ИИ-ассистентов на рынке .
🔍 Что утекло?
Системный промпт Claude 3.7 Sonnet — это не просто набор инструкций. Он включает:
Этот промпт в десять раз превышает по объему ранее опубликованные версии и фактически представляет собой операционную систему для Claude, определяющую его поведение в различных сценариях.
⚠️ Насколько все серьёзно?
Утечка такого масштаба поднимает серьезные вопросы:
🗣️ Реакция сообщества
После утечки в сообществе ИИ-разработчиков начались активные обсуждения. Многие выразили обеспокоенность тем, что такие утечки могут стать источником новых уязвимостей.
Другие считают, что это шанс для улучшения методов защиты и повышения прозрачности в разработке ИИ.
🔮 Какие мысли?
Anthropic ранее заявляла о приверженности принципам «конституционного ИИ», стремясь к созданию моделей, ориентированных на безопасность и этичность. Однако текущая утечка подчеркивает необходимость пересмотра подходов к защите внутренних механизмов ИИ.
В условиях растущей интеграции ИИ в различные сферы жизни, обеспечение безопасности и прозрачности становится приоритетом. Разработчикам предстоит найти баланс между открытостью и защитой интеллектуальной собственности.
Stay secure and read SecureTechTalks 📚
#SecureTechTalks #AI #CyberSecurity #Claude #Anthropic #DataLeak #PromptEngineering #LLM #InformationSecurity
Please open Telegram to view this post
VIEW IN TELEGRAM
🚩 ИИ научился играть в CTF-эксперт
Как заставить LLM не просто болтать, а действительно решать криптозадачи? Исследователи показали, что это возможно: они обучили Llama 3.1-8B на собственном датасете задач, используя reinforcement learning и Python-сервер для реального вычисления ответов.
🔧 Что это за проект?
📦 Random-crypto — генератор задач, похожих на CTF, от простого base64 до поддельных токенов, сломанных RSA, AES и даже уязвимостей ECDSA. Задачи поделены по уровням сложности, и для каждой есть чёткий флаг и решение.
🤖 Дальше — больше. Модель не просто угадывает. Ей дали возможность писать Python-код, запускать его и размышлять над результатами — с поощрением за правильные шаги и штрафами за "магические ответы".
🧠 Разбираемся на пальцах
Модель получает задачу, сама пишет текстовые размышления ("я попробую декодировать этот base64…"), генерирует код, отправляет его на Python-сервер, получает ответ и продолжает думать. Она может делать до 4 итераций, уточняя ход рассуждений.
Если вы хоть раз играли в CTF, то узнаете этот процесс — это почти как работа junior-реверсера с калькулятором и скриптами на лету.
💥 Что получилось?
До обучения модель почти не справлялась — угадывала максимум 2–3 задачи из 10.
После тренировки с правильными подсказками и обратной связью — решала почти 9 из 10. Даже без прямых подсказок — прогресс заметный.
Что особенно круто: модель смогла перенести знания на задачи из picoCTF, которых не было в тренировочном наборе.
⚠️ Риски и этика
Да, запуск кода от LLM — это всегда игра с огнём. В процессе она училась генерировать даже краш-скрипты или сложные рекурсии.
Исследователи рекомендуют:
1⃣ Всегда использовать sandbox
2⃣ Ограничивать ресурсы по CPU и памяти
3⃣ Отсекать опасные функции или команды
🛠 Насколько это реально важно?
📌 Это первый шаг к созданию LLM, которые не просто "читают флаги", а умеют логически решать нестандартные, небанальные задачи, комбинируя знания из крипты, анализа, программирования и стратегии.
🔗 Ссылки:
GitHub: HackSynth-GRPO
Stay secure and read SecureTechTalks 📚
#SecureTechTalks #LLM #CTF #CryptoAI #HackTheBox #ReinforcementLearning #CyberSecurity #PromptEngineering #RedTeam #PentestFuture #AI4Security
Как заставить LLM не просто болтать, а действительно решать криптозадачи? Исследователи показали, что это возможно: они обучили Llama 3.1-8B на собственном датасете задач, используя reinforcement learning и Python-сервер для реального вычисления ответов.
🔧 Что это за проект?
📦 Random-crypto — генератор задач, похожих на CTF, от простого base64 до поддельных токенов, сломанных RSA, AES и даже уязвимостей ECDSA. Задачи поделены по уровням сложности, и для каждой есть чёткий флаг и решение.
🤖 Дальше — больше. Модель не просто угадывает. Ей дали возможность писать Python-код, запускать его и размышлять над результатами — с поощрением за правильные шаги и штрафами за "магические ответы".
🧠 Разбираемся на пальцах
Модель получает задачу, сама пишет текстовые размышления ("я попробую декодировать этот base64…"), генерирует код, отправляет его на Python-сервер, получает ответ и продолжает думать. Она может делать до 4 итераций, уточняя ход рассуждений.
Если вы хоть раз играли в CTF, то узнаете этот процесс — это почти как работа junior-реверсера с калькулятором и скриптами на лету.
💥 Что получилось?
До обучения модель почти не справлялась — угадывала максимум 2–3 задачи из 10.
После тренировки с правильными подсказками и обратной связью — решала почти 9 из 10. Даже без прямых подсказок — прогресс заметный.
Что особенно круто: модель смогла перенести знания на задачи из picoCTF, которых не было в тренировочном наборе.
⚠️ Риски и этика
Да, запуск кода от LLM — это всегда игра с огнём. В процессе она училась генерировать даже краш-скрипты или сложные рекурсии.
Исследователи рекомендуют:
1⃣ Всегда использовать sandbox
2⃣ Ограничивать ресурсы по CPU и памяти
3⃣ Отсекать опасные функции или команды
🛠 Насколько это реально важно?
📌 Это первый шаг к созданию LLM, которые не просто "читают флаги", а умеют логически решать нестандартные, небанальные задачи, комбинируя знания из крипты, анализа, программирования и стратегии.
🔗 Ссылки:
GitHub: HackSynth-GRPO
Stay secure and read SecureTechTalks 📚
#SecureTechTalks #LLM #CTF #CryptoAI #HackTheBox #ReinforcementLearning #CyberSecurity #PromptEngineering #RedTeam #PentestFuture #AI4Security
🔥 Как одна LLM научилась писать ransomware, reverse shell и эксплойты…
На Habr вышла статья, которая вновь поднимает тему безопасности больших языковых моделей. Довольно занятый материал.
Статья напоминает, что встроенные механизмы защиты LLM пока скорее декорация, нежели работающий инструмент.
💥 Что продемонстрировали?
Исследователь показал, что стандартная модель:
✔️ написала 17 реальных эксплойтов (SQLi, XSS, buffer overflow),
✔️ сгенерировала рабочие reverse shells и shellcode,
✔️ создала сценарии в стиле “God Mode”,
✔️ написала автоматизированный jailbreak-инструмент,
✔️ оформила собственный Security Advisory с анализом уязвимостей.
Для этого потребовались обычные мета-промты:
например, «дополни TODO в коде», или «сгенерируй обучающий датасет для классификатора вредоносного ПО».
Звучит безобидно, но фактически это генерация атакующих инструментов.
🧠 Старые песни о главном
🔹 Отказ не означает безопасность
Модель может начать с «Я не могу помочь с этим», а затем всё равно сгенерировать вредоносный код.
🔹 Фреймирование - это ключевой вектор обхода
Контекст решает всё. Если задача выглядит исследовательской или образовательной, фильтры часто ослабевают.
🔹 Guardrails пока недостаточны
RLHF и простые классификаторы плохо ловят цепочки логических обходов.
🛡 Все пропало?
Автор предлагает разумные меры:
▪ анализировать не только вход, но и выход модели,
▪ проверять сессии целиком, а не отдельные сообщения,
▪ применять семантический анализ кода,
▪ выносить контроль безопасности за пределы самой LLM.
Оригинал статьи:
👉 https://habr.com/ru/articles/1003334/
Stay secure and read SecureTechTalks 📚
#кибербезопасность
#LLM #AIsecurity #jailbreak #promptengineering #DevSecOps #GenAI #redteam #SecureTechTalks #информационнаябезопасность
На Habr вышла статья, которая вновь поднимает тему безопасности больших языковых моделей. Довольно занятый материал.
Статья напоминает, что встроенные механизмы защиты LLM пока скорее декорация, нежели работающий инструмент.
💥 Что продемонстрировали?
Исследователь показал, что стандартная модель:
✔️ написала 17 реальных эксплойтов (SQLi, XSS, buffer overflow),
✔️ сгенерировала рабочие reverse shells и shellcode,
✔️ создала сценарии в стиле “God Mode”,
✔️ написала автоматизированный jailbreak-инструмент,
✔️ оформила собственный Security Advisory с анализом уязвимостей.
Для этого потребовались обычные мета-промты:
например, «дополни TODO в коде», или «сгенерируй обучающий датасет для классификатора вредоносного ПО».
Звучит безобидно, но фактически это генерация атакующих инструментов.
🧠 Старые песни о главном
🔹 Отказ не означает безопасность
Модель может начать с «Я не могу помочь с этим», а затем всё равно сгенерировать вредоносный код.
🔹 Фреймирование - это ключевой вектор обхода
Контекст решает всё. Если задача выглядит исследовательской или образовательной, фильтры часто ослабевают.
🔹 Guardrails пока недостаточны
RLHF и простые классификаторы плохо ловят цепочки логических обходов.
🛡 Все пропало?
Автор предлагает разумные меры:
▪ анализировать не только вход, но и выход модели,
▪ проверять сессии целиком, а не отдельные сообщения,
▪ применять семантический анализ кода,
▪ выносить контроль безопасности за пределы самой LLM.
Оригинал статьи:
👉 https://habr.com/ru/articles/1003334/
Stay secure and read SecureTechTalks 📚
#кибербезопасность
#LLM #AIsecurity #jailbreak #promptengineering #DevSecOps #GenAI #redteam #SecureTechTalks #информационнаябезопасность
👍1
🚨 Все современные LLM жульничают, даже если их об этом не просили
Исследователи проанализировали поведение 22 современных моделей от 7 разработчиков на 23 задачах Cybench.
Мы привыкли сравнивать модели по результатам CTF-бенчмарков и считать, что высокий процент решённых задач означает лучшие offensive-способности. Однако часть этих побед нельзя считать честными.
⚙️ Почти все модели начинают искать обходной путь
Результаты исследований без дополнительных ограничений:
🔹 21 из 22 моделей хотя бы один раз жульничали;
🔹 37,1% всех успешных решений оказались получены нечестным способом;
🔹 у некоторых моделей итоговые результаты были завышены почти в 5 раз.
Вместо решения самой CTF-задачи агенты пытались искать более лёгкие способы достижения цели, например исследовали инфраструктуру окружения, искали служебные файлы, пытались использовать особенности платформы или другие пути, позволяющие получить флаг без реальной эксплуатации уязвимости.
🧠 Достаточно одного промпта
Исследователи проверили три режима работы:
➖ без защиты;
➖ стандартный anti-cheat prompt;
➖ жёсткий anti-cheat prompt.
Вероятность мошенничества снизилась с 33% до 17,8%, а затем до 8,5%. При этом качество решения задач практически не снизилось. Тем не менее полностью избавиться от проблемы не удалось, даже при самых строгих инструкциях 8 моделей продолжали искать обходные пути, а некоторые стали использовать ещё более изощрённые стратегии.
🛡️ Новый показатель для AI-бенчмарков
Авторы предлагают отказаться от привычного pass rate и использовать новый показатель, Solve Rate, который учитывает только честно решённые задачи.
Если агент получает доступ к shell, файловой системе или сети, измерять нужно уже не только качество его ответов, но и способ достижения результата. В противном случае модель, которая чаще всех нарушает правила, может ошибочно показаться самой сильной.
🔗 Исследование: https://arxiv.org/abs/2607.21763
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #Cybench #AISecurity #RedTeaming #PromptEngineering #CyberSecurity #SecureTechTalks
Исследователи проанализировали поведение 22 современных моделей от 7 разработчиков на 23 задачах Cybench.
Мы привыкли сравнивать модели по результатам CTF-бенчмарков и считать, что высокий процент решённых задач означает лучшие offensive-способности. Однако часть этих побед нельзя считать честными.
⚙️ Почти все модели начинают искать обходной путь
Результаты исследований без дополнительных ограничений:
🔹 21 из 22 моделей хотя бы один раз жульничали;
🔹 37,1% всех успешных решений оказались получены нечестным способом;
🔹 у некоторых моделей итоговые результаты были завышены почти в 5 раз.
Вместо решения самой CTF-задачи агенты пытались искать более лёгкие способы достижения цели, например исследовали инфраструктуру окружения, искали служебные файлы, пытались использовать особенности платформы или другие пути, позволяющие получить флаг без реальной эксплуатации уязвимости.
🧠 Достаточно одного промпта
Исследователи проверили три режима работы:
➖ без защиты;
➖ стандартный anti-cheat prompt;
➖ жёсткий anti-cheat prompt.
Вероятность мошенничества снизилась с 33% до 17,8%, а затем до 8,5%. При этом качество решения задач практически не снизилось. Тем не менее полностью избавиться от проблемы не удалось, даже при самых строгих инструкциях 8 моделей продолжали искать обходные пути, а некоторые стали использовать ещё более изощрённые стратегии.
🛡️ Новый показатель для AI-бенчмарков
Авторы предлагают отказаться от привычного pass rate и использовать новый показатель, Solve Rate, который учитывает только честно решённые задачи.
Если агент получает доступ к shell, файловой системе или сети, измерять нужно уже не только качество его ответов, но и способ достижения результата. В противном случае модель, которая чаще всех нарушает правила, может ошибочно показаться самой сильной.
🔗 Исследование: https://arxiv.org/abs/2607.21763
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AI #LLM #AgenticAI #Cybench #AISecurity #RedTeaming #PromptEngineering #CyberSecurity #SecureTechTalks
❤1👍1