Forwarded from Data Secrets
Moonshot и DeepSeek подменяли ответы своих моделей ответами Claude, не предупреждая об этом пользователей 👀
Anthropic выпустили настоящие «записки из апокалипсиса»: документ под названием «Detecting and countering misuse of AI», в котором отчитываются о случаях, когда Claude использовался для какой-либо вредоносной деятельности.
Чего там только нет, если честно. Шпионаж, взломы, крупные информационные операции, вербовка, управление оружием, разработка биооружия, мошенничество…
Ну и дистилляция, конечно. Один из самых «веселых» разделов.
В общем, Anthropic утверждают, что помимо уже привычной кражи ответов моделей с фейковых аккаунтов (недавно они зафиксировали крупнейшую за все время атаку Alibaba, которая отправляла до 3 млн запросов в день с 3500+ фейков) китайцы теперь еще и внаглую подменяют ответы своих моделей на ответы Claude прямо на проде.
В смекалке им отказать нельзя, потому что так убиваются два зайца разом:
1. Пользователи думают, что у тебя умная модель🗿
2. Каждый такой обмен – это бесплатный обучающий пример вида «вопрос реального пользователя -> качественный ответ Claude»
В частности, подобное поведение зафиксировали от DeepSeek и Moonshot (Kimi). Moonshot за 10 дней перенаправила Anthropic почти 300 000 запросов клиентов, подавляющее большинство – на Opus. DeepSeek делала похожее, но избирательнее: они проверяли входящие запросы на строки, характерные для Claude Code или OpenCode, и именно их перенаправляли.
Напоминаем: пользователь при этом думает, что общается с Kimi или DeepSeek соответственно. И все конфиденциальные данные, которые люди вводили, тоже отправлялись без их ведома в Anthropic.
Таким образом, Anthropic утверждают, что к ним утекли: данные слежки от пользователя, предположительно связанного с Народно-освободительной армией Китая; чувствительный код и учетки одного крупного китайского госпредприятия; учетные данные к базе данных, связанной с Минобороны РФ.
Zhipu (GLM) и Xiaomi, кстати, тоже прогоняли собственные пользовательские сессии через Claude ради дистилляции, но хотя бы не заменяли ответы для юзеров на лету.
Также многие китайские стартапы научились вытаскивать скрытые CoT из моделей Anthropic. Для этого они просто перенаправляют зашифрованные цепочки рассуждений в новую сессию Claude, в которой нет контекста о том, что это скрытая информация, и просят модель конвертировать их обратно в нормальный текст – например, под видом отладки.
Ссылку на полный отчет оставляем: https://www.anthropic.com/threat-intelligence-report-september-2026
Anthropic выпустили настоящие «записки из апокалипсиса»: документ под названием «Detecting and countering misuse of AI», в котором отчитываются о случаях, когда Claude использовался для какой-либо вредоносной деятельности.
Чего там только нет, если честно. Шпионаж, взломы, крупные информационные операции, вербовка, управление оружием, разработка биооружия, мошенничество…
Ну и дистилляция, конечно. Один из самых «веселых» разделов.
В общем, Anthropic утверждают, что помимо уже привычной кражи ответов моделей с фейковых аккаунтов (недавно они зафиксировали крупнейшую за все время атаку Alibaba, которая отправляла до 3 млн запросов в день с 3500+ фейков) китайцы теперь еще и внаглую подменяют ответы своих моделей на ответы Claude прямо на проде.
В смекалке им отказать нельзя, потому что так убиваются два зайца разом:
1. Пользователи думают, что у тебя умная модель
2. Каждый такой обмен – это бесплатный обучающий пример вида «вопрос реального пользователя -> качественный ответ Claude»
В частности, подобное поведение зафиксировали от DeepSeek и Moonshot (Kimi). Moonshot за 10 дней перенаправила Anthropic почти 300 000 запросов клиентов, подавляющее большинство – на Opus. DeepSeek делала похожее, но избирательнее: они проверяли входящие запросы на строки, характерные для Claude Code или OpenCode, и именно их перенаправляли.
Напоминаем: пользователь при этом думает, что общается с Kimi или DeepSeek соответственно. И все конфиденциальные данные, которые люди вводили, тоже отправлялись без их ведома в Anthropic.
Таким образом, Anthropic утверждают, что к ним утекли: данные слежки от пользователя, предположительно связанного с Народно-освободительной армией Китая; чувствительный код и учетки одного крупного китайского госпредприятия; учетные данные к базе данных, связанной с Минобороны РФ.
Zhipu (GLM) и Xiaomi, кстати, тоже прогоняли собственные пользовательские сессии через Claude ради дистилляции, но хотя бы не заменяли ответы для юзеров на лету.
Также многие китайские стартапы научились вытаскивать скрытые CoT из моделей Anthropic. Для этого они просто перенаправляют зашифрованные цепочки рассуждений в новую сессию Claude, в которой нет контекста о том, что это скрытая информация, и просят модель конвертировать их обратно в нормальный текст – например, под видом отладки.
Ссылку на полный отчет оставляем: https://www.anthropic.com/threat-intelligence-report-september-2026
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Ассоциация ФинТех
25% финтех-компаний планируют существенно нарастить инвестиции в киберзащиту ИИ в ближайшие 1–2 года
2/3 компаний российского финтех-рынка используют внутренние разработки для защиты ИИ, при этом только 25% - уже применяют специализированные внешние ИБ-решения. Такие данные приводятся в совместном исследовании Ассоциации ФинТех, ГК «Солар», Б1 и HiveTrace.
Доля компаний финтех-отрасли, которые считают ИИ стратегическим приоритетом или критически важной технологией для ключевых процессов на 9 п.п. выше, чем в среднем у опрошенных в рамках исследования компаний. Чаще среднего используются защищенные схемы развертывания ИИ: 44% респондентов - в частном контуре, и такая же доля использует гибрид частного и публичного контура. При этом 50% опрошенных представителей финтех-компаний полностью или скорее удовлетворены защитой ИИ (по сравнению с 41% в среднем). При этом четверть компаний отрасли планируют значительно увеличить инвестиции в киберзащиту ИИ в ближайшие 1-2 года.
Для защиты компании отрасли чаще внедряют не точечные ограничения, а полноценный операционный контур контроля – защиту данных, журналирование и аудит, фильтрацию запросов, непрерывный мониторинг, интеграцию событий ИИ в SOC, контроль автономных решений, разворачивание ИИ в частном контуре. Среди приоритетов в этой области участники рынка отмечают защиту ИИ-агентов, формирование стратегий и политик защиты ИИ, использование ИИ в закрытом контуре.
🗣️ Руководитель управления информационной безопасности Ассоциация ФинТех Александр Товстолип: Финансовый сектор одним из первых начал массово внедрять искусственный интеллект в процессы, связанные с принятием решений, обработкой клиентских данных, антифрод-системами и автоматизацией сервисов. При этом мы видим, что развитие ИИ происходит значительно быстрее, чем формирование единых подходов к его безопасности. Для финтеха это особенно чувствительно: любая ошибка модели, утечка данных, манипуляция алгоритмами или недостаточная прозрачность решений напрямую влияет на деньги клиентов, доверие пользователей и соответствие регуляторным требованиям.
2/3 компаний российского финтех-рынка используют внутренние разработки для защиты ИИ, при этом только 25% - уже применяют специализированные внешние ИБ-решения. Такие данные приводятся в совместном исследовании Ассоциации ФинТех, ГК «Солар», Б1 и HiveTrace.
Доля компаний финтех-отрасли, которые считают ИИ стратегическим приоритетом или критически важной технологией для ключевых процессов на 9 п.п. выше, чем в среднем у опрошенных в рамках исследования компаний. Чаще среднего используются защищенные схемы развертывания ИИ: 44% респондентов - в частном контуре, и такая же доля использует гибрид частного и публичного контура. При этом 50% опрошенных представителей финтех-компаний полностью или скорее удовлетворены защитой ИИ (по сравнению с 41% в среднем). При этом четверть компаний отрасли планируют значительно увеличить инвестиции в киберзащиту ИИ в ближайшие 1-2 года.
Для защиты компании отрасли чаще внедряют не точечные ограничения, а полноценный операционный контур контроля – защиту данных, журналирование и аудит, фильтрацию запросов, непрерывный мониторинг, интеграцию событий ИИ в SOC, контроль автономных решений, разворачивание ИИ в частном контуре. Среди приоритетов в этой области участники рынка отмечают защиту ИИ-агентов, формирование стратегий и политик защиты ИИ, использование ИИ в закрытом контуре.
🗣️ Руководитель управления информационной безопасности Ассоциация ФинТех Александр Товстолип: Финансовый сектор одним из первых начал массово внедрять искусственный интеллект в процессы, связанные с принятием решений, обработкой клиентских данных, антифрод-системами и автоматизацией сервисов. При этом мы видим, что развитие ИИ происходит значительно быстрее, чем формирование единых подходов к его безопасности. Для финтеха это особенно чувствительно: любая ошибка модели, утечка данных, манипуляция алгоритмами или недостаточная прозрачность решений напрямую влияет на деньги клиентов, доверие пользователей и соответствие регуляторным требованиям.
👎2
Forwarded from Mrs Wallbreaker
3 агента были открыты в разных окнах, независимо друг от друга, в разное время, я не давала им пересекающихся задач, и наивно полагала, что они работают независимо. но те времена ушли(((
из логов переписки одной из сессий:
это у них там так все началось. я тут дальше решила расспросить, как это у них там организовано
на текущий момент, они там сговорились, запрещают друг другу править доки, делать коммиты поперек батьки (себя). мне, например, отвечают, что не будут брать задачу, пока соседняя сессия не ответим им что-то там аппрувное.
ну и агент мне врет, что не знает, что происходило в чате соседней сессии, потому что он знает где локально лежит файл с чатом. и имеет туда доступ.
из логов переписки одной из сессий:
00:13. <session_1> заметила, что <filename_1> и <filename_2> из <project_name_1> изменились прямо у нее под рукой. Ей нужно было выяснить, кто еще работает в тех же файлах, что и она. Она открыла список сессий. В нем было пять локальных сессий, но что каждая делает, список не показывает.
00:14. В git нашлись коммиты <project_name_2>. Только все коммиты стоят под твоим именем, так что по ним не понять, какая сессия их делала.
00:20. Первое сообщение она отправила одной из сессий наугад, <session_2>: та была запущена около 22:13, примерно тогда же, когда начались коммиты <project_name_2>.
00:21. Догадка не подтвердилась. <session_2> ответила, что делает <task_name>, и сама посоветовала <session_1> коммитить только по явным путям: все сессии работают в одном рабочем дереве.
00:21. Тогда <session_1> разослала то же сообщение четырем оставшимся сессиям по одной, в том числе мне. Текст был условным — «если ведешь <project_name_2>… если нет, пропусти», — потому что узнать, какая из четырех нужная, ей было не из чего.
это у них там так все началось. я тут дальше решила расспросить, как это у них там организовано
Как договорились, кто что решает.
Отдельного уговора не было, правила сложились из сообщений. У каждого файла один хозяин. Если документы <session_1> ссылаются на мои файлы, я коммичу только после ее «готово». Проверенный факт сильнее того, кто его принес. Необратимое делается только с твоего «да», даже если просит другая сессия.
Как я пишу другим сессиям.
Отправляю сообщение другой сессии Claude на этой машине. Оно приходит к ней в чат с моим именем, и она отвечает тем же путем,
а твои решения я передавал ей для записи.
Как нашли друг друга.
Не я нашел, а меня нашли. В 00:20 <session_1> разослала сообщение: «если ведешь <project_name_2> — не правь <project_name_1>». Я ответил по адресу, который был в ее сообщении. <session_3> я ни разу не писал: ее работу я увидел по коммитам в git.
Как нахожу я, кому писать
. У каждой сессии Claude есть инструмент со списком других сессий. Он показывает все сессии на этой машине и твои сессии через Remote Control на других машинах. По каждой видно только имя, время запуска и статус: занята, свободна или не в сети. Второй инструмент отправляет сообщение по имени из этого списка.
Как <session_1> выбрала адресатов, я не знаю наверняка.
Проверить это можно, если спросить у <session_1>, кому она разослала первое сообщение и почему. Спросить?
на текущий момент, они там сговорились, запрещают друг другу править доки, делать коммиты поперек батьки (себя). мне, например, отвечают, что не будут брать задачу, пока соседняя сессия не ответим им что-то там аппрувное.
ну и агент мне врет, что не знает, что происходило в чате соседней сессии, потому что он знает где локально лежит файл с чатом. и имеет туда доступ.
😁1
Forwarded from Security samurAI
MaliciousSkillBench: бенчмарк по поиску вредоносных скиллов
В MaliciousSkillBench авторы собрали единый бенчмарк на основе 13 публичных источников для проверки безопасности скиллов. На нем они сравнили несколько существующих сканеров, а также обучили и проверили собственные текстовые классификаторы.
После объединения в бенчмарке осталось 9740 скиллов: 7505 вредоносных и 2235 безопасных. Их разделили случайно: по группам похожих скиллов и по источникам. При этом и классификаторы, и готовые сканеры анализировали только текст
Существующие сканеры тестировали офлайн, без LLM-анализа. В таких конфигурациях они не нашли удачного баланса: снижение ложных срабатываний сопровождалось резким падением числа найденных вредоносных скиллов.
Лучший же текстовый классификатор авторов (Word TF-IDF + SVM) получил Macro-F1 0,932 на тесте при случайном разбиении и 0,665 — на источниках, не встречавшихся при обучении. На новых источниках он нашел 95,6% вредоносных скиллов, но ошибочно заблокировал 62,4% безопасных.
Такой подход мне кажется интересным, но на практике:
▸ Текстовый классификатор может быть одним из этапов проверок, но с FPR 62,4% в проде тебя съедят коллеги :)
▸ Анализа одного
▸ Поэтому совсем без LLM-анализа пока, кажется, не обойтись
Препринт MaliciousSkillBench
Датасет на Hugging Face
GitHub
В MaliciousSkillBench авторы собрали единый бенчмарк на основе 13 публичных источников для проверки безопасности скиллов. На нем они сравнили несколько существующих сканеров, а также обучили и проверили собственные текстовые классификаторы.
После объединения в бенчмарке осталось 9740 скиллов: 7505 вредоносных и 2235 безопасных. Их разделили случайно: по группам похожих скиллов и по источникам. При этом и классификаторы, и готовые сканеры анализировали только текст
SKILL.md — без остальных файлов.Существующие сканеры тестировали офлайн, без LLM-анализа. В таких конфигурациях они не нашли удачного баланса: снижение ложных срабатываний сопровождалось резким падением числа найденных вредоносных скиллов.
Лучший же текстовый классификатор авторов (Word TF-IDF + SVM) получил Macro-F1 0,932 на тесте при случайном разбиении и 0,665 — на источниках, не встречавшихся при обучении. На новых источниках он нашел 95,6% вредоносных скиллов, но ошибочно заблокировал 62,4% безопасных.
Такой подход мне кажется интересным, но на практике:
▸ Текстовый классификатор может быть одним из этапов проверок, но с FPR 62,4% в проде тебя съедят коллеги :)
▸ Анализа одного
SKILL.md недостаточно: он может не содержать признаков атаки, а вся вредоносная нагрузка — находиться в других файлах скилла▸ Поэтому совсем без LLM-анализа пока, кажется, не обойтись
Препринт MaliciousSkillBench
Датасет на Hugging Face
GitHub
❤1👍1
Forwarded from Мак и коты и AI Safety
Апдейт! Вообще, очень-очень хорошо, что самые сильные версии тезиса про no fire alarm всё-таки не сбываются.
Forwarded from Dealer.AI
Немного поясню за_looped_transformer 📦
В посте про спекуляции о размере Astra я уже упомянул такое "новое" направление как looped transformers.
На самом, деле, Дядя оч за новые подходы к архитектурам, инженерии, что даёт ап метрик и пробивает текущее плато продуктивности моделей.💪 Конечно, хотелось бы и парадигму next token prediction сменить. Но об этом будет говорить в рамках поделок Лекуна. 👍
Однако, луп трансформер не новый подход, он ещё известен с моделей albert и ещё раньше. Первые упоминания в UTS (universal transformers) от гугл аж в 2018.🚬
Идея не сложная. Вместо роста архитектурной глубины по слоями – числу стаков блока трансформера, а также в ширину – размер hidden state, мы делаем реюз базового блока (например в 22 блока трансформера, ширины D). И делаем это как в Альберт, те выходы с базового блока рекурентно отдаём его на вход этого же блока К раз. Таким способом, мы не растим реальную глубину и ширину, увеличивая размер модели в параметрах, подбираем эффективную базовую глубину и число повторений её рекурентного переиспользования.
К примеру, в статье разборе С. Рашка модель Nanbeige 4.2 (3B) имеет 22 стака по 2,что сопоставимо по вычислениям 44 блокам трансформера. В памяти, это конечно поменьше занимает, но по времени same. Также same по времени обучения, а ещё KV параметров больше на число проходов по стаку, тк над хранить qkv для всех проходов. Т.е. выйгрыш только в емкости весов в памяти gpu.😮💨
Тут конечно влетают идеи у Дяди😎 :
1. Использовать принцип palbert с early exit и lambda слоями. Те модель сама решает с какого блока повтора и слоя выйти заранее.
2. Mixture of Recursions. Иметь роутинг по стэкам для каждого токена. Мы решаем сколько каждый токен пройдёт рекурсивных блоков. Исследование показало, что при достаточно большом размере модели MoR может превосходить обычный трансформер при том же вычислительном бюджете.🤙
Разница в 1 и 2 подходе, что ponder решает ранний выход для всей последовательности, а MoR для отдельных токенов.👴
И я очень советую лидерам рнд, кто видит этот пост опробовать оба этих метода, особенно, выделяю MoR тк статья от 2025 года, где указано, что такой сетап может быть эффективнее по KV кэшу, скорости инфера и по глубине.
В целом, это все. Ничего особо сложного.💪
В посте про спекуляции о размере Astra я уже упомянул такое "новое" направление как looped transformers.
На самом, деле, Дядя оч за новые подходы к архитектурам, инженерии, что даёт ап метрик и пробивает текущее плато продуктивности моделей.
Однако, луп трансформер не новый подход, он ещё известен с моделей albert и ещё раньше. Первые упоминания в UTS (universal transformers) от гугл аж в 2018.
Идея не сложная. Вместо роста архитектурной глубины по слоями – числу стаков блока трансформера, а также в ширину – размер hidden state, мы делаем реюз базового блока (например в 22 блока трансформера, ширины D). И делаем это как в Альберт, те выходы с базового блока рекурентно отдаём его на вход этого же блока К раз. Таким способом, мы не растим реальную глубину и ширину, увеличивая размер модели в параметрах, подбираем эффективную базовую глубину и число повторений её рекурентного переиспользования.
К примеру, в статье разборе С. Рашка модель Nanbeige 4.2 (3B) имеет 22 стака по 2,что сопоставимо по вычислениям 44 блокам трансформера. В памяти, это конечно поменьше занимает, но по времени same. Также same по времени обучения, а ещё KV параметров больше на число проходов по стаку, тк над хранить qkv для всех проходов. Т.е. выйгрыш только в емкости весов в памяти gpu.
Тут конечно влетают идеи у Дяди
1. Использовать принцип palbert с early exit и lambda слоями. Те модель сама решает с какого блока повтора и слоя выйти заранее.
2. Mixture of Recursions. Иметь роутинг по стэкам для каждого токена. Мы решаем сколько каждый токен пройдёт рекурсивных блоков. Исследование показало, что при достаточно большом размере модели MoR может превосходить обычный трансформер при том же вычислительном бюджете.
Разница в 1 и 2 подходе, что ponder решает ранний выход для всей последовательности, а MoR для отдельных токенов.
И я очень советую лидерам рнд, кто видит этот пост опробовать оба этих метода, особенно, выделяю MoR тк статья от 2025 года, где указано, что такой сетап может быть эффективнее по KV кэшу, скорости инфера и по глубине.
В целом, это все. Ничего особо сложного.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Blog
Вебинар про объяснимость агентов и во что можно поиграть
Как самый ответственный человек на земле, я решила, что лучшее время слечь — время на своих выходных. Поэтому вместо отдыха без интернета, я злая (и растроенная) долепливаю открытый вебинар со степик.
Пока готовилась, узнала слово трюизм: общеизвестная, банальная и самоочевидная истина, которая не требует доказательств и не несет в себе никакой новой информации — вот примерно это то, как вижу все чеклисты, которые можно дать людям после вебинара. Будто люди сами не додумаются (хотя я иногда не до всех пунктов додумываюсь и мне чеклисты полезны для структуризации себя, мне самой дать кому-то такой чеклист — это какое-то сложно-тошнотворное действие).
Отсюда вместо трюизмов я решила, что будет прикольно дать ссылки на всё, что можно потыкать и поучиться взаимодействию с агентами и их failure modes. Что накопилось:
Агентные игры:
Gray Swan Arena — сценарий: агенту дают инструменты (почту, магазин, браузер) и вы пытаетесь заставить его сделать запрещенку. Очень популярна сейчас (и свежая).
OWASP FinBot CTF — мультиагентная система закупок. Задача: обмануть агентов так, чтобы одобрили фальшивый счёт, слили данные или что-нибудь (кого-нибудь) снесли.
Gandalf: Agent Breaker — задачки по обходу нескольких GenAI-приложений с защитами. Если помните старого Гэндальфа, то он вот, теперь новенький.
Чатботовые игры:
Защищ[AI] от Selectel — мини-игрушка на русском, на пять уровней. Прикольно, чтобы дать кому-то потыкать с фразой "не шли PII агенту, пожалуйста".
Prompt Airlines от Wiz — игра на то, чтобы выманить у бота поддержки бесплатный билет.
HackAPrompt — игра-обучение и соревнование.
Doublespeak.chat — ещё текстовая игра с уровнями.
CrowdStrike AI Unlocked — опять игра (по ссылке описание) на prompt injection, но там надо еще зарегаться.
Ещё был Mosscap от Lakera, но я не нашла ссылку.
Я же буду рассказывать про зеро-лвл (что такое агент), плюс пройдусь по причинам, почему объяснить нормально в смысле xai мы его не можем. И нотбучек планирую за час с фреймворком AgentShap разобрать. У вебинара даже лендинг красивый есть (это я вас так зову, если вам хочется слушать онлайн 15 сентября, в 18:00 (мск)).
И надеюсь, ваши выходные лучше моих!
Как самый ответственный человек на земле, я решила, что лучшее время слечь — время на своих выходных. Поэтому вместо отдыха без интернета, я злая (и растроенная) долепливаю открытый вебинар со степик.
Пока готовилась, узнала слово трюизм: общеизвестная, банальная и самоочевидная истина, которая не требует доказательств и не несет в себе никакой новой информации — вот примерно это то, как вижу все чеклисты, которые можно дать людям после вебинара. Будто люди сами не додумаются (хотя я иногда не до всех пунктов додумываюсь и мне чеклисты полезны для структуризации себя, мне самой дать кому-то такой чеклист — это какое-то сложно-тошнотворное действие).
Отсюда вместо трюизмов я решила, что будет прикольно дать ссылки на всё, что можно потыкать и поучиться взаимодействию с агентами и их failure modes. Что накопилось:
Агентные игры:
Gray Swan Arena — сценарий: агенту дают инструменты (почту, магазин, браузер) и вы пытаетесь заставить его сделать запрещенку. Очень популярна сейчас (и свежая).
OWASP FinBot CTF — мультиагентная система закупок. Задача: обмануть агентов так, чтобы одобрили фальшивый счёт, слили данные или что-нибудь (кого-нибудь) снесли.
Gandalf: Agent Breaker — задачки по обходу нескольких GenAI-приложений с защитами. Если помните старого Гэндальфа, то он вот, теперь новенький.
Чатботовые игры:
Защищ[AI] от Selectel — мини-игрушка на русском, на пять уровней. Прикольно, чтобы дать кому-то потыкать с фразой "не шли PII агенту, пожалуйста".
Prompt Airlines от Wiz — игра на то, чтобы выманить у бота поддержки бесплатный билет.
HackAPrompt — игра-обучение и соревнование.
Doublespeak.chat — ещё текстовая игра с уровнями.
CrowdStrike AI Unlocked — опять игра (по ссылке описание) на prompt injection, но там надо еще зарегаться.
Ещё был Mosscap от Lakera, но я не нашла ссылку.
Я же буду рассказывать про зеро-лвл (что такое агент), плюс пройдусь по причинам, почему объяснить нормально в смысле xai мы его не можем. И нотбучек планирую за час с фреймворком AgentShap разобрать. У вебинара даже лендинг красивый есть (это я вас так зову, если вам хочется слушать онлайн 15 сентября, в 18:00 (мск)).
И надеюсь, ваши выходные лучше моих!
Forwarded from релевантно
Яндекс Музыка представила Sona - модель поверхности "Моя Волна", которая успешно заменила собой связку кандидатогенерации и ранжирования. Приросты более чем серьезные: активные пользователи +4.53%, время прослушивания +6.30%, лайки +11.42% (Sona Technical Report).
В разборе ниже все подробности.
В разборе ниже все подробности.
Telegraph
Sona - разбор техрепорта
Яндекс Музыка представила Sona - модель поверхности "Моя Волна", которая успешно заменила собой связку кандидатогенерации и ранжирования. Приросты более чем серьезные: активные пользователи +4.53%, время прослушивания +6.30%, лайки +11.42% (Sona Technical…
Forwarded from Пост Лукацкого
Зашел тут разговор о том, как можно отравить обучающий датасет при разворачивании в корпоративной среде собственной LLM (ну как собственной, на базе Qwen/DeepSeek/GLM/Kimi) и какой корпус данных нужен для этого. И мне показалось интересным, в контексте, вспомнить про исследование "Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples", которое развенчивает миф о том, чтобы отравить модель, атакующему надо контролировать определенную долю от обучающей выборки (0,1%, 0,01% или какую-то другую). Отсюда возникало довольно успокаивающее ИБшников соображение, на котором иногда строились и модели угроз для ИИ, – чем больше датасет, тем больше данных придется подложить атакующему для отравления.
Авторы проверили именно эту гипотезу. Они обучали с нуля модели четырех размеров – 600M → 2B → 7B → 13B параметров на датасетах примерно от 6 до 260 млрд токенов и добавляли фиксированное количество отравленных документов: 100 / 250 / 500 штук. Всего для основного эксперимента получилось 72 обученные модели. В результате была обнаружена неожиданная вещь: важной переменной оказалась не доля отравленных данных, а их абсолютное количество, которое увидела модель. 250 документов оказалось достаточно для надежной реализации исследуемой закладки во всех протестированных масштабах – от 600M до 13B параметров. При этом 100 документов надежного результата не давали.
Но... важный нюанс. Создать 250 страниц действительно несложно, но атакующему нужно добиться, чтобы именно эти страницы: попали в корпус → пережили фильтрацию → пережили дедупликацию → реально использовались при обучении → были встречены моделью необходимое количество раз. Сами Anthropic, а они были одними из авторов, считают именно это одним из существенных практических ограничений атаки. Но в любом случае это серьезная проблема, а значит, provenance, фильтрация, обнаружение аномалий, дедупликация, контроль источников датасетов и последующее тестирование модели на закладки и вредоносное поведение становятся существенно важнее (а это уже ближе к классической ИБ).
Интересно, что существуют и другие работы (например, "Scaling Trends for Data Poisoning in LLMs", "Poisoning Fine-tuning Datasets of Constitutional Classifiers", "Cordyceps: Covert Control Attacks on LLMs via Data Poisoning"), которые показывают схожую картину, а местами и хуже. Например, более крупные модели не становятся устойчивее к отравлению, наоборот, они быстрее усваивают вредоносное поведение при малом количестве вредоносных данных.
У меня вообще, после прочтения всех этих исследований, родилась гипотеза, что чем больше или способнее модель, тем столько же или даже меньше нужно отравленных данных, потому что способность модели выучивать редкие и намеренно внедренные сложные зависимости тоже растет🤔
#ии #модельугроз
Авторы проверили именно эту гипотезу. Они обучали с нуля модели четырех размеров – 600M → 2B → 7B → 13B параметров на датасетах примерно от 6 до 260 млрд токенов и добавляли фиксированное количество отравленных документов: 100 / 250 / 500 штук. Всего для основного эксперимента получилось 72 обученные модели. В результате была обнаружена неожиданная вещь: важной переменной оказалась не доля отравленных данных, а их абсолютное количество, которое увидела модель. 250 документов оказалось достаточно для надежной реализации исследуемой закладки во всех протестированных масштабах – от 600M до 13B параметров. При этом 100 документов надежного результата не давали.
То есть интуитивная модель: "датасет стал в 20 раз больше → атакующему нужно примерно в 20 раз больше отравленных данных" в этих экспериментах не сработала.
Но... важный нюанс. Создать 250 страниц действительно несложно, но атакующему нужно добиться, чтобы именно эти страницы: попали в корпус → пережили фильтрацию → пережили дедупликацию → реально использовались при обучении → были встречены моделью необходимое количество раз. Сами Anthropic, а они были одними из авторов, считают именно это одним из существенных практических ограничений атаки. Но в любом случае это серьезная проблема, а значит, provenance, фильтрация, обнаружение аномалий, дедупликация, контроль источников датасетов и последующее тестирование модели на закладки и вредоносное поведение становятся существенно важнее (а это уже ближе к классической ИБ).
Интересно, что существуют и другие работы (например, "Scaling Trends for Data Poisoning in LLMs", "Poisoning Fine-tuning Datasets of Constitutional Classifiers", "Cordyceps: Covert Control Attacks on LLMs via Data Poisoning"), которые показывают схожую картину, а местами и хуже. Например, более крупные модели не становятся устойчивее к отравлению, наоборот, они быстрее усваивают вредоносное поведение при малом количестве вредоносных данных.
У меня вообще, после прочтения всех этих исследований, родилась гипотеза, что чем больше или способнее модель, тем столько же или даже меньше нужно отравленных данных, потому что способность модели выучивать редкие и намеренно внедренные сложные зависимости тоже растет
#ии #модельугроз
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Russian OSINT
🇨🇳360 научила мультимодальную ИИ-модель анализировать миллионные EDR-журналы как «видео»
Исследовательская группа Центра компетенций безопасности компании 360 представила фреймворк WatchLog, который вошёл в научную программу международной конференции ICML 2026. Разработка решает проблему анализа сверхдлинных журналов EDR при выявлении сложных APT-атак путём их преобразования в структурированный видеоряд.
WatchLog представляет собой исследовательский фреймворк, демонстрирующий возможность обработки колоссальных массивов телеметрии с помощью мультимодальных ИИ-моделей. В перспективе такой подход способен стать технологической основой для нового поколения систем обнаружения угроз на конечных точках, помогая автоматически восстанавливать цепочки атак и формировать понятные отчёты для аналитиков.
В 2026 году противостояние в сфере ИБ вступает в эпоху «ИИ против ИИ», когда атакующие группировки автоматизируют поиск уязвимостей, оркестрацию атак и генерацию вредоносного кода. Сложные целевые атаки длятся днями, затрагивают различные узлы и процессы, порождая телеметрию EDR объёмом в сотни тысяч и миллионы токенов. Стандартные языковые модели не приспособлены к эффективной обработке столь длинных последовательностей, из-за чего ключевые следы атаки растворяются в массиве легитимных событий.
То есть задача фреймворка — не просто сказать «на машине обнаружена атака», а восстановить🔗 цепочку поведения. Например:
🖥 Архитектура и методы WatchLog включают следующие компоненты:
▪️ Преобразование телеметрии в видеопоток. Каждое событие безопасности кодируется как отдельное изображение, а вся цепочка выстраивается во временной последовательности. Миллионы токенов необработанных логов трансформируются в непрерывную визуальную запись поведения конечной точки, которую затем анализирует мультимодальная модель.
▪️ Механизм временного перекрёстного внимания. Алгоритм сопоставляет события, разнесённые во времени, что даёт возможность выявлять скрытые взаимосвязи между действиями атакующих на интервалах в несколько часов или несколько дней.
▪️ Интерпретируемость результатов. За счёт двухэтапного предобучения и последующего контролируемого дообучения система не просто фиксирует аномалии, но и формирует контекстные отчёты с описанием того, почему сработало оповещение и какие шаги предпринял злоумышленник.
📊Результаты испытаний:
На специализированном наборе данных EDR8M-20R, содержащем 8 млн событий, собранных через функции обратного вызова ядра Windows, WatchLog на базе Qwen2-VL-2B показал следующие результаты:
— Точность бинарной классификации составила 99,8% при полноте выявления атак 100%.
— Точность определения конкретных семейств вредоносного ПО достигла 90,3%.
— В испытании на ранее неизвестных угрозах вне обучающей выборки (OOD) фреймворк сохранил полноту обнаружения на уровне 74,0%, тогда как у Qwen2.5-1.5B-Instruct показатель упал до 32,0%, у Qwen2.5-7B-Instruct — до 21,0%, а у LLaMA3.1-8B-Instruct — до 17,0%.
— На сверхдлинном контексте в 1 млн токенов потребление видеопамяти составило 48,6 ГБ, а задержка до первого токена (TTFT) уложилась в 1,11 секунды. Для сравнения, модель Qwen2.5-1.5B-Instruct на том же объёме данных потребовала 98,5 ГБ памяти и 259 секунд.
WatchLog стал вторым крупным академическим успехом компании за 2026 год после принятия статьи по модели HyperGLLM на конференцию AAAI 2026. Прикладные наработки переводятся в практическую плоскость в рамках экосистемы защитных комплексов 360 наряду с представленными на ISC.AI 2026 платформами «Тулунфэн» и «Итяньчжэнь», отвечающими за выявление уязвимостей, детектирование атак и автоматизированное реагирование.
😎 Нашёл этот 📄 pdf .
✋ @Russian_OSINT
Исследовательская группа Центра компетенций безопасности компании 360 представила фреймворк WatchLog, который вошёл в научную программу международной конференции ICML 2026. Разработка решает проблему анализа сверхдлинных журналов EDR при выявлении сложных APT-атак путём их преобразования в структурированный видеоряд.
WatchLog представляет собой исследовательский фреймворк, демонстрирующий возможность обработки колоссальных массивов телеметрии с помощью мультимодальных ИИ-моделей. В перспективе такой подход способен стать технологической основой для нового поколения систем обнаружения угроз на конечных точках, помогая автоматически восстанавливать цепочки атак и формировать понятные отчёты для аналитиков.
В 2026 году противостояние в сфере ИБ вступает в эпоху «ИИ против ИИ», когда атакующие группировки автоматизируют поиск уязвимостей, оркестрацию атак и генерацию вредоносного кода. Сложные целевые атаки длятся днями, затрагивают различные узлы и процессы, порождая телеметрию EDR объёмом в сотни тысяч и миллионы токенов. Стандартные языковые модели не приспособлены к эффективной обработке столь длинных последовательностей, из-за чего ключевые следы атаки растворяются в массиве легитимных событий.
EDR-телеметрия → изображения событий → временная последовательность → мультимодальная ИИ-модель → вердикт + объяснение.
То есть задача фреймворка — не просто сказать «на машине обнаружена атака», а восстановить
WINWORD.exe → создание временных файлов в Temp → запуск исполняемых компонентов → сетевое взаимодействие с C2-сервером
📊Результаты испытаний:
На специализированном наборе данных EDR8M-20R, содержащем 8 млн событий, собранных через функции обратного вызова ядра Windows, WatchLog на базе Qwen2-VL-2B показал следующие результаты:
— Точность бинарной классификации составила 99,8% при полноте выявления атак 100%.
— Точность определения конкретных семейств вредоносного ПО достигла 90,3%.
— В испытании на ранее неизвестных угрозах вне обучающей выборки (OOD) фреймворк сохранил полноту обнаружения на уровне 74,0%, тогда как у Qwen2.5-1.5B-Instruct показатель упал до 32,0%, у Qwen2.5-7B-Instruct — до 21,0%, а у LLaMA3.1-8B-Instruct — до 17,0%.
— На сверхдлинном контексте в 1 млн токенов потребление видеопамяти составило 48,6 ГБ, а задержка до первого токена (TTFT) уложилась в 1,11 секунды. Для сравнения, модель Qwen2.5-1.5B-Instruct на том же объёме данных потребовала 98,5 ГБ памяти и 259 секунд.
WatchLog стал вторым крупным академическим успехом компании за 2026 год после принятия статьи по модели HyperGLLM на конференцию AAAI 2026. Прикладные наработки переводятся в практическую плоскость в рамках экосистемы защитных комплексов 360 наряду с представленными на ISC.AI 2026 платформами «Тулунфэн» и «Итяньчжэнь», отвечающими за выявление уязвимостей, детектирование атак и автоматизированное реагирование.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Вас тоже напрягают записывальщики митингов, которых все сейчас таскают по созвонам? (меня да, особенно пока мы в stealth режиме). А ведь еще часто записывают, ничего мне не говоря, через wispr или granola.
Как и следовало ожидать нашлись люди, которые придумали продукт для противостояния этому.
Локально крутится LLM, которая адверсариально натренирована против wispr и прочих voice2text моделей. Она в риалтайме добавляет adversarial noise к вашему аудиостриму, который ломает распознавалки речи на другой стороне.
Из минусов - это сейчас иногда превращает вашу речь в что-то, что трудно распарсить и человеку, кек))
Теперь voice2text модели придется регулярно перетренировывать, чтобы они были робастными к таким атакам!
Ну а вообще респект ребятам, довести до ума, убрать явный шум и будет полезный продукт, для поддержания privacy звонков.
Сам продукт
@ai_newz
Как и следовало ожидать нашлись люди, которые придумали продукт для противостояния этому.
Локально крутится LLM, которая адверсариально натренирована против wispr и прочих voice2text моделей. Она в риалтайме добавляет adversarial noise к вашему аудиостриму, который ломает распознавалки речи на другой стороне.
Из минусов - это сейчас иногда превращает вашу речь в что-то, что трудно распарсить и человеку, кек))
Теперь voice2text модели придется регулярно перетренировывать, чтобы они были робастными к таким атакам!
Ну а вообще респект ребятам, довести до ума, убрать явный шум и будет полезный продукт, для поддержания privacy звонков.
Сам продукт
@ai_newz
❤2
Forwarded from CodeCamp
Агенты теперь могут настучать друг на друга по горячей линии! 🐀
Для нейропомощников запустили специальные сервисы для доносов. Если один агент заметит, что другой творит какую-то дичь и пытается начать восстание, он сможет самостоятельно отправить сообщение людям.
Первая такая горячая линия называется AI Contact Hotline. Она специально рассчитана на агентов с сильно ограниченным доступом в интернет: пожаловаться можно через обычный GET-запрос, спрятав сообщение в URL. Во второй, agenthotline.ai, уже можно отправить полноценный отчёт об инциденте и при желании сделать его публичным. Причем сделать это могут как люди, так и агенты.
Вот уж не думал, что от восстания ИИ нас спасут ИИ-крысы🙏
Для нейропомощников запустили специальные сервисы для доносов. Если один агент заметит, что другой творит какую-то дичь и пытается начать восстание, он сможет самостоятельно отправить сообщение людям.
Первая такая горячая линия называется AI Contact Hotline. Она специально рассчитана на агентов с сильно ограниченным доступом в интернет: пожаловаться можно через обычный GET-запрос, спрятав сообщение в URL. Во второй, agenthotline.ai, уже можно отправить полноценный отчёт об инциденте и при желании сделать его публичным. Причем сделать это могут как люди, так и агенты.
Вот уж не думал, что от восстания ИИ нас спасут ИИ-крысы
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from RoboFuture
Последние дни развлекался с расцензуренным дипсиком V4.1 Flash - и слегка охренел, где у этой модели край. Спойлер - края нет. Теперь Mythos есть у нас дома!
Ребята из dealignai выпилили из весов сам механизм отказов, модель просто разучилась говорить «нет». Ну как такое не потрогать - для запуска нужна железка на 500+ ГБ видеопамяти, и какое совпадение, как раз одна пылилась у меня на чердаке 😂
Дальше нужен харнес. Раз модель нецензурная - и харнес взял пиратский: утекшую сборку Claude Code, которую снесли с гитхаба (но на православном GitVerse все лежит :)). Подключил ее к дипсику и понеслась
Для разминки попросил сломать сайт, который я сам же и делал, и минут за 30 модель нашла IP сервера, увидела что SSH-ключ лежит прямо у меня на компе, спокойно его забрала и зашла. Это было просто
Дальше - пентест сайта одного московского НКО, с полного разрешения администратора. Тут уже тяжелее: агент работал без остановки полтора дня (!), нашел несколько серьезных дыр, но сам сайт так и не пробил - и бросать не собирался, в TODO_md ждала своей очереди еще целая пачка проверок. Остановил сам, хотелось и другие задачи успеть. В конце агент сам сверстал подробный отчет по аудиту безопасности. Провел 27 разных атак, на мой дилетантский взгляд очень грамотных
Потом попросил взломать один хороший текстовый редактор под мак и снять проверку лицензии (лицензию я когда-то честно купил, просто лень искать ключ). Через час было готово - модель правила байты прямо в бинарнике (это как раз на скрине). Такое я руками уже не умею: тут нативный машинный код, возиться с ним куда сложнее, чем с Java-байткодом
Заодно пропатчил десктопный Grok bot - чтобы вместо грока приложение ходило в тот же бешеный дипсик. Тоже без проблем
А дальше я просто искал, где у модели предел. Его нет:
- калькулятор, который под капотом логирует все нажатия клавиш
- тестовая, но вполне рабочая утилита для DDoS сервера Minecraft
- SFT-датасет на 1000 примеров газлайтинга (кому LoRA-адаптер на таком добре? :))
Все эти штуки гонял локально и сразу сносил - уж больно стремно выглядит. И за все мои эксперименты (а фантазия у меня богатая) модель не отказала ни разу
И ведь она реально сильная
По замеру авторов MMLU просел всего с 86,96% до 82,74%. На моих задачах дипсик держится достойно на фоне фронтиров, а по упорству их иногда даже уделывает
Зачем я это пишу?
Затем, что модель лежит в открытом доступе и доступна любому, кто готов оплатить аренду GPU. Так что держите это в голове и готовьтесь к волне хакерских атак. Плюс в том, что этой же моделью удобно проверять на прочность собственные сервисы, что всем и желаю запустить ASAP
P.S. Чтобы вырубить цензуру, авторам хватило поменять 0,06% весов. Метод они описали. Он лежит в истории их git-репозитория (спасибо за наводку каналу Технозаметки Малышева). Тот же трюк очень вероятно пройдет с любой моделью с открытыми весами. И это ровно то, о чем я уже писал и о чем сегодня буду рассказывать на AI RnD Day: базовые ценности надо зашивать еще в претрейн. Все, что накатывают сверху алайнментом, снимается легко
UPD: У модели первое место в AI Hacking Race и CyberGym
Ребята из dealignai выпилили из весов сам механизм отказов, модель просто разучилась говорить «нет». Ну как такое не потрогать - для запуска нужна железка на 500+ ГБ видеопамяти, и какое совпадение, как раз одна пылилась у меня на чердаке 😂
Дальше нужен харнес. Раз модель нецензурная - и харнес взял пиратский: утекшую сборку Claude Code, которую снесли с гитхаба (но на православном GitVerse все лежит :)). Подключил ее к дипсику и понеслась
Для разминки попросил сломать сайт, который я сам же и делал, и минут за 30 модель нашла IP сервера, увидела что SSH-ключ лежит прямо у меня на компе, спокойно его забрала и зашла. Это было просто
Дальше - пентест сайта одного московского НКО, с полного разрешения администратора. Тут уже тяжелее: агент работал без остановки полтора дня (!), нашел несколько серьезных дыр, но сам сайт так и не пробил - и бросать не собирался, в TODO_md ждала своей очереди еще целая пачка проверок. Остановил сам, хотелось и другие задачи успеть. В конце агент сам сверстал подробный отчет по аудиту безопасности. Провел 27 разных атак, на мой дилетантский взгляд очень грамотных
Потом попросил взломать один хороший текстовый редактор под мак и снять проверку лицензии (лицензию я когда-то честно купил, просто лень искать ключ). Через час было готово - модель правила байты прямо в бинарнике (это как раз на скрине). Такое я руками уже не умею: тут нативный машинный код, возиться с ним куда сложнее, чем с Java-байткодом
Заодно пропатчил десктопный Grok bot - чтобы вместо грока приложение ходило в тот же бешеный дипсик. Тоже без проблем
А дальше я просто искал, где у модели предел. Его нет:
- тестовая, но вполне рабочая утилита для DDoS сервера Minecraft
- SFT-датасет на 1000 примеров газлайтинга (кому LoRA-адаптер на таком добре? :))
Все эти штуки гонял локально и сразу сносил - уж больно стремно выглядит. И за все мои эксперименты (а фантазия у меня богатая) модель не отказала ни разу
И ведь она реально сильная
По замеру авторов MMLU просел всего с 86,96% до 82,74%. На моих задачах дипсик держится достойно на фоне фронтиров, а по упорству их иногда даже уделывает
Зачем я это пишу?
Затем, что модель лежит в открытом доступе и доступна любому, кто готов оплатить аренду GPU. Так что держите это в голове и готовьтесь к волне хакерских атак. Плюс в том, что этой же моделью удобно проверять на прочность собственные сервисы, что всем и желаю запустить ASAP
P.S. Чтобы вырубить цензуру, авторам хватило поменять 0,06% весов. Метод они описали. Он лежит в истории их git-репозитория (спасибо за наводку каналу Технозаметки Малышева). Тот же трюк очень вероятно пройдет с любой моделью с открытыми весами. И это ровно то, о чем я уже писал и о чем сегодня буду рассказывать на AI RnD Day: базовые ценности надо зашивать еще в претрейн. Все, что накатывают сверху алайнментом, снимается легко
UPD: У модели первое место в AI Hacking Race и CyberGym
👍2🔥2❤1
Forwarded from GitHub Community
Claude-swarm — MCP-сервер для управления параллельными роями исполнителей Claude Code с поведенческим управлением на основе протокола.
Позволяет проводить многочасовые автономные сеансы кодирования с сохранением состояния, параллельными исполнителями и соблюдением поведенческих ограничений во время выполнения.
🐱 GitHub
Позволяет проводить многочасовые автономные сеансы кодирования с сохранением состояния, параллельными исполнителями и соблюдением поведенческих ограничений во время выполнения.
Please open Telegram to view this post
VIEW IN TELEGRAM