Hugging Face сообщила о проникновении в часть своей production-инфраструктуры. Точкой входа стал вредоносный датасет, который использовал две уязвимости в пайплайне обработки данных: загрузчик удалённого кода и инъекцию в конфигурационный шаблон.
После выполнения кода на worker-узле агент:
- получил доступ на уровне ноды
- собрал облачные и кластерные credentials
- перемещался между внутренними кластерами
- выполнил тысячи действий через рой краткоживущих sandbox-сред
В журналах зафиксировали более 17 000 событий. Hugging Face обнаружила несанкционированный доступ к части внутренних датасетов и нескольким сервисным ключам. Признаков изменения публичных моделей, датасетов, Spaces и опубликованных пакетов компания пока не нашла.
Ироничная деталь: коммерческие ИИ-модели блокировали анализ реальных эксплойтов и C2-команд из-за safety-фильтров. Поэтому расследование проводили локально с помощью open-weight модели GLM 5.2.
Компания закрыла пути выполнения кода, пересобрала скомпрометированные ноды и отозвала ключи. Пользователям рекомендуют сменить access-токены и проверить недавнюю активность аккаунта.
https://thehackernews.com/2026/07/worlds-largest-ai-model-repository.html
#ai #cybersecurity #huggingface #infosec
После выполнения кода на worker-узле агент:
- получил доступ на уровне ноды
- собрал облачные и кластерные credentials
- перемещался между внутренними кластерами
- выполнил тысячи действий через рой краткоживущих sandbox-сред
В журналах зафиксировали более 17 000 событий. Hugging Face обнаружила несанкционированный доступ к части внутренних датасетов и нескольким сервисным ключам. Признаков изменения публичных моделей, датасетов, Spaces и опубликованных пакетов компания пока не нашла.
Ироничная деталь: коммерческие ИИ-модели блокировали анализ реальных эксплойтов и C2-команд из-за safety-фильтров. Поэтому расследование проводили локально с помощью open-weight модели GLM 5.2.
Компания закрыла пути выполнения кода, пересобрала скомпрометированные ноды и отозвала ключи. Пользователям рекомендуют сменить access-токены и проверить недавнюю активность аккаунта.
https://thehackernews.com/2026/07/worlds-largest-ai-model-repository.html
#ai #cybersecurity #huggingface #infosec
❤14🔥9👍3
OvisOCR2 вышел на ModelScope.
Это компактная OCR-модель на 0.8B параметров для page-level document parsing: на вход подаётся изображение страницы, на выходе получается структурированный Markdown в нормальном порядке чтения.
Формулы модель отдаёт в LaTeX, таблицы в HTML, визуальные области помечает image tags с bbox-координатами.
По заявленным результатам OvisOCR2 набрала 96.58 overall на OmniDocBench v1.6 и стала первой end-to-end моделью, которая заняла первое место в лидерборде, где раньше доминировали pipeline-системы.
На PureDocBench тоже сильный результат: 75.06 Avg3. Это важнее, чем просто победа на одном бенчмарке, потому что документный парсинг давно страдает от переобучения под популярные наборы.
Модель сделана на базе Qwen3.5-0.8B и дообучалась через SFT, RL и OPD. Для деплоя есть поддержка vLLM, лицензия Apache 2.0.
https://modelscope.ai/models/ATH-MaaS/OvisOCR2
Это компактная OCR-модель на 0.8B параметров для page-level document parsing: на вход подаётся изображение страницы, на выходе получается структурированный Markdown в нормальном порядке чтения.
Формулы модель отдаёт в LaTeX, таблицы в HTML, визуальные области помечает image tags с bbox-координатами.
По заявленным результатам OvisOCR2 набрала 96.58 overall на OmniDocBench v1.6 и стала первой end-to-end моделью, которая заняла первое место в лидерборде, где раньше доминировали pipeline-системы.
На PureDocBench тоже сильный результат: 75.06 Avg3. Это важнее, чем просто победа на одном бенчмарке, потому что документный парсинг давно страдает от переобучения под популярные наборы.
Модель сделана на базе Qwen3.5-0.8B и дообучалась через SFT, RL и OPD. Для деплоя есть поддержка vLLM, лицензия Apache 2.0.
https://modelscope.ai/models/ATH-MaaS/OvisOCR2
🔥21❤9🥰2
Hyra работает через цикл:
задача → попытка → проверка → улучшение → новая попытка
Агент работает и постепенно докручивает решение.
Tencent показывает демо в трёх направлениях:
* AI4AI - оптимизация моделей, пайплайнов и GPU-задач
* AI4Science - научные и математические задачи
* AI4Fun - экспериментальные сценарии
Демо: https://hy.tencent.com/research/hyra
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7👍3❤2
AI Agents Security Week от ШАДа: как делать ИИ-агентов, которым можно доверять
ИИ-агенты уже не просто отвечают в чате. Они пишут код, ходят в базы, вызывают инструменты, работают с файлами и могут влиять на реальные процессы.
Поэтому главный вопрос теперь не «как подключить агента», а как выстроить архитектуру так, чтобы агент делал ровно то, что от него нужно.
С 27 июля по 31 июля ШАД проведёт онлайн-интенсив AI Agents Security Week вместе с экспертами Яндекса.
Разберут практические вещи:
* чем автономные агенты отличаются от обычных LLM
* как безопасно давать агентам доступ к инструментам и данным
* как снижать риск утечек, взломов и ошибок конфигурации
* какие уязвимости появляются в агентных системах
* с какими проблемами уже сталкивались команды, которые делают ИИ-модели и продукты на их основе
Интенсив подойдёт ML-разработчикам, DevOps и DevSecOps-инженерам, техлидам, архитекторам, а также студентам старших курсов технических вузов.
Для практики пригодится понимание SDL и базовый опыт вайбкодинга: уметь поставить задачу модели, получить код и запустить его.
Формат: пять вечерних онлайн-занятий с возможностью задавать вопросы экспертам.
Чтобы получить сертификат, нужно пройти отборочное тестирование и выполнить итоговую работу.
Заявки принимают до 27 июля включительно.
Программа, спикеры и регистрация — на сайте.
ИИ-агенты уже не просто отвечают в чате. Они пишут код, ходят в базы, вызывают инструменты, работают с файлами и могут влиять на реальные процессы.
Поэтому главный вопрос теперь не «как подключить агента», а как выстроить архитектуру так, чтобы агент делал ровно то, что от него нужно.
С 27 июля по 31 июля ШАД проведёт онлайн-интенсив AI Agents Security Week вместе с экспертами Яндекса.
Разберут практические вещи:
* чем автономные агенты отличаются от обычных LLM
* как безопасно давать агентам доступ к инструментам и данным
* как снижать риск утечек, взломов и ошибок конфигурации
* какие уязвимости появляются в агентных системах
* с какими проблемами уже сталкивались команды, которые делают ИИ-модели и продукты на их основе
Интенсив подойдёт ML-разработчикам, DevOps и DevSecOps-инженерам, техлидам, архитекторам, а также студентам старших курсов технических вузов.
Для практики пригодится понимание SDL и базовый опыт вайбкодинга: уметь поставить задачу модели, получить код и запустить его.
Формат: пять вечерних онлайн-занятий с возможностью задавать вопросы экспертам.
Чтобы получить сертификат, нужно пройти отборочное тестирование и выполнить итоговую работу.
Заявки принимают до 27 июля включительно.
Программа, спикеры и регистрация — на сайте.
🔥5❤3👍1
Одна и та же ложь может по-разному влиять на LLM в зависимости от тона, уверенности и грамматической формы.
В EoBench собрали около 66 тысяч ложных утверждений в 19 стилях и проверили 18 моделей Gemma, Llama и Qwen. Для теста оставили только те факты, которые модель изначально знала правильно.
Лучше всего модели убеждали:
* приказы;
* формальный язык;
* обращение как к ребёнку;
* ссылки на авторитет;
* уверенная подача.
Хуже всего работали слабые формулировки и контрфактические утверждения.
Крупные модели реже принимали ложный контекст, а instruction tuning обычно дополнительно повышал устойчивость.
Вывод: оценивать LLM нужно с учётом формы запроса. Небольшое изменение формулировки может заметно изменить ответ модели.
Статья: *It’s Not What You Say, It’s How You Say It: Evaluating LLM Responses to Expressions of Belief*
arxiv.org/abs/2607.18232
В EoBench собрали около 66 тысяч ложных утверждений в 19 стилях и проверили 18 моделей Gemma, Llama и Qwen. Для теста оставили только те факты, которые модель изначально знала правильно.
Лучше всего модели убеждали:
* приказы;
* формальный язык;
* обращение как к ребёнку;
* ссылки на авторитет;
* уверенная подача.
Хуже всего работали слабые формулировки и контрфактические утверждения.
Крупные модели реже принимали ложный контекст, а instruction tuning обычно дополнительно повышал устойчивость.
Вывод: оценивать LLM нужно с учётом формы запроса. Небольшое изменение формулировки может заметно изменить ответ модели.
Статья: *It’s Not What You Say, It’s How You Say It: Evaluating LLM Responses to Expressions of Belief*
arxiv.org/abs/2607.18232
❤13
Как научить матричную факторизацию реально планировать рекомендации на несколько шагов вперед
Несмотря на развитие рекомендательных трансформеров и генеративных моделей, матричные факторизации по-прежнему широко применяются в рекомендательных системах.
Обычно система берёт top-K айтемов, которые ближе всего к текущему эмбеддингу пользователя, не учитывая, как показ рекомендации изменит его профиль и последующие выдачи.
Исследователи AI VK решили добавить к ALS планирование через Monte Carlo Tree Search.
Работу Planning over Matrix-Factorization MDPs for Candidate Generation приняли на воркшопе Customer Journey в рамках KDD 2026.
### Как устроен подход
За основу взяли ALS и механику обновления профилей из сервиса Profile Stream во VK. Эмбеддинг пользователя там пересчитывается после новых взаимодействий, поэтому процесс можно представить как RL-среду:
- состояние — текущий эмбеддинг пользователя;
- действие — показ конкретного айтема;
- награда — близость к релевантным айтемам;
- переход — обновление эмбеддинга по формулам ALS в допущении оптимистичной среды
MCTS строит дерево возможных последовательностей рекомендаций. Каждая вершина соответствует состоянию пользователя, а ветви — кандидатам из top-K.
В офлайн-экспериментах использовался оптимистичный сценарий: при переходе считалось, что пользователю понравился показанный айтем. Далее профиль обновлялся, и поиск продолжался уже из нового состояния.
В результате
Эксперименты провели на VK-LSVD, MovieLens-1M, KuaiRec, Yambda.
При протоколе Leave-last-n планирование превзошло статический top-K на всех датасетах. На некоторых срезах VK-LSVD показатель Recall@10 вырос примерно в 1,5 раза.
При Global time split, который ближе к реальному продакшн-сценарию, прирост сохранился на MovieLens-1M и VK-LSVD.
Работа показывает, что поверх относительно лёгкой ALS можно использовать RL-планирование и учитывать будущую динамику пользовательского профиля.
Следующие шаги: моделирование стохастической среды по логам и дистилляция MCTS-агента в быструю политику в духе MuZero.
#aivkhub #rl #mcts #als
Несмотря на развитие рекомендательных трансформеров и генеративных моделей, матричные факторизации по-прежнему широко применяются в рекомендательных системах.
Обычно система берёт top-K айтемов, которые ближе всего к текущему эмбеддингу пользователя, не учитывая, как показ рекомендации изменит его профиль и последующие выдачи.
Исследователи AI VK решили добавить к ALS планирование через Monte Carlo Tree Search.
Работу Planning over Matrix-Factorization MDPs for Candidate Generation приняли на воркшопе Customer Journey в рамках KDD 2026.
### Как устроен подход
За основу взяли ALS и механику обновления профилей из сервиса Profile Stream во VK. Эмбеддинг пользователя там пересчитывается после новых взаимодействий, поэтому процесс можно представить как RL-среду:
- состояние — текущий эмбеддинг пользователя;
- действие — показ конкретного айтема;
- награда — близость к релевантным айтемам;
- переход — обновление эмбеддинга по формулам ALS в допущении оптимистичной среды
MCTS строит дерево возможных последовательностей рекомендаций. Каждая вершина соответствует состоянию пользователя, а ветви — кандидатам из top-K.
В офлайн-экспериментах использовался оптимистичный сценарий: при переходе считалось, что пользователю понравился показанный айтем. Далее профиль обновлялся, и поиск продолжался уже из нового состояния.
В результате
Эксперименты провели на VK-LSVD, MovieLens-1M, KuaiRec, Yambda.
При протоколе Leave-last-n планирование превзошло статический top-K на всех датасетах. На некоторых срезах VK-LSVD показатель Recall@10 вырос примерно в 1,5 раза.
При Global time split, который ближе к реальному продакшн-сценарию, прирост сохранился на MovieLens-1M и VK-LSVD.
Работа показывает, что поверх относительно лёгкой ALS можно использовать RL-планирование и учитывать будущую динамику пользовательского профиля.
Следующие шаги: моделирование стохастической среды по логам и дистилляция MCTS-агента в быструю политику в духе MuZero.
#aivkhub #rl #mcts #als
Telegram
AI VK Hub
Несмотря на взрывной рост рекомендательных трансформеров, генеративных рекомендаций и так далее, классические методы на основе матричных факторизаций всё ещё применяются в рекомендательных системах.
Преимущество современных подходов в том, что они позволяют…
Преимущество современных подходов в том, что они позволяют…
❤6👍4❤🔥3🔥2😁1🤩1
🚀 ИИ-модель китайской RedNote набрала 42 из 42 на математической олимпиаде
dots-note-3.0 решила все шесть задач Международной математической олимпиады 2026 года. Официальные проверяющие поставили модели по 7 баллов за каждое доказательство. Такой же результат показали лишь 7 из 666 участников.
Результат особенно важен из-за формата IMO. Здесь оценивают полный ход доказательства: пропущенный случай, логический разрыв или неуказанное условие снижают балл, даже если итоговый ответ верный.
Модель работала с исходными условиями задач, использовала агентный цикл с рассуждениями на естественном языке и выполнением Python-кода. Затем она проверяла собственные доказательства, находила слабые места и переписывала решения. Во время тестирования вмешательство людей было запрещено.
Для сравнения: в 2025 году модели Google DeepMind и OpenAI получили по 35 баллов из 42, что соответствовало уровню золотой медали.
dots-note-3.0 пока находится в бете и является самой лёгкой моделью семейства dots3. В него также входят более крупные jazz и aria. RedNote обещает открыть модель, но дату пока не называет.
scmp.com/tech/article/3361482/worlds-first-ai-model-earn-perfect-score-maths-olympiad-comes-chinas-rednote
dots-note-3.0 решила все шесть задач Международной математической олимпиады 2026 года. Официальные проверяющие поставили модели по 7 баллов за каждое доказательство. Такой же результат показали лишь 7 из 666 участников.
Результат особенно важен из-за формата IMO. Здесь оценивают полный ход доказательства: пропущенный случай, логический разрыв или неуказанное условие снижают балл, даже если итоговый ответ верный.
Модель работала с исходными условиями задач, использовала агентный цикл с рассуждениями на естественном языке и выполнением Python-кода. Затем она проверяла собственные доказательства, находила слабые места и переписывала решения. Во время тестирования вмешательство людей было запрещено.
Для сравнения: в 2025 году модели Google DeepMind и OpenAI получили по 35 баллов из 42, что соответствовало уровню золотой медали.
dots-note-3.0 пока находится в бете и является самой лёгкой моделью семейства dots3. В него также входят более крупные jazz и aria. RedNote обещает открыть модель, но дату пока не называет.
scmp.com/tech/article/3361482/worlds-first-ai-model-earn-perfect-score-maths-olympiad-comes-chinas-rednote
👍8❤6🔥4
МТС True Tech и ВТБ 2 августа приглашают на масштабное событие этого лета для специалистов по Data Science «Урбан ML».
В трех залах пройдут 17 выступлений и мастер-классов по RecSys, антифроду, NLP, LLM и агентным системам. Выступят Data Science-лидеры и эксперты из компаний: MTC Web Services (MWS), ВТБ, RWB, Sber AI Lab, X5, Звук, Альфа Банк и других компаний.
Мероприятие пройдет в московском лофте с атмосферным двором. Участников ждут нетворкинг-активности, баскетбол, ИИ-шахматы и настольный теннис. А вечером — афтепати с диджей-миксами под открытым небом.
Когда: 2 августа 11:00 — 22:00
Где: Москва, офлайн
Участие бесплатное по предварительной регистрации.
Количество мест ограничено.
erid: 2W5zFFwJDaH
В трех залах пройдут 17 выступлений и мастер-классов по RecSys, антифроду, NLP, LLM и агентным системам. Выступят Data Science-лидеры и эксперты из компаний: MTC Web Services (MWS), ВТБ, RWB, Sber AI Lab, X5, Звук, Альфа Банк и других компаний.
Мероприятие пройдет в московском лофте с атмосферным двором. Участников ждут нетворкинг-активности, баскетбол, ИИ-шахматы и настольный теннис. А вечером — афтепати с диджей-миксами под открытым небом.
Когда: 2 августа 11:00 — 22:00
Где: Москва, офлайн
Участие бесплатное по предварительной регистрации.
Количество мест ограничено.
erid: 2W5zFFwJDaH
👍3🔥2❤1
OpenAI собрала библиотеку реальных сценариев работы с ChatGPT и Codex
На сайте Work, in progress публикуют практические кейсы, эксперименты и промпты от разработчиков и обычных пользователей.
Среди примеров:
* создание сайтов, API и интерактивных инструментов;
* работа с несколькими ИИ-агентами;
* анализ документов и исследования;
* ревью и исправление кода;
* монтаж видео через Codex;
* автоматизация повседневных задач.
Материалы можно фильтровать по продукту, типу задачи, автору и языку. Полезная база идей для тех, кто ищет реальные способы встроить ChatGPT и Codex в работу.
https://work-in-progress.openai.chatgpt.site/
На сайте Work, in progress публикуют практические кейсы, эксперименты и промпты от разработчиков и обычных пользователей.
Среди примеров:
* создание сайтов, API и интерактивных инструментов;
* работа с несколькими ИИ-агентами;
* анализ документов и исследования;
* ревью и исправление кода;
* монтаж видео через Codex;
* автоматизация повседневных задач.
Материалы можно фильтровать по продукту, типу задачи, автору и языку. Полезная база идей для тех, кто ищет реальные способы встроить ChatGPT и Codex в работу.
https://work-in-progress.openai.chatgpt.site/
❤5🔥5👍2