Machine learning Interview
30.2K subscribers
1.76K photos
154 videos
13 files
1.21K links
ИИ, Rust, вайбкодинг, Data Science, Deep Learning и делюсь тем, что интересно и полезно!

Вопросы - @workakkk

РКН: clck.ru/3FmwRz
Download Telegram
AI Agents Security Week от ШАДа: как делать ИИ-агентов, которым можно доверять

ИИ-агенты уже не просто отвечают в чате. Они пишут код, ходят в базы, вызывают инструменты, работают с файлами и могут влиять на реальные процессы.

Поэтому главный вопрос теперь не «как подключить агента», а как выстроить архитектуру так, чтобы агент делал ровно то, что от него нужно.

С 27 июля по 31 июля ШАД проведёт онлайн-интенсив AI Agents Security Week вместе с экспертами Яндекса.

Разберут практические вещи:

* чем автономные агенты отличаются от обычных LLM
* как безопасно давать агентам доступ к инструментам и данным
* как снижать риск утечек, взломов и ошибок конфигурации
* какие уязвимости появляются в агентных системах
* с какими проблемами уже сталкивались команды, которые делают ИИ-модели и продукты на их основе

Интенсив подойдёт ML-разработчикам, DevOps и DevSecOps-инженерам, техлидам, архитекторам, а также студентам старших курсов технических вузов.

Для практики пригодится понимание SDL и базовый опыт вайбкодинга: уметь поставить задачу модели, получить код и запустить его.

Формат: пять вечерних онлайн-занятий с возможностью задавать вопросы экспертам.

Чтобы получить сертификат, нужно пройти отборочное тестирование и выполнить итоговую работу.

Заявки принимают до 27 июля включительно.

Программа, спикеры и регистрация — на сайте.
🔥53👍1
Одна и та же ложь может по-разному влиять на LLM в зависимости от тона, уверенности и грамматической формы.

В EoBench собрали около 66 тысяч ложных утверждений в 19 стилях и проверили 18 моделей Gemma, Llama и Qwen. Для теста оставили только те факты, которые модель изначально знала правильно.

Лучше всего модели убеждали:

* приказы;
* формальный язык;
* обращение как к ребёнку;
* ссылки на авторитет;
* уверенная подача.

Хуже всего работали слабые формулировки и контрфактические утверждения.

Крупные модели реже принимали ложный контекст, а instruction tuning обычно дополнительно повышал устойчивость.

Вывод: оценивать LLM нужно с учётом формы запроса. Небольшое изменение формулировки может заметно изменить ответ модели.

Статья: *It’s Not What You Say, It’s How You Say It: Evaluating LLM Responses to Expressions of Belief*

arxiv.org/abs/2607.18232
12
Как научить матричную факторизацию реально планировать рекомендации на несколько шагов вперед

Несмотря на развитие рекомендательных трансформеров и генеративных моделей, матричные факторизации по-прежнему широко применяются в рекомендательных системах.

Обычно система берёт top-K айтемов, которые ближе всего к текущему эмбеддингу пользователя, не учитывая, как показ рекомендации изменит его профиль и последующие выдачи.

Исследователи AI VK решили добавить к ALS планирование через Monte Carlo Tree Search.

Работу Planning over Matrix-Factorization MDPs for Candidate Generation приняли на воркшопе Customer Journey в рамках KDD 2026.

### Как устроен подход

За основу взяли ALS и механику обновления профилей из сервиса Profile Stream во VK. Эмбеддинг пользователя там пересчитывается после новых взаимодействий, поэтому процесс можно представить как RL-среду:

- состояние — текущий эмбеддинг пользователя;
- действие — показ конкретного айтема;
- награда — близость к релевантным айтемам;
- переход — обновление эмбеддинга по формулам ALS в допущении оптимистичной среды

MCTS строит дерево возможных последовательностей рекомендаций. Каждая вершина соответствует состоянию пользователя, а ветви — кандидатам из top-K.

В офлайн-экспериментах использовался оптимистичный сценарий: при переходе считалось, что пользователю понравился показанный айтем. Далее профиль обновлялся, и поиск продолжался уже из нового состояния.

В результате

Эксперименты провели на VK-LSVD, MovieLens-1M, KuaiRec, Yambda.

При протоколе Leave-last-n планирование превзошло статический top-K на всех датасетах. На некоторых срезах VK-LSVD показатель Recall@10 вырос примерно в 1,5 раза.

При Global time split, который ближе к реальному продакшн-сценарию, прирост сохранился на MovieLens-1M и VK-LSVD.

Работа показывает, что поверх относительно лёгкой ALS можно использовать RL-планирование и учитывать будущую динамику пользовательского профиля.

Следующие шаги: моделирование стохастической среды по логам и дистилляция MCTS-агента в быструю политику в духе MuZero.

#aivkhub #rl #mcts #als
6👍4❤‍🔥3🔥2😁1🤩1
🚀 ИИ-модель китайской RedNote набрала 42 из 42 на математической олимпиаде

dots-note-3.0 решила все шесть задач Международной математической олимпиады 2026 года. Официальные проверяющие поставили модели по 7 баллов за каждое доказательство. Такой же результат показали лишь 7 из 666 участников.

Результат особенно важен из-за формата IMO. Здесь оценивают полный ход доказательства: пропущенный случай, логический разрыв или неуказанное условие снижают балл, даже если итоговый ответ верный.

Модель работала с исходными условиями задач, использовала агентный цикл с рассуждениями на естественном языке и выполнением Python-кода. Затем она проверяла собственные доказательства, находила слабые места и переписывала решения. Во время тестирования вмешательство людей было запрещено.

Для сравнения: в 2025 году модели Google DeepMind и OpenAI получили по 35 баллов из 42, что соответствовало уровню золотой медали.

dots-note-3.0 пока находится в бете и является самой лёгкой моделью семейства dots3. В него также входят более крупные jazz и aria. RedNote обещает открыть модель, но дату пока не называет.

scmp.com/tech/article/3361482/worlds-first-ai-model-earn-perfect-score-maths-olympiad-comes-chinas-rednote
👍86🔥4
МТС True Tech и ВТБ 2 августа приглашают на масштабное событие этого лета для специалистов по Data Science «Урбан ML».

В трех залах пройдут 17 выступлений и мастер-классов по RecSys, антифроду, NLP, LLM и агентным системам. Выступят Data Science-лидеры и эксперты из компаний: MTC Web Services (MWS), ВТБ, RWB, Sber AI Lab, X5, Звук, Альфа Банк и других компаний.

Мероприятие пройдет в московском лофте с атмосферным двором. Участников ждут нетворкинг-активности, баскетбол, ИИ-шахматы и настольный теннис. А вечером — афтепати с диджей-миксами под открытым небом.

Когда: 2 августа 11:00 — 22:00
Где: Москва, офлайн


Участие бесплатное по предварительной регистрации.
Количество мест ограничено.
erid: 2W5zFFwJDaH
👍3🔥21
OpenAI собрала библиотеку реальных сценариев работы с ChatGPT и Codex

На сайте Work, in progress публикуют практические кейсы, эксперименты и промпты от разработчиков и обычных пользователей.

Среди примеров:

* создание сайтов, API и интерактивных инструментов;
* работа с несколькими ИИ-агентами;
* анализ документов и исследования;
* ревью и исправление кода;
* монтаж видео через Codex;
* автоматизация повседневных задач.

Материалы можно фильтровать по продукту, типу задачи, автору и языку. Полезная база идей для тех, кто ищет реальные способы встроить ChatGPT и Codex в работу.

https://work-in-progress.openai.chatgpt.site/
🔥54👍2