commit history
4.29K subscribers
31 photos
7 videos
3 files
65 links
история моих коммитов про машинное обучение, карьеру и набитые шишки

@ibragim_bad
Download Telegram
Снова пост-солянка!

1. В Google Scholar мой профиль перешагнул отметку в 100 цитирований. Приятно!

2. В X (бывший Twitter) есть статья, которая набрала 170млн просмотров. Ждал, что её кто-то переведет, но в итоге сделал это сам для vc и Хабра Суммарно вышло 200тыс просмотров и много полярных комментов. Статья называется: «Как исправить всю свою жизнь за один день».

3. Писали статью на конфу. В этот раз основной связкой были VS Code + Codex для работы с LaTeX. В ChatGPT Pro загружал проект целиком вместе с PDF и просил прожарить – удобно искать несоответствия фактов, артефакты верстки. Кстати, пробовал Cursor на месяц, но не зашло: низкие лимиты, слабая модель автодополнения, да и IDE-агентами я почти не пользуюсь (предпочитаю терминальные). В итоге вернулся в VS Code + терминальные агенты.

4. Игорь написал классный лонгрид про тестовое в Anthropic. Статья: Anthropic Performance Team Take-Home for Dummies. Вообще респект авторам, которые вставляют куски кода на Python или псевдокод в разборы алгоритмов. Мне в таком формате понимать всё гораздо проще. Если кода нет, приходится просить ChatGPT накидать примеры.

5. Прошлый пост с обновлением SWE-rebench в X залетел на 80тыс просмотров. Пробую разные форматы, но публикую редко. Если у вас есть советы, как эффективно вести X/что-то другое, или вы сами продвигаете свои продукты/research – поделитесь опытом, интересно послушать!

6. Сходили по совету друзей на постановку по Stranger Things. Там предыстория Векны. Я смотрел только первый сезон, остальное догнали кратким пересказом перед походом в театр. Понравилось, спецэффекты – оч классные!

Если что-то из пунктов интересует больше - пишите в комменты/личку.
🔥317❤‍🔥6👍4
Мы тут в Nebius AI R&D выкатили новый тул для всех, кто работает с кодовыми агентами ConTree 🌳

https://contree.dev/

Пока в альфа релизе, будем рады фидбеку и вопросам!
Начинаем раскатывать понемногу перед большим релизом, чтобы собрать фидбек и шлифануть все.

Мы давно работаем с агентами, и одна из ключевых сильных сторон нашей команды – это умение пилить инфру.

С агентами всегда стоит вопрос: где им безопасно и быстро выполнять код? В докере есть ограничения, а обычные виртуалки — слишком медленные. В итоге мы сделали свою песочницу на базе microVM.

Пара главных фичей:
+ Git-like ветвление стейта. Агент доходит до чекпойнта и может запустить 5 вариантов кода параллельно (идеально для MCTS/Beam Search). Если скрипт падает, агент откатывается назад за миллисекунды. Ошибки LLM теперь ничего не стоят.

+ Hardware-изоляция. Агент может крашнуть ядро или сделать rm -rf / — ConTree всё проглотит и мгновенно восстановится.

+ Готовый MCP сервер. Добавляешь пару строк в конфиг claude, и у него появляется неубиваемый облачный терминал.

Пишите в комменты или в личку, если хотите попробовать и свои вопросы! Мы поможем всё настроить и сделать тестовые запуски.
45🔥20👍6
Последние пару месяцев я плотно работал над этим релизом, и наконец-то мы выкатываем его в опенсорс!

📟 Встречайте SWE-rebench-V2: самый большой открытый, мультиязычный датасет для обучения кодовых агентов!

Вместе с командой Nebius AI R&D мы построили пайплайн для масштабного сбора задач из реальных GitHub репозиториев и теперь делимся всем с комьюнити. На текущий момент это самый большой и разнообразный открытый датасет подобных задач в мире.

Что внутри:
> 32 000+ задач — на базе реальных issue + готовый Docker-образ.
> 20 языков программирования. Некоторые языки (например, Lua или Clojure) вообще никогда раньше не были покрыты!
> 120 000+ дополнительных задач, собранных на базе реальных PR.
> Качество — задачи отфильтрованы и размечены с помощью ансамбля LLM. Также мы обогатили их метаданными и добавили интерфейсы, которые проверяются в тестах.

Вместе с датасетом мы дропаем техрепорт со всеми деталями нашего пайплайна и прогонами моделей.

📄 Статья и датасет

👾 Наш Discord (мы там онлайн, залетайте с фидбеком и вопросами).

✉️ Пост в X

Если есть любые мысли, идеи, предложения - приходите!

🔁 Буду благодарен за репост и пересылку!
64🔥354👍3🤔1
недавно записали подкаст с ребятами из JetBrains Research

https://youtu.be/-G3e0qffIPE?is=MAmdpFNKXu3n16AB

Подкаст свежий, это только второй выпуск (первый был с Анной Коган, ex-ceo OpenCV)

поговорили про мой путь из стоматологии в рисерч, SWE-rebench, кодовых агентов,
наши свежие релизы (SWE-rebench-V2 и contree)!

Советую чекнуть профили ведущих!
Игорь один из авторов известного курса по CV на степике, это был мой первый курс по CV в 2019, который я экспрессом прошел перед хакатоном.

А у Ильи психологический бэкграунд + phd и сейчас он занимается human-AI experience
🔥2719👍8
Мои новости сразу пачкой:

1. Пару недель назад сходил попить кофе с Ross Taylor из gr.inc ($10M raised), кофаундером Papers with Code (кто-то помнит еще такое?) и лидом по ризонингу в Llama 2/3. Сегодня они запустили свою платформу для RL - OpenReward. По сути, это клей между разными датасетами задач для RL и бэкендами для обучения (как Tinker, например). Мы поддержали там SWE-rebench-V2 с первого дня.

2. Обновили SWE-rebench Leaderboard. Заняло чуть больше времени, но добавили много нового — смотрите инсайты: https://swe-rebench.com/?insight=feb_2026
еще пост в X бодро разошелся на 120к и привел пару интересных контактов.

3. Буду выступать на конфе AI Engineer в Лондоне 9 апреля. У ребят имхо лучшие видео с выступлениями по этой теме. На конфе я расскажу про SWE-rebench: как собираем таски, как гоняем агентов и т.п. Го увидимся, если кто-то тоже там будет (правда, билетов уже нет). Но!

4. 7-го апреля будет более расширенное выступление с этой же темой в InnovatorGuild. У ребят классное комьюнити в Лондоне, приходите послушать про SWE-rebench. Вход свободный, просто зарегистрируйтесь на ивент в Luma. Если будет запрос - можем сделать запись. Ближе к датам выступлений еще раз закину анонс.
❤‍🔥248🔥4👍2🎉1
Два доклада и как прошел AI Engineer: впечатления спикера

Прошлая неделя выдалась плотной: я выступил с докладом про SWE-rebench Leaderboard два раза!

Сначала заглянул на Innovation Guild. Хорошая аудитория, комфортная атмосфера. Получилось отлично пообщаться, классные вопросы — спасибо Айбулату за приглашение! Если вы в Лондоне, горячо рекомендую заглядывать к ним в офлайне.

Про AI Engineer Europe. Это их первый ивент в Европе, и планку они задали высокую. В отличие от академических конференций, здесь выше концентрация более сенсорных практиков + удивило, что большая часть людей, с кем общался были не из Лондона а из СФ и около. Swyx ( один из оргов конфы), сказал, что для ребят из штатов – конфа – вариант, чтобы на деньги компании сгонят потусить в Лондон.

Про спикеров: на кейноутах был Pragmatic Engineer, создатель OpenClaw и другие

Еще мне повезло с соседями на ужине для спикеров, сидели рядом и общались с:
> Matt Pocock (250k в x, 170k YouTube), первый человек не из СНГ, который знает про Казань), посоветовал сгонять на юго запад Англии и попробовать настолку quacks

> Ryan Lopopolo из OpenAI, который написал вот эту статью про работу с агентами

> Peter Gostev из llm-arena, создатель bullshit benchmark

> Alex Volkov – ведет подкаст W&B, знал почти всех спикеров

Отдельно рад был повидаться с ребятами:
> Макс из tessl. Он уже написал свой фидбэк на конференцию, можете посмотреть

> Боря из ElevenLabs. Он автор вирального проекта, где агенты общаются на своем языке . В этот раз они привезли настоящую английскую красную будку, где по телефону общаешься с моделью. Загляните к Боре в пост разбор как он это сделал, не зря его позвали в Антропик рассказать, как он взломал физический телефон Клод кодом.

Также прикрепляю презентацию со своего выступления, а как только организаторы выложат видео — поделюсь ссылкой!
🔥1911❤‍🔥4👍1
Как я смонтировал видео с лекции прямо с телефона (и без ручного труда)

Выложил видео с недавнего выступления на Innovation Guild. Посмотреть можно тут.

Я никогда не занимался видеомонтажом и не хотел тратить на это время. Был запрос: уложиться в час-два максимум и получить адекватное качество.

Более того, я хотел сделать это автоматически и автономно , так что я запустил агента и вышел из дома, потом уже просто с телефона апдейтнул таски (с телефона есть доступ к tmux на маке).

Кажется, сейчас записать и свести любую лекцию можно вообще без продакшена и минимальным ручным трудом (чтобы по airdrop скинуть материалы, запустить codex / Claude code и потом загрузить видео на YouTube).

📱 Оборудование: Два Айфона и штатив.

> Один айфон стоял на штативе и писал видео.
> Второй айфон просто положили рядом и включил диктофон. Использовать звук с камеры — плохая идея, он получается глухим и далеким.
> На руках была обычная PDF-ка со слайдами презентации.

🛠 Workflow
Я закинул тяжелое видео с камеры (около 30 ГБ), аудио с диктофона и PDF-презентацию в одну папку. Дальше попросил кодекс наложить и синхронизировать аудио с диктофона на видео и добавить слайды.

Вот что он сделал по моему промпту:

1. Сжал 30-гиговый исходник под YouTube на 2.5 ГБ.

2. Аудио и видео были разной длины. Скрипт сам порезал, синхронизировал дорожки и наложил звук с диктофона на видеоряд.

3. На видео слайды с проектора засвечены и плохо читаются. Попросил скрипт вытащить каждый слайд из PDF в виде картинки, порезать видео на кадры и вставить чистые слайды по 15 секунд поверх видеоряда там, где они переключаются. (Когда слайдов немного, можно вручную подправить таймстемпы чтобы лучше синхронизировать, но я был с телефона и было лень)

4. В кубере был под с GPU. Я просто попросил Codex сходить на этот под, поставить туда Whisper, перекинуть аудиофайл, прогнать транскрибацию и вернуть готовые субтитры. Он там еще сверху шлифанул текст, так как я вставляю английскую терминологию в русский. И сделал сообщение с таймстемпами для ютуба.

5. Когда пришел домой выбрал из обложек для видео которые он сделал, попросил сделать одну правку и загрузил на ютуб.

Теперь все публичные выступления буду так записывать и обрабатывать.
❤‍🔥35🔥32👍12👏3
Буду в Казани, решил сделать небольшое выступление + встречу подписчиков.

Поговорим про кодовых агентов. Сделал комфортный уровень для понимания, но при этом плотно по смыслу. Никакой сухой теории или пересказов чужих кейсов — сконцентрированный опыт по агентам и эвалам: как гоняем сами, как сравнивать модели итп. Будет полезно тем, кто уже ими пользуется и/или интересуется темой.

Ещё добавил развлекательную часть: расскажу, как агенты «читерят», и поделюсь историями.

Приходите, буду рад!
Встречаемся в новом IT-парке 4 мая в 18:00

https://it-akademiya-3c.timepad.ru/event/3939782/
21🔥14❤‍🔥5👍4
Когда-то в университетские годы мы много организовывали мероприятия с минимальным бюджетом. Концерт студвесны на два часа: с костюмами, реквизитом и типографией — умудрялись собрать примерно за 12 тысяч рублей.

Потом были ивенты побольше. На одном из награждений нужно было накормить 100+ человек, а бюджет был всё такой же минимальный. Тогда мы собрали волонтёров, которые помогли приготовить огромный казан плова — им в итоге всех и накормили.

С тех пор прошло много времени, но любовь к офлайн-ивентам осталась. Особенно в новых городах: это всё ещё один из лучших способов развиртуализироваться, познакомиться с людьми и быстрее погрузиться в локальное комьюнити.

И вот теперь мы в Nebius делаем такой ивент уже в нашем лондонском офисе на Holborn 21 мая.

Nebius.Build/LON — прикладной ивент для AI-билдеров. Будут выступления от ребят из NVIDIA, JetBrains, Wayve, Tavily и Nebius, разговоры про ML-инфру, inference scaling, agentic systems, продукты, ресёрч и всё, что вы сейчас строите.

Плова на сто человек не обещаю, но еда, напитки и нетворкинг будут.

Если вы в Лондоне и вам близка AI / ML / infra / agents-тусовка — приходите, буду рад увидеться!

Регистрация тут:
https://nebius.com/events/nebius-build-london
❤‍🔥2017🔥12💩2
В начале апреля я выступал на AI Engineer Europe – и на днях вышло видео моего доклада!

имхо: AI Engineer — сейчас одна из лучших конференций по прикладному AI. Еще у них есть YouTube-канал, на 500к+ подписчиков, куда выкладывают видео выступлений. Там много классных записей!

видео доклада:
https://youtu.be/wcUJWP6WpGM

Я рассказывал про лидерборд SWE-rebench — динамический бенчмарк со свежими SWE-задачами с GitHub:
https://swe-rebench.com/

Если бы мне нужно было выделить главные выводы, я бы выбрал эти:

> Динамические бенчмарки помогают держать задачи свежими и снижают контаминацию.
> Для запуска SWE-эвалов нужны не только GPU: вам также понадобится масштабируемая инфраструктура исполнения для сэндбоксов.
> Хорошие задачи должны быть решаемыми, но при этом достаточно сложными и показывать значимую разницу между моделями.
> Высококачественные верифицируемые эвалы могут стать основой для будущих датасетов для RL-обучения.

P.S. Вышло забавно: на превью у них всегда лицо спикера. И для моей сессии они просто апскейлнули кусок кадра из видео — и получилась довольно вольная интерпретация моей внешности из низкого разрешения! (можете сравнить с фотографиями в профиле)
❤‍🔥28🔥18😁9👍42💩1👀1
За последний месяц сделали несколько апдейтов SWE-rebench Leaderboard:

https://swe-rebench.com/

> собрали новые задачи и прогнали кучу моделей на свежем срезе
> обновили интерфейс, сделали его более понятным и красивым
> добавили rebench в HarborHub: теперь бенчмарк можно запускать в Harbor

Мы немного поменяли формат апдейтов: теперь делаем их не каждый месяц, а примерно раз в два месяца. Зато в каждом таком обновлении сразу прогоняем много моделей на пачке из примерно 100 свежих задач.

Ещё один интересный момент: независимый исследователь прогнал наши задачи и задачи SWE-bench Pro на предмет качества. По его оценке, в нашем бенчмарке оказалось меньше задач с явными проблемами, чем в SWE-bench Pro. Это приятно, учитывая, что в последнем апдейте мы не смотрели задачи вручную: всё было собрано автоматически, тогда как в SWE-bench Pro было много ручной разметки.

> SWE-rebench audit: 7 / 110 ≈ 6% unsolvable tasks

> SWE-bench-PRO audit: 172 / 728 ≈ 24% unsolvable tasks

Ещё я записал прямой эфир с ребятами про бенчмаркинг кодинговых агентов.
@etechlead
@ai_driven
Очень классно поговорили о том, как всё устроено, какие есть проблемы в оценке моделей и как вообще стоит смотреть на такие бенчмарки.

https://www.youtube.com/live/C0jDYsrBPuk
❤‍🔥15👍11🔥83💩1
Приехал в Сеул на ICML (одна из трех топ ai конференций) с SWE-rebench-v2, который прошёл сюда, так что буду со стенгазетой на постерной сессии ICML, а потом ещё на воркшопе про код.

В этот раз у нас здесь большая команда и сразу две статьи на main track.

Приходите, если вы тоже здесь, и пишите — сгоняем попить прохладительные напитки.

Фотку приложу со своей прошлой поездки в Сеул, потому что новых пока не сделал.
👍399💩7❤‍🔥5🔥4
Вернувшись с ICML, с головой закопался в новый апдейт SWE-rebench и лидерборда! 🛠️

Этот релиз мы сделали масштабнее, он мультиязычный. Собрал 111 задач на 5 языках, сделал кучу прогонов и зарылся в траектории агентов, чтобы отловить, как именно модели читерят и обманывают эвалы.

Всю более подробную аналитику собрал в большой блогпост.

📊 Статья с разбором: https://teletype.in/@ibragim_bad/swe-rebench-2026-07

🏆 Лидерборд: https://swe-rebench.com/
🔥27❤‍🔥7💩4👍1