Снова пост-солянка!
1. В Google Scholar мой профиль перешагнул отметку в 100 цитирований. Приятно!
2. В X (бывший Twitter) есть статья, которая набрала 170млн просмотров. Ждал, что её кто-то переведет, но в итоге сделал это сам для vc и Хабра Суммарно вышло 200тыс просмотров и много полярных комментов. Статья называется: «Как исправить всю свою жизнь за один день».
3. Писали статью на конфу. В этот раз основной связкой были VS Code + Codex для работы с LaTeX. В ChatGPT Pro загружал проект целиком вместе с PDF и просил прожарить – удобно искать несоответствия фактов, артефакты верстки. Кстати, пробовал Cursor на месяц, но не зашло: низкие лимиты, слабая модель автодополнения, да и IDE-агентами я почти не пользуюсь (предпочитаю терминальные). В итоге вернулся в VS Code + терминальные агенты.
4. Игорь написал классный лонгрид про тестовое в Anthropic. Статья: Anthropic Performance Team Take-Home for Dummies. Вообще респект авторам, которые вставляют куски кода на Python или псевдокод в разборы алгоритмов. Мне в таком формате понимать всё гораздо проще. Если кода нет, приходится просить ChatGPT накидать примеры.
5. Прошлый пост с обновлением SWE-rebench в X залетел на 80тыс просмотров. Пробую разные форматы, но публикую редко. Если у вас есть советы, как эффективно вести X/что-то другое, или вы сами продвигаете свои продукты/research – поделитесь опытом, интересно послушать!
6. Сходили по совету друзей на постановку по Stranger Things. Там предыстория Векны. Я смотрел только первый сезон, остальное догнали кратким пересказом перед походом в театр. Понравилось, спецэффекты – оч классные!
Если что-то из пунктов интересует больше - пишите в комменты/личку.
1. В Google Scholar мой профиль перешагнул отметку в 100 цитирований. Приятно!
2. В X (бывший Twitter) есть статья, которая набрала 170млн просмотров. Ждал, что её кто-то переведет, но в итоге сделал это сам для vc и Хабра Суммарно вышло 200тыс просмотров и много полярных комментов. Статья называется: «Как исправить всю свою жизнь за один день».
3. Писали статью на конфу. В этот раз основной связкой были VS Code + Codex для работы с LaTeX. В ChatGPT Pro загружал проект целиком вместе с PDF и просил прожарить – удобно искать несоответствия фактов, артефакты верстки. Кстати, пробовал Cursor на месяц, но не зашло: низкие лимиты, слабая модель автодополнения, да и IDE-агентами я почти не пользуюсь (предпочитаю терминальные). В итоге вернулся в VS Code + терминальные агенты.
4. Игорь написал классный лонгрид про тестовое в Anthropic. Статья: Anthropic Performance Team Take-Home for Dummies. Вообще респект авторам, которые вставляют куски кода на Python или псевдокод в разборы алгоритмов. Мне в таком формате понимать всё гораздо проще. Если кода нет, приходится просить ChatGPT накидать примеры.
5. Прошлый пост с обновлением SWE-rebench в X залетел на 80тыс просмотров. Пробую разные форматы, но публикую редко. Если у вас есть советы, как эффективно вести X/что-то другое, или вы сами продвигаете свои продукты/research – поделитесь опытом, интересно послушать!
6. Сходили по совету друзей на постановку по Stranger Things. Там предыстория Векны. Я смотрел только первый сезон, остальное догнали кратким пересказом перед походом в театр. Понравилось, спецэффекты – оч классные!
Если что-то из пунктов интересует больше - пишите в комменты/личку.
🔥31❤7❤🔥6👍4
Мы тут в Nebius AI R&D выкатили новый тул для всех, кто работает с кодовыми агентами – ConTree 🌳
https://contree.dev/
Пока в альфа релизе, будем рады фидбеку и вопросам!
Начинаем раскатывать понемногу перед большим релизом, чтобы собрать фидбек и шлифануть все.
Мы давно работаем с агентами, и одна из ключевых сильных сторон нашей команды – это умение пилить инфру.
С агентами всегда стоит вопрос: где им безопасно и быстро выполнять код? В докере есть ограничения, а обычные виртуалки — слишком медленные. В итоге мы сделали свою песочницу на базе microVM.
Пара главных фичей:
+ Git-like ветвление стейта. Агент доходит до чекпойнта и может запустить 5 вариантов кода параллельно (идеально для MCTS/Beam Search). Если скрипт падает, агент откатывается назад за миллисекунды. Ошибки LLM теперь ничего не стоят.
+ Hardware-изоляция. Агент может крашнуть ядро или сделать rm -rf / — ConTree всё проглотит и мгновенно восстановится.
+ Готовый MCP сервер. Добавляешь пару строк в конфиг claude, и у него появляется неубиваемый облачный терминал.
Пишите в комменты или в личку, если хотите попробовать и свои вопросы! Мы поможем всё настроить и сделать тестовые запуски.
https://contree.dev/
Пока в альфа релизе, будем рады фидбеку и вопросам!
Начинаем раскатывать понемногу перед большим релизом, чтобы собрать фидбек и шлифануть все.
Мы давно работаем с агентами, и одна из ключевых сильных сторон нашей команды – это умение пилить инфру.
С агентами всегда стоит вопрос: где им безопасно и быстро выполнять код? В докере есть ограничения, а обычные виртуалки — слишком медленные. В итоге мы сделали свою песочницу на базе microVM.
Пара главных фичей:
+ Git-like ветвление стейта. Агент доходит до чекпойнта и может запустить 5 вариантов кода параллельно (идеально для MCTS/Beam Search). Если скрипт падает, агент откатывается назад за миллисекунды. Ошибки LLM теперь ничего не стоят.
+ Hardware-изоляция. Агент может крашнуть ядро или сделать rm -rf / — ConTree всё проглотит и мгновенно восстановится.
+ Готовый MCP сервер. Добавляешь пару строк в конфиг claude, и у него появляется неубиваемый облачный терминал.
Пишите в комменты или в личку, если хотите попробовать и свои вопросы! Мы поможем всё настроить и сделать тестовые запуски.
❤45🔥20👍6
Последние пару месяцев я плотно работал над этим релизом, и наконец-то мы выкатываем его в опенсорс!
📟 Встречайте SWE-rebench-V2: самый большой открытый, мультиязычный датасет для обучения кодовых агентов!
Вместе с командой Nebius AI R&D мы построили пайплайн для масштабного сбора задач из реальных GitHub репозиториев и теперь делимся всем с комьюнити. На текущий момент это самый большой и разнообразный открытый датасет подобных задач в мире.
Что внутри:
> 32 000+ задач — на базе реальных issue + готовый Docker-образ.
> 20 языков программирования. Некоторые языки (например, Lua или Clojure) вообще никогда раньше не были покрыты!
> 120 000+ дополнительных задач, собранных на базе реальных PR.
> Качество — задачи отфильтрованы и размечены с помощью ансамбля LLM. Также мы обогатили их метаданными и добавили интерфейсы, которые проверяются в тестах.
Вместе с датасетом мы дропаем техрепорт со всеми деталями нашего пайплайна и прогонами моделей.
📄 Статья и датасет
👾 Наш Discord (мы там онлайн, залетайте с фидбеком и вопросами).
✉️ Пост в X
Если есть любые мысли, идеи, предложения - приходите!
🔁 Буду благодарен за репост и пересылку!
📟 Встречайте SWE-rebench-V2: самый большой открытый, мультиязычный датасет для обучения кодовых агентов!
Вместе с командой Nebius AI R&D мы построили пайплайн для масштабного сбора задач из реальных GitHub репозиториев и теперь делимся всем с комьюнити. На текущий момент это самый большой и разнообразный открытый датасет подобных задач в мире.
Что внутри:
> 32 000+ задач — на базе реальных issue + готовый Docker-образ.
> 20 языков программирования. Некоторые языки (например, Lua или Clojure) вообще никогда раньше не были покрыты!
> 120 000+ дополнительных задач, собранных на базе реальных PR.
> Качество — задачи отфильтрованы и размечены с помощью ансамбля LLM. Также мы обогатили их метаданными и добавили интерфейсы, которые проверяются в тестах.
Вместе с датасетом мы дропаем техрепорт со всеми деталями нашего пайплайна и прогонами моделей.
📄 Статья и датасет
👾 Наш Discord (мы там онлайн, залетайте с фидбеком и вопросами).
✉️ Пост в X
Если есть любые мысли, идеи, предложения - приходите!
🔁 Буду благодарен за репост и пересылку!
❤64🔥35✍4👍3🤔1
недавно записали подкаст с ребятами из JetBrains Research
https://youtu.be/-G3e0qffIPE?is=MAmdpFNKXu3n16AB
Подкаст свежий, это только второй выпуск (первый был с Анной Коган, ex-ceo OpenCV)
поговорили про мой путь из стоматологии в рисерч, SWE-rebench, кодовых агентов,
наши свежие релизы (SWE-rebench-V2 и contree)!
Советую чекнуть профили ведущих!
Игорь один из авторов известного курса по CV на степике, это был мой первый курс по CV в 2019, который я экспрессом прошел перед хакатоном.
А у Ильи психологический бэкграунд + phd и сейчас он занимается human-AI experience
https://youtu.be/-G3e0qffIPE?is=MAmdpFNKXu3n16AB
Подкаст свежий, это только второй выпуск (первый был с Анной Коган, ex-ceo OpenCV)
поговорили про мой путь из стоматологии в рисерч, SWE-rebench, кодовых агентов,
наши свежие релизы (SWE-rebench-V2 и contree)!
Советую чекнуть профили ведущих!
Игорь один из авторов известного курса по CV на степике, это был мой первый курс по CV в 2019, который я экспрессом прошел перед хакатоном.
А у Ильи психологический бэкграунд + phd и сейчас он занимается human-AI experience
YouTube
Ibragim Badertdinov: From Dentistry to AI, Coding Agents, SWE-rebench | JetBrains Research Podcast
In our second episode, we chat with Ibragim Badertdinov from Nebius about SWE-rebench, coding agents, and his path from dentistry and AI.
Our first episode can be found here: https://youtu.be/W8wFQjKhb7s
Episode links:
SWE-rebench: https://swe-rebench.com/…
Our first episode can be found here: https://youtu.be/W8wFQjKhb7s
Episode links:
SWE-rebench: https://swe-rebench.com/…
🔥27❤19👍8
Мои новости сразу пачкой:
1. Пару недель назад сходил попить кофе с Ross Taylor из gr.inc ($10M raised), кофаундером Papers with Code (кто-то помнит еще такое?) и лидом по ризонингу в Llama 2/3. Сегодня они запустили свою платформу для RL - OpenReward. По сути, это клей между разными датасетами задач для RL и бэкендами для обучения (как Tinker, например). Мы поддержали там SWE-rebench-V2 с первого дня.
2. Обновили SWE-rebench Leaderboard. Заняло чуть больше времени, но добавили много нового — смотрите инсайты: https://swe-rebench.com/?insight=feb_2026
еще пост в X бодро разошелся на 120к и привел пару интересных контактов.
3. Буду выступать на конфе AI Engineer в Лондоне 9 апреля. У ребят имхо лучшие видео с выступлениями по этой теме. На конфе я расскажу про SWE-rebench: как собираем таски, как гоняем агентов и т.п. Го увидимся, если кто-то тоже там будет (правда, билетов уже нет). Но!
4. 7-го апреля будет более расширенное выступление с этой же темой в InnovatorGuild. У ребят классное комьюнити в Лондоне, приходите послушать про SWE-rebench. Вход свободный, просто зарегистрируйтесь на ивент в Luma. Если будет запрос - можем сделать запись. Ближе к датам выступлений еще раз закину анонс.
1. Пару недель назад сходил попить кофе с Ross Taylor из gr.inc ($10M raised), кофаундером Papers with Code (кто-то помнит еще такое?) и лидом по ризонингу в Llama 2/3. Сегодня они запустили свою платформу для RL - OpenReward. По сути, это клей между разными датасетами задач для RL и бэкендами для обучения (как Tinker, например). Мы поддержали там SWE-rebench-V2 с первого дня.
2. Обновили SWE-rebench Leaderboard. Заняло чуть больше времени, но добавили много нового — смотрите инсайты: https://swe-rebench.com/?insight=feb_2026
еще пост в X бодро разошелся на 120к и привел пару интересных контактов.
3. Буду выступать на конфе AI Engineer в Лондоне 9 апреля. У ребят имхо лучшие видео с выступлениями по этой теме. На конфе я расскажу про SWE-rebench: как собираем таски, как гоняем агентов и т.п. Го увидимся, если кто-то тоже там будет (правда, билетов уже нет). Но!
4. 7-го апреля будет более расширенное выступление с этой же темой в InnovatorGuild. У ребят классное комьюнити в Лондоне, приходите послушать про SWE-rebench. Вход свободный, просто зарегистрируйтесь на ивент в Luma. Если будет запрос - можем сделать запись. Ближе к датам выступлений еще раз закину анонс.
❤🔥24❤8🔥4👍2🎉1
Два доклада и как прошел AI Engineer: впечатления спикера
Прошлая неделя выдалась плотной: я выступил с докладом про SWE-rebench Leaderboard два раза!
Сначала заглянул на Innovation Guild. Хорошая аудитория, комфортная атмосфера. Получилось отлично пообщаться, классные вопросы — спасибо Айбулату за приглашение! Если вы в Лондоне, горячо рекомендую заглядывать к ним в офлайне.
Про AI Engineer Europe. Это их первый ивент в Европе, и планку они задали высокую. В отличие от академических конференций, здесь выше концентрация более сенсорных практиков + удивило, что большая часть людей, с кем общался были не из Лондона а из СФ и около. Swyx ( один из оргов конфы), сказал, что для ребят из штатов – конфа – вариант, чтобы на деньги компании сгонят потусить в Лондон.
Про спикеров: на кейноутах был Pragmatic Engineer, создатель OpenClaw и другие
Еще мне повезло с соседями на ужине для спикеров, сидели рядом и общались с:
> Matt Pocock (250k в x, 170k YouTube), первый человек не из СНГ, который знает про Казань), посоветовал сгонять на юго запад Англии и попробовать настолку quacks
> Ryan Lopopolo из OpenAI, который написал вот эту статью про работу с агентами
> Peter Gostev из llm-arena, создатель bullshit benchmark
> Alex Volkov – ведет подкаст W&B, знал почти всех спикеров
Отдельно рад был повидаться с ребятами:
> Макс из tessl. Он уже написал свой фидбэк на конференцию, можете посмотреть
> Боря из ElevenLabs. Он автор вирального проекта, где агенты общаются на своем языке . В этот раз они привезли настоящую английскую красную будку, где по телефону общаешься с моделью. Загляните к Боре в пост разбор как он это сделал, не зря его позвали в Антропик рассказать, как он взломал физический телефон Клод кодом.
Также прикрепляю презентацию со своего выступления, а как только организаторы выложат видео — поделюсь ссылкой!
Прошлая неделя выдалась плотной: я выступил с докладом про SWE-rebench Leaderboard два раза!
Сначала заглянул на Innovation Guild. Хорошая аудитория, комфортная атмосфера. Получилось отлично пообщаться, классные вопросы — спасибо Айбулату за приглашение! Если вы в Лондоне, горячо рекомендую заглядывать к ним в офлайне.
Про AI Engineer Europe. Это их первый ивент в Европе, и планку они задали высокую. В отличие от академических конференций, здесь выше концентрация более сенсорных практиков + удивило, что большая часть людей, с кем общался были не из Лондона а из СФ и около. Swyx ( один из оргов конфы), сказал, что для ребят из штатов – конфа – вариант, чтобы на деньги компании сгонят потусить в Лондон.
Про спикеров: на кейноутах был Pragmatic Engineer, создатель OpenClaw и другие
Еще мне повезло с соседями на ужине для спикеров, сидели рядом и общались с:
> Matt Pocock (250k в x, 170k YouTube), первый человек не из СНГ, который знает про Казань), посоветовал сгонять на юго запад Англии и попробовать настолку quacks
> Ryan Lopopolo из OpenAI, который написал вот эту статью про работу с агентами
> Peter Gostev из llm-arena, создатель bullshit benchmark
> Alex Volkov – ведет подкаст W&B, знал почти всех спикеров
Отдельно рад был повидаться с ребятами:
> Макс из tessl. Он уже написал свой фидбэк на конференцию, можете посмотреть
> Боря из ElevenLabs. Он автор вирального проекта, где агенты общаются на своем языке . В этот раз они привезли настоящую английскую красную будку, где по телефону общаешься с моделью. Загляните к Боре в пост разбор как он это сделал, не зря его позвали в Антропик рассказать, как он взломал физический телефон Клод кодом.
Также прикрепляю презентацию со своего выступления, а как только организаторы выложат видео — поделюсь ссылкой!
🔥19❤11❤🔥4👍1
Как я смонтировал видео с лекции прямо с телефона (и без ручного труда)
Выложил видео с недавнего выступления на Innovation Guild. Посмотреть можно тут.
Я никогда не занимался видеомонтажом и не хотел тратить на это время. Был запрос: уложиться в час-два максимум и получить адекватное качество.
Более того, я хотел сделать это автоматически и автономно , так что я запустил агента и вышел из дома, потом уже просто с телефона апдейтнул таски (с телефона есть доступ к tmux на маке).
Кажется, сейчас записать и свести любую лекцию можно вообще без продакшена и минимальным ручным трудом (чтобы по airdrop скинуть материалы, запустить codex / Claude code и потом загрузить видео на YouTube).
📱 Оборудование: Два Айфона и штатив.
> Один айфон стоял на штативе и писал видео.
> Второй айфон просто положили рядом и включил диктофон. Использовать звук с камеры — плохая идея, он получается глухим и далеким.
> На руках была обычная PDF-ка со слайдами презентации.
🛠 Workflow
Я закинул тяжелое видео с камеры (около 30 ГБ), аудио с диктофона и PDF-презентацию в одну папку. Дальше попросил кодекс наложить и синхронизировать аудио с диктофона на видео и добавить слайды.
Вот что он сделал по моему промпту:
1. Сжал 30-гиговый исходник под YouTube на 2.5 ГБ.
2. Аудио и видео были разной длины. Скрипт сам порезал, синхронизировал дорожки и наложил звук с диктофона на видеоряд.
3. На видео слайды с проектора засвечены и плохо читаются. Попросил скрипт вытащить каждый слайд из PDF в виде картинки, порезать видео на кадры и вставить чистые слайды по 15 секунд поверх видеоряда там, где они переключаются. (Когда слайдов немного, можно вручную подправить таймстемпы чтобы лучше синхронизировать, но я был с телефона и было лень)
4. В кубере был под с GPU. Я просто попросил Codex сходить на этот под, поставить туда Whisper, перекинуть аудиофайл, прогнать транскрибацию и вернуть готовые субтитры. Он там еще сверху шлифанул текст, так как я вставляю английскую терминологию в русский. И сделал сообщение с таймстемпами для ютуба.
5. Когда пришел домой выбрал из обложек для видео которые он сделал, попросил сделать одну правку и загрузил на ютуб.
Теперь все публичные выступления буду так записывать и обрабатывать.
Выложил видео с недавнего выступления на Innovation Guild. Посмотреть можно тут.
Я никогда не занимался видеомонтажом и не хотел тратить на это время. Был запрос: уложиться в час-два максимум и получить адекватное качество.
Более того, я хотел сделать это автоматически и автономно , так что я запустил агента и вышел из дома, потом уже просто с телефона апдейтнул таски (с телефона есть доступ к tmux на маке).
Кажется, сейчас записать и свести любую лекцию можно вообще без продакшена и минимальным ручным трудом (чтобы по airdrop скинуть материалы, запустить codex / Claude code и потом загрузить видео на YouTube).
📱 Оборудование: Два Айфона и штатив.
> Один айфон стоял на штативе и писал видео.
> Второй айфон просто положили рядом и включил диктофон. Использовать звук с камеры — плохая идея, он получается глухим и далеким.
> На руках была обычная PDF-ка со слайдами презентации.
🛠 Workflow
Я закинул тяжелое видео с камеры (около 30 ГБ), аудио с диктофона и PDF-презентацию в одну папку. Дальше попросил кодекс наложить и синхронизировать аудио с диктофона на видео и добавить слайды.
Вот что он сделал по моему промпту:
1. Сжал 30-гиговый исходник под YouTube на 2.5 ГБ.
2. Аудио и видео были разной длины. Скрипт сам порезал, синхронизировал дорожки и наложил звук с диктофона на видеоряд.
3. На видео слайды с проектора засвечены и плохо читаются. Попросил скрипт вытащить каждый слайд из PDF в виде картинки, порезать видео на кадры и вставить чистые слайды по 15 секунд поверх видеоряда там, где они переключаются. (Когда слайдов немного, можно вручную подправить таймстемпы чтобы лучше синхронизировать, но я был с телефона и было лень)
4. В кубере был под с GPU. Я просто попросил Codex сходить на этот под, поставить туда Whisper, перекинуть аудиофайл, прогнать транскрибацию и вернуть готовые субтитры. Он там еще сверху шлифанул текст, так как я вставляю английскую терминологию в русский. И сделал сообщение с таймстемпами для ютуба.
5. Когда пришел домой выбрал из обложек для видео которые он сделал, попросил сделать одну правку и загрузил на ютуб.
Теперь все публичные выступления буду так записывать и обрабатывать.
YouTube
SWE-rebench: Как мы тестировали ИИ-агентов на реальных задачах разработчиков
В этом видео я (Ибрагим Бадертдинов) рассказываю про наш бенчмарк для ИИ-агентов и делюсь результатами тестирования. Это запись моего доклада с лондонского митапа Innovation Guild https://innovators.london/about.
О чем поговорим:
Как ИИ-программисты (кодинг…
О чем поговорим:
Как ИИ-программисты (кодинг…
❤🔥35🔥32👍12👏3
Буду в Казани, решил сделать небольшое выступление + встречу подписчиков.
Поговорим про кодовых агентов. Сделал комфортный уровень для понимания, но при этом плотно по смыслу. Никакой сухой теории или пересказов чужих кейсов — сконцентрированный опыт по агентам и эвалам: как гоняем сами, как сравнивать модели итп. Будет полезно тем, кто уже ими пользуется и/или интересуется темой.
Ещё добавил развлекательную часть: расскажу, как агенты «читерят», и поделюсь историями.
Приходите, буду рад!
Встречаемся в новом IT-парке 4 мая в 18:00
https://it-akademiya-3c.timepad.ru/event/3939782/
Поговорим про кодовых агентов. Сделал комфортный уровень для понимания, но при этом плотно по смыслу. Никакой сухой теории или пересказов чужих кейсов — сконцентрированный опыт по агентам и эвалам: как гоняем сами, как сравнивать модели итп. Будет полезно тем, кто уже ими пользуется и/или интересуется темой.
Ещё добавил развлекательную часть: расскажу, как агенты «читерят», и поделюсь историями.
Приходите, буду рад!
Встречаемся в новом IT-парке 4 мая в 18:00
https://it-akademiya-3c.timepad.ru/event/3939782/
❤21🔥14❤🔥5👍4
Когда-то в университетские годы мы много организовывали мероприятия с минимальным бюджетом. Концерт студвесны на два часа: с костюмами, реквизитом и типографией — умудрялись собрать примерно за 12 тысяч рублей.
Потом были ивенты побольше. На одном из награждений нужно было накормить 100+ человек, а бюджет был всё такой же минимальный. Тогда мы собрали волонтёров, которые помогли приготовить огромный казан плова — им в итоге всех и накормили.
С тех пор прошло много времени, но любовь к офлайн-ивентам осталась. Особенно в новых городах: это всё ещё один из лучших способов развиртуализироваться, познакомиться с людьми и быстрее погрузиться в локальное комьюнити.
И вот теперь мы в Nebius делаем такой ивент уже в нашем лондонском офисе на Holborn 21 мая.
Nebius.Build/LON — прикладной ивент для AI-билдеров. Будут выступления от ребят из NVIDIA, JetBrains, Wayve, Tavily и Nebius, разговоры про ML-инфру, inference scaling, agentic systems, продукты, ресёрч и всё, что вы сейчас строите.
Плова на сто человек не обещаю, но еда, напитки и нетворкинг будут.
Если вы в Лондоне и вам близка AI / ML / infra / agents-тусовка — приходите, буду рад увидеться!
Регистрация тут:
https://nebius.com/events/nebius-build-london
Потом были ивенты побольше. На одном из награждений нужно было накормить 100+ человек, а бюджет был всё такой же минимальный. Тогда мы собрали волонтёров, которые помогли приготовить огромный казан плова — им в итоге всех и накормили.
С тех пор прошло много времени, но любовь к офлайн-ивентам осталась. Особенно в новых городах: это всё ещё один из лучших способов развиртуализироваться, познакомиться с людьми и быстрее погрузиться в локальное комьюнити.
И вот теперь мы в Nebius делаем такой ивент уже в нашем лондонском офисе на Holborn 21 мая.
Nebius.Build/LON — прикладной ивент для AI-билдеров. Будут выступления от ребят из NVIDIA, JetBrains, Wayve, Tavily и Nebius, разговоры про ML-инфру, inference scaling, agentic systems, продукты, ресёрч и всё, что вы сейчас строите.
Плова на сто человек не обещаю, но еда, напитки и нетворкинг будут.
Если вы в Лондоне и вам близка AI / ML / infra / agents-тусовка — приходите, буду рад увидеться!
Регистрация тут:
https://nebius.com/events/nebius-build-london
❤🔥20❤17🔥12💩2
В начале апреля я выступал на AI Engineer Europe – и на днях вышло видео моего доклада!
имхо: AI Engineer — сейчас одна из лучших конференций по прикладному AI. Еще у них есть YouTube-канал, на 500к+ подписчиков, куда выкладывают видео выступлений. Там много классных записей!
видео доклада:
https://youtu.be/wcUJWP6WpGM
Я рассказывал про лидерборд SWE-rebench — динамический бенчмарк со свежими SWE-задачами с GitHub:
https://swe-rebench.com/
Если бы мне нужно было выделить главные выводы, я бы выбрал эти:
> Динамические бенчмарки помогают держать задачи свежими и снижают контаминацию.
> Для запуска SWE-эвалов нужны не только GPU: вам также понадобится масштабируемая инфраструктура исполнения для сэндбоксов.
> Хорошие задачи должны быть решаемыми, но при этом достаточно сложными и показывать значимую разницу между моделями.
> Высококачественные верифицируемые эвалы могут стать основой для будущих датасетов для RL-обучения.
P.S. Вышло забавно: на превью у них всегда лицо спикера. И для моей сессии они просто апскейлнули кусок кадра из видео — и получилась довольно вольная интерпретация моей внешности из низкого разрешения! (можете сравнить с фотографиями в профиле)
имхо: AI Engineer — сейчас одна из лучших конференций по прикладному AI. Еще у них есть YouTube-канал, на 500к+ подписчиков, куда выкладывают видео выступлений. Там много классных записей!
видео доклада:
https://youtu.be/wcUJWP6WpGM
Я рассказывал про лидерборд SWE-rebench — динамический бенчмарк со свежими SWE-задачами с GitHub:
https://swe-rebench.com/
Если бы мне нужно было выделить главные выводы, я бы выбрал эти:
> Динамические бенчмарки помогают держать задачи свежими и снижают контаминацию.
> Для запуска SWE-эвалов нужны не только GPU: вам также понадобится масштабируемая инфраструктура исполнения для сэндбоксов.
> Хорошие задачи должны быть решаемыми, но при этом достаточно сложными и показывать значимую разницу между моделями.
> Высококачественные верифицируемые эвалы могут стать основой для будущих датасетов для RL-обучения.
P.S. Вышло забавно: на превью у них всегда лицо спикера. И для моей сессии они просто апскейлнули кусок кадра из видео — и получилась довольно вольная интерпретация моей внешности из низкого разрешения! (можете сравнить с фотографиями в профиле)
❤🔥28🔥18😁9👍4❤2💩1👀1
За последний месяц сделали несколько апдейтов SWE-rebench Leaderboard:
https://swe-rebench.com/
> собрали новые задачи и прогнали кучу моделей на свежем срезе
> обновили интерфейс, сделали его более понятным и красивым
> добавили rebench в HarborHub: теперь бенчмарк можно запускать в Harbor
Мы немного поменяли формат апдейтов: теперь делаем их не каждый месяц, а примерно раз в два месяца. Зато в каждом таком обновлении сразу прогоняем много моделей на пачке из примерно 100 свежих задач.
Ещё один интересный момент: независимый исследователь прогнал наши задачи и задачи SWE-bench Pro на предмет качества. По его оценке, в нашем бенчмарке оказалось меньше задач с явными проблемами, чем в SWE-bench Pro. Это приятно, учитывая, что в последнем апдейте мы не смотрели задачи вручную: всё было собрано автоматически, тогда как в SWE-bench Pro было много ручной разметки.
> SWE-rebench audit: 7 / 110 ≈ 6% unsolvable tasks
> SWE-bench-PRO audit: 172 / 728 ≈ 24% unsolvable tasks
Ещё я записал прямой эфир с ребятами про бенчмаркинг кодинговых агентов.
@etechlead
@ai_driven
Очень классно поговорили о том, как всё устроено, какие есть проблемы в оценке моделей и как вообще стоит смотреть на такие бенчмарки.
https://www.youtube.com/live/C0jDYsrBPuk
https://swe-rebench.com/
> собрали новые задачи и прогнали кучу моделей на свежем срезе
> обновили интерфейс, сделали его более понятным и красивым
> добавили rebench в HarborHub: теперь бенчмарк можно запускать в Harbor
Мы немного поменяли формат апдейтов: теперь делаем их не каждый месяц, а примерно раз в два месяца. Зато в каждом таком обновлении сразу прогоняем много моделей на пачке из примерно 100 свежих задач.
Ещё один интересный момент: независимый исследователь прогнал наши задачи и задачи SWE-bench Pro на предмет качества. По его оценке, в нашем бенчмарке оказалось меньше задач с явными проблемами, чем в SWE-bench Pro. Это приятно, учитывая, что в последнем апдейте мы не смотрели задачи вручную: всё было собрано автоматически, тогда как в SWE-bench Pro было много ручной разметки.
> SWE-rebench audit: 7 / 110 ≈ 6% unsolvable tasks
> SWE-bench-PRO audit: 172 / 728 ≈ 24% unsolvable tasks
Ещё я записал прямой эфир с ребятами про бенчмаркинг кодинговых агентов.
@etechlead
@ai_driven
Очень классно поговорили о том, как всё устроено, какие есть проблемы в оценке моделей и как вообще стоит смотреть на такие бенчмарки.
https://www.youtube.com/live/C0jDYsrBPuk
Youtube
- YouTube
Enjoy the videos and music you love, upload original content, and share it all with friends, family, and the world on YouTube.
❤🔥15👍11🔥8❤3💩1
Приехал в Сеул на ICML (одна из трех топ ai конференций) с SWE-rebench-v2, который прошёл сюда, так что буду со стенгазетой на постерной сессии ICML, а потом ещё на воркшопе про код.
В этот раз у нас здесь большая команда и сразу две статьи на main track.
Приходите, если вы тоже здесь, и пишите — сгоняем попить прохладительные напитки.
Фотку приложу со своей прошлой поездки в Сеул, потому что новых пока не сделал.
В этот раз у нас здесь большая команда и сразу две статьи на main track.
Приходите, если вы тоже здесь, и пишите — сгоняем попить прохладительные напитки.
Фотку приложу со своей прошлой поездки в Сеул, потому что новых пока не сделал.
👍39❤9💩7❤🔥5🔥4
Вернувшись с ICML, с головой закопался в новый апдейт SWE-rebench и лидерборда! 🛠️
Этот релиз мы сделали масштабнее, он мультиязычный. Собрал 111 задач на 5 языках, сделал кучу прогонов и зарылся в траектории агентов, чтобы отловить, как именно модели читерят и обманывают эвалы.
Всю более подробную аналитику собрал в большой блогпост.
📊 Статья с разбором: https://teletype.in/@ibragim_bad/swe-rebench-2026-07
🏆 Лидерборд: https://swe-rebench.com/
Этот релиз мы сделали масштабнее, он мультиязычный. Собрал 111 задач на 5 языках, сделал кучу прогонов и зарылся в траектории агентов, чтобы отловить, как именно модели читерят и обманывают эвалы.
Всю более подробную аналитику собрал в большой блогпост.
📊 Статья с разбором: https://teletype.in/@ibragim_bad/swe-rebench-2026-07
🏆 Лидерборд: https://swe-rebench.com/
Teletype
SWE-rebench Leaderboard: большое мультиязычное обновление
В свежем релизе SWE-rebench мы собрали 111 задач на пяти популярных языках программирования, ужесточили фильтрацию и добавили аналитику...
🔥27❤🔥7💩4👍1