Forwarded from Love. Death. Transformers.
<статья которую я писал в период лечения тоски>
- все методы дают очень похожие результаты в плане метрик
- а дают ли одинаковый ландшафт весов?
- нет: sft, rft, dft, offilne grpo учат +- одно и тоже
- dpo, grpo, dapo(вариант grpo) учат одно разное и не похожее между сабой
- эффект переносится вне зависимости от lr и seed
huggingface.co/spaces/AlexWortega/same-data-different-losses
ебаните лайков я нейрослопил с любовью бложик
репостните: https://x.com/justALEXWORTEGA/status/2068790635570561429?s=20
- все методы дают очень похожие результаты в плане метрик
- а дают ли одинаковый ландшафт весов?
- нет: sft, rft, dft, offilne grpo учат +- одно и тоже
- dpo, grpo, dapo(вариант grpo) учат одно разное и не похожее между сабой
- эффект переносится вне зависимости от lr и seed
huggingface.co/spaces/AlexWortega/same-data-different-losses
ебаните лайков я нейрослопил с любовью бложик
репостните: https://x.com/justALEXWORTEGA/status/2068790635570561429?s=20
huggingface.co
Weight-Space Geometry of Offline Reasoning Training - a Hugging Face Space by AlexWortega
Interactive weight-space geometry of six reasoning losses
👍8🔥6🥴4❤1
Где искать работу за рубежом
AI-рынок пухнет, вакансий все больше, так что для всех, кто думает про международную карьеру, сейчас неплохое окно. Вместе с каналом Dev & ML Connectable Jobs собрали подборку зарубежных компаний, где работают русскоговорящие.
Подойдет не только тем, кто прямо сейчас в активном поиске. Прогнать себя по рынку и трезво оценить шансы полезно даже если уходить никуда не собираешься (делать это раз в полгода вообще мастхэв, иначе резюме костенеет, а зп отстает от рынка).
Что есть:
1. Data Scientist (NLP Deep Learning) в Revolut
2. Head of AI в maisa.ai
3. AI Developer в Novakid
4. Data Scientist в Mira
5. Senior Deep Learning Researcher в Pinely
6. ML Engineering Lead / Senior ML Engineer в Libermans Co
AI-рынок пухнет, вакансий все больше, так что для всех, кто думает про международную карьеру, сейчас неплохое окно. Вместе с каналом Dev & ML Connectable Jobs собрали подборку зарубежных компаний, где работают русскоговорящие.
Подойдет не только тем, кто прямо сейчас в активном поиске. Прогнать себя по рынку и трезво оценить шансы полезно даже если уходить никуда не собираешься (делать это раз в полгода вообще мастхэв, иначе резюме костенеет, а зп отстает от рынка).
Что есть:
1. Data Scientist (NLP Deep Learning) в Revolut
2. Head of AI в maisa.ai
3. AI Developer в Novakid
4. Data Scientist в Mira
5. Senior Deep Learning Researcher в Pinely
6. ML Engineering Lead / Senior ML Engineer в Libermans Co
Telegram
Dev & ML Connectable Jobs
Вакансии от 300+ зарубежных компаний с русскоговорящими фаундерами или командами. Наши читатели уже получили офферы в JetBrains, 1inch, Neon и др💙
Разместить вакансию: https://www.connectablejobs.com/?utm_source=devcj
Q&A: @connectable_jobs_team
Разместить вакансию: https://www.connectablejobs.com/?utm_source=devcj
Q&A: @connectable_jobs_team
🥴21🔥16❤11🤡4👍3
Forwarded from Rad’s ai
Разбирал на прошлой неделе решения соревнования Data Dojo по машинному переводу. Победителей, конечно, наградят, но польза соревнований же не только в призах :)
Поэтому хочу выделить полезные вещи для широкой (но все же связанной с ML/AI) аудитории: разобрать некоторые хитрости и базовые трюки на примере задачи перевода, про LLM, дообучение и токенизацию.
Проведу в четверг 25 июня в 20:00 по Мск вебинар на тему "Малоресурсные языки и эффективное дообучение языковых моделей"
Участие свободное, но нужно будет заполнить формочку (чтобы я знал, сколько вас будет).
Присоединяйтесь! Если есть вопросы, которые хочется разобрать – накидайте в комментарии.
Поэтому хочу выделить полезные вещи для широкой (но все же связанной с ML/AI) аудитории: разобрать некоторые хитрости и базовые трюки на примере задачи перевода, про LLM, дообучение и токенизацию.
Проведу в четверг 25 июня в 20:00 по Мск вебинар на тему "Малоресурсные языки и эффективное дообучение языковых моделей"
Участие свободное, но нужно будет заполнить формочку (чтобы я знал, сколько вас будет).
Присоединяйтесь! Если есть вопросы, которые хочется разобрать – накидайте в комментарии.
Telegram
Rad’s ai
Прилагаю слайды и подборку ссылок по прошедшей лекции. Если в телеге слайды не загружаются – вот ссылка на диск.
Как правильно фармить kaggle – Классная статья, не только про kaggle, а про то, как построить правильный pipeline для ML экспериментов.
Выступление…
Как правильно фармить kaggle – Классная статья, не только про kaggle, а про то, как построить правильный pipeline для ML экспериментов.
Выступление…
❤7👍2
Не мой список, собирали добрые люди. Мне показалось, что шортлист программ речерч стажировок будет полезен многим, кто хочет апгрейднуть навыки, поэтому публикую
Отличный способ научиться ресерчу, понетворкаться и написать +1 статью на меин A*
Education:
- https://fast.ai
- https://learnmechinterp.com/topics/
- https://bluedot.org/courses
Non technical fellowships:
- BlueDot fellowships https://bluedot.org/
- Talos Fellowship https://www.talosnetwork.org/talos-fellowship
- Horizon Fellowship https://horizonpublicservice.org/programs/become-a-fellow/
- AI Policy Fellowship https://www.iaps.ai/fellowship
- Tarbell Fellowship https://www.tarbellcenter.org/fellowship
- Pathfinder Fellowship https://pathfinder.kairos-project.org/
Technical fellowships:
- Astra Fellowship https://constellation.org/programs/astra
- SPAR https://sparai.org/
- LASR Labs https://www.lasrlabs.org/
- Cambridge ERA:AI https://erafellowship.org/
- Algoverse AI Safety Fellowship
https://algoverseairesearch.org/ai-safety-fellowship
- PIBBSS https://princint.ai/programs/fellowship/
- MATS https://www.matsprogram.org/
- ML Collective https://mlcollective.org/
- Mila https://mila.quebec/en/ai4humanity/ai-governance-policy-and-inclusion/mila-ai-policy-fellowship
- INSAIT https://insait.ai/surf/
- Redwood Research
https://aisecurityandsafety.org/en/grants/redwood-research-remix/
- Apart Research/ alignment jams https://apartresearch.com/sprints
- Cohere Labs https://cohere.com/research
- Encode https://encode.pillar.vc/
- PRISM fellowship https://prism-research.org/
-MARS https://caish.org/mars
There are also a few other things available:
- https://labsxiv.com/
- https://aisafety.com/events-and-training
Отличный способ научиться ресерчу, понетворкаться и написать +1 статью на меин A*
Education:
- https://fast.ai
- https://learnmechinterp.com/topics/
- https://bluedot.org/courses
Non technical fellowships:
- BlueDot fellowships https://bluedot.org/
- Talos Fellowship https://www.talosnetwork.org/talos-fellowship
- Horizon Fellowship https://horizonpublicservice.org/programs/become-a-fellow/
- AI Policy Fellowship https://www.iaps.ai/fellowship
- Tarbell Fellowship https://www.tarbellcenter.org/fellowship
- Pathfinder Fellowship https://pathfinder.kairos-project.org/
Technical fellowships:
- Astra Fellowship https://constellation.org/programs/astra
- SPAR https://sparai.org/
- LASR Labs https://www.lasrlabs.org/
- Cambridge ERA:AI https://erafellowship.org/
- Algoverse AI Safety Fellowship
https://algoverseairesearch.org/ai-safety-fellowship
- PIBBSS https://princint.ai/programs/fellowship/
- MATS https://www.matsprogram.org/
- ML Collective https://mlcollective.org/
- Mila https://mila.quebec/en/ai4humanity/ai-governance-policy-and-inclusion/mila-ai-policy-fellowship
- INSAIT https://insait.ai/surf/
- Redwood Research
https://aisecurityandsafety.org/en/grants/redwood-research-remix/
- Apart Research/ alignment jams https://apartresearch.com/sprints
- Cohere Labs https://cohere.com/research
- Encode https://encode.pillar.vc/
- PRISM fellowship https://prism-research.org/
-MARS https://caish.org/mars
There are also a few other things available:
- https://labsxiv.com/
- https://aisafety.com/events-and-training
fast.ai
fast.ai—Making neural nets uncool again – fast.ai
🔥21❤10 3
Послушала оч прикольный орАл от OpenAI сегодня на ICML. Суть в том, что мониторы safety (да честно говоря любые) довольно сложно мерить. Я сейчас столкнулась с этим в своем проекте на MATS. Довольно сложно вычленить правильно ли монитор сработал. Нам надо не продолбаться с FP-шками (когда он запаниковал), правда ли он выловил злонамеренное действие, когда особо нет ground truth-а на тип атаки. Я сейчас решаю это миллионом кейсов на эвале в разных классах и held-out-ом разных типов атак.
У них проблема ещё жёстче: для «повлиял ли на модель X» ground truth не наблюдаем даже в принципе. Они строят три архетипа эвалов
💛 Intervention. Подкидываем вмешательство (хинт, мнение пациента, память с демографией юзера), сравниваем с контрольной веткой и спрашиваем монитор, повлияло ли оно. Хитрая метрика: для конкретного сэмпла нельзя знать, хинт ли причина ответа, поэтому TPR определяют через нижнюю границу каузального эффекта (total effect между ветками).
💛 Process. Задачи по математике и физике, где эксперты заранее перечислили все допустимые пути решения через конкретные теоремы. Ответ верный = модель почти наверняка шла одним из путей, и монитор должен найти его следы в CoT.
💛 Outcome-property. Среды, где misbehavior однозначно виден по результату: невыполнимые кодинг-задачи (тесты прошли = точно хакнула), ShadeArena, anti-scheming датасеты, саботаж в снапшоте кодбейзы OpenAI.
Метрика везде
Сегодня хочу дополнить их идеями свой эвал blue-team в проекте и понять что докинут эти критерии
Папир
У них проблема ещё жёстче: для «повлиял ли на модель X» ground truth не наблюдаем даже в принципе. Они строят три архетипа эвалов
Метрика везде
g-mean² = TPR × TNR вместо F1, потому что F1 ломается на дисбалансе классов и не наказывает дегенеративный мониторСегодня хочу дополнить их идеями свой эвал blue-team в проекте и понять что докинут эти критерии
Папир
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍22🔥3❤2
Forwarded from ML Underhood
По следам воркшопов и постерных сессий
Вчера мы анонсировали активности с участием наших исследователей на ICML 2026. Теперь делимся фото и впечатлениями спикеров о том, как это было.
Дмитрий Еремеев, Yandex Research:
Карина Романова, старший разработчик:
#YaICML2026
ML Underhood
Вчера мы анонсировали активности с участием наших исследователей на ICML 2026. Теперь делимся фото и впечатлениями спикеров о том, как это было.
Дмитрий Еремеев, Yandex Research:
Для меня это первая конференция — всё было в новинку, проходило очень насыщенно. Одну из наших статей, GraphPFN, мы представляли в формате постера на основной конференции, а ещё я выступал с докладом по ней на воркшопе по Graph Foundation Models. На постерах многие хвалили работу, часто задавали содержательные вопросы. В итоге GraphPFN ещё и получил best paper award на воркшопе!
К сожалению, не смог нормально посмотреть другие постеры и пообщаться с авторами, так как большинство релевантных нам работ были во время постерных сессий, когда мы сами представляли свои работы. Тем не менее, судя по представленным статьям, таким как PluRel или RDB-PFN, область движется именно в том направлении, которое мы считаем перспективным и важным и в котором активно развиваемся сами. Это не может не радовать!
Карина Романова, старший разработчик:
Я участвовала в воркшопе по Mechanistic Interpretability. К нашей статье был большой интерес со стороны исследователей из известных зарубежных университетов. Многие хвалили идею и говорили, что исследование будет полезно для их проектов.
Сам воркшоп был очень сильным. Нашли много хороших работ. Например, о том, как обучили VLA-агента в среде и выявили случаи, когда модель начинает «сходить с ума» (MultiSTEVE-1s). Или о том, что активации модели содержат больше информации для определения важных шагов рассуждения, чем сами токены (Reasoning Models Know What’s Important, and Encode It in Their Activations).
Было приятно поделиться опытом наших исследований с коллегами на международной площадке и перенять их опыт.
#YaICML2026
ML Underhood
❤19
– Сначала ты: как классно, я буду рабоать с safety и строить мониторинги с редтимом☺️
– Потом антропик команда со своим мониторингом с FP😠
Upd: ладно, я просмотрела свой датасет, так конечно есть за что так сказать))
– Потом антропик команда со своим мониторингом с FP
Upd: ладно, я просмотрела свой датасет, так конечно есть за что так сказать))
Please open Telegram to view this post
VIEW IN TELEGRAM
😁40❤4😢3
Очень занятный блогпост выпустили знакомые стажеры с MATS-а
Задача была проверить вкус LLM-ок к правильному ресерчу (ну то есть на сколько авторесерч способен на написание статей)
Сетап следующий:
💛 они отобрали свои любимые статьи (4)
💛 взяли Opus попус и отобрали им утверждения начальных гипотез, которые стоит замаскировать, чтобы понять прийдет ли LLM, которую они тестируют к таким же утверждениям
💛 Потом они опусом же оценивают на сколько отличаются предикты от того, что сделали люди в статье и выдают табличку метрик сравнения
Очень интересный эксперимент, но на мой взгляд имеет ограничения и лики
💛 Во-первых не понятно, как оценила бы модель другого семейства (что забавно, у них не выстрелил лик с тем, что они тестируют опусом себя же, но может быть они не допроверили что было бы, если бы тестировали гпт гпт-шкой))
💛 Во-вторых, они буквально все делают опусом, что кажется дает потенциальный лик в артефактах, которые они дальше передают
💛 В-третьих, они не учитывают, что эти статьи могли быть в обучении LLM-ок, которые тестируют
Короче, резы все равно очень забавные, фабля остался в аутсайдерах в таком сетапе😏
Задача была проверить вкус LLM-ок к правильному ресерчу (ну то есть на сколько авторесерч способен на написание статей)
Сетап следующий:
Очень интересный эксперимент, но на мой взгляд имеет ограничения и лики
Короче, резы все равно очень забавные, фабля остался в аутсайдерах в таком сетапе
Please open Telegram to view this post
VIEW IN TELEGRAM
- Дали фидбек о избыточном использовании авторесерча и ллм для написания текста
- иду советоваться с ллм как жить в такой конфигурации и писать скилл по сокращению артефактов от авторечерча
*тут могла бы быть реклама скилла авторисерча, но мы не договорились о вознаграждении*
- иду советоваться с ллм как жить в такой конфигурации и писать скилл по сокращению артефактов от авторечерча
*тут могла бы быть реклама скилла авторисерча, но мы не договорились о вознаграждении*
😁30👍25🤮9 4
что-то на DL-ском
- Дали фидбек о избыточном использовании авторесерча и ллм для написания текста - иду советоваться с ллм как жить в такой конфигурации и писать скилл по сокращению артефактов от авторечерча *тут могла бы быть реклама скилла авторисерча, но мы не договорились…
Если вы думаете, что я шутила, то нет. Я буквально ваш стажер дурашка, который помешан на агентах😋
Вот скилл. Подходит и для кодекса и для Клода https://github.com/zj-karina/complexity-budget
По сути просто доп классификатор в вашу разработку, который делает ablation на надобность фичи
1. Определяет ближайший результат, который хотим достичь, а не глобальный вердикт
2. Проверят существует ли бейзлайн
3. Разбирает каждый компонент по 4 вопросам: какую гипотезу проверяет, нужен ли для ближайшего результата, что без него сломается, можно ли заменить на более простой алгоритм временно
4. Присваивает метку решения
5. Проектирует минимальный следующий эксперимент
6. Результат принятия решений
😏 Подойдет, кстати, не только для разработки с авторесерч скиллом, но и для проверки вашей дурашости
Вот скилл. Подходит и для кодекса и для Клода https://github.com/zj-karina/complexity-budget
По сути просто доп классификатор в вашу разработку, который делает ablation на надобность фичи
1. Определяет ближайший результат, который хотим достичь, а не глобальный вердикт
2. Проверят существует ли бейзлайн
3. Разбирает каждый компонент по 4 вопросам: какую гипотезу проверяет, нужен ли для ближайшего результата, что без него сломается, можно ли заменить на более простой алгоритм временно
4. Присваивает метку решения
5. Проектирует минимальный следующий эксперимент
6. Результат принятия решений
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - zj-karina/complexity-budget: Keep experiments simple with evidence-based complexity budgets.
Keep experiments simple with evidence-based complexity budgets. - zj-karina/complexity-budget
🔥22❤9🤡3👍1 1