SIQ-1-35B
Короче я обучил qwen35b a3 с PPO и я первый раз в жизни увидел чтобы PPO докидывало нормально(reward был верифицируемый)
Эта штука на karpathy autoresearch для parametr golf лучше чем glm5.2 и qwen350b и генерит идеи похожие на опус
А еще она на bullshit бенч лучше чем NEX и gpt5.5
Модель + gguf:
https://huggingface.co/AlexWortega/SIQ-1-35B
Демо чтобы гонять на zero gpu и радоваться:
https://huggingface.co/spaces/AlexWortega/hermes-agent-zerogpu
Короче я обучил qwen35b a3 с PPO и я первый раз в жизни увидел чтобы PPO докидывало нормально(reward был верифицируемый)
Эта штука на karpathy autoresearch для parametr golf лучше чем glm5.2 и qwen350b и генерит идеи похожие на опус
А еще она на bullshit бенч лучше чем NEX и gpt5.5
Модель + gguf:
https://huggingface.co/AlexWortega/SIQ-1-35B
Демо чтобы гонять на zero gpu и радоваться:
https://huggingface.co/spaces/AlexWortega/hermes-agent-zerogpu
👍81🤡33🔥15💊13💩5🍓5❤🔥1🤔1
Forwarded from commit history
В начале апреля я выступал на AI Engineer Europe – и на днях вышло видео моего доклада!
имхо: AI Engineer — сейчас одна из лучших конференций по прикладному AI. Еще у них есть YouTube-канал, на 500к+ подписчиков, куда выкладывают видео выступлений. Там много классных записей!
видео доклада:
https://youtu.be/wcUJWP6WpGM
Я рассказывал про лидерборд SWE-rebench — динамический бенчмарк со свежими SWE-задачами с GitHub:
https://swe-rebench.com/
Если бы мне нужно было выделить главные выводы, я бы выбрал эти:
> Динамические бенчмарки помогают держать задачи свежими и снижают контаминацию.
> Для запуска SWE-эвалов нужны не только GPU: вам также понадобится масштабируемая инфраструктура исполнения для сэндбоксов.
> Хорошие задачи должны быть решаемыми, но при этом достаточно сложными и показывать значимую разницу между моделями.
> Высококачественные верифицируемые эвалы могут стать основой для будущих датасетов для RL-обучения.
P.S. Вышло забавно: на превью у них всегда лицо спикера. И для моей сессии они просто апскейлнули кусок кадра из видео — и получилась довольно вольная интерпретация моей внешности из низкого разрешения! (можете сравнить с фотографиями в профиле)
имхо: AI Engineer — сейчас одна из лучших конференций по прикладному AI. Еще у них есть YouTube-канал, на 500к+ подписчиков, куда выкладывают видео выступлений. Там много классных записей!
видео доклада:
https://youtu.be/wcUJWP6WpGM
Я рассказывал про лидерборд SWE-rebench — динамический бенчмарк со свежими SWE-задачами с GitHub:
https://swe-rebench.com/
Если бы мне нужно было выделить главные выводы, я бы выбрал эти:
> Динамические бенчмарки помогают держать задачи свежими и снижают контаминацию.
> Для запуска SWE-эвалов нужны не только GPU: вам также понадобится масштабируемая инфраструктура исполнения для сэндбоксов.
> Хорошие задачи должны быть решаемыми, но при этом достаточно сложными и показывать значимую разницу между моделями.
> Высококачественные верифицируемые эвалы могут стать основой для будущих датасетов для RL-обучения.
P.S. Вышло забавно: на превью у них всегда лицо спикера. И для моей сессии они просто апскейлнули кусок кадра из видео — и получилась довольно вольная интерпретация моей внешности из низкого разрешения! (можете сравнить с фотографиями в профиле)
🔥36🎉8👍6⚡1😎1
Forwarded from Zhovner Hub
This media is not supported in your browser
VIEW IN TELEGRAM
FlipCTL — наш графический фреймворк для встраиваемых Линукс систем
Выкладываю черновик поста на русском, до того как его переведут или отредактируют. Чтобы никто не доебался, что текст сгенерирован AI.
TL;DR
* Все GUI на кибердеках говно — потому что никто не хочет разрабатывать пиксель-перфект интерфейсы
* Мы хотим сделать нормальный пацанский HMI (Human Machine Interface) для хакерских кибердеров. Называется FlipCTL
* Это будет софт + отдельная железа с экраном и кнопками от Flipper One
* Его можно будет использовать на Flippe One а так же прикрутить к любом одноплатнику типа Raspberry Pi
Дискас:
https://blog.flipper.net/p/424ce402-df71-417b-80ec-74f35493f041/
Выкладываю черновик поста на русском, до того как его переведут или отредактируют. Чтобы никто не доебался, что текст сгенерирован AI.
TL;DR
* Все GUI на кибердеках говно — потому что никто не хочет разрабатывать пиксель-перфект интерфейсы
* Мы хотим сделать нормальный пацанский HMI (Human Machine Interface) для хакерских кибердеров. Называется FlipCTL
* Это будет софт + отдельная железа с экраном и кнопками от Flipper One
* Его можно будет использовать на Flippe One а так же прикрутить к любом одноплатнику типа Raspberry Pi
Дискас:
https://blog.flipper.net/p/424ce402-df71-417b-80ec-74f35493f041/
1🔥58💩11🥴4
Forwarded from Жека Тигор
Новый видос! https://www.youtube.com/watch?v=u0Y0fRci_5o
Локальные LLM: инфра и безопасность Евгений Новиков x Xecut Hackerspace
В комментах слайды: оригинал .md и готовая к просмотру .html
Локальные LLM: инфра и безопасность Евгений Новиков x Xecut Hackerspace
В комментах слайды: оригинал .md и готовая к просмотру .html
YouTube
Локальные LLM: инфра и безопасность Евгений Новиков x Xecut Hackerspace
Секция «Локальные LLM: инфраструктура и информационная безопасность»
Модератор: Евгений https://t.iss.one/the_tigor Новиков, эксперт по локальному запуску LLM.
Поговорим о больших языковых моделях, которые можно запускать у себя: на рабочей станции, сервере…
Модератор: Евгений https://t.iss.one/the_tigor Новиков, эксперт по локальному запуску LLM.
Поговорим о больших языковых моделях, которые можно запускать у себя: на рабочей станции, сервере…
хочу serverless сервить 30б, какой нынче способ лучше?
ранпод говно с лейтенси на запуск 5 минут, гайс у меня есть гугл не надо мне давать 1 решение
ранпод говно с лейтенси на запуск 5 минут, гайс у меня есть гугл не надо мне давать 1 решение
🤡22💊7💩5🙉3🔥1
Forwarded from что-то на DL-ском
Наша статья принята на ICML, а это значит, что надо было сделать постер. Хочется сделать его быстро и качественно, поэтому не долго думая я решила, что ебаться с этим мы не хотим. Хотим, чтобы это делал Claude когда он уже будет делать все мои дела пока я пью пиво???
Я отсмотрела все инструменты в интернете для создания постеров автоматизировано и решила запихнуть все фичи в один универсальный скилл. Так родился скилл для генерации постеров, который универесально может вам сгенерить постер для любой конференции по их требованиям к формату и люой вашей идее дизайна
Как это работает:
💛 устанавливаете скилл из моей репы https://github.com/zj-karina/conference-poster
💛 клод интервьюирует вас на предмет какая конференция или воркшоп вас интересует и какая статья. Можете это все закинуть ему ссылками. Он найдет все за вас
💛 после у вас есть выбор в каком стиле сделать ваш постер и при желании можно дать ключик к fal.ai, чтобы получился например такой стиль как у нашего постера с my little pony
Кст суть статьи следующая. Кучу offline RL лоссов для дистилляции ризонинга (RFT, RIFT, DFT, Offline GRPO, DPO) сравнивают почти всегда только по accuracy на бенчах. Но никто не смотрит, что они реально делают с весами. Учат одни и те же цепи ризонинга с разной скоростью или это вообще разные вычисления?
Резы:
💛 SFT, RFT, RIFT это один и тот же апдейт
DFT внезапно выбивается сильнее всех
💛 Offline GRPO единственный reward-сигнал, который реально добавляет ортогональную компоненту
💛 DPO это вообще другой алгоритм, и геометрически, и по точности
Я отсмотрела все инструменты в интернете для создания постеров автоматизировано и решила запихнуть все фичи в один универсальный скилл. Так родился скилл для генерации постеров, который универесально может вам сгенерить постер для любой конференции по их требованиям к формату и люой вашей идее дизайна
Как это работает:
Кст суть статьи следующая. Кучу offline RL лоссов для дистилляции ризонинга (RFT, RIFT, DFT, Offline GRPO, DPO) сравнивают почти всегда только по accuracy на бенчах. Но никто не смотрит, что они реально делают с весами. Учат одни и те же цепи ризонинга с разной скоростью или это вообще разные вычисления?
Резы:
DFT внезапно выбивается сильнее всех
Please open Telegram to view this post
VIEW IN TELEGRAM
убейте людей которые не собирают блядский nightly vllm для своих еба моделей в докеры
😭56😁18 9🤡3 3
Давайте задонатим на a6000pro домой
Usdt trc20:
Usdt trc20:
TCkLihkiM1NTZnU7vJH3VagaWUpHgF2dsh- все методы дают очень похожие результаты в плане метрик
- а дают ли одинаковый ландшафт весов?
- нет: sft, rft, dft, offilne grpo учат +- одно и тоже
- dpo, grpo, dapo(вариант grpo) учат одно разное и не похожее между сабой
- эффект переносится вне зависимости от lr и seed
huggingface.co/spaces/AlexWortega/same-data-different-losses
ебаните лайков я нейрослопил с любовью бложик
репостните: https://x.com/justALEXWORTEGA/status/2068790635570561429?s=20
- а дают ли одинаковый ландшафт весов?
- нет: sft, rft, dft, offilne grpo учат +- одно и тоже
- dpo, grpo, dapo(вариант grpo) учат одно разное и не похожее между сабой
- эффект переносится вне зависимости от lr и seed
huggingface.co/spaces/AlexWortega/same-data-different-losses
ебаните лайков я нейрослопил с любовью бложик
репостните: https://x.com/justALEXWORTEGA/status/2068790635570561429?s=20
🔥65🥱20💩5👍3 2😁1🤡1😎1
- все методы дают очень похожие результаты в плане метрик
- а дают ли одинаковый ландшафт весов?
- нет: sft, rft, dft, offilne grpo учат +- одно и тоже
- dpo, grpo, dapo(вариант grpo) учат одно разное и не похожее между сабой
- эффект переносится вне зависимости от lr и seed
huggingface.co/spaces/AlexWortega/same-data-different-losses
ебаните лайков я нейрослопил с любовью бложик
репостните: https://x.com/justALEXWORTEGA/status/2068790635570561429?s=20
- а дают ли одинаковый ландшафт весов?
- нет: sft, rft, dft, offilne grpo учат +- одно и тоже
- dpo, grpo, dapo(вариант grpo) учат одно разное и не похожее между сабой
- эффект переносится вне зависимости от lr и seed
huggingface.co/spaces/AlexWortega/same-data-different-losses
ебаните лайков я нейрослопил с любовью бложик
репостните: https://x.com/justALEXWORTEGA/status/2068790635570561429?s=20
🔥59💊22👍12🥱5 5 4💩3🤡3❤🔥1
https://youtu.be/jbK80BswgBg?si=eOj0XrHQ7a39Bra4
Друзья, вдруг вам нечего смотреть этим вечером, можете посмотреть как два не молодых человека шутят про мл
Друзья, вдруг вам нечего смотреть этим вечером, можете посмотреть как два не молодых человека шутят про мл
YouTube
Повышение агентности, Владимир Платонов, Нестандартная модель #13
Представьте помощника, который не просто решает поставленную задачу, но и сам изучает лог, найходит проблему и исправляет ее. Работой над таким ИИ-агентом занимается в «Яндексе» Владимир Платонов. О том, какие какие проблемы на этом пути решают ML-разработчики…
😁30❤🔥16🤡9💩6🔥5🍓3
Forwarded from ЛОМ 🏴☠️
Лучше сосать бензин из шланга в канистру, чем всю жизнь сосать хозяевам на западе
😁127💯21💩10 9🔥1
Forwarded from partially unsupervised
☭ https://sovietrxiv.org ☭
Самое время идти к VC с питчем: "Ивахненко и Вапник - два моих деда, нашел их записные книжки на даче, дайте миллиард"
Самое время идти к VC с питчем: "Ивахненко и Вапник - два моих деда, нашел их записные книжки на даче, дайте миллиард"
🔥32💩8