Sandbagging, scheming звучит как сексуальные фетиши если есть фантазия
🍓58 16👍2👏1😁1
Сделал примерно самый пиздатый трейсинг, заменяет wandb и langfuse tracehouse.ai
https://tracehouse.ai/p/893ff162-40d2-45bd-a658-201f64d84817?t=FUGDHc51W8oFMpAy0rPnZeL03qfc9Lyf
https://tracehouse.ai/p/893ff162-40d2-45bd-a658-201f64d84817?t=FUGDHc51W8oFMpAy0rPnZeL03qfc9Lyf
💩73🔥30🤡19💊7❤🔥1😁1
словно хуй дроченый в жопу альтмана
фейбл выпустили пацаны
сша сказали "так не надо бля"
и перерубили все концы
скоро вы, уёбища, ответите
зря бенчмарки в трейн ты заливал
если б не пиар, фейбл не тронули бы
не дадим негражданам юзать
вы молитесь, суки, о прощении
kyc теперь не пустой звук
испарили воду вы всю в Кении
охлаждайте жопу и бегите в суд
фейбл выпустили пацаны
сша сказали "так не надо бля"
и перерубили все концы
скоро вы, уёбища, ответите
зря бенчмарки в трейн ты заливал
если б не пиар, фейбл не тронули бы
не дадим негражданам юзать
вы молитесь, суки, о прощении
kyc теперь не пустой звук
испарили воду вы всю в Кении
охлаждайте жопу и бегите в суд
😭195 65😁43💩10 5❤🔥4🔥4💋2💅2🥴1🍓1
Forwarded from Старший Авгур
Уже почти полгода я занимаюсь разработкой Keenable, нового поискового движка для агентов. Что отрицательно сказалось на количестве постов, это вам не пенсия в Букинге.
Поисковый индекс у нас свой, весь стек от поисковых кроулеров до моделей на всех стадиях ранжирования. Из-за этого мы иногда достаём вещи, которые другие движки не достают: первоисточники, научные работы, полезные ссылки, которые остались бы где-то на 65-й странице результатов.
Подключить к агенту (Claude Code, Cursor и т.п.) можно за минуту, без регистрации и СМС: https://keenable.ai/SKILL.md.
Рейт-лимиты довольно щедрые: https://docs.keenable.ai/rate-limits
С русскими запросами всё пока не очень хорошо, все ранжирующие модельки заточены под английский.
Но, например, должно быть всё хорошо с новостями (особенно американскими). Поддерживаются фильтры по датам и "site:"
Поисковый индекс у нас свой, весь стек от поисковых кроулеров до моделей на всех стадиях ранжирования. Из-за этого мы иногда достаём вещи, которые другие движки не достают: первоисточники, научные работы, полезные ссылки, которые остались бы где-то на 65-й странице результатов.
Подключить к агенту (Claude Code, Cursor и т.п.) можно за минуту, без регистрации и СМС: https://keenable.ai/SKILL.md.
Рейт-лимиты довольно щедрые: https://docs.keenable.ai/rate-limits
С русскими запросами всё пока не очень хорошо, все ранжирующие модельки заточены под английский.
Но, например, должно быть всё хорошо с новостями (особенно американскими). Поддерживаются фильтры по датам и "site:"
🔥74👍15
SIQ-1-35B
Короче я обучил qwen35b a3 с PPO и я первый раз в жизни увидел чтобы PPO докидывало нормально(reward был верифицируемый)
Эта штука на karpathy autoresearch для parametr golf лучше чем glm5.2 и qwen350b и генерит идеи похожие на опус
А еще она на bullshit бенч лучше чем NEX и gpt5.5
Модель + gguf:
https://huggingface.co/AlexWortega/SIQ-1-35B
Демо чтобы гонять на zero gpu и радоваться:
https://huggingface.co/spaces/AlexWortega/hermes-agent-zerogpu
Короче я обучил qwen35b a3 с PPO и я первый раз в жизни увидел чтобы PPO докидывало нормально(reward был верифицируемый)
Эта штука на karpathy autoresearch для parametr golf лучше чем glm5.2 и qwen350b и генерит идеи похожие на опус
А еще она на bullshit бенч лучше чем NEX и gpt5.5
Модель + gguf:
https://huggingface.co/AlexWortega/SIQ-1-35B
Демо чтобы гонять на zero gpu и радоваться:
https://huggingface.co/spaces/AlexWortega/hermes-agent-zerogpu
👍81🤡33🔥15💊13💩5🍓5❤🔥1🤔1
Forwarded from commit history
В начале апреля я выступал на AI Engineer Europe – и на днях вышло видео моего доклада!
имхо: AI Engineer — сейчас одна из лучших конференций по прикладному AI. Еще у них есть YouTube-канал, на 500к+ подписчиков, куда выкладывают видео выступлений. Там много классных записей!
видео доклада:
https://youtu.be/wcUJWP6WpGM
Я рассказывал про лидерборд SWE-rebench — динамический бенчмарк со свежими SWE-задачами с GitHub:
https://swe-rebench.com/
Если бы мне нужно было выделить главные выводы, я бы выбрал эти:
> Динамические бенчмарки помогают держать задачи свежими и снижают контаминацию.
> Для запуска SWE-эвалов нужны не только GPU: вам также понадобится масштабируемая инфраструктура исполнения для сэндбоксов.
> Хорошие задачи должны быть решаемыми, но при этом достаточно сложными и показывать значимую разницу между моделями.
> Высококачественные верифицируемые эвалы могут стать основой для будущих датасетов для RL-обучения.
P.S. Вышло забавно: на превью у них всегда лицо спикера. И для моей сессии они просто апскейлнули кусок кадра из видео — и получилась довольно вольная интерпретация моей внешности из низкого разрешения! (можете сравнить с фотографиями в профиле)
имхо: AI Engineer — сейчас одна из лучших конференций по прикладному AI. Еще у них есть YouTube-канал, на 500к+ подписчиков, куда выкладывают видео выступлений. Там много классных записей!
видео доклада:
https://youtu.be/wcUJWP6WpGM
Я рассказывал про лидерборд SWE-rebench — динамический бенчмарк со свежими SWE-задачами с GitHub:
https://swe-rebench.com/
Если бы мне нужно было выделить главные выводы, я бы выбрал эти:
> Динамические бенчмарки помогают держать задачи свежими и снижают контаминацию.
> Для запуска SWE-эвалов нужны не только GPU: вам также понадобится масштабируемая инфраструктура исполнения для сэндбоксов.
> Хорошие задачи должны быть решаемыми, но при этом достаточно сложными и показывать значимую разницу между моделями.
> Высококачественные верифицируемые эвалы могут стать основой для будущих датасетов для RL-обучения.
P.S. Вышло забавно: на превью у них всегда лицо спикера. И для моей сессии они просто апскейлнули кусок кадра из видео — и получилась довольно вольная интерпретация моей внешности из низкого разрешения! (можете сравнить с фотографиями в профиле)
🔥36🎉8👍6⚡1😎1
Forwarded from Zhovner Hub
This media is not supported in your browser
VIEW IN TELEGRAM
FlipCTL — наш графический фреймворк для встраиваемых Линукс систем
Выкладываю черновик поста на русском, до того как его переведут или отредактируют. Чтобы никто не доебался, что текст сгенерирован AI.
TL;DR
* Все GUI на кибердеках говно — потому что никто не хочет разрабатывать пиксель-перфект интерфейсы
* Мы хотим сделать нормальный пацанский HMI (Human Machine Interface) для хакерских кибердеров. Называется FlipCTL
* Это будет софт + отдельная железа с экраном и кнопками от Flipper One
* Его можно будет использовать на Flippe One а так же прикрутить к любом одноплатнику типа Raspberry Pi
Дискас:
https://blog.flipper.net/p/424ce402-df71-417b-80ec-74f35493f041/
Выкладываю черновик поста на русском, до того как его переведут или отредактируют. Чтобы никто не доебался, что текст сгенерирован AI.
TL;DR
* Все GUI на кибердеках говно — потому что никто не хочет разрабатывать пиксель-перфект интерфейсы
* Мы хотим сделать нормальный пацанский HMI (Human Machine Interface) для хакерских кибердеров. Называется FlipCTL
* Это будет софт + отдельная железа с экраном и кнопками от Flipper One
* Его можно будет использовать на Flippe One а так же прикрутить к любом одноплатнику типа Raspberry Pi
Дискас:
https://blog.flipper.net/p/424ce402-df71-417b-80ec-74f35493f041/
1🔥58💩11🥴4
Forwarded from Жека Тигор
Новый видос! https://www.youtube.com/watch?v=u0Y0fRci_5o
Локальные LLM: инфра и безопасность Евгений Новиков x Xecut Hackerspace
В комментах слайды: оригинал .md и готовая к просмотру .html
Локальные LLM: инфра и безопасность Евгений Новиков x Xecut Hackerspace
В комментах слайды: оригинал .md и готовая к просмотру .html
YouTube
Локальные LLM: инфра и безопасность Евгений Новиков x Xecut Hackerspace
Секция «Локальные LLM: инфраструктура и информационная безопасность»
Модератор: Евгений https://t.iss.one/the_tigor Новиков, эксперт по локальному запуску LLM.
Поговорим о больших языковых моделях, которые можно запускать у себя: на рабочей станции, сервере…
Модератор: Евгений https://t.iss.one/the_tigor Новиков, эксперт по локальному запуску LLM.
Поговорим о больших языковых моделях, которые можно запускать у себя: на рабочей станции, сервере…
хочу serverless сервить 30б, какой нынче способ лучше?
ранпод говно с лейтенси на запуск 5 минут, гайс у меня есть гугл не надо мне давать 1 решение
ранпод говно с лейтенси на запуск 5 минут, гайс у меня есть гугл не надо мне давать 1 решение
🤡22💊7💩5🙉3🔥1
Forwarded from что-то на DL-ском
Наша статья принята на ICML, а это значит, что надо было сделать постер. Хочется сделать его быстро и качественно, поэтому не долго думая я решила, что ебаться с этим мы не хотим. Хотим, чтобы это делал Claude когда он уже будет делать все мои дела пока я пью пиво???
Я отсмотрела все инструменты в интернете для создания постеров автоматизировано и решила запихнуть все фичи в один универсальный скилл. Так родился скилл для генерации постеров, который универесально может вам сгенерить постер для любой конференции по их требованиям к формату и люой вашей идее дизайна
Как это работает:
💛 устанавливаете скилл из моей репы https://github.com/zj-karina/conference-poster
💛 клод интервьюирует вас на предмет какая конференция или воркшоп вас интересует и какая статья. Можете это все закинуть ему ссылками. Он найдет все за вас
💛 после у вас есть выбор в каком стиле сделать ваш постер и при желании можно дать ключик к fal.ai, чтобы получился например такой стиль как у нашего постера с my little pony
Кст суть статьи следующая. Кучу offline RL лоссов для дистилляции ризонинга (RFT, RIFT, DFT, Offline GRPO, DPO) сравнивают почти всегда только по accuracy на бенчах. Но никто не смотрит, что они реально делают с весами. Учат одни и те же цепи ризонинга с разной скоростью или это вообще разные вычисления?
Резы:
💛 SFT, RFT, RIFT это один и тот же апдейт
DFT внезапно выбивается сильнее всех
💛 Offline GRPO единственный reward-сигнал, который реально добавляет ортогональную компоненту
💛 DPO это вообще другой алгоритм, и геометрически, и по точности
Я отсмотрела все инструменты в интернете для создания постеров автоматизировано и решила запихнуть все фичи в один универсальный скилл. Так родился скилл для генерации постеров, который универесально может вам сгенерить постер для любой конференции по их требованиям к формату и люой вашей идее дизайна
Как это работает:
Кст суть статьи следующая. Кучу offline RL лоссов для дистилляции ризонинга (RFT, RIFT, DFT, Offline GRPO, DPO) сравнивают почти всегда только по accuracy на бенчах. Но никто не смотрит, что они реально делают с весами. Учат одни и те же цепи ризонинга с разной скоростью или это вообще разные вычисления?
Резы:
DFT внезапно выбивается сильнее всех
Please open Telegram to view this post
VIEW IN TELEGRAM
убейте людей которые не собирают блядский nightly vllm для своих еба моделей в докеры
😭56😁18 9🤡3 3
Давайте задонатим на a6000pro домой
Usdt trc20:
Usdt trc20:
TCkLihkiM1NTZnU7vJH3VagaWUpHgF2dsh