Forwarded from NLP Wanderer
Halo: почти год моей работы в White Circle теперь в опенсорсе
Почти год я веду в White Circle разработку Halo - фреймворка для тренировки LLM, на котором мы учим все свои модели. Внутри он работал давно как замена Мегатрона, но до публичного релиза пришлось догнать transformers, TRL и vLLM, добавить модели и упростить адопшен - образы, CLI, документация. Подробный блогпост - на сайте White Circle (https://whitecircle.com/research/halo).
Если вы файнтюните открытые модели, то наверняка упирались в: модель уже не лезет в TRL и обычный FSDP, но связываться с Megatron и конвертацией чекпоинтов еще рано или просто не хочется. С MoE все еще хуже, без Expert Parallelism их по большому счету не потренировать. Halo добавляет EP, Context, Tensor и Expert-Tensor Parallelism прямо поверх обычных классов HuggingFace: на вход HF модель, на выходе HF модель. Новое MoE семейство подключается оберткой меньше 140 строк (у Megatron-Bridge на то же самое уходит 600-1900), сейчас их 15.
Немного цифр, все на B300, воспроизводимы из репо:
- 2.3-2.8x throughput относительно стокового TRL на gpt-oss-20b при тех же кернелах, loss совпадает в пределах ~1%.
- Gemma 4 26B-A4B на 2 GPU: 7.2k tok/s против 3.2-5.0k у NeMo AutoModel, Axolotl, Megatron Bridge, MS-SWIFT и Unsloth.
- Оптимизатор целиком в bf16 со стохастическим округлением: 120 GB состояния вместо 240 для 20B.
Все это првоерялось на реальных кластерах B300/B200/H200/H100 а топология заложена вплоть до NVL72: невалидные раскладки отбрасываются еще на этапе конфига. Запускается через
Отдельная моя гордость - Async RL. vLLM или SGLang живут в отдельном контейнере, роллауты идут асинхронно через Ray, веса уезжают по NCCL (по EFA 53-80 GB/s, gpt-oss-120b обновляется за 3-4 секунды), а генерации во время синка не обрываются. Внутри routing replay, importance sampling с масками, обучение на токенах, которые насэмплил движок, и 11 встроенных сред - от code contests и SWE до тулов через MCP. По механикам это сопоставимо с verl и Miles, только на HF-моделях и без Megatron.
Для студентов и тех, кто только начинает, Halo, мне кажется, хорошая точка входа. Все запускается из одного docker-образа:
Выложили и модель - GLM-4.7-Flash-Coder, 30B MoE под агентские скаффолды: SFT на 7.8k успешных траекторий GLM-5.1, на SWE-rebench-V2 pass@1 вырос с 33.2% до 41.7%, а модель сама научилась вызывать тулы параллельно. Она уже слегка устарела, но как гайд по агентскому SFT актуальна.
Код мы пишем с агентными скаффолдами и сильными моделями вроде Claude Fable и Opus, репозиторий под это спроектирован. Контрибьт приветствуется, но через фильтр: сначала issue и approve мейнтейнера, потом PR. Главное правило - понимать свой код: с AI писать можно, но это нужно раскрыть, а тесты должны падать, когда ломается поведение.
Дальше больше: Pipeline Parallelism (все уже в коде, но докатим после полных тестов) и серия блогов про тренировку, например про async RL для code contests. Лицензия Apache 2.0.
P.S. Если помните такую вещь как SMPO из времен Vikhr, то он теперь тоже живет там, но уже с EP и CP и улучшениями.
Почти год я веду в White Circle разработку Halo - фреймворка для тренировки LLM, на котором мы учим все свои модели. Внутри он работал давно как замена Мегатрона, но до публичного релиза пришлось догнать transformers, TRL и vLLM, добавить модели и упростить адопшен - образы, CLI, документация. Подробный блогпост - на сайте White Circle (https://whitecircle.com/research/halo).
Если вы файнтюните открытые модели, то наверняка упирались в: модель уже не лезет в TRL и обычный FSDP, но связываться с Megatron и конвертацией чекпоинтов еще рано или просто не хочется. С MoE все еще хуже, без Expert Parallelism их по большому счету не потренировать. Halo добавляет EP, Context, Tensor и Expert-Tensor Parallelism прямо поверх обычных классов HuggingFace: на вход HF модель, на выходе HF модель. Новое MoE семейство подключается оберткой меньше 140 строк (у Megatron-Bridge на то же самое уходит 600-1900), сейчас их 15.
Немного цифр, все на B300, воспроизводимы из репо:
- 2.3-2.8x throughput относительно стокового TRL на gpt-oss-20b при тех же кернелах, loss совпадает в пределах ~1%.
- Gemma 4 26B-A4B на 2 GPU: 7.2k tok/s против 3.2-5.0k у NeMo AutoModel, Axolotl, Megatron Bridge, MS-SWIFT и Unsloth.
- Оптимизатор целиком в bf16 со стохастическим округлением: 120 GB состояния вместо 240 для 20B.
Все это првоерялось на реальных кластерах B300/B200/H200/H100 а топология заложена вплоть до NVL72: невалидные раскладки отбрасываются еще на этапе конфига. Запускается через
torchrun, accelerate или halo CLI, в репо есть рецепты под SLURM, SkyPilot, RunPod и Nomad. Большая часть года ушла на то, чтобы все это не разваливалось на всех комбинациях моделей и параллелизмов - тестов в репозитории больше, чем кода. При этом работать будет также и на современных консьюмерских GPU.Отдельная моя гордость - Async RL. vLLM или SGLang живут в отдельном контейнере, роллауты идут асинхронно через Ray, веса уезжают по NCCL (по EFA 53-80 GB/s, gpt-oss-120b обновляется за 3-4 секунды), а генерации во время синка не обрываются. Внутри routing replay, importance sampling с масками, обучение на токенах, которые насэмплил движок, и 11 встроенных сред - от code contests и SWE до тулов через MCP. По механикам это сопоставимо с verl и Miles, только на HF-моделях и без Megatron.
Для студентов и тех, кто только начинает, Halo, мне кажется, хорошая точка входа. Все запускается из одного docker-образа:
halo launch sft config.yaml, а QLoRA Qwen3-4B занимает 7.9 GB и должна работать на 3090/4090. Документации больше 170 страниц, отдельно советую прочитать лекцию GPU Training Theory: база того как работают такие фреймворки, почему эксперты в MoE упираются в память, а не в compute, и почему в EP-шаге 88% времени - это all-to-all. Там же честно написано, что не помогает и что тихо ломает, например TF32 по умолчанию в NGC-образе, портящий RoPE после 2048 токенов.Выложили и модель - GLM-4.7-Flash-Coder, 30B MoE под агентские скаффолды: SFT на 7.8k успешных траекторий GLM-5.1, на SWE-rebench-V2 pass@1 вырос с 33.2% до 41.7%, а модель сама научилась вызывать тулы параллельно. Она уже слегка устарела, но как гайд по агентскому SFT актуальна.
Код мы пишем с агентными скаффолдами и сильными моделями вроде Claude Fable и Opus, репозиторий под это спроектирован. Контрибьт приветствуется, но через фильтр: сначала issue и approve мейнтейнера, потом PR. Главное правило - понимать свой код: с AI писать можно, но это нужно раскрыть, а тесты должны падать, когда ломается поведение.
Дальше больше: Pipeline Parallelism (все уже в коде, но докатим после полных тестов) и серия блогов про тренировку, например про async RL для code contests. Лицензия Apache 2.0.
P.S. Если помните такую вещь как SMPO из времен Vikhr, то он теперь тоже живет там, но уже с EP и CP и улучшениями.
❤🔥45🔥21👾5🤡4👍2💩2💊1
Tldr: китайские технологии в отдельных областях улетели в стратасферу, причем настолько далеко что уже пора их реверс инженерить
https://www.arenaphysica.com/publications/dji-teardown
https://www.arenaphysica.com/publications/dji-teardown
Arenaphysica
Can the US build a DJI?
How DJI achieves its exceptional margins, from a teardown of two popular drones.
🫡61🔥8👍3👏2😁1🥱1
Love. Death. Transformers.
спасибо @nadlskom за нормальный ui и @akhaliq за домен твитер репостить тут
v5 вышла, теперь она нативно училась с rlcd и на вижен и агентик задачах, теперь в 0.8b 2b и 4b размере, на каких то рандомных бенчах неплохо себя показывает
https://huggingface.co/AlexWortega/openjev
https://x.com/justalexwortega/status/2102828012362223864?s=46
https://huggingface.co/AlexWortega/openjev
https://x.com/justalexwortega/status/2102828012362223864?s=46
👍27🔥12😁5💊2⚡1
Forwarded from латте
ПРОВЕРЬ СВОЮ УЧИТЕЛЬНИЦУ НА ВБРОС
Около 40% УИКов находится в школах, а работают там те, в чьи обязанности входит(ло) нас обучать в самые юные годы.
Фальсификации происходят и там, а значит представители древнейшей профессии тоже оказываются замешанными в них...
Мы видим, что многие познакомились с результатами нашего исследования и даже поиграли в мини-игры на сайте.
Пора проверить и свои школы — переходите по ссылке: https://gosduma2026.org/#/school
Около 40% УИКов находится в школах, а работают там те, в чьи обязанности входит(ло) нас обучать в самые юные годы.
Фальсификации происходят и там, а значит представители древнейшей профессии тоже оказываются замешанными в них...
Мы видим, что многие познакомились с результатами нашего исследования и даже поиграли в мини-игры на сайте.
Пора проверить и свои школы — переходите по ссылке: https://gosduma2026.org/#/school
😭84😁48🤡29👍15💩11❤🔥4🥴3🤔2
SourceCraft
В обсуждениях GitLab теперь можно поручать задачи автономным ИИ-агентам. В SourceCraft появилась возможность подключать таких агентов для написания кода, проверки его безопасности и других задач разработки.
Агент работает под собственной учетной записью, самостоятельно выполняет задачу и возвращает результат на ревью. Если в процессе нужны дополнительные данные или согласование, он сам обращается к команде.
Можно подключать и собственных агентов, в том числе созданных в Yandex AI Studio. Взаимодействовать с ними можно через GitLab, VS Code, командную строку и мессенджеры.
📱 @git_developer
В обсуждениях GitLab теперь можно поручать задачи автономным ИИ-агентам. В SourceCraft появилась возможность подключать таких агентов для написания кода, проверки его безопасности и других задач разработки.
Агент работает под собственной учетной записью, самостоятельно выполняет задачу и возвращает результат на ревью. Если в процессе нужны дополнительные данные или согласование, он сам обращается к команде.
Можно подключать и собственных агентов, в том числе созданных в Yandex AI Studio. Взаимодействовать с ними можно через GitLab, VS Code, командную строку и мессенджеры.
📱 @git_developer
🤡68 22⚡5🔥3🤷♂2👍1👏1
Love. Death. Transformers.
v5 вышла, теперь она нативно училась с rlcd и на вижен и агентик задачах, теперь в 0.8b 2b и 4b размере, на каких то рандомных бенчах неплохо себя показывает https://huggingface.co/AlexWortega/openjev https://x.com/justalexwortega/status/2102828012362223864?s=46
https://huggingface.co/TypeSafeAI/Step-5-Preview-BF16
забавно, 600А27 по экономике действительно забавен, в nvfp4 еще поди и 70% профита на их jev сетапе дает
забавно, 600А27 по экономике действительно забавен, в nvfp4 еще поди и 70% профита на их jev сетапе дает
huggingface.co
TypeSafeAI/Step-5-Preview-BF16 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
🤡21
Love. Death. Transformers.
https://huggingface.co/TypeSafeAI/Step-5-Preview-BF16 забавно, 600А27 по экономике действительно забавен, в nvfp4 еще поди и 70% профита на их jev сетапе дает
вы ща охуеете, это были ДОМЕННЫЕ ТРОЛИ которые угнали имя на хф
😁97😭13
Forwarded from AbstractDL
Evidence of Linear Superposition in LLMs
Языковые модели ЕЩЁ ЛИНЕЙНЕЕ, чем мы думали. Это, конечно, какой-то смех, но если тупо усреднить инпут-эмбеддинги у входных текстов, то LLM будет в аутпуте продолжать оба текста сразу. То есть она может параллельно о двух разных вещах думать и разбираться в усреднённых активациях, распутывая их. Похоже, это следствие линейности внутренних репрезентаций, которую я описывал в старой работе.
У меня тоже получилось немного помочь с этой статьёй и залететь в соавторы, но я там скорее рядом постоял просто. Все лавры Паше Тихонову за крутую находку.
Статья
Языковые модели ЕЩЁ ЛИНЕЙНЕЕ, чем мы думали. Это, конечно, какой-то смех, но если тупо усреднить инпут-эмбеддинги у входных текстов, то LLM будет в аутпуте продолжать оба текста сразу. То есть она может параллельно о двух разных вещах думать и разбираться в усреднённых активациях, распутывая их. Похоже, это следствие линейности внутренних репрезентаций, которую я описывал в старой работе.
У меня тоже получилось немного помочь с этой статьёй и залететь в соавторы, но я там скорее рядом постоял просто. Все лавры Паше Тихонову за крутую находку.
Статья
huggingface.co
Paper page - Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs
Join the discussion on this paper page
1👍63🔥32😨14😁7🤔5🍓4 4🎉2👏1💩1🤗1
Forwarded from Just links
Self-Play Pretraining with Zero Data https://arxiv.org/abs/2609.30063
arXiv.org
Self-Play Pretraining with Zero Data
Advances in language modeling have been driven by scaling pretraining on ever more data. Yet, the training data is still largely curated on the model's behalf. A more general approach to...
🥴33🔥9👍4🌭3
Forwarded from The place to land
Amy_Fighter35_Nordland_demo_version_digital_art_catalog_2014_2021.pdf
9.3 MB
★
Как я упоминала ранее, обстоятельства моей жизни изменились, поэтому я расширила и переосмыслила концепцию Федерации Нордланд. Опубликованные ранее работы сохраняют свою ценность в качестве демо-версии Нордланд. Я собрала их в каталог, охватывающий мои разработки в период с 2014 по 2021 год.
Каталог прикреплен к сообщению, его также можно использовать, если вы заинтересованы в покупке принтов, оригиналов файлов и т.д. – все актуальные ссылки и другая информация внутри (все ссылки кликабельны).
Кроме того, я полностью провела ребрендинг своих страниц во всех социальных сетях – теперь меня можно найти только по никнейму/тэгу Amy_Fighter35✈️ 💅 ⚡ (с вариациями amy_fighter35, amy-fighter35 или amyfighter35 в некоторых аккаунтах).
Скоро появятся другие обновления – следите за новостями!✨
★
As I mentioned earlier, my life circumstances have changed, prompting me to expand and rethink the concept of The Federation of Nordland. The artworks published earlier retain their value as the Nordland demo version. I have compiled them into a catalog covering my work from 2014 to 2021.
The catalog is attached to this post. You can also use it if you're interested in purchasing prints, original files, custom art, etc. – all relevant links and information are inside (all links are clickable).
Additionally, I have completed a full rebranding of my social media pages – I can now be found only under the username/tag Amy_Fighter35✈️ 💅 ⚡ (also appears as amy_fighter35, amy-fighter35 or amyfighter35 in some handles).
Further updates are coming soon – stay tuned!✨
#Amy_Fighter35 #The_Federation_of_Nordland
#updates
Please open Telegram to view this post
VIEW IN TELEGRAM
💊41👍3❤🔥1
Забавно что авторка гениального the federation of nordland в один момент жизни слегка изменила взгляды, получила визу в штаты и постит под ником fighter 35
Да, это ее реальный канал
Да, это ее реальный канал
😁36💩12 3😭1 1