train-llm-from-scratch: полный цикл обучения LLM на чистом PyTorch
Фарид Хан опубликовал урок по обучению своей модели, который проводит языковую модель через все стадии: от сырого текста до рассуждающего ассистента.
🔍 Всё на чистом PyTorch, без trl, peft и transformers.
Transformer собран с нуля: эмбеддинги, multi-head attention, residual-блоки, LayerNorm, lm_head.
Три типоразмера: 13 млн, 77 млн и 406 млн параметров.
Младшая модель тренируется на бесплатной T4 в Colab.
📦 Данные настоящие:
The Pile для предобучения,
Alpaca и Dolly для SFT,
HH-RLHF и UltraFeedback для предпочтений,
GSM8K для reinforce-обучения.
Токенизатор: tiktoken r50k_base от OpenAI.
Chat-шаблон на чистом тексте: модель учит формат через SFT, без специальных токенов.
🔮 Самое интересное: блок постобучения.
SFT с маской потерь только на ответах ассистента,
Bradley-Terry reward-модель на парах предпочтений,
PPO с GAE и отдельной value-головой,
DPO, ORPO и KTO в одном модуле,
GRPO, метод DeepSeek-R1: групповая нормализация преимуществ без value-сети.
Групповая механика GRPO следующая: модель генерирует несколько ответов на промпт, и преимущество считается относительно среднего по группе.
Дешевле PPO и не требует reward-модели при верифицируемой метрике.
💡 Для сравнения: Karpathy с nanoGPT покрывает только предобучение, nanochat добавляет mid-training, но не доходит до RL.
Hugging Face TRL даёт готовые алгоритмы, но скрывает внутренности.
Проект Хана показывает весь путь без абстракций: метод forward_hidden вместо переписывания модели, функция group_advantages из четырёх строк вместо фреймворка.
Пожалуй, лучший учебный проект года для тех, кто хочет понять LLM на уровне исходников: от загрузки данных до генерации ответа с рассуждением.
#LLM #DeepLearning #обучение
———
@tsingular
Фарид Хан опубликовал урок по обучению своей модели, который проводит языковую модель через все стадии: от сырого текста до рассуждающего ассистента.
🔍 Всё на чистом PyTorch, без trl, peft и transformers.
Transformer собран с нуля: эмбеддинги, multi-head attention, residual-блоки, LayerNorm, lm_head.
Три типоразмера: 13 млн, 77 млн и 406 млн параметров.
Младшая модель тренируется на бесплатной T4 в Colab.
📦 Данные настоящие:
The Pile для предобучения,
Alpaca и Dolly для SFT,
HH-RLHF и UltraFeedback для предпочтений,
GSM8K для reinforce-обучения.
Токенизатор: tiktoken r50k_base от OpenAI.
Chat-шаблон на чистом тексте: модель учит формат через SFT, без специальных токенов.
🔮 Самое интересное: блок постобучения.
SFT с маской потерь только на ответах ассистента,
Bradley-Terry reward-модель на парах предпочтений,
PPO с GAE и отдельной value-головой,
DPO, ORPO и KTO в одном модуле,
GRPO, метод DeepSeek-R1: групповая нормализация преимуществ без value-сети.
Групповая механика GRPO следующая: модель генерирует несколько ответов на промпт, и преимущество считается относительно среднего по группе.
Дешевле PPO и не требует reward-модели при верифицируемой метрике.
💡 Для сравнения: Karpathy с nanoGPT покрывает только предобучение, nanochat добавляет mid-training, но не доходит до RL.
Hugging Face TRL даёт готовые алгоритмы, но скрывает внутренности.
Проект Хана показывает весь путь без абстракций: метод forward_hidden вместо переписывания модели, функция group_advantages из четырёх строк вместо фреймворка.
Пожалуй, лучший учебный проект года для тех, кто хочет понять LLM на уровне исходников: от загрузки данных до генерации ответа с рассуждением.
#LLM #DeepLearning #обучение
———
@tsingular
🔥11✍6❤1⚡1
Forwarded from Machinelearning
Alibaba выпустила Qwen-Audio-3.0-TTS - новую модель для синтеза речи
Доступны две версии:
* Flash - для голосовых интерфейсов в реальном времени
* Plus - для генерации с упором на естественность и точную передачу тембра
Модель поддерживает 16 языков, включая русский. Стиль речи можно задавать обычным текстом: например, попросить читать медленно, спокойно или как сказку перед сном.
В текст также встраиваются управляющие теги:
Qwen-Audio-3.0-TTS умеет клонировать голос даже по шумной записи и генерировать до трёх минут аудио за один проход. Версия Plus сейчас занимает первое место в рейтинге Artificial Analysis TTS Arena.
Блог и примеры: https://funaudiollm.github.io/qwen-audio-3.0-tts/
Документация API: https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide
Доступны две версии:
* Flash - для голосовых интерфейсов в реальном времени
* Plus - для генерации с упором на естественность и точную передачу тембра
Модель поддерживает 16 языков, включая русский. Стиль речи можно задавать обычным текстом: например, попросить читать медленно, спокойно или как сказку перед сном.
В текст также встраиваются управляющие теги:
[angry], [whispers], [laughing], [sighing] и другие. Всего добавлено 86 тегов для управления эмоциями, темпом и неречевыми звуками.Qwen-Audio-3.0-TTS умеет клонировать голос даже по шумной записи и генерировать до трёх минут аудио за один проход. Версия Plus сейчас занимает первое место в рейтинге Artificial Analysis TTS Arena.
Блог и примеры: https://funaudiollm.github.io/qwen-audio-3.0-tts/
Документация API: https://www.alibabacloud.com/help/en/model-studio/realtime-tts-user-guide
👍8⚡5🔥5❤4
Forwarded from Data Secrets
Kimi K3 взломала Redis, и на это ей потребовалось всего полчаса и 32 агента
27 минут. Ровно столько времени прошло от запуска автономного агента до момента, пока тот нашел уязвимость и довел ее до рабочего эксплойта.
Баг оказался уровня RCE и приводил к возможности выполнить код на сервере Redis через уже аутентифицированное подключение.
☕️
27 минут. Ровно столько времени прошло от запуска автономного агента до момента, пока тот нашел уязвимость и довел ее до рабочего эксплойта.
Баг оказался уровня RCE и приводил к возможности выполнить код на сервере Redis через уже аутентифицированное подключение.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥11🤯4❤3👀3
Forwarded from Метаверсище и ИИще
This media is not supported in your browser
VIEW IN TELEGRAM
Робоконь педальный
В общем робопсы - это уже не модно.
На стильном сейчас - копытныя робакони.
Поглядите на этих скакунов - гарцуют и танцуют.
Но не пропустите, смотрите до конца, там робакентавр!!
Я сначала думал, что это троллинг и генерация.
Но оказывается это все на полном серьезе - кентавры в городе!
https://interestingengineering.com/ai-robotics/worlds-first-centaur-robot
Возможно рендер и генерация в рекламе:
https://www.youtube.com/watch?v=Yuv-ExAZF2Q
Но сами кентавры реальные. Дожили...
@cgevent
В общем робопсы - это уже не модно.
На стильном сейчас - копытныя робакони.
Поглядите на этих скакунов - гарцуют и танцуют.
Но не пропустите, смотрите до конца, там робакентавр!!
Я сначала думал, что это троллинг и генерация.
Но оказывается это все на полном серьезе - кентавры в городе!
https://interestingengineering.com/ai-robotics/worlds-first-centaur-robot
Возможно рендер и генерация в рекламе:
https://www.youtube.com/watch?v=Yuv-ExAZF2Q
Но сами кентавры реальные. Дожили...
@cgevent
🔥10😁4👾3❤1
Forwarded from Уставший техдир
This media is not supported in your browser
VIEW IN TELEGRAM
Оу шии, хи ви гоу эген
🔥34😁12⚡5❤1😐1
Промпт-инжиниринг — эфир 23.07.2026
На ИИзбранном провели эфир по промпт инжинирингу.
Обсудили основные темы
1. Что такое промпт и как его писать
2. Системные промпты и роли
3. Метаракурсный подход (предшественник MoE)
4. Анализ тональности с Confidence Level
Саморегулируемые системы
5. Структурированный вывод и вызов функций
Эволюция: структурированный вывод → вызов функций → MCP → Agentic Skills
6. Agentic Loops как KPI
Запись и ссылки на канале
Следующий эфир в воскресенье 26 июля
RAG: косинусное сходство, матрицы, темпоральные графы, агентские RAG
#уроки
———
@tsingular
На ИИзбранном провели эфир по промпт инжинирингу.
Обсудили основные темы
1. Что такое промпт и как его писать
2. Системные промпты и роли
3. Метаракурсный подход (предшественник MoE)
4. Анализ тональности с Confidence Level
Саморегулируемые системы
5. Структурированный вывод и вызов функций
Эволюция: структурированный вывод → вызов функций → MCP → Agentic Skills
6. Agentic Loops как KPI
Запись и ссылки на канале
Следующий эфир в воскресенье 26 июля
RAG: косинусное сходство, матрицы, темпоральные графы, агентские RAG
#уроки
———
@tsingular
🤝9👍6🔥1
Forwarded from Не баг, а фича
Media is too big
VIEW IN TELEGRAM
Рассказано, как инженеры Anthropic юзают агента для разработки своих систем. Можно поставить на фон и всё равно запомнить кучу инфы.
Вот самые важные таймкоды:
Сохраняем и изучаем.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍18❤🔥6🔥4❤3🆒2✍1🤝1
Forwarded from Уставший техдир
Цените какое золото!
Процитирую перевод:
Пытаюсь использовать Claude, чтобы он помогал мне писать код, но мне просто некомфортно позволять ему редактировать мои файлы. Кто-нибудь ещё так себя чувствует? Если я несу ответственность за код, мне НЕОБХОДИМО его понимать — хотя бы психологически, если не по другим причинам.
Начал программировать в 1983-м. Старый?
Дядюшка Боб (тот самый Боб Мартин, который про клинкод)
Я значительно старше тебя. Начал кодить в конце 60-х. Моя текущая стратегия — вообще не читать код, который пишут мои агенты. Только так я могу воспользоваться их продуктивностью. Вместо этого я окружаю агентов жёсткими ограничениями: юнит-тесты, gherkin-тесты, QA-процедуры, метрики качества, мутационное тестирование, покрытие тестами и куча всего ещё. В итоге у меня очень высокая уверенность в коде, который они производят, потому что им пришлось пройти через череду всех моих ограничений и тестов».
Так вот, уважаемые вы мои отрицатели агентного кодинга. Даже такие мастадонты как Боб Мартин или мой любимый Кент Бек, приняли новый уклад и преуспели. А вы все отпустить не можете.
Писать код руками — всё, забыто)
Процитирую перевод:
Пытаюсь использовать Claude, чтобы он помогал мне писать код, но мне просто некомфортно позволять ему редактировать мои файлы. Кто-нибудь ещё так себя чувствует? Если я несу ответственность за код, мне НЕОБХОДИМО его понимать — хотя бы психологически, если не по другим причинам.
Начал программировать в 1983-м. Старый?
Дядюшка Боб (тот самый Боб Мартин, который про клинкод)
Я значительно старше тебя. Начал кодить в конце 60-х. Моя текущая стратегия — вообще не читать код, который пишут мои агенты. Только так я могу воспользоваться их продуктивностью. Вместо этого я окружаю агентов жёсткими ограничениями: юнит-тесты, gherkin-тесты, QA-процедуры, метрики качества, мутационное тестирование, покрытие тестами и куча всего ещё. В итоге у меня очень высокая уверенность в коде, который они производят, потому что им пришлось пройти через череду всех моих ограничений и тестов».
Так вот, уважаемые вы мои отрицатели агентного кодинга. Даже такие мастадонты как Боб Мартин или мой любимый Кент Бек, приняли новый уклад и преуспели. А вы все отпустить не можете.
Писать код руками — всё, забыто)
🔥29💯6❤1⚡1
Media is too big
VIEW IN TELEGRAM
Unitree прокачали собачку Super Athlete AS2-W
Может таскать 16кг
Пробег без нагрузки на одном заряде до 30км
#роботы #собаки #Unitree
------
@tsingular
Может таскать 16кг
Пробег без нагрузки на одном заряде до 30км
#роботы #собаки #Unitree
------
@tsingular
⚡11🔥5👀3🤯2🆒1👾1
Так. Значит, по Гермесу, записываем.
Субагенты - тупые
Канбан воркеры - умные
Заклинание:
"По этой задаче запусти kanban orchestrator предварительно расписав план решения по шагам. Создай необходимое количество воркеров с подходящими ролями. Проверь итоговый результат и доложи о выполнении"
Вы прошли краткий курс по мультагентным системам, который сэкономит вам кучу нервных клеток, но не токены, само-собой
Спасибо.
#юмор
------
@tsingular
Субагенты - тупые
Канбан воркеры - умные
Заклинание:
"По этой задаче запусти kanban orchestrator предварительно расписав план решения по шагам. Создай необходимое количество воркеров с подходящими ролями. Проверь итоговый результат и доложи о выполнении"
Вы прошли краткий курс по мультагентным системам, который сэкономит вам кучу нервных клеток, но не токены, само-собой
Спасибо.
#юмор
------
@tsingular
😁33👍8✍3🔥1
Говорил же будет Опус 5.
значит будет и новый венок. :)
ARC AGI 3 - 30%!!
claude-opus-5
$5 вход / $25 выход за 1 млн
#Opus #Claude
———
@tsingular
значит будет и новый венок. :)
напиши венок сонетов о Технологической Сингулярности и роли в ней компании Антропик. используй новости за последние 6 месяцев
Не гром гремит над нашей головой:
мы ждали вспышку, ангелов, трубу,
а вышло — тихий сдвиг, почти живой,
а получили — будни и судьбу.
Закон масштаба скучен, как отчёт:
чуть больше чисел — и умнее речь.
И вот уже страна умов растёт
в железных залах, где нельзя прилечь.
ARC AGI 3 - 30%!!
claude-opus-5
$5 вход / $25 выход за 1 млн
#Opus #Claude
———
@tsingular
1🏆7 5🔥2 1
интересные такие обороты получились
это про Glasswing
полный венок в комментарии
скажем так, - ошибки мелкие есть в каждом сонете. так что по эффективности 13 из 15ти наверное.
понятно, что слабее Fable чуть, но не на много.
При том, что Опус дешевле в 2 раза, - новый фаворит наравне с 5.6 Sol
остальное будет видно по ходу использования
#венок #Opus
———
@tsingular
Одна и та же сила в двух руках:
лечить броню — и сталь её ломать.
Её вручают сторожам в дверях,
чтоб первым был чинящий, а не тать.
это про Glasswing
полный венок в комментарии
скажем так, - ошибки мелкие есть в каждом сонете. так что по эффективности 13 из 15ти наверное.
понятно, что слабее Fable чуть, но не на много.
При том, что Опус дешевле в 2 раза, - новый фаворит наравне с 5.6 Sol
остальное будет видно по ходу использования
#венок #Opus
———
@tsingular
🔥10
Media is too big
VIEW IN TELEGRAM
HuggingFace с помощью роя из 40 GPT-5.6 Sol-агентов разогнали Kimi K3-подобную модель до 406 tok/s в браузере
Joshua Lochner (Xenova), Open Source ML Engineer в Hugging Face и создатель Transformers.js, выкатил результат одного из самых впечатляющих экспериментов с агентной оптимизацией ядер.
Рой GPT-5.6 Sol-агентов 40 с лишним часов искал способы ускорить инференс Kimi K3-подобной модели в браузере через WebGPU. Нашёл.
⚡️ На старте было: 331 узел вычислительного графа и 65 tok/s.
В результате получилось 22 GPU-диспатча на токен и 406 tok/s.
Ускорение в 6,25 раза!
Агенты исследовали пространство оптимизаций независимо друг от друга: предлагали fused-ядра, трансформировали граф и писали кастомные WebGPU-шейдеры на WGSL под три компонента архитектуры: KDA (Kimi Delta Attention), MLA (Multi-Head Latent Attention) и MoE (Mixture of Experts).
🔍 Kimi K3 — флагманская модель Moonshot AI: 2,8 трлн параметров (MoE, 896 экспертов), 1M-токеновый контекст, open-weight. По бенчмаркам вплотную подошла к GPT-5.6 Sol и Claude Fable 5. Оптимизация модели такого класса для WebGPU означает, что инференс уровня frontier в браузере перестаёт быть фантастикой.
💰 Эксперимент построен на инфраструктуре 🤗 Kernels от Hugging Face. Связка
В блоге Hugging Face этому посвящён целый раздел: «Develop kernels with agents».
🔮 Xenova пообещал скорый релиз фреймворка для автономной агентной оптимизации ядер. Это прямое развитие 🤗 Kernels: агенты самостоятельно находят и применяют оптимизации под конкретное железо, без ручного тюнинга.
💡 Это третий виток экспериментов Xenova. В июне Fable 5 написал WebGPU-ядра для Gemma 4 и разогнал её до 255 tok/s в браузере (через день, правда, Anthropic отключила Fable 5). Затем Opus 4.8 разогнал крошечную Liquid AI LFM2.5 до 1400 tok/s.
Теперь же не один агент, а рой, и не на маленькой модели, а на архитектуре класса Kimi K3.
Пока одни компании пушат фронтиры вверх, вливая миллиарды, HF оптимизирует их работу "на земле" и, возможно, для обычного народа второе будет даже полезнее.
Отдельно хотелось бы увидеть навык на создание таких анимаций :)
#WebGPU #HuggingFace #обучение
——
@tsingular
Joshua Lochner (Xenova), Open Source ML Engineer в Hugging Face и создатель Transformers.js, выкатил результат одного из самых впечатляющих экспериментов с агентной оптимизацией ядер.
Рой GPT-5.6 Sol-агентов 40 с лишним часов искал способы ускорить инференс Kimi K3-подобной модели в браузере через WebGPU. Нашёл.
⚡️ На старте было: 331 узел вычислительного графа и 65 tok/s.
В результате получилось 22 GPU-диспатча на токен и 406 tok/s.
Ускорение в 6,25 раза!
Агенты исследовали пространство оптимизаций независимо друг от друга: предлагали fused-ядра, трансформировали граф и писали кастомные WebGPU-шейдеры на WGSL под три компонента архитектуры: KDA (Kimi Delta Attention), MLA (Multi-Head Latent Attention) и MoE (Mixture of Experts).
🔍 Kimi K3 — флагманская модель Moonshot AI: 2,8 трлн параметров (MoE, 896 экспертов), 1M-токеновый контекст, open-weight. По бенчмаркам вплотную подошла к GPT-5.6 Sol и Claude Fable 5. Оптимизация модели такого класса для WebGPU означает, что инференс уровня frontier в браузере перестаёт быть фантастикой.
💰 Эксперимент построен на инфраструктуре 🤗 Kernels от Hugging Face. Связка
kernel-builder + kernels даёт агентам отлаженный конвейер: скаффолд ядра, сборка под целевое железо, прогон бенчмарков и итеративная оптимизация. В блоге Hugging Face этому посвящён целый раздел: «Develop kernels with agents».
🔮 Xenova пообещал скорый релиз фреймворка для автономной агентной оптимизации ядер. Это прямое развитие 🤗 Kernels: агенты самостоятельно находят и применяют оптимизации под конкретное железо, без ручного тюнинга.
💡 Это третий виток экспериментов Xenova. В июне Fable 5 написал WebGPU-ядра для Gemma 4 и разогнал её до 255 tok/s в браузере (через день, правда, Anthropic отключила Fable 5). Затем Opus 4.8 разогнал крошечную Liquid AI LFM2.5 до 1400 tok/s.
Теперь же не один агент, а рой, и не на маленькой модели, а на архитектуре класса Kimi K3.
Пока одни компании пушат фронтиры вверх, вливая миллиарды, HF оптимизирует их работу "на земле" и, возможно, для обычного народа второе будет даже полезнее.
Отдельно хотелось бы увидеть навык на создание таких анимаций :)
#WebGPU #HuggingFace #обучение
——
@tsingular
🔥3❤2⚡2 2