FlashAttention-3 и FlashAttention-4 — пример того, как алгоритмы нужно заново адаптировать под каждое поколение GPU 🚀
В новой статье разбираем, почему FlashAttention-2 отлично работал на Amper'е, но уже не раскрывал потенциал архитектур Hopper и Blackwell и какие архитектурные изменения вновь ускорили attention.
Вы узнаете:
• почему на H100 FA-2 просел по утилизации GPU
• как Tensor Memory Accelerator и асинхронные Tensor Cores ускорили FA-3
• зачем нужна warp-специализация
• как matmul и softmax удалось выполнять параллельно
• что даёт FP8 с контролем ошибок
• и почему для Blackwell снова понадобилась перестройка во FlashAttention-4
Читайте разбор по ссылке! 👈🏼
В новой статье разбираем, почему FlashAttention-2 отлично работал на Amper'е, но уже не раскрывал потенциал архитектур Hopper и Blackwell и какие архитектурные изменения вновь ускорили attention.
Вы узнаете:
• почему на H100 FA-2 просел по утилизации GPU
• как Tensor Memory Accelerator и асинхронные Tensor Cores ускорили FA-3
• зачем нужна warp-специализация
• как matmul и softmax удалось выполнять параллельно
• что даёт FP8 с контролем ошибок
• и почему для Blackwell снова понадобилась перестройка во FlashAttention-4
Читайте разбор по ссылке! 👈🏼
1❤19🔥14👍11
Последние места на LLM System Design
15 июля стартует курс «LLM System Design», и осталось 4 места со скидкой 9%⚡️
В течение обучения вы решите топ-4 задачи на рынке 2026:
• чат-бот c RAG по базе знаний компании
• клиентский саппорт: «классический» и мультиагентный
• локальный сервис речевой аналитики
• мультиагентный ИИ-разработчик
В программе:
— 8 лекций от senior-инженеров, тех- и тимлидов продуктовых команд
— 3 семинара с разбором систем
— 2 QA-сессии где можно задать любые вопросы спикерам
— чат со спикерами на протяжении всего обучения
Изучайте подробности о курсе на сайте и записывайтесь!
Если ещё остались вопросы, то пишите нам в Поддержку @deepschool_support
15 июля стартует курс «LLM System Design», и осталось 4 места со скидкой 9%⚡️
В течение обучения вы решите топ-4 задачи на рынке 2026:
• чат-бот c RAG по базе знаний компании
• клиентский саппорт: «классический» и мультиагентный
• локальный сервис речевой аналитики
• мультиагентный ИИ-разработчик
В программе:
— 8 лекций от senior-инженеров, тех- и тимлидов продуктовых команд
— 3 семинара с разбором систем
— 2 QA-сессии где можно задать любые вопросы спикерам
— чат со спикерами на протяжении всего обучения
Изучайте подробности о курсе на сайте и записывайтесь!
Если ещё остались вопросы, то пишите нам в Поддержку @deepschool_support
deepschool.ru
LLM System Design — DeepSchool
Учим создавать LLM-системы: от поиска по базе знаний и саппорт-агентов до речевой аналитики и мультиагентных систем. Курс из четырёх проектов.
❤5🔥4🤩2
Как свёрточные сети меняли компьютерное зрение
Почему AlexNet стала переломным моментом, чем VGG упростила архитектурный дизайн, как ResNet решила проблему глубины и зачем MobileNet, EfficientNet и ConvNeXt по-разному оптимизировали точность, скорость и масштабирование?
✅ В новом видео разбираем эволюцию CNN как последовательность инженерных ответов на ограничения предыдущих поколений моделей.
Смотрите видео по ссылке: https://youtu.be/l5kAIVbFQJ4?si=mdJlnY20mageDq36
🪔 DeepSchool
Почему AlexNet стала переломным моментом, чем VGG упростила архитектурный дизайн, как ResNet решила проблему глубины и зачем MobileNet, EfficientNet и ConvNeXt по-разному оптимизировали точность, скорость и масштабирование?
Смотрите видео по ссылке: https://youtu.be/l5kAIVbFQJ4?si=mdJlnY20mageDq36
Please open Telegram to view this post
VIEW IN TELEGRAM
YouTube
Полная история свёрточных нейросетей
Почему AlexNet стала переломным моментом, чем VGG упростила архитектурный дизайн, как ResNet решила проблему глубины и зачем MobileNet, EfficientNet и ConvNeXt по-разному оптимизировали точность, скорость и масштабирование?
✅ В новом видео разбираем эволюцию…
✅ В новом видео разбираем эволюцию…
❤17👍9🔥7
DeepSchool Digest⚡
Собрали для вас материалы за июнь и июль в одном посте☀️
Как собрать хорошие траектории для обучения LLM-агента — LLM-агенту недостаточно просто отвечать текстом: важно научить его выбирать действия и работать с инструментами. Разобрали, какие данные здесь нужны, и почему одного SFT обычно мало.
Late chunking — рассказали, как улучшить векторный поиск в RAG без сложной нарезки чанков.
Reinforcement Learning — подготовили пошаговый план изучения и полезные ресурсы.
Genie family — подготовили серию постов о современных world-моделях и 3D-генерациях мира.
И начали с семейства Genie от Deepmind.
FlashAttention-3 и FlashAttention-4 — разобрали, почему FlashAttention-2 отлично работал на Amper'е, но уже не раскрывал потенциал архитектур Hopper и Blackwell, и какие архитектурные изменения вновь ускорили attention.
Как свёрточные сети меняли компьютерное зрение — разобрали эволюцию CNN как последовательность инженерных ответов на ограничения предыдущих поколений моделей.
Собрали для вас материалы за июнь и июль в одном посте
Как собрать хорошие траектории для обучения LLM-агента — LLM-агенту недостаточно просто отвечать текстом: важно научить его выбирать действия и работать с инструментами. Разобрали, какие данные здесь нужны, и почему одного SFT обычно мало.
Late chunking — рассказали, как улучшить векторный поиск в RAG без сложной нарезки чанков.
Reinforcement Learning — подготовили пошаговый план изучения и полезные ресурсы.
Genie family — подготовили серию постов о современных world-моделях и 3D-генерациях мира.
И начали с семейства Genie от Deepmind.
FlashAttention-3 и FlashAttention-4 — разобрали, почему FlashAttention-2 отлично работал на Amper'е, но уже не раскрывал потенциал архитектур Hopper и Blackwell, и какие архитектурные изменения вновь ускорили attention.
Как свёрточные сети меняли компьютерное зрение — разобрали эволюцию CNN как последовательность инженерных ответов на ограничения предыдущих поколений моделей.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤16👍10🔥7⚡1
Хорошие практики LLM-as-a-judge
LLM-судьи позволяют быстро оценивать тысячи ответов, но один промпт и аккуратный выход в формате JSON ещё не гарантируют надёжную оценку. Судья может пропускать ошибки, менять вердикты из-за формулировки промпта или уверенно оценивать ответ, когда ему не хватает данных.
В новой статье разобрали шесть практик, которые помогают сделать LLM-оценку надёжнее: от формулировки критериев и проверки на человеческой разметке до анализа ошибок, смещений и расхождений между судьями. Всё — на реальном кейсе shopping-ассистента.
Читайте новую статью по ссылке!
Автор: Алексей Яндутов
LLM-судьи позволяют быстро оценивать тысячи ответов, но один промпт и аккуратный выход в формате JSON ещё не гарантируют надёжную оценку. Судья может пропускать ошибки, менять вердикты из-за формулировки промпта или уверенно оценивать ответ, когда ему не хватает данных.
В новой статье разобрали шесть практик, которые помогают сделать LLM-оценку надёжнее: от формулировки критериев и проверки на человеческой разметке до анализа ошибок, смещений и расхождений между судьями. Всё — на реальном кейсе shopping-ассистента.
Читайте новую статью по ссылке!
Соберите полноценные LLM-системы с учётом требований к качеству и нагрузке, разберите сложные кейсы и дизайны NLP-решений у нас на курсе. Новый поток стартует 18 августа, а до 9 августа вы можете присоединиться со скидкой 20%!
Автор: Алексей Яндутов
2❤13🔥9👍6
2 недели до старта LLM Pro
Если вы работаете в NLP и хотите научиться решать сложные задачи, то приходите на ближайший поток LLM Pro, который стартует 18 августа!
Это продвинутая программа, на которой мы показываем, как собирать полноценные NLP-системы с учётом требований к качеству и нагрузке.
Вы разберёте реальные кейсы и научитесь применять похожие подходы в своих проектах.
До 9 августа действует скидка 20% ⚡
Изучайте подробности на сайте и оставляйте заявку на этот поток!
Если у вас остались вопросы, то пишите в нашу поддержку @deepschool_support
Если вы работаете в NLP и хотите научиться решать сложные задачи, то приходите на ближайший поток LLM Pro, который стартует 18 августа!
Это продвинутая программа, на которой мы показываем, как собирать полноценные NLP-системы с учётом требований к качеству и нагрузке.
Вы разберёте реальные кейсы и научитесь применять похожие подходы в своих проектах.
До 9 августа действует скидка 20% ⚡
Изучайте подробности на сайте и оставляйте заявку на этот поток!
Если у вас остались вопросы, то пишите в нашу поддержку @deepschool_support
deepschool.ru
LLM Pro — Продвинутый курс по LLM и NLP System Design | DeepSchool
Соберёте полноценные LLM-системы с учётом требований к качеству и нагрузке, разберёте сложные кейсы и дизайны NLP-решений
❤6🔥2👍1
Как сегодня обучают AI-агентов? 🤖
LLM уже умеют писать код, пользоваться браузером и самостоятельно выполнять сложные задачи. Но как их этому обучают?
В новой статье разбираем, почему классического RLHF оказалось недостаточно, что такое Agent Reinforcement Learning, зачем нужны Verifiable Rewards и Credit Assignment, и как современные методы позволяют агентам находить эффективные стратегии самостоятельно.
Читайте разбор по ссылке! 👈🏼
🪔 DeepSchool
LLM уже умеют писать код, пользоваться браузером и самостоятельно выполнять сложные задачи. Но как их этому обучают?
В новой статье разбираем, почему классического RLHF оказалось недостаточно, что такое Agent Reinforcement Learning, зачем нужны Verifiable Rewards и Credit Assignment, и как современные методы позволяют агентам находить эффективные стратегии самостоятельно.
Читайте разбор по ссылке! 👈🏼
Соберите полноценные LLM-системы с учётом требований к качеству и нагрузке, разберите сложные кейсы и дизайны NLP-решений у нас на курсе. Новый поток стартует 18 августа, а до 9 августа вы можете присоединиться со скидкой 20%!
Please open Telegram to view this post
VIEW IN TELEGRAM
deepschool.ru
LLM Pro — Продвинутый курс по LLM и NLP System Design | DeepSchool
Соберёте полноценные LLM-системы с учётом требований к качеству и нагрузке, разберёте сложные кейсы и дизайны NLP-решений
❤16🔥12👍7👻1
Ванильный RAG не работает. Как исправить?
RAG — один из самых популярных сценариев для интеграции LLM в продукты. При этом большинство RAG-систем в реальных условиях ломаются уже на старте: галлюцинации, нерелевантные ответы, потерянный контекст.
Проблема не в идее, а в деталях. Ванильная схема «ретривер + генератор» — это только скелет. Без правильно настроенного эмбеддера, качественных данных, реранкера и дообученного генератора она не работает. А когда что-то идёт не так, то непонятно, за что взяться.
В эту среду Дмитрий Калашников, NLP team lead в Яндексе, проведёт открытую лекцию и разложит систему по частям: где обычно ломается, как диагностировать проблему и что конкретно делать на каждом уровне пайплайна.
Мы разберём:
• типичные точки отказа: эмбеддер, поиск, реранкер, генератор, данные
• как локализовать проблему, прежде чем что-то чинить
• какие техники реально улучшают качество на каждом этапе
• как собрать из компонентов систему, которая держит нагрузку
На лекции также расскажем про курс LLM Pro — для тех, кто хочет научиться строить полноценные NLP-системы с учётом требований к качеству и нагрузке.
Участникам лекции подарим скидку в 15% на обучение! 🎁
📅 Лекция пройдёт 12 августа в 19:00 МСК
Регистрируйтесь по ссылке и до встречи в среду!
RAG — один из самых популярных сценариев для интеграции LLM в продукты. При этом большинство RAG-систем в реальных условиях ломаются уже на старте: галлюцинации, нерелевантные ответы, потерянный контекст.
Проблема не в идее, а в деталях. Ванильная схема «ретривер + генератор» — это только скелет. Без правильно настроенного эмбеддера, качественных данных, реранкера и дообученного генератора она не работает. А когда что-то идёт не так, то непонятно, за что взяться.
В эту среду Дмитрий Калашников, NLP team lead в Яндексе, проведёт открытую лекцию и разложит систему по частям: где обычно ломается, как диагностировать проблему и что конкретно делать на каждом уровне пайплайна.
Мы разберём:
• типичные точки отказа: эмбеддер, поиск, реранкер, генератор, данные
• как локализовать проблему, прежде чем что-то чинить
• какие техники реально улучшают качество на каждом этапе
• как собрать из компонентов систему, которая держит нагрузку
На лекции также расскажем про курс LLM Pro — для тех, кто хочет научиться строить полноценные NLP-системы с учётом требований к качеству и нагрузке.
Участникам лекции подарим скидку в 15% на обучение! 🎁
Регистрируйтесь по ссылке и до встречи в среду!
Please open Telegram to view this post
VIEW IN TELEGRAM
deepschool.ru
Ванильный RAG не работает. Как исправить? | Открытая лекция DeepSchool
Расскажем, как правильно выстроить пайплайн и превратить RAG из хаотичного набора компонентов в надёжный инструмент
🔥8❤5👍3
Как собирать NLP-системы, которые работают под нагрузкой
Обучить модель, построить эмбеддер или воспользоваться API — не значит запустить рабочую систему. RAG галлюцинирует, агент ломается на реальных сценариях, эмбеддинги не работают на специфичном домене. С этими и другими проблемами мы разберёмся на курсе LLM Pro, который стартует 18 августа!
На курсе вы научитесь:
• проектировать и запускать NLP-системы под реальные продуктовые задачи
• адаптировать LLM и эмбеддинги под специфичный домен и «живые» данные
• собирать и размечать датасеты — даже если данных изначально почти нет
• решать задачи классификации, поиска, кластеризации и NER — с ограничениями продакшн-среды
• собирать свою RAG-систему: от ретривера и реранкера до генератора и оценки качества
• строить AI-агентов с нуля — на основе сценариев, функций и взаимодействия с внешней средой
Приходите, чтобы узнать про best practices от опытных инженеров из продуктовых команд и применять похожие подходы в своих проектах
🤖 До 17 августа вы можете присоединиться к обучению со скидкой 5%!
Изучайте программу и отзывы на сайте и записывайтесь на ближайший поток 🎓
Обучить модель, построить эмбеддер или воспользоваться API — не значит запустить рабочую систему. RAG галлюцинирует, агент ломается на реальных сценариях, эмбеддинги не работают на специфичном домене. С этими и другими проблемами мы разберёмся на курсе LLM Pro, который стартует 18 августа!
На курсе вы научитесь:
• проектировать и запускать NLP-системы под реальные продуктовые задачи
• адаптировать LLM и эмбеддинги под специфичный домен и «живые» данные
• собирать и размечать датасеты — даже если данных изначально почти нет
• решать задачи классификации, поиска, кластеризации и NER — с ограничениями продакшн-среды
• собирать свою RAG-систему: от ретривера и реранкера до генератора и оценки качества
• строить AI-агентов с нуля — на основе сценариев, функций и взаимодействия с внешней средой
Приходите, чтобы узнать про best practices от опытных инженеров из продуктовых команд и применять похожие подходы в своих проектах
🤖 До 17 августа вы можете присоединиться к обучению со скидкой 5%!
Изучайте программу и отзывы на сайте и записывайтесь на ближайший поток 🎓
deepschool.ru
LLM Pro — Продвинутый курс по LLM и NLP System Design | DeepSchool
Соберёте полноценные LLM-системы с учётом требований к качеству и нагрузке, разберёте сложные кейсы и дизайны NLP-решений
❤9🔥4👍1
Взять датасет побольше и дообучить модель? Да, но в этой статье расскажем об альтернативных вариантах улучшения модели.
Трекинг объектов — это набор алгоритмов, которые связывают одни и те же объекты на соседних кадрах видео. Трекинг работает в тесной связке с детектором, поэтому качество первого напрямую зависит от точности второго. Ошибки детектора усложняют работу трекинга, но хороший трекер может справиться даже с неидеальными детекциями.
Шаг 0. Анализ ошибок модели детекции.
Между кадрами моргает детектор? Много кратковременных ложных предсказаний? Вам однозначно нужен алгоритм фильтрации, каким может выступить трекинг. Для быстрого старта подойдет библиотека BoxMOT. В ней реализованы алгоритмы, помогающие стабилизировать слабые детекции.
Итак, связали детектор и трекер. Но все равно не работает.
Шаг 1. Локализация проблемных мест.
Отрисуйте предсказания.
Объекта нет среди детекций → проблема, скорее всего, в детекторе.
Детекция есть, но трек обрывается → смотрим, как трекер работает со временной потерей объекта.
Объект остаётся в кадре, но получает другой ID → проблема в ассоциации.
Ошибки появляются при окклюзии → проверяем, насколько хорошо трекер использует информацию о движении и внешнем виде объекта.
Этот шаг помогает понять, что именно следует исправить в общем пайплайне.
Шаг 2. Проверка confidence детектора.
При окклюзии уверенность детектора может упасть, например, с 0.9 до 0.3. Если использовать порог уверенности детекции 0.5, такая детекция исчезнет ещё до трекера. Объект пропадёт, вместе с ним может оборваться и трек.
ВoostTrack предлагает простой приём: сначала сопоставлять уверенные детекции, затем использовать менее уверенные боксы для восстановления существующих треков.
Поэтому при частых пропусках объектов нужно проверить, что происходит с детекциями с низким confidence, и настроить порог.
При низком пороге могут появиться «ложняки». Да, но они кратковременные.
Шаг 3. Настройка инициализации треков.
Можно отрисовывать трек не сразу, а при нескольких подряд идущих детекциях. Этот параметр обычно называется min_hits, измеряется в кадрах. Обычно 3 кадров в видео 30 FPS хватает. Но учитывайте скорость объектов, вращение камеры, FPS видео для своей задачи. Также подредактируйте код, чтобы не отрисовывать те треки, которые пока не прошли эту проверку.
Шаг 4. Борьба с окклюзией.
Объект может исчезнуть на несколько кадров из-за окклюзии, а потом снова появиться. Если за это время трекер уже удалил старый трек, старый объект получит новый ID.
Здесь помогает настройка track_buffer: некоторое время трекер продолжает хранить информацию о потерянном объекте и пытается связать его с новой детекцией.
Если окклюзии в видео длинные, этот параметр стоит проверить в первую очередь. Но увеличивать его бесконечно нельзя: слишком большой буфер повышает риск вернуть старый ID новому объекту.
Шаг 5. Компенсация движения камеры
Если камера поворачивается или перемещается, координаты всех объектов меняются одновременно при условии, что нет дисторсии. Для трекера это может выглядеть как движение самих объектов.
Компенсация движения камеры (Camera Motion Compensation) позволяет оценить, как сдвинулось изображение целиком, и учитывать это при трекинге объектов. Особенно полезно для спортивных трансляций, PTZ-камер и видео с дронов.
Из готовых решений можно взять идею из BoT-SORT: компенсировать движение камеры перед ассоциацией, а затем использовать модель движения и ReID.
Шаг 6. Выбор алгоритма трекинга.
Алгоритмы отличаются друг от друга применимостью к конкретной задаче.
ByteTrack — базовый вариант, особенно если проблема связана с потерей слабых детекций.
BoT-SORT можно попробовать при движении камеры и частых пересечениях объектов.
OC-SORT полезен для сцен с резкими изменениями направления движения.
Поэтому здесь нужен эксперимент — прогнать один и тот же детектор через несколько трекеров и сравнить не только общий score, но и конкретные ошибки (fragmentation и ID switch).
Не бойтесь экспериментировать и сочетать сильные стороны каждого алгоритма в своём пайплайне 💪🏻
Шаг 7. Что такое уверенность детектора?
Представим bbox с confidence 0.3. Сам по себе это слабый сигнал.
Но если детекция появилась именно там, где мы ожидаем увидеть существующий трек, и совпадает с ним по положению, размеру и движению, её уже будет нелогично выбрасывать.
В BoostTrack используется похожая идея: оценка детекции корректируется с учётом её соответствия существующему треку.
То есть к вопросу: «Насколько уверен детектор?» добавляем: «Насколько эта детекция соответствует тому, что мы ожидаем увидеть?»
Итого: без дообучения модели пофиксили FP и стабилизировали детекции.
На курсе CV Rocket также разберем, как увеличить TP с помощью трекера и другие адаптации под ваши задачи. Присоединяйтесь до 15 сентября со скидкой 20%!
Авторы: Башаров Илья, Холодов Семен (НКБТех)
Please open Telegram to view this post
VIEW IN TELEGRAM
3❤11🔥10👍8
Flow Matching: обучение и дистилляция
Flow Matching — один из главных подходов генерации изображений сегодня. Его используют такие семейства, как Stable Diffusion 3.5 и FLUX.2. Но у такой генерации есть и проблема: чтобы получить одну картинку, модель нужно запустить десятки или сотни раз!
Сегодня разбираем внутрянку метода и быстрый способ дистиллировать модель в одношаговый генератор 🏎
В новой статье рассказываем:
- что такое Flow Matching и при чём тут поля 🌾
- почему генерация требует большого числа шагов и почему это проблема
- как дистиллировать уже обученную модель в одношаговый генератор и как с этим связаны игры 🎲
P.S. Много интуиции, математики и практических деталей обучения 🧠
Читайте статью по ссылке! 👈🏼
Flow Matching — один из главных подходов генерации изображений сегодня. Его используют такие семейства, как Stable Diffusion 3.5 и FLUX.2. Но у такой генерации есть и проблема: чтобы получить одну картинку, модель нужно запустить десятки или сотни раз!
Сегодня разбираем внутрянку метода и быстрый способ дистиллировать модель в одношаговый генератор 🏎
В новой статье рассказываем:
- что такое Flow Matching и при чём тут поля 🌾
- почему генерация требует большого числа шагов и почему это проблема
- как дистиллировать уже обученную модель в одношаговый генератор и как с этим связаны игры 🎲
P.S. Много интуиции, математики и практических деталей обучения 🧠
Читайте статью по ссылке! 👈🏼
4❤22🔥9🤝4👍3