🤖 Machine Learning Roadmap: от базы до гуру вайбкодинга
Карта обучения машинному обучению (Machine Learning, Deep Learning, LLM, Generative AI, MLOps) - от первого import numpy до уровня инженера, который понимает, как ИИ работает внутри, и может писать прод‑системы, а не только дёргать API.
https://github.com/justxor/MachineLearningRoadmap/tree/main
Карта обучения машинному обучению (Machine Learning, Deep Learning, LLM, Generative AI, MLOps) - от первого import numpy до уровня инженера, который понимает, как ИИ работает внутри, и может писать прод‑системы, а не только дёргать API.
https://github.com/justxor/MachineLearningRoadmap/tree/main
❤8👎1🔥1
⚙️ ASMLings - подробный гайд на русском
ASMLings - это набор из ~32 коротких упражнений на ассемблере Intel 8086, выстроенных по возрастанию сложности: от mov ax, 0x1337 до 32-битного сложения через carry flag, циклов, подпрограмм, работы с памятью и стеком.
Полный русскоязычный гайд по asmlings — интерактивной песочнице для изучения ассемблера Intel 8086, в которой 16-битный x86-эмулятор написан на Rust.
Внутри: что это, как устроено под капотом, как установить, как читать и решать упражнения, разборы реальных задач из репозитория, готовые примеры в examples/ и шпаргалки.
https://github.com/justxor/-ASMLingsru/
ASMLings - это набор из ~32 коротких упражнений на ассемблере Intel 8086, выстроенных по возрастанию сложности: от mov ax, 0x1337 до 32-битного сложения через carry flag, циклов, подпрограмм, работы с памятью и стеком.
Полный русскоязычный гайд по asmlings — интерактивной песочнице для изучения ассемблера Intel 8086, в которой 16-битный x86-эмулятор написан на Rust.
Внутри: что это, как устроено под капотом, как установить, как читать и решать упражнения, разборы реальных задач из репозитория, готовые примеры в examples/ и шпаргалки.
https://github.com/justxor/-ASMLingsru/
❤5🔥3👍2😁2👀1
ИИ начал писать «как великие авторы». И читатели выбрали ИИ
Представьте писателя, который 40 лет собирал свой стиль:
- ритм фраз
- способ начинать сцену
- интонацию
- вес каждого слова
- годы отказов, черновиков и переписываний
А потом исследователи берут все его книги, дообучают на них ChatGPT и просят написать новый текст в его голосе.
Дальше - слепой тест.
Без подписи. Без подсказок. Только два текста:
- один написан человеком
- второй сгенерирован ИИ
Оценивали не случайные люди. В исследовании участвовали MFA-авторы, обычные читатели, 50 известных писателей, 8 нобелевских лауреатов, лауреаты Пулитцера и Букера.
И вот где становится неприятно.
Когда ChatGPT просто просили «напиши как этот автор», эксперты быстро видели подделку. Текст звучал как ИИ.
Но когда модель дообучили на полном корпусе книг конкретного автора, всё перевернулось.
Эксперты чаще выбирали уже ИИ:
- как более похожий по стилю
- как более качественный по письму
- как текст, который звучит ближе к автору
AI-детектор тоже сломался.
Обычный AI-текст Pangram ловил в 97% случаев. Дообученный под автора - только в 3%.
Медианная цена дообучения и генерации под одного автора - около $81.
То есть модель может взять десятилетия чужого труда, стиль, голос, литературную ДНК - и за копейки начать писать так, что читатели предпочитают её оригиналу.
Если каждая новая книга автора становится обучающим материалом для системы, которая потом пишет следующую книгу без него, что именно защищает авторское право?
arxiv.org/pdf/2510.13939
Представьте писателя, который 40 лет собирал свой стиль:
- ритм фраз
- способ начинать сцену
- интонацию
- вес каждого слова
- годы отказов, черновиков и переписываний
А потом исследователи берут все его книги, дообучают на них ChatGPT и просят написать новый текст в его голосе.
Дальше - слепой тест.
Без подписи. Без подсказок. Только два текста:
- один написан человеком
- второй сгенерирован ИИ
Оценивали не случайные люди. В исследовании участвовали MFA-авторы, обычные читатели, 50 известных писателей, 8 нобелевских лауреатов, лауреаты Пулитцера и Букера.
И вот где становится неприятно.
Когда ChatGPT просто просили «напиши как этот автор», эксперты быстро видели подделку. Текст звучал как ИИ.
Но когда модель дообучили на полном корпусе книг конкретного автора, всё перевернулось.
Эксперты чаще выбирали уже ИИ:
- как более похожий по стилю
- как более качественный по письму
- как текст, который звучит ближе к автору
AI-детектор тоже сломался.
Обычный AI-текст Pangram ловил в 97% случаев. Дообученный под автора - только в 3%.
Медианная цена дообучения и генерации под одного автора - около $81.
То есть модель может взять десятилетия чужого труда, стиль, голос, литературную ДНК - и за копейки начать писать так, что читатели предпочитают её оригиналу.
Если каждая новая книга автора становится обучающим материалом для системы, которая потом пишет следующую книгу без него, что именно защищает авторское право?
arxiv.org/pdf/2510.13939
❤10👍8😨4😁1🤡1
И дело не в том, что ты плохо пишешь код. Просто большинство курсов заканчиваются ровно там, где начинается настоящий .NET.
Этот курс про то, что обычно остаётся под капотом:
- CLR
- JIT
- GC
- Span
- async state machine
- Source Generators
- lock-free подходы
- OpenTelemetry
- дампы в проде
На практике разбираем, как .NET реально работает внутри: что происходит с кодом после компиляции, как память живёт под нагрузкой, почему async иногда помогает, а иногда ломает производительность, как читать проблемы по дампам и метрикам, а не гадать по логам.
Если хочешь дойти до уровня, где система для тебя не чёрный ящик, а инструмент, который ты понимаешь до IL, - велкам.
Сейчас на stepik доступна скидка 55%: https://stepik.org/a/288694
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
Forwarded from Machinelearning
Компания сообщила, что полностью сбросила пятичасовой и недельный лимиты для всех подписчиков тарифов Pro и Max.
Это решение должно компенсировать платным пользователям повышенный расход ресурсов, вызванный программным сбоем.
Причиной проблемы стало то, что некоторые сессии Claude Code ошибочно запускали большое число параллельных субагентов. Из-за этого квоты расходовались заметно быстрее, чем предполагалось.
Пользователи жаловались в соцсетях на аномально быстрое исчерпание квот при работе с Claude Code: в ряде случаев дневной лимит заканчивался уже после нескольких простых запросов.
В сообществе разработчиком высказывались предположения, что резкое сокращение доступных квот связано с новой версией функции Dynamic Workflows. Anthropic это опровергла.
Согласно пояснению, причина кроется в особенностях обработки запросов к Opus 4.8: из-за них модель инициировала больше одновременных вызовов инструментов, чем было заложено.
Сам сбой, как утверждается, уже устранён.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍2
MIT предложили интересную рамку для self-evolving AI scientists - систем, которые не просто ищут ответ, а умеют понять, что им не хватает самого языка для описания открытия.
Проблема в том, что большинство ИИ-систем для науки работают внутри заранее заданной схемы. Они могут перебирать гипотезы, искать статьи, запускать инструменты, сравнивать результаты, но всё равно остаются внутри фиксированного набора переменных, тестов и понятий.
А настоящая наука часто начинается там, где приходится менять саму схему:
- добавить новый тип переменной
- придумать новый инструмент измерения
- ввести новый класс объектов
- изменить способ проверки гипотезы
- сформулировать утверждение, которое раньше нельзя было выразить
Идея статьи в том, чтобы представлять каждый элемент работы агента как typed artifact: данные, модель, вывод инструмента, ошибку, промежуточный результат, гипотезу или финальный claim. Система должна знать не только «что это», но и как это было получено.
Так агент может различать три режима:
- retrieval - добавили уже известный факт
- search - поискали внутри старой схемы
- discovery - изменили саму схему, чтобы стало возможно выразить новое
Это попытка формализовать то, что ИИ-агенты пока чаще имитируют: разницу между «найти ответ внутри языка» и «заслужить право изменить сам язык».
arxiv.org/abs/2606.01444
Проблема в том, что большинство ИИ-систем для науки работают внутри заранее заданной схемы. Они могут перебирать гипотезы, искать статьи, запускать инструменты, сравнивать результаты, но всё равно остаются внутри фиксированного набора переменных, тестов и понятий.
А настоящая наука часто начинается там, где приходится менять саму схему:
- добавить новый тип переменной
- придумать новый инструмент измерения
- ввести новый класс объектов
- изменить способ проверки гипотезы
- сформулировать утверждение, которое раньше нельзя было выразить
Идея статьи в том, чтобы представлять каждый элемент работы агента как typed artifact: данные, модель, вывод инструмента, ошибку, промежуточный результат, гипотезу или финальный claim. Система должна знать не только «что это», но и как это было получено.
Так агент может различать три режима:
- retrieval - добавили уже известный факт
- search - поискали внутри старой схемы
- discovery - изменили саму схему, чтобы стало возможно выразить новое
Это попытка формализовать то, что ИИ-агенты пока чаще имитируют: разницу между «найти ответ внутри языка» и «заслужить право изменить сам язык».
arxiv.org/abs/2606.01444
👍6❤1🔥1
В Harvard Business Review вышел материал о том, как ИИ ломает найм сразу с двух сторон.
Резюме стало проще подделывать, а удалённые интервью - проще проходить с подсказками в реальном времени. В итоге система всё чаще награждает не тех, кто лучше справится с работой, а тех, кто лучше умеет проходить сам процесс найма.
Кандидат может за несколько минут сгенерировать вылизанный текст с нужными ключевыми словами, а AI-скринеры иногда сами предпочитают резюме, похожие на output модели. В статье приводится исследование, где такие резюме получали на 23-60% больше шансов попасть в короткий список.
Первый раунд удалённых интервью тоже теряет доверие. Live AI-ассистенты уже могут подсказывать ответы во время звонка, особенно на предсказуемые вопросы: конфликт в команде, мотивация, карьерный путь, «расскажите о сложной ситуации».
Проблема не только в false positives, когда слабый кандидат выглядит сильным. Есть и false negatives: нестандартные сильные кандидаты могут вообще не попасть к человеку, потому что их документы хуже оптимизированы под фильтры.
HBR предлагает уходить от шаблонных вопросов к живым рабочим симуляциям. Кандидату дают messy-сценарий из реальной работы, просят принять решение, а затем интервьюер меняет вводные: добавляет ограничение, противоречие или новый факт.
Так проверяется способность думать на ходу: защищать tradeoffs, менять решение и сохранять связную логику под давлением.
https://hbr.org/2026/06/ai-has-broken-hiring-heres-how-to-fix-it
Резюме стало проще подделывать, а удалённые интервью - проще проходить с подсказками в реальном времени. В итоге система всё чаще награждает не тех, кто лучше справится с работой, а тех, кто лучше умеет проходить сам процесс найма.
Кандидат может за несколько минут сгенерировать вылизанный текст с нужными ключевыми словами, а AI-скринеры иногда сами предпочитают резюме, похожие на output модели. В статье приводится исследование, где такие резюме получали на 23-60% больше шансов попасть в короткий список.
Первый раунд удалённых интервью тоже теряет доверие. Live AI-ассистенты уже могут подсказывать ответы во время звонка, особенно на предсказуемые вопросы: конфликт в команде, мотивация, карьерный путь, «расскажите о сложной ситуации».
Проблема не только в false positives, когда слабый кандидат выглядит сильным. Есть и false negatives: нестандартные сильные кандидаты могут вообще не попасть к человеку, потому что их документы хуже оптимизированы под фильтры.
HBR предлагает уходить от шаблонных вопросов к живым рабочим симуляциям. Кандидату дают messy-сценарий из реальной работы, просят принять решение, а затем интервьюер меняет вводные: добавляет ограничение, противоречие или новый факт.
Так проверяется способность думать на ходу: защищать tradeoffs, менять решение и сохранять связную логику под давлением.
https://hbr.org/2026/06/ai-has-broken-hiring-heres-how-to-fix-it
❤10👍6🔥3😁1🤡1
“Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines”
В статье утверждается, что sparse autoencoders, возможно, не такие уж плохие инструменты для steering, как считалось раньше. Значительная часть прошлых неудач могла быть связана не с самими автоэнкодерами, а с тем, что исследователи выбирали и называли неправильные признаки.
Проблема в том, что ранние работы выставляли sparse autoencoders слабыми: их features размечали так, что названия могли не совпадать с тем, что эти признаки реально вызывают внутри модели.
Sparse autoencoder - это небольшая вспомогательная модель, которая раскладывает скрытую активность LLM на множество возможных «признаков»: тему, стиль, концепт или другое внутреннее направление.
То есть sparse autoencoder может найти направление внутри модели, но неназванное направление ещё не становится удобной ручкой управления.
Авторы заменяют размытые или унаследованные названия supervised-пайплайном: они проверяют, действительно ли активность конкретного feature стабильно совпадает с реальной меткой в данных.
Механизм примерно такой: если feature срабатывает на тему «алкоголь», а искусственное усиление этого feature заставляет модель чаще говорить об алкоголе, то метка перестаёт быть просто описательной. У неё появляется причинный смысл.
Ещё один важный вывод: экстремальная разреженность может быть не обязательна. Feature не обязан быть сверхредким, чтобы быть полезным для steering.
Важно и сравнение с prompting. И prompting, и feature steering пытаются подтолкнуть LLM к нужному поведению.
Но prompting обычно сильнее, потому что модель специально обучали следовать промптам. Feature steering работает грубее: мы как будто напрямую нажимаем на внутренний механизм модели и надеемся, что остальная система не развалится.
Prompting говорит модели во входе: «напиши про алкоголь». Feature steering делает иначе: он усиливает внутренний «alcohol-related» feature и проверяет, сдвинется ли ответ в эту сторону.
Ссылка: arxiv.org/abs/2605.31183
В статье утверждается, что sparse autoencoders, возможно, не такие уж плохие инструменты для steering, как считалось раньше. Значительная часть прошлых неудач могла быть связана не с самими автоэнкодерами, а с тем, что исследователи выбирали и называли неправильные признаки.
Проблема в том, что ранние работы выставляли sparse autoencoders слабыми: их features размечали так, что названия могли не совпадать с тем, что эти признаки реально вызывают внутри модели.
Sparse autoencoder - это небольшая вспомогательная модель, которая раскладывает скрытую активность LLM на множество возможных «признаков»: тему, стиль, концепт или другое внутреннее направление.
То есть sparse autoencoder может найти направление внутри модели, но неназванное направление ещё не становится удобной ручкой управления.
Авторы заменяют размытые или унаследованные названия supervised-пайплайном: они проверяют, действительно ли активность конкретного feature стабильно совпадает с реальной меткой в данных.
Механизм примерно такой: если feature срабатывает на тему «алкоголь», а искусственное усиление этого feature заставляет модель чаще говорить об алкоголе, то метка перестаёт быть просто описательной. У неё появляется причинный смысл.
Ещё один важный вывод: экстремальная разреженность может быть не обязательна. Feature не обязан быть сверхредким, чтобы быть полезным для steering.
Важно и сравнение с prompting. И prompting, и feature steering пытаются подтолкнуть LLM к нужному поведению.
Но prompting обычно сильнее, потому что модель специально обучали следовать промптам. Feature steering работает грубее: мы как будто напрямую нажимаем на внутренний механизм модели и надеемся, что остальная система не развалится.
Prompting говорит модели во входе: «напиши про алкоголь». Feature steering делает иначе: он усиливает внутренний «alcohol-related» feature и проверяет, сдвинется ли ответ в эту сторону.
Ссылка: arxiv.org/abs/2605.31183
❤3👍3
🐍 Python Парсинг: Большой продвинутый бесплатный курс
Полное практическое руководство по веб-скрейпингу на Python — от основ HTTP до production-grade пауков, обхода антибот-защит, асинхронности и проектирования надёжных пайплайнов. Каждый раздел содержит рабочие примеры, типовые ошибки и продвинутые практики.
https://github.com/justxor/Pythonparsing-/tree/main
Полное практическое руководство по веб-скрейпингу на Python — от основ HTTP до production-grade пауков, обхода антибот-защит, асинхронности и проектирования надёжных пайплайнов. Каждый раздел содержит рабочие примеры, типовые ошибки и продвинутые практики.
https://github.com/justxor/Pythonparsing-/tree/main
👍4🔥3🥰2
В Оксфордском университете написали эссе, объясняющее, как работает «Бесконечность» Годзё Сатору.
В эссе “Mathematics Behind Jujutsu Kaisen: Gojo Satoru’s Infinity” разбирают технику Infinity как настоящий математический объект.
На поверхности всё похоже на парадокс Зенона: между атакующим и Годжо всегда остаётся расстояние. Его можно делить пополам бесконечно: половина, четверть, одна восьмая и так дальше. Кажется, что атакующий никогда не дойдёт до цели.
Но обычная математика быстро ломает эту “абсолютную защиту”. Геометрическая прогрессия сходится:
1/2 + 1/4 + 1/8 + ... = 1
То есть бесконечно много шагов могут дать конечное расстояние и конечное время. С этой точки зрения Infinity не должна останавливать атаку вообще.
Дальше начинается интереснее. Через меру Лебега автор показывает, что бесконечный набор точек деления может иметь нулевую длину. То есть “барьер” из бесконечного числа точек не занимает пространства как настоящая стена.
Тогда почему атака всё-таки тормозит?
Ответ даёт риманова геометрия. Infinity можно понимать не как стену, а как искажение самой метрики пространства рядом с Годжо. Чем ближе атакующий подходит, тем сильнее растягивается “линейка”, которой измеряется расстояние. Физически шаг может быть маленьким, но внутри такой геометрии он ощущается всё длиннее и длиннее.
Поэтому техника работает не как невидимая преграда, а как изменение правил измерения пространства.
И отсюда становится понятнее, почему Sukuna смог её обойти. Он не “пробил” Infinity обычной атакой. Он атаковал не Годжо как точку внутри пространства, а само пространство, в котором держалась техника. В терминах статьи, World Cutting Slash разрывает непрерывность метрики. Барьер не преодолевается, а теряет основу, на которой существовал.
Получается красивый разбор: Infinity Годжо можно описать через сходимость рядов, меру Лебега, риманову геометрию и топологию.
Редкий случай, когда аниме-способность реально тянет на мини-курс по современной математике.
PDF:
https://tomrocksmaths.com/wp-content/uploads/2026/06/achmad-roykhan-sabiq_essay_competition_2026-achmad-roykhan-sabiq.pdf
В эссе “Mathematics Behind Jujutsu Kaisen: Gojo Satoru’s Infinity” разбирают технику Infinity как настоящий математический объект.
На поверхности всё похоже на парадокс Зенона: между атакующим и Годжо всегда остаётся расстояние. Его можно делить пополам бесконечно: половина, четверть, одна восьмая и так дальше. Кажется, что атакующий никогда не дойдёт до цели.
Но обычная математика быстро ломает эту “абсолютную защиту”. Геометрическая прогрессия сходится:
1/2 + 1/4 + 1/8 + ... = 1
То есть бесконечно много шагов могут дать конечное расстояние и конечное время. С этой точки зрения Infinity не должна останавливать атаку вообще.
Дальше начинается интереснее. Через меру Лебега автор показывает, что бесконечный набор точек деления может иметь нулевую длину. То есть “барьер” из бесконечного числа точек не занимает пространства как настоящая стена.
Тогда почему атака всё-таки тормозит?
Ответ даёт риманова геометрия. Infinity можно понимать не как стену, а как искажение самой метрики пространства рядом с Годжо. Чем ближе атакующий подходит, тем сильнее растягивается “линейка”, которой измеряется расстояние. Физически шаг может быть маленьким, но внутри такой геометрии он ощущается всё длиннее и длиннее.
Поэтому техника работает не как невидимая преграда, а как изменение правил измерения пространства.
И отсюда становится понятнее, почему Sukuna смог её обойти. Он не “пробил” Infinity обычной атакой. Он атаковал не Годжо как точку внутри пространства, а само пространство, в котором держалась техника. В терминах статьи, World Cutting Slash разрывает непрерывность метрики. Барьер не преодолевается, а теряет основу, на которой существовал.
Получается красивый разбор: Infinity Годжо можно описать через сходимость рядов, меру Лебега, риманову геометрию и топологию.
Редкий случай, когда аниме-способность реально тянет на мини-курс по современной математике.
PDF:
https://tomrocksmaths.com/wp-content/uploads/2026/06/achmad-roykhan-sabiq_essay_competition_2026-achmad-roykhan-sabiq.pdf
❤10👎4🔥4😁4🗿1
Forwarded from 📚Python Books
Один из лучших вводных материалов по прикладной линейной алгебре, который мне попадался.
Этот курс объясняет векторы, матрицы и метод наименьших квадратов с самых основ, а затем связывает их с реальными задачами:
• подгонка данных
• машинное обучение
• оптимизация
• обработка изображений
• системы управления
Это материал, который можно рекомендовать студентам, инженерам и всем, кто хочет понять математический фундамент современной data science.
PDF: https://web.stanford.edu/~boyd/vmls/vmls.pdf
Этот курс объясняет векторы, матрицы и метод наименьших квадратов с самых основ, а затем связывает их с реальными задачами:
• подгонка данных
• машинное обучение
• оптимизация
• обработка изображений
• системы управления
Это материал, который можно рекомендовать студентам, инженерам и всем, кто хочет понять математический фундамент современной data science.
PDF: https://web.stanford.edu/~boyd/vmls/vmls.pdf
👍10❤4
LLM-агенты для трейдинга в основном проваливаются, когда тесты на фондовом рынке становятся длинными, широкими и честными.
Авторы создали FINSABER - более строгую систему оценки, которая проверяет LLM-трейдинг примерно на 20-летнем периоде, на большем числе акций и с лучшей защитой от cherry-picking, то есть подбора удобных результатов.
Они сравнили LLM-системы вроде FinMem и FinAgent с простыми базовыми стратегиями: Buy and Hold, rule-based trading, forecasting models и reinforcement learning методами.
Главный результат: LLM-стратегии могут выглядеть хорошо в узких тестах, но обычно не обгоняют простые рыночные стратегии, когда тест становится длиннее и честнее.
Также в работе показано, что такие LLM плохо ведут себя в разных рыночных условиях: они слишком осторожны, когда акции растут, и слишком рискованны, когда рынок падает.
То есть современные LLM могут понимать финансовые тексты, но это не значит, что они умеют надёжно угадывать движение фондового рынка.
Link: arxiv.org/abs/2505.07078v5
Title: “Can LLM-based Financial Investing Strategies Outperform the Market in Long Run?”
Авторы создали FINSABER - более строгую систему оценки, которая проверяет LLM-трейдинг примерно на 20-летнем периоде, на большем числе акций и с лучшей защитой от cherry-picking, то есть подбора удобных результатов.
Они сравнили LLM-системы вроде FinMem и FinAgent с простыми базовыми стратегиями: Buy and Hold, rule-based trading, forecasting models и reinforcement learning методами.
Главный результат: LLM-стратегии могут выглядеть хорошо в узких тестах, но обычно не обгоняют простые рыночные стратегии, когда тест становится длиннее и честнее.
Также в работе показано, что такие LLM плохо ведут себя в разных рыночных условиях: они слишком осторожны, когда акции растут, и слишком рискованны, когда рынок падает.
То есть современные LLM могут понимать финансовые тексты, но это не значит, что они умеют надёжно угадывать движение фондового рынка.
Link: arxiv.org/abs/2505.07078v5
Title: “Can LLM-based Financial Investing Strategies Outperform the Market in Long Run?”
🔥5❤4👍3
AutoMem ускоряет long-horizon агентов в 2–4 раза
Новая работа предлагает обучать память агента как отдельный cognitive skill.
Идея в том, что агент должен не просто складывать всё в контекст, а учиться:
• что сохранять
• как кодировать информацию
• когда доставать нужные данные
• как менять структуру памяти после опыта
AutoMem использует два цикла: LLM пересобирает memory structure по прошлым траекториям, а затем улучшает её через удачные решения.
На Crafter, MiniHack и NetHack авторы показывают, что одна только оптимизация памяти уже даёт сильный прирост и местами приближает агентов к frontier-моделям.
Почему это важно: long-horizon задачи часто ломаются не из-за слабого reasoning, а из-за плохой памяти. Агент забывает контекст, хранит мусор или не может достать нужный факт вовремя.
AutoMem пытается решить именно этот bottleneck без полного переобучения под каждую задачу.
Потенциально полезно для игровых агентов, робототехники и автономных workflow.
arxiv.org/abs/2607.01224
Новая работа предлагает обучать память агента как отдельный cognitive skill.
Идея в том, что агент должен не просто складывать всё в контекст, а учиться:
• что сохранять
• как кодировать информацию
• когда доставать нужные данные
• как менять структуру памяти после опыта
AutoMem использует два цикла: LLM пересобирает memory structure по прошлым траекториям, а затем улучшает её через удачные решения.
На Crafter, MiniHack и NetHack авторы показывают, что одна только оптимизация памяти уже даёт сильный прирост и местами приближает агентов к frontier-моделям.
Почему это важно: long-horizon задачи часто ломаются не из-за слабого reasoning, а из-за плохой памяти. Агент забывает контекст, хранит мусор или не может достать нужный факт вовремя.
AutoMem пытается решить именно этот bottleneck без полного переобучения под каждую задачу.
Потенциально полезно для игровых агентов, робототехники и автономных workflow.
arxiv.org/abs/2607.01224
❤5👍1🔥1
Forwarded from Machine learning Interview
Вышла полезная работа про то, почему reasoning-модели становятся сильнее после обучения.
Авторы пишут, что дело не только в размере датасета. Для reasoning важнее другое: есть ли у модели понятная проверка, где она справилась, где ошиблась и почему.
Обычная пара «вопрос → ответ» даёт мало сигнала. Она показывает результат, но не показывает процесс: какой шаг был неверным, какой вызов инструмента помог, где модель восстановилась после ошибки, какой judge подтвердил решение.
Поэтому хороший обучающий пример для reasoning должен хранить больше контекста: саму задачу, действия модели, проверку результата и метаданные о том, откуда взялся пример.
Проверка бывает разной. В математике и коде можно использовать точные тесты. У агентов можно смотреть, справился ли он в окружении. В более размытых задачах приходится подключать людей или model-judge.
Отдельно авторы предупреждают о популярных ошибках. Длинная цепочка рассуждений не всегда полезна. Сложные задачи не всегда улучшают конкретную модель. Большой датасет может выглядеть внушительно, но всё равно плохо покрывать нужные навыки.
Для agent data особенно важно сохранять всю «грязную» траекторию: неудачные действия, повторные попытки, исправления, изменения состояния и финальную проверку. Часто именно там лежит самый ценный обучающий сигнал.
Итоговый подход такой- обучать reasoning-модель не на красивых ответах, а на проверяемых попытках, где видно, что сработало, что сломалось и почему это можно использовать для обучения.
Paper: A Primer in Post-Training Reasoning Data: What They Know About How It Works
https://arxiv.org/abs/2606.02113
Авторы пишут, что дело не только в размере датасета. Для reasoning важнее другое: есть ли у модели понятная проверка, где она справилась, где ошиблась и почему.
Обычная пара «вопрос → ответ» даёт мало сигнала. Она показывает результат, но не показывает процесс: какой шаг был неверным, какой вызов инструмента помог, где модель восстановилась после ошибки, какой judge подтвердил решение.
Поэтому хороший обучающий пример для reasoning должен хранить больше контекста: саму задачу, действия модели, проверку результата и метаданные о том, откуда взялся пример.
Проверка бывает разной. В математике и коде можно использовать точные тесты. У агентов можно смотреть, справился ли он в окружении. В более размытых задачах приходится подключать людей или model-judge.
Отдельно авторы предупреждают о популярных ошибках. Длинная цепочка рассуждений не всегда полезна. Сложные задачи не всегда улучшают конкретную модель. Большой датасет может выглядеть внушительно, но всё равно плохо покрывать нужные навыки.
Для agent data особенно важно сохранять всю «грязную» траекторию: неудачные действия, повторные попытки, исправления, изменения состояния и финальную проверку. Часто именно там лежит самый ценный обучающий сигнал.
Итоговый подход такой- обучать reasoning-модель не на красивых ответах, а на проверяемых попытках, где видно, что сработало, что сломалось и почему это можно использовать для обучения.
Paper: A Primer in Post-Training Reasoning Data: What They Know About How It Works
https://arxiv.org/abs/2606.02113
❤5
Spatially Speculative Decoding ускоряет авторегрессионные image-модели до 13.3×.
Идея простая: перестать делать вид, что картинка - это просто длинная строка токенов.
Обычно AR image-модель разворачивает 2D-изображение в последовательность и генерирует её токен за токеном. Это работает, но убивает скорость: каждый следующий шаг ждёт предыдущий.
SSD добавляет маленькие draft-heads, которые используют пространственную структуру изображения. Они предсказывают не только следующий токен, но и соседние токены справа и снизу. По сути, модель начинает черновиком собирать сразу куски изображения и целые строки, а не идти по одному токену.
Эти вспомогательные головы не пытаются угадывать финальные visual token labels напрямую. Они предсказывают внутренние feature-представления, которые проще выучить и стабильнее проверять.
Основная модель потом верифицирует draft-блок параллельно и исправляет ошибки, поэтому один промах не обнуляет весь блок.
На Janus-Pro, Lumina-mGPT и Emu3 авторы получили ускорение от 5.74× до 13.28× при сопоставимых бенчмарках.
Чем больше token grid, тем выше выигрыш. Базовая модель при этом не меняется: ускорение даёт небольшой обученный модуль поверх неё.
Paper: “SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation”
arxiv.org/abs/2606.20543
@machinelearning_books
Идея простая: перестать делать вид, что картинка - это просто длинная строка токенов.
Обычно AR image-модель разворачивает 2D-изображение в последовательность и генерирует её токен за токеном. Это работает, но убивает скорость: каждый следующий шаг ждёт предыдущий.
SSD добавляет маленькие draft-heads, которые используют пространственную структуру изображения. Они предсказывают не только следующий токен, но и соседние токены справа и снизу. По сути, модель начинает черновиком собирать сразу куски изображения и целые строки, а не идти по одному токену.
Эти вспомогательные головы не пытаются угадывать финальные visual token labels напрямую. Они предсказывают внутренние feature-представления, которые проще выучить и стабильнее проверять.
Основная модель потом верифицирует draft-блок параллельно и исправляет ошибки, поэтому один промах не обнуляет весь блок.
На Janus-Pro, Lumina-mGPT и Emu3 авторы получили ускорение от 5.74× до 13.28× при сопоставимых бенчмарках.
Чем больше token grid, тем выше выигрыш. Базовая модель при этом не меняется: ускорение даёт небольшой обученный модуль поверх неё.
Paper: “SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation”
arxiv.org/abs/2606.20543
@machinelearning_books
🔥2🥰2❤1👍1
🤖У нас есть ИИ дома
Узнайте, как запустить корпоративный ИИ в собственном контуре за 2 недели
Не готовы мириться с ограничениями и дырами в безопасности при использовании публичных ИИ-сервисов, но разворачивать собственную инфраструктуру для инференса долго и тяжело? Присоединяйтесь к вебинару от Selectel и узнайте, как быстро запускать и масштабировать ИИ в собственном контуре без крупных капитальных затрат.
В программе вебинара:
🔹Модели развертывания ИИ-инфраструктуры и причины выбора решений на собственной площадке.
🔹Обзор возможностей и сценариев применения нового сервиса AIBox от Selectel, Yandex Cloud и Metamentor — развертывания локального ИИ в контуре клиента на базе серверов Selectel.
🔹Разбор реальных бизнес-кейсов.
📍 Онлайн
⏰ 23 июля в 12:00
Регистрируйтесь и ускорьте внедрение ИИ в компании ➡️ https://slc.tl/kuka2
Больше мероприятий для ИТ-специалистов в канале @selectel_events. Подписывайтесь!
Реклама. АО "Селектел". erid:2W5zFGVyJ8h
Узнайте, как запустить корпоративный ИИ в собственном контуре за 2 недели
Не готовы мириться с ограничениями и дырами в безопасности при использовании публичных ИИ-сервисов, но разворачивать собственную инфраструктуру для инференса долго и тяжело? Присоединяйтесь к вебинару от Selectel и узнайте, как быстро запускать и масштабировать ИИ в собственном контуре без крупных капитальных затрат.
В программе вебинара:
🔹Модели развертывания ИИ-инфраструктуры и причины выбора решений на собственной площадке.
🔹Обзор возможностей и сценариев применения нового сервиса AIBox от Selectel, Yandex Cloud и Metamentor — развертывания локального ИИ в контуре клиента на базе серверов Selectel.
🔹Разбор реальных бизнес-кейсов.
📍 Онлайн
⏰ 23 июля в 12:00
Регистрируйтесь и ускорьте внедрение ИИ в компании ➡️ https://slc.tl/kuka2
Больше мероприятий для ИТ-специалистов в канале @selectel_events. Подписывайтесь!
Реклама. АО "Селектел". erid:2W5zFGVyJ8h
В открытом доступе лежит большой PDF по causal inference на стыке ML, статистики и AI.
Applied Causal Inference Powered by ML and AI - это 496-страничная книга от Victor Chernozhukov, Christian Hansen, Nathan Kallus, Martin Spindler и Vasilis Syrgkanis. На arXiv она описана как введение в связку machine learning и causal inference.
Внутри разбираются structural equation models, DAG, structural causal models и Double / Debiased Machine Learning, то есть методы, которые помогают отвечать не только на вопрос “что модель предсказывает?”, но и на вопрос “что реально влияет?”.
Это полезно, если вы работаете с экспериментами, A/B-тестами, продуктовой аналитикой, эконометрикой, рекомендациями или ML-моделями, где важно отличать корреляцию от причинного эффекта.
Сильная тема для тех, кто уже устал от “модель нашла закономерность” и хочет понимать, можно ли на этой закономерности принимать решения.
PDF: https://arxiv.org/abs/2403.02467
#ML #DataScience #Algorithms #Statistics
Applied Causal Inference Powered by ML and AI - это 496-страничная книга от Victor Chernozhukov, Christian Hansen, Nathan Kallus, Martin Spindler и Vasilis Syrgkanis. На arXiv она описана как введение в связку machine learning и causal inference.
Внутри разбираются structural equation models, DAG, structural causal models и Double / Debiased Machine Learning, то есть методы, которые помогают отвечать не только на вопрос “что модель предсказывает?”, но и на вопрос “что реально влияет?”.
Это полезно, если вы работаете с экспериментами, A/B-тестами, продуктовой аналитикой, эконометрикой, рекомендациями или ML-моделями, где важно отличать корреляцию от причинного эффекта.
Сильная тема для тех, кто уже устал от “модель нашла закономерность” и хочет понимать, можно ли на этой закономерности принимать решения.
PDF: https://arxiv.org/abs/2403.02467
#ML #DataScience #Algorithms #Statistics
❤7👍3