Data Recipes for Agentic Models - челы из terminal bench выпустили
оверолл метод понятный - собрать разные сеты, фильтрануть, обучить 32b qwen3(что?) не сравниваться с qwen3.5 (что?) и эээ ну прикольно, но уже устарело не успев выйти
https://arxiv.org/pdf/2606.24855
оверолл метод понятный - собрать разные сеты, фильтрануть, обучить 32b qwen3(что?) не сравниваться с qwen3.5 (что?) и эээ ну прикольно, но уже устарело не успев выйти
https://arxiv.org/pdf/2606.24855
🤡25🥱9💩8💊6❤🔥2🔥1
Forwarded from эйай ньюз
В Vesuvius Challenge впервые прочитали весь обуглившийся свиток
Из-за того что папирус разлагается за несколько сотен лет, за тысячелетия было утеряно большинство текстов из той эпохи. Геркуланумским папирусам в каком-то смысле повезло — из-за извержения Везувия две тысячи лет назад свитки обуглились и были погребены, что позволило им сохраниться.
Уже в наше время вышло сделать трёхмерные сканы свитков при помощи рентгена и использовать нейросети для их "виртуального разворачивания". Таким образом в 2023 году победителям Vesuvius Challenge удалось прочитать небольшой отрывок из одного папируса, после чего нескольких участников наняли заниматься этим на постоянной основе, что привело к реконструкции содержимого всего свитка.
К сожалению, большая часть PHerc. 1667, расшифрованного свитка, была физически уничтожена во время нескольких попыток открыть его в 19 и 20 веке, так что из 19-24 сантиметров свитка, физически уцелело лишь 8. По нему понятно, что это стоический текст датированный 2 веком до нашей эры, у которого удалось идентифицировать автора — Аристокреона, ученика известного стоического философа Хрисиппа.
Остались ещё сотни свитков которые ждут своего часа, команда и не думает останавливаться. Новый текст из свитков в ближайшие годы станет регулярным событием.
Блогпост
@ai_newz
Из-за того что папирус разлагается за несколько сотен лет, за тысячелетия было утеряно большинство текстов из той эпохи. Геркуланумским папирусам в каком-то смысле повезло — из-за извержения Везувия две тысячи лет назад свитки обуглились и были погребены, что позволило им сохраниться.
Уже в наше время вышло сделать трёхмерные сканы свитков при помощи рентгена и использовать нейросети для их "виртуального разворачивания". Таким образом в 2023 году победителям Vesuvius Challenge удалось прочитать небольшой отрывок из одного папируса, после чего нескольких участников наняли заниматься этим на постоянной основе, что привело к реконструкции содержимого всего свитка.
К сожалению, большая часть PHerc. 1667, расшифрованного свитка, была физически уничтожена во время нескольких попыток открыть его в 19 и 20 веке, так что из 19-24 сантиметров свитка, физически уцелело лишь 8. По нему понятно, что это стоический текст датированный 2 веком до нашей эры, у которого удалось идентифицировать автора — Аристокреона, ученика известного стоического философа Хрисиппа.
Остались ещё сотни свитков которые ждут своего часа, команда и не думает останавливаться. Новый текст из свитков в ближайшие годы станет регулярным событием.
Блогпост
@ai_newz
🔥106❤🔥21👏15💊4💩3🤡3
Красивый блог про то как челы PPO для роботов заводят
thehumanoid.ai/technology/kinetiq-ascend/
thehumanoid.ai/technology/kinetiq-ascend/
Humanoid
KinetIQ Ascend: Towards 100% Manipulation Reliability and Superhuman Speed - Humanoid
At Humanoid, we build humanoid robots for real industrial work on production lines and in warehouses. A robot at a work station repeats its task thousands of times a day and earns its place only if it almost never fails while keeping the pace with the people…
❤🔥14🔥9
This media is not supported in your browser
VIEW IN TELEGRAM
Tldr: дистилл чтобы улучшать капибилити работает только на фулл ризонинге, на суммаризованном не работает.
https://arxiv.org/abs/2606.05988v1
https://arxiv.org/abs/2606.05988v1
arXiv.org
Compress-Distill: Reasoning Trace Compression for Efficient...
Reasoning models produce long chain-of-thought traces that are costly to distill and encourage verbose student outputs. We study post-hoc compression of such traces before knowledge distillation....
🤔27👍6💯4🔥2
Love. Death. Transformers.
Tldr: дистилл чтобы улучшать капибилити работает только на фулл ризонинге, на суммаризованном не работает. https://arxiv.org/abs/2606.05988v1
все что вы хотели видеть мои дорогие любители дистилить фронтир
😢27👍3🔥1
Забавный в своей бесполезности тул - мониторинг взлома реварда, проверяет есть ли коллапс награды в одно значении и прочие простые штуки
https://github.com/AvAdiii/rewardspy
https://github.com/AvAdiii/rewardspy
🔥32😁5
Forwarded from Пресс-служба Сириона
Меня всегда удивляет, что можно найти на просторах интернета, например, математические доказательства ранее нерешенных проблем
Аниме "Меланхолия Харухи Судзумии" в первом сезоне состоит из 14 серий, которые задумывались так, чтобы их можно было смотреть в любом порядке
в 2011 на фочане кто-то задался вопросом: "какое минимальное количество серий нужно посмотреть, чтобы увидеть весь сезон во всех возможных порядках?"
Оказалось, что это классическая задача комбинаторики про суперперестановки https://en.wikipedia.org/wiki/Superpermutation
И какой-то анонимный юзер доказал, что нижняя граница равна n! + (n−1)! + (n−2)! + n − 3, при n >= 2
Это пылилось на просторах интернета, пока в 2013 году про тред не написал Натаниэль Джонстон у себя в блоге, но это доказательство осталось без внимания, пока в 2018 Робин Хьюстон не наткнулся на пост в блоге, и вместе с коллегами опубликовал статью с дополненным доказательством, где первым автором указал анонима с фочана
Оригинальная статья, где первый автор это аноним с фочана https://oeis.org/A180632/a180632.pdf
Ну и сама задача о кратчайшей суперперестановке называется проблемой Харухи: https://mathsci.fandom.com/wiki/The_Haruhi_Problem
Аниме "Меланхолия Харухи Судзумии" в первом сезоне состоит из 14 серий, которые задумывались так, чтобы их можно было смотреть в любом порядке
в 2011 на фочане кто-то задался вопросом: "какое минимальное количество серий нужно посмотреть, чтобы увидеть весь сезон во всех возможных порядках?"
Оказалось, что это классическая задача комбинаторики про суперперестановки https://en.wikipedia.org/wiki/Superpermutation
И какой-то анонимный юзер доказал, что нижняя граница равна n! + (n−1)! + (n−2)! + n − 3, при n >= 2
Это пылилось на просторах интернета, пока в 2013 году про тред не написал Натаниэль Джонстон у себя в блоге, но это доказательство осталось без внимания, пока в 2018 Робин Хьюстон не наткнулся на пост в блоге, и вместе с коллегами опубликовал статью с дополненным доказательством, где первым автором указал анонима с фочана
Оригинальная статья, где первый автор это аноним с фочана https://oeis.org/A180632/a180632.pdf
Ну и сама задача о кратчайшей суперперестановке называется проблемой Харухи: https://mathsci.fandom.com/wiki/The_Haruhi_Problem
😁137 53🔥25👍4🥱3⚡1
Forwarded from Dan Okhlopkov - канал
Рассказал:
• как и где я использую Hermes Agent
• как засетапить себе бота как @fiztehbot
• нюансы, безопасность, контекст
Моя январская статья стала самой популярной на хабре про СС (192k просмотров), хотя ее жестко заминусовали лол
Оставьте коммент под статьей - посмотрим, что на это скажут ИИ хейтеры
🔗 habr.com/ru/articles/1053846
🔗 habr.com/ru/articles/1053846
🔗 habr.com/ru/articles/1053846
• как и где я использую Hermes Agent
• как засетапить себе бота как @fiztehbot
• нюансы, безопасность, контекст
Моя январская статья стала самой популярной на хабре про СС (192k просмотров), хотя ее жестко заминусовали лол
Оставьте коммент под статьей - посмотрим, что на это скажут ИИ хейтеры
🔗 habr.com/ru/articles/1053846
🔗 habr.com/ru/articles/1053846
🔗 habr.com/ru/articles/1053846
🤡64💩13💊10🔥5😁2🍌1
Forwarded from AbstractDL
Sonnet-5
По метрикам классный. По цене на 30% дешевле sonnet-4.6 (временно). Хоуп уже тестит в чате.
Блог, техрепорт
По метрикам классный. По цене на 30% дешевле sonnet-4.6 (временно). Хоуп уже тестит в чате.
Блог, техрепорт
⚡35🥱15🔥8👍5💩5🎉2❤🔥1
Forwarded from Гречневые мысли
Объявляется неделя прикольных ссылок
Мои коллеги из команды претрейнов сделали дискретную диффузию на основе гигачата — причём основным исполнителем был стажёр. Веса в опенсорсе, поддержка в SGLang в PR, метрики лишь немного ниже обычного гигачата, а скорость генерации выше аж на 72%.
Если вы умный, активный и хотите делать прикольные штуки на большом компьюте, приходите к нам)
Репорт:
https://habr.com/ru/companies/sberbank/articles/1054690/
Веса:
https://huggingface.co/ai-sage/GFusion-10B-A1.8B
Мои коллеги из команды претрейнов сделали дискретную диффузию на основе гигачата — причём основным исполнителем был стажёр. Веса в опенсорсе, поддержка в SGLang в PR, метрики лишь немного ниже обычного гигачата, а скорость генерации выше аж на 72%.
Если вы умный, активный и хотите делать прикольные штуки на большом компьюте, приходите к нам)
Репорт:
https://habr.com/ru/companies/sberbank/articles/1054690/
Веса:
https://huggingface.co/ai-sage/GFusion-10B-A1.8B
👍50💩20🔥11😁4🤡4💊3👏2❤🔥1
Forwarded from Data Blog
StiTching
Мне сегодня нужно было сшить кожу на пальце, и в процессе этого перформанса я вспомнила про model stitching. Чтобы скрасить время — врачебное и моё — начала рассказывать зачем это надо. Без понятия, зашло ли хирургу и медсестре, но зато я обнаружила для себя интересный тейк на поделиться с вами = )
Что:
Тогда это осталось нишевым инструментом для картинок — юзали AlexNet-ы.
Потом в 2021 NeurIPS идею дооформили, вышли две работы: Similarity and Matching of Neural Network Representations и Revisiting Model Stitching to Compare Neural Representations. Кстати, в первой работе шутили про Франкенштейна (или нет).
Как это стало устроено:
Смотрим на две обученные и замороженные сети A и B. «Сшитая» модель строится так:
• берём нижние слои сети B (front model, представление r = B≤ℓ)
• между ними ставим тонкий обучаемый stitching layer — единственный, кто обучается
• подключаем к верхним слоям сети A (top model, A>ℓ)
То есть делаем бутерброд из белого и темного хлеба, если хотите. А формально ищется простейший слой, задачей вида: L_ℓ(r; A) = inf_{s∈S} L(A>ℓ ∘ s ∘ r)
Где s — stitching layer, A>ℓ — верхние слои A, r — представление из B. s∈S — тут специально, мы ищем слой из класса простых слоев, а инфимум (inf), как математический знак, говорит нам, что stitching layer обязан быть минимальным: для свёрточных сетей — 1×1 conv с BatchNorm, для трансформеров — token-wise linear.
Как именно обучают stitching layer:
— HLM (hard label matching) — минимизируем ошибку на настоящих метках задачи.
— SLM (soft label matching) — минимизируем расстояние до предсказаний end-модели, а не до ground truth.
— DM (direct matching) — напрямую минимизируем расстояние между активациями на уровне stitching.
— FuLA (functional latent alignment, Athanasiadis et al., 2026) — stitching layer обучается имитировать не только выход end-модели, но и её внутренние процессы послойно (на пальцах плохо — надо читать).
Метрика успеха — stitching penalty = разница между ошибкой сшитой модели и ошибкой базовой A. Penalty ≈ 0 означает совместимость. Penalty < 0 — сшитая модель стала лучше базовой, то есть мы буквально подсадили ей более сильные нижние слои.
Зачем это нужно:
Смотрим на фиолетовую/рыжую цитату — изначально — метрика сходства. Но потом пошло интереснее. Например, Stitchable Neural Networks (CVPR 2023) можно семейство предобученных моделей разного размера (например, Swin-Ti/S/B), сшить и получить модель, которая во время инференса может динамически переключаться между режимами accuracy/efficiency или T-Stitch: ускорение диффузионных моделей через замену первых шагов денойзинга на более лёгкую сеть и возврат к тяжёлой для финального качества.
Это что, пахнет LoRA?
Эту мысль я обдумывала при знакомстве со stitching. Вдруг она не возникла у вас — я опеределиа.
Да: оба метода замораживают предобученные веса и вставляют тонкий линейный слой.
Но нет: LoRA адаптирует одну модель к новой задаче, stitching измеряет совместимость двух уже обученных сетей на старой задаче.
Финал не придумала, но stiting — одна из штук, висящих у меня на "идеи для рисерча". А ещё — просто вдумайтесь! Этот AI-мир можно сшить!
Хирург, кстати, ничего не спросил, но швы наложил нормально.
Аккуратнее будьте, друзья, и будьте здоровы! 😌
Мне сегодня нужно было сшить кожу на пальце, и в процессе этого перформанса я вспомнила про model stitching. Чтобы скрасить время — врачебное и моё — начала рассказывать зачем это надо. Без понятия, зашло ли хирургу и медсестре, но зато я обнаружила для себя интересный тейк на поделиться с вами = )
Что:
Model stitching как идея появился в 2015 году. Его выдвинули как метод изучения эквивалентности двух сетей, но математическая эквивалентность здесь мимо не проходила — она, более того, не верна — авторы назвали два представления эквивалентными, если существует преобразование между ними, в математике мы требуем аксиом).
Тогда это осталось нишевым инструментом для картинок — юзали AlexNet-ы.
Потом в 2021 NeurIPS идею дооформили, вышли две работы: Similarity and Matching of Neural Network Representations и Revisiting Model Stitching to Compare Neural Representations. Кстати, в первой работе шутили про Франкенштейна (или нет).
Как это стало устроено:
Смотрим на две обученные и замороженные сети A и B. «Сшитая» модель строится так:
• берём нижние слои сети B (front model, представление r = B≤ℓ)
• между ними ставим тонкий обучаемый stitching layer — единственный, кто обучается
• подключаем к верхним слоям сети A (top model, A>ℓ)
То есть делаем бутерброд из белого и темного хлеба, если хотите. А формально ищется простейший слой, задачей вида: L_ℓ(r; A) = inf_{s∈S} L(A>ℓ ∘ s ∘ r)
Где s — stitching layer, A>ℓ — верхние слои A, r — представление из B. s∈S — тут специально, мы ищем слой из класса простых слоев, а инфимум (inf), как математический знак, говорит нам, что stitching layer обязан быть минимальным: для свёрточных сетей — 1×1 conv с BatchNorm, для трансформеров — token-wise linear.
Как именно обучают stitching layer:
— HLM (hard label matching) — минимизируем ошибку на настоящих метках задачи.
— SLM (soft label matching) — минимизируем расстояние до предсказаний end-модели, а не до ground truth.
— DM (direct matching) — напрямую минимизируем расстояние между активациями на уровне stitching.
— FuLA (functional latent alignment, Athanasiadis et al., 2026) — stitching layer обучается имитировать не только выход end-модели, но и её внутренние процессы послойно (на пальцах плохо — надо читать).
Метрика успеха — stitching penalty = разница между ошибкой сшитой модели и ошибкой базовой A. Penalty ≈ 0 означает совместимость. Penalty < 0 — сшитая модель стала лучше базовой, то есть мы буквально подсадили ей более сильные нижние слои.
Зачем это нужно:
Смотрим на фиолетовую/рыжую цитату — изначально — метрика сходства. Но потом пошло интереснее. Например, Stitchable Neural Networks (CVPR 2023) можно семейство предобученных моделей разного размера (например, Swin-Ti/S/B), сшить и получить модель, которая во время инференса может динамически переключаться между режимами accuracy/efficiency или T-Stitch: ускорение диффузионных моделей через замену первых шагов денойзинга на более лёгкую сеть и возврат к тяжёлой для финального качества.
Это что, пахнет LoRA?
Эту мысль я обдумывала при знакомстве со stitching. Вдруг она не возникла у вас — я опеределиа.
Да: оба метода замораживают предобученные веса и вставляют тонкий линейный слой.
Но нет: LoRA адаптирует одну модель к новой задаче, stitching измеряет совместимость двух уже обученных сетей на старой задаче.
Финал не придумала, но stiting — одна из штук, висящих у меня на "идеи для рисерча". А ещё — просто вдумайтесь! Этот AI-мир можно сшить!
Хирург, кстати, ничего не спросил, но швы наложил нормально.
Аккуратнее будьте, друзья, и будьте здоровы! 😌
💊45👍27💩10🔥6❤🔥5🤡5🤗1🤪1