Градиент обреченный
8.71K subscribers
967 photos
24 videos
10 files
523 links
Download Telegram
Forwarded from Kali Novskaya
🌸Релизим Muse Glimmer 30B 🌸

Впервые за долгое время, наконец-то релизим большой командой новую открытую LLM от Meta Superintelligence Labs.
Веса под Apache 2.0!

🌸Что это за модель:
— 30B dense модель, дистиллированная версия Muse Spark для локального инференса на 1 GPU
— юз-кейсы: OpenClaw, MCP, и агентные тулзы
— общие способности (ризонинг, знания, кодинг) тоже на высоком уровне для модели такого размера.
— очень быстрый инференс: 233 токена/сек на 5090 благодаря DFlash spec decoding
— по ключевым способностям — агентные воркфлоу, swe bench, ризонинг — лучше Qwen 3.6 и Gemma 4 31B
— есть мультимодальный инпут (картинки и видео)
— больше 100 языков в претрейне
— контекст 131к токенов
— есть perception encoder (1.8B) в дополнение к модели

Пожалуйста, скачивайте, пользуйтесь, — и ждите тех репорт и доки!
На неделе постараемся выпустить инференс у партнёров и доки по деплою на llama.cpp, ExecuTorch, MLX.

🟣Блогпост https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
🟣 Веса https://huggingface.co/meta-models/Muse-Glimmer-30B
🟣Доки: (пока что такие же как у Muse Spark) https://dev.meta.ai/docs/cookbook
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥167👍5👀2💅1
This media is not supported in your browser
VIEW IN TELEGRAM
Меня часто спрашивают, как я всё успеваю
😁62119💯4
🔺 SuperMinor

Сделал ещё один небольшой SFT датасет-заготовку для малоресурсных языков России.

Пару лет назад делал портал для разметки, на котором были пользовательские промпты для чат-моделей типа "Когда родился XXX?" (есть много таких шаблонных промптов), "Выпиши пять основных пунктов, о которых идет речь в тексте:", "Переработай данный текст в креативный маркетинговый материал из 5-6 предложений" и т.д.

Специально делал много синонимичных промптов в разных стилях для их разнообразия. Многое тогда перевели носители, часть оставалась.

Делалось это всё для генерации синтетических SFT инструкций, например, берёте заготовку типа "«XXX» рус телендә нисек әйтергә?", подставляете слово на башкирском и ответ на русском. Делаете так N инструкций, кидаете в обучение.

Таких промптов-заготовок в датасете 124 штуки.

Сейчас провалидировал и доперевел остатки Fable'ом. Пометки про перевод есть в отдельных колонках.

Всего 16 языков: русский, аварский, алтайский, башкирский, белорусский, даргинский, казахский, коми, марийский (луговой), осетинский (дигорский), осетинский (иронский), татарский, удмуртский, хакасский, чувашский, якутский.

👉 https://huggingface.co/datasets/averoo/sumi

//всем, кто в свое время помогал переводить, спасибо!
27🔥13👍72
Заглянул на ML Recap от Яндекса, старый добрый митап, много приятных лиц, клевые доклады.

Великолепный доклад был про табличный ML, узнали про него даже слишком много.

Крутой доклад про инференс, спикер был хорош. Будет время, посмотрите, как выложат.

👉 Upd. https://runtime.strm.yandex.ru/player/episode/vple3pp35tg4cd7nefds
19🔥11👍7👀3😁1
Знаю, что открытые модели сейчас пытаются разворачивать локально в некоторых больших компаниях и что в основном это проходит не очень успешно. Как я понимаю, ML-спецы на местах ставят небольшие модели и дают разработчикам, не объясняя толком что это, чтобы те разуверились в этом подходе и продолжали писать код руками.

Друзья, не надо так, помогите коллегам, разверните что-то на 2T+ параметров, если есть возможность, настройте, проверьте и объясните как пользоваться. А то среди знакомых довольно много программистов, в том числе получше меня, которые всё ещё не в теме, а на работе им дают что-то странное.

//писал пост про новый дипсик и отвлёкся
👍20😁8👀83💯22👾1
GLM 5.3

Zhipu вчера выпустили новую модель. Что интересно, после всех предыдущих инцидентов сделали упор на кибербезе:

GLM-5.3 did not simply become better at identifying isolated flaws: it began to reason across multiple stages of exploitation, forming coherent plans for complete exploitation chains.


Пишут, что на внутренних бенчах она на 50% процентов лучше GLM 5.2, с точки зрения команды, которая модель обучала, это прям очень круто. Само собой, она послабее Fable и Sol, но safety фильтров в ней должно быть меньше, к тому же веса скоро выложат в открытый доступ.

В OpenRouter пока нет, есть в официальном Code Plan, так что качаем родной харнесс, пробуем.
🔥24👍431
Тыкаю GLM. От поиска уязвимостей, по крайней мере, не отказывается.
🔥278😁6👍3👾2🤔1
Рассылка от LinkedIn выглядит так, как будто тебя просматривают обнаженные люди. Чего они хотят? Что чувствуют в момент просмотра?
😁67🍓14🌚4👍2
Лаида, не грусти!
12👍2
Часто грущу от того, что нашей с коллегами последней статьей Unveiling Intrinsic Dimension of Texts: from Academic Abstract to Creative Story никто не интересуется и не цитирует... 💢

Напомню, что статья посвящена анализу внутренней размерности активаций LLM и её связи с различными свойствами текста, который подали на вход модели. Более подробное разъяснение статьи можно найти здесь, посмотреть видос про то, что такое в принципе внутренняя размерность (от 3blue1brown) - тут; ещё более подробное разъяснение популярных способов оценить внутреннюю размерность облака точек можно прочитать здесь.

Так вот, вместо этой новой статьи, которая связывает внутреннюю размерность активаций на тестах с лексическим разнообразием и сжимаемостью этих текстов алгоритмом gzip и энтропией (что, на мой взгляд, очень интересно, так как связывает внутреннюю размерность со сжатием представлений в LLM, а, как говорит 3blue1brown, compression is intelligence), челики почему-то цитируют нашу старую статью про детекцию сгенерированных текстов с помощью внутренней размерности, хотя мы же и показали в более поздней статье, что для новых моделей GPT этот метод уже не работает.

Скорее всего, это происходит от того, что старая статья была опубликована на NeurIPS, а новая, на мой взгляд, более актуальная, интересная и вносящая больший вклад в область interpretability of LLM - на EACL - то есть, на конференции поменбше и статусом пониже, где эта область вообще почти не представлена, так что мало кто будет ожидать найти в материалах конференции такие работы...

Я писала про эту работу в дискорде Neel Nanda, но там никто ею не заинтересовался, так как все только рекламируют свои работы, но не читают чужие... В общем, уже и не знаю, что сделать, чтобы на данную работу обратили внимание 🤔🤔🤔

Помогите советом кто сможет 🥺
Please open Telegram to view this post
VIEW IN TELEGRAM
👍15💅6🔥533
😁567💔3💅3💯2
Ух, сделал в нашей читалке режим мультиязычного чтения. Много классиков типа Гоголя, Чехова, Куприна, Тургенева и других было переведено на разные языки, всё такое стараюсь собрать и делаю из этого параллельные книжки. Иностранных классиков тоже не забываю, так что библиотека потихоньку растёт, около 600 книг уже есть. Можно будет выбрать до 4 языков (если столько редакций присутствует в книжке).

Но это всё для патологических читателей (мои любимые ❤️). Для более широкой аудитории делаю режим объяснялки, когда можно выбрать любой фрагмент книги и задать по нему вопрос.

Ну и сошлись с господами тестировщиками во мнении, что очень нужен тур по интерфейсу с подсказками, какая кнопка на экране чтения для чего нужна. Все выходные провозился и несколько раз переделывал, но вроде бы получилось неплохо.

По опыту работы с моделями (чем бы ни пользовался; и клодом, и кодексом, и китайскими) — под андроид обычно остается больше остаточных артефактов чем под ios (какие-то рамочки, недорисовки, тени, доп. расстояния). Видимо, разработка под ios более фиксированная, реже меняется или это из-за меньшего разнообразия девайсов, как-то так.

Идей, что ещё добавить, примерно до фига, но пока всё зафиксировал. Отправляю релиз на проверки в сторы.
1🔥3512👍72😭1