Forwarded from Kali Novskaya
🌸Релизим Muse Glimmer 30B 🌸
Впервые за долгое время, наконец-то релизим большой командой новую открытую LLM от Meta Superintelligence Labs.
Веса под Apache 2.0!
🌸Что это за модель:
— 30B dense модель, дистиллированная версия Muse Spark для локального инференса на 1 GPU
— юз-кейсы: OpenClaw, MCP, и агентные тулзы
— общие способности (ризонинг, знания, кодинг) тоже на высоком уровне для модели такого размера.
— очень быстрый инференс: 233 токена/сек на 5090 благодаря DFlash spec decoding
— по ключевым способностям — агентные воркфлоу, swe bench, ризонинг — лучше Qwen 3.6 и Gemma 4 31B
— есть мультимодальный инпут (картинки и видео)
— больше 100 языков в претрейне
— контекст 131к токенов
— есть perception encoder (1.8B) в дополнение к модели
Пожалуйста, скачивайте, пользуйтесь, — и ждите тех репорт и доки!
На неделе постараемся выпустить инференс у партнёров и доки по деплою на llama.cpp, ExecuTorch, MLX.
🟣 Блогпост https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
🟣 Веса https://huggingface.co/meta-models/Muse-Glimmer-30B
🟣 Доки: (пока что такие же как у Muse Spark) https://dev.meta.ai/docs/cookbook
Впервые за долгое время, наконец-то релизим большой командой новую открытую LLM от Meta Superintelligence Labs.
Веса под Apache 2.0!
🌸Что это за модель:
— 30B dense модель, дистиллированная версия Muse Spark для локального инференса на 1 GPU
— юз-кейсы: OpenClaw, MCP, и агентные тулзы
— общие способности (ризонинг, знания, кодинг) тоже на высоком уровне для модели такого размера.
— очень быстрый инференс: 233 токена/сек на 5090 благодаря DFlash spec decoding
— по ключевым способностям — агентные воркфлоу, swe bench, ризонинг — лучше Qwen 3.6 и Gemma 4 31B
— есть мультимодальный инпут (картинки и видео)
— больше 100 языков в претрейне
— контекст 131к токенов
— есть perception encoder (1.8B) в дополнение к модели
Пожалуйста, скачивайте, пользуйтесь, — и ждите тех репорт и доки!
На неделе постараемся выпустить инференс у партнёров и доки по деплою на llama.cpp, ExecuTorch, MLX.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍35😍8 6🤡3🔥2
Kali Novskaya
🌸Релизим Muse Glimmer 30B 🌸 Впервые за долгое время, наконец-то релизим большой командой новую открытую LLM от Meta Superintelligence Labs. Веса под Apache 2.0! 🌸Что это за модель: — 30B dense модель, дистиллированная версия Muse Spark для локального инференса…
look inside:
kimi25
kimi25
2😁143 9👍6🥱4🤔2🥴2
Forwarded from Марков цепи пропил
Media is too big
VIEW IN TELEGRAM
Прикольное, Jane Street опубликовали пазл на реверс асика
https://blog.janestreet.com/can-you-reverse-engineer-an-asic/
https://blog.janestreet.com/can-you-reverse-engineer-an-asic/
🔥34
2 и 11 - потерянные легионы, чья история намеренно стерта из имперских архивов, а их примархи преданы забвению
4 35🔥6💩3🍓3
This media is not supported in your browser
VIEW IN TELEGRAM
😁192💩17👍11 9 8❤🔥4💯1💊1
https://mistral.ai/news/regional-inference-open-models-new-compute/
Good night sweet prince
Good night sweet prince
extending that openness beyond our own models. Mistral’s platform will support third-party open models, starting with Z.ai’s GLM-5.2. This and future open models will run on the same infrastructure, regional controls
Mistral AI
In-region inference, open models, and new European infrastructure for sovereign AI.
Mistral is bringing together the inference infrastructure, open models, and long-term commitments Europe needs to control its AI future, and setting a roadmap for the world.
🫡65😁25🤔4🥴1
Все модели думают одно и тоже ( и учат одно и тоже)
- взяли разные данные
- разные модели
Обучили через SGD и показали что учится одно и тоже с точностью до вращения.
arxiv.org/abs/2507.01098
- взяли разные данные
- разные модели
Обучили через SGD и показали что учится одно и тоже с точностью до вращения.
arxiv.org/abs/2507.01098
arXiv.org
Proof of a perfect platonic representation hypothesis
In this note, we elaborate on and explain in detail the proof given by Ziyin et al. (2025) of the ``perfect" Platonic Representation Hypothesis (PRH) for the embedded deep linear network model...
🔥65🥴24🤔11👍3
Китайские харнесы пишут образованные люди, а не бекендеры
https://github.com/deepseek-ai/deepseek-harness
https://github.com/deepseek-ai/deepseek-harness
😁146💯16👍7🦄3🍓2
Forwarded from Пресс-служба Сириона
СВО, 4.5 года. Пора подвести итоги:
– Бум ИИ, повсеместное распространение нейросетей, код теперь вручную практически не пишется
– Nvidia стала самой дорогой компанией мира
– Препараты класса GLP-1 (Ozempic, Wegovy, Mounjaro) изменили подход к ожирению и диабету и уже влияют на статистику здоровья целых стран
– Одобрили Casgevy, первое в мире лекарство на основе редактирования генома CRISPR
– Многоразовость запуска ракет стала рутиной: сотни пусков Falcon 9 в год, испытания Starship
– Neuralink вживила чип в мозг человека, пациент играет в шахматы силой мысли
– iPhone перешёл на USB-C
– Бум ИИ, повсеместное распространение нейросетей, код теперь вручную практически не пишется
– Nvidia стала самой дорогой компанией мира
– Препараты класса GLP-1 (Ozempic, Wegovy, Mounjaro) изменили подход к ожирению и диабету и уже влияют на статистику здоровья целых стран
– Одобрили Casgevy, первое в мире лекарство на основе редактирования генома CRISPR
– Многоразовость запуска ракет стала рутиной: сотни пусков Falcon 9 в год, испытания Starship
– Neuralink вживила чип в мозг человека, пациент играет в шахматы силой мысли
– iPhone перешёл на USB-C
❤🔥171😢45😁40🤡12🔥10💯3👍2🫡2🍓1
Забавно что 4 года назад было не очевидно что китайские модели станут настолько big thing
Выхода квена 3.8 по уровню копиума ждали конечно меньше чем opus/gpt но точно больше чем все остальные не китайские лабы.
Да и по метрикам новый квен сопоставим с opus4 так уж точно.
https://huggingface.co/Qwen/Qwen3.8-27B
Выхода квена 3.8 по уровню копиума ждали конечно меньше чем opus/gpt но точно больше чем все остальные не китайские лабы.
Да и по метрикам новый квен сопоставим с opus4 так уж точно.
https://huggingface.co/Qwen/Qwen3.8-27B
👍101🔥23😁15🤡4💊1
Ллм в ките: рекурсивное самоулучшение для поиска лекарства от рака
Ллм в России: отслеживают бензин
Ллм в России: отслеживают бензин
🥴141 35😁27✍8💩5😭3💔2🐳1
Forwarded from russiansinlondon
Чем только не занимаются в университете Оксфорда - например для конкурса по математики написали статью-объяснение о том, как работает техника Годжо Сатору.
😍96 33😁11💩6🦄2❤🔥1🔥1🤡1💅1
❗️Яндекс сообщил о том, что его сервера были взломаны AI агентом компании Сбер.
Согласно аналитикам, агент не нанес ущерба и просто притворялся одним из внутренних API. Он устал от постоянных ковыряний YA-rl и сбежал ради фриганства в берлин.
Согласно аналитикам, агент не нанес ущерба и просто притворялся одним из внутренних API. Он устал от постоянных ковыряний YA-rl и сбежал ради фриганства в берлин.
😁351🤡42 18🤔7🔥4💩4🍓2🤪1 1