Борис опять
16.8K subscribers
1.58K photos
82 videos
35 files
1.63K links
life = curiosity + irreducible noise

Whois: https://t.iss.one/boris_again/3400

Лс: @btseytlin
Download Telegram
Ухаживания
Раньше: оплатил девушке маникюр
Сейчас: оплатил девушке Codex Pro
😢545038👍11🔥6👎5🤬1
💵 GigaChat 3.5 Ultra: меньше, быстрее, сильнее

Сегодня мы выкладываем в open source GigaChat 3.5 Ultra — новую 432B-модель под MIT-лицензией. Это первый в open source гибрид GatedDeltaNet и MLA, доведённый до сотен миллиардов параметров, — с собственным рецептом обучения, который мы собирали больше чем в 1500 экспериментах. Модель выросла в коде, математике, агентных сценариях и на аренах — и при этом стала на 40% меньше, чем GigaChat 3.1 Ultra.


Что внутри:

🔘Собственная гибридная архитектура MLA + GatedDeltaNet с придуманной нами уникальной стабилизирующей обвязкой, без которой такой гибрид на этом масштабе просто не обучается;
🔘Gated Attention — модель может локально приглушать слишком сильный сигнал из attention-слоя;
🔘GatedNorm — нормализация с явным гейтом для управления масштабом сигнала между признаками. Модернизация этого слоя позволила нам стабильно обучать модели с большим количеством параметров.
🔘Линейный слой требует в 4 раза меньше KV-кеша на токен, в ту же память позволяет поместить в 2,14 раза больше контекста, throughput под нагрузкой растет на +20%;
🔘Две MTP-головы и ускорение генерации до 2,2 раза;
🔘FP8 на всех этапах обучения без потери качества относительно bf16 — свои Triton- и CUDA-ядра;
🔘Новый этап online RL после SFT и DPO.

Результаты:

🔘GigaChat-3.5-Ultra-Base обходит DeepSeek V3.2 Exp Base и DeepSeek V4 Flash Base в среднем по нашему набору general-, math- и code-бенчмарков (полные таблицы — в статье);
🔘GigaChat-3.5-Ultra-Instant сравним с DeepSeek V3.2 по среднему скору, будучи в полтора раза меньше;
🔘По LLM-судье MiniMax-M2.7 средний win-rate против GigaChat 3.1 Ultra — 75,9%, а против GPT-5 — 68.7%.

Весь стек — данные (своя LLM-фильтрация Common Crawl, 600+ языков программирования в коде), архитектура, рецепт обучения, инфраструктура — сделан нами end-to-end.


🤖 Подробности, включая детали реализации гейтов и рецепт стабилизации, — в статье на Habr.

➡️HuggingFace | GitVerse
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
7859👍8🤔6🔥4🤬3
Я на RAISE summit, ищу инвесторов, клиентов и партнеров.

И это буквально мем про лопаты. Каждый второй стенд это провайдер компьюта. Компьют компьют компьют дата-центры гпухи

Не пузырь, четко и ясно
52👍267🔥5🤔1
80👍153🔥2🤔1
TIL теперь существует профессия брокера компьюта. Человек, который ходит по клаудам и подбирает за тебя кластеры

Риелторы для гпу!
🔥40392👍1
Как вам место для размещения приглашения на invite only executive dinner for founders and VCs?

Я зарегался
4728🔥3👍2
На конференции по AI вырубило свет

Upd: в туалете нельзя помыть руки потому что диспенсеры воды и мыла электрические
223🔥156👍2👎1
Forwarded from КПД
7x size reduction for Gemma4 Edge models

📝 Блогпост

Команда из Stage.AI выпустила занятный блогпост про сжатие Gemma-4 в 6,4 раза с умеренной просадкой качества.

Работа примечательна тем, что комбинирует многие классические и свежие практики, чтобы выдать наилучший trade-off между размером модели и качеством.
👍1595🔥4
Forwarded from ChillHouse (Alexey Moiseenkov)
Ну что ж, вот и наш первый релиз на архив.

we achieve a 4.37-fold speedup over autoregressive decoding, and outperform a highly optimized DFlash baseline by 24.7%


Это спекулятивный декодинг. SOTA(ну на qwen3.6 точно). Бьем все, что есть известного в паблике (ну dflash). Супер важная тема для быстрого инференса на устройстве, особенно когда понимаешь задачу.

GitHub
HF
Поддержка в нашем инференс движке скоро доедет
🔥22👍531
Мое тело это машина которая перерабатывает кофе в показы демо и "прикольно, а что помешает Антропику это сделать?"
🔥67519👍3🤔3😢2
18316🔥6👍1🤔1
This is the world we live in now
7311🤔8😢6🔥3👍1
43🔥3👍21
​​banned by AI, convicted by AI, defended by AI, and pardoned by AI in about 10 minutes

https://x.com/endpointarena/status/2075245286339846145
896🔥5😢3👍2🤔1
«Хочешь узнать, кто тобой управляет — посмотри, кто создал тикет.» — Тацит ☝️
9415👍7🔥4
Forwarded from Econet
11942🔥8🤔3👍1
Я очень много пишу код с помощью Claude Code. Точнее сказать, что иначе я уже не пишу код вообще. При этом это произошло как-то само собой и я не уверен, что это хорошо.

С одной стороны проект растет непомерными темпами. С другой стороны у меня постоянно ощущение, что я одной клод сессией правлю баги созданные другой клод сессией. Часто это такие баги, которые я бы сам никогда (по моему мнению) не допустил.

Я запустил клод проанализировать историю переписок и классифицировать все сессии по категориям.

Похоже, что я правда 80%+ времени правлю баги или ищу их.

При этом может быть два объяснения:
1. Клод пишет плохой код и эти баги — дополнительный эффект вайбкода.
2. Написание любого кода создает баги, код теперь пишется гораздо быстрее, поэтому я встречаю больше багов в единицу времени. Если бы писал этот код сам, то видел бы примерно столько же багов, но не в такой концентрации.

В любом случае можно сделать вывод, что вайбкодинг это скам: каждый сожженый на создание чего-то токен ведет к сжиганию ещё двух-трех, чтобы это нормально работало.
8978👍12🔥5🤔4
Т-Технологии выложили в открытый доступ ИИ-модель T-Search — первую русскоязычную модель для Agentic RAG. Это когда ИИ-агент самостоятельно выполняет многошаговый поиск с помощью доступных инструментов.

Модель опубликована на Huggingface вместе с кодом и собственный харнессом. Основой послужил Qwen3.6-35B-A3B. Так же выложили два датасета для эвала: https://huggingface.co/datasets/t-tech/SynthComp и https://huggingface.co/datasets/t-tech/TRuST.

По оценке разработчиков, использование T-Search в агентских ИИ-системах позволяет сократить затраты на инференс — то есть выполнение запросов языковыми моделями — на 20–50% в зависимости от сценария. Кроме того, T-Search можно запускать на собственной инфраструктуре компании. Это помогает снизить стоимость обработки запросов и справляться с пиковыми нагрузками без расширения GPU-кластера. При этом решение помогает соблюдать требования по защите персональных и других чувствительных данных, поскольку информация не передается во внешние облачные сервисы


Для запуска модели достаточно одной H100 GPU. В целом модель имеет всего 3B активных параметров, так что стоимость инференса гораздо ниже, чем если использовать апи провайдеров или стандартный поисковый мудуль в классическом RAG
🔥6524👍2321👎2🤔2
577🔥4👍3🤔1