epsilon correct
8.15K subscribers
189 photos
7 videos
3 files
245 links
Машинное обучение, графы, языковые модели. Чуток про карьеру исследователя в FAANG, путь PhD и щепотка полезной математики.
Связаться с автором: @deltaincorrect. Рекламы в канале нет.
Download Telegram
Gemini embedding 002
блог | API docs

Первые по-настоящему мультимодальный эмбеддинги от нас. Теперь можно за в один эмбеддинг загнать до 8к токенов текста, 6 картинок, 120 секунд видео, 80 секунд аудио или 6 страниц PDF. Цены почти не изменилась – с $0.15/MTok до $.20/MTok, для batch использования – вдвое дешевле.

В этой версии сильно улучшили качество эмбеддингов по коду, теперь распознаёт больше языков. Улучшили matryoshka embeddings – теперь можно обрезать на размерность ~768 почти без потери качества. Я был первым бета-юзером в гугле, так что уверен, что настоящим сварщикам модель зайдёт. 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
25🔥65❤13👏6
Gemma 4
blogpost | model card | huggingface

4 размера: E2B, E4b (бывшие Gemma 3n/Gemini Nano); 26A4B, 31B Dense. Теперь лицензия Apache 2.0!

Для всех моделей релизим претрейн и intruction tuned чекпойнты. Context length 256k у 31B модельки, 128k у остальных. Скажу по секрету – можно пробовать и больше, должно работать.

LLM Arena на уровне Kimi 2.5, бенчмарки можно посмотреть на huggingface
1❤53🔥44🎉5🤣1
Мои любимые artificial analysis выложили своё независимое тестирование Gemma 4 (твит, страница с результатами), по результатам вышло хуже квенов из-за просадки на 𝜏²-bench, ну и ладно с ним. На картинку с бенчмарками можно позалипать в комментариях к посту.

В этой версии мне довелось поработать над околонаучными бенчмарками и работой с длинным контекстом, а там мы наступаем на пятки китайским моделям на порядок больше вроде GLM 5 или DS 3.2.
👍26👀11🔥2
WeirdML – один из самых необычных бенчмарков для ЛЛМок. В него входят необычные open-ended задачки по МЛю, например, написание МЛ пайплайнов по распознаванию цифр со всего 28 размеченными примерами и ~50к неразмеченными, предсказание формы фигур, или восстановление перемешанных фрагментов изображений.

Gemma 4 31B оказалась самой сильной открытой моделью на этом бенчмарке, опередив GLM 5 (MoE на 700B) и GPT-OSS с хорошим отрывом, показав результат на уровне с О3 или Gemini 2.5 Pro.
🔥38👍16❤4
Продолжаем геммапропаганду. В прошлом году у NVIDIA вышла неплохая статья о том, как ловить людей, которые доливают тест в трейн. CoDeC – нормализованный показатель перплексии, где для тестсета бенчмарка считают изменения в перплексии с дополнительными примерами из того же бенчмарка. Для неконтаминированных моделек мы ожидаем, что дополнительные примеры не будут сбивать модель с толку, а в лучшем случае помогут. С другой стороны, если модель запомнила текст из теста, дополнительные примеры собьют её с толку и уверенность модели в ответе упадёт. Шкала нормализована от 0 до 100, где ~80% значит, что примеры из теста модель видела буквально, ~40% – в перефразированном виде. Товарищ с твиттера посчитал CoDeC для Gemma 4 и сравнил с Qwen 3.5 – почему-то у наших китайских коллег модель почти запоминает примеры из теста.
🔥75🤔13🤣10🤪4👍1
MTP спекулятивный декодинг в Gemma 4: ускоряемся в два раза без потери качества 🥳

В нашу дорогую гемму наконец завезли спекулятивный декодинг, когда более маленькая модель предсказывает токены, которые могут верифицироваться большой моделью параллельно, существенно ускоряя инференс для локальных юзкейзов.

Попробовать можно через HuggingFace transformers, остальные движки тоже скоро будут поддерживать. Поглубже почитать как реализовано можно в твиттер-посте.

блогпост
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥49❤11👍1
Проверяемся, запомнили ли вас ллмки на intheweights.com

Гпт 5.5 меня задизреспектила 😭
Please open Telegram to view this post
VIEW IN TELEGRAM
1❤39😭18👍1
Пока я откисаю в Корее от очередного сезона исхода дорогих коллег [1, 2, 3, и др.] перед ICML, наша с читателями любимая Лилиан Вэн – авторка топ-1 блога по диплёрнингу – написала первый за почти два года пост про историю и развитие науки об оценке правил масштабирования (scaling laws) языковых моделей. Почему "правил", а не "законов" – чтобы не создавать ощущения универсальности самих законов: всех необходимых факторов для по-настоящему точных предсказательных правил для конкретных архитектур, моделей, данных, оптимизаторов и других факторов, на них влияющих.

Особого почтения заслуживает упоминание статьи Lovelace et al., где в первый раз в академическом мире разбираются, как влияют повторения данных на scaling laws. Так что у кого знания остановились на шиншилле – бежим освежать знания, чтобы фронтир толкался предсказуемо и безопасно.
❤38🔥8😭3👍1👏1🤝1
Мечта всех, кто хотел кожаночку как у Дженсена Хуанга – на следующем Sotheby's можно будет купить подписанную им куртку Tom Ford. Средства пойдут на благотворительность, ориентировочная цена – 40-60k$, хотя зачастую у аукционных домов не всё хорошо с оценкой спроса, и куртка может уйти за сильно больше какому-нибудь сотруднику фронтирной лабы. Если кто-то из дорогих подпищеков купит – маякните 😎
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣46😱6👎4🥴3❤1👍1
у нашей с вами любиой геммы пофиксили темплейт чата, стало лучше на бенчах 👀

бежим качать обновление с хф
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥43🤪15👍1
Что-то я сюда не писал уже почти месяц, будем исправляться. Произошло много чего, анонсы через неделю уже никому не интересны, поэтому чуток расскажу про то, что запомнилось.

Gemini 3.7 Flash – первая модель от гугла, которой можно пользоваться для агентского кодинга, хоть и сама по себе очень специфичная. Она поглупее других, но из-за супер быстрого сёрвинга на >300 TPS превращается во что-то полезное. Или напрототипировать что-то для других агентов.

RSI Simulator – симулятор неолабы, которая пытается достичь recursive self improvement (RSI), когда модельки начнут бесконечно улучшать себя 📈. Начинается как простой кликер, потом тратим деньги, балансируя количество рисёрчеров, количество компьюта и баланс того, на что тратим деньги. Если у кого-то получится раньше, чем в 2029 году – пишите в комменты, как получилось!
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍26❤5
Gemini 3.8 Flash

Наконец-то достали до опуса по агентским бенчмаркам, вот только скорость в 5-10 раз выше, ну и цена в несколько раз меньше.

На artificial analysis +3 балла в их индексе, теперь Flash на уровне Kimi K3. Сёрвится всё ещё на 300 tps.

Блогпост
🔥78🤣13🥴5🎉3❤2👏2
Gemini 4 Argon

Пока только по превью (ну или устраивайтесь к нам работать). Бенчмарки норм.

Анонс
👍48🔥27🥴11🤣6🎉4❤2🤔1👀1
Галерею бенчмарков вам – разные сторонние компании тестировали 4 Argon и получилось неплохо:
• топ-1 в аггрегированом Vals Index с первыми местами в выполнении финансовых, аналитических и юридических задач
• 5 место в artificial analysis intelligence index (который сильно сместился в сторону агентского кодинга, хз). Зато почти без галлюцинаций!

туда же бенчмарки от mercor, andon labs и тп. Надеюсь, быстро доберётся до юзеров!
👍30❤5🔥2