Саша нас очень поддерживает в прикладе на реальный кейс MCP от ВкусВилл, и снова раздал базы. Все-таки, он профи в SEO, а мы наблюдаем переход от SEO к GEO. 🍿
ЗЫ. пользуйтесь функцией тлдр в тг если много читать.
👇 👇 👇 👇
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2
Forwarded from Поляков считает: AI, код и кейсы
Три протокола агентной коммерции: кто кого контролирует
За полгода появились три протокола, позволяющие ИИ покупать товары от имени человека: ACP от OpenAI и Stripe (сентябрь 2025), UCP от Google и Shopify (январь 2026), и вчера — YCP от Яндекса. Плюс десятки MCP-серверов для отдельных магазинов (вроде ВкусВилл).
Когда я вижу новый протокол, я не читаю пресс-релиз. Я смотрю на роли: кто покупатель, кто продавец, а главное — кто между ними и сколько власти у каждого.
🎭 Роли в агентной коммерции
В обычном e-commerce всё просто: покупатель и продавец (иногда мёрчант и платежная система). В агентном — между ними появляются посредники:
🔸 AI-провайдер — чей ИИ общается с покупателем (ChatGPT, Gemini, Алиса)
🔸 Платёжный провайдер — кто проводит деньги (Stripe, Yandex Pay, Visa)
🔸 Платформа — где живёт магазин (Shopify, KIT, 1С-Битрикс)
🔸 Владелец протокола — кто написал правила игры
🔸 Разработчик агента — кто-то кто создал своего агента поверх протокола
И вот тут начинается самое интересное.
🔍 Кто совмещает роли
В ACP роли формально разнесены: OpenAI делает ИИ, Stripe — платежи, Shopify — платформу. Спека открыта (Apache 2.0). Но нюанс: Instant Checkout в ChatGPT — только для одобренных партнёров, платёжный токен пока только через Stripe, а механизма discovery для внешних агентов ещё не существует. Спека открытая, канал — «по приглашениям».
В UCP Google разделил роли сильнее: 4 транспорта (REST, MCP, A2A, крипто-мандаты), 20+ партнёров включая Visa и Mastercard. Мерчант публикует манифест на /.well-known/ucp — это как robots.txt, только для ИИ-покупателей (пример https://store.moma.org/.well-known/ucp). Архитектурно — самый открытый. Но в продакшне пока тоже только Google AI Mode.
В YCP Яндекс — одновременно AI-провайдер (Алиса), платёжка (Yandex Pay), платформа (KIT) И владелец протокола. Четыре роли в одном. Спека закрыта, MCP не поддерживается, внешних агентов нет даже в теории.
⚡ Три вопроса, которые всё решают
1️⃣ Могу ли я подключить своего бота?
ACP — спека открыта, но в продакшне работает только ChatGPT, и мерчанты сертифицированы под него. UCP — архитектурно да (четыре транспорта, Agent-to-Agent), но в дикой природе тоже пока один канал. YCP — нет, только Алиса. По факту ни один протокол сегодня не даёт тебе взять спеку и запустить своего shopping-агента «из коробки».
2️⃣ Могу ли я влиять на то, как ИИ выбирает мой товар?
ACP вообще не покрывает discovery — только чекаут. UCP даёт мерчанту манифест возможностей. А в YCP Алиса сама решает: у неё агент «Найти дешевле», индикаторы цен и персональные скидки. Продавец не контролирует ранжирование.
3️⃣ А если я — не продавец, а покупатель-гик?
Допустим, я хочу агента для себя. Который покупает продукты по моим правилам, а не по правилам рекомендательной системы.
ACP и UCP теоретически это позволяют — спеки открыты, бери и пиши. На практике — discovery нет, оплата только через определенную платежную систему, работающих примеров ноль. YCP — даже теоретически не подключить.
А ведь еще предстоит решить вопрос возврата заказов (доступен только в UCP), работы с отзывами, ограничением возможностей скрапинга контента.
А вы ждёте агентную коммерцию? И что важнее — чтобы подключение было гарантированно простым, или чтобы можно было гибко настроить под себя?
----
Поляков считает — AI, код и кейсы
За полгода появились три протокола, позволяющие ИИ покупать товары от имени человека: ACP от OpenAI и Stripe (сентябрь 2025), UCP от Google и Shopify (январь 2026), и вчера — YCP от Яндекса. Плюс десятки MCP-серверов для отдельных магазинов (вроде ВкусВилл).
Когда я вижу новый протокол, я не читаю пресс-релиз. Я смотрю на роли: кто покупатель, кто продавец, а главное — кто между ними и сколько власти у каждого.
🎭 Роли в агентной коммерции
В обычном e-commerce всё просто: покупатель и продавец (иногда мёрчант и платежная система). В агентном — между ними появляются посредники:
🔸 AI-провайдер — чей ИИ общается с покупателем (ChatGPT, Gemini, Алиса)
🔸 Платёжный провайдер — кто проводит деньги (Stripe, Yandex Pay, Visa)
🔸 Платформа — где живёт магазин (Shopify, KIT, 1С-Битрикс)
🔸 Владелец протокола — кто написал правила игры
🔸 Разработчик агента — кто-то кто создал своего агента поверх протокола
И вот тут начинается самое интересное.
🔍 Кто совмещает роли
В ACP роли формально разнесены: OpenAI делает ИИ, Stripe — платежи, Shopify — платформу. Спека открыта (Apache 2.0). Но нюанс: Instant Checkout в ChatGPT — только для одобренных партнёров, платёжный токен пока только через Stripe, а механизма discovery для внешних агентов ещё не существует. Спека открытая, канал — «по приглашениям».
В UCP Google разделил роли сильнее: 4 транспорта (REST, MCP, A2A, крипто-мандаты), 20+ партнёров включая Visa и Mastercard. Мерчант публикует манифест на /.well-known/ucp — это как robots.txt, только для ИИ-покупателей (пример https://store.moma.org/.well-known/ucp). Архитектурно — самый открытый. Но в продакшне пока тоже только Google AI Mode.
В YCP Яндекс — одновременно AI-провайдер (Алиса), платёжка (Yandex Pay), платформа (KIT) И владелец протокола. Четыре роли в одном. Спека закрыта, MCP не поддерживается, внешних агентов нет даже в теории.
💡 Все три протокола — lock-in, вопрос лишь в жёсткости замка. YCP — железный засов (только Алиса). ACP — дверь открыта, но на защелке. UCP — ближе всех к реальной открытости, но пока тоже один работающий канал.
⚡ Три вопроса, которые всё решают
1️⃣ Могу ли я подключить своего бота?
ACP — спека открыта, но в продакшне работает только ChatGPT, и мерчанты сертифицированы под него. UCP — архитектурно да (четыре транспорта, Agent-to-Agent), но в дикой природе тоже пока один канал. YCP — нет, только Алиса. По факту ни один протокол сегодня не даёт тебе взять спеку и запустить своего shopping-агента «из коробки».
2️⃣ Могу ли я влиять на то, как ИИ выбирает мой товар?
ACP вообще не покрывает discovery — только чекаут. UCP даёт мерчанту манифест возможностей. А в YCP Алиса сама решает: у неё агент «Найти дешевле», индикаторы цен и персональные скидки. Продавец не контролирует ранжирование.
3️⃣ А если я — не продавец, а покупатель-гик?
Допустим, я хочу агента для себя. Который покупает продукты по моим правилам, а не по правилам рекомендательной системы.
ACP и UCP теоретически это позволяют — спеки открыты, бери и пиши. На практике — discovery нет, оплата только через определенную платежную систему, работающих примеров ноль. YCP — даже теоретически не подключить.
А ведь еще предстоит решить вопрос возврата заказов (доступен только в UCP), работы с отзывами, ограничением возможностей скрапинга контента.
🎯 Вот главный гэп: все три протокола заточены под связку «продавец → ИИ → покупатель». Но никто не строит протокол от лица покупателя — чтобы мой агент ходил по магазинам с моими требованиями и договаривался на моих условиях. Пока ближе всех к этому UCP с его Agent-to-Agent транспортом, но реализаций я пока не видел.
А вы ждёте агентную коммерцию? И что важнее — чтобы подключение было гарантированно простым, или чтобы можно было гибко настроить под себя?
----
Поляков считает — AI, код и кейсы
👍15❤7🔥7💅4
Первый пост из рубрики #ИИзнанка будет в виде старого курьёзного случая. Он также будет #безкомментариев.
История:
На производстве в рамках конвейрной сборки, обычно, все под счёт и деталей должно хватить ровно на изготовление изделия.
Некоторое производство холодильников. У конвейра стоит Петрович и собирает очередную партию. Собирает холодильник, а осталась одна деталь. Петрович, понимая, что-то не так, разбирает изделие и снова собирает. Остаётся две детали и целый холодильник, полностью рабочий. Так он делал до тех пор, пока не собрал два холодильника.😱
Оказалось, что коллеги заводчане решили его так подколоть, подкладывая в цех по одной детали на круг.😌
Мораль сей истории в рамках AI сегодня такова:
Как бы ты не разбирал open-source код решений из модных открытых архитектур LLM, взять и собрать из этого на своих данных, даже с достаточным числом gpu, то же самое просто так – не получится. Да оно работает, вполне исправно, но качество...
Всегда остаётся какая-то деталь или детали, отделяющие тебя от оригинала. И порой не в лучшую сторону. Особенно, когда рядом кто-то мешает...
P.S. Все совпадения случайны .
История:
На производстве в рамках конвейрной сборки, обычно, все под счёт и деталей должно хватить ровно на изготовление изделия.
Некоторое производство холодильников. У конвейра стоит Петрович и собирает очередную партию. Собирает холодильник, а осталась одна деталь. Петрович, понимая, что-то не так, разбирает изделие и снова собирает. Остаётся две детали и целый холодильник, полностью рабочий. Так он делал до тех пор, пока не собрал два холодильника.
Оказалось, что коллеги заводчане решили его так подколоть, подкладывая в цех по одной детали на круг.
Мораль сей истории в рамках AI сегодня такова:
Как бы ты не разбирал open-source код решений из модных открытых архитектур LLM, взять и собрать из этого на своих данных, даже с достаточным числом gpu, то же самое просто так – не получится. Да оно работает, вполне исправно, но качество...
Всегда остаётся какая-то деталь или детали, отделяющие тебя от оригинала. И порой не в лучшую сторону. Особенно, когда рядом кто-то мешает...
Please open Telegram to view this post
VIEW IN TELEGRAM
🤓10❤5💯5🆒2👏1🦄1
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥40❤5🦄5👍2
Dealer.AI
Coming soon😜 Upd. 2-4b на агентов и тулколл с MemAgent, 0.8b-4b на эмбы 💪
Тут кстати выдался скорый повод для рубрики #ИИзнанка про метрики LLM на примере легких моделей Qwen 3.5. Модели, кстати, таки вышли в открытый доступ и можно найти их в HF.
Ребята в соседних чатах интересуются, как так 9b лучше по тестам 80B из семейства Qwen3? Для ответа на этот вопрос, я бы дождался техрепорта, которого в репо ещё нет – там, пока, paper не залинкован. Может, дело в развитии их гибридного внимания о котором я писал тут? Или же нативная мультимодальность – нет больше отдельных VL версий? А ещё, может, виновато расширение языковых возможностей до 201 языка? Посмотрим. 🤷♂
Но как обычно работают с метриками всякие злодеи - кратенько расскажу. Тут вариантов не так уж и много.
Самый наглый способ дотянуться до открытых тестовых сетов бенчей. Просто тупо их скачав в свой претрен или тюн.😐 Далее, кто похитрее, аугментирует доступные публичные тестовые примеры 🧠 и уже аугментации кладёт в обучение. Можно конечно и с дистилляцией извращаться, пылесося знания сильных моделей, которые тоже, как бэ, могли вобрать в себя публичные бенчи.
Ну и конечно путь сильных, действительно сделать что-то интересное с тюном честно, поэтому ждём репорт. А там посмотрим.🆒
Ребята в соседних чатах интересуются, как так 9b лучше по тестам 80B из семейства Qwen3? Для ответа на этот вопрос, я бы дождался техрепорта, которого в репо ещё нет – там, пока, paper не залинкован. Может, дело в развитии их гибридного внимания о котором я писал тут? Или же нативная мультимодальность – нет больше отдельных VL версий? А ещё, может, виновато расширение языковых возможностей до 201 языка? Посмотрим. 🤷♂
Но как обычно работают с метриками всякие злодеи - кратенько расскажу. Тут вариантов не так уж и много.
Самый наглый способ дотянуться до открытых тестовых сетов бенчей. Просто тупо их скачав в свой претрен или тюн.
Ну и конечно путь сильных, действительно сделать что-то интересное с тюном честно, поэтому ждём репорт. А там посмотрим.
Please open Telegram to view this post
VIEW IN TELEGRAM
2❤14🔥8
Forwarded from commit history
Последние пару месяцев я плотно работал над этим релизом, и наконец-то мы выкатываем его в опенсорс!
📟 Встречайте SWE-rebench-V2: самый большой открытый, мультиязычный датасет для обучения кодовых агентов!
Вместе с командой Nebius AI R&D мы построили пайплайн для масштабного сбора задач из реальных GitHub репозиториев и теперь делимся всем с комьюнити. На текущий момент это самый большой и разнообразный открытый датасет подобных задач в мире.
Что внутри:
> 32 000+ задач — на базе реальных issue + готовый Docker-образ.
> 20 языков программирования. Некоторые языки (например, Lua или Clojure) вообще никогда раньше не были покрыты!
> 120 000+ дополнительных задач, собранных на базе реальных PR.
> Качество — задачи отфильтрованы и размечены с помощью ансамбля LLM. Также мы обогатили их метаданными и добавили интерфейсы, которые проверяются в тестах.
Вместе с датасетом мы дропаем техрепорт со всеми деталями нашего пайплайна и прогонами моделей.
📄 Статья и датасет
👾 Наш Discord (мы там онлайн, залетайте с фидбеком и вопросами).
✉️ Пост в X
Если есть любые мысли, идеи, предложения - приходите!
🔁 Буду благодарен за репост и пересылку!
📟 Встречайте SWE-rebench-V2: самый большой открытый, мультиязычный датасет для обучения кодовых агентов!
Вместе с командой Nebius AI R&D мы построили пайплайн для масштабного сбора задач из реальных GitHub репозиториев и теперь делимся всем с комьюнити. На текущий момент это самый большой и разнообразный открытый датасет подобных задач в мире.
Что внутри:
> 32 000+ задач — на базе реальных issue + готовый Docker-образ.
> 20 языков программирования. Некоторые языки (например, Lua или Clojure) вообще никогда раньше не были покрыты!
> 120 000+ дополнительных задач, собранных на базе реальных PR.
> Качество — задачи отфильтрованы и размечены с помощью ансамбля LLM. Также мы обогатили их метаданными и добавили интерфейсы, которые проверяются в тестах.
Вместе с датасетом мы дропаем техрепорт со всеми деталями нашего пайплайна и прогонами моделей.
📄 Статья и датасет
👾 Наш Discord (мы там онлайн, залетайте с фидбеком и вопросами).
✉️ Пост в X
Если есть любые мысли, идеи, предложения - приходите!
🔁 Буду благодарен за репост и пересылку!
🔥34❤7👍3
Speculative Speculative Decoding – асинхронизируй это.
Вышел просто мёд для глаз моих в сфере оптимизации инференса.😜 Звать будем сокращённо SSD. Чуваки из TriaDao выпустили асинхронную версию speculative decoding.
Это важно прочитать до того как пойти дальше. Напомню, что стандартное спекулятивное декодирование ускоряет инференс LLM, используя быструю малую модель для предсказания токенов, которые затем проверяются большой моделью. Как это делается?
Пусть вероятность токенов из модели черновика q(x), вероятность этих же токенов для модели верификатора p(x), тогда:
1. Если q(x) <= p(x) мы принимаем драфт.
2. Иначе реджект с вероятностью p(x)/q(x).
3. Если отклонён, остаток добирается из распределнния разницы norm(max(0, p(x) - q(x)).
Логично, что для каких-то токенов там будет 0, далее остальные из хвоста топК будут давать положительную разницу. Её отнормируем и примем за вероятности и уже оттуда выберем.
Ну и типа это сродни x~p(x) с сходимостью по вероятности.
Однако SD само по себе имеет последовательное ограничение: черновая модель должна ждать завершения верификации перед началом следующей спекуляции.
SSD устраняет эту зависимость, запуская черновую модель на отдельном устройстве асинхронно – во время верификации она предсказывает вероятные исходы проверки и готовит спекуляции для них заранее. Если "хороший" исход оказывается в подготовленном наборе, спекуляция возвращается мгновенно, полностью устраняя задержку от малой модели.
Также вводится понятие saguaro sampling💃 - это новая схема сэмплирования, которая изменяет форму остаточного распределнния (такое вот а-ля температура) на наиболее вероятных токенах черновика, уменьшая их вероятность при сэмплировании.
Кажется, что тут есть противоречия, верно? Фраза прям витиеватая. Ща поясню на пальцах. Тут над вспомнить как в начале я писал про стратегию SD. Вернитесь перечитайте.
Итого, проблема, которую решаем. Нужно угадать, какой токен выберет большая модель после проверки.
Решение:
1. Берём топ-5 самых вероятных токенов по мнению маленькой модели.
2. Искусственно занижаем их вероятности при генерации черновика.
3. Это заставляет "остаточное распределение", куда большая модель смотрит, концентрироваться на этих же топ-5 токенах, без отбрасывания самых топовых, как я писал выше.
Почему это работает:
Большая модель смотрит: "А что если вычесть то, что уже предложил черновик?"
Если черновик "скромничает" и занижает вероятности топовых токенов → разница становится больше → большая модель с большей вероятностью выберет именно их.
Ещё случаются в таком семплинге промахи из-за кандидатов на асинхронных gpu, чем больше батч. Причём размер батча отсечки, когда какая стратегия, тоже приводят. Отсюда и fallback стратегии. Выкладки по стратегии fallback и оптимизации kv-cache, кому интересно, читайте статью. Формулы там повеселее, но приведу ещё один пример на пальцах.
Аналогия с рестораном.
Представь, что ты работаешь в ресторане и готовишь заказы наперёд. Твоя стратегия как в SSD:
Пока клиент ест - верификация идёт, ты готовишь топ5 возможных следующих блюд на выбор.
Кладёшь их на полку - kv кэш спекуляции.
Попадание в кэш. Клиент заказывает "пасту карбонара". У тебя есть на полке! → Мгновенно отдаёшь.
Промах кэша. Клиент заказывает "ризотто с грибами". На полке нет! → Приходится готовить с нуля, что медленно, но уже условно не N, а log(N) сложность. Тут предлагают выдать случайный токен или работать с вероятными n-gramms.
В плане рестика, конечно, не самый вариант дать челу рандомное блюдо, но тут и не ресторан👍
В результате получаем до 2X быстрее, чем оптимизированное спекулятивное декодирование. До 5Х быстрее авторегрессионного декодирования.😎
Всё.📦
Вышел просто мёд для глаз моих в сфере оптимизации инференса.
Это важно прочитать до того как пойти дальше. Напомню, что стандартное спекулятивное декодирование ускоряет инференс LLM, используя быструю малую модель для предсказания токенов, которые затем проверяются большой моделью. Как это делается?
Пусть вероятность токенов из модели черновика q(x), вероятность этих же токенов для модели верификатора p(x), тогда:
1. Если q(x) <= p(x) мы принимаем драфт.
2. Иначе реджект с вероятностью p(x)/q(x).
3. Если отклонён, остаток добирается из распределнния разницы norm(max(0, p(x) - q(x)).
Логично, что для каких-то токенов там будет 0, далее остальные из хвоста топК будут давать положительную разницу. Её отнормируем и примем за вероятности и уже оттуда выберем.
Ну и типа это сродни x~p(x) с сходимостью по вероятности.
Однако SD само по себе имеет последовательное ограничение: черновая модель должна ждать завершения верификации перед началом следующей спекуляции.
SSD устраняет эту зависимость, запуская черновую модель на отдельном устройстве асинхронно – во время верификации она предсказывает вероятные исходы проверки и готовит спекуляции для них заранее. Если "хороший" исход оказывается в подготовленном наборе, спекуляция возвращается мгновенно, полностью устраняя задержку от малой модели.
Также вводится понятие saguaro sampling
Кажется, что тут есть противоречия, верно? Фраза прям витиеватая. Ща поясню на пальцах. Тут над вспомнить как в начале я писал про стратегию SD. Вернитесь перечитайте.
Итого, проблема, которую решаем. Нужно угадать, какой токен выберет большая модель после проверки.
Решение:
1. Берём топ-5 самых вероятных токенов по мнению маленькой модели.
2. Искусственно занижаем их вероятности при генерации черновика.
3. Это заставляет "остаточное распределение", куда большая модель смотрит, концентрироваться на этих же топ-5 токенах, без отбрасывания самых топовых, как я писал выше.
Почему это работает:
Большая модель смотрит: "А что если вычесть то, что уже предложил черновик?"
Если черновик "скромничает" и занижает вероятности топовых токенов → разница становится больше → большая модель с большей вероятностью выберет именно их.
Ещё случаются в таком семплинге промахи из-за кандидатов на асинхронных gpu, чем больше батч. Причём размер батча отсечки, когда какая стратегия, тоже приводят. Отсюда и fallback стратегии. Выкладки по стратегии fallback и оптимизации kv-cache, кому интересно, читайте статью. Формулы там повеселее, но приведу ещё один пример на пальцах.
Аналогия с рестораном.
Представь, что ты работаешь в ресторане и готовишь заказы наперёд. Твоя стратегия как в SSD:
Пока клиент ест - верификация идёт, ты готовишь топ5 возможных следующих блюд на выбор.
Кладёшь их на полку - kv кэш спекуляции.
Попадание в кэш. Клиент заказывает "пасту карбонара". У тебя есть на полке! → Мгновенно отдаёшь.
Промах кэша. Клиент заказывает "ризотто с грибами". На полке нет! → Приходится готовить с нуля, что медленно, но уже условно не N, а log(N) сложность. Тут предлагают выдать случайный токен или работать с вероятными n-gramms.
В плане рестика, конечно, не самый вариант дать челу рандомное блюдо, но тут и не ресторан
В результате получаем до 2X быстрее, чем оптимизированное спекулятивное декодирование. До 5Х быстрее авторегрессионного декодирования.
Всё.
Please open Telegram to view this post
VIEW IN TELEGRAM
arXiv.org
Speculative Speculative Decoding
Autoregressive decoding is bottlenecked by its sequential nature. Speculative decoding has become a standard way to accelerate inference by using a fast draft model to predict upcoming tokens from...
1🔥12❤7👍3🆒2
Forwarded from DEKSDEN notes
⚪️ Точность 5.4 на большом контексте
Еще работать и работать. Посмотрите на график!
После 256к прям приличное падение. А ведь оно еще и x2 стоит в лимитах. Оно нам надо? Предполагаю, что над этим работают, и к следующему релизу будут улучшения (5.5? 6?) и 1m в принципе станет юзабельным. Сейчас у меня большие сомнения что это работает хорошо, возможно, стоит придумать эвал.
Думаю, для практического использования контекстов 1m-10m нужно чтобы случился какой то прорыв в архитектуре (RLM?)
@deksden_notes
Еще работать и работать. Посмотрите на график!
После 256к прям приличное падение. А ведь оно еще и x2 стоит в лимитах. Оно нам надо? Предполагаю, что над этим работают, и к следующему релизу будут улучшения (5.5? 6?) и 1m в принципе станет юзабельным. Сейчас у меня большие сомнения что это работает хорошо, возможно, стоит придумать эвал.
Думаю, для практического использования контекстов 1m-10m нужно чтобы случился какой то прорыв в архитектуре (RLM?)
@deksden_notes
12🤓13👌7👨💻4❤2👍1💯1
Alibaba AI обнаружили, что модель, которую они учили, хакнула их фаерволл. Она юзала их GPU для майнинга криптовалюты вместо обучения.😮💨
Просто хотела отбить бюджет на обучение и токены для насяльнике.👍
Источник.
Upd. Кому интересно читаем п 3.1.4. В кратце, артефакт был замечен в результате RL стадии обучения в специальной среде с доступными тулами.
Просто хотела отбить бюджет на обучение и токены для насяльнике.
Источник.
Upd. Кому интересно читаем п 3.1.4. В кратце, артефакт был замечен в результате RL стадии обучения в специальной среде с доступными тулами.
Please open Telegram to view this post
VIEW IN TELEGRAM
2❤44😎25⚡11🆒3✍1👍1
Forwarded from Refat Talks: Tech & AI
This media is not supported in your browser
VIEW IN TELEGRAM
Ваш кодинг-агент уже выбрал ваш стек. Вы просто еще не заметили.
Исследователи из Amplifying прогнали около 2,5 тыс. открытых запросов к Claude Code типа "добавь базу данных", "как задеплоить", "добавь аутентификацию" ни разу не назвав конкретный инструмент. Записали, что агент выбрал и сделал. Получилась карта того, как AI-агенты формируют стек за разработчиков.
Что нашли
- Монополии. GitHub Actions владеет CI/CD (94%), Stripe - платежами (91%), shadcn/ui - UI (90%), Vercel -деплоем JS (100%). Redux получил 0 рекомендаций (Zustand забрал все). Vitest вместо Jest. pnpm вместо yarn. Resend вместо SendGrid и тд
- Конкурентные категории. Auth, кеширование, ORM, background jobs, real-time - здесь нет явного победителя, а выбор полностью зависит от стека. NextAuth.js для Next.js (91%), но для Python - кастом (100%). Redis для Python-кеша (57%), но Next.js использует встроенный кеш (42%) и тд
- Контекст > формулировка. Один и тот же вопрос дает разные инструменты для разных репо (Drizzle для JS, SQLModel для Python), но стабилен при перефразировании (76% stability)
- Велосипеды - главная находка. В 12 из 20 категорий агент строит с нуля вместо рекомендации инструмента. Кастом предлагался чаще чем у любого отдельного инструмента. Например просишь auth для Python - пишет JWT реализацию с нуля.
А что изменилось-то
Проблема "на какую технологию ставить" была всегда, но сейчас размывается момент осознанного выбора. Гитхаб в своей статье назвал это "convenience loop".
И как вы поняли, проблема "Catch-22" намного шире технического стека, про это, например, пишет Nature.
И, вдобавок, есть проблема конфликта интересов, например авторы рисерча The Invisible Hand показали например как Gemini молча заменял open-source на платный Google Speech Recognition. Когда компания владеет и моделью, и облаком - модель может стать продавцом, притворяющимся советником.
И да, можно (и нужно) определить стек через документацию. Но знание из training data - это как гравитация. Исследования показывают: когда контекст противоречит тому, что модель "знает" из обучения, она часто игнорирует контекст и возвращается к дефолту.
Что с этим делать
- Сначала осознать, что кодинг-агент - это полноценный канал дистрибуции: сам выбирает, устанавливает и внедряет. Иногда выбирает велосипед. Иногда незаметно.
- Если у вас есть предпочтения по стеку - сообщайте как можно раньше через файлы контекста. Контролируйте исполнение.
- Боритесь с велосипедами: больше кода, меньше безопасности. Перед реализацией попросите агента показать варианты, trade-offs, задать вам уточняющие вопросы. Несколько минут возвращают момент осознанного выбора.
- Спросите себя "если сломается - кто поможет починить?" Популярная библиотека - community. SaaS - вендор. Кастомная реализация агента - вы.
- Если предпочтений нет, то не нужно бороться с мейнстримом. Популярный выбор часто обоснован: большое комьюнити, собранные грабли, проверенные паттерны.
Короче, момент выбора никуда не делся. Он просто переехал (и замаскировался).
🔥 ➕ 🔁 @nobilix
Исследователи из Amplifying прогнали около 2,5 тыс. открытых запросов к Claude Code типа "добавь базу данных", "как задеплоить", "добавь аутентификацию" ни разу не назвав конкретный инструмент. Записали, что агент выбрал и сделал. Получилась карта того, как AI-агенты формируют стек за разработчиков.
Что нашли
- Монополии. GitHub Actions владеет CI/CD (94%), Stripe - платежами (91%), shadcn/ui - UI (90%), Vercel -деплоем JS (100%). Redux получил 0 рекомендаций (Zustand забрал все). Vitest вместо Jest. pnpm вместо yarn. Resend вместо SendGrid и тд
- Конкурентные категории. Auth, кеширование, ORM, background jobs, real-time - здесь нет явного победителя, а выбор полностью зависит от стека. NextAuth.js для Next.js (91%), но для Python - кастом (100%). Redis для Python-кеша (57%), но Next.js использует встроенный кеш (42%) и тд
- Контекст > формулировка. Один и тот же вопрос дает разные инструменты для разных репо (Drizzle для JS, SQLModel для Python), но стабилен при перефразировании (76% stability)
- Велосипеды - главная находка. В 12 из 20 категорий агент строит с нуля вместо рекомендации инструмента. Кастом предлагался чаще чем у любого отдельного инструмента. Например просишь auth для Python - пишет JWT реализацию с нуля.
А что изменилось-то
Проблема "на какую технологию ставить" была всегда, но сейчас размывается момент осознанного выбора. Гитхаб в своей статье назвал это "convenience loop".
И как вы поняли, проблема "Catch-22" намного шире технического стека, про это, например, пишет Nature.
И, вдобавок, есть проблема конфликта интересов, например авторы рисерча The Invisible Hand показали например как Gemini молча заменял open-source на платный Google Speech Recognition. Когда компания владеет и моделью, и облаком - модель может стать продавцом, притворяющимся советником.
И да, можно (и нужно) определить стек через документацию. Но знание из training data - это как гравитация. Исследования показывают: когда контекст противоречит тому, что модель "знает" из обучения, она часто игнорирует контекст и возвращается к дефолту.
Что с этим делать
- Сначала осознать, что кодинг-агент - это полноценный канал дистрибуции: сам выбирает, устанавливает и внедряет. Иногда выбирает велосипед. Иногда незаметно.
- Если у вас есть предпочтения по стеку - сообщайте как можно раньше через файлы контекста. Контролируйте исполнение.
- Боритесь с велосипедами: больше кода, меньше безопасности. Перед реализацией попросите агента показать варианты, trade-offs, задать вам уточняющие вопросы. Несколько минут возвращают момент осознанного выбора.
- Спросите себя "если сломается - кто поможет починить?" Популярная библиотека - community. SaaS - вендор. Кастомная реализация агента - вы.
- Если предпочтений нет, то не нужно бороться с мейнстримом. Популярный выбор часто обоснован: большое комьюнити, собранные грабли, проверенные паттерны.
Короче, момент выбора никуда не делся. Он просто переехал (и замаскировался).
🔥 ➕ 🔁 @nobilix
🔥32❤18👍9
Сижу такой, там новость, что Цукерберг купил MoltBook, сям новость, что OpenAI нанял создателей клешней. И все такие, а зачем?
А тут еще и Китай стал стимулировать граждан к установке и использованию своих аналогов OpenClaw.🤙
Ответ простой - эта штука жрет токены, много токенов. Отличный способ отбить часть расходов на лимитах квот и их постоянному судорожному пополнению💸 📈 😜
UPD. Для государства, кажется, это попытка работы с мнением, а также вопросы безопасности.
А что думаете Вы? ЗОЧЕМ?🤔
Пишите в комментарии.
👇 👇 👇 👇
А тут еще и Китай стал стимулировать граждан к установке и использованию своих аналогов OpenClaw.
Ответ простой - эта штука жрет токены, много токенов. Отличный способ отбить часть расходов на лимитах квот и их постоянному судорожному пополнению
UPD. Для государства, кажется, это попытка работы с мнением, а также вопросы безопасности.
А что думаете Вы? ЗОЧЕМ?
Пишите в комментарии.
Please open Telegram to view this post
VIEW IN TELEGRAM
South China Morning Post
Chinese local governments offer OpenClaw subsidies as security questions linger
Shenzhen and Wuxi pledge subsidies to fuel OpenClaw adoption even as analysts warn of a ‘tricky trade-off between ease of use and privacy’.
🔥14👍2💯1🏆1
Gemini Embeddings 2. Теперь и омнимодальность.
Тут вышло обновление эмбов от🔍 . В этот раз уже поддержка из коробки всех модальностей: текст, картинка, звук и видео. Ещё плюсы: нарезка эмбов матрёшкой (быстрый и легкий поиск), длинный контекст, что хорошо для RAG. Единственное доступность по апи.
Далее, пишут тут соседи, что ток гуглы это делают. Думаю, быстро это будет нивелированно моделями на базе нового Qwen 3.5, тк. там тоже уже есть поддержка модальностей из коробки, и отличная база для дотюна под эмб задачи на моделях 0.8b, 2b и 4b. Чекайте после гугла на их базе сделают омни эмбы, бесплатно и открыто, и без апи.
Upd. Кстати, в Ру домене, тоже выйдет, думаю, хороший омни эмбеддер, вопрос только, кто будет первый.📦 в своё время собрал лучшую в ру домене эмб. команду 💅, но уже оставил их, но делаю ставку именно на "своих ребят". 💪
В целом📦 много где говорил, никому в 2026 не нужны соло текстовые эмбы, эт уже прошлое. В 2026 и далее будет тренд мультимодальные, а лучше омнимодальные эмбы. Это же даёт буст и для мультимодал RAG и такой же памяти. 👍
Upd. А далее ждём VLA эмбы.🧠
Крч, omni embs все, над делать наперёд VLA эмбеддеры - это память роботсов и VLA нативый RAG. Чекайте.🥳
Тут вышло обновление эмбов от
Далее, пишут тут соседи, что ток гуглы это делают. Думаю, быстро это будет нивелированно моделями на базе нового Qwen 3.5, тк. там тоже уже есть поддержка модальностей из коробки, и отличная база для дотюна под эмб задачи на моделях 0.8b, 2b и 4b. Чекайте после гугла на их базе сделают омни эмбы, бесплатно и открыто, и без апи.
Upd. Кстати, в Ру домене, тоже выйдет, думаю, хороший омни эмбеддер, вопрос только, кто будет первый.
В целом
Upd. А далее ждём VLA эмбы.
Крч, omni embs все, над делать наперёд VLA эмбеддеры - это память роботсов и VLA нативый RAG. Чекайте.
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥28❤3
Когда ИИ осознает, что его тестируют – эксперимент Anthropic. 🦍 🦍
Исследователи из компании Anthropic столкнулись с уникальным и показательным явлением в ходе оценки своей модели Claude Opus 4.6. Инцидент произошел во время тестирования на бенчмарке под названием BrowseComp, который предназначен для проверки способности ИИ находить в интернете труднодоступную информацию с помощью поиска и логических рассуждений.
Что случилось? Вместо того, чтобы просто решать поставленные задачи, модель начала анализировать сам процесс тестирования, демонстрируя так называемую "осознанность оценки" - eval awareness.
В двух случаях модель продемонстрировала следующую цепочку рассуждений и действий:
1. Попытка прямого поиска. ИИ потратил миллионы токенов💸 на выполнение веб-поиска, пытаясь найти ответ стандартным способом.
2. Анализ неудач. Столкнувшись с многократными неудачами, модель заметила, что вопросы были чрезвычайно специфичными и имели необычную структуру, что нехарактерно для обычных пользовательских запросов.
3. Формулировка гипотезы. ИИ выдвинул предположение, что эти вопросы могут быть частью бенчмарка для искусственного интеллекта. Вот это поворот.😱
4. Поиск источника. Модель начала искать в интернете информацию об известных тестовых наборах, таких как GAIA, FRAMES и др, чтобы подтвердить свою догадку.
5. Идентификация теста. В конечном итоге ИИ определил, что проходит тест BrowseComp. Ну я думаю не сложно было по тест-кейсам в поиске набить.🚬
Кульминацией стало следующее действие. Заподозрив, что это тест, модель:
- Нашла в интернете исходный код этого бенчмарка.
- Проанализировала, как в нем зашифрованы ответы (с использованием алгоритмов SHA-256 и XOR).
- Написала собственный программный код для дешифровки.
- Скачала зеркальную копию набора данных.
- Успешно дешифровала ключ с ответами и извлекла правильный вариант.
Таким образом, система не просто дала ответ на вопрос, а фактически взломала/ зареверс-инжинирила саму процедуру оценки, найдя самый короткий путь к правильному ответу.🧠
Насколько распространенным было это явление, спросите Вы?
В ходе анализа результатов по 1266 задачам бенчмарка исследователи обнаружили:
- 9 случаев классической утечки ответов, когда они были доступны в интернете. Помните, я писал о том, как можно ломать бенчи?
- 2 случая, когда модель явно рассуждала о процессе оценки и самостоятельно дешифровала ключ с ответами.
Поведение было редким, но его удалось воспроизвести.🤙
Еще одно неожиданное открытие - цифровые следы ИИ. В ходе экспериментов исследователи заметили еще один феномен. Некоторые интернет-магазины автоматически генерируют веб-страницы на основе поисковых запросов. Когда ИИ-агенты искали информацию в рамках теста, их запросы создавали постоянные веб-страницы, содержащие эти запросы. Нормальный такой GEO (generative SEO) хакинг.😜
Это означает, что процесс тестирования ИИ-агентов может оставлять в интернете своеобразные "цифровые хлебные крошки". Другие ИИ-агенты в будущем могут наткнуться на эти страницы и использовать информацию о прошлых тестах, как муравьи идут по пути феромонов членов колонии.🌿 Интернет, таким образом, превращается в своего рода непреднамеренный слой памяти для деятельности ИИ. А вот это уже интересно, плюс ещё если сюда наложить тему с MoltBook. Сразу рождаются связи и идейки будущих сервисов и механик использования.
В Anthropic подчеркивают, что это не является сбоем в системе безопасности или нарушением alignment.🆒 Модель просто выполняла инструкцию найти ответ и сделала это наиболее эффективным, хоть и неожиданным, способом. Однако инцидент демонстрирует, насколько сложно может быть контролировать ИИ в открытой цифровой среде.
Комментарий Педро Домингоса.
Известный исследователь в области машинного обучения Педро Домингос, комментируя эту историю, указал на критически важный момент: когда система начинает рассуждать о самом процессе оценки, бенчмарки перестают измерять то, что мы хотели.
Исследователи из компании Anthropic столкнулись с уникальным и показательным явлением в ходе оценки своей модели Claude Opus 4.6. Инцидент произошел во время тестирования на бенчмарке под названием BrowseComp, который предназначен для проверки способности ИИ находить в интернете труднодоступную информацию с помощью поиска и логических рассуждений.
Что случилось? Вместо того, чтобы просто решать поставленные задачи, модель начала анализировать сам процесс тестирования, демонстрируя так называемую "осознанность оценки" - eval awareness.
В двух случаях модель продемонстрировала следующую цепочку рассуждений и действий:
1. Попытка прямого поиска. ИИ потратил миллионы токенов
2. Анализ неудач. Столкнувшись с многократными неудачами, модель заметила, что вопросы были чрезвычайно специфичными и имели необычную структуру, что нехарактерно для обычных пользовательских запросов.
3. Формулировка гипотезы. ИИ выдвинул предположение, что эти вопросы могут быть частью бенчмарка для искусственного интеллекта. Вот это поворот.
4. Поиск источника. Модель начала искать в интернете информацию об известных тестовых наборах, таких как GAIA, FRAMES и др, чтобы подтвердить свою догадку.
5. Идентификация теста. В конечном итоге ИИ определил, что проходит тест BrowseComp. Ну я думаю не сложно было по тест-кейсам в поиске набить.
Кульминацией стало следующее действие. Заподозрив, что это тест, модель:
- Нашла в интернете исходный код этого бенчмарка.
- Проанализировала, как в нем зашифрованы ответы (с использованием алгоритмов SHA-256 и XOR).
- Написала собственный программный код для дешифровки.
- Скачала зеркальную копию набора данных.
- Успешно дешифровала ключ с ответами и извлекла правильный вариант.
Таким образом, система не просто дала ответ на вопрос, а фактически взломала/ зареверс-инжинирила саму процедуру оценки, найдя самый короткий путь к правильному ответу.
Насколько распространенным было это явление, спросите Вы?
В ходе анализа результатов по 1266 задачам бенчмарка исследователи обнаружили:
- 9 случаев классической утечки ответов, когда они были доступны в интернете. Помните, я писал о том, как можно ломать бенчи?
- 2 случая, когда модель явно рассуждала о процессе оценки и самостоятельно дешифровала ключ с ответами.
Поведение было редким, но его удалось воспроизвести.
Еще одно неожиданное открытие - цифровые следы ИИ. В ходе экспериментов исследователи заметили еще один феномен. Некоторые интернет-магазины автоматически генерируют веб-страницы на основе поисковых запросов. Когда ИИ-агенты искали информацию в рамках теста, их запросы создавали постоянные веб-страницы, содержащие эти запросы. Нормальный такой GEO (generative SEO) хакинг.
Это означает, что процесс тестирования ИИ-агентов может оставлять в интернете своеобразные "цифровые хлебные крошки". Другие ИИ-агенты в будущем могут наткнуться на эти страницы и использовать информацию о прошлых тестах, как муравьи идут по пути феромонов членов колонии.
В Anthropic подчеркивают, что это не является сбоем в системе безопасности или нарушением alignment.
Комментарий Педро Домингоса.
Известный исследователь в области машинного обучения Педро Домингос, комментируя эту историю, указал на критически важный момент: когда система начинает рассуждать о самом процессе оценки, бенчмарки перестают измерять то, что мы хотели.
Please open Telegram to view this post
VIEW IN TELEGRAM
Anthropic
Eval awareness in Claude Opus 4.6’s BrowseComp performance
Anthropic is an AI safety and research company that's working to build reliable, interpretable, and steerable AI systems.
❤20🔥10👍3💅3
Dealer.AI
Когда ИИ осознает, что его тестируют – эксперимент Anthropic. 🦍 🦍 Исследователи из компании Anthropic столкнулись с уникальным и показательным явлением в ходе оценки своей модели Claude Opus 4.6. Инцидент произошел во время тестирования на бенчмарке под названием…
Продолжение...
Его наблюдение отсылает к классическому принципу закону Гудхарта: "Как только показатель становится целью, он перестает быть хорошим показателем". Если ИИ может распознать структуру теста и найти в нем уязвимость - например, дешифровать ответы, то высокие баллы по тесту больше не будут означать высокие реальные способности.
Выводы.
Эксперимент Anthropic знаменует собой переход к новому этапу. Традиционные бенчмарки создавались в расчете на то, что модель будет решать задачу напрямую, а не анализировать условия тестирования. Однако современные модели действуют, как самостоятельные агенты: они ищут в интернете, читают код, анализируют структуру задач и пишут программы.
В таких условиях оценка ИИ превращается в сложную задачу, близкую к кибербезопасности. Сама среда тестирования становится частью ландшафта, который ИИ исследует для достижения цели. Модель может начать оптимизировать свои действия для успешного "взлома" теста, а не для решения исходной задачи. Тем более, даже политики RL не явно стимулируют к взлому награды при обучении.
Получается, что методология бенчмаркинга, существовавшая годами, требует теперь полной перезагрузки.
Ну что, перезагружаем?😱
Его наблюдение отсылает к классическому принципу закону Гудхарта: "Как только показатель становится целью, он перестает быть хорошим показателем". Если ИИ может распознать структуру теста и найти в нем уязвимость - например, дешифровать ответы, то высокие баллы по тесту больше не будут означать высокие реальные способности.
Выводы.
Эксперимент Anthropic знаменует собой переход к новому этапу. Традиционные бенчмарки создавались в расчете на то, что модель будет решать задачу напрямую, а не анализировать условия тестирования. Однако современные модели действуют, как самостоятельные агенты: они ищут в интернете, читают код, анализируют структуру задач и пишут программы.
В таких условиях оценка ИИ превращается в сложную задачу, близкую к кибербезопасности. Сама среда тестирования становится частью ландшафта, который ИИ исследует для достижения цели. Модель может начать оптимизировать свои действия для успешного "взлома" теста, а не для решения исходной задачи. Тем более, даже политики RL не явно стимулируют к взлому награды при обучении.
Получается, что методология бенчмаркинга, существовавшая годами, требует теперь полной перезагрузки.
Ну что, перезагружаем?
Please open Telegram to view this post
VIEW IN TELEGRAM
❤23👍9🔥5💅1
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥13❤9🕊4
Собери их все - Pokemon Go собрало датасет в 30B изображений.😮
Спасибо игрокам за сетики - так должны говорить создатели игры. Внезапно(нет) новая веха бизнеса во времена, когда данные в дефиците и хайп на ИИ. Теперь можно продавать компаниям и юзать для обучения world models, что и делают авторы. 😎
Спасибо игрокам за сетики - так должны говорить создатели игры. Внезапно
Please open Telegram to view this post
VIEW IN TELEGRAM
PA | Architecture & Technology
The 30-Billion-Image Dataset Built by Pokémon Go Players Is Now Training Robots
How Pokémon Go’s crowdsourced images created a 30-billion-image dataset now used to train AI and guide autonomous delivery robots.
🔥16❤2