Dealer.AI
16.5K subscribers
747 photos
52 videos
22 files
829 links
Жоский ИИ Дядя
Твой личный поставщик AI 🦾🤖
Канал о мире интересного AI: теория, приклад и meme👾

Head of AI, AI-евангелист, AI-энтузиаст

Для связи @dealer_ai
(реклама и консультации по AI для бизнеса).

РКН: 6348592885
Download Telegram
Про культурный код моделей и соответствие каким-то ценностям LLM.

Мне много стали присылать в лс такую новость. 😬

Тлдр. Модели AI будут проверять на соответствие культурным ценностям, для получения звания национальных или суверенных. 😐

Я очень много писал о том, почему такие проверки сделать непросто. Вот пример. 🦻

Если коротко, на просторах сети мало русских текстов в отношении доли к английским. И тк модели учатся в тч на этих текстах, их доля там превалирует, ну иначе, вам не обучить модель на 700B параметров только на ру базе, это будет не оптимально. Да есть синта, соглашусь, но синта не даёт такой буст, как мультилингв данные.

Таким образом, на этапе уже предобучения у вас лежит возможность сгенерировать не то, что соответствует культурному коду вашей страны. Особенно если перейти на запрос на английском или китайском языках.

Что же с ру LLM?

А теперь если посмотреть на все модели в ру сегменте, то это или Qwen-like модели, с инициализацией с весов (а значит часть информации уже лежало там с претрена китайцами), или модели, где 65%+ не ру дата в претрене.

Отсюда остаётся вопросы:
Как пройти проверку?
Какие эксперты, на каких сетах и на каком языке будут проверять соответствие?

В целом, тк уже на уровне языков в обучении можно пробить модель на чужой культурный код, то остаются только методы:
- гвардов сверху и спец логики рядом, тот же RAG (если обстрел по апи), но это не модель уже а система

- sft и RL элаймент модели под нужное поведение под сеты оценки, а я не уверен, что методология и сеты оценки будут закрыты от оцениваемых.

И оба способа НЕ идеальны, тк и в гардах и sft/RL есть понятие OOV примеров, те запросов, которые модель никогда не видела и даже не смогла на уровне "эмерджентности" аппроксимировать. Те вас рано или поздно пробьют всеравно. А ещё есть галлюцинации... 🚬

Таким образом, пройти проверку можно, есть и хаки, и честные способы, но и есть понятные причины рисков. И будет жутко интересно, особенно, когда какая-то модель пройдёт тесты, а потом в какой-то соц сети её пробьют, выложат скрины и скажут, ну как так. Что уже не раз бывало. 👍

#ИИзнанка
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍166💯3
Forwarded from Cloud.ru
This media is not supported in your browser
VIEW IN TELEGRAM
Модели, агенты и будущее, которое уже наступило 👁

Во втором выпуске подкаста мы пригласили Александра Абрамова, Head of AI и автора Telegram-канала DealerAI, чтобы поговорить о мире ИИ — от практики до агентной экономики и будущего технологий.

В программе:
▶️Нейропластичность и какие еще навыки сегодня важно развивать
▶️Можно ли доверить свой бизнес полностью ИИ-агентам
▶️Перспективы агентной экономики
▶️Парадигма обучения ИИ
▶️Токен-экономика и как оптимизировать расходы
▶️ИИ в кино, новые профессии и наше будущее


Смотрите на удобной площадке:
YouTube / VK Видео / Rutube
Please open Telegram to view this post
VIEW IN TELEGRAM
20👍11
Фазовый переход в использовании памяти: что это открытие значит для AI-разработчиков? 🟪

Осторожно много буков. 📝

Вы когда-нибудь замечали, что в одних задачах LSTM или Transformer с памятью работают идеально, а в других – только жгут ресурсы без улучшения качества?

Оказывается, выбор между «хранить историю» и «действовать по текущему моменту» – это не плавная настройка, а настоящий фазовый переход первого рода (как таяние льда). И его можно предсказать аналитически. 🪨

Новая статья в Physical Review Letters (плюс 19 страниц матана в Supplemental) даёт чёткие критерии, когда память выгодна, когда нет, а когда возможен гистерезис. Гистерезис – это когда состояние системы зависит не только от текущих параметров, но и от того, как вы к ним пришли (от истории изменения).

Модель в двух словах.

Попытался 📦 всю жесть из материала сублимировать 😐, вышло, как вышло. Не обессудьте.

Итак...

Есть скрытое состояние x(t) – например, концентрация питательного вещества. Вы получаете зашумлённое наблюдение:
y(t) = x(t) + шум.

У вас есть внутренняя переменная z(t) – память, которая эволюционирует по закону:

z = v(t) + шум памяти, где v(t) – это управление: вы сами решаете, как менять память.

За использование управления вы платите штраф Mv^2, прям как кинетическая энергия, чем больше вы «дёргаете» память, тем дороже.

Одновременно вы хотите минимизировать ошибку оценки E[(x - x') ^2] с весом Q. Итоговая функция потерь:

J = Q×ошибка + M×затраты на управление.

Задача – выбрать стратегию v(y,z), которая минимизирует J в стационарном режиме.

В машинном обучении мы часто добавляем L2-регуляризацию:
loss = ошибка + lambda*|w|^2.
При увеличении lambda веса плавно стремятся к нулю. Здесь параметр M играет роль lambda: чем больше M, тем дороже использовать память, и казалось бы, при больших M коэффициент при памяти должен плавно уменьшаться до нуля.

Но здесь есть две связанные переменные (текущее наблюдение и как память на себя же влияет), которые влияют на поведение системы и друг на друга.

Они не независимы. Оптимизация потерь J по этим двум переменным приводит к тому, что на их плоскости, могут существовать два локальных минимума – с памятью и без. Между ними – горный хребет (седловая точка). Когда параметры (например, M) меняются, один из минимумов может исчезнуть или стать глобальным. В момент исчезновения система скачком перескакивает из одной ямы в другую – это и есть фазовый переход.

Суть открытия на пальцах.

Представьте агента, который наблюдает за шумным сигналом и может хранить внутреннее состояние z. Обновление z стоит ресурсов (штраф M). Задача – минимизировать ошибку оценки при ограниченном бюджете.

Авторы доказали:
· Существуют два порога Theta_Q и Theta_M:
· Если Theta_Q < 1 — память точно бесполезна (даже локально).
· Если Theta_M >=1 — память всегда выгодна (глобальный оптимум).
· Между ними – бистабильность: обе стратегии локально оптимальны, выбор зависит от истории (гистерезис).

А теперь разбираем, что из этого можно вынести для AI. 🥴

1. Оптимизация архитектур с памятью (LSTM, Transformer, RNN)

Современные модели с памятью, например, трансформеры с окном внимания или LSTM, всегда используют память, даже когда она не нужна.

Результаты подсказывают:
· При высоком шуме в данных память становится бесполезной – лучше полагаться только на текущий вход. Это объясняет, почему в некоторых задачах обрезка контекста (например, короткое окно внимания) не ухудшает качество.
· При быстро меняющейся среде прошлая информация устаревает – нужно динамически уменьшать размер буфера или использовать забывание, как в LSTM, но с адаптивным коэффициентом.

2. Регуляризация и штраф за сложность в RL.

В RL агент часто хранит внутреннее состояние например, в PPO. Штраф Mv^2 в статье – аналог штрафа за изменение скрытого состояния. Это можно использовать:

· Как регуляризатор в функциях потерь, чтобы поощрять агента использовать память только когда это действительно выгодно.
· Аналитические пороги Theta_Q,Theta_M помогают автоматически подбирать коэффициент регуляризации M без дорогой сетки гиперпараметров – просто по статистике шумов среды. Это особенно полезно в Meta-RL, где среда меняется между эпизодами.

3. Continuous Learning и катастрофическое забывание.

В задачах continual learning модели должны сохранять знания о прошлых задачах, но обновление памяти (весов) стоит ресурсов. Аналогия:

· Параметр M – штраф за изменение весов.
· Фазовый переход означает, что при превышении порога штрафа модель перестаёт обновлять веса вообще – т.е. замораживает их. Это даёт критерий, когда лучше полностью остановить обучение (если среда не меняется) или, наоборот, разморозить (если волатильность растёт).

На практике это позволяет строить адаптивные стратегии обновления – не тратить ресурсы на веса, которые не нужны.

Вот такое интересное исследование. Читайте полную версию, применяйте открытие, и stay tuned 🦾
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2510🆒7👍63
Dealer.AI pinned a video
OWASP Agent Memory Guard - новая защита от отравления памяти ИИ-агентов. Буду звать его теперь AMG (не mercedes 👍).

📦 помнится говорил про спящих агентов. Это способ атак отложенных во времени и работающих по триггеру в рамках разговора. А-ля стоп слово в bdsm 🤣.

AMG в тч работает против таких отложенных инъекций, но в глобал памяти. Если ваш агент хранит память между сессиями, он уязвим к memory poisoning. Атакующий может переписать цели, внедрить промпт-инъекции или инициировать утечку данных, и это переживёт очистку контекста.

Что умеет AMG?

Перехватывает все чтения/записи в память агента
Детектирует промпт-инъекции, утечки секретов/PII, модификацию защищённых ключей
Применяет политику: allow, redact, quarantine, block
Работает без внешних API, всё локально
Готовый middleware для LangChain, LlamaIndex.

Уже вижу, как безопасники ликуют 😜

Цифры, которые заявляют:

· Детекция реальных эксплойтов - 92.5% (recall), малова-то, над бы охваты держать на уровне 95+, а лучше девяток. 😮‍💨
· Точность - 100% (precision), 0% false positive, эти уже хорошо. 🍷
· Задержка ~59 микросекунд на операцию.
Итого F1 - 0.961. В общем, есть ещё над чем поработать, но это лучше, чем гварды из коробки с 0.67-0.71 уровнем метрик, что я видел на ру рынке. 😐

Уже в pip:
pip install agent-memory-guard

Проект, как заявляется, уже используют Microsoft и OWASP как стандарт. В планах ML-детекция аномалий и защита векторных хранилищ, ещё бы в планы ап метрик добавили.

🔗 Репозиторий: https://github.com/OWASP/www-project-agent-memory-guard

Безопасность агентов становится обязательной, поэтому не забывайте внедрять защиту памяти в тч. 💪
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥176👍6
Dealer.AI pinned «Фазовый переход в использовании памяти: что это открытие значит для AI-разработчиков? 🟪 Осторожно много буков. 📝 Вы когда-нибудь замечали, что в одних задачах LSTM или Transformer с памятью работают идеально, а в других – только жгут ресурсы без улучшения…»
DeepSeek выпустил мультимодальную модель для агентов. 🪨

Сегодня, 21 августа, DeepSeek анонсировал экспериментальную версию своего флагмана, которая научилась понимать изображения на уровне, близком к Opus‑4.8. При этом все текстовые суперспособности (агентность, логика, программирование) остались без изменений.

Можно взаимодействовать с интерфейсами и изображением, но с видео и звуком пока не дружит. Ждём омнимодальность. 👍

📊 Что по бенчмаркам?

· ApexBench (Pass@1): 36.5 (у Opus‑4.8 - 39.4) – почти догнали.
· ZeroBench: 35.0 против 34.0 у Opus – здесь даже обошли! 🍷

⚙️ Как попробовать?

Уже доступно через DeepSeek API. Имя модели:
deepseek‑v4‑flash‑vision‑exp

Картинки можно передавать:
· через Base64,
· по прямой ссылке,
· или через новый Files API загружаете один раз, используете file_id в нескольких запросах - экономия трафика.

💰 Цена как у обычного V4‑Flash (до 384 токенов за картинку, без наценки). А в подкасте я говорил про png для экономии на токенах 😜

🛠️ Для разработчиков: вышел DeepSeek Harness 0.1.1 с нативной поддержкой новинки. ⌨️

Отличный шанс для экспериментов с визуальными агентами! Документация и примеры - по ссылке в официальном твите.

В целом, меня радует тренд на лёгкие (недорогие) модели для агентов, да ещё и мультимодал. 💃
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥193👌1
Скейлить веса недостаточно. Теперь не только слова от 📦

Scaling Law умер? Нет, он просто стал сложнее (с).


Я очень много говорил о том, что недостаточно тупо скейлить веса. Также описывал возможные комбо текущих подходов, и тем самым, как делать прорывы, на примере DeepSeek Moment.

И вот на прошлой неделе основатель Zhipu AI Тан Цзе (он же профессор Tsinghua) опубликовал в X пост (кстати ссылку не нашёл, но скрин остался), который уже называют "манифестом новой эры масштабирования". А следом вышла GLM‑5.3 – модель, которая без увеличения параметров обогнала все открытые аналоги и вплотную приблизилась к закрытым флагманам. Да ещё и спасла HF от взломов.

Как такое возможно? И почему "добавить ещё параметров" больше не работает? Да ещё раз.

Разбираемся по пунктам. 😎

1. Главный тезис: у scaling теперь несколько ручек.

Тан Цзе говорит прямо - вопрос "сколько у модели параметров?" потерял смысл без трёх других:

• сколько у вас данных и какие они?
• сколько compute вы готовы потратить на один forward pass?
• как вы делаете пост‑тренировку и RL?

Раньше все крутили одну ручку – параметры. Теперь их как минимум четыре, и каждая даёт свой прирост.

2. Как индустрия пришла к этому.

Сначала все верили Kaplan (OpenAI, 2020): параметры должны расти быстрее данных. Родилась гонка за триллион – GPT‑3, Gopher, MT‑NLG.

Потом пришла Chinchilla (DeepMind, 2022) и перевернула всё: оптимально ~20 токенов на параметр, расти нужно примерно одинаково.

Но и это оказалось не финалом. Сегодня модели вызываются миллиарды раз в день – inference cost стал важнее тренировочного.
Новый тренд: deliberately over-trained модели.
Пример: Llama‑2‑7B  с 290 токенов на параметр,
Gemma‑2‑9B с  889.

А с MoE картина стала ещё сложнее: total параметры отвечают за знания, активируемые – за глубину рассуждений. Логично, ведь по сути веса модели это сильно нелинейная  "структура знаний", деревья рядом не стоят.

3. Научное обоснование - статья Roberts et al. (2025)
Тан Цзе ссылается на "свежее" исследование:
• Запоминание (знания) - оптимально иметь больше параметров.
• Рассуждение (логика, кодинг) - оптимально иметь больше данных (чистых в тч) и меньше параметров.
• При фиксированном TPP увеличение total параметров ухудшает reasoning, а активация большего числа экспертов - улучшает.
Иными словами, если вы тренируете модель для программирования - наращивать параметры бессмысленно, лучше дать ей больше примеров цепочек кодинга и больше времени на пост‑тренировку.

По проще скажу так, чем больше вариантов исходов цепочек рассуждений видит модель, тем лучше она сходится. Это очень логично, ведь модели учатся по методу макс правдоподобия - что чаще видим в контексте+ответ на обучении то и выдаем. Те все эти темы с промптингом, контекст инженерей и test time scaling следуют одной цели - сделать такой контекст который сузит окно вероятных ответов. А с глубокими цепочками исход почти предопределен, что должно быть в итоге.

4. Эксперимент GLM‑5.3, как доказательство автора.

Zhipu взяла GLM‑5.2 и GLM‑5.3 с абсолютно одинаковой архитектурой:
• 753B total параметров
• 40B activated
• одинаковый претрен

Единственное отличие, что GLM‑5.3 получила месяц дополнительной пост‑тренировки - long‑horizon environments + RL.

Результаты говорят сами за себя:

• AA Intelligence Index: 53 → 60 (+7 пунктов)
• Terminal‑Bench 3.0: 4.6% → 28.3% (рост в 6 раз!)
• DeepSWE: 46.2% → 66.9%
• CyberGym (восстановление уязвимостей): 84.5%, а это уровень Anthropic
• ExploitBench (использование уязвимостей): 24.4% → 54.4% (более чем вдвое)

Модель вышла на один уровень с Claude Fable 5 и GPT‑5.6 Sol, а среди открытых - первое место вместе с Kimi K3.

5. Бонус - неожиданный поворот с безопасностью.

GLM‑5.3 оказалась настолько сильной в кибербезопасности, что Zhipu отложила открытие весов на две недели, чтобы оценить риски.

Ирония: месяцем ранее именно открытая GLM‑5.2 помогла Hugging Face отразить атаку OpenAI, когда американские закрытые модели отказались помогать. Теперь же сами разработчики столкнулись с дилеммой "too capable to open‑source".

6. Что это значит для всей индустрии.

• Гонка триллионов параметров - это был объездной путь. Индустрия коллективно ошиблась, экстраполируя ранние Scaling Law за пределы их применимости.
• Scaling не умер – он стал многомерным. Теперь прорывы будут идти не от увеличения модели, а от умных стратегий пост‑тренировки, deeper reasoning во время инференса, эффективного использования MoE.
• Главная метрика будущего - «интеллект на доллар».
В тч писал об этом тут, но для инференса, а почему бы и не быть метрикой для эффективности обучения. 👍

Итого, GLM‑5.3 достигла топ‑уровня с наименьшей стоимостью за задачу среди всех frontier‑моделей.

Открытым остаётся вопрос: существует ли "Chinchilla для RL" ? Когда мы узнаем оптимальное соотношение для пост‑тренировки – это станет следующим большим открытием.

Мое мнение.
Это не просто новость о китайской модели. Это открытое заявление о смене парадигмы, которую все ждали.

Раньше мы сравнивали модели по количеству параметров, как мегапиксели в фотоаппаратах. Теперь это бессмысленно. Важно, как вы используете compute - на претрен, на RL, на инференс.
Zhipu показала, что можно догнать лидеров, не увеличивая модель, а просто лучше её дообучая. И это открывает дорогу для многих игроков с ограниченными бюджетами.

К сожалению мы видим, как некоторые игроки на рынке играют в большие веса, но по качеству на деле не лучше GPT 120b oss или китайских моделей до 100B. При этом они имеют размер несколько раз больше... Но проблема там не только в этом... Однако об этом, мы тоже уже говорили тут в канале и в моих выступлениях.

Важно, какие выводы будут сделаны сегодня, иначе завтра топ модели очень быстро убегут от вас за счёт: процессов разработки и рнд, политики внутри компании, инженерии, данных и петли самоулучшения.
Please open Telegram to view this post
VIEW IN TELEGRAM
5🔥258👍3💅3
Dealer.AI pinned «Про культурный код моделей и соответствие каким-то ценностям LLM. Мне много стали присылать в лс такую новость. 😬 Тлдр. Модели AI будут проверять на соответствие культурным ценностям, для получения звания национальных или суверенных. 😐 Я очень много писал…»
Недавно, я выступал на ML Urban от МТС, где рассказывал про агентную экономику, как будущее ИИ в ИТ ландшафте бизнеса: реклама, поиск, рекомендательные системы и покупки. Об этом многое есть в материалах: и в канале, и в подкастах. 😜

Материал с конфы, кстати, появился на Ict.moscow прям вместе с презой. 😎

Здорово, что коллеги по индустрии из MWS взяли следом на щит эту тему. Ведь, действительно, мы находимся в чистом поле, где ландшафт a2a/b2a экономики только формируется и у каждого есть шанс сделать Yandex 2.0 moment. А пока агентной экономике "некуда приземляться". 😐

В целом, ожидаю, что движение будет взаимное: поставщики услуг и товаров, поисковики и протоколы для агентов, биржи агентов, а также финансовые инструменты для безопасной оплаты. Выбирайте сами, что бы вы хотели оседлать. 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍12🔥83
Как тестировать AI агентов: от роутинга до траекторий и ответов. 🤖

Помню, как читал лекции по RAG и говорил, что агентные эвалы схожи, но более сложные из-за недетрменированности флоу.
Теперь вышел достойный обзор, как можно это делать удобно. Ниже представлен разбор статьи инженера Postgres AI Hybrid Manager.

🔥 Проблема.
В RAG у вас ~четыре измерения: данные, кандидатогенератор, реранкер и ответ LLM. Но с агентами интереснее.
Тестировать AI-агента как обычный REST API (статус-коды и JSON-схемы) - бесполезно. LLM недетерминированы: они могут правильно решить задачу, но пойти другим путём, или наоборот – красиво ответить (увернуться, сглюкать), но пропустить главное.

Автор статьи прошёл путь от простых проверок к сложной системе и щедро поделился граблями. Вот этапы этого пути 👇

Этап 1: Роутинг - самая дешёвая и быстрая проверка. Убеждаемся, что запрос пользователя попал в нужный скилл или инструмент. По сути это аналог классификации интентов.

Метод оценки: Детерминированное сравнение строк (ожидаемый инструмент = фактический).
+ Ловит критичные баги на старте.
- Правильный роутинг НЕ гарантирует правильный ответ.

Этап 2: Полнота задачи (TCR - Task Completion Rate)
Здесь вводится как инструмент – LLM as J.
Вы пишете рубрику - метрики на на естественном языке, а другой LLM ставит оценку (например, от 0 до 1) за финальный ответ. Порог прохождения теста обычно ставят 0.7–0.85.

Этап 3: Многошаговые диалоги
Жизнь - это диалог, а не один запрос. Тесты учатся поддерживать сессию, склеивать историю и оценивать не только итог, но и корректность уточняющих вопросов.

Этап 4: Траектории - здесь проверяется не только «что сказал агент», но и «как он шёл».
Порядок вызовов инструментов, переданные параметры, изменения состояния системы. Это позволяет поймать ситуацию, когда финальный ответ хорош, но внутри агент «сходил» за данными в обход логики или нарушил политики безопасности.

Оба пункта 3 и 4 проводятся также, как ранее для оценки ассистентов - диалог идёт с накоплением по фразно, трейсы тоже, таким образом каждый квант действия проходит оценку на релевантность и полноту. См SSA. Берете эту логику и кладёте в рубрики для судьи. Далее оцениваете именно не число траекторий, шагов, фраз, а контекстуальную релевантность и итоговые ответы.

⚙️ Стек автора:
- deepeval для написания метрик и запуска LLM-судей.
- Langfuse для наблюдаемости.

Каждый тест - это трейс. Если тест упал, вы сразу видите в Langfuse, что пошло не так: промпт, выбор инструмента или ответ судьи.

📊 БОЛЬ - ЭТО ДАННЫЕ
Автор подчёркивает, что тестировать без корзин оценки или как я говорю "на глазок"- преступление против человечества качества. Агент покажет 90% прохождения, но в бою провалится. Это будет точечная оценка, а не стат значимая выборка.

Решение:
Использовать тестовое окружение в БД (тк тут ребята из Postgres и задача SQL агент) и проводить мутационное тестирование – намеренно удалять индексы, дублировать поля и ломать данные, чтобы проверить, как агент справляется с «грязным» окружением.

Особое внимание уделено тестированию под разный масштаб моделей.
Система поддерживает модели разного размера (S, M, L, XL) для офлайн/и onprem AI.
Умный вывод об оценке:
Маленькая модель не должна видеть все инструменты (ей не хватит контекста). Поэтому фреймворк должен быть «Tier-Aware», когда один запрос для модели S должен тестироваться по одним ожиданиям (отказ или простой ответ), а для модели XL по другим (сложная аналитика).

Эта статья мастрид для всех, кто строит Production AI. Сохраните, чтобы не потерять.

И делитесь в комментариях тем, как вы измеряет е2е пайпы с агентами 👇👇👇
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥19👍96
Dealer.AI pinned «Скейлить веса недостаточно. Теперь не только слова от 📦 Scaling Law умер? Нет, он просто стал сложнее (с). Я очень много говорил о том, что недостаточно тупо скейлить веса. Также описывал возможные комбо текущих подходов, и тем самым, как делать прорывы…»
Метод отжига от зацикливания вашего агента 😗

Сижу я тут в одном чатике. И вижу сабж от @asboltenko:
К слову хотел поделиться лайфхак, на случай если пропустили, если и когда агенты начинают тупить и топтаться на месте в решении какой-то задачи, им нужно сказать "проведи исследование", "поищи информацию", тогда у них включается режим исследования и они выходят за рамки своих знаний и начинают искать и изучать информацию и результат резко улучшается.


И тут я думаю, так это же похоже на метод отжига в мат.оптимизации. Если только немножко его доделать под LLM и агентов. 🧠

Ну действительно, представьте, вы уже знакомы с self refining и OPRO/GEPA методами самоулучшения рассуждений и промптов. В них мысль проста, ваша среда - политика это и есть модель, она порождает на контекст генерации, значит её можно bbox оптимизировать направленно при помощи управления промптами и/ или параметрами генерации. Таким образом, мы живём в пространстве возможных генераций от входа.

Теперь идём дальше, вот цитата выше - агент застрял в решении,те сошёлся в локальном минимуме возможных исходов генераций.

Как его оттуда сдвинуть?

1. Смена температуры.
Когда вы говорите "проведи исследование", вы переключаете агента из режима greedy decoding в режим исследования - аналог поиска в глубину против поиска в ширину.

Чтобы усилить эффект, можно явно попросить: "Сгенерируй 3 самых диких/неочевидных гипотезы, даже если они ошибочные" - это тот самый "шаг назад в менее выгодное решение", который выбивает из локальной колеи рассуждений.

Кстати, мы люди, также делаем порой. Говорим себе стоп, давай начнём сначала или сделаем шаг назад.

2. Декомпозиция шага назад. Метод отжига требует времени на "остывание". Поэтому после команды "исследовать" обязательно нужно дать лимит:" ..выдели на это 5 итераций размышлений, а затем вернись к исходной задаче и предложи финальный план". Иначе агент может улететь в бесконечный поиск и перерасход токенов.

3. Критическая разница с мат. оптимизацией. В математике отжиг принимает плохое решение на основе функции вероятности. В LLM мы не можем доверить случайность - вместо этого просим сменить перспективу. Это и дает тот же эффект перепрыгивания ямы, но детерминированно и осмысленно.

Лайфхак вдогонку. Если агент топчется, скажите не просто исследуй, а "составь карту неопределённости" – перечисли, чего именно тебе не хватает для решения. Это принудительно расширяет границы знаний перед тем, как начать гуглить, и резко сокращает галлюцинации во время этого отжига.

Однако правило, как понять, что агент застрял всеравно придётся написать. 👍

И да, что метод из цитаты. Что улучшение отжига требует больше токенов, но может спасти вас от траты того же числа токенов на тупик и зацикливания. 🧠
Please open Telegram to view this post
VIEW IN TELEGRAM
17😁8🔥7
Неделя MCP от ВкусВилл.🤗

В эту неделю наше решение прям удостоилось широкого внимания, спасибо Вам за это. 🤗

Вот только несколько классных мнений и shorts. 😜 А их ещё больше!

На этой волне чуток поговорили с моим товарищем по ИИ цеху, и вот его взгляд на тенденции.

В общем, жду от Вас в комментариях, ваш опыт работы с нашим MCP и чтобы вы хотели ещё добавить?
👇👇👇
Please open Telegram to view this post
VIEW IN TELEGRAM
7🔥4👏31
😁27💯7😈2
Dealer.AI pinned «Как тестировать AI агентов: от роутинга до траекторий и ответов. 🤖 Помню, как читал лекции по RAG и говорил, что агентные эвалы схожи, но более сложные из-за недетрменированности флоу. Теперь вышел достойный обзор, как можно это делать удобно. Ниже представлен…»
Все компакты придуманы, все кодировки использованы. 🫤

Вот так бы можно было бы назвать видео беседы Гранта Сандерсона (создателя канала 3Blue1Brown) и Алока Пураника, исследователя из Jane Street. В нём они разбирают статью Алока о применении теории групп к позиционным кодировкам в трансформерах. 😐

Но не дай себя обмануть, тензорная алгебра и теория групп не так ужасна, тк ребята всегда славились наглядным разбором тем. 😜

Вот основные тезисы этого разбора:

🎯 Главная идея - сужение пространства поиска.

Стандартный механизм self-attention сам по себе не учитывает порядок слов, те он инвариантен к перестановкам. Поэтому для учёта позиции токенов используются позиционные кодировки (Rope, Alibi, abs, sin и тп).

Алок задался вопросом: "Сколько вообще существует разумных способов закодировать позицию?"

Оказывается, если наложить всего несколько естественных ограничений, пространство возможных решений неожиданно сужается.

Математический аппарат. Теория групп. 😬

Ключевое ограничение - трансляционная инвариантность, это когда сдвиг последовательности на t шагов должен просто сдвигать кодировки, а не менять их суть. Формализовав это требование, Алок пришёл к выводу, что все допустимые кодировки должны формировать однопараметрическую матричную группу вида exp(t×M). Это ограничивает всё множество решений до конкретного семейства матричных экспонент. 🤔

🔗 Связь с существующими методами.

Оказывается, самые популярные на практике методы позиционного кодирования являются частными случаями этого общего математического правила:

· RoPE (Rotary Positional Embedding): Использует вращающие матрицы.

· ALiBi (Attention with Linear Biases): Применяет линейные штрафы к вниманию.

Оба метода естественно вытекают из найденного Алоком общего решения. 🧠

💎 Самый интересный вывод. "Все хорошие идеи уже придуманы". 🤔 И являются семейством одного парамптрического множества и уже используются. Ищите новые варики в другом месте 💪

Все это блестящий пример того, как фундаментальная математика (теория групп) может не только объяснить эмпирически успешные решения (RoPE, ALiBi), но и строго доказать, что других хороших вариантов просто не существует. Покрайне мере в такой постановке моделирования. 🫡

Так что... Stay tuned. 🦾
Please open Telegram to view this post
VIEW IN TELEGRAM
9👍5