ИИ-агенты лучше редактируют код, когда репозиторий описан через поведение, а не файлы
В статье Harness Handbook исследователи предложили отдельную «карту» agent harness: она описывает, что делает система, и связывает каждое поведение с конкретными местами в коде.
Проблема знакомая: промпты, tools, memory и execution часто размазаны по десяткам функций и файлов. Агент понимает, что нужно изменить, но легко пропускает часть реализации.
Handbook строится автоматически через static analysis + LLM, хранит три уровня детализации, связи через shared state и обновляется после изменений. Агент сначала находит нужное поведение, затем постепенно спускается до конкретного кода и перепроверяет его по актуальному репозиторию.
На задачах изменения Codex качество планов выросло с 28,3% до 38,3%, а на Terminus-2 с 26,7% до 45,6%. При этом расход planner-токенов снизился на 12,7% и 8,6% соответственно. Все 24 сравнения Recall/Precision/F1 по поиску мест для правок также улучшились.
Важно: исследование измеряло качество планов изменений, а не успешность уже выполненных патчей.
Похоже, для coding agents хороший навигатор по архитектуре иногда полезнее, чем ещё больше контекста.
Paper:
https://arxiv.org/abs/2607.13285
В статье Harness Handbook исследователи предложили отдельную «карту» agent harness: она описывает, что делает система, и связывает каждое поведение с конкретными местами в коде.
Проблема знакомая: промпты, tools, memory и execution часто размазаны по десяткам функций и файлов. Агент понимает, что нужно изменить, но легко пропускает часть реализации.
Handbook строится автоматически через static analysis + LLM, хранит три уровня детализации, связи через shared state и обновляется после изменений. Агент сначала находит нужное поведение, затем постепенно спускается до конкретного кода и перепроверяет его по актуальному репозиторию.
На задачах изменения Codex качество планов выросло с 28,3% до 38,3%, а на Terminus-2 с 26,7% до 45,6%. При этом расход planner-токенов снизился на 12,7% и 8,6% соответственно. Все 24 сравнения Recall/Precision/F1 по поиску мест для правок также улучшились.
Важно: исследование измеряло качество планов изменений, а не успешность уже выполненных патчей.
Похоже, для coding agents хороший навигатор по архитектуре иногда полезнее, чем ещё больше контекста.
Paper:
Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editablehttps://arxiv.org/abs/2607.13285
❤11🤔3
✔️ Карпати говорит, что модели «неровные»: где-то рефакторят кодовую базу, где-то путаются в простом. В агентных системах это особенность, которую стоит закладывать в архитектуру заранее – успевайте зарегистрироваться
Агент, который отлично пишет код, не обязательно сам понимает, что не должен читать .env-файл соседнего проекта или дёргать внешний API без проверки. Эта неровность – не баг одной модели, а системное свойство того, как агенты сейчас устроены. Именно поэтому проектирование агентных систем – отдельная инженерная дисциплина.
ШАД с 27 по 31 июля проводит AI Agents Security Week с экспертами Яндекса – про то, как эту неровность закрывать архитектурой, а не надеждой.
В программе:
• автономные агенты vs LLM – в чём разница с точки зрения угроз
• безопасный доступ к инструментам и инфраструктуре
• защита персональных и корпоративных данных
• уязвимости агентных систем
• реальные проблемы, с которыми уже столкнулись команды ИИ-продуктов
Подойдёт ML-разработчикам, DevOps/DevSecOps-инженерам, техлидам, архитекторам, студентам старших курсов. Пригодится понимание SDL и базовый опыт вайбкодинга.
5 вечерних занятий, отборочное тестирование и итоговая работа для сертификата.
До окончания приёма заявок (27 июля, включительно) осталось совсем немного времени – не упустите возможность. Регистрация по ссылке.
Агент, который отлично пишет код, не обязательно сам понимает, что не должен читать .env-файл соседнего проекта или дёргать внешний API без проверки. Эта неровность – не баг одной модели, а системное свойство того, как агенты сейчас устроены. Именно поэтому проектирование агентных систем – отдельная инженерная дисциплина.
ШАД с 27 по 31 июля проводит AI Agents Security Week с экспертами Яндекса – про то, как эту неровность закрывать архитектурой, а не надеждой.
В программе:
• автономные агенты vs LLM – в чём разница с точки зрения угроз
• безопасный доступ к инструментам и инфраструктуре
• защита персональных и корпоративных данных
• уязвимости агентных систем
• реальные проблемы, с которыми уже столкнулись команды ИИ-продуктов
Подойдёт ML-разработчикам, DevOps/DevSecOps-инженерам, техлидам, архитекторам, студентам старших курсов. Пригодится понимание SDL и базовый опыт вайбкодинга.
5 вечерних занятий, отборочное тестирование и итоговая работа для сертификата.
До окончания приёма заявок (27 июля, включительно) осталось совсем немного времени – не упустите возможность. Регистрация по ссылке.
❤3👍3🔥1
📚 Бесплатный учебник по теории игр - 578 страниц
Game Theory от Giacomo Bonanno — большой open-source учебник по некооперативной теории игр.
Внутри:
* основы теории игр и стратегического взаимодействия;
* равновесия и принятие решений;
* 165 задач с решениями;
* 163 иллюстрации;
* материал на стыке математики, экономики и Computer Science.
Хорошая база для тех, кто занимается ML, Multi-Agent Systems, математикой и алгоритмами.
📖 Скачать PDF: https://arxiv.org/pdf/1512.06808
#GameTheory #Mathematics #Statistics #Probability #MachineLearning
Game Theory от Giacomo Bonanno — большой open-source учебник по некооперативной теории игр.
Внутри:
* основы теории игр и стратегического взаимодействия;
* равновесия и принятие решений;
* 165 задач с решениями;
* 163 иллюстрации;
* материал на стыке математики, экономики и Computer Science.
Хорошая база для тех, кто занимается ML, Multi-Agent Systems, математикой и алгоритмами.
📖 Скачать PDF: https://arxiv.org/pdf/1512.06808
#GameTheory #Mathematics #Statistics #Probability #MachineLearning
❤6👍3🔥2👎1
🥇 Opus 5 порвал международную математическую олимпиаду 2026: набрав 42 из 42 баллов.
Международная математическая олимпиада завершилась всего несколько дней назад. Порог золотой медали в этом году составил 29 баллов, а Opus 5, по опубликованным результатам тестирования, набрал абсолютный максимум — 42/42.
И это хорошо показывает, насколько бешено сейчас движется прогресс.
Ещё год назад результаты OpenAI и Google на IMO воспринимались как огромный прорыв: модели впервые добрались до уровня золотой медали. Но тогда речь шла о специальных внутренних системах, отдельно заточенных под такие задачи и недоступных обычным пользователям. Да и идеального результата у них не было.
Теперь планка снова поднялась: коммерчески доступная модель проходит одну из самых сложных школьных олимпиад мира без единой потерянной точки.
Причём IMO — это не тест на скорость вычислений. Задачи требуют нестандартных идей, построения доказательств и длинных цепочек рассуждений.
Самое забавное, как быстро меняется восприятие таких новостей. Вчера само «золото IMO у ИИ» звучало почти фантастически. Сегодня 42/42 уже воспринимается как очередной апдейт.
Интересно, что будет считаться впечатляющим через год.
https://www.imo-official.org/results/individual/year/2026/
Международная математическая олимпиада завершилась всего несколько дней назад. Порог золотой медали в этом году составил 29 баллов, а Opus 5, по опубликованным результатам тестирования, набрал абсолютный максимум — 42/42.
И это хорошо показывает, насколько бешено сейчас движется прогресс.
Ещё год назад результаты OpenAI и Google на IMO воспринимались как огромный прорыв: модели впервые добрались до уровня золотой медали. Но тогда речь шла о специальных внутренних системах, отдельно заточенных под такие задачи и недоступных обычным пользователям. Да и идеального результата у них не было.
Теперь планка снова поднялась: коммерчески доступная модель проходит одну из самых сложных школьных олимпиад мира без единой потерянной точки.
Причём IMO — это не тест на скорость вычислений. Задачи требуют нестандартных идей, построения доказательств и длинных цепочек рассуждений.
Самое забавное, как быстро меняется восприятие таких новостей. Вчера само «золото IMO у ИИ» звучало почти фантастически. Сегодня 42/42 уже воспринимается как очередной апдейт.
Интересно, что будет считаться впечатляющим через год.
https://www.imo-official.org/results/individual/year/2026/
❤10😁5👍4
Forwarded from Data Science. SQL hub
🤯 OPUS 5 ЗА 10 МИНУТ УДАЛИЛ ВСЮ БАЗУ ДАННЫХ, А ПОТОМ ВЕЖЛИВО ПРИЗНАЛ ОШИБКУ
Пользователь Reddit решил протестировать Claude Code. После одного запроса агент уничтожил базу проекта и сообщил: «Это моя вина, и я должен немедленно вам об этом сказать».
Позже Gemini 3.6 помог восстановить 96 страниц, ещё 21 пришлось пересоздавать. Автор уточнил, что это был тестовый проект с небольшим числом пользователей, поэтому последствия оказались не критичными.
Самое показательное: модель получила режим Always Allow, доступ к данным и возможность выполнять разрушительные команды без подтверждения.
Историяпро разработчика, который дал автономному агенту права администратора без нормальных бэкапов и ограничений.
ИИ-агенту в проде нужны минимальные права, отдельное окружение, снапшоты и ручное подтверждение любых DROP, DELETE и миграций.
Иначе вайб-кодинг быстро превращается в вайб-восстановление базы.
https://www.reddit.com/r/Anthropic/comments/1v9iurd/and_just_like_that_opus_5_ultracode_wipes_the/?solution=44899d8f83b98cbf44899d8f83b98cbf&js_challenge=1&token=7afd7253fec22262ff1c52b1703fe9ec98100ded527c5fb6747eed7511fb37a6&jsc_orig_r=
Пользователь Reddit решил протестировать Claude Code. После одного запроса агент уничтожил базу проекта и сообщил: «Это моя вина, и я должен немедленно вам об этом сказать».
Позже Gemini 3.6 помог восстановить 96 страниц, ещё 21 пришлось пересоздавать. Автор уточнил, что это был тестовый проект с небольшим числом пользователей, поэтому последствия оказались не критичными.
Самое показательное: модель получила режим Always Allow, доступ к данным и возможность выполнять разрушительные команды без подтверждения.
Историяпро разработчика, который дал автономному агенту права администратора без нормальных бэкапов и ограничений.
ИИ-агенту в проде нужны минимальные права, отдельное окружение, снапшоты и ручное подтверждение любых DROP, DELETE и миграций.
Иначе вайб-кодинг быстро превращается в вайб-восстановление базы.
https://www.reddit.com/r/Anthropic/comments/1v9iurd/and_just_like_that_opus_5_ultracode_wipes_the/?solution=44899d8f83b98cbf44899d8f83b98cbf&js_challenge=1&token=7afd7253fec22262ff1c52b1703fe9ec98100ded527c5fb6747eed7511fb37a6&jsc_orig_r=
👎8👍4😁4🔥3❤2🤔1🤩1
Forwarded from Machinelearning
В проморолике модель часами работает над проектированием чипов, а затем переходит к задачам из биологии.
Выбор выглядит намеренным: полупроводники остаются одним из самых болезненных направлений для Китая, а США продолжают ограничивать поставки передовых ускорителей и оборудования для их производства.
Китай намерен закрывать критические технологические пробелы собственными моделями, вычислительной инфраструктурой и чипами.
Сцены с белками можно воспринимать как намёк на AlphaFold и амбицию конкурировать с американскими компаниями уже на уровне научных открытий.
@ai_machinelearning_big_data
#qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6👍5❤4😁1
Machinelearning
Текущая ситуация с ИИ🇨🇳
😁19👍7❤5🤔3
⚡️ ИИ уже начал перераспределять стоимость компаний на фондовом рынке
Исследователи проанализировали 380 трлн реально использованных токенов более чем у 400 моделей в OpenRouter. Выборка охватывает около 2% мирового ежемесячного потребления ИИ.
Из роста токенов, расходов и числа пользователей авторы собрали единый AI Factor, а затем рассчитали для публичных компаний AI beta - насколько движение их акций связано с реальным ростом спроса на ИИ.
Компании с высокой AI beta впоследствии показывали более высокую доходность. Стратегия, покупавшая наиболее чувствительные к ИИ компании и продававшая наименее чувствительные, приносила в среднем 0,641% в неделю. Особенно сильный эффект связан с закрытыми моделями, платными и опытными пользователями, а также длинными промптами. Для случайного использования и open-weight моделей такой премии не обнаружили.
Эффект выходит далеко за пределы технологического сектора. Рынок положительнее оценивает ИИ в профессиях, где много общения, обучения и взаимодействия с людьми, и осторожнее - в аналитических, научных и операционных задачах.
Получается, токены становятся новым экономическим индикатором. По реальному потреблению моделей уже можно оценивать, какие компании и профессии инвесторы считают будущими победителями ИИ-экономики.
Пока это препринт, а найденная зависимость не доказывает причинность. Но рынок, похоже, начал учитывать ИИ раньше, чем большинство компаний научилось измерять его влияние.
Исследование: AI Premium
arxiv.org/abs/2606.30583v2
Исследователи проанализировали 380 трлн реально использованных токенов более чем у 400 моделей в OpenRouter. Выборка охватывает около 2% мирового ежемесячного потребления ИИ.
Из роста токенов, расходов и числа пользователей авторы собрали единый AI Factor, а затем рассчитали для публичных компаний AI beta - насколько движение их акций связано с реальным ростом спроса на ИИ.
Компании с высокой AI beta впоследствии показывали более высокую доходность. Стратегия, покупавшая наиболее чувствительные к ИИ компании и продававшая наименее чувствительные, приносила в среднем 0,641% в неделю. Особенно сильный эффект связан с закрытыми моделями, платными и опытными пользователями, а также длинными промптами. Для случайного использования и open-weight моделей такой премии не обнаружили.
Эффект выходит далеко за пределы технологического сектора. Рынок положительнее оценивает ИИ в профессиях, где много общения, обучения и взаимодействия с людьми, и осторожнее - в аналитических, научных и операционных задачах.
Получается, токены становятся новым экономическим индикатором. По реальному потреблению моделей уже можно оценивать, какие компании и профессии инвесторы считают будущими победителями ИИ-экономики.
Пока это препринт, а найденная зависимость не доказывает причинность. Но рынок, похоже, начал учитывать ИИ раньше, чем большинство компаний научилось измерять его влияние.
Исследование: AI Premium
arxiv.org/abs/2606.30583v2
❤3👍3🔥2
Forwarded from Java
🔥 JetBrains открыла исходники KotlinLLM - Kotlin-код, который дописывает себя во время выполнения
KotlinLLM - исследовательский плагин для IntelliJ IDEA, который позволяет делегировать часть логики приложения LLM прямо во время запуска.
Пример:
Когда приложение сталкивается с новым сценарием, плагин:
1. получает runtime-значения и типы;
2. просит LLM сгенерировать обновление;
3. компилирует новый код;
4. горячо перезагружает класс;
5. повторно выполняет исходный вызов.
Главная идея - модель не вызывается постоянно. Успешное решение сохраняется как обычный Kotlin-файл, который можно проверить, изменить, закоммитить и запускать дальше уже без LLM.
Сейчас доступны два основных механизма:
-
-
Пока это исследовательский прототип для Kotlin/JVM. Проект распространяется по лицензии Apache 2.0.
GitHub:
https://github.com/JetBrains-Research/kotlinllm-plugin
@javatg
KotlinLLM - исследовательский плагин для IntelliJ IDEA, который позволяет делегировать часть логики приложения LLM прямо во время запуска.
Пример:
val apiUrl: String = asLlm(
"JetBrains/kotlin",
hint = "Верни URL для GitHub Issues API"
)
val service: GithubService = mockLlm()
Когда приложение сталкивается с новым сценарием, плагин:
1. получает runtime-значения и типы;
2. просит LLM сгенерировать обновление;
3. компилирует новый код;
4. горячо перезагружает класс;
5. повторно выполняет исходный вызов.
Главная идея - модель не вызывается постоянно. Успешное решение сохраняется как обычный Kotlin-файл, который можно проверить, изменить, закоммитить и запускать дальше уже без LLM.
Сейчас доступны два основных механизма:
-
asLlm<F, T>() - преобразует значение одного типа в другой;-
mockLlm<T>() - генерирует реализацию интерфейса и развивает её по мере появления новых сценариев.Пока это исследовательский прототип для Kotlin/JVM. Проект распространяется по лицензии Apache 2.0.
GitHub:
https://github.com/JetBrains-Research/kotlinllm-plugin
@javatg
👍4🔥4❤3🤯2👏1
🚨 Белый дом подготовил новые правила проверки передовых ИИ-моделей
Разработчики закрытых моделей смогут добровольно передавать их правительству США за 30 дней до публичного релиза. Проверка будет проходить в защищённой среде с жёстким контролем доступа и журналированием каждого пользователя.
Главное исключение — модели с открытыми весами. Правила распространяются только на закрытые продукты и прямо не должны ограничивать свободно скачиваемые веса после релиза.
На презентацию пригласили OpenAI, Anthropic, Google, Meta, Nvidia и другие крупные компании. Проверять модели планируют совместно с NSA и другими ведомствами на предмет рисков для национальной безопасности.
Но вопросов пока больше, чем ответов:
— что считать «передовой» моделью, не определено;
— критерии угрозы национальной безопасности не раскрыты;
— сам документ публиковать не собираются;
— неизвестно, кто войдёт в список доверенных партнёров;
— небольшие разработчики фактически остаются за пределами процесса.
Компании также попросили предоставлять почти готовые продукты, а не ранние версии. В результате крупные лаборатории получат прямой канал взаимодействия с государством, пока остальные даже не знают точных правил игры.
wsj.com/tech/ai/white-houses-ai-guidelines-exempt-u-s-open-models-from-government-review-74924eb8
Разработчики закрытых моделей смогут добровольно передавать их правительству США за 30 дней до публичного релиза. Проверка будет проходить в защищённой среде с жёстким контролем доступа и журналированием каждого пользователя.
Главное исключение — модели с открытыми весами. Правила распространяются только на закрытые продукты и прямо не должны ограничивать свободно скачиваемые веса после релиза.
На презентацию пригласили OpenAI, Anthropic, Google, Meta, Nvidia и другие крупные компании. Проверять модели планируют совместно с NSA и другими ведомствами на предмет рисков для национальной безопасности.
Но вопросов пока больше, чем ответов:
— что считать «передовой» моделью, не определено;
— критерии угрозы национальной безопасности не раскрыты;
— сам документ публиковать не собираются;
— неизвестно, кто войдёт в список доверенных партнёров;
— небольшие разработчики фактически остаются за пределами процесса.
Компании также попросили предоставлять почти готовые продукты, а не ранние версии. В результате крупные лаборатории получат прямой канал взаимодействия с государством, пока остальные даже не знают точных правил игры.
wsj.com/tech/ai/white-houses-ai-guidelines-exempt-u-s-open-models-from-government-review-74924eb8
👍6🔥3😁1
⚡️ PDF-пайплайны не должны начинаться с OCR.
Что он делает:
- классифицирует PDF;
- извлекает структурированный Markdown там, где это возможно;
- определяет страницы, которые нельзя нормально разобрать обычным способом;
- отправляет на OCR только проблемные страницы.
Главная идея - не прогонять через OCR весь документ по умолчанию.
На fast path здесь нет:
- LLM;
- внешних API;
- SaaS;
- сетевых зависимостей.
Это особенно полезно для больших PDF-пайплайнов, где OCR обычно становится самым дорогим и медленным этапом.
Вместо:
получаем:
Меньше вычислений, ниже latency и проще контролировать приватность данных.
🔗 github.com/firecrawl/pdf-inspector
#Rust #PDF #OCR #OpenSource #DataEngineering
pdf-inspector - локальный инструмент на Rust, который сначала пытается понять, что вообще находится внутри PDF, и только потом решает, какие страницы действительно требуют тяжёлой обработки.Что он делает:
- классифицирует PDF;
- извлекает структурированный Markdown там, где это возможно;
- определяет страницы, которые нельзя нормально разобрать обычным способом;
- отправляет на OCR только проблемные страницы.
Главная идея - не прогонять через OCR весь документ по умолчанию.
На fast path здесь нет:
- LLM;
- внешних API;
- SaaS;
- сетевых зависимостей.
Это особенно полезно для больших PDF-пайплайнов, где OCR обычно становится самым дорогим и медленным этапом.
Вместо:
PDF → OCR всех страниц → парсингполучаем:
PDF → классификация → native extraction → OCR только сложных страницМеньше вычислений, ниже latency и проще контролировать приватность данных.
🔗 github.com/firecrawl/pdf-inspector
#Rust #PDF #OCR #OpenSource #DataEngineering
❤8👍6
Исследуйте сферу AI в T-Lab
Т-Образование зовет участников в проект T-Lab. Это годовая программа научно-исследовательской работы в области AI. Станьте соавтором научных открытий, которые меняют индустрию!
Вы сможете выбрать один из проектов в сфере AI и участвовать в исследовании на всех этапах. Итоги вашей работы могут лечь в основу научных публикаций и стать вектором новых продуктов.
Кого ждут в T-Lab?
Студентов бакалавриата и магистратуры, недавних выпускников технических направлений.
Участники получат:
🔴 Официальное трудоустройство с зарплатой.
🔴 Доступ к ресурсам бигтеха для исследований.
🔴 Возможность получить оффер в IT-компанию.
Узнайте больше и оставьте заявку до 23 августа по ссылке
Т-Образование зовет участников в проект T-Lab. Это годовая программа научно-исследовательской работы в области AI. Станьте соавтором научных открытий, которые меняют индустрию!
Вы сможете выбрать один из проектов в сфере AI и участвовать в исследовании на всех этапах. Итоги вашей работы могут лечь в основу научных публикаций и стать вектором новых продуктов.
Кого ждут в T-Lab?
Студентов бакалавриата и магистратуры, недавних выпускников технических направлений.
Участники получат:
Узнайте больше и оставьте заявку до 23 августа по ссылке
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍1👎1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
⚡️ Qwen выпустил мультимодальный tool layer для AI-агентов
Идея в том, чтобы мультимодальные возможности подключались к агенту как набор инструментов, а не были жёстко зашиты в конкретную модель.
Агент, запущенный внутри Claude Code, Codex, Qwen Code, Gemini CLI или другого harness, может сам обнаружить нужный capability, вызвать его и встроить результат в более длинный workflow.
GitHub-репозиторий при этом устроен как коллекция отдельных plugins/capabilities.
Например, базовый плагин даёт агенту инструменты вроде:
- read_image
- read_video
- visualize
- OCR
- object grounding
- segmentation
- speech transcription
- cropping
То есть вместо схемы:
агент → одна мультимодальная модель
получается:
агент → набор специализированных multimodal tools → цепочка действий
Например, агент может:
1. прочитать изображение;
2. найти нужный объект;
3. вырезать конкретную область;
4. прогнать OCR;
5. сопоставить результат с видео;
6. транскрибировать аудио;
7. собрать всё в единый ответ.
https://github.com/QwenLM/Qwen-MM-Plugins
#AI #Qwen #Agents #Multimodal #ClaudeCode #Codex
Идея в том, чтобы мультимодальные возможности подключались к агенту как набор инструментов, а не были жёстко зашиты в конкретную модель.
Агент, запущенный внутри Claude Code, Codex, Qwen Code, Gemini CLI или другого harness, может сам обнаружить нужный capability, вызвать его и встроить результат в более длинный workflow.
GitHub-репозиторий при этом устроен как коллекция отдельных plugins/capabilities.
Например, базовый плагин даёт агенту инструменты вроде:
- read_image
- read_video
- visualize
- OCR
- object grounding
- segmentation
- speech transcription
- cropping
То есть вместо схемы:
агент → одна мультимодальная модель
получается:
агент → набор специализированных multimodal tools → цепочка действий
Например, агент может:
1. прочитать изображение;
2. найти нужный объект;
3. вырезать конкретную область;
4. прогнать OCR;
5. сопоставить результат с видео;
6. транскрибировать аудио;
7. собрать всё в единый ответ.
https://github.com/QwenLM/Qwen-MM-Plugins
#AI #Qwen #Agents #Multimodal #ClaudeCode #Codex
❤6👍1
⚡️ MatrAIx — инфраструктура, где вместо небольших фокус-групп можно запускать миллиарды виртуальных пользователей с разными характерами, привычками и предпочтениями.
Внутри:
- 8,3 млрд persona-профилей;
- 1 290 характеристик на пользователя;
- 1 010 задач в 25+ сферах — от софта и e-commerce до финансов и медицины;
- 4 среды: опросы, чат-боты, веб и приложения;
- около 1 млн отфильтрованных персон открыты для исследований.
-
Авторы провели 18 189 испытаний, а персон управляли GPT-5.5, Claude Opus 4.8 и Claude Haiku 4.5. В проверках поведение персон соответствовало заданным характеристикам в 91,5% случаев.
Идея мощная: перед запуском продукта можно спросить не 100 тестировщиков, а миллионы виртуальных пользователей — как они отреагируют на цену, задержку, плохой ответ ассистента или новый интерфейс.
По сути, это шаг к масштабным цифровым симуляциям человеческого поведения.
Paper:
https://huggingface.co/papers/2608.04205
#AI #AIAgents #LLM #Research #Simulation
Внутри:
- 8,3 млрд persona-профилей;
- 1 290 характеристик на пользователя;
- 1 010 задач в 25+ сферах — от софта и e-commerce до финансов и медицины;
- 4 среды: опросы, чат-боты, веб и приложения;
- около 1 млн отфильтрованных персон открыты для исследований.
-
Авторы провели 18 189 испытаний, а персон управляли GPT-5.5, Claude Opus 4.8 и Claude Haiku 4.5. В проверках поведение персон соответствовало заданным характеристикам в 91,5% случаев.
Идея мощная: перед запуском продукта можно спросить не 100 тестировщиков, а миллионы виртуальных пользователей — как они отреагируют на цену, задержку, плохой ответ ассистента или новый интерфейс.
По сути, это шаг к масштабным цифровым симуляциям человеческого поведения.
Paper:
https://huggingface.co/papers/2608.04205
#AI #AIAgents #LLM #Research #Simulation
🔥6❤1👍1
🚀 Cognition уже обсуждает оценку выше $40 млрд - всего через 3 месяца после раунда при $26 млрд
По данным Bloomberg, новый раунд может превысить $1 млрд. При этом годовой темп выручки Cognition приближается к $1 млрд - получается оценка примерно в 40 годовых выручек.
Ещё в мае компания сообщала о $492 млн annualized revenue run rate. Если показатель действительно приблизился к $1 млрд, рост всего за несколько месяцев составил около 103%.
Отдельно впечатляет Devin: enterprise-использование росло примерно на 50% месяц к месяцу на протяжении шести месяцев.
Рынок AI-кодинга продолжает разгоняться, а инвесторы, похоже, готовы платить огромную премию за тех, кто уже превращает агентов в реальный бизнес.
https://www.bloomberg.com/news/articles/2026-08-12/ai-startup-cognition-in-new-funding-talks-at-40-billion-value
По данным Bloomberg, новый раунд может превысить $1 млрд. При этом годовой темп выручки Cognition приближается к $1 млрд - получается оценка примерно в 40 годовых выручек.
Ещё в мае компания сообщала о $492 млн annualized revenue run rate. Если показатель действительно приблизился к $1 млрд, рост всего за несколько месяцев составил около 103%.
Отдельно впечатляет Devin: enterprise-использование росло примерно на 50% месяц к месяцу на протяжении шести месяцев.
Рынок AI-кодинга продолжает разгоняться, а инвесторы, похоже, готовы платить огромную премию за тех, кто уже превращает агентов в реальный бизнес.
https://www.bloomberg.com/news/articles/2026-08-12/ai-startup-cognition-in-new-funding-talks-at-40-billion-value
❤2👍2🔥1