Машинное обучение RU
18.1K subscribers
1.76K photos
251 videos
11 files
2.2K links
Все о машинном обучении

админ - @workakkk

@data_analysis_ml - анализ даннных

@ai_machinelearning_big_data - Machine learning

@itchannels_telegram -лучшие ит-каналы

@pythonl - Python

@pythonlbooks- python 📚

@datascienceiot - 📚

РКН: clck.ru/3FmrUw
Download Telegram
ИИ-агенты лучше редактируют код, когда репозиторий описан через поведение, а не файлы

В статье Harness Handbook исследователи предложили отдельную «карту» agent harness: она описывает, что делает система, и связывает каждое поведение с конкретными местами в коде.

Проблема знакомая: промпты, tools, memory и execution часто размазаны по десяткам функций и файлов. Агент понимает, что нужно изменить, но легко пропускает часть реализации.

Handbook строится автоматически через static analysis + LLM, хранит три уровня детализации, связи через shared state и обновляется после изменений. Агент сначала находит нужное поведение, затем постепенно спускается до конкретного кода и перепроверяет его по актуальному репозиторию.

На задачах изменения Codex качество планов выросло с 28,3% до 38,3%, а на Terminus-2 с 26,7% до 45,6%. При этом расход planner-токенов снизился на 12,7% и 8,6% соответственно. Все 24 сравнения Recall/Precision/F1 по поиску мест для правок также улучшились.

Важно: исследование измеряло качество планов изменений, а не успешность уже выполненных патчей.

Похоже, для coding agents хороший навигатор по архитектуре иногда полезнее, чем ещё больше контекста.

Paper: Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable
https://arxiv.org/abs/2607.13285
11🤔3
✔️ Карпати говорит, что модели «неровные»: где-то рефакторят кодовую базу, где-то путаются в простом. В агентных системах это особенность, которую стоит закладывать в архитектуру заранее – успевайте зарегистрироваться 

Агент, который отлично пишет код, не обязательно сам понимает, что не должен читать .env-файл соседнего проекта или дёргать внешний API без проверки. Эта неровность – не баг одной модели, а системное свойство того, как агенты сейчас устроены. Именно поэтому проектирование агентных систем – отдельная инженерная дисциплина.

ШАД с 27 по 31 июля проводит AI Agents Security Week с экспертами Яндекса – про то, как эту неровность закрывать архитектурой, а не надеждой.

В программе:
• автономные агенты vs LLM – в чём разница с точки зрения угроз
• безопасный доступ к инструментам и инфраструктуре
• защита персональных и корпоративных данных
• уязвимости агентных систем
• реальные проблемы, с которыми уже столкнулись команды ИИ-продуктов

Подойдёт ML-разработчикам, DevOps/DevSecOps-инженерам, техлидам, архитекторам, студентам старших курсов. Пригодится понимание SDL и базовый опыт вайбкодинга.

5 вечерних занятий, отборочное тестирование и итоговая работа для сертификата.

До окончания приёма заявок (27 июля, включительно) осталось совсем немного времени – не упустите возможность. Регистрация по ссылке.
3👍3🔥1
📚 Бесплатный учебник по теории игр - 578 страниц

Game Theory от Giacomo Bonanno — большой open-source учебник по некооперативной теории игр.

Внутри:

* основы теории игр и стратегического взаимодействия;
* равновесия и принятие решений;
* 165 задач с решениями;
* 163 иллюстрации;
* материал на стыке математики, экономики и Computer Science.

Хорошая база для тех, кто занимается ML, Multi-Agent Systems, математикой и алгоритмами.

📖 Скачать PDF: https://arxiv.org/pdf/1512.06808

#GameTheory #Mathematics #Statistics #Probability #MachineLearning
6👍3🔥2👎1
🥇 Opus 5 порвал международную математическую олимпиаду 2026: набрав 42 из 42 баллов.

Международная математическая олимпиада завершилась всего несколько дней назад. Порог золотой медали в этом году составил 29 баллов, а Opus 5, по опубликованным результатам тестирования, набрал абсолютный максимум — 42/42.

И это хорошо показывает, насколько бешено сейчас движется прогресс.

Ещё год назад результаты OpenAI и Google на IMO воспринимались как огромный прорыв: модели впервые добрались до уровня золотой медали. Но тогда речь шла о специальных внутренних системах, отдельно заточенных под такие задачи и недоступных обычным пользователям. Да и идеального результата у них не было.

Теперь планка снова поднялась: коммерчески доступная модель проходит одну из самых сложных школьных олимпиад мира без единой потерянной точки.

Причём IMO — это не тест на скорость вычислений. Задачи требуют нестандартных идей, построения доказательств и длинных цепочек рассуждений.

Самое забавное, как быстро меняется восприятие таких новостей. Вчера само «золото IMO у ИИ» звучало почти фантастически. Сегодня 42/42 уже воспринимается как очередной апдейт.

Интересно, что будет считаться впечатляющим через год.

https://www.imo-official.org/results/individual/year/2026/
10😁5👍4
Да, архитектуры LLM становятся все сложнее.

https://t.iss.one/ai_machinelearning_big_data/10602
🔥65👍3
😁317👍4
Forwarded from Data Science. SQL hub
🤯 OPUS 5 ЗА 10 МИНУТ УДАЛИЛ ВСЮ БАЗУ ДАННЫХ, А ПОТОМ ВЕЖЛИВО ПРИЗНАЛ ОШИБКУ

Пользователь Reddit решил протестировать Claude Code. После одного запроса агент уничтожил базу проекта и сообщил: «Это моя вина, и я должен немедленно вам об этом сказать».

Позже Gemini 3.6 помог восстановить 96 страниц, ещё 21 пришлось пересоздавать. Автор уточнил, что это был тестовый проект с небольшим числом пользователей, поэтому последствия оказались не критичными.

Самое показательное: модель получила режим Always Allow, доступ к данным и возможность выполнять разрушительные команды без подтверждения.

Историяпро разработчика, который дал автономному агенту права администратора без нормальных бэкапов и ограничений.

ИИ-агенту в проде нужны минимальные права, отдельное окружение, снапшоты и ручное подтверждение любых DROP, DELETE и миграций.

Иначе вайб-кодинг быстро превращается в вайб-восстановление базы.

https://www.reddit.com/r/Anthropic/comments/1v9iurd/and_just_like_that_opus_5_ultracode_wipes_the/?solution=44899d8f83b98cbf44899d8f83b98cbf&js_challenge=1&token=7afd7253fec22262ff1c52b1703fe9ec98100ded527c5fb6747eed7511fb37a6&jsc_orig_r=
👎8👍4😁4🔥32🤔1🤩1
17😁14👍5🤔2👎1
Forwarded from Machinelearning
⚡️ Alibaba в презентации Qwen3.8 в открыто троллит США и бросает им вызов?

В проморолике модель часами работает над проектированием чипов, а затем переходит к задачам из биологии.

Выбор выглядит намеренным: полупроводники остаются одним из самых болезненных направлений для Китая, а США продолжают ограничивать поставки передовых ускорителей и оборудования для их производства.

Китай намерен закрывать критические технологические пробелы собственными моделями, вычислительной инфраструктурой и чипами.

Сцены с белками можно воспринимать как намёк на AlphaFold и амбицию конкурировать с американскими компаниями уже на уровне научных открытий.

@ai_machinelearning_big_data

#qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6👍54😁1
⚡️ ИИ уже начал перераспределять стоимость компаний на фондовом рынке

Исследователи проанализировали 380 трлн реально использованных токенов более чем у 400 моделей в OpenRouter. Выборка охватывает около 2% мирового ежемесячного потребления ИИ.

Из роста токенов, расходов и числа пользователей авторы собрали единый AI Factor, а затем рассчитали для публичных компаний AI beta - насколько движение их акций связано с реальным ростом спроса на ИИ.

Компании с высокой AI beta впоследствии показывали более высокую доходность. Стратегия, покупавшая наиболее чувствительные к ИИ компании и продававшая наименее чувствительные, приносила в среднем 0,641% в неделю. Особенно сильный эффект связан с закрытыми моделями, платными и опытными пользователями, а также длинными промптами. Для случайного использования и open-weight моделей такой премии не обнаружили.

Эффект выходит далеко за пределы технологического сектора. Рынок положительнее оценивает ИИ в профессиях, где много общения, обучения и взаимодействия с людьми, и осторожнее - в аналитических, научных и операционных задачах.

Получается, токены становятся новым экономическим индикатором. По реальному потреблению моделей уже можно оценивать, какие компании и профессии инвесторы считают будущими победителями ИИ-экономики.

Пока это препринт, а найденная зависимость не доказывает причинность. Но рынок, похоже, начал учитывать ИИ раньше, чем большинство компаний научилось измерять его влияние.

Исследование: AI Premium
arxiv.org/abs/2606.30583v2
3👍3🔥2
Forwarded from Java
🔥 JetBrains открыла исходники KotlinLLM - Kotlin-код, который дописывает себя во время выполнения

KotlinLLM - исследовательский плагин для IntelliJ IDEA, который позволяет делегировать часть логики приложения LLM прямо во время запуска.

Пример:


val apiUrl: String = asLlm(
"JetBrains/kotlin",
hint = "Верни URL для GitHub Issues API"
)

val service: GithubService = mockLlm()


Когда приложение сталкивается с новым сценарием, плагин:

1. получает runtime-значения и типы;
2. просит LLM сгенерировать обновление;
3. компилирует новый код;
4. горячо перезагружает класс;
5. повторно выполняет исходный вызов.

Главная идея - модель не вызывается постоянно. Успешное решение сохраняется как обычный Kotlin-файл, который можно проверить, изменить, закоммитить и запускать дальше уже без LLM.

Сейчас доступны два основных механизма:

- asLlm<F, T>() - преобразует значение одного типа в другой;
- mockLlm<T>() - генерирует реализацию интерфейса и развивает её по мере появления новых сценариев.

Пока это исследовательский прототип для Kotlin/JVM. Проект распространяется по лицензии Apache 2.0.

GitHub:
https://github.com/JetBrains-Research/kotlinllm-plugin

@javatg
👍4🔥43🤯2👏1
🚨 Белый дом подготовил новые правила проверки передовых ИИ-моделей

Разработчики закрытых моделей смогут добровольно передавать их правительству США за 30 дней до публичного релиза. Проверка будет проходить в защищённой среде с жёстким контролем доступа и журналированием каждого пользователя.

Главное исключение — модели с открытыми весами. Правила распространяются только на закрытые продукты и прямо не должны ограничивать свободно скачиваемые веса после релиза.

На презентацию пригласили OpenAI, Anthropic, Google, Meta, Nvidia и другие крупные компании. Проверять модели планируют совместно с NSA и другими ведомствами на предмет рисков для национальной безопасности.

Но вопросов пока больше, чем ответов:

— что считать «передовой» моделью, не определено;
— критерии угрозы национальной безопасности не раскрыты;
— сам документ публиковать не собираются;
— неизвестно, кто войдёт в список доверенных партнёров;
— небольшие разработчики фактически остаются за пределами процесса.

Компании также попросили предоставлять почти готовые продукты, а не ранние версии. В результате крупные лаборатории получат прямой канал взаимодействия с государством, пока остальные даже не знают точных правил игры.

wsj.com/tech/ai/white-houses-ai-guidelines-exempt-u-s-open-models-from-government-review-74924eb8
👍6🔥3😁1
⚡️ PDF-пайплайны не должны начинаться с OCR.

pdf-inspector - локальный инструмент на Rust, который сначала пытается понять, что вообще находится внутри PDF, и только потом решает, какие страницы действительно требуют тяжёлой обработки.

Что он делает:

- классифицирует PDF;
- извлекает структурированный Markdown там, где это возможно;
- определяет страницы, которые нельзя нормально разобрать обычным способом;
- отправляет на OCR только проблемные страницы.

Главная идея - не прогонять через OCR весь документ по умолчанию.

На fast path здесь нет:

- LLM;
- внешних API;
- SaaS;
- сетевых зависимостей.

Это особенно полезно для больших PDF-пайплайнов, где OCR обычно становится самым дорогим и медленным этапом.

Вместо:

PDF → OCR всех страниц → парсинг

получаем:

PDF → классификация → native extraction → OCR только сложных страниц

Меньше вычислений, ниже latency и проще контролировать приватность данных.

🔗 github.com/firecrawl/pdf-inspector

#Rust #PDF #OCR #OpenSource #DataEngineering
8👍6
Исследуйте сферу AI в T-Lab

Т-Образование зовет участников в проект T-Lab. Это годовая программа научно-исследовательской работы в области AI. Станьте соавтором научных открытий, которые меняют индустрию!

Вы сможете выбрать один из проектов в сфере AI и участвовать в исследовании на всех этапах. Итоги вашей работы могут лечь в основу научных публикаций и стать вектором новых продуктов.

Кого ждут в T-Lab?

Студентов бакалавриата и магистратуры, недавних выпускников технических направлений.

Участники получат:
🔴Официальное трудоустройство с зарплатой.
🔴Доступ к ресурсам бигтеха для исследований.
🔴Возможность получить оффер в IT-компанию.

Узнайте больше и оставьте заявку до 23 августа по ссылке
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍1👎1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
⚡️ Qwen выпустил мультимодальный tool layer для AI-агентов

Идея в том, чтобы мультимодальные возможности подключались к агенту как набор инструментов, а не были жёстко зашиты в конкретную модель.

Агент, запущенный внутри Claude Code, Codex, Qwen Code, Gemini CLI или другого harness, может сам обнаружить нужный capability, вызвать его и встроить результат в более длинный workflow.

GitHub-репозиторий при этом устроен как коллекция отдельных plugins/capabilities.

Например, базовый плагин даёт агенту инструменты вроде:

- read_image
- read_video
- visualize
- OCR
- object grounding
- segmentation
- speech transcription
- cropping

То есть вместо схемы:

агент → одна мультимодальная модель

получается:

агент → набор специализированных multimodal tools → цепочка действий

Например, агент может:

1. прочитать изображение;
2. найти нужный объект;
3. вырезать конкретную область;
4. прогнать OCR;
5. сопоставить результат с видео;
6. транскрибировать аудио;
7. собрать всё в единый ответ.


https://github.com/QwenLM/Qwen-MM-Plugins

#AI #Qwen #Agents #Multimodal #ClaudeCode #Codex
6👍1
⚡️ MatrAIx — инфраструктура, где вместо небольших фокус-групп можно запускать миллиарды виртуальных пользователей с разными характерами, привычками и предпочтениями.

Внутри:

- 8,3 млрд persona-профилей;
- 1 290 характеристик на пользователя;
- 1 010 задач в 25+ сферах — от софта и e-commerce до финансов и медицины;
- 4 среды: опросы, чат-боты, веб и приложения;
- около 1 млн отфильтрованных персон открыты для исследований.
-
Авторы провели 18 189 испытаний, а персон управляли GPT-5.5, Claude Opus 4.8 и Claude Haiku 4.5. В проверках поведение персон соответствовало заданным характеристикам в 91,5% случаев.

Идея мощная: перед запуском продукта можно спросить не 100 тестировщиков, а миллионы виртуальных пользователей — как они отреагируют на цену, задержку, плохой ответ ассистента или новый интерфейс.

По сути, это шаг к масштабным цифровым симуляциям человеческого поведения.

Paper:
https://huggingface.co/papers/2608.04205

#AI #AIAgents #LLM #Research #Simulation
🔥61👍1
🚀 Cognition уже обсуждает оценку выше $40 млрд - всего через 3 месяца после раунда при $26 млрд

По данным Bloomberg, новый раунд может превысить $1 млрд. При этом годовой темп выручки Cognition приближается к $1 млрд - получается оценка примерно в 40 годовых выручек.

Ещё в мае компания сообщала о $492 млн annualized revenue run rate. Если показатель действительно приблизился к $1 млрд, рост всего за несколько месяцев составил около 103%.

Отдельно впечатляет Devin: enterprise-использование росло примерно на 50% месяц к месяцу на протяжении шести месяцев.

Рынок AI-кодинга продолжает разгоняться, а инвесторы, похоже, готовы платить огромную премию за тех, кто уже превращает агентов в реальный бизнес.

https://www.bloomberg.com/news/articles/2026-08-12/ai-startup-cognition-in-new-funding-talks-at-40-billion-value
2👍2🔥1