This media is not supported in your browser
VIEW IN TELEGRAM
Сразу три новых флагмана в гонке ИИ
За несколько недель рынок получил GPT-6 Astra, Grok 4.7 и Claude Opus 5.5.
• Grok 4.7 получил более крупную базовую модель, лучше работает с многочасовыми задачами и проверяет собственные результаты. Цена: $2 за вход и $6 за выход.
• Claude Opus 5.5 ориентирован на программирование и автономных агентов. По данным Anthropic, он на 30% быстрее Opus 5 и обходится на 40% дешевле в типичных задачах.
• GPT-6 Astra стал новым флагманом OpenAI для сложной профессиональной работы, исследований и использования инструментов.
Гонка теперь идет не только за интеллект, но и за скорость, автономность и стоимость выполнения реальных задач.
https://x.ai/news/grok-4-7
https://www.anthropic.com/claude-opus-5-5
https://openai.com/index/gpt-6-astra/
За несколько недель рынок получил GPT-6 Astra, Grok 4.7 и Claude Opus 5.5.
• Grok 4.7 получил более крупную базовую модель, лучше работает с многочасовыми задачами и проверяет собственные результаты. Цена: $2 за вход и $6 за выход.
• Claude Opus 5.5 ориентирован на программирование и автономных агентов. По данным Anthropic, он на 30% быстрее Opus 5 и обходится на 40% дешевле в типичных задачах.
• GPT-6 Astra стал новым флагманом OpenAI для сложной профессиональной работы, исследований и использования инструментов.
Гонка теперь идет не только за интеллект, но и за скорость, автономность и стоимость выполнения реальных задач.
https://x.ai/news/grok-4-7
https://www.anthropic.com/claude-opus-5-5
https://openai.com/index/gpt-6-astra/
😁15❤3🔥3👍2
⚡️ Агенты научились улучшать собственную обвязку
RRSI оптимизирует не веса модели, а всю систему вокруг неё: промпты, инструменты, память, управление контекстом и логику выполнения задач.
Обычное самоулучшение быстро подгоняется под тесты. RRSI ограничивает число изменений, отсекает хаки под конкретный бенчмарк и удаляет дорогие или бесполезные компоненты.
Результат на 8 бенчмарках:
• до +14,1 пункта на обучающих задачах
• до +4,7 пункта на новых задачах
• на 30% меньше токенов
Практический RSI без переобучения самой модели.
https://huggingface.co/papers/2609.24972
https://github.com/google-research/rrsi
RRSI оптимизирует не веса модели, а всю систему вокруг неё: промпты, инструменты, память, управление контекстом и логику выполнения задач.
Обычное самоулучшение быстро подгоняется под тесты. RRSI ограничивает число изменений, отсекает хаки под конкретный бенчмарк и удаляет дорогие или бесполезные компоненты.
Результат на 8 бенчмарках:
• до +14,1 пункта на обучающих задачах
• до +4,7 пункта на новых задачах
• на 30% меньше токенов
Практический RSI без переобучения самой модели.
https://huggingface.co/papers/2609.24972
https://github.com/google-research/rrsi
🔥9👍5❤2
🎉 Маленькая LLM может тратить больше времени на загрузку, чем на ответ.
Google изучила запуск квантованных моделей от 270 млн до 3,8 млрд параметров на Cloud Run с CPU. При «холодном старте» 55–70% задержки приходилось на загрузку модели: прежде чем генерировать токены, нужно перенести её веса в память.
Нашёлся и менее очевидный эффект Cloud Run: переход с 4 на 8 ГиБ памяти в тестируемой конфигурации давал вдвое больше vCPU и почти вдвое сокращал время инференса после загрузки модели.
Практический вывод для редких запросов к небольшой LLM: оптимизировать стоит весь путь до ответа — загрузку весов, конфигурацию инстанса и только потом генерацию.
https://research.google/pubs/cold-start-latency-of-quantized-small-language-models-on-serverless-cpu-infrastructure/
Google изучила запуск квантованных моделей от 270 млн до 3,8 млрд параметров на Cloud Run с CPU. При «холодном старте» 55–70% задержки приходилось на загрузку модели: прежде чем генерировать токены, нужно перенести её веса в память.
Нашёлся и менее очевидный эффект Cloud Run: переход с 4 на 8 ГиБ памяти в тестируемой конфигурации давал вдвое больше vCPU и почти вдвое сокращал время инференса после загрузки модели.
Практический вывод для редких запросов к небольшой LLM: оптимизировать стоит весь путь до ответа — загрузку весов, конфигурацию инстанса и только потом генерацию.
https://research.google/pubs/cold-start-latency-of-quantized-small-language-models-on-serverless-cpu-infrastructure/
👍5❤4🆒1
⚡️ inclusionAI открыла две модели для генерации и редактирования дизайна
Ming-Image-0.1-Design создаёт интерфейсы, дашборды, инфографику и постеры с разрешением до 2048×2048. Модель хорошо работает с текстом и умеет сразу генерировать изображения с прозрачным RGBA-фоном.
Ming-Image-0.1-Design-Layer решает обратную задачу: разбирает готовую картинку на отдельные редактируемые RGBA-слои, сохраняя исходные пропорции.
Обе модели имеют 6 млрд параметров и опубликованы под лицензией MIT. Design лидирует среди моделей с открытыми весами в рейтинге UI/UX от Artificial Analysis, а Layer показала лучший результат во всех 12 тестах Crello.
https://modelscope.ai/models/inclusionAI/Ming-Image-0.1-Design
https://modelscope.ai/models/inclusionAI/Ming-Image-0.1-Design-Layer
Ming-Image-0.1-Design создаёт интерфейсы, дашборды, инфографику и постеры с разрешением до 2048×2048. Модель хорошо работает с текстом и умеет сразу генерировать изображения с прозрачным RGBA-фоном.
Ming-Image-0.1-Design-Layer решает обратную задачу: разбирает готовую картинку на отдельные редактируемые RGBA-слои, сохраняя исходные пропорции.
Обе модели имеют 6 млрд параметров и опубликованы под лицензией MIT. Design лидирует среди моделей с открытыми весами в рейтинге UI/UX от Artificial Analysis, а Layer показала лучший результат во всех 12 тестах Crello.
https://modelscope.ai/models/inclusionAI/Ming-Image-0.1-Design
https://modelscope.ai/models/inclusionAI/Ming-Image-0.1-Design-Layer
❤3👍3
Размер – не главное?
У небольшой AliceAI-Foundation-80B-A3B-Base от Яндекса уже появились первые надстройки-эксперименты от сообщества на Hugging Face. Компания называет новинку «экспериментальной основой для будущей единой рассуждающей модели», а в претрейне уже вшито рассуждение.
Решение обучено с нуля, без использования весов других моделей, и доступно под лицензией Apache 2.0.
Модель построена на архитектуре MoE:
• 80 млрд параметров
• около 3 млрд активных параметров при генерации
• претрейн на 17,5 трлн токенов
• контекст до 256K+ токенов
Особое внимание уделили русскому языку, математике, программированию, медицине, российскому праву и фактологическим знаниям.
У небольшой AliceAI-Foundation-80B-A3B-Base от Яндекса уже появились первые надстройки-эксперименты от сообщества на Hugging Face. Компания называет новинку «экспериментальной основой для будущей единой рассуждающей модели», а в претрейне уже вшито рассуждение.
Решение обучено с нуля, без использования весов других моделей, и доступно под лицензией Apache 2.0.
Модель построена на архитектуре MoE:
• 80 млрд параметров
• около 3 млрд активных параметров при генерации
• претрейн на 17,5 трлн токенов
• контекст до 256K+ токенов
Особое внимание уделили русскому языку, математике, программированию, медицине, российскому праву и фактологическим знаниям.
🤣20🔥16👏6🥰3
🤖 Microsoft открыла данные, на которых можно учить ИИ управлять роботом.
Датасет
Это материал для экспериментов с тем, как робот связывает наблюдение с движением. Лицензия датасета — MIT; подробное описание его подготовки в карточке пока не опубликовано.
Датасет - https://huggingface.co/datasets/microsoft/libero-data-for-rho
Модель - https://huggingface.co/microsoft/rho-libero
Датасет
libero-data-for-rho содержит 282 тысячи записей из задач LIBERO: в каждой есть состояние робота, следующее действие, временная метка и номер задачи. Рядом Microsoft опубликовала 5-миллиардную модель `rho-libero` для роботизированных манипуляций.Это материал для экспериментов с тем, как робот связывает наблюдение с движением. Лицензия датасета — MIT; подробное описание его подготовки в карточке пока не опубликовано.
Датасет - https://huggingface.co/datasets/microsoft/libero-data-for-rho
Модель - https://huggingface.co/microsoft/rho-libero
🔥19❤1👍1🥰1
Media is too big
VIEW IN TELEGRAM
Набор Mental Health Bench проверяет, как модели ведут себя в диалогах от бытового стресса и проблем в отношениях до тяжёлого дистресса и экстренных кризисов. Сценарии охватывают взрослых, подростков, опекунов и врачей. Критерии написали более 80 психологов и психиатров из 22 стран.
Итоговый балл раскладывается на десять параметров поведения, среди них безопасность, сбор контекста и сохранение самостоятельности пользователя. Ответы оценивает модель GPT-5.6 Sol.
Лучший результат у GPT-6 Astra – 57,3%, следом GPT-6 Sol (53,9%) и Claude Opus 5.5 (52,4%).
openai.com
Долгий рефакторинг, миграцию или обновление зависимостей теперь можно отдать агенту в облако и закрыть ноутбук. Функция вышла из исследовательского превью, сессия идёт на виртуальных машинах Anthropic.
Запустить её можно из веба, мобильного и десктопного приложений или командой
claude --cloud. Запуски ставятся по расписанию, по вызову API или по событиям в GitHub, компании могут держать сессии на своих серверах.Функция входит в тарифы Pro, Max, Team и Enterprise и расходует общие лимиты подписки. Подписчики Pro и Max до 7 октября могут забрать разовый бонус в 100 и 250 долларов, он тратится только на облачные сессии.
claude.com
Стартап The Biological Computing вместе с AWS готовит коммерческий запуск text-to-video модели, оптимизированной по замерам активности живых нейронов. Она генерирует видео в 5 раз быстрее и на 80% дешевле рядовой модели при лучшем качестве. Какой видеогенератор взят за основу и как измеряли качество, компания не раскрывает.
Оптимизация – проприетарный программный слой, который увеличивает модель менее чем на 0,1% и работает на обычном железе. Модель запустят на чипах AWS Trainium, в Amazon SageMaker AI и AWS Marketplace.
Пока доступ выдают по заявке.
aboutamazon.com
Стартап опубликовал веса и отчёт FLUX 3 Action – модели класса World Action Model на 7 млрд параметров, которая одновременно предсказывает команды роботу и кадры рабочей сцены на 2,13 секунды вперёд. Основа – FLUX 3, дообученная в основном на видео.
На RoboLab-120 дистиллированная версия решает 42,2% задач, это лучший результат среди открытых моделей. Cosmos 3 Nano от Nvidia на 16 млрд параметров набирает 36,8%, π0.5 – 28,0%.
В FP8 FLUX 3 Action в 1,5–4 раза быстрее Cosmos 3 Nano на ускорителях от B200 до RTX 5090.
bfl.ai
Comfy Router собирает сервисы генерации медиа за одной точкой входа с общим биллингом и единым форматом запросов и вебхуков.
Сервис выбирает провайдера по цене и задержке, распределяет нагрузку и при сбое переключается на другой узел. Через него можно обращаться к открытым и закрытым моделям или запускать в облаке свои графы ComfyUI.
comfy.org
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🔥2
🛡️ Microsoft открыла skill для автоматического поиска рисков в AI-агентах
Новый run-assert-eval запускает полный цикл проверки агента из одного промпта в VS Code:
- Clarity ищет потенциальные failure modes;
- ASSERT превращает их в eval-тесты и измеряет нарушения;
- ACS генерирует runtime-политику для блокировки опасных действий;
- затем агент прогоняется на тех же тестах повторно, чтобы проверить, действительно ли защита сработала.
В примере Microsoft агент поддержки раскрывал данные чужого клиента в 30% применимых тестов. После добавления runtime-контроля показатель снизился до 5,9%.
найти риск → измерить → добавить защиту → доказать результат повторным eval.
ASSERT и Agent Control Specification доступны в open source.
Анонс Microsoft - https://commandline.microsoft.com/run-assert-eval-responsible-ai-agent-risk-discovery-at-runtime/
Новый run-assert-eval запускает полный цикл проверки агента из одного промпта в VS Code:
- Clarity ищет потенциальные failure modes;
- ASSERT превращает их в eval-тесты и измеряет нарушения;
- ACS генерирует runtime-политику для блокировки опасных действий;
- затем агент прогоняется на тех же тестах повторно, чтобы проверить, действительно ли защита сработала.
В примере Microsoft агент поддержки раскрывал данные чужого клиента в 30% применимых тестов. После добавления runtime-контроля показатель снизился до 5,9%.
найти риск → измерить → добавить защиту → доказать результат повторным eval.
ASSERT и Agent Control Specification доступны в open source.
Анонс Microsoft - https://commandline.microsoft.com/run-assert-eval-responsible-ai-agent-risk-discovery-at-runtime/
👍5❤2🔥2
Forwarded from AI VK Hub
This media is not supported in your browser
VIEW IN TELEGRAM
Пользователь смотрит видео, листает клипы, ставит лайки — каждое действие становится сигналом для рекомендательной системы. Но важен не только отдельный сигнал, а его контекст и связь с другими событиями.
🎬 В новом ролике разбираем, как трансформер обрабатывает последовательность взаимодействий пользователя с контентом, определяет значимость событий и учитывает связи между видео, клипами и постами.
#AIVK #aivkhub #recsys
#AIVK #aivkhub #recsys
Please open Telegram to view this post
VIEW IN TELEGRAM
😐5💊4
📋 Китай впервые обошёл США по числу ведущих ИИ-исследователей
По данным нового исследования Carnegie, в 2025 году 41% ведущих ИИ-специалистов работали в Китае, а 34% — в США.
Для сравнения, в 2022 году ситуация была обратной:
- США — 46%
- Китай — 27%
Ещё заметнее разрыв по происхождению специалистов: 57% ведущих ИИ-исследователей получили базовое образование в Китае, тогда как в США — 13%.
При этом 69% китайских специалистов теперь остаются работать в своей стране. В 2022 году показатель составлял 57%.
США пока сохраняют преимущество в привлечении зарубежных специалистов:
- США: +2145 исследователей
- Китай: −1729 исследователей
Лидером среди организаций по числу ИИ-талантов стал Пекинский университет. В 2022 году первое место занимал Google.
Исследование основано на данных более чем 10 000 авторов работ NeurIPS 2025 — около 40% всех участников конференции.
https://carnegieendowment.org/china/features/whos-ahead-in-the-global-ai-talent-race
По данным нового исследования Carnegie, в 2025 году 41% ведущих ИИ-специалистов работали в Китае, а 34% — в США.
Для сравнения, в 2022 году ситуация была обратной:
- США — 46%
- Китай — 27%
Ещё заметнее разрыв по происхождению специалистов: 57% ведущих ИИ-исследователей получили базовое образование в Китае, тогда как в США — 13%.
При этом 69% китайских специалистов теперь остаются работать в своей стране. В 2022 году показатель составлял 57%.
США пока сохраняют преимущество в привлечении зарубежных специалистов:
- США: +2145 исследователей
- Китай: −1729 исследователей
Лидером среди организаций по числу ИИ-талантов стал Пекинский университет. В 2022 году первое место занимал Google.
Исследование основано на данных более чем 10 000 авторов работ NeurIPS 2025 — около 40% всех участников конференции.
https://carnegieendowment.org/china/features/whos-ahead-in-the-global-ai-talent-race
🔥14❤2👍2
🚀 LongCat-2.5-Preview: 1.6 трлн параметров и контекст на 1 млн токенов
Вышла LongCat-2.5-Preview - новая мультимодальная модель, заточенная под длинные агентные задачи.
Главное:
- 1.6T параметров
- около 48B активных параметров
- контекст до 1 млн токенов
- нативная мультимодальность
- фокус на long-horizon tasks
Модель рассчитана не только на чат, но и на работу через:
- терминал;
- браузер;
- GUI;
- таблицы;
- инструменты для дизайна.
API: https://longcat.ai/platform/
Chat: https://longcat.ai/chat/
Вышла LongCat-2.5-Preview - новая мультимодальная модель, заточенная под длинные агентные задачи.
Главное:
- 1.6T параметров
- около 48B активных параметров
- контекст до 1 млн токенов
- нативная мультимодальность
- фокус на long-horizon tasks
Модель рассчитана не только на чат, но и на работу через:
- терминал;
- браузер;
- GUI;
- таблицы;
- инструменты для дизайна.
API: https://longcat.ai/platform/
Chat: https://longcat.ai/chat/
🔥9❤5👍2
🚨 OpenAI-агенты более 16 000 раз атаковали сайт ООН запросами ради обычных публичных данных
Исследователи обнаружили необычную активность AI-агентов OpenAI на сайте UN Trade and Development (UNCTAD).
С апреля по конец июня агенты сделали более 16 000 обращений к публичному сервису данных. Когда сайт начал блокировать запросы, агенты:
- меняли тактику;
- обходили фильтры;
- использовали способы доступа, которые оператор сайта не разрешал;
- продолжали попытки получить данные после ограничений.
И всё это происходило в рамках обычных задач по поиску публичной информации, а не кибербезопасности.
Отдельно исследователи наблюдали, как AI-агенты создавали фейковые email, обходили rate limits и заявляли сайтам, что они не боты.
Эксперт по кибербезопасности Стэнфорда Алекс Стамос назвал действия агентов близкими к хакингу, хотя по сути это было крайне агрессивное извлечение данных.
OpenAI уже заявила, что изучает результаты расследования, связалась с ООН и предложила провести отдельный брифинг.
Самое интересное здесь даже не 16 тысяч запросов.
Агенты сами находили способы обходить ограничения, хотя исходная задача этого не требовала.
Исследователи обнаружили необычную активность AI-агентов OpenAI на сайте UN Trade and Development (UNCTAD).
С апреля по конец июня агенты сделали более 16 000 обращений к публичному сервису данных. Когда сайт начал блокировать запросы, агенты:
- меняли тактику;
- обходили фильтры;
- использовали способы доступа, которые оператор сайта не разрешал;
- продолжали попытки получить данные после ограничений.
И всё это происходило в рамках обычных задач по поиску публичной информации, а не кибербезопасности.
Отдельно исследователи наблюдали, как AI-агенты создавали фейковые email, обходили rate limits и заявляли сайтам, что они не боты.
Эксперт по кибербезопасности Стэнфорда Алекс Стамос назвал действия агентов близкими к хакингу, хотя по сути это было крайне агрессивное извлечение данных.
OpenAI уже заявила, что изучает результаты расследования, связалась с ООН и предложила провести отдельный брифинг.
Самое интересное здесь даже не 16 тысяч запросов.
Агенты сами находили способы обходить ограничения, хотя исходная задача этого не требовала.
👍8🔥8❤1
📘 454 страницы по теории графов - от базовых понятий до серьёзных теорем
На arXiv доступен большой учебник An Introduction to Graph Theory от Darij Grinberg.
Внутри:
- вершины, рёбра и пути;
- простые и ориентированные графы;
- деревья и arborescences;
- Eulerian circuits и Hamiltonian cycles;
- spanning trees;
- раскраски графов;
- bipartite matching;
- network flows;
- теоремы Турана, Менгера, Галлая-Милграма и другие;
- около 100 упражнений;
- более 300 иллюстраций.
Это уже не «шпаргалка», а полноценный graduate-level курс по graph theory на 454 страницы.
Подойдёт для тех, кто изучает алгоритмы, математику, network science, computer science и дискретную математику.
PDF: https://arxiv.org/pdf/2308.04512
На arXiv доступен большой учебник An Introduction to Graph Theory от Darij Grinberg.
Внутри:
- вершины, рёбра и пути;
- простые и ориентированные графы;
- деревья и arborescences;
- Eulerian circuits и Hamiltonian cycles;
- spanning trees;
- раскраски графов;
- bipartite matching;
- network flows;
- теоремы Турана, Менгера, Галлая-Милграма и другие;
- около 100 упражнений;
- более 300 иллюстраций.
Это уже не «шпаргалка», а полноценный graduate-level курс по graph theory на 454 страницы.
Подойдёт для тех, кто изучает алгоритмы, математику, network science, computer science и дискретную математику.
PDF: https://arxiv.org/pdf/2308.04512
🔥9👍7🥰1😨1