278K subscribers
5.52K photos
1.29K videos
17 files
5.87K links
Погружаемся в машинное обучение и Data Science

Показываем как запускать любые LLm на пальцах.

По всем вопросам - @haarrp

@itchannels_telegram -🔥best channels

Реестр РКН: clck.ru/3Fmqri
Download Telegram
Как сократить расход токенов на веб-контекст до трёх раз

Если корпоративному ИИ-ассистенту нужны свежие данные из интернета, за поиском стоит отдельная работа: загрузить страницы, очистить HTML, разбить текст на фрагменты и отобрать релевантные. Всё это нужно разрабатывать и поддерживать.

В Yandex Search API появились Smart Snippets - возможность получить подходящие фрагменты найденных страниц одним вызовом API. Отправляете запрос, получаете контекст с цитатами и ссылками на источники.

Каждый фрагмент занимает около 500 токенов. В модель отправляются нужные выдержки вместо страниц целиком. По данным команды продукта, это позволяет сократить расход токенов на веб-контекст до трёх раз при том же качестве ответа.

Итоговый ответ по-прежнему формирует ваша модель. Smart Snippets подготавливают для неё материал из веба, например, для проверки актуальных условий, поиска документации или сбора данных о рынке.

Для команд, которые строят ИИ-агентов и корпоративных ассистентов, это меньше компонентов в поисковом пайплайне и ниже затраты на обработку веб-контекста.

Свяжитесь с экспертом, чтобы протестировать – по ссылке.
👍125👏51🤔33🔥31😁30💯29❤26🎉25👨‍💻3🗿3
✔️ TikTok добавил ИИ-ассистента для покупок и оплату в один клик

Платформа расширила коммерческий арсенал сервиса TikTok Shop, запустив диалогового ИИ-помощника для шопинга и механизм оформления заказов в один клик.

Нововведения должны минимизировать отток аудитории на финальных этапах воронки и сократить дистанцию между просмотром контента и покупкой.

Виртуальный ассистент интегрирован в интерфейс поиска и каталога - он обрабатывает пользовательские запросы, подбирает релевантные товары с учетом персональных предпочтений и контекста роликов, а также отвечает на уточняющие вопросы о характеристиках позиций.

Функция быстрой оплаты, в свою очередь, сохраняет платежные и данные для доставки, позволяя закрывать транзакцию мгновенно прямо из ленты или карточки товара в обход
стандартной многоэтапной корзины.

Релиз усиливает давление соцсети на традиционные маркетплейсы за счет упрощения импульсивных покупок.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤64🔥34🥰33👍23👏19😁18🤔13🎉12💯10😢3🗿3
Media is too big
VIEW IN TELEGRAM
⚡️ Google выпустила Nano Banana 2.1

Модель построена на базе Gemini 3.6 Flash и предназначена для генерации и редактирования изображений с возможностью вывода сопутствующего текста.

Обновление принесло увеличение входного контекста до 1 млн токенов (выходной буфер составляет 4K токенов для графики и 64K для текста), что позволяет обрабатывать большие текстовые описания и серии референсных картинок в едином запросе.

На бенчмарках генерации и редактирования модель обошла Nano Banana 2 и Nano Banana Pro - в режиме ризонинга рейтинг предпочтений вырос до 1050 Elo.

Google удалось заметно улучшить консистентность персонажей и объектов между кадрами, редактирование по маскам и эскизам, а также фактологическую точность при отрисовке инфографики за счет базы знаний Gemini.

Обновлённая модель доступна в приложении Gemini, AI Studio, API, Flow и Stitch.
deepmind.google

✔️ Отрыв США от Китая в ИИ сократился до минимума

По расчётам аналитиков, средний разрыв между флагманами двух стран по ключевым бенчмаркам сузился с 15% в начале года до 9% в мае и 3% после выхода DeepSeek V4.1 Flash в сентябре.

Прогресс китайских лабораторий связывают с оптимизацией алгоритмов под местные ускорители и сомневаются на этом основании в действенности экспортных ограничений США на чипы Nvidia.

В деньги паритет пока не превращается - из-за ценовой войны сектор, по тому же прогнозу, может оставаться убыточным до 2030 года, зарабатывать получается у единиц вроде ByteDance, а DeepSeek отдаёт модели бесплатно и продаёт токены с околонулевой маржой. 
bloomberg.com

✔️ Anthropic ослабила ограничения для проверенных ИБ-команд

Cyber Verification Program свела прежнюю одноимённую программу и Project Glasswing в три уровня допуска к Opus 5.5, Sonnet 5.5 и Mythos 5.1.

Defense Access рассчитан на центры мониторинга, разбор инцидентов, реверс вредоносов и анализ уязвимостей. Red Team Access добавляет авторизованный пентест, Specialized Access отведён организациям, тестирующим критичные для безопасности системы в сотрудничестве с правительством США.

Заявку на первый уровень рассматривают дни, на второй берут только организации и рассматривают недели. Доступ через Claude Platform, Vertex AI и Microsoft Foundry.
anthropic.com

✔️ Hugging Face выпустила инструмент обучения моделей в кодинг-агентах

Multi-harness RL позволяет обучать языковые модели с подкреплением непосредственно в Claude Code, Codex и OpenCode. Из коробки поддерживается 10 сред.

Инструмент работает через прокси-прослойку, которая перехватывает запросы в форматах OpenAI, Anthropic или Gemini, направляет их в vLLM, логирует token ID и logprobs, а затем передает траектории в библиотеку TRL. Это превращает агентский интерфейс в RL-окружение без изменения кодовой базы самого агента.

Исходный код прокси в OpenEnv, обучающие скрипты для TRL и семь готовых моделей выложены в открытый доступ.
Clement Delangue в X

✔️ Трафик ИИ-сервисов больше не гарантирует выручку

Венчурный фонд Andreessen Horowitz опубликовал седьмой отчет Consumer AI, впервые сопоставив посещаемость сервисов с реальными тратами пользователей на основе банковских данных.

Главный вывод - популярность продукта перестала напрямую определять его финансовую успешность: 29 из 50 самых прибыльных ИИ-компаний вообще не входят в топ по веб- или мобильному трафику.

При этом монетизация сектора держится на сверхпользователях - верхний 1% платящей аудитории тратит в среднем 903 доллара в месяц, обеспечивая пятую часть всей выручки рынка, тогда как медианный чек составляет 25 долларов.

Аналитики также зафиксировали замедление ротации лидеров - в рейтинги пробились лишь 11 новичков, что стало историческим минимумом.

Единственной заметно растущей категорией остаются персональные агенты, ориентированные на выполнение прикладных задач вместо стандартного диалога.

Индустрия постепенно смещается от хайпа вокруг чат-ботов к утилитарным агентским пайплайнам с четкой бизнес-моделью.
a16z.com

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍64❤30🎉20🤔16💯15😁14🔥11👏6⚡5🤣2
🌟 VeriHarness: обвязка для проверки работы агентов той же моделью

Google AI Research и Кембриджский университет открыли код VeriHarness, системы, которая проверяет результаты долгих агентных задач силами той же модели, что их сделала.

Вместе с кодом выложены около 26 тысяч трейсов агентов Gemini 3.5 flash и Opus 4.8, на генерацию которых ушло больше 100 тысяч долларов.


ИИ-агент решает одну и ту же задачу несколько раз, и каждая попытка даёт свой вариант отчёта, таблицы, документа или патча.

VeriHarness сверяет все эти варианты с файлами и данными рабочего пространства и выдаёт лучший вариант, исправленный по найденным ошибкам, вместе с журналом проверок, но эталонных ответов и критериев оценки проверяющий не видит.

Идею подсказали запуски Claude Opus 4.8 на бенчмарке APEX-Agents, где треть ответов, в которых сходились все десять попыток, оказалась ошибочной, а при расхождении верный вариант обычно был среди попыток, но голосование большинством выбирало его лишь примерно в половине случаев.


🟡 Механика

Проверка идёт в двух отдельных контекстах модели.

Первый разбирает утверждения, в которых прогоны расходятся, и подбирает проверку, которая лучше всего отделит верный вариант.

Второй ищет ошибки там, где все прогоны согласны, например пересчитывает итоги или сверяет валюту с метаданными источника.

Затем новый контекст сводит оба журнала, выбирает базовый прогон и план правок, а нерешённые вопросы помечает отдельно.

Что именно проверять, подсказывают 18 навыков, коротких инструкций со скриптами для таблиц, PDF, документов, презентаций и патчей.

Навыки умеют пополняться сами из разборов ошибок на отладочных задачах.

Протокол работает внутри Gemini CLI, Claude Code и Codex.


🟡Тесты

На пяти бенчмарках рабочих задач APEX-Agents, SpreadsheetBench 2 и JobBench, VeriHarness с правками поднял средний результат по сравнению с одиночным прогоном с 47,2 до 53,4 балла у Gemini 3.5 Flash и с 49,6 до 56,1 у Claude Opus 4.8.

Сильнее всего вырос APEX-Agents у Opus, с 35,8 до 47,5.

Без правок, в режиме выбора лучшего прогона, VeriHarness обошёл все сравниваемые методы, включая LLM-as-a-Verifier, на всех бенчмарках у обеих моделей.


📌Лицензирование: Apache 2.0


🟡Страница проекта
🟡Arxiv
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #Agents #VeriHarness #Google
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍57🔥49👏49❤39🤓38💯37🤔36😁31🎉27👨‍💻8
GPU, токены и деньги: как балансировать на ИИ-арене?

15 октября на ежегодной конференции Orion soft «Большая игра» обсудят, что происходит после успешного ИИ-пилота. Промышленный сервис требует распределять GPU между моделями, управлять нагрузкой в Kubernetes, защищать обращения к LLM и понимать, какое подразделение сожгло месячный запас токенов за три дня.

На дискуссии «Deploy: Become AI-ready» топ-менеджеры ПИК, «Газпром нефти» и red_mad_robot разберут свой опыт внедрения ИИ: что меняется при переходе от эксперимента к промышленной эксплуатации, готова ли к этому корпоративная инфраструктура и как удержать расходы под контролем.

Техническая часть будет посвящена двум слоям корпоративного ИИ. Первый — запуск и масштабирование AI-нагрузок в Kubernetes с помощью Nova AI, включая распределение GPU между командами и сервисами. Второй — AI Gateway на базе StarGuard AI: единая точка доступа к моделям, через которую можно применять политики безопасности, контролировать запросы и ответы, маскировать чувствительные данные и вести аудит.

Отдельная премьера — новый продукт Orion soft для биллинга ИИ-токенов. Он должен ответить на вопрос, который быстро возникает после массового внедрения LLM: кто, какую модель и для каких задач использовал — и кому в итоге выставлять счёт.

Кроме ИИ-трека, в программе — инфраструктура, DevOps, кибербезопасность, опыт импортозамещения и демо-лаборатории с продуктами Orion soft.

📌15 октября, Москва + онлайн
🕹Deploy: Become AI-ready → регистрация
🌚62🤔35👏31❤22👍21💯14🔥12🎉12🤣3🤩2⚡1
🌟 MIT CSAIL опубликовала модель разметки анатомии на рентгеновских снимках

MIT вместе с коллегами из Массачусетской больницы общего профиля и Гарвардской медицинской школы сделала модель FleXray, которая находит и выделяет на снимке 60 анатомических структур, от рёбер и позвонков до костей таза и конечностей.

Модель работает с разными областями тела, стандартными и косыми проекциями, кадрами рентгеноскопии во время операций, снимками взрослых и детей.

На размеченных структурах можно автоматически делать измерения, например угла искривления позвоночника при сколиозе, или сопоставлять кадры рентгеноскопии с трёхмерной КТ для навигации во время вмешательств.

Патологии модель не ищет, только анатомию, и правую сторону от левой не отличает.


Внутри свёрточная сеть U-Net, снимок перед обработкой приводится к размеру 256 на 256 пикселей. Для максимального качества пять таких сетей работают ансамблем.

🟡Тесты

На восьми наборах реальных снимков с разметкой FleXray набрала в среднем 0,875 по коэффициенту Dice, который показывает, насколько выделенная область совпадает с эталонной, от 0 до 1.

Универсальные PAXray, TotalSegmentator2D и FluoroSAM она обошла на семи наборах из восьми.

Сети nnU-Net, которые обучали отдельно под каждый набор, набрали в среднем 0,914.

В оценке сколиоза средняя ошибка в угле искривления составила 5,13 градуса против 6,38 у TotalSegmentator2D.

При совмещении кадров рентгеноскопии с КТ медианная ошибка снизилась с 335 до 1,2 мм.

Попробовать FleXray можно в браузерной демоверсии, которая работает локально через WebGPU.


📌Лицензирование: CC-BY-NC-4.0


🟡Страница проекта
🟡Модель
🟡Arxiv
🟡Демо
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #CV #Medical #Segmentation #FleXray
Please open Telegram to view this post
VIEW IN TELEGRAM
🤩109👏45👍28🎉27❤26🔥20🤔18💯18😁10
⚡ Anthropic представила Claude Haiku 5.5

Claude Haiku 5.5
- самая быстрая и доступная модель в линейке Claude 5.5.

Она рассчитана на задачи, где важны скорость, низкая стоимость и масштабирование: массовая обработка запросов, классификация, автоматизация, простые агенты и API-нагрузки.

Линейка Claude 5.5 теперь выглядит так:

- Opus 5.5 - максимум возможностей
- Sonnet 5.5 - баланс качества и стоимости
- Haiku 5.5 - скорость и минимальная цена

Haiku 5.5 близкоподошла к более крупным моделям прошлых поколений по качеству.

https://www.anthropic.com/claude-haiku-5-5
🔥98👍47⚡41❤29👏20💯15🎉14😁9🥱8🤩3❤‍🔥2
Media is too big
VIEW IN TELEGRAM
✔️ Anthropic даёт стартапам год Claude Team и 1000 долларов на API

Программу Claude for Startups расширили - участникам полагается год тарифа Claude Team на пять премиальных мест и 1000 долларов кредитов на разработку с Claude.

Этим шагом компания стремится переманить разработчиков и фаундеров на ранних стадиях, напрямую конкурируя с программами поддержки от OpenAI и облачных гигантов Microsoft Azure и AWS.

К участию допускаются проекты, основанные в течение последних пяти лет. Подать заявку можно на странице программы Claude for Startups.
techcrunch.com

✔️ Google открыла веб-платформу генерации браузерных игр

Платформа Playground, запущенная в рамках партнерства Google и Unity, предоставляет возможность генерации браузерной игры по текстовому запросу с настраиваемой физикой, правилами механики, окружением и внешним видом персонажей. Созданную игру можно запустить в мобильном или десктопном браузере.

В сервис встроены публичная галерея проектов, лидерборды и мультиплеер для некоторых жанров. В будущем заявлена интеграция с Unity Spark. через который можно будет экспортировать текстовые наработки в движок Unity для добавления 3D-графики и игровой логики.

На старте Playground доступен пользователям из США. Лимиты на генерацию зависят от уровня подписки Google One.
blog.google

✔️ Nous Research представила бенчмарк оценки эффективности и стоимости агентов

Исследовательская группа собрала Hermes Index, публичный лидерборд для сравнения языковых моделей внутри фреймворка Hermes Agent при максимальной глубине рассуждения.

Итоговый балл формируется на основе четырёх тестов: Terminal-Bench 4, Terminal-Bench Science, SkillsBench и нового набора Hermes Bench. В последнем агент выполняет 150 разноплановых задач в реальном рабочем пространстве, оперируя файлами и внешними инструментами.

Первое место заняла Claude Opus 5.5 с расходом около $5 на задачу, опередив GPT 6 Astra, которая показала второй результат, но оказалась самой дорогой в рейтинге - $11,6. Тройку замкнула Sonnet 5.5 ($2,8).

В бюджетном сегменте на границу Парето вышли DeepSeek V4.1 Flash (36,91 балла при 26 центах за задачу) и GPT6 Luna (14 центов). Они стали наиболее выгодными с точки зрения баланса цены и продуктивности.
nousresearch.com

✔️ ElevenLabs запустила инструмент сборки и отладки голосовых агентов через диалог

Открылось альфа-тестирование специализированного ассистента Architect, помогающего создавать, конфигурировать и оптимизировать голосовых агентов с помощью текстовых или голосовых команд.

Инструмент понимает логику, структуру баз знаний, настройки синтеза речи и системных промптов. Ему достаточно передать системе лог сбоя, статистику эскалаций на операторов или общий запрос на улучшение, после чего Architect самостоятельно выполнит анализ транскриптов, выявит узкие места и предложит готовые решения.

Все предложенные обновления фиксируются в виде версионируемых черновиков и применяются в продакшене только после ручного подтверждения.

Architect доступен внутри ElevenLabs и в Cursor, Claude Code, ChatGPT и Grok Bot.
elevenlabs.io

✔️ Boston Dynamics показала новые манипуляторы для Atlas под ручной инструмент

Новинка получила 13 степеней свободы - четыре оси на противопоставленном большом пальце и по три на остальных. Инженеры отказались от мизинца для упрощения кинематики и снижения себестоимости. Конструкция позволяет удерживать дрели, горелки и пневмопистолеты с возможностью нажатия на курок.

Механика построена на закрытых электроприводах прямого действия без тросовых тяг и выдерживает нагрузку свыше 45 кг. Подушечки пальцев и ладонь оснащены матрицами тактильных датчиков давления.

Аппаратная часть оптимизирована под sim2real. Точная проприоцепция минимизирует динамическую погрешность при моделировании - манипулятивные политики обучаются через RL в симуляции и напрямую переносятся на физического робота.
bostondynamics.com


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍57❤29👏23🤔18🎉12😁11🔥10💯9🤣1
📌Baseten выпустила бесплатный учебник по инженерии инференса

Платформа, которая хостит модели Cursor, Notion и Harvey, выложила в открытый доступ книгу Inference Engineering за авторством Филипа Кайли. который четыре года работает в Baseten и написал её по интервью с инженерами компании и собственным докладам.

Среди рецензентов - автор FlashAttention Три Дао.


Книга собирает в одном месте путь от выбора модели и GPU до мониторинга работающего сервиса.

Baseten основана в 2019 году тремя выходцами из Gumroad, четвёртым сооснователем стал Панкадж Гупта из Uber.

Компания продаёт выделенные развёртывания открытых и собственных моделей клиентов, готовые Model APIs и инфраструктуру для дообучения, а также развивает открытый фреймворк упаковки моделей Truss.


Восемь глав объясняют, как сформулировать требования к продукту, как устроены модели и где они тормозят, прежде всего в механизме внимания, разбирают GPU NVIDIA поколений Hopper и Blackwell и программный уровень, от CUDA и PyTorch до движков vLLM, SGLang, TensorRT-LLM и Dynamo.

Отдельные главы посвящены методам ускорения, моделям для речи, изображений и видео, а также эксплуатации - от автомасштабирования и батчинга до постепенной выкатки новых версий.

Новичку книга даёт карту области и порядок действий - как определить задачу, бюджет задержки, стоимости и подобрать модель, а в последующем заняться оптимизацией.

Базовые понятия вроде предзаполнения, декодирования и KV-кэша объяснены с нуля, а незнакомые термины можно найти в глоссарии.

Опытным инженерам будут интересны пороги и практические правила. Для каждой техники ускорения автор объясняет, как она устроена, при каком трафике и размере модели окупается и чем рискует качество ответов.

Отдельно сравниваются движки инференса и разобраны задачи эксплуатации, которые обычно приходится решать методом проб и ошибок.

Последний раздел посвящён продуктам компании, а оборудование рассматривается почти целиком на примере NVIDIA, другим ускорителям отведено около двух страниц.

🔜 Запросить книгу бесплатно в форматах PDF, EPUB или аудиоверсию


@ai_machinelearning_big_data

#AI #ML #Inference #Book #Baseten
Please open Telegram to view this post
VIEW IN TELEGRAM
2👨‍💻113❤46💯43👍37👏26🔥18🤔11🎉9🤓7🤝2👌1
✔️ Организатора схемы накрутки ИИ-музыки приговорили к 18 месяцам тюрьмы

Федеральный суд США назначил полтора года тюремного заключения фигуранту первого уголовного дела о мошенничестве со стриминговыми сервисами с применением генеративного ИИ.

Злоумышленник загружал в каталоги платформ Spotify и Apple Music сотни тысяч сгенерированных треков, после чего симулировал прослушивания через распределённую сеть бот-аккаунтов для получения роялти.

Чтобы обходить антифрод стримингов, схема опиралась на дробление трафика - боты распределяли фиктивные стримы тонким слоем по огромной библиотеке композиций, не поднимаясь выше триггеров аномальной активности для единичных треков.

Прецедентный приговор подсветил уязвимость традиционных эвристик безопасности платформ и вынудил их ускорить внедрение поведенческого анализа и систем выявления синтетического контента в реальном времени.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔126💯35👏29❤19👍14😁14🎉11🤨11🔥8🤣3🤬1
✔️ Meta*, DeepMind и Isomorphic Labs присоединились к проекту симуляции живых клеток

Некоммерческая научно-исследовательская организация Biohub семейного фонда Цукербергов расширила программу Virtual Biology Initiative для симуляции клеточных процессов in silico.

К проекту присоединились Google DeepMind, Meta и Isomorphic Labs Демиса Хассабиса. Общий бюджет консорциума достиг $1,8 млрд.

Задача партнерства - создать фундаментальные модели для предсказания отклика клеток на лекарственные препараты до проведения клинических экспериментов.

Для обучения модели требуются датасеты на триллионы записей и первую партию верифицированных данных планируют собрать до конца 2027 года, а готовую архитектуру представят в течение пяти лет.

Техногиганты выделяют на проект $300 млн. Министерство энергетики США направит более $500 млн на вычислительные мощности, а Национальные институты здравоохранения предоставят накопленные биологические базы.

Результаты исследований и датасеты откроют для научного сообщества. Коммерческие участники консорциума получат годичный эксклюзивный доступ к данным, собранным на их средства.

*организация признана экстремистской, её деятельность на территории РФ запрещена.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍57👏41❤33🤔20🔥12😁7💯7🎉4🥱3🤩2
📌 Кейноут Windows and Surface event

На осенней презентации 7 октября Microsoft рассказала о своих новинках и планах.

Встроенная в Windows 11 песочница Microsoft Execution Containers (MXC), которая на уровне системы ограничивает, к каким файлам и сетям допущен агент, вышла из предварительной версии.

Вместе с ней компания показала маршрутизацию задач между локальными и облачными моделями, новый Copilot и компьютеры на чипе NVIDIA RTX Spark, рассчитанные на запуск локальный моделей.

MXC уже поддерживают Codex от OpenAI, GitHub Copilot, OpenClaw, LM Studio и OpenShell от NVIDIA, следом обещаны Claude Code, Perplexity, Manus и другие агенты.

Действия агента Windows записывает отдельно от действий пользователя, а корпоративные администраторы могут управлять агентами через Intune и Agent 365.

Также Microsoft показала квантованную трёхбитную версию своей кодинг-модели MAI Code 1.1 Flash для запуска на устройствах.

До конца октября GitHub Copilot в CLI, приложении и VS Code научится сам решать, отправить задачу локальной модели или в облако.

В среду выполнения Windows ML добавят llama.cpp для запуска открытых моделей.

Ноутбук Surface Laptop Ultra на RTX Spark с унифицированной памяти до 128 ГБ будет стоить от 2599 долларов и поступит в продажу 16 октября, свои компьютеры на этом чипе готовят Asus, Dell, Lenovo, HP и MSI.

Мини-ПК Surface RTX Spark Dev Box планируют продавать от 5999 долларов, поставки в США начнутся в ноябре.

До конца года Dell и HP выпустят рабочие станции DGX Station для Windows на суперчипе GB300.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍62👏45🔥24❤15🤔8🎉6💯4🤩3😁2
Media is too big
VIEW IN TELEGRAM
✔️ OpenAI начала развёртывание GPT-6 с динамическим интерфейсом

Главное новшество – система Intelligent UI. Вместо статичного текста модель собирает под задачу интерактивные компоненты, от схем и графиков до калькуляторов и мини-игр.

Внутри своя библиотека потоковых компонентов и компилятор, который отрисовывает интерфейс по мере генерации токенов, не дожидаясь конца ответа.

Поменялся и механизм рассуждений, теперь модель чередует скрытые вычисления с генерацией текста и отдаёт частичные результаты без пауз на размышление.

GPT-6 Sol открыта на платных тарифах Plus, Pro, Business и Enterprise, облегчённая GPT-6 Luna придёт на Free и Go.
openai.com

✔️ Google представила автономного агента для корпоративной среды

На конференции Gemini at Work компания анонсировала агента для многодневных инженерных и организационных задач. Работает он как сотрудник, со своей учётной записью, почтой, календарём и хранилищем.

Вычисления идут в облаке, контекст синхронизируется между CLI, Slack и Google Workspace, модели берутся из семейств Gemini и Claude, позже обещана поддержка открытых.

Память разделена на четыре уровня – сессионный, семантический, процедурный и эпизодический, – и это позволяет накапливать знания о внутренних регламентах. К инфраструктуре агент подключается через Git, Jira, BigQuery, Databricks и MCP.

Код запускается в песочницах, действия проходят криптографическую аутентификацию. Тарифы и сроки не раскрыты.
google.com

✔️ Grok Bot научился читать посты в X

Ассистент теперь читает данные платформы напрямую, без платного X API и отдельной авторизации. Так он собирает публикации, сводит отзывы и отслеживает новостные поводы, тогда как августовской версии требовались привязка учётной записи и расход квот API.

Встроенный планировщик позволяет разбирать X по расписанию, структурировать найденное и присылать сводки в чат. Публикация твитов от имени пользователя осталась отдельной функцией и по-прежнему требует настройки авторизованного коннектора.
x.com

✔️ GitHub открыла доступ к локальной песочнице для Copilot

Механизм изолирует автономные действия агентов в VS Code, десктопном приложении и Copilot CLI, закрывая терминальным командам файловую систему хоста, сетевые сокеты, связки ключей и переменные окружения.

Строится он на движке Microsoft eXecution Container, который переводит единые правила безопасности в средства ОС, то есть в bubblewrap на Linux, Seatbelt на macOS и ProcessContainer на Windows. Изоляция не тарифицируется и работает на ресурсах самой машины.

Администраторы могут включить песочницу принудительно и запретить разработчикам менять правила на своих устройствах. Вместе с ней в Copilot CLI появилась маршрутизация запросов к локальным моделям через Ollama и поддержка Microsoft MAI Code Flash для работы без облака.
github.blog

✔️ ByteDance профинансирует ИИ-кино

Компания запустила международную программу Dreamina Originals для авторов полнометражных ИИ-фильмов и сериалов. Команды и студии получат приоритетный доступ к мощностям для работы видеомоделей, инженерные консультации и ресурсы на продвижение.

Авторам полного метра выделят до 15 млн кредитов, а дистрибуцию и подачу работ на кинофестивали ByteDance берёт на себя.

Сериалы с суммарным хронометражем около 100 минут поделены на две категории. Проекты категории S получают неограниченный доступ к токенам на производство, а категории A – до 1 млн кредитов на эпизод и гранты до 10 тысяч долларов на продвижение в YouTube, TikTok и X.

Сама программа – глобальное расширение китайской Dreamina Studio, запущенной в августе, через которую ByteDance выстраивает экосистему контента, целиком созданного нейросетями.
Dreamina AI в X


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍96🔥37❤21👏14🤔5🎉5🤩4😁3🏆3💯2
This media is not supported in your browser
VIEW IN TELEGRAM
✔️ Odyssey выпустила модель мира Odyssey-3

Новая модель стартапа Odyssey, основанного выходцами из разработки беспилотных автомобилей, по текстовому запросу создаёт интерактивное окружение и в реальном времени просчитывает, как в нём двигаются и взаимодействуют объекты.

Попробовать её можно на сайте компании, вышли две версии, Odyssey-3 с разрешением 832х480 пикселей и Odyssey-3 Pro с разрешением 1280х720.


Модель продолжает видео кадр за кадром с опорой на предыдущие и на ходу принимает команды и запросы, а на каждый фрагмент тратит всего несколько шагов генерации, поэтому успевает отвечать в реальном времени.

По сгенерированному миру можно перемещаться от первого или третьего лица, отдельно управлять камерой и во время генерации добавлять события, на которые сцена реагирует.

Odyssey позиционирует новинку как симулятор для обучения роботов и других физических систем. Поверх неё обучают отдельные декодеры действий и политики управления.

На Physics-IQ Verified, который проверяет, насколько правдоподобно модель продолжает видео с физическими процессами, Odyssey-3 Pro набрала 66,1 балла, это лучший опубликованный результат на этом наборе.

На WorldMark модель заняла первое место в трёх категориях из четырёх, а в генерации реалистичных сцен от первого лица оказалась третьей, уступив Lyra 2.0 и AlayaWorld.

Доступ к API запрашивается через портал для разработчиков, стоимость неизвестна.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤩64👍26👏23❤14🔥14😁12🤔6💯4🎉1
🔍 Microsoft выпустила модель, которая только принимает решения. В 35 раз быстрее GPT-6 Sol, выходные токены бесплатно

Microsoft-Decision-1 получает запрос и фиксированный набор вариантов и за один проход выдаёт откалиброванную вероятность для каждого. Да/нет, выбор из списка, рейтинг, оценка ответа ИИ или действия агента по рубрике. Внутри Qwen3.5-9B после пост-трейна.

На 36 закрытых бенчмарках, почти 150 тысяч вопросов, модель показала лучшую точность среди LLM и других decision-моделей. По задержке она в 4,5 раза быстрее ближайшего конкурента и в 35 раз быстрее GPT-6 Sol. На перефразированных и перемешанных вариантах решение меняется лишь в 1,3% случаев.

Внутри Microsoft её уже используют. Xbox Research разметили 10 тысяч отзывов с качеством уровня GPT-6 Sol, но в 14 раз быстрее и в 200 раз дешевле. В Copilot модель оценивает ответы агентов в 100 раз быстрее GPT-5.6 Luna.

Цена $0,042 за миллион входных токенов. Уже в Microsoft Foundry, скоро на OpenRouter.

https://commandline.microsoft.com/microsoft-decision-1-model-foundry/

@ai_machinelearning_big_data

#Microsoft
Please open Telegram to view this post
VIEW IN TELEGRAM
👍124🎉29❤26👏23🔥16💯16😁14🤔4
📌 Humanity's Sixth Sense: мультимодальные модели все еще отстают в когнитивном восприятии

Исследовательское подразделение Scale Labs в партнерстве с Elorian представило бенчмарк Humanity's Sixth Sense, созданный для проверки способности ИИ интерпретировать скрытые социальные сигналы и пространственные взаимосвязи на изображениях и видео.

Набор тестов состоит из 522 вопросов по 288 статичным сценам и 234 видеофрагментам (оценка габаритов разъезда автомобилей, мотивы поведения людей, негласная иерархия в кадре и т.д)

Испытания 25 актуальных мультимодальных моделей зафиксировали заметное отставание от человека.

Контрольная группа людей набрала 93,1% точности, лидирующая GPT-6 Astra - 53,6%. Результаты GPT-6.1 Sol и Claude Opus составили 46,6% и 44,6%, медиана по выборке - 30,9%.


Детальный разбор более 8,5 тысяч неудачных ответов показал, что 94% из них вызваны сбоями первичного машинного зрения - модели пропускают маркеры в кадре и теряют контекст. На ошибки в логике рассуждений пришлось всего 5%.

Увеличение вычислительного бюджета (в среднем 4000 токенов на ответ) не решило проблему, а иногда еще и снижало точность. Эмуляция фокусировки через кроп также дала минимальный эффект.

Scale Labs по итогу тестов пришли к выводу, что масштабирование логического вывода не компенсирует ограничения базовой архитектуры компьютерного зрения.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔40👏23❤15💔8🔥6😐5👍4🎉4💯4😁3🙉1
Media is too big
VIEW IN TELEGRAM
✔️ Anthropic апрувнул все заявки на Claude Code Projects

Все, кто подавался с тарифов Pro и Max - проверяйте.

Для тех кто не в курсе, Anthropic записали видеообзор новой сущности, разработанной на основе Projects, но для Claude Code.

В отличие от стандартных проектов в веб-интерфейсе, которые работают как изолированные базы знаний для чата, Claude Code Projects превращают рабочее пространство в среду для полноценного автономного агента, способного координировать сложную разработку.



@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🎉29👍12❤11🤩9🔥3👏3💯3🤔1👌1