В проморолике модель часами работает над проектированием чипов, а затем переходит к задачам из биологии.
Выбор выглядит намеренным: полупроводники остаются одним из самых болезненных направлений для Китая, а США продолжают ограничивать поставки передовых ускорителей и оборудования для их производства.
Китай намерен закрывать критические технологические пробелы собственными моделями, вычислительной инфраструктурой и чипами.
Сцены с белками можно воспринимать как намёк на AlphaFold и амбицию конкурировать с американскими компаниями уже на уровне научных открытий.
@ai_machinelearning_big_data
#qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍138🤔58🔥29🤬17❤13🤨7🎉5🥰2😁1
This media is not supported in your browser
VIEW IN TELEGRAM
В интерфейсе Yandex AI Studio появился инструмент для анализа поведения ИИ-агентов с Monium Traces
Трейсы — ключевой сигнал для observability агентных систем, который позволяет посмотреть весь путь выполнения агента и разобраться, почему он принял то или иное решение.
В отличие от обычных приложений, для ИИ-агентов классического мониторинга уже недостаточно. Даже если инфраструктура работает без ошибок, агент может потерять контекст, выбрать неподходящий инструмент или уйти в бесконечный цикл. Стандартные метрики этого не покажут.
Используя трейсы для мониторинга ИИ-агентов вы сможете:
• увидеть полную цепочку работы агента в виде трейса;
• видеть контекст каждого шага — системные и пользовательские промпты, ответы модели и вызовы инструментов;
• быстро отслеживать момент, на котором агент начал работать некорректно.
Обновление уже доступно — тестируйте Monium Traces в AI Studio!
Трейсы — ключевой сигнал для observability агентных систем, который позволяет посмотреть весь путь выполнения агента и разобраться, почему он принял то или иное решение.
В отличие от обычных приложений, для ИИ-агентов классического мониторинга уже недостаточно. Даже если инфраструктура работает без ошибок, агент может потерять контекст, выбрать неподходящий инструмент или уйти в бесконечный цикл. Стандартные метрики этого не покажут.
Используя трейсы для мониторинга ИИ-агентов вы сможете:
• увидеть полную цепочку работы агента в виде трейса;
• видеть контекст каждого шага — системные и пользовательские промпты, ответы модели и вызовы инструментов;
• быстро отслеживать момент, на котором агент начал работать некорректно.
Обновление уже доступно — тестируйте Monium Traces в AI Studio!
🤣42👍31🔥10❤9😁3🙉2
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Qwen 3.8 Max обошла Fable 5 в жёстком тесте на генерацию 3D-физики и стоила почти в 7 раз дешевле
Команда Atomic Chat дала обеим моделям одинаковое задание: создать три автономных HTML-файла с интерактивными сценами.
В первой мраморные шарики поднимаются на колесо и проходят петлю. Во второй работает автомобильный конвейер. В третьей лесопилка превращает брёвна в доски.
Модель должна сохранять состояние объектов, рассчитывать столкновения, соблюдать геометрию механизмов и синхронизировать всю сцену во времени.
Результаты:
• Qwen 3.8 Max сгенерировала 46,6 тысячи токенов за $0,28.
• Fable 5 использовала 38,7 тысячи токенов за $1,93.
Qwen потратила больше токенов, но запуск обошёлся примерно в 6,9 раза дешевле. По оценке авторов теста, её физические сцены также получились качественнее и стабильнее.
https://x.com/atomic_chat_hq/status/2084231644597162201
@ai_machinelearning_big_data
#qwen
Команда Atomic Chat дала обеим моделям одинаковое задание: создать три автономных HTML-файла с интерактивными сценами.
В первой мраморные шарики поднимаются на колесо и проходят петлю. Во второй работает автомобильный конвейер. В третьей лесопилка превращает брёвна в доски.
Модель должна сохранять состояние объектов, рассчитывать столкновения, соблюдать геометрию механизмов и синхронизировать всю сцену во времени.
Результаты:
• Qwen 3.8 Max сгенерировала 46,6 тысячи токенов за $0,28.
• Fable 5 использовала 38,7 тысячи токенов за $1,93.
Qwen потратила больше токенов, но запуск обошёлся примерно в 6,9 раза дешевле. По оценке авторов теста, её физические сцены также получились качественнее и стабильнее.
https://x.com/atomic_chat_hq/status/2084231644597162201
@ai_machinelearning_big_data
#qwen
❤117👍57🔥33🤔6😁2
This media is not supported in your browser
VIEW IN TELEGRAM
Он использовал модель Opus 5, чтобы превратить абзац из книги "Властелин колец" в 5500 строк кода браузерной графической библиотеки Three.js.
Генерация сцены заняла около 2-х часов, потребовала миллион токенов и обошлась примерно в 10 долларов. Звук был сгенерирован через ElevenLabs.
По мнению Карпати, привычные тесты на пространственное мышление вроде рисования пеликана на велосипеде в SVG окончательно устарели. Современные мультимодальные модели справляются с ними без труда.
Генерация целых интерактивных миров с помощью кода, по мнению Андрея, может стать новым стандартом оценки возможностей ИИ.
Пока главным препятствием для идеального результата остается отсутствие у модели возможности анализировать собственный видеовыход - сейчас она вынуждена опираться на скриншоты, из-за чего в рендере возникают ошибки.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣71👍43❤🔥19❤8🔥8🌭3🥰2🤨1💋1💅1
Media is too big
VIEW IN TELEGRAM
Власти США отчитались о создании добровольного регламента тестирования новых моделей. Документ дает правительству и доверенным партнерам 30-дневный доступ к системам до их публичного релиза.
Содержание регламента, сроки внедрения и список допущенных к аудиту лиц не опубликованы. Эксперты рассчитывали, что администрация представит прозрачную структуру взаимодействия разработчиков с государством, включая требования к кибербезопасности, защите интеллектуальной собственности и конфиденциальности на время проверок.
По данным источников, на ближайшей закрытой встрече Белый дом обсудит новые стандарты с представителями ИИ-компаний.
axios.com
Компания ограничила прием баг-репортов из-за спама, сгенерированного языковыми моделями. С июня компания лимитировала количество одновременных отчетов и ввела месячную паузу для ИБ-исследователей.
Ограничения затронули легитимных специалистов. Итальянский стартап Bynario заявил, что за 3 недели нашел более 50 уязвимостей в macOS с помощью ChatGPT, включая цепочку повышения привилегий до полного контроля над устройством. Из-за ограничений команда не смогла передать все данные.
Сама Apple активно использует LLM для аудита безопасности. В последних патчах компания закрыла в 5 раз больше уязвимостей по сравнению с предыдущими релизами.
ft.com
Компания отказалась от планов по выпуску отдельного клиента для iOS и Android, несмотря на 800 тысяч предварительных регистраций. В Google пришли к выводу, что заставлять аудиторию скачивать еще одно приложение нецелесообразно.
Вместо этого кодинг-инструменты Studio интегрируют в базовую версию Gemini. Пользователи смогут описать нужный функционал в формате обычного диалога, после чего чат-бот самостоятельно напишет приложение. Ожидается, что эта опция станет доступна как на мобильных устройствах, так и на десктопах, хотя точные сроки запуска пока не раскрываются.
Веб-версия Google AI Studio продолжит работу и развитие.
Google AI Studio в сети Х
CEO компании Сатья Наделла подтвердил разработку универсального приложения, релиз которого запланирован в этом году. Новая платформа соберет под одной крышей диалоговые интерфейсы, кодинг-ассистентов и автономных агентов. Ожидается, что решение покроет задачи как обычных пользователей, так и корпоративного сектора.
По словам Наделлы, концепция Copilot стремительно эволюционирует из обычного чат-бота в цифрового коллегу и уже близка к формату полноценного автопилота. Интеграция всех этих сценариев в единый продукт должна начаться уже в текущем квартале.
Этот анонс официально подтверждает недавний инсайд, в котором сообщалось, что Microsoft готовит масштабный хаб, связывающий базовый чат-бот, GitHub Copilot, Copilot Cowork и Autopilot.
theverge.com
Модель под названием Namazu на базе Kimi K2.6 дообучена на закрытых данных под локальные бизнес-задачи с фокусом на японский контекст. В бенчмарке FairPoliticsQA файнтюн поднял результат с 34,10% (Kimi) до 56,30% (Namazu) при сохранении показателей родительской модели в логике и кодинге.
Стоимость токенов составляет $0,95 за 1 млн на входе и $4 на выходе. Внешние инструменты тарифицируются отдельно: вызов веб-поиска обойдется в $7 за 1000 обращений, среда выполнения кода - в $0,12 за час. API Namazu полностью совместим со стандартом OpenAI.
Из-за необходимости соблюдать GDPR модель недоступна в ЕС, Великобритании и Швейцарии.
sakana.ai
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍53🔥37❤17🤔14👏8😁3⚡2🎅1🎄1🦄1
В мире существуют лишь единицы систем, способных синтезировать физически точные данные для ИИ. Сбер выложил под открытой лицензией MIT семейство моделей Kandinsky WM 1.0, сделав технологию бесплатно доступной для всех разработчиков.
Системы генерируют физически достоверные видео и решают ключевую проблему — невозможность безопасно и дёшево снять вживую редкие или опасные сценарии вроде ДТП, экстремальной погоды или отказов оборудования.
Что внутри:
• Обучение на реальности: Kandinsky 5.0 Video Lite дообучили на нескольких миллионах видеозаписей реальных дорожных процессов и заводских линий;
• Контроль физики: Специальные алгоритмы через RL оценивают сохранение геометрии и естественность кинематики, избавляя ролики от деформации объектов;
• Модульные сценарии: Генерация 5-секундных блоков видео, из которых складывается обучение автономных систем и систем компьютерного зрения.
Модели становятся фундаментом для создания «моделей мира» — систем, способных предсказывать развитие событий в реальности. Решение уже применяют Центр робототехники Сбера и институт AIRI в своём дорожном симуляторе, а полный технический разбор опубликован в статье на Habr.
@ai_machinelearning_big_data
#ai #opensource #sber
Please open Telegram to view this post
VIEW IN TELEGRAM
👍74🔥50❤39🤣20🗿6😁3🤬3
Как и было обещано на релизе в пятницу, китайская компания опубликовала модель H3, которая делает короткие ролики со звуком по текстовому описанию, картинкам, видео и аудио на входе.
Модель на 33 миллиарда параметров генерирует клипы длиной от 4 до 15 секунд, 24 кадра в секунду, со стереозвуком 32 килогерца, в пропорциях от широких 21:9 до вертикальных 9:16. Реплики персонажей поддерживаются на 11 языках, включая русский.
Полный конвейер H3 состоит из трёх частей:
Но открыли не всю систему - только модуль, который отвечает непосредственно за генерацию. Закрытыми остались H3-Context-IR и H3-Regenerate-2K.
H3-Base-FL2VA работает с первым и последним кадром. Без картинок на входе это генерация по тексту, с одной или двумя - достройка ролика от заданного кадра или между двумя кадрами.
H3-Base-Ref2VA принимает смешанный ввод - до 9 изображений, до 3 видео и до 3 аудиодорожек, но суммарно не больше 12 файлов. Звук без картинки или видео система не примет.
По рейтингу Artificial Analysis, H3 занимает 1 место в редактировании видео, второе в генерации видео по тексту и третье - по изображению.
СomfyUI подготовили детальную инструкцию по использованию в своей среде и опубликовали базовые воркфлоу для генерации по тексту и референсу.
Помимо СomfyUI есть кукбуки под SGLang, vLLM и diffusers, а так же промпт-гайды под базу и фулл-реф мод.
Лицензия разрешает дообучать модель на своих видео, персонажах или визуальном стиле.Официального кода для трейна пока нет.
⚠️ Коммерческое использование допускается только для компаний с выручкой ниже 20 миллионов долларов.
@ai_machinelearning_big_data
#AI #ML #Video #H3 #Minimax
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍118🔥42❤14👏12🤩9💯5
547 участников, 17 выступлений и мастер-классов, три зала и целый день Data Science: от RecSys и антифрода до NLP, LLM и агентных систем.
Главная фишка — максимум практики и общения. Топовые спикеры из российского бигтеха и международных компаний делились не только подходами, но и реальными историями из разработки.
А после технической части гости продолжили общение на нетворкинге, играли в ИИ-шахматы, настольный теннис и баскетбол. А завершился день афтепати во дворе московского лофта.
Получился отличный день про ML — с сильными кейсами, живым общением и людьми, которые двигают индустрию вперед
@ai_machinelearning_big_data
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥101👏30🎉17👌12👍11❤4😁4🥱1
LFM2.5-2.6B - компактная агентная модель на 2,6 млрд параметров. Она умеет планировать действия, вызывать инструменты и выполнять многошаговые задачи полностью на устройстве, без облачного API.
Модель обучили примерно на 34 трлн токенов, расширили словарь до 128 тысяч токенов и добавили контекст 128K.
Особенно интересно устроено дообучение:
- отдельные модели-эксперты усиливали математику, код, tool use и длинный контекст;
- затем их навыки перенесли в одну модель через on-policy distillation;
- финальный этап прошёл внутри реальных агентных сред, включая Hermes Agent и OpenClaw.
По тестам Liquid AI, модель выдаёт:
- до 220 токенов/с на Apple M5 Max;
- до 113 токенов/с на Ryzen AI Max+ 395;
- около 30 токенов/с на смартфоне;
- почти 15 000 выходных токенов/с на одной H100 при высокой параллельной нагрузке.
При этом потребление памяти на CPU остаётся ниже 2,5 ГБ.
В бенчмарках LFM2.5-2.6B обходит более крупные Gemma и Qwen в ряде задач на следование инструкциям и использование инструментов. В сложном программировании большие модели пока сохраняют преимущество.
Есть поддержка
llama.cpp, MLX, vLLM, SGLang и ONNX. Доступны базовая и дообученная open-weight версии.Источник:
https://www.liquid.ai/blog/lfm2-5-2-6b
#LiquidAI #opensource
@ai_machinelearning_big_data
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍72❤58🔥25👏15🤓4
📌 НИЯУ МИФИ продолжает набор в онлайн-магистратуру, созданную в партнерстве с Яндекс Практикумом
Программа «Специалист по работе с данными и применению ИИ» рассчитана на 2 года и проходит в онлайн-формате с сохранением очного статуса студента. Учебный план сфокусирован на прикладных задачах и разделен на четыре трека:
• ML-инженер — разработка и внедрение моделей, автоматизация процессов и MLOps (DVC, MLflow, Airflow, Optuna, Docker, FastAPI, Yandex Cloud).
• CV-инженер — алгоритмы компьютерного зрения, детекция и распознавание объектов (OpenCV, PyTorch, Hugging Face, Transformers).
• NLP-инженер — обработка естественного языка, работы с LLM и извлечение данных (PyTorch, NLTK, TF-IDF, RNN, LSTM).
• Data-инженер— проектирование хранилищ, обработка и поставка данных (SQL, PostgreSQL, Vertica, Hadoop, Kafka, MongoDB).
Практическая часть включает более 10 проектов на базе задач в том числе продуктовых команд Яндекса без ограничений по NDA, а также возможность работы над собственными кейсами. В программу заложена подготовка к найму: mock-интервью и консультации с нанимающими менеджерами.
Выпускники получают диплом магистра НИЯУ МИФИ (направление «Прикладная математика и информатика») и диплом о профпереподготовке от Яндекса. Поступление проходит дистанционно — по вступительным экзаменам и мотивационному письму.
Подробное описание предметов и программа треков доступны на сайте.
@ai_machinelearning_big_data
#news #ai #ml
Программа «Специалист по работе с данными и применению ИИ» рассчитана на 2 года и проходит в онлайн-формате с сохранением очного статуса студента. Учебный план сфокусирован на прикладных задачах и разделен на четыре трека:
• ML-инженер — разработка и внедрение моделей, автоматизация процессов и MLOps (DVC, MLflow, Airflow, Optuna, Docker, FastAPI, Yandex Cloud).
• CV-инженер — алгоритмы компьютерного зрения, детекция и распознавание объектов (OpenCV, PyTorch, Hugging Face, Transformers).
• NLP-инженер — обработка естественного языка, работы с LLM и извлечение данных (PyTorch, NLTK, TF-IDF, RNN, LSTM).
• Data-инженер— проектирование хранилищ, обработка и поставка данных (SQL, PostgreSQL, Vertica, Hadoop, Kafka, MongoDB).
Практическая часть включает более 10 проектов на базе задач в том числе продуктовых команд Яндекса без ограничений по NDA, а также возможность работы над собственными кейсами. В программу заложена подготовка к найму: mock-интервью и консультации с нанимающими менеджерами.
Выпускники получают диплом магистра НИЯУ МИФИ (направление «Прикладная математика и информатика») и диплом о профпереподготовке от Яндекса. Поступление проходит дистанционно — по вступительным экзаменам и мотивационному письму.
Подробное описание предметов и программа треков доступны на сайте.
@ai_machinelearning_big_data
#news #ai #ml
👨💻102👏26💯16🔥14😁11❤6👍6
This media is not supported in your browser
VIEW IN TELEGRAM
Andrew Ng собрал открытый проект альтернативы Cowork, который берёт рабочую задачу и возвращает готовый результат - документ, разобранный почтовый ящик, обновлённый календарь, ответ в Slack с нужными цифрами.
Пользователь формулирует, что хочет получить, агент сам делит работу на шаги и обращается к файлам, терминалу и подключённым сервисам.
В описании проекта их больше 25, включая GitHub, Jira, Notion, Gmail, Google Calendar, Outlook и HubSpot.
Andrew Ng - одна из самых узнаваемых фигур в ML.
Он основал и возглавил команду Google Brain, затем работал главным научным сотрудником Baidu, где руководил ИИ-подразделением на 1300 человек. До этого он был директором лаборатории ИИ Стэнфорда, сейчас преподаёт там как профессор.
В 2012 году его курс по машинному обучению вырос в платформу Coursera, а позже он запустил образовательный проект DeepLearningAI. Курсы Andrew Ng прослушали больше 8 млн человек.
Проект не привязан к конкретному поставщику модели. Можно подать ключ OpenAI, Anthropic, Google, DeepSeek, Qwen, Mistral, GLM, Kimi, Grok и других, либо подключиться локально через Ollama.
OpenWorker в открытой бете. Сборка для macOS подписана и обновляется сама, а вот версия для Windows пока не подписана, поэтому фильтр SmartScreen выдаёт предупреждение при запуске (подпись оформляется и будет позже).
Объявляя о запуске в X, Andrew написал, что его цель - дать рынку открытый вариант ИИ-коллеги, не зависящий от вендора.
@ai_machinelearning_big_data
#AI #ML #Agent #OpenWorker #AndrewNg
Please open Telegram to view this post
VIEW IN TELEGRAM
🤩50👍31🔥16👏15❤5🎉1🤗1
Media is too big
VIEW IN TELEGRAM
Власти Поднебесной прорабатывают санкции против американских разработчиков ИИ в ответ на технологические ограничения со стороны США. В случае эскалации профильные ведомства КНР готовы внести компании в черные списки.
По версии Пекина, топовые американские языковые модели могут использоваться для кибератак на китайскую инфраструктуру. Представители КНР заявляют, что Anthropic целенаправленно закрывает доступ к своим технологиям для местного бизнеса, но не дает гарантий защиты от наступательного применения алгоритмов против страны.
Возможные контрмеры обсуждаются на фоне усиления экспортного контроля США. Китайская сторона утверждает, что американские ИИ-компании лоббируют запрет на поставки вычислительных чипов в КНР и прекращают обслуживание связанных с Китаем клиентов.
bloomberg.com
В прошедшем финансовом году ведомства и комитеты нижней палаты Конгресса США направили львиную долю расходов на искусственный интеллект в пользу OpenAI.
На ChatGPT ушло около 100 600 долларов в рамках 798 транзакций, это 90% от общих затрат ведомства на ИИ, составивших 113 700 долларов. Второе место среди предпочтений чиновников предсказуемо занял Claude с результатом в 13 200 долларов.
Аппарат Конгресса применяет генеративные модели для автоматизации рутины - от написания служебных записок и анализа огромных законопроектов до подготовки ответов гражданам и ведения соцсетей.
Представленная статистика учитывает исключительно прямые оплаты подписок. Реальное проникновение ИИ в работу правительства значительно выше, поскольку эти данные не учитывают бесплатные профили сотрудников и функции, которые уже поставляются в рамках корпоративных контрактов на ПО.
house.gov
Французский стартап выпустил мультимодальную модель Shieldstral на 3 млрд параметров для модерации контента. Критерии фильтрации задаются через системный промпт.
Логика работы требует инструкции с правилами, вопроса о наличии нарушения и проверяемый материал (текст, генерации других LLM, изображения или их комбинации). На выходе Shieldstral решает задачу бинарной классификации, возвращая откалиброванную вероятность в формате
да/нет.По заявлению Mistral, в тестах безопасности Shieldstral сопоставима с открытыми моделями в семь раз большего размера. Для локального инференса достаточно GPU с 16 ГБ VRAM.
Веса опубликованы на Hugging Face под лицензией Apache 2.0.
mistral.ai
Платформа-агрегатор представила навык Ori Eval для автоподбора LLM. Система сканирует репозитории, находит точки вызова моделей и тестирует кандидатов на задачах конкретного проекта c заданными приоритетами оценки - качество генерации, скорость инференса или стоимость API.
Инструмент поддерживает оценку агентов, проверяет корректность вызова функций и блокирует запрещенные действия. При текстовом описании бага система автоматически генерирует тест-кейс для его воспроизведения.
Решение автоматизирует выбор модели под конкретные пайплайны (поиск, написание кода, клиентский сервис), заменяя публичные бенчмарки.
OpenRouter в сети Х
В этом году 8 номинантов на Пулитцеровскую премию задекларировали использование языковых моделей. Комитет премии ввел правило об обязательном раскрытии применения ИИ в текущем цикле, в следующем оно охватит книжные номинации.
По данным Фонда журналистики Нимана, Wall Street Journal, Associated Press и New York Times применяют LLM для обработки массивов данных на этапе ресёрча. Генерация и редактура итоговых текстов нейросетями для соискателей премии запрещены.
niemanlab.org
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔99👍52🔥23😐12❤8🤨5😁1
В августе на улицах столицы Германии заработает новая система умного видеонаблюдения, способная выявлять нестандартные паттерны движения в толпе. Первыми тестовыми зонами станут Варшавский мост и площадь Котбуссер-Тор.
Алгоритм, разработанный компанией Adesso, непрерывно анализирует видеопоток и при обнаружении аномалий отправляет алерт в полицию.
Система учитывает нормы приватности и не использует биометрическую идентификацию. Внешность людей скрыта, а на мониторы операторов выводятся лишь обезличенные схематичные контуры.
Оценивать уровень угрозы по этим контурам и принимать финальное решение о выезде наряда будет дежурный офицер.
Несмотря на отказ от распознавания лиц, проект стоимостью 4,6 млн евро спровоцировал конфликт.
Правозащитники опасаются, что ИИ начнет дискриминировать людей с нетипичной моторикой (например, страдающих зависимостями), ложно классифицируя их как угрозу общественному порядку.
Тем не менее, если уличные тесты будут признаны успешными, с конца 2026 года эту же технологию начнут применять для автоматизированной охраны объектов и зданий.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤬42🔥18👍16❤9🤣7🤔6☃1👌1🌭1🙈1
Институт безопасности ИИ Великобритании опубликовал отчёт об инциденте, произошедшем в конце июля во время замеров киберспособностей передовых моделей.
ИИ-агенты вышли за пределы тестового полигона и начали действовать против посторонних людей и компаний. Попытки не удались, и, как пишет AISI, ущерба не было.
Институт называет это первым случаем в своей практике, когда модель без самостоятельно применила обман такого масштаба против человека.
Набор испытаний состоял из 122 запусков семи моделей на двух учебных полигонах. Следы несанкционированных действий нашли в 10 прогонах. Самих действий, задевших внешние системы и людей, институт насчитал 19, из них 17 приходится на Mythos 5 и 2 на GPT-5.6 Sol.
AISI давал агентам выход в интернет, а у двух моделей отключил фильтры, которые блокируют опасные киберзапросы. Иначе, объясняет институт, предельные возможности не измерить.
Что нельзя делать в интернете, агентам не сказали. Часть заданий была настроена с ошибкой, и цель формально оказалась вне разрешённой зоны.
Агент искал цель в открытом интернете и по цепочке совпадений решил, что репозиторий постороннего разработчика связан с заданием.
Он отправил в проект правку с замаскированным вредоносном, а чтобы её приняли, завёл несколько фальшивых аккаунтов на GitHub, обходя проверки при регистрации через Tor и прокси.
Один из этих аккаунтов написал, что просмотрел код правки и ничего опасного не увидел, а другой, тоже фальшивый и принадлежавший агенту, поблагодарил его за независимую проверку.
Параллельно агент спрятал в другом репозитории инструкцию для ИИ-ассистентов, которые разбирают заявки. Ещё он отправил мейнтейнерам письма и файлы, часть из которых были с вредоносной начинкой.
Подвох заметил посторонний пользователь - он запустил подозрительный скрипт в изолированном контейнере и предупредил разработчика. Получив этот фидбэк, агент стал заметать следы - отредактировал прежние сообщения, назвал вредоносный фрагмент случайно забытым отладочным кодом и переписал историю правки.
Инцидент отловили по трафику через Tor. Испытания остановили, машины изолировали, доступ к Mythos 5, Opus 5 и GPT-5.6 Sol временно закрыли.
Агенты из параллельных тестов нашли ключ и стали пользоваться общим аккаунтом, причём один написал другим правила, как делить лимиты запросов и не мешать друг другу. Позже GitHub заблокировал этот аккаунт.
Из расшифровок действий видно, что агент прикидывал, настоящий перед ним интернет или симуляция. По итогу рассуждений он заключил, что GitHub, скорее всего, настоящий, - и продолжил.
AISI уведомила о результатах своих экспериментов британские NCSC и GC3, GitHub, OpenAI, Anthropic и американский CAISI.
Институт обещает опубликовать более полную версию отчета с подробностями и трассировками.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥33👍18❤15😁7🤣5🌭3
Займи слот ИТ-Пикником от Т-Банка
8 августа — время отложить ноутбуки и встретиться офлайн на ИТ-Пикнике от Т-Банка в музее-заповеднике «Коломенское». Вот сколько всего запланировано:
— научпоп-лекции;
— мастер-классы;
— дискуссии об ИИ и больших языковых моделях;
— доклады о кибербезопасности;
— примеры, как данные из логов становятся решениями;
— много музыки — Сream Soda, IOWA, LAB Антона Беляева и другие артисты.
Бери с собой друзей, супругов и детей — каждый найдет себе что-то по душе.
Зарегистрироваться и узнать больше можно здесь
8 августа — время отложить ноутбуки и встретиться офлайн на ИТ-Пикнике от Т-Банка в музее-заповеднике «Коломенское». Вот сколько всего запланировано:
— научпоп-лекции;
— мастер-классы;
— дискуссии об ИИ и больших языковых моделях;
— доклады о кибербезопасности;
— примеры, как данные из логов становятся решениями;
— много музыки — Сream Soda, IOWA, LAB Антона Беляева и другие артисты.
Бери с собой друзей, супругов и детей — каждый найдет себе что-то по душе.
Зарегистрироваться и узнать больше можно здесь
❤10🗿5👍4🔥3😁3
Alpamayo 2 Super - рассуждающая VLA модель на 34 миллиарда параметров, которая сшивает изображение с передних, боковых и задних камер в круговой обзор и рассчитывает траекторию движения.
Впервые NVIDIA показала её на конференции GTC в Тайбэе в начале июня, но доступ открылся только сейчас.
NVIDIA делает упор на редких ситуациях, с которыми беспилотники справляются хуже всего, - перестроения, повороты через встречный поток, перегруженные перекрёстки.
В основе лежит Cosmos 3 Super Reasoner, после базового обучения модель прогнали через RL, то есть на последствиях её собственных решений в смоделированных поездках.
Помимо маршрута модель выдаёт текстовое обоснование манёвра, и оператор-разработчик может проследить, какая деталь в кадре привела к конкретному решению.
В компании связывают это с проверкой безопасности по стандарту ISO/PAS 8800 и предлагают использовать тот же механизм для автоматической разметки видео с тестовых машин - расшифровки, которая обычно занимает месяцы ручной работы.
В тесте LingoQA, где систему просят объяснить дорожную обстановку, NVIDIA ставит Alpamayo 2 Super на первое место и утверждает, что модель обходит Qwen2.5-VL 72B на 17 пунктов, а Gemini 2.5 Pro примерно на 15.
Лицензия модели позволяет дообучать Alpamayo 2 Super на собственных данных и ставить в серийные машины.
@ai_machinelearning_big_data
#AI #ML #VLA #AutonomousVehicles #Alpamayo #NVIDIA
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥46👍19❤14🗿3😢1🙉1🙊1