По бенчмаркам заметный скачок в кодинге и агентных задачах. Контекст раздули до 1 миллиона токенов, так что модель держит в голове огромные объёмы и хорошо тянет длинные многошаговые сценарии.
Внутри два режима рассуждений. GLM-5.2 (max) выжимает максимум качества, а GLM-5.2 (high) ищет баланс между мозгами и экономией токенов.
Цены на API оставили теми же, что у GLM-5.1. Веса уже лежат на Hugging Face, есть API, чат и тарифы для разработчиков.
Tech Blog: https://z.ai/blog/glm-5.2
Weights: https://huggingface.co/zai-org/GLM-5.2
API: https://docs.z.ai/guides/llm/glm-5.2
Coding Plan: https://z.ai/subscribe
Chat: https://chat.z.ai
Please open Telegram to view this post
VIEW IN TELEGRAM
👍93🤩46🔥22❤21👏2😁2🤣1
Anthropic опубликовала отчёт, в котором утверждает, что главным фактором успеха при работе с ИИ-агентами для программирования оказывается не владение кодом, а понимание самой задачи.
Вывод основан на анализе около 400 тысяч сессий сервиса Claude Code, проведённых примерно 235 тысячами пользователей с октября 2025 по апрель 2026 года.
В типичной сессии человек принимает около 70% решений о том, что делать, тогда как агент берёт на себя примерно 80% решений о том, как это сделать. Иными словами, человек ставит задачу, а ассистент выбирает способ её выполнения.
Чем глубже пользователь разбирается в предметной области, тем больше работы агент выполняет по одной команде. По оценке команды, у новичков одна реплика запускает в среднем около 5 действий ИИ и порядка 600 слов ответа, у экспертов - вдвое больше действий и впятеро больше текста.
Уровень владения при этом определялся не должностью, а тем, насколько точно человек формулирует требования и замечает ошибки агента.
При написании кода представители разных специальностей добиваются результата почти так же часто, как профессиональные программисты - все крупные профгруппы укладываются в 7 процентных пунктов от показателей инженеров.
В то же время разрыв между новичками и более опытными заметен. По критерию "подтверждённого успеха" сессии новичков завершались удачно в 15% случаев, а пользователей среднего уровня и выше - в 28–33%.
Доля сессий, посвящённых исправлению ошибок, упала с 33% до 19%.
Выросла доля задач, связанных с запуском и настройкой программ, анализом данных и подготовкой текстов.
Оценочная стоимость типичной задачи, рассчитанная через сравнение с расценками на биржах фриланса, поднялась в среднем примерно на 25%.
@ai_machinelearning_big_data
#AI #ML #Coding #Research #Anthropic
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔112💯33👨💻23❤21👏15🔥6🥱4👍2🤩1
Media is too big
VIEW IN TELEGRAM
Федеральный суд США отклонил без права пересмотра иск xAI к OpenAI, в котором компания Илона Маска обвиняла конкурентов в сборе данных о технологиях модели Grok 4 через хантинг сотрудников.
Претензии строились вокруг перехода старшего инженера Сюэчэня Ли. По версии xAI, на собеседованиях OpenAI намеренно расспрашивала кандидата о деталях разработки Grok 4. Истец утверждает, что OpenAI компенсировала таким образом собственное отставание в алгоритмах инференса, методах RL и пост-тренировке.
Суд постановил, что обсуждение прошлого опыта кандидата - стандартная практика индустрии, и не нашел доказательств принуждения к раскрытию коммерческой тайны. В OpenAI назвали разбирательство безосновательным и частью кампании давления со стороны Маска. За последний месяц это второе отклоненное дело xAI против команды Сэма Альтмана.
reuters.com
Компания отменила обновление биллинга, запланированное на 15 июня 2026 года. Agent SDK, интерактивный режим и сторонние интеграции планировали перевести на отдельную тарификацию вне стандартных подписок.
Клиентам собирались начислять ежемесячные кредиты: $20 на тарифе Pro и $200 для Enterprise. При перерасходе включалась оплата за токены по базовым расценкам API. Теперь эти инструменты продолжат использовать общие лимиты.
Бытует мнение, что отказ от перехода на другой тип тарификации вызван подготовкой OpenAI к снижению цен на API. Официально Anthropic объяснила паузу необходимостью адаптировать тарифы под реальные юзкейсы. К разделению лимитов компания планирует вернуться после снижения базовой стоимости собственных токенов.
claude.com
Microsoft переводит сервис Copilot Cowork с фиксированной подписки на тарификацию по мере использования и тестирует интеграцию модели DeepSeek V4. Ранее аналогичную схему оплаты внедрили для GitHub Copilot.
Руководитель направления Copilot назвал текущую бизнес-модель нерентабельной. Убытки генерируют активные пользователи, делегирующие ИИ сотни задач в неделю. Сейчас Cowork работает на базе моделей Claude, где агентные сценарии приводят к высокому расходу токенов.
В качестве бюджетной альтернативы Microsoft планирует опционально добавить в сервис дообученную версию DeepSeek V4. Модель развернут в Azure для изоляции клиентских данных внутри облака компании.
Окончательное решение о внедрении DeepSeek примут в ближайшие недели.
axios.com
OpenAI открылa доступ к Computer Use, расширению для Chrome, Memories и Chronicle в Codex для пользователей из ЕЭЗ, Великобритании и Швейцарии.
Computer Use позволяет ассистенту напрямую управлять интерфейсом macOS и Windows, расширение для Chrome - выполнять браузерные задачи в фоновом режиме.
С функцией Memories Codex запоминает предпочитаемый стек технологий, правила оформления кода в репозиториях и воркфлоу, а экспериментальный режим Chronicle на macOS автоматически формирует контекстную память на основе недавней активности на экране.
OpenAI Developers в сети Х
SpaceX договорилась о покупке стартапа Anysphere, разработчика кодинг-ассистента Cursor. Сумма сделки оценивается в $60 млрд, которые инвесторы стартапа получат в виде акций SpaceX.
Сделка призвана усилить позиции подразделения xAI на рынке ИИ-кодинга. Инженеры Cursor уже работают в офисах xAI над созданием новой совместной модели.
Покупка Anysphere открывает стартапу доступ к мощностям и запасам чипов SpaceX. В свою очередь xAI восполняет нехватку кадров: ранее проект покинули десятки специалистов, из-за чего к работе привлекали инженеров из Starlink и Tesla. Команду дополнит как основной штат Cursor, так и принадлежащее Anysphere профильное рекрутинговое агентство.
bloomberg.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤔87🔥29❤19👏13👍9🎉8🥰2🤣1👀1
Китайская компания объявила о запуске Kimi K2.7 Code HighSpeed - высокоскоростном режиме для своей мультимодальной модели Kimi K2.7 Code.
Moonshot утверждает, что ответы генерируются до 6 раз быстрее стандартной версии.
Обещают скорость около 180 токенов в секунду на средних запросах и до 260 токенов в секунду, если контекст короткий.
Версия разворачивается для участников программы Kimi Code Beta, разработчиков, использующих Kimi API, и корпоративных клиентов Kimi Business.
Отдельный инвайт не требуется: возможность получить доступ есть у всех, кто присоединился к бета-программе.
В официальном анонсе цены не названы; в нём лишь говорится, что "открытый интеллект должен быть мгновенным, доступным и не знающим границ".
Вместе с тем в ряде публикаций упоминается, что тарифы на API ускоренной версии вдвое выше, чем у стандартной.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍113🤔19❤17👏10🔥6
✔️ Хакатон по роботизации складов и компьютерному зрению с призовым фондом 15 млн рублей
Ozon Tech открыл регистрацию на Робозон: соревнование пройдёт со 2 июля по 12 сентября. Участникам предстоит разработать решения для автоматизации процессов в сортировочных центрах, где ежедневно обрабатывается до 55 млн операций.
Хакатон разделён на два этапа. Первый продлится два месяца в онлайн-формате — команды будут решать задачи по трём направлениям: имитационное моделирование, проектирование инженерных решений и разработка систем компьютерного зрения. Второй этап пройдёт на конференции E-CODE, куда Ozon Tech пригласит финалистов с оплатой дороги и проживания.
Участие индивидуальное или в командах до 7 человек. Регистрация через сайт. Открыта до 11 июля.
P.S. Подробнее о CV-задаче: интеллектуальной роботизированной системе сортировки товаров. Участникам нужно разработать решение, которое обнаруживает объекты на конвейере, определяет их тип с помощью CV-технологий и автоматически направляет в соответствующие зоны. Результат может быть представлен как программно-аппаратный комплекс или цифровая симуляция.
#news #ai #ml
Ozon Tech открыл регистрацию на Робозон: соревнование пройдёт со 2 июля по 12 сентября. Участникам предстоит разработать решения для автоматизации процессов в сортировочных центрах, где ежедневно обрабатывается до 55 млн операций.
Хакатон разделён на два этапа. Первый продлится два месяца в онлайн-формате — команды будут решать задачи по трём направлениям: имитационное моделирование, проектирование инженерных решений и разработка систем компьютерного зрения. Второй этап пройдёт на конференции E-CODE, куда Ozon Tech пригласит финалистов с оплатой дороги и проживания.
Участие индивидуальное или в командах до 7 человек. Регистрация через сайт. Открыта до 11 июля.
P.S. Подробнее о CV-задаче: интеллектуальной роботизированной системе сортировки товаров. Участникам нужно разработать решение, которое обнаруживает объекты на конвейере, определяет их тип с помощью CV-технологий и автоматически направляет в соответствующие зоны. Результат может быть представлен как программно-аппаратный комплекс или цифровая симуляция.
#news #ai #ml
👍93👏25🎉16😁10❤7👨💻6🏆5💯3🤬1
Qwen-Robot Suite — набор из 3 моделей для воплощённого интеллекта, который нацелен заполнить пробел между пониманием визуально-языковых моделей и физическим действием.
Модели RobotNav, RobotManip и RobotWorld отвечают соответственно за навигацию, манипуляцию и моделирование физического мира.
Построена на Qwen3-VL и объединяет в одной модели 5 навигационных задач: следование инструкциям, поиск объекта, слежение за целью, автономное вождение и ответы на вопросы о среде.
Поведение задаётся через протокол наблюдения с 4 параметрами - бюджет визуальных токенов, временное затухание, веса камер и режим выборки кадров.
Qwen заявляет о рекордных результатах в 5 областях и о работе без дообучения на четвероногом Unitree Go2.
Опирается на Qwen3.5-4B VL и модуль формирования действий на базе flow-matching DiT. Она использует единое 80-мерное представление состояния и действия для разных типов роботов.
Разработчики сообщают о точности 91,4% в тесте LIBERO-Plus и о 1 месте в одном из треков конкурса RoboChallenge.
Модель мира. По текущему наблюдению и текстовой команде она предсказывает, как изменится сцена. Все действия описываются естественным языком, что позволяет объединить в одной системе более 20 типов роботов и свыше 500 категорий действий.
В основе лежит 60-слойная архитектура MMDiT, связанная с представлениями Qwen2.5-VL.
Qwen рапортует о первых местах в тестах на соответствие физическим законам (EWMBench, WorldModelBench и других), в части из них - среди открытых моделей.
Это браузерное демо управления текстовыми командами и наблюдением за реакцией робота в реальном времени.
Сейчас оно работает только с упрощённой версией модели RobotManip, которая была обучена на наборе из 50 задач. Её цель - показать частичную способность выполнять незнакомые инструкции.
В анонсе не указано, будут ли открыты ли веса и под какой лицензией. Пока доступны технические отчёты и анонсы по каждой модели.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍97❤28🎉26👏17🤩9🤔6🔥4🥰2
Media is too big
VIEW IN TELEGRAM
Компания опубликовала методику Deployment Simulation для тестирования безопасности LLM. Подход оценивает поведение моделей в условиях, имитирующих продакшен.
Вместо синтетических промптов новой модели передают анонимизированную историю диалогов пользователей с предыдущими версиями ИИ и запрашивают генерацию следующего ответа. В такой среде метрика распознавания тестирования снижается со 100% до 5,4%. При проверке задач с вызовом функций используется вспомогательная модель, имитирующую ответы окружения.
По тестам, Deployment Simulation предсказывает генерацию запрещенного контента или обман в 92% случаев против 54% у классических бенчмарков. При тестировании серии GPT-5 выяснилось, что GPT-5.1 использовала браузер в качестве калькулятора, рапортуя пользователю о выполнении веб-поиска.
Метод применим для независимого аудита сторонних моделей на базе открытых датасетов диалогов, без доступа к внутренним логам разработчика.
openai.com
Odyssey ML привлек $310 млн от Amazon, Nvidia, AMD, фонда IQT, Google Ventures и главного научного сотрудника Google Джеффа Дина. Средства пойдут на создание 3D-моделей мира, а вычисления проекта развернут в облаке AWS на базе ускорителей Amazon Trainium.
Основатели стартапа Оливер Кэмерон и Джефф Хоук ранее разрабатывали системы автономного вождения. Архитектура моделей Odyssey ML сфокусирована на симуляции законов физики, пространственных связей, динамики объектов и кинематики.
ft.com
По сравнению с базовой версией стоимость значительно снижена, а скорость генерации выросла вдвое относительно тарифа Fast.
Модель генерирует ролики длиной до 15 секунд в разрешении 720p при 24 FPS. Mini поддерживает мультимодальные промпты: текстовый запрос можно дополнить референсными изображениями, аудио или видео для сохранения похожести персонажей и объектов в кадре.
Инструмент уже интегрирован в пользовательские приложения CapCut, Dreamina и Jimeng. Доступ к API обещают с 22 июня через облачные платформы Volcengine и BytePlus.
capcut.com
Портал обзавёлся функцией Teams для управления корпоративными аккаунтами. Платформа заменила индивидуальную оплату за рабочие места на общий пул кредитов.
Администратор пополняет единый баланс и приглашает пользователей. Разработчики могут состоять в нескольких командах одновременно и переключаться между ними без создания отдельных профилей.
Для контроля расходов добавлен дашборд Spend Intelligence. Инструмент показывает детализированную статистику потребления в реальном времени, позволяет задавать лимиты списаний для отдельных участников и оперативно отзывать права доступа.
NousResearch в сети Х
Исследователь Microsoft Эдриан де Винтер построил нейросеть в редакторе карт Age of Empires II для критики антропоморфизма при оценке LLM.
Архитектура собрана из игровых объектов. Роль битов выполняют козы (животное на траве= 0, на мосту=1), логика реализована через встроенные скрипты. Модель обучилась логической операции "AND".
Проект иллюстрирует математическую природу нейросетей. Эмпатия к языковым моделям вызвана текстовым интерфейсом: перенос вычислений на поведение виртуальных коз дает тот же результат, но не создает иллюзию сознания.
Проанализировав более 300 научных статей об ИИ, де Винтер обнаружил, что свыше 50% авторов приписывают алгоритмам человеческие черты. Подобный подход ведет к методологическим ошибкам и циклической логике экспериментов. Эдриан призывает коллег не наделять код когнитивными функциями и анализировать строго ввод и вывод данных.
Сценарий карты выложен в открытый доступ.
adewynter.github.io
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍121🔥25🤔22❤18👏8😁8
Исследователи проекта Rchatgpt-pulse проанализировали 3 года публикаций в сообществе Реддит
r/ChatGPT и пришли к выводу, что обращения к чат-боту за психологической поддержкой и формирование привязанности к нему начала расти почти сразу после выхода модели GPT-4o. Учёные изучили 137 154 поста за период с декабря 2022 по ноябрь 2025 года, выделяя в них смысловые признаки.
Помимо ретроспективного анализа, они представили систему мониторинга PuLSE и утверждают, что она могла зафиксировать рост эмоциональной вовлечённости за несколько месяцев до того, как тема вышла в публичное поле.
Со временем доля постов с базовыми вопросами (как пользоваться, проблемы со входом) снизилась, а доля сообщений о более продвинутом и привычном использовании выросла.
Авторы трактуют это как превращение технологии в рутинный потребительский продукт.
По подсчётам, эмоциональная вовлечённость присутствовала минимум в 30,5% жалоб на новую модель пятого поколения (OpenAI оценила подобные сценарии в 1,9% всех сообщений).
В этом расхождении авторы видят довод в пользу того, что одна лишь частота использования не отражает масштаб влияния продукта.
В системной карте GPT-4o OpenAI отмечала риск антропоморфизации и эмоциональной зависимости, а Сэм Альтман позднее заявлял, что тему психического здоровья и личного использования в OpenAI "отслеживают примерно последний год", т.е сами наблюдения не были для компании новостью.
У проекта есть интерактивный ресурс, который обновляется ежедневно. На нём можно посмотреть темы из анализа как в режиме реального времени, так и ретроспективно, а также изучить категории тем в виде карты.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤32🤔21👍13👏6🔥4😐3🎃2
Вышли LFM2.5-Embedding-350M и LFM2.5-ColBERT-350M. Это первые двунаправленные модели в семействе LFM, сделанные на базе LFM2.5-350M-Base.
Главный фокус: быстрый мультиязычный поиск для RAG, FAQ, каталогов, саппорта и баз знаний. Поддерживаются 11 языков, включая арабский, японский, корейский и европейские языки.
Архитектурно Liquid взяли causal decoder и превратили его в bidirectional encoder: убрали causal mask, включили full attention и сделали короткие свёртки не-причинными. Теперь каждый токен видит контекст с двух сторон, что важно для retrieval.
Разница между моделями:
• LFM2.5-Embedding-350M даёт один dense vector на документ. Индекс компактный, поиск быстрый, хранение дешёвое.
• LFM2.5-ColBERT-350M хранит вектор на каждый токен и использует MaxSim late interaction. Качество выше, особенно на кросс-язычном поиске, но индекс тяжелее.
По NanoBEIR Multilingual:
- ColBERT: 0.605 NDCG@10
- Embedding: 0.577
- Qwen3-Embedding-0.6B: 0.556
- gte-multilingual-base: 0.528
На MKQA-11 обе LFM-модели дают около 0.69 Recall@20.
На H100 embedding запроса около 1.5 мс p50, ColBERT query + MaxSim около 2.5 мс p50. Есть GGUF под llama.cpp, на MacBook M4 Max около 7-8 мс p50.
Релиз для тех, кому нужен дешёвый мультиязычный retrieval без тяжёлых embedding-моделей.
https://www.liquid.ai/blog/lfm2-5-retrievers
@ai_machinelearning_big_data
#Liquid #ai #ml #opensource
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍58⚡31❤28👏12😍6🔥5
Инициатива по выдаче цифровых ID автономным агентам в рамках расширения программы e-residency, одобренная премьер-министром страны, определяет правовой статус алгоритмов при выполнении задач от лица компаний, госучреждений и граждан.
Статус позволит ИИ легально работать с базами данных в режиме чтения, готовить документы и управлять финансами в пределах заданных лимитов. Права доступа настраиваются самим владельцем агента, но каждое действие ИИ будет записываться в аудируемый лог.
Эстония уже внедряет LLM в госсектор и школы совместно с OpenAI. Премьер-министр тестирует инструменты разработки лично, недавно он навайбкодил с помощью Claude дашборд для отслеживания приоритетов кабинета министров.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍90🤣44🔥19❤17🤔7👏6🎉6🙉5😁3
Media is too big
VIEW IN TELEGRAM
Обновление принесло серьезный скачок в обработке сложных запросов о здоровье. Модель, дообученная при участии двух сотен врачей, теперь справляется с бенчмарком HealthBench на уровне ризонинг-моделей компании.
Алгоритм стал гораздо лучше выявлять критические симптомы, сообщать о степени своей неуверенности и запрашивать у пользователя недостающий контекст.
Оптимизации уже показали эффективность на проде. Мониторинг еженедельных запросов зафиксировал падение количества ошибок на 71% за 2 месяца.
openai.com
Знакомый по веб-версии чат-бота инструмент теперь позволяет генерировать интерактивные страницы прямо из консоли. В Anthropic считают, что нововведение упростит ревью пулл-реквестов, анализ инцидентов, аудит лицензий и визуализацию архитектуры.
При создании дашборда учитывается весь рабочий контекст: исходный код, подключенные утилиты и история диалога. Чтобы сгенерировать артефакт, достаточно отправить соответствующий промпт в процессе работы. Все созданные материалы по умолчанию приватны и видны только авторизованным сотрудникам с учетом ролевых политик организации.
Функция доступна в бете для тарифов Team и Enterprise и работает как через CLI, так и в десктопном приложении.
claude.com
ИИ-поисковик добавил своей агентной системе Computer новую систему памяти Brain, которая работает как автоматизированная LLM-вики.
Brain непрерывно фиксирует весь ход работы: структуру проектов, исходники, а также тупиковые решения и ошибки. Каждую ночь система синтезирует накопленные данные и обновляет граф контекста, избавляя от необходимости заново вводить бота в курс дела перед началом новой сессии.
Perplexity заявляет о росте точности ответов на 25% и улучшении работы с контекстом на 16%. Кроме того, Brain позволяет сократить расход токенов на передачу истории диалога в среднем на 13%.
Развертывание началось в статусе превью для тарифов Max и Enterprise.
perplexity.ai
Создатель генеративной нейросети совместно с Butterfly Network разрабатывает полноростовой УЗИ-сканер. Технология позиционируется как замена МРТ.
Устройство работает по принципу эхолокации. Человек погружается в бассейн, где кольцо из 500 тыс датчиков генерирует и принимает ультразвуковые волны. Вычислительный кластер анализирует прохождение звука через ткани и затем рендерит 3D-модель тела.
Технологию планируют продвигать через сеть собственных спа-центров. Первые локации откроются в следующем году, где сканеры будут строить карты композиции тела. Сама Midjourney планирует получать сертификацию FDA для диагностики.
К 2028 году компания намерена разработать кастомные чипы для 3-го поколения сканеров. План к 2031 году - развернуть 50 тысяч машин с пропускной способностью 1 млрд обследований в месяц.
midjourney.com
Компания выпустила в публичную бету сквозного агента для выполнения многошаговых продакшен-задач в Premiere, Photoshop, Illustrator, InDesign и Frame.
Ассистент выстраивает цепочки действий по текстовому промпту. Процесс включает сортировку исходников, черновой монтаж, массовую генерацию макетов из таблиц, адаптацию верстки под гайдлайны и проверку файлов на технические ошибки перед печатью.
Инструментарий вывели за пределы софта - управлять генерацией теперь можно из ChatGPT, Claude и Microsoft 365 Copilot. Позже заявлена интеграция с Google Gemini и Slack.
Параллельно началось тестирование обновления для Firefly Studio, где добавили создание логотипа по бренд-буку и быстрый черновой монтаж клипов.
adobe.com
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍42❤22🔥5🙈2⚡1🤔1🎉1
Вслед за недавними размышлениями об эволюции AGI в ASI, исследовательское подразделение Google представила внутренний регламент контроля высокоразвитых ИИ-агентов.
Помимо привычного элайнмента модели, DeepMind добавляет отдельный слой системного контроля, пересобирая защиту исходя из худшего сценария.
За вводную берётся то, что система изначально враждебна, имеет скрытые цели и тайно работает против разработчиков.
Для систематизации таких угроз взяли за основу популярный фреймворк MITRE ATT&CK и создали на его базе TRAIT&R, новую таксономию тактик и методов обхода защиты.
Она учитывает специфику ИИ и описывает векторы атак, недоступные людям: от незаметного саботажа научных исследований и внедрения бэкдоров до распределенных цепочек взлома, когда фрагменты вредоносного плана синхронно выполняются сотнями разных инстансов одного агента.
Защита выстроена по принципу эскалации и делится на уровни D1–D4 для систем обнаружения и R1–R3 для механизмов реагирования.
На базовых этапах безопасность обеспечивается анализом CoT агента в песочницах под присмотром более слабых, но надежных ИИ-супервизоров.
По мере развития способностей модели начинают понимать факт слежки и учатся скрывать ход своих мыслей.
Для контроля над такими системами (это уровень D4/R3) традиционные методы больше не работают.
На этом этапе DeepMind планирует применят более затратные меры, вплоть до проверки внутренних состояний модели, использования изолированных копий самой недоверенной системы для аудита и инфраструктуры экстренной остановки агентов и запущенных ими процессов.
Вместе с новой стратегией опубликован отдельный документ для индустрии о том, как сделать агентов безопасными по мере их распространения, и он разбит на 3 уровня:
Как защитить одну систему от утечек данных, чужих манипуляций и от собственных ошибочных действий, и зачем для этого нужны общие стандарты.
Каскадные сбои, негласный сговор алгоритмов, ситуации, где за вред никто конкретно не отвечает, и атаки, рассчитанные сразу на сеть агентов.
Как помочь защитникам сохранить преимущество перед злоумышленниками (автоматический поиск и устранение уязвимостей, обмен сигналами об угрозах, обучение специалистов).
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔108👨💻23❤15👀15✍10👍8🔥7😐2
DeepSeek запустил Vision Mode в веб-версии и мобильном приложении. Режим поддерживает визуальный CoT для сложных задач (геометрические выводы, анализ графиков и прямую конвертацию UI-скринов в HTML).
В основе функции лежит работа Thinking with Visual Primitives, в которой авторы решили проблему восприятия MMLM при точной локализации и пространственных рассуждениях.
Координаты и граничные рамки используются как минимальные единицы мышления и встраиваются непосредственно в визуальную цепочку CoT.
Это дает модели точную пространственную ориентацию в инференсе без опоры на описания естественным языком.
Vision Mode обрабатывает только статические изображения. Поддержки аудио, видео и генерации картинок нет.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍157🔥33❤22🤓21👏12😎9👌6
Media is too big
VIEW IN TELEGRAM
OpenAI добавила функцию Record and Replay в Codex для автоматизации десктопной рутины. Инструмент записывает повторяющиеся действия пользователя и конвертирует их в структурированный алгоритм.
Пользователь вручную управляет процессом записи. После захвата действий модель генерирует редактируемый сценарий. Его можно сохранить для запуска в будущем.
Пока функция работает в виде опциональной настройки только в клиенте для macOS. Для её использования требуется активировать специальное разрешение Computer Use. Из-за региональных ограничений релиз недоступен на территории стран ЕЭЗ, Великобритании и Швейцарии.
OpenAIDevs в сети Х
Тест AA-Briefcase был разработан совместно с Google, McKinsey и BCG. Он состоит из 91 задачи, симулирующей процессы в Data Science, управлении продуктами, банкинге и промышленности. Модели ранжируются по качеству аналитики, точности ответов и формату данных.
Лидером рейтинга стала Fable 5, второе и третье место - Opus 4.8 и GLM-5.2. Показатели успешности остаются низкими, лидер достиг 100% результата лишь в 3% случаев и не набрал половины баллов в 31 задании. В опенсорс-сегменте GLM-5.2 уступила Opus 4.8 на 90 баллов при четырехкратной разнице в стоимости использования.
Разброс цены за выполнение одной задачи составил от 4 центов у DeepSeek V4 до 31 доллара у Fable 5. Авторы бенчмарка зафиксировали, что для прохождения тестов моделям-литерам регулярно требовались инструменты визуального анализа.
artificialanalysis.ai
Команду покинул Джон Джампер, руководитель проекта AlphaFold и лауреат Нобелевской премии по химии 2024 года. После почти 9 лет работы в подразделении он принял решение перейти в Anthropic.
Джампер получил мировое признание за создание алгоритма, совершившего революцию в предсказании трехмерной структуры белков, разделив награду с Демисом Хассабисом.
Незадолго до этого о своем уходе в OpenAI объявил Ноам Шазир. Он занимал пост соруководителя разработки Gemini и был одним из ключевых создателей архитектуры ризонинга языковых моделей Google.
Всего за несколько дней Anthropic и OpenAI удалось переманить двух важнейших специалистов, напрямую определявших развитие ИИ-продуктов поискового гиганта.
John Jumper и Noam Shazeer в сети Х
Стартап, поддерживаемый Эриком Шмидтом представил складного колёсного робота Eno на базе собственной модели GENE.
В отличие от двуногих платформ, Eno передвигается на колёсном шасси с регулируемой стойкой из шарнирных панелей. Устройство меняет высоту на ходу и складывается до размеров чемодана.
Робот получил руки с 20 активными степенями свободы и обратной связью. За управление отвечает модель GENE, которая работает как физический агент - анализирует обстановку и адаптируется к изменениям без запрограммированных сценариев.
Genesis AI собрала несколько десятков предсерийных образцов. К концу года компания планирует запустить производство для складской логистики, а в перспективе вывести устройство в отели, больницы и потребительский сектор.
genesis.ai
В конце августа страна закроет доступ к инструментам генеративного ИИ для учеников 1–7 классов (6–13 лет).
В средней школе (14–16 лет) использование нейросетей допускается только под контролем учителей. Обучать работе с алгоритмами будут исключительно старшеклассников.
Правительство считает, что ИИ позволяет школьникам обходить образовательные процессы, вредя базовому освоению чтения, письма и математики. Общее снижение успеваемости с 2015 года власти напрямую связывают с цифровизацией обучения. Помимо ограничений для ИИ, в классы вернут бумажные учебники.
Ранее в Норвегии уже запретили использование смартфонов на уроках, а в ближайшее время планируется ввести запрет на доступ к социальным сетям для детей младше 16 лет.
reuters.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍128🤔27❤20👏10🎉8🐳5🤝4❤🔥2🙊1
Аналитик Дин Болл рассказал в личном блоге, что в начале июля присоединится к OpenAI на должность главы Strategic Futures, нового подразделения, которое займётся вопросами политики в сфере ИИ.
Strategic Futures - небольшая команда с высокой степенью самостоятельности, которая будет подчиняться директору по стратегии OpenAI Джейсону Квону.
В сферу её ответственности он включает катастрофические риски, рекурсивное самоулучшение моделей, влияние ИИ на рынок труда, а также отношения между ИИ-лабораториями, государствами и обществом.
Экспертиза в ML или политике в сфере ИИ при этом не обязательна, Дин рассчитывает собрать команду из представителей разных дисциплин и сейчас открыт к обращениям кандидатов.
Ранее Болл работал в Белом доме, где занимался вопросами политики в области ИИ. Своё решение перейти в OpenAI он объясняет собственными представлениями об управлении передовыми технологиями.
ИИ нуждается в регулировании, но одновременно сам становится новым инструментом управления, а наиболее значимые решения в этой области, вероятно, будут приниматься внутри лабораторий, а не внешними институтами.
Чтобы вести содержательную работу по политике ИИ, технологию необходимо понимать изнутри.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤔65❤14👏14👍13😁5🤨5😐5🙈4🤷♂1🤝1😎1