Исследователи UC Berkeley показали новую проблему безопасности AI-агентов: иногда скрытый навык можно почти восстановить, вообще не видя его системный промпт, SKILL.md или внутренние файлы.
В работе Daydreaming атакующий просто даёт агенту специально подобранные обычные задачи и изучает ответы.
Этого оказалось достаточно, чтобы восстановить до 86,8% поведения скрытого навыка.
Самое неприятное - точная копия исходных файлов даже не нужна. Реконструированные версии могли сильно отличаться от оригинала, но всё равно воспроизводили большую часть поведения на новых задачах.
То есть навык может оставаться секретным на уровне файлов, но его логика всё равно постепенно «утекает» через нормальное использование.
Авторы советуют защищать не только промпты и внутренние файлы, но и сам рабочий интерфейс:
- не отдавать лишние детали в ответах
- скрывать ненужные трассировки выполнения
- ограничивать или отслеживать адаптивные серии запросов
Особенно важно для компаний, которые продают закрытые agent skills как сервис.
https://arxiv.org/abs/2608.26733
В работе Daydreaming атакующий просто даёт агенту специально подобранные обычные задачи и изучает ответы.
Этого оказалось достаточно, чтобы восстановить до 86,8% поведения скрытого навыка.
Самое неприятное - точная копия исходных файлов даже не нужна. Реконструированные версии могли сильно отличаться от оригинала, но всё равно воспроизводили большую часть поведения на новых задачах.
То есть навык может оставаться секретным на уровне файлов, но его логика всё равно постепенно «утекает» через нормальное использование.
Авторы советуют защищать не только промпты и внутренние файлы, но и сам рабочий интерфейс:
- не отдавать лишние детали в ответах
- скрывать ненужные трассировки выполнения
- ограничивать или отслеживать адаптивные серии запросов
Особенно важно для компаний, которые продают закрытые agent skills как сервис.
https://arxiv.org/abs/2608.26733
👍8🔥8❤3
Главное:
- NVGEMM добавляет в Inductor CUTLASS-ядра, сгенерированные через CuTeDSL
- появился новый backend
nccl2 для PyTorch Distributed- отказоустойчивость стала частью c10d: можно перенастраивать process group без полного перезапуска
- на Apple Silicon появилась нативная линейная алгебра: SVD,
eigh, QR и Cholesky-
torch.switch добавляет многостороннее ветвление-
torch.while_loop теперь можно захватывать в CUDA Graph-
@dynamic_spec задаёт динамические формы декларативно для torch.compile, torch.export и make_fx- Intel XPU получил нативный graph capture
- Inductor добавил поддержку Rubin
sm_107-
torch.compile экспериментально научился работать с комплексными числамиОтдельно NVGEMM умеет epilogue fusion, scaled GEMM, NVFP4 GEMM и autotuning вместе с Triton и ATen.
В релиз вошло 2995 коммитов от 487 участников.
17 сентября команда PyTorch проведёт live Q&A по версии 2.14.
Release blog: https://pytorch.org/blog/pytorch-2-14-release-blog/
Q&A: https://pytorch.org/event/pytorch-2-14-release-live-qa/
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9👍5❤4
⚡️ Покупка Hugging Face компанией NVIDIA может неожиданно стать одним из лучших сценариев для open-source AI.
Бизнес компании хорошо совпадает с интересами открытой экосистемы.
NVIDIA не нужно, чтобы победила одна конкретная модель. Компания зарабатывает, когда миллионы разработчиков обучают, дообучают и запускают миллионы разных моделей.
Hugging Face при этом контролирует один из важнейших каналов распространения open-source AI.
Если сделка состоится, Hugging Face получит доступ к огромной инфраструктуре и капиталу, а NVIDIA - ещё более сильную позицию в экосистеме разработчиков.
При условии, что NVIDIA действительно сохранит поддержку разных моделей, облаков и ускорителей, такая покупка может пойти на благо всем разработчикам.
https://x.com/JensenHuang/status/2095482647355244762
@data_analysis_ml / Папка полезного по ML.
Бизнес компании хорошо совпадает с интересами открытой экосистемы.
NVIDIA не нужно, чтобы победила одна конкретная модель. Компания зарабатывает, когда миллионы разработчиков обучают, дообучают и запускают миллионы разных моделей.
Hugging Face при этом контролирует один из важнейших каналов распространения open-source AI.
Если сделка состоится, Hugging Face получит доступ к огромной инфраструктуре и капиталу, а NVIDIA - ещё более сильную позицию в экосистеме разработчиков.
При условии, что NVIDIA действительно сохранит поддержку разных моделей, облаков и ускорителей, такая покупка может пойти на благо всем разработчикам.
https://x.com/JensenHuang/status/2095482647355244762
@data_analysis_ml / Папка полезного по ML.
❤14👍8🔥7🤣3🌚1
По данным команды, серия ориентирована на coding и agentic-задачи и показывает сильные результаты во всех размерных классах. Модели на 0,9B, 3,7B и 7B заявлены как новые SOTA для своего масштаба.
IFM выпустили веса, но и код, обучающие данные и рецепты обучения.
Launch: https://ifm.ai/k2/
Tech blog: https://ifm.ai/blog/k2
Hugging Face: https://huggingface.co/collections/IFM/k2-horizon
Please open Telegram to view this post
VIEW IN TELEGRAM
❤10👍8🔥6
Несколько мыслей о релизе GPT-6 Astra.
Сразу оговорка: это выводы по тому, что показала OpenAI. Саму модель я ещё не тестировал.
По опубликованным бенчмаркам Astra выглядит как самый сильный релиз OpenAI за долгое время и серьёзный удар по позициям Anthropic. Особенно заметен скачок в coding, computer use, browser use, математике, работе с таблицами и других сложных прикладных задачах.
Отсюда снова всплыл старый вопрос: можно ли уже называть такие модели AGI?
Единого определения AGI до сих пор нет. Но если понимать general intelligence буквально как способность работать на экспертном уровне сразу в большом числе разных областей, Astra действительно подбирается очень близко к этому описанию.
Astra вышла вскоре после Fable 5.1 и на фоне подготовки Anthropic к IPO. На этом фоне запуск выглядит особенно символично: OpenAI снова пытается вернуть себе лидерство в гонке frontier-моделей.
Насколько хорошо Astra будет справляться с длинными агентными задачами, coding, исследованиями, браузером и компьютером без постоянного контроля человека - станет понятно уже по первым массовым тестам.
И, судя по всему, Astra может быть не последним крупным релизом OpenAI в 2026 году.
Если опубликованные результаты подтвердятся на практике, GPT-6 станет одним из самых заметных скачков в возможностях универсальных AI-моделей за последние годы.
Сразу оговорка: это выводы по тому, что показала OpenAI. Саму модель я ещё не тестировал.
По опубликованным бенчмаркам Astra выглядит как самый сильный релиз OpenAI за долгое время и серьёзный удар по позициям Anthropic. Особенно заметен скачок в coding, computer use, browser use, математике, работе с таблицами и других сложных прикладных задачах.
Отсюда снова всплыл старый вопрос: можно ли уже называть такие модели AGI?
Единого определения AGI до сих пор нет. Но если понимать general intelligence буквально как способность работать на экспертном уровне сразу в большом числе разных областей, Astra действительно подбирается очень близко к этому описанию.
Astra вышла вскоре после Fable 5.1 и на фоне подготовки Anthropic к IPO. На этом фоне запуск выглядит особенно символично: OpenAI снова пытается вернуть себе лидерство в гонке frontier-моделей.
Насколько хорошо Astra будет справляться с длинными агентными задачами, coding, исследованиями, браузером и компьютером без постоянного контроля человека - станет понятно уже по первым массовым тестам.
И, судя по всему, Astra может быть не последним крупным релизом OpenAI в 2026 году.
Если опубликованные результаты подтвердятся на практике, GPT-6 станет одним из самых заметных скачков в возможностях универсальных AI-моделей за последние годы.
1❤16👍8🔥6😱3😢1🤣1
Цена за миллион токенов всё хуже показывает реальную стоимость AI
Токен перестал быть нормальной единицей сравнения моделей.
Две модели могут решить одну и ту же задачу, но одной понадобится 5 000 токенов, а другой - 50 000+. Добавьте разные токенизаторы, скрытые reasoning-токены, tool calls и повторные попытки — и метрика
Для AI-агентов проблема ещё заметнее.
Если первый шаг сгенерировал слишком много текста, этот результат часто становится входом для второго шага, затем попадает в третий, четвёртый и дальше.
Поэтому модель, которая использует в 2 раза больше токенов, может обойтись значительно дороже, чем просто ×2:
- растёт контекст;
- увеличивается latency;
- дорожают следующие reasoning-шаги;
- растут расходы на tool calls и retries.
Чем длиннее агентный workflow, тем важнее token efficiency.
Гораздо полезнее считать:
То есть сравнивать модели не по цене токена, а по стоимости успешно выполненной задачи при нужном качестве.
https://x.com/Machinelearrn/status/2095817451699130868
Токен перестал быть нормальной единицей сравнения моделей.
Две модели могут решить одну и ту же задачу, но одной понадобится 5 000 токенов, а другой - 50 000+. Добавьте разные токенизаторы, скрытые reasoning-токены, tool calls и повторные попытки — и метрика
$ / 1M tokens уже почти ничего не говорит о стоимости реальной работы.Для AI-агентов проблема ещё заметнее.
Если первый шаг сгенерировал слишком много текста, этот результат часто становится входом для второго шага, затем попадает в третий, четвёртый и дальше.
Поэтому модель, которая использует в 2 раза больше токенов, может обойтись значительно дороже, чем просто ×2:
- растёт контекст;
- увеличивается latency;
- дорожают следующие reasoning-шаги;
- растут расходы на tool calls и retries.
Чем длиннее агентный workflow, тем важнее token efficiency.
Гораздо полезнее считать:
полная стоимость модели + reasoning + tools + retries / число успешно выполненных задачТо есть сравнивать модели не по цене токена, а по стоимости успешно выполненной задачи при нужном качестве.
https://x.com/Machinelearrn/status/2095817451699130868
❤15🔥8👍6💯2
Смеяться можно долго: в цене сделки Nvidia по покупке Hugging Face спрятали сразу два пасхальных яйца.
Итоговая сумма - $12,930,300,000.
Если взять первые шесть цифр - 129303 и прочитать их как кодовую точку Unicode, получаем U+1F917. Это эмодзи 🤗, тот самый, который ассоциируется с Hugging Face.
Сооснователь Hugging Face Томас Вулф отдельно намекнул, что в цене сделки спрятаны отсылки сразу к обеим компаниям.
Второе пасхальное яйцо - для Nvidia. Если записать 129303 как HEX-цвет #129303, получится насыщенный зелёный оттенок, очень близкий к фирменному цвету Nvidia.
Почти $13 млрд и даже цифры в ценнике решили использовать не случайно.
Итоговая сумма - $12,930,300,000.
Если взять первые шесть цифр - 129303 и прочитать их как кодовую точку Unicode, получаем U+1F917. Это эмодзи 🤗, тот самый, который ассоциируется с Hugging Face.
Сооснователь Hugging Face Томас Вулф отдельно намекнул, что в цене сделки спрятаны отсылки сразу к обеим компаниям.
Второе пасхальное яйцо - для Nvidia. Если записать 129303 как HEX-цвет #129303, получится насыщенный зелёный оттенок, очень близкий к фирменному цвету Nvidia.
Почти $13 млрд и даже цифры в ценнике решили использовать не случайно.
❤46🤣17👍9🔥7🌭1
⚡️ GLM-5.3 теперь можно запускать в российском облаке
MWS Cloud развернула новую модель Z.аi в собственной инфраструктуре. GLM-5.3 доступна через MWS GPT Model Hub, а запросы и данные пользователей обрабатываются внутри России. При этом цена осталась на уровне GLM-5.2.
GLM-5.3 интересна прежде всего не обычным чатингом, а кодингом и агентными задачами. Модель умеет работать с репозиториями, искать ошибки в коде, выполнять многошаговые задачи и использовать инструменты в длительных последовательностях действий.
Модель доступна через OpenAI-совместимый API, что упрощает ее интеграцию и переключение между моделями.
Z.аi оставила базовую архитектуру от GLM-5.2, а основной прирост качества получила за счёт более масштабирования посттренинга. Веса GLM-5.3 разработчик выпустил не сразу, а примерно через две недели после релиза — за это время модель дополнительно тестировали и проверяли её безопасность.
В задачах программирования Модель стабильно опережает Claude Opus 4.8 и сопоставима с новейшими Claude Fable 5 и GPT-5.6 Sol
@data_analysis_ml / Папка полезного по ML.
MWS Cloud развернула новую модель Z.аi в собственной инфраструктуре. GLM-5.3 доступна через MWS GPT Model Hub, а запросы и данные пользователей обрабатываются внутри России. При этом цена осталась на уровне GLM-5.2.
GLM-5.3 интересна прежде всего не обычным чатингом, а кодингом и агентными задачами. Модель умеет работать с репозиториями, искать ошибки в коде, выполнять многошаговые задачи и использовать инструменты в длительных последовательностях действий.
Модель доступна через OpenAI-совместимый API, что упрощает ее интеграцию и переключение между моделями.
Z.аi оставила базовую архитектуру от GLM-5.2, а основной прирост качества получила за счёт более масштабирования посттренинга. Веса GLM-5.3 разработчик выпустил не сразу, а примерно через две недели после релиза — за это время модель дополнительно тестировали и проверяли её безопасность.
В задачах программирования Модель стабильно опережает Claude Opus 4.8 и сопоставима с новейшими Claude Fable 5 и GPT-5.6 Sol
@data_analysis_ml / Папка полезного по ML.
mws.ru
GPT Model Hub — генеративные модели по API в облаке MWS Cloud Platform
GPT Model Hub — готовые генеративные модели и LLM в MWS Cloud Platform. OpenAI-совместимый API, быстрый инференс. Каталог моделей для создания AI-ассистентов, чат-ботов и AI-приложений
👍8🔥6❤4🥴4
Появились сообщения, что в GPT-6 Astra используется техника recurrent depth - одни и те же Transformer-блоки с общими весами прогоняются несколько раз подряд.
Вместо того чтобы каждый раз добавлять новые слои и параметры, модель может повторно использовать уже существующие блоки и выполнять больше внутреннего вычисления над одним состоянием.
По сути:
hidden state → Transformer block → тот же block → тот же block → результатТакой подход близок к семейству Recurrent Reasoning Models (RRM), которое исследователи активно изучают как способ увеличить глубину рассуждения без пропорционального роста числа параметров.
Интересно, что похожую идею разбирали ещё весной этого года в работе про recurrent reasoning models:
https://arxiv.org/abs/2603.02193
PS: OpenAI публично архитектуру Astra пока не раскрывала, поэтому recurrent depth остаётся сообщаемой, но не подтверждённой компанией особенностью модели.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍12🔥4❤3
Утекли предполагаемые бенчмарки Gemini 4 - цифры выглядят безумно 🤯
В сети разошлась таблица с прогнозируемыми результатами Gemini 4:
- 99,9%+ — ARC-AGI-3
- 99,1% — FrontierMath Tier 4 v2
- 72,8% — Terminal-Bench Science 0.1
- 70,2% — HealthBench Professional
- 62,3% — Terminal-Bench 4.0
- 48,7% — AutomationBench
- 98,6% — BenchCAD
В этой таблице Gemini 4 опережает GPT-6 Astra и Fable 5.1 на всех перечисленных тестах. Особенно сильный скачок якобы приходится на математику, scientific reasoning, работу в терминале и agentic-задачи.
Сам Gemini 4 реален: Google уже подтвердил, что запустил для него свой «самый амбициозный pre-training run» на сегодняшний день.
В сети разошлась таблица с прогнозируемыми результатами Gemini 4:
- 99,9%+ — ARC-AGI-3
- 99,1% — FrontierMath Tier 4 v2
- 72,8% — Terminal-Bench Science 0.1
- 70,2% — HealthBench Professional
- 62,3% — Terminal-Bench 4.0
- 48,7% — AutomationBench
- 98,6% — BenchCAD
В этой таблице Gemini 4 опережает GPT-6 Astra и Fable 5.1 на всех перечисленных тестах. Особенно сильный скачок якобы приходится на математику, scientific reasoning, работу в терминале и agentic-задачи.
Сам Gemini 4 реален: Google уже подтвердил, что запустил для него свой «самый амбициозный pre-training run» на сегодняшний день.
😁45❤20🤣15👍7🔥5
DeepSeek хочет закупить около 160 000 ускорителей Huawei Ascend для своего огромного дата-центра во Внутренней Монголии.
Если заказ реализуют, это будет крупнейший кластер Huawei для AI.
По данным Bloomberg:
- Ascend планируют использовать в основном для inference
- обучение крупных моделей DeepSeek по-прежнему рассчитывает проводить на NVIDIA
- производство такого объёма чипов может занять больше года
- главный ограничитель сейчас - не спрос, а производственные мощности Huawei
DeepSeek, судя по всему, хочет ещё больше ускорителей, но Huawei пока физически не может выпускать их в нужных объёмах.
Это хорошо показывает, как быстро в Китае растёт отдельная инфраструктура для AI inference на локальных чипах.
https://www.bloomberg.com/news/articles/2026-09-04/deepseek-plans-big-huawei-ai-chip-order-to-power-new-data-center
Если заказ реализуют, это будет крупнейший кластер Huawei для AI.
По данным Bloomberg:
- Ascend планируют использовать в основном для inference
- обучение крупных моделей DeepSeek по-прежнему рассчитывает проводить на NVIDIA
- производство такого объёма чипов может занять больше года
- главный ограничитель сейчас - не спрос, а производственные мощности Huawei
DeepSeek, судя по всему, хочет ещё больше ускорителей, но Huawei пока физически не может выпускать их в нужных объёмах.
Это хорошо показывает, как быстро в Китае растёт отдельная инфраструктура для AI inference на локальных чипах.
https://www.bloomberg.com/news/articles/2026-09-04/deepseek-plans-big-huawei-ai-chip-order-to-power-new-data-center
🔥11👍5🥰3
This media is not supported in your browser
VIEW IN TELEGRAM
GPT-6 Astra не та модель, разработку которой OpenAI приостановила из-за опасений по кибербезопасности. Речь шла о будущей модели.
«Обучение Astra завершилось уже некоторое время назад. Модель, о приостановке которой мы недавно говорили, это будущая модель. Но Astra уже достигла уровня cyber-critical.»
Источник: YouTube-канал Bloomberg Television, полное видео - в комментариях.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣32👍6🔥6❤4🥴2
Слух о том, что Anthropic могла решить одну из задач тысячелетия, становится всё интереснее.
Несколько часов назад Теренс Тао отдельно разобрал сценарий, где AI самостоятельно находит решение задачи глобальной регулярности уравнений Навье-Стокса, но почти весь путь к доказательству остаётся скрытым внутри закрытой системы.
Математически задача может быть решена, но если человечество увидит только финальный ответ без цепочки неудачных подходов, обходных путей и новых идей, сама область может получить от этого гораздо меньше пользы.
Пока подтверждённого решения Навье-Стокса нет, задача официально остаётся открытой. Но совпадение по времени выглядит очень любопытно.
Несколько часов назад Теренс Тао отдельно разобрал сценарий, где AI самостоятельно находит решение задачи глобальной регулярности уравнений Навье-Стокса, но почти весь путь к доказательству остаётся скрытым внутри закрытой системы.
Математически задача может быть решена, но если человечество увидит только финальный ответ без цепочки неудачных подходов, обходных путей и новых идей, сама область может получить от этого гораздо меньше пользы.
Пока подтверждённого решения Навье-Стокса нет, задача официально остаётся открытой. Но совпадение по времени выглядит очень любопытно.
👍18🔥8🤣5❤4🤨2⚡1
🚀 Thinking Machines Lab Миры Мурати уже обсуждает новый раунд инвестиций с оценкой около $40 млрд - менее чем через два года после запуска.
Стартап при этом уже генерирует как минимум
несколько сотен миллионов долларов годовой выручки в пересчёте на текущий темп.
Если сделка состоится, это будет одна из самых высоких оценок среди молодых AI-компаний.
https://www.theinformation.com/articles/thinking-machines-lab-talks-raise-billions-roughly-40-billion-valuation
Стартап при этом уже генерирует как минимум
несколько сотен миллионов долларов годовой выручки в пересчёте на текущий темп.
Если сделка состоится, это будет одна из самых высоких оценок среди молодых AI-компаний.
https://www.theinformation.com/articles/thinking-machines-lab-talks-raise-billions-roughly-40-billion-valuation
👍6❤3🤣3🔥2
🤖 Подключать AI-агента к каждому мессенджеру отдельно - обычно боль из разных API, токенов, настроек и коннекторов.
dsh-im решает это одним плагином для DeepSeek Harness.
Он позволяет подключить локального агента сразу к 9 платформам:
* Telegram
* Slack
* Discord
* WhatsApp
* WeChat
* Feishu
* DingTalk
* WeCom
* QQ
Настройка может идти через QR-код, App Manifest или обычные credentials — из одного интерфейса.
Что ещё умеет:
* несколько ботов на одном канале;
* отдельные workspace и session bindings;
* стриминг ответов;
* отображение thinking/tool progress там, где это поддерживается;
* отправка изображений и файлов;
* выбор Agent Preset для каждого бота;
* тест подключения прямо из панели.
Полезно, если нужно быстро встроить локального AI-агента в уже существующие рабочие чаты команды.
Open source, MIT.
https://github.com/xmanrui/dsh-im
dsh-im решает это одним плагином для DeepSeek Harness.
Он позволяет подключить локального агента сразу к 9 платформам:
* Telegram
* Slack
* Discord
* Feishu
* DingTalk
* WeCom
Настройка может идти через QR-код, App Manifest или обычные credentials — из одного интерфейса.
Что ещё умеет:
* несколько ботов на одном канале;
* отдельные workspace и session bindings;
* стриминг ответов;
* отображение thinking/tool progress там, где это поддерживается;
* отправка изображений и файлов;
* выбор Agent Preset для каждого бота;
* тест подключения прямо из панели.
Полезно, если нужно быстро встроить локального AI-агента в уже существующие рабочие чаты команды.
Open source, MIT.
https://github.com/xmanrui/dsh-im
👍7❤5🔥5