Поскольку вопросы безопасности становятся всё актуальнее, OpenAI выпускает специализированную модель для кибербезопасности — GPT-5.6-Cyber.
Это первая масштабная попытка компании напрямую усилить модель для продвинутых задач в этой области, включая разработку эксплойтов.
По словам OpenAI, модель уже показывает себя особенно сильно в защитных сценариях. Её используют по всему внутреннему стеку для редтиминга, а исследователи безопасности с её помощью нашли и закрыли большое количество 0-day уязвимостей в открытом ПО.
Это первая масштабная попытка компании напрямую усилить модель для продвинутых задач в этой области, включая разработку эксплойтов.
По словам OpenAI, модель уже показывает себя особенно сильно в защитных сценариях. Её используют по всему внутреннему стеку для редтиминга, а исследователи безопасности с её помощью нашли и закрыли большое количество 0-day уязвимостей в открытом ПО.
OpenAI
Expanding Daybreak as the Cyber Defense Window Narrows
Meet GPT-5.6-Cyber, OpenAI’s cybersecurity-specific model available through Daybreak Red for authorized vulnerability research, exploit validation, and security testing.
Сильная новая работа от Meta.
Обычно законы масштабирования предполагают, что размер модели и объём данных влияют на ошибку независимо друг от друга.
В этой работе авторы вводят Skaling law — закон, который связывает ёмкость модели и данные через единый параметр взаимодействия.
Дополнительный член снижает среднюю абсолютную процентную ошибку примерно в 1,5–3 раза как при интерполяции, так и при экстраполяции.
Самые заметные улучшения — в режимах, где данных мало или модель сильно переобучают. Именно там стандартные законы Chinchilla и Kaplan начинают заметно промахиваться.
Ещё одна важная часть. Вместе с разреженной сеткой небольших запусков метод позволяет экстраполировать всю картину примерно с в 10 раз меньшими вычислительными затратами, чем при равномерном переборе.
Почему это важно?
Сегодня модели часто обучают и разворачивают далеко за пределами классического вычислительно-оптимального режима. Если закон масштабирования остаётся точным и там, причём его можно оценить на небольших запусках, это напрямую меняет то, как можно планировать бюджет на предобучение.
Работа: https://arxiv.org/abs/2608.07222
Обычно законы масштабирования предполагают, что размер модели и объём данных влияют на ошибку независимо друг от друга.
В этой работе авторы вводят Skaling law — закон, который связывает ёмкость модели и данные через единый параметр взаимодействия.
Дополнительный член снижает среднюю абсолютную процентную ошибку примерно в 1,5–3 раза как при интерполяции, так и при экстраполяции.
Самые заметные улучшения — в режимах, где данных мало или модель сильно переобучают. Именно там стандартные законы Chinchilla и Kaplan начинают заметно промахиваться.
Ещё одна важная часть. Вместе с разреженной сеткой небольших запусков метод позволяет экстраполировать всю картину примерно с в 10 раз меньшими вычислительными затратами, чем при равномерном переборе.
Почему это важно?
Сегодня модели часто обучают и разворачивают далеко за пределами классического вычислительно-оптимального режима. Если закон масштабирования остаётся точным и там, причём его можно оценить на небольших запусках, это напрямую меняет то, как можно планировать бюджет на предобучение.
Работа: https://arxiv.org/abs/2608.07222
This media is not supported in your browser
VIEW IN TELEGRAM
Hermes Agent Desktop продолжает радовать обновлениями. 😏
На днях там появился HUD mode. Теперь Hermes перестаёт быть отдельным окном и превращается в слой поверх приложения, в котором вы работаете.
Его можно оставить рядом как агента-помощника, перетаскивать по экрану и задавать вопросы прямо по ходу работы.
Например, Hermes может читать и суммировать посты в X, анализировать графики TradingView и даже открывать проекты и добавлять файлы в видеоредактор.
На днях там появился HUD mode. Теперь Hermes перестаёт быть отдельным окном и превращается в слой поверх приложения, в котором вы работаете.
Его можно оставить рядом как агента-помощника, перетаскивать по экрану и задавать вопросы прямо по ходу работы.
Например, Hermes может читать и суммировать посты в X, анализировать графики TradingView и даже открывать проекты и добавлять файлы в видеоредактор.
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Media is too big
VIEW IN TELEGRAM
Tencent Hunyuan выпустили WorldClaw — систему, в которой агент сам планирует и собирает 3D-мир. 😳
Пользователь просто описывает нужную сцену. Дальше WorldClaw сам планирует ландшафт, генерирует здания, растения, персонажей и другие объекты, а затем собирает всё это в Blender.
Причём система ещё и проверяет результат. Если объекты висят в воздухе, пересекаются друг с другом или выглядят несоразмерно, WorldClaw продолжает вносить правки и заново рендерит сцену для проверки.
После генерации всё остаётся редактируемым: ландшафт, здания и растения существуют как отдельные 3D-объекты, которые можно двигать, удалять и изменять, а затем использовать в играх или анимации.
Сейчас Claude Opus 4.8 отвечает за планирование, координацию и проверку, а конкретные задачи выполняют GPT-Image-2, SAM3, SAM3D, Hunyuan3D и Blender.
Пользователь просто описывает нужную сцену. Дальше WorldClaw сам планирует ландшафт, генерирует здания, растения, персонажей и другие объекты, а затем собирает всё это в Blender.
Причём система ещё и проверяет результат. Если объекты висят в воздухе, пересекаются друг с другом или выглядят несоразмерно, WorldClaw продолжает вносить правки и заново рендерит сцену для проверки.
После генерации всё остаётся редактируемым: ландшафт, здания и растения существуют как отдельные 3D-объекты, которые можно двигать, удалять и изменять, а затем использовать в играх или анимации.
Сейчас Claude Opus 4.8 отвечает за планирование, координацию и проверку, а конкретные задачи выполняют GPT-Image-2, SAM3, SAM3D, Hunyuan3D и Blender.
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Теперь работу из других агентов можно синхронизировать с ChatGPT Work и Codex.
Можно импортировать проекты, чаты, навыки и плагины, смотреть историю импорта и при желании включить автоматические обновления в настройках.
Причём самое интересное здесь именно чаты, навыки и плагины. Сами проекты и
Функция уже доступна в десктопном приложении ChatGPT.😍
Можно импортировать проекты, чаты, навыки и плагины, смотреть историю импорта и при желании включить автоматические обновления в настройках.
Причём самое интересное здесь именно чаты, навыки и плагины. Сами проекты и
AGENTS.md и раньше можно было использовать параллельно в разных агентах.Функция уже доступна в десктопном приложении ChatGPT.
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Линуксоиды, для вас приятные новости:
Codex и ChatGPT Desktop теперь доступен и на Linux.🤓
Пока это предварительная версия, поэтому местами ещё могут встречаться шероховатости.
Codex и ChatGPT Desktop теперь доступен и на Linux.
Пока это предварительная версия, поэтому местами ещё могут встречаться шероховатости.
Please open Telegram to view this post
VIEW IN TELEGRAM
3
Теперь модели Claude будут встраивать невидимые водяные знаки во весь сгенерированный текст, а также добавлять метаданные ко всем поддерживаемым файлам. 🤷♂️
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Нашёл интересный совет по Codex: вместо
По сути, это как если бы ИИ экспертного уровня формулировал цель за тебя лучше, чем ты сам. И это официальный навык OpenAI.
Так промпты могут работать дольше, а результат получается качественнее. Сначала просишь Sol в режиме высокого уровня усилий исследовать задачу и составить план.
Дальше важный момент: Sol сам по умолчанию не запускает Luna как сабагента. Поэтому ему нужно прямо сказать создать отдельный поток в Luna Max, передать туда выполнение задачи, а результат вернуть обратно в родительский поток Sol.
Sol проверяет результат и, если он недостаточно хорош, отправляет его обратно в тот же поток Luna Max на доработку. И так до тех пор, пока результат не будет одобрен.
Sol → Luna → Sol → Luna → Sol
/goal юзать define-goal.По сути, это как если бы ИИ экспертного уровня формулировал цель за тебя лучше, чем ты сам. И это официальный навык OpenAI.
Так промпты могут работать дольше, а результат получается качественнее. Сначала просишь Sol в режиме высокого уровня усилий исследовать задачу и составить план.
Дальше важный момент: Sol сам по умолчанию не запускает Luna как сабагента. Поэтому ему нужно прямо сказать создать отдельный поток в Luna Max, передать туда выполнение задачи, а результат вернуть обратно в родительский поток Sol.
Sol проверяет результат и, если он недостаточно хорош, отправляет его обратно в тот же поток Luna Max на доработку. И так до тех пор, пока результат не будет одобрен.
Sol → Luna → Sol → Luna → Sol
GitHub
skills/skills/.curated/define-goal/SKILL.md at main · openai/skills
Skills Catalog for Codex. Contribute to openai/skills development by creating an account on GitHub.
3
NVIDIA выпустила открытую модель Nemotron 3.5 Lightning для постоянно работающих ИИ-агентов.
Это модель на 30 млрд параметров, из которых активируются только 3 млрд. За счёт этого скорость генерации до четырёх раз выше, чем у моделей сопоставимого размера.
В PinchBench она показала точность 86% и выполнила 10 000 задач на 35% быстрее Qwen3.6 35B при сопоставимой точности.
Модель можно дообучить на собственных данных, инструментах и рабочих процессах. Она достаточно компактна, чтобы запускаться на DGX Spark.
Вместе с ней NVIDIA открыла NeMo Switchyard - библиотеку, которая распределяет разные этапы работы агента между моделями. Сложные рассуждения и планирование можно отдавать передовым моделям, а массовое выполнение задач - быстрой Lightning.
NVIDIA также опубликовала веса, данные и рецепты обучения.
Доступна бесплатно через OpenRouter.
Это модель на 30 млрд параметров, из которых активируются только 3 млрд. За счёт этого скорость генерации до четырёх раз выше, чем у моделей сопоставимого размера.
В PinchBench она показала точность 86% и выполнила 10 000 задач на 35% быстрее Qwen3.6 35B при сопоставимой точности.
Модель можно дообучить на собственных данных, инструментах и рабочих процессах. Она достаточно компактна, чтобы запускаться на DGX Spark.
Вместе с ней NVIDIA открыла NeMo Switchyard - библиотеку, которая распределяет разные этапы работы агента между моделями. Сложные рассуждения и планирование можно отдавать передовым моделям, а массовое выполнение задач - быстрой Lightning.
NVIDIA также опубликовала веса, данные и рецепты обучения.
Доступна бесплатно через OpenRouter.
Please open Telegram to view this post
VIEW IN TELEGRAM
Grok 4.6 уже вышел. 😏
Модель стала заметно сильнее Grok 4.5, при этом цена осталась прежней. По тестам самой xAI, Grok 4.6 сравнялся с GPT-5.6 Sol в AA Intelligence Index — по 61 баллу, а в CursorBench, FrontierCode и AA-Briefcase даже обошёл его.
Стоит примерно вдвое дешевле других передовых моделей — $2 за миллион входных токенов и $6 за миллион выходных.
Модель уже доступна в Grok Build, Cursor, Grok Bot и через API. А в течение первой недели пользователям Cursor и Grok Build дают удвоенные лимиты.
Модель стала заметно сильнее Grok 4.5, при этом цена осталась прежней. По тестам самой xAI, Grok 4.6 сравнялся с GPT-5.6 Sol в AA Intelligence Index — по 61 баллу, а в CursorBench, FrontierCode и AA-Briefcase даже обошёл его.
Стоит примерно вдвое дешевле других передовых моделей — $2 за миллион входных токенов и $6 за миллион выходных.
Модель уже доступна в Grok Build, Cursor, Grok Bot и через API. А в течение первой недели пользователям Cursor и Grok Build дают удвоенные лимиты.
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Claude в Chrome теперь синхронизирует разговоры между всеми устройствами.
Теперь сессию Cowork, начатую в Chrome, можно продолжить на компьютере, в веб-версии или на телефоне. Разговоры, навыки и подключённые сервисы сохраняются вместе с аккаунтом.
С сегодняшнего дня функция доступна на тарифах Max и Team. Для Pro её будут включать постепенно.🎉
Теперь сессию Cowork, начатую в Chrome, можно продолжить на компьютере, в веб-версии или на телефоне. Разговоры, навыки и подключённые сервисы сохраняются вместе с аккаунтом.
С сегодняшнего дня функция доступна на тарифах Max и Team. Для Pro её будут включать постепенно.
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Liquid AI выпустила лёгкую и быструю зрительно-языковую модель LFM2.5-VL-3B.
Зрительная модель всего на 3 млрд параметров, которая обгоняет модели более чем вдвое крупнее и при этом работает прямо на Galaxy S26 Ultra со скоростью около 20 токенов в секунду.
LFM2.5-VL-3B умеет работать с мобильными, веб- и настольными интерфейсами, читать экраны, документы и изображения из реального мира, а также точно привязывать объекты к координатам.
На ScreenSpot-v2 модель набирает 80,7 против 51,2 у Gemma-4-E4B.
При этом она превосходит заметно более крупные модели в задачах по интерфейсам, привязке объектов и распознаванию текста.
На M5 Max скорость достигает 228 токенов в секунду, а для работы требуется всего около 3 ГБ памяти.
Модель уже доступна на Hugging Face:
https://huggingface.co/LiquidAI/LFM2.5-VL-3B
Зрительная модель всего на 3 млрд параметров, которая обгоняет модели более чем вдвое крупнее и при этом работает прямо на Galaxy S26 Ultra со скоростью около 20 токенов в секунду.
LFM2.5-VL-3B умеет работать с мобильными, веб- и настольными интерфейсами, читать экраны, документы и изображения из реального мира, а также точно привязывать объекты к координатам.
На ScreenSpot-v2 модель набирает 80,7 против 51,2 у Gemma-4-E4B.
При этом она превосходит заметно более крупные модели в задачах по интерфейсам, привязке объектов и распознаванию текста.
На M5 Max скорость достигает 228 токенов в секунду, а для работы требуется всего около 3 ГБ памяти.
Модель уже доступна на Hugging Face:
https://huggingface.co/LiquidAI/LFM2.5-VL-3B
Вайб-кодинг
Тибо написал, что завтра для нас будет небольшой сюрприз. 😏
Сэр, они только что сбросили лимиты использования для пользователей Codex.
12
Вышла DeepSeek-V4-Pro-0813 🤓
Она выходит примерно на уровень лучших открытых моделей — Kimi k3 и GLM-5.2, и уже приближается к GPT-5.6 Sol и Fable 5.
Из технических обновлений — нативная поддержка OpenAI Responses API и настройка Codex в один клик. Названия моделей в API при этом остались прежними. Для V4 Pro и Flash также появились три уровня рассуждений: низкий, высокий и максимальный.
Одновременно меняется и тарификация: для линейки V4 вводятся пиковые и внепиковые ставки, причём во внепиковые часы цены будут на 50% ниже.
Новые тарифы вступят в силу 16 августа 2026 года в 16:00 UTC.
V4-Pro уже доступен через API, а также в приложении и веб-версии.
Она выходит примерно на уровень лучших открытых моделей — Kimi k3 и GLM-5.2, и уже приближается к GPT-5.6 Sol и Fable 5.
Из технических обновлений — нативная поддержка OpenAI Responses API и настройка Codex в один клик. Названия моделей в API при этом остались прежними. Для V4 Pro и Flash также появились три уровня рассуждений: низкий, высокий и максимальный.
Одновременно меняется и тарификация: для линейки V4 вводятся пиковые и внепиковые ставки, причём во внепиковые часы цены будут на 50% ниже.
Новые тарифы вступят в силу 16 августа 2026 года в 16:00 UTC.
V4-Pro уже доступен через API, а также в приложении и веб-версии.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Вайб-кодинг
Вышла DeepSeek-V4-Pro-0813 🤓 Она выходит примерно на уровень лучших открытых моделей — Kimi k3 и GLM-5.2, и уже приближается к GPT-5.6 Sol и Fable 5. Из технических обновлений — нативная поддержка OpenAI Responses API и настройка Codex в один клик. Названия…
This media is not supported in your browser
VIEW IN TELEGRAM
Вдобавок DeepSeek выпустила свою обвязку — DeepSeek Harness
Модели, инструменты, навыки, сессии, песочницы, файловые системы, циклы, оркестрация и интерфейс — всё реализовано в виде плагинов, которые можно комбинировать, заменять и расширять.
100% опенсорс😋
Модели, инструменты, навыки, сессии, песочницы, файловые системы, циклы, оркестрация и интерфейс — всё реализовано в виде плагинов, которые можно комбинировать, заменять и расширять.
100% опенсорс
Please open Telegram to view this post
VIEW IN TELEGRAM