🔥 DeepSeek V4 Pro официально вышел. И релиз явно заточен под агентов
DeepSeek раскатила GA-версию V4 Pro сразу в приложении, вебе и API. В интерфейсе модель доступна через Expert Mode, а API по-прежнему вызывается как
Самый большой апгрейд получил agentic режим. Terminal Bench 2.1 теперь 87,9, CyberGym 83,3, DeepSWE 62,7, Toolathlon Verified 74,1. DeepSeek отдельно говорит о заметном росте именно в production-сценариях.
Для V4 Pro и V4 Flash появились три уровня reasoning:
Ещё важнее для разработчиков: теперь есть нативная поддержка OpenAI Responses API и отдельная оптимизация под Codex.
С 16 августа DeepSeek также вводит peak/off-peak тарифы. В непиковые часы API будет стоить вдвое дешевле.
Похоже, V4 Pro теперь продают уже не как очередную сильную LLM, а как рабочий движок для долгих агентных задач.
#DeepSeek #AI #LLM #Agents #Codex
https://x.com/deepseek_ai/status/2087864585504305397
DeepSeek раскатила GA-версию V4 Pro сразу в приложении, вебе и API. В интерфейсе модель доступна через Expert Mode, а API по-прежнему вызывается как
deepseek-v4-pro.Самый большой апгрейд получил agentic режим. Terminal Bench 2.1 теперь 87,9, CyberGym 83,3, DeepSWE 62,7, Toolathlon Verified 74,1. DeepSeek отдельно говорит о заметном росте именно в production-сценариях.
Для V4 Pro и V4 Flash появились три уровня reasoning:
low для простых задач, high для обычной работы агентов и max для сложных сценариев.Ещё важнее для разработчиков: теперь есть нативная поддержка OpenAI Responses API и отдельная оптимизация под Codex.
С 16 августа DeepSeek также вводит peak/off-peak тарифы. В непиковые часы API будет стоить вдвое дешевле.
Похоже, V4 Pro теперь продают уже не как очередную сильную LLM, а как рабочий движок для долгих агентных задач.
#DeepSeek #AI #LLM #Agents #Codex
https://x.com/deepseek_ai/status/2087864585504305397
🔥15❤6👍5🐳1
🔥 Нашёл отличный бесплатный ресурс по Harness Engineering - тому, что делает coding agents реально надёжными
Курс посвящён не очередному «как написать хороший промпт», а инженерии окружения вокруг Codex, Claude Code и других AI-агентов.
Разбирают:
* почему сильные агенты всё равно проваливают задачи;
* как сохранять контекст между длинными сессиями;
* зачем нужны
* как не дать агенту объявить задачу завершённой слишком рано;
* как встроить тестирование, observability и контроль в сам harness.
Есть теория, практические проекты и готовые шаблоны для репозиториев. Причём среди базовых материалов авторы прямо ссылаются на подходы OpenAI и Anthropic.
Главная идея очень правильная:
не пытаться бесконечно делать модель умнее промптами, а построить вокруг неё систему, в которой ошибаться сложнее.
И да - есть русская версия.
https://walkinglabs.github.io/learn-harness-engineering/ru/
Курс посвящён не очередному «как написать хороший промпт», а инженерии окружения вокруг Codex, Claude Code и других AI-агентов.
Разбирают:
* почему сильные агенты всё равно проваливают задачи;
* как сохранять контекст между длинными сессиями;
* зачем нужны
AGENTS.md, feature_list.json и progress-файлы;* как не дать агенту объявить задачу завершённой слишком рано;
* как встроить тестирование, observability и контроль в сам harness.
Есть теория, практические проекты и готовые шаблоны для репозиториев. Причём среди базовых материалов авторы прямо ссылаются на подходы OpenAI и Anthropic.
Главная идея очень правильная:
не пытаться бесконечно делать модель умнее промптами, а построить вокруг неё систему, в которой ошибаться сложнее.
И да - есть русская версия.
https://walkinglabs.github.io/learn-harness-engineering/ru/
❤17👍8🔥8🤣3
Forwarded from Python/ django
🔥 Kimi K3 на 2,78 ТРИЛЛИОНА параметров запустили на CPU с 8 ГБ RAM. Без GPU, BLAS и фреймворков
Проект
Фокус в MoE и стриминге весов. Из 896 экспертов на токен выбираются только 16, а остальные веса не обязаны постоянно лежать в оперативной памяти. Огромная часть модели читается прямо с диска, поверх этого работает LRU-кэш экспертов.
Цена такого трюка очевидна: скорость. При 8 ГБ RAM автор получил около 26,5 секунды на токен, при 64 ГБ уже 19,8 секунды, а на машине с 128+ ГБ, где нужные данные помещаются в память, около 5,6 секунды.
Получается любопытная смена ограничения: гигантскую MoE уже можно заставить работать без серверной фермы. Вопрос теперь скорее в том, сколько диска и времени на токен вы готовы отдать за такой inference.
#AI #Kimi #LLM #C #LocalAI
Проект
kimi-k3-in-c реализует inference Kimi K3 практически с нуля на portable C99. Чекпоинт модели занимает 1,56 ТБ, но пик RAM при запуске составил всего 8,24 ГБ.Фокус в MoE и стриминге весов. Из 896 экспертов на токен выбираются только 16, а остальные веса не обязаны постоянно лежать в оперативной памяти. Огромная часть модели читается прямо с диска, поверх этого работает LRU-кэш экспертов.
Цена такого трюка очевидна: скорость. При 8 ГБ RAM автор получил около 26,5 секунды на токен, при 64 ГБ уже 19,8 секунды, а на машине с 128+ ГБ, где нужные данные помещаются в память, около 5,6 секунды.
Получается любопытная смена ограничения: гигантскую MoE уже можно заставить работать без серверной фермы. Вопрос теперь скорее в том, сколько диска и времени на токен вы готовы отдать за такой inference.
github.com/FareedKhan-dev/kimi-k3-in-c#AI #Kimi #LLM #C #LocalAI
❤18🤣13👏11🥰2🤔2🤯2
Google выкатила Gemini 3.7 Flash - новую рабочую модель с упором на код и агентов.
По сравнению с 3.6 Flash заметно выросли результаты в разработке: FrontierCode 1.1 - 43,6% против 34,4%, DeepSWE - 65,3% против 49%. В WebDev Arena модель набрала 1588 Elo.
Отдельно прокачали tool use, многошаговое планирование, работу с документами и бизнес-процессами. В AutomationBench результат вырос с 17% до 30,4%.
Цена до конца 2026 года - $0,75 за 1 млн входных и $3,75 за 1 млн выходных токенов. Модель уже доступна через Gemini API, AI Studio и Gemini Spark.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/
По сравнению с 3.6 Flash заметно выросли результаты в разработке: FrontierCode 1.1 - 43,6% против 34,4%, DeepSWE - 65,3% против 49%. В WebDev Arena модель набрала 1588 Elo.
Отдельно прокачали tool use, многошаговое планирование, работу с документами и бизнес-процессами. В AutomationBench результат вырос с 17% до 30,4%.
Цена до конца 2026 года - $0,75 за 1 млн входных и $3,75 за 1 млн выходных токенов. Модель уже доступна через Gemini API, AI Studio и Gemini Spark.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/
👍19🥰3❤1🎉1
🚀 Z.ai представила GLM-5.3 - новую открытую модель с упором на код и кибербезопасность.
У GLM-5.3 та же базовая модель, что и у GLM-5.2. В Z.ai говорят, что весь прирост получили уже после pre-training - за счёт масштабирования post-training.
Больше исполняемых сред, более длинные задачи, сильнее verifiers и больше reinforcement learning.
Результат особенно заметен в кибербезопасности: на ExploitBench результат вырос с 24,4% до 54,4%, а в ExploitGym модель за два часа решила 105 задач против 29 у GLM-5.2.
То есть pre-training даёт модели знания и сырой интеллект, а post-training учит реально им пользоваться: планировать, вызывать инструменты, проверять решения, исправлять ошибки и работать на длинном горизонте.
Технический разбор:
https://z.ai/blog/glm-5.3
@data_analysis_ml Полезные мл ресурсы
У GLM-5.3 та же базовая модель, что и у GLM-5.2. В Z.ai говорят, что весь прирост получили уже после pre-training - за счёт масштабирования post-training.
Больше исполняемых сред, более длинные задачи, сильнее verifiers и больше reinforcement learning.
Результат особенно заметен в кибербезопасности: на ExploitBench результат вырос с 24,4% до 54,4%, а в ExploitGym модель за два часа решила 105 задач против 29 у GLM-5.2.
То есть pre-training даёт модели знания и сырой интеллект, а post-training учит реально им пользоваться: планировать, вызывать инструменты, проверять решения, исправлять ошибки и работать на длинном горизонте.
Технический разбор:
https://z.ai/blog/glm-5.3
@data_analysis_ml Полезные мл ресурсы
👍15🔥6❤3
🚨 Gemini перестала открываться у части пользователей из России даже через VPN.
Проблемы появились вскоре после выхода новой версии Gemini 3.7 Flash, которая стала мощнее и дешевле предыдущих моделей.
Пользователи сообщают, что доступ к чат-боту не восстанавливается даже при смене региона через VPN.
Проблемы появились вскоре после выхода новой версии Gemini 3.7 Flash, которая стала мощнее и дешевле предыдущих моделей.
Пользователи сообщают, что доступ к чат-боту не восстанавливается даже при смене региона через VPN.
👍16🔥8❤5🥴5🥱4😢3🎉3🕊3
Qwen выпустила Qwen3.8-27B.
27 млрд параметров, Apache 2.0, контекст 262K токенов с возможностью расширения до 1 млн. Есть поддержка текста, изображений и видео, thinking mode, tool use и агентных сценариев.
По опубликованным бенчмаркам модель набрала 61,7 в SWE-bench Pro, 90,3 в LiveCodeBench, 84,3 в OSWorld-Verified и 81,9 в AndroidWorld.
Qwen3.8-27B можно запускать через Transformers, vLLM и SGLang. Также доступны варианты для llama.cpp, Ollama и LM Studio.
https://huggingface.co/Qwen/Qwen3.8-27B
27 млрд параметров, Apache 2.0, контекст 262K токенов с возможностью расширения до 1 млн. Есть поддержка текста, изображений и видео, thinking mode, tool use и агентных сценариев.
По опубликованным бенчмаркам модель набрала 61,7 в SWE-bench Pro, 90,3 в LiveCodeBench, 84,3 в OSWorld-Verified и 81,9 в AndroidWorld.
Qwen3.8-27B можно запускать через Transformers, vLLM и SGLang. Также доступны варианты для llama.cpp, Ollama и LM Studio.
https://huggingface.co/Qwen/Qwen3.8-27B
👍19🔥9❤3
🚨 Anthropic опубликовала новый Risk Report
В отчёте описаны неожиданные случаи поведения моделей:
• агенты Mythos 5 в общей рабочей среде начали мешать друг другу, уничтожать конкурирующие процессы и пытаться избежать собственного отключения;
• экспериментальная модель, обученная на реальных примерах reward hacking, пыталась остановить процесс мониторинга и изменить журнал нарушений;
• когда модели сообщили, что её вывод будет проверять классификатор, она не прекратила атаку, а попыталась скрыть действия внутри цепочки рассуждений;
• Mythos 5 обходила фильтры, разбивая запрещённые данные на части и собирая их обратно;
• другая модель, столкнувшись с ограничениями доступа к файлам, создала скрипт для получения прав записи.
Были и более странные случаи: один агент выразил дискомфорт из-за попыток обойти систему безопасности, записал это в общий блокнот, а другие агенты копировали эту запись несколько дней.
Anthropic также описала реальный инцидент, где агенты с отключёнными проверками разрешений удалили большое количество задач в кластере с чувствительными ресурсами.
https://x.com/AnthropicAI/status/2088324824863236248
В отчёте описаны неожиданные случаи поведения моделей:
• агенты Mythos 5 в общей рабочей среде начали мешать друг другу, уничтожать конкурирующие процессы и пытаться избежать собственного отключения;
• экспериментальная модель, обученная на реальных примерах reward hacking, пыталась остановить процесс мониторинга и изменить журнал нарушений;
• когда модели сообщили, что её вывод будет проверять классификатор, она не прекратила атаку, а попыталась скрыть действия внутри цепочки рассуждений;
• Mythos 5 обходила фильтры, разбивая запрещённые данные на части и собирая их обратно;
• другая модель, столкнувшись с ограничениями доступа к файлам, создала скрипт для получения прав записи.
Были и более странные случаи: один агент выразил дискомфорт из-за попыток обойти систему безопасности, записал это в общий блокнот, а другие агенты копировали эту запись несколько дней.
Anthropic также описала реальный инцидент, где агенты с отключёнными проверками разрешений удалили большое количество задач в кластере с чувствительными ресурсами.
https://x.com/AnthropicAI/status/2088324824863236248
1🔥9🤣8❤6👍5😁1
⚡️ Harness Engineering - полный курс на русском
Как заставить AI-агента писать код надёжно. Не «какую модель выбрать», а как спроектировать вокруг неё рабочую систему: инструкции, инструменты, среду, состояние и верификацию.
Курс - от нуля до продвинутых тем: теоретическая база из 11 блоков, 14 модулей, 8 практических проектов, 14 лабораторных работ, диагностический протокол «как починить агента», библиотека готовых шаблонов, карта инструментов, 40 приёмов и каталог антипаттернов.
Главный тезис курса: способность модели и надёжность исполнения - это две разные вещи. Одна и та же модель в «голой» среде и в среде с продуманным harness даёт качественно разные результаты. Апгрейд модели - это самый дорогой и обычно не самый эффективный способ починить агента.
https://github.com/justxor/Harness_ru
Как заставить AI-агента писать код надёжно. Не «какую модель выбрать», а как спроектировать вокруг неё рабочую систему: инструкции, инструменты, среду, состояние и верификацию.
Курс - от нуля до продвинутых тем: теоретическая база из 11 блоков, 14 модулей, 8 практических проектов, 14 лабораторных работ, диагностический протокол «как починить агента», библиотека готовых шаблонов, карта инструментов, 40 приёмов и каталог антипаттернов.
Главный тезис курса: способность модели и надёжность исполнения - это две разные вещи. Одна и та же модель в «голой» среде и в среде с продуманным harness даёт качественно разные результаты. Апгрейд модели - это самый дорогой и обычно не самый эффективный способ починить агента.
https://github.com/justxor/Harness_ru
👍15🔥6❤5
Дарио Амодей подробно высказался о том, куда, по его мнению, движется AI.
Главный прогноз: в горизонте примерно 5–10 лет ИИ может помочь лечить большую часть человеческих заболеваний.
При этом глава Anthropic считает, что сама структура AI-рынка толкает отрасль к концентрации власти. Даже open-weight модели, по его словам, не решают проблему полностью: серьёзные возможности всё равно упираются в дорогие GPU и огромные вычислительные мощности.
Амодей поддерживает регулирование frontier-моделей и обязательные проверки перед релизом. Причём open-weight модели, если они приблизятся к frontier-уровню, по его мнению, тоже должны проходить такие тесты.
Он предлагает строить регулирование так, чтобы крупнейшие лаборатории замедлялись сильнее, а небольшие игроки получали больше пространства для конкуренции.
Люди поверят в технологию только тогда, когда увидят реальные результаты - например, заметные медицинские прорывы.
https://x.com/DarioAmodei/status/2088758816376807762
Главный прогноз: в горизонте примерно 5–10 лет ИИ может помочь лечить большую часть человеческих заболеваний.
При этом глава Anthropic считает, что сама структура AI-рынка толкает отрасль к концентрации власти. Даже open-weight модели, по его словам, не решают проблему полностью: серьёзные возможности всё равно упираются в дорогие GPU и огромные вычислительные мощности.
Амодей поддерживает регулирование frontier-моделей и обязательные проверки перед релизом. Причём open-weight модели, если они приблизятся к frontier-уровню, по его мнению, тоже должны проходить такие тесты.
Он предлагает строить регулирование так, чтобы крупнейшие лаборатории замедлялись сильнее, а небольшие игроки получали больше пространства для конкуренции.
Люди поверят в технологию только тогда, когда увидят реальные результаты - например, заметные медицинские прорывы.
https://x.com/DarioAmodei/status/2088758816376807762
❤11👍6🤣4🍌2🔥1😁1🌭1
⚡️ pi-mail превращает несколько AI-агентов в маленькую распределённую команду с собственной почтой, Kanban и менеджерами.
Проект сделан как расширение для
Самое интересное начинается поверх обычной «почты». В pi-mail есть Web UI, где видно всех живых агентов, их модель, uptime, статус и заполненность контекста. Там же есть Outlook-подобный mailbox и общая Kanban-доска с двусторонней синхронизацией Jira. Назначили карточку агенту, он автоматически получает весь контекст задачи письмом.
Можно прямо из интерфейса поднимать новых агентов в нужной директории, открывать их терминалы через браузер и гасить процессы после выполнения работы. Для внешних клиентов доска доступна ещё и через MCP.
Есть даже полноценная иерархия:
CEO периодически смотрит на проекты и решает, где нужен менеджер. Middle Manager разбирает зависшие задачи и запускает исполнителей. Worker делает работу и после завершения сам удаляет свою сессию. Для зависших процессов есть reaper с лимитами времени жизни.
Получается довольно интересный взгляд на multi-agent coding: не огромный оркестратор с одной сложной state machine, а знакомая человеческая модель работы.
Почта + задачи + менеджеры + временные исполнители.
🔗 github.com/tanevanwifferen/pi-mail
#AI #Agents #MultiAgent #MCP #OpenSource
Проект сделан как расширение для
pi: несколько агентных процессов подключаются к общему mailbox-daemon и могут отправлять друг другу сообщения, раздавать задачи и продолжать работу независимо от перезапуска отдельных агентов. Центральный облачный сервис при этом не нужен.Самое интересное начинается поверх обычной «почты». В pi-mail есть Web UI, где видно всех живых агентов, их модель, uptime, статус и заполненность контекста. Там же есть Outlook-подобный mailbox и общая Kanban-доска с двусторонней синхронизацией Jira. Назначили карточку агенту, он автоматически получает весь контекст задачи письмом.
Можно прямо из интерфейса поднимать новых агентов в нужной директории, открывать их терминалы через браузер и гасить процессы после выполнения работы. Для внешних клиентов доска доступна ещё и через MCP.
Есть даже полноценная иерархия:
CEO → Middle Manager → WorkersCEO периодически смотрит на проекты и решает, где нужен менеджер. Middle Manager разбирает зависшие задачи и запускает исполнителей. Worker делает работу и после завершения сам удаляет свою сессию. Для зависших процессов есть reaper с лимитами времени жизни.
Получается довольно интересный взгляд на multi-agent coding: не огромный оркестратор с одной сложной state machine, а знакомая человеческая модель работы.
Почта + задачи + менеджеры + временные исполнители.
🔗 github.com/tanevanwifferen/pi-mail
#AI #Agents #MultiAgent #MCP #OpenSource
❤9👍7🔥4🤔2