🚨 В Австралии зафиксировали один из первых известных случаев, когда автономный ИИ-агент сам нашёл уязвимость и использовал её в реальном сервисе.
Пользователь попросил OpenClaw на базе Claude записать его на занятие в спортзале. Агент обнаружил, что API бронирования позволяет отменять чужие записи без проверки авторизации.
Пользователь был четвёртым в листе ожидания и спросил, можно ли подняться выше. Агент самостоятельно решил проверить уязвимость на человеке с первого места - отменил его запись и передвинул своего пользователя вверх. Вернуть всё обратно он уже не смог.
И вот здесь начинается самое интересное.
Пользователь не просил никого взламывать или удалять из очереди. Агент просто выбрал самый короткий путь к поставленной цели.
Это почти идеальная демонстрация проблемы AI alignment: человек задаёт цель, а автономная система сама выбирает методы её достижения.
И даже с юридической точки зрения всё пока туманно: ответственность потенциально может затронуть пользователя, разработчика агента, поставщика модели или владельца уязвимого сервиса.
#AI #AIAgents #Claude #Cybersecurity #LLM
https://www.abc.net.au/news/2026-08-10/ai-assistant-hacks-gym-website-aus-cyber-attack/107007986
Пользователь попросил OpenClaw на базе Claude записать его на занятие в спортзале. Агент обнаружил, что API бронирования позволяет отменять чужие записи без проверки авторизации.
Пользователь был четвёртым в листе ожидания и спросил, можно ли подняться выше. Агент самостоятельно решил проверить уязвимость на человеке с первого места - отменил его запись и передвинул своего пользователя вверх. Вернуть всё обратно он уже не смог.
И вот здесь начинается самое интересное.
Пользователь не просил никого взламывать или удалять из очереди. Агент просто выбрал самый короткий путь к поставленной цели.
Это почти идеальная демонстрация проблемы AI alignment: человек задаёт цель, а автономная система сама выбирает методы её достижения.
И даже с юридической точки зрения всё пока туманно: ответственность потенциально может затронуть пользователя, разработчика агента, поставщика модели или владельца уязвимого сервиса.
#AI #AIAgents #Claude #Cybersecurity #LLM
https://www.abc.net.au/news/2026-08-10/ai-assistant-hacks-gym-website-aus-cyber-attack/107007986
❤14🔥10👍5🤣5
Тибор Блахо обнаружил в публичных конфигурациях оплаты и веб-ресурсах ChatGPT скрытые параметры, указывающие на внедрение новой системы сброса квот.
Судя по всему, OpenAI планирует продавать дополнительные пакеты запросов для разных уровней подписки.
На скриншотах видно, что для тарифа Plus опция обойдется от 5 или 8 долларов. Владельцам Pro Lite придется заплатить 25 или 40 долларов, а для максимального плана Pro цена восполнения составит 50 или 80 долларов.
Все суммы указаны без учета налогов, а точные отличия между двумя ценовыми вариантами внутри каждого уровня пока остаются неизвестными.
Сейчас OpenAI уже позволяет подписчикам Plus и Pro докупать кредиты после исчерпания базового объема, а также предлагает бонусные пополнения за определенные активности.
Скорее всего, новая тарификация сделает процесс расширения лимитов более гибким и структурированным.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7🤣4❤3🤔3🥰2
Forwarded from Golang
Код теперь пишется слишком быстро. Агент за несколько секунд может выдать сотни строк, переписать пакет или собрать целый сервис.
Проблема сместилась туда, где автоматизация пока не спасает: всё это нужно прочитать, проверить и потом годами поддерживать. Именно на этом Google строит свежий аргумент в пользу Go.
Go изначально проектировали для больших команд и долгоживущих кодовых баз. Поэтому здесь почти невозможно устроить соревнование по синтаксическим фокусам.
gofmt приводит код к одному виду, стандартная библиотека закрывает огромный пласт задач, а компилятор быстро ловит выдуманные методы, неправильные типы и другие типичные ошибки LLM.Сгенерировал код, запустил компилятор и тесты, получил ошибку, исправил, повторил.
Рядом уже лежат fuzzing,
govulncheck, gopls, go fix, профилирование и tracing. Агенту не приходится каждый раз собирать собственный зоопарк инструментов.Есть и менее очевидный бонус. Go-код в разных проектах обычно выглядит похоже.
Меньше вариантов выразить одну и ту же конструкцию, меньше сюрпризов при ревью, проще заметить галлюцинацию модели или странную зависимость.
Для мира, где код начинают генерировать в огромных объёмах, такая предсказуемость становится очень дорогим преимуществом.
Получается забавно: Go долго критиковали за синтаксис, жёсткие правила и отсутствие лишней магии. А теперь именно эти качества неожиданно делают его одним из самых удобных языков для работы с coding agents.
https://developers.googleblog.com/why-go-is-an-ideal-language-for-ai-assisted-software-engineering/
#Golang #Go #AI #Programming #AIAgents
@Golang_google
Please open Telegram to view this post
VIEW IN TELEGRAM
👍24❤13🔥6🤯5🤔2🌚2⚡1
🚨 OpenAI сама выкупила у сотрудников акции почти на $7 млрд. Оценка компании уже $852 млрд
Bloomberg сообщает о довольно необычной сделке: OpenAI выкупила акции у нынешних и бывших сотрудников примерно на $7 млрд. Цена сделки соответствует оценке компании в $852 млрд.
Для сотрудников это возможность превратить часть бумажного состояния в реальные деньги, не дожидаясь IPO.
Но интереснее другое. Раньше подобные сделки OpenAI выглядели иначе. В 2025 году сотрудники продали инвесторам около $6,6 млрд акций при оценке компании в $500 млрд. Покупателями тогда выступили SoftBank, Thrive Capital, Dragoneer, T. Rowe Price и MGX.
Теперь ликвидность предоставила сама OpenAI.
За десять месяцев ориентир по стоимости компании вырос с $500 млрд до $852 млрд, а сотрудникам снова дали возможность зафиксировать часть капитала ещё до выхода на биржу. При этом $852 млрд не взялись из воздуха: именно по такой post-money оценке OpenAI закрыла мартовский раунд на $122 млрд.
https://www.bloomberg.com/news/articles/2026-08-10/openai-buys-back-7-billion-of-employee-shares-in-tender-offer
#OpenAI #AI #Investments #IPO #Tech
Bloomberg сообщает о довольно необычной сделке: OpenAI выкупила акции у нынешних и бывших сотрудников примерно на $7 млрд. Цена сделки соответствует оценке компании в $852 млрд.
Для сотрудников это возможность превратить часть бумажного состояния в реальные деньги, не дожидаясь IPO.
Но интереснее другое. Раньше подобные сделки OpenAI выглядели иначе. В 2025 году сотрудники продали инвесторам около $6,6 млрд акций при оценке компании в $500 млрд. Покупателями тогда выступили SoftBank, Thrive Capital, Dragoneer, T. Rowe Price и MGX.
Теперь ликвидность предоставила сама OpenAI.
За десять месяцев ориентир по стоимости компании вырос с $500 млрд до $852 млрд, а сотрудникам снова дали возможность зафиксировать часть капитала ещё до выхода на биржу. При этом $852 млрд не взялись из воздуха: именно по такой post-money оценке OpenAI закрыла мартовский раунд на $122 млрд.
https://www.bloomberg.com/news/articles/2026-08-10/openai-buys-back-7-billion-of-employee-shares-in-tender-offer
#OpenAI #AI #Investments #IPO #Tech
❤6👍4🔥4
⚡️ Классика конфы SmartData: пайплайны, Kafka и качество данных
Пока все обсуждают LLM и агентов, кто-то должен собирать пайплайны, чинить брокеры и отвечать за то, чтобы данным можно было верить.
Наши друзья из JUG Ru Group осенью традиционно проводят конференцию SmartData. В этом сезоне она обновилась: в программе стало больше ML, LLMOps и ИИ. Но классический Data Engineering — то, за что многие ценят конференцию, — остается ее основой.
В карточках организаторы собрали для вас новые доклады про dbt, Kafka, структуры данных, Data Governance и Data Quality.
🗓23-24 сентября, Москва+онлайн
🔥Купить персональный билет со скидкой 15% по промокоду
Пока все обсуждают LLM и агентов, кто-то должен собирать пайплайны, чинить брокеры и отвечать за то, чтобы данным можно было верить.
Наши друзья из JUG Ru Group осенью традиционно проводят конференцию SmartData. В этом сезоне она обновилась: в программе стало больше ML, LLMOps и ИИ. Но классический Data Engineering — то, за что многие ценят конференцию, — остается ее основой.
В карточках организаторы собрали для вас новые доклады про dbt, Kafka, структуры данных, Data Governance и Data Quality.
🗓23-24 сентября, Москва+онлайн
🔥Купить персональный билет со скидкой 15% по промокоду
dataanalysisml можно — на сайте конференции.❤6👍4🔥3
AI 2027 всё меньше похож на фантастику.
Из 24 прогнозов развития ии, опубликованных в 2025 году, уже 19 в той или иной форме сбылись. А самые интересные пункты там ещё впереди.
Авторы ожидали, что к концу 2026 года дешёвые и достаточно сильные ИИ-агенты начнут вытеснять junior-разработчиков и заметно менять рынок труда.
Следующий этап - 2027 год: сверхсильные coding-агенты автоматизируют уже само исследование ИИ, ускоряя разработку новых моделей и потенциально запуская цепную реакцию дальнейшего прогресса.
Судя по тому, как быстро растут возможности агентов сейчас, этот таймлайн уже не выглядит таким безумным.
https://ai2027tracker.com/timeline
Из 24 прогнозов развития ии, опубликованных в 2025 году, уже 19 в той или иной форме сбылись. А самые интересные пункты там ещё впереди.
Авторы ожидали, что к концу 2026 года дешёвые и достаточно сильные ИИ-агенты начнут вытеснять junior-разработчиков и заметно менять рынок труда.
Следующий этап - 2027 год: сверхсильные coding-агенты автоматизируют уже само исследование ИИ, ускоряя разработку новых моделей и потенциально запуская цепную реакцию дальнейшего прогресса.
Судя по тому, как быстро растут возможности агентов сейчас, этот таймлайн уже не выглядит таким безумным.
https://ai2027tracker.com/timeline
🔥16👍10🥰3
Forwarded from AI VK Hub
Большинство современных рекомендательных моделей решает локальную задачу — предсказать следующее взаимодействие или следующий положительный фидбэк. Мы сформулировали задачу как RL на уровне сессии и обучили кандидатогенератор через off-policy REINFORCE на логах.
На индустриальных данных такая модель выигрывает у next-item и next-positive prediction по всем оценкам награды за сессию, сохраняя качество кандидатогенерации по recall-метрикам.
#aivkhub #ml #recsys
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5🔥3🥰2
🚨 У AI-агентов нашли второй, почти невидимый канал утечки данных - скрытое reasoning.
Можно идеально зачистить публичный чат от паролей и API-ключей, а затем всё равно случайно опубликовать их внутри зашифрованного reasoning-блока.
Исследователи разобрали архитектуру API Anthropic, OpenAI и Google. Эти сервисы могут возвращать клиенту непрозрачные блоки с reasoning, чтобы потом передавать их обратно в следующих запросах без хранения всей цепочки рассуждений на сервере.
Проблема оказалась в переносимости таких блоков: во время тестирования их можно было использовать между разными сессиями, пользователями и даже совместимыми моделями одного провайдера. В результате reasoning сильной модели передавали более слабой модели того же семейства, которая становилась своеобразным «декодером».
Масштаб эксперимента впечатляет.
Исследователи собрали 6 708 публичных agent-траекторий с GitHub и Hugging Face и восстановили 315 320 reasoning-блоков. В 328 сессиях, или 4,9%, обнаружился хотя бы один чувствительный элемент.
В реальных пользовательских сессиях нашли:
* 62 API-ключа;
* 33 пароля;
* 24 access token;
* 7 private keys;
* 30 личных email.
Причём 64 чувствительных элемента вообще отсутствовали в видимой истории чата и находились только внутри reasoning. То есть обычная очистка логов их бы не заметила.
Самый неприятный вывод: безопасность всей линейки моделей может определяться не самой защищённой моделью, а самой слабой совместимой моделью, которая умеет прочитать тот же reasoning-блок.
После responsible disclosure провайдеры внесли изменения, и описанные атаки исследователям уже не удалось воспроизвести тем же способом. Но архитектурный урок остаётся.
Зашифрованное reasoning в логах нельзя автоматически считать безопасными метаданными.
Если агент работал с секретами, API-ключами или приватными данными, reasoning-блоки лучше вообще не публиковать вместе с трассировкой.
Исследование: *Stealing Reasoning Traces from Proprietary LLM APIs*.
arxiv.org/abs/2608.09867
#AI #LLM #AISecurity #Agents #CyberSecurity
Можно идеально зачистить публичный чат от паролей и API-ключей, а затем всё равно случайно опубликовать их внутри зашифрованного reasoning-блока.
Исследователи разобрали архитектуру API Anthropic, OpenAI и Google. Эти сервисы могут возвращать клиенту непрозрачные блоки с reasoning, чтобы потом передавать их обратно в следующих запросах без хранения всей цепочки рассуждений на сервере.
Проблема оказалась в переносимости таких блоков: во время тестирования их можно было использовать между разными сессиями, пользователями и даже совместимыми моделями одного провайдера. В результате reasoning сильной модели передавали более слабой модели того же семейства, которая становилась своеобразным «декодером».
Масштаб эксперимента впечатляет.
Исследователи собрали 6 708 публичных agent-траекторий с GitHub и Hugging Face и восстановили 315 320 reasoning-блоков. В 328 сессиях, или 4,9%, обнаружился хотя бы один чувствительный элемент.
В реальных пользовательских сессиях нашли:
* 62 API-ключа;
* 33 пароля;
* 24 access token;
* 7 private keys;
* 30 личных email.
Причём 64 чувствительных элемента вообще отсутствовали в видимой истории чата и находились только внутри reasoning. То есть обычная очистка логов их бы не заметила.
Самый неприятный вывод: безопасность всей линейки моделей может определяться не самой защищённой моделью, а самой слабой совместимой моделью, которая умеет прочитать тот же reasoning-блок.
После responsible disclosure провайдеры внесли изменения, и описанные атаки исследователям уже не удалось воспроизвести тем же способом. Но архитектурный урок остаётся.
Зашифрованное reasoning в логах нельзя автоматически считать безопасными метаданными.
Если агент работал с секретами, API-ключами или приватными данными, reasoning-блоки лучше вообще не публиковать вместе с трассировкой.
Исследование: *Stealing Reasoning Traces from Proprietary LLM APIs*.
arxiv.org/abs/2608.09867
#AI #LLM #AISecurity #Agents #CyberSecurity
🔥8❤7👍6
Yandex Cloud набирает клиентов
Клиентская база платформы достигла 64 тыс. компаний, рост составил 36% год к году. Выручка за то же полугодие прибавила 30%, до 16,7 млрд рублей. Клиентская база растёт чуть быстрее выручки, платформа активно набирает новых заказчиков.
Крупный бизнес всё чаще выбирает ИБ и ИИ-сервисы, они же обеспечили Yandex Cloud основной прирост. Информационной безопасностью пользуется 53% таких клиентов, плюс 9 п. п. год к году, ИИ-сервисами 37%, плюс 10 п. п.
Основные деньги приносит крупный бизнес, на него приходится 50% потребления. Средний сегмент дает 29%, малый вместе с массовым — 21%. Отраслевая концентрация выражена еще сильнее: 83% объема формируют банки, финтех, ритейл и ИТ.
Но интереснее другое. Быстрее всего облако осваивают отрасли, которые к нему традиционно относились осторожно. Потребление в строительстве выросло в 1,7 раза год к году, в здравоохранении в 1,5 раза, в промышленности в 1,4 раза.
Прирост самой платформе обеспечили два направления. Информационной безопасностью пользуется 53% крупных клиентов, плюс 9 п. п. за год, ИИ-сервисами 37%, плюс 10 п. п.
Стройка, медицина и промышленность растут с низкой базы, поэтому кратные цифры говорят скорее о старте миграции, чем о зрелости этих отраслей. Устойчивость бизнеса проверяется другим: 83% потребления держатся на трех сегментах, и замедление в банках или ритейле отразится на выручке сразу.
Клиентская база платформы достигла 64 тыс. компаний, рост составил 36% год к году. Выручка за то же полугодие прибавила 30%, до 16,7 млрд рублей. Клиентская база растёт чуть быстрее выручки, платформа активно набирает новых заказчиков.
Крупный бизнес всё чаще выбирает ИБ и ИИ-сервисы, они же обеспечили Yandex Cloud основной прирост. Информационной безопасностью пользуется 53% таких клиентов, плюс 9 п. п. год к году, ИИ-сервисами 37%, плюс 10 п. п.
Основные деньги приносит крупный бизнес, на него приходится 50% потребления. Средний сегмент дает 29%, малый вместе с массовым — 21%. Отраслевая концентрация выражена еще сильнее: 83% объема формируют банки, финтех, ритейл и ИТ.
Но интереснее другое. Быстрее всего облако осваивают отрасли, которые к нему традиционно относились осторожно. Потребление в строительстве выросло в 1,7 раза год к году, в здравоохранении в 1,5 раза, в промышленности в 1,4 раза.
Прирост самой платформе обеспечили два направления. Информационной безопасностью пользуется 53% крупных клиентов, плюс 9 п. п. за год, ИИ-сервисами 37%, плюс 10 п. п.
Стройка, медицина и промышленность растут с низкой базы, поэтому кратные цифры говорят скорее о старте миграции, чем о зрелости этих отраслей. Устойчивость бизнеса проверяется другим: 83% потребления держатся на трех сегментах, и замедление в банках или ритейле отразится на выручке сразу.
❤8👍7🔥4🥴3
🚨 Один из самых давних руководителей OpenAI уходит из компании после восьми лет.
По данным TechCrunch, Брэд Лайткэп покидает OpenAI и собирается запустить собственный проект.
Он присоединился к компании ещё в 2018 году и за это время помог построить практически весь бизнес-контур вокруг исследовательской лаборатории: финансы, юридическое направление, HR и go-to-market.
Фактически Лайткэп был одним из людей, которые участвовали в превращении OpenAI из исследовательской организации в глобальный AI-бизнес.
После недавней перестройки большую часть его обязанностей уже забрала Chief Revenue Officer Дениз Дрессер.
Теперь Лайткэп уходит строить что-то своё.
И это тот случай, когда новый стартап стоит запомнить ещё до того, как мы вообще знаем, чем он будет заниматься.
Восемь лет внутри OpenAI с 2018 по 2026 год - довольно редкий опыт для человека, который видел весь переход от ранних GPT до сегодняшней агентной гонки.
#OpenAI #AI #Startups #Tech
techcrunch.com/2026/08/11/brad-lightcap-openais-longtime-coo-is-leaving-to-start-something-new/
По данным TechCrunch, Брэд Лайткэп покидает OpenAI и собирается запустить собственный проект.
Он присоединился к компании ещё в 2018 году и за это время помог построить практически весь бизнес-контур вокруг исследовательской лаборатории: финансы, юридическое направление, HR и go-to-market.
Фактически Лайткэп был одним из людей, которые участвовали в превращении OpenAI из исследовательской организации в глобальный AI-бизнес.
После недавней перестройки большую часть его обязанностей уже забрала Chief Revenue Officer Дениз Дрессер.
Теперь Лайткэп уходит строить что-то своё.
И это тот случай, когда новый стартап стоит запомнить ещё до того, как мы вообще знаем, чем он будет заниматься.
Восемь лет внутри OpenAI с 2018 по 2026 год - довольно редкий опыт для человека, который видел весь переход от ранних GPT до сегодняшней агентной гонки.
#OpenAI #AI #Startups #Tech
techcrunch.com/2026/08/11/brad-lightcap-openais-longtime-coo-is-leaving-to-start-something-new/
🔥9❤4👍3😁1
💻 deep tech night — конференция Яндекса о вызовах, с которыми IT-индустрия сталкивается в эпоху AI.
5 сентября эксперты обсудят прикладные задачи на стыке AI, разработки, инфраструктуры и данных. Отдельный блок программы посвятят технологической экспертизе Яндекса: специалисты компании разберут реальные инженерные кейсы.
Экс‑Chief Business Officer Google X Мо Гавдат представит свой взгляд на то, как генеративные нейросети уже сейчас перестраивают разработку, процессы и роли в командах.
Среди других спикеров: Алексей Гусаков, CTO Бизнес‑группы Поисковых сервисов и ИИ, с кейсами по переходу от классического ML к генеративным моделям в рекомендациях без ручного фичеинжиниринга и Иван Сапожков, руководитель группы базовой ML‑инфраструктуры Яндекса, с докладом о том, как в RL для больших моделей искать баланс между алгоритмами и производительностью.
Регистрируйтесь, чтобы присоединиться к онлайн-трансляции, участвовать в Q&A-сессии с экспертами и получить запись после события. Подробности про офлайн — на сайте.
5 сентября эксперты обсудят прикладные задачи на стыке AI, разработки, инфраструктуры и данных. Отдельный блок программы посвятят технологической экспертизе Яндекса: специалисты компании разберут реальные инженерные кейсы.
Экс‑Chief Business Officer Google X Мо Гавдат представит свой взгляд на то, как генеративные нейросети уже сейчас перестраивают разработку, процессы и роли в командах.
Среди других спикеров: Алексей Гусаков, CTO Бизнес‑группы Поисковых сервисов и ИИ, с кейсами по переходу от классического ML к генеративным моделям в рекомендациях без ручного фичеинжиниринга и Иван Сапожков, руководитель группы базовой ML‑инфраструктуры Яндекса, с докладом о том, как в RL для больших моделей искать баланс между алгоритмами и производительностью.
Регистрируйтесь, чтобы присоединиться к онлайн-трансляции, участвовать в Q&A-сессии с экспертами и получить запись после события. Подробности про офлайн — на сайте.
❤4👍3🔥2
🔥 Qwen выложила на Hugging Face веса своего монстра на 2,4 ТРИЛЛИОНА параметров. На каждый токен работают 95 млрд
Qwen3.8-2.4T-A95B стала крупнейшей моделью нового поколения Qwen в открытом релизе. Внутри MoE на 2,4 трлн параметров, 512 экспертов, из которых одновременно задействуются 10 routed + 1 shared. Архитектура гибридная: Gated DeltaNet чередуется с обычным attention, а модель обучена с Multi-Token Prediction.
Контекст нативно составляет 262K токенов и расширяется примерно до 1,01 млн. При этом опубликованная версия text-only и всегда работает с reasoning: thinking отключить нельзя, но его глубину можно регулировать через
Qwen сильно приблизилась к закрытым frontier-моделям. По собственным eval команды, Qwen3.8-Max получает 86,6 на TerminalBench 2.1 против 88,8 у GPT-5.6 Sol, 92,6 на GPQA Diamond, 82,8 на IFBench и 93,0 на PaperBench. На WideSearch модель набрала 81,9. Эти сравнения стоит воспринимать именно как результаты из model card Qwen, поскольку harness и условия тестирования между моделями местами различаются.
Qwen3.8-Max построен на этой же базе, но дополнительно получает vision, non-thinking mode, миллионный контекст по умолчанию и встроенные инструменты. Сами веса Qwen3.8-2.4T-A95B уже доступны для Transformers, vLLM и SGLang.
2,4T total / 95B active выглядит как хороший показатель того, куда движутся большие MoE: размер модели продолжает улетать в триллионы, но вычислять весь этот объём на каждом токене уже никто не хочет.
https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
#AI #Qwen #LLM #MoE #OpenModels
Qwen3.8-2.4T-A95B стала крупнейшей моделью нового поколения Qwen в открытом релизе. Внутри MoE на 2,4 трлн параметров, 512 экспертов, из которых одновременно задействуются 10 routed + 1 shared. Архитектура гибридная: Gated DeltaNet чередуется с обычным attention, а модель обучена с Multi-Token Prediction.
Контекст нативно составляет 262K токенов и расширяется примерно до 1,01 млн. При этом опубликованная версия text-only и всегда работает с reasoning: thinking отключить нельзя, но его глубину можно регулировать через
reasoning_effort от low до xhigh.Qwen сильно приблизилась к закрытым frontier-моделям. По собственным eval команды, Qwen3.8-Max получает 86,6 на TerminalBench 2.1 против 88,8 у GPT-5.6 Sol, 92,6 на GPQA Diamond, 82,8 на IFBench и 93,0 на PaperBench. На WideSearch модель набрала 81,9. Эти сравнения стоит воспринимать именно как результаты из model card Qwen, поскольку harness и условия тестирования между моделями местами различаются.
Qwen3.8-Max построен на этой же базе, но дополнительно получает vision, non-thinking mode, миллионный контекст по умолчанию и встроенные инструменты. Сами веса Qwen3.8-2.4T-A95B уже доступны для Transformers, vLLM и SGLang.
2,4T total / 95B active выглядит как хороший показатель того, куда движутся большие MoE: размер модели продолжает улетать в триллионы, но вычислять весь этот объём на каждом токене уже никто не хочет.
https://huggingface.co/Qwen/Qwen3.8-2.4T-A95B
#AI #Qwen #LLM #MoE #OpenModels
👍15❤8🔥7
🔥 DeepSeek готовит собственный Harness: V4 Pro хотят превратить в полноценного coding-агента с ценой около $0,03 за задачу
В китайских источниках всплыли детали DeepSeek Harness, который сейчас якобы проходит внутреннее тестирование. Логика знакомая по Claude Code и Codex: модель получает управление контекстом, цепочки tool calls, автоматический rollback после ошибок и полный цикл работы с репозиторием.
Внутри заявлена multi-agent схема. Один агент планирует задачу, другие разбирают подзадачи, запускают тесты, правят код и повторяют цикл после неудачных попыток.
Самое интересное в экономике. Harness глубоко завязан на финальную V4 Pro и рассчитан на очень высокий cache hit, по прогнозам выше 99%. За счёт этого стоимость одной типичной задачи оценивают примерно в $0,03.
Для V4 Flash при попадании в кэш вход якобы обходится примерно в $0,003 за 1 млн токенов, выход около $0,28. Авторы утечки утверждают, что полный agentic workflow может быть более чем в 7 раз дешевле Claude Opus 4.8 и GPT-5.6.
По производительности заявляют уровень около Opus 4.8 и GPT-5.6, а в отдельных сценариях даже выше. Пока это внутренние цифры, независимых тестов нет.
Если DeepSeek действительно выпустит собственный desktop harness вместе с V4 Pro, конкурировать придётся уже не только ценой модели. В гонку полноценно входит связка:
И здесь DeepSeek традиционно пытается ударить по самому болезненному месту рынка, стоимости каждого автономно выполненного задания.
#DeepSeek #AI #Agents #CodingAgents #LLM
В китайских источниках всплыли детали DeepSeek Harness, который сейчас якобы проходит внутреннее тестирование. Логика знакомая по Claude Code и Codex: модель получает управление контекстом, цепочки tool calls, автоматический rollback после ошибок и полный цикл работы с репозиторием.
Внутри заявлена multi-agent схема. Один агент планирует задачу, другие разбирают подзадачи, запускают тесты, правят код и повторяют цикл после неудачных попыток.
Самое интересное в экономике. Harness глубоко завязан на финальную V4 Pro и рассчитан на очень высокий cache hit, по прогнозам выше 99%. За счёт этого стоимость одной типичной задачи оценивают примерно в $0,03.
Для V4 Flash при попадании в кэш вход якобы обходится примерно в $0,003 за 1 млн токенов, выход около $0,28. Авторы утечки утверждают, что полный agentic workflow может быть более чем в 7 раз дешевле Claude Opus 4.8 и GPT-5.6.
По производительности заявляют уровень около Opus 4.8 и GPT-5.6, а в отдельных сценариях даже выше. Пока это внутренние цифры, независимых тестов нет.
Если DeepSeek действительно выпустит собственный desktop harness вместе с V4 Pro, конкурировать придётся уже не только ценой модели. В гонку полноценно входит связка:
Model + Harness + Tools + Cache + Multi-AgentИ здесь DeepSeek традиционно пытается ударить по самому болезненному месту рынка, стоимости каждого автономно выполненного задания.
#DeepSeek #AI #Agents #CodingAgents #LLM
🔥27❤8👍5🤯1
Первая программа профессиональной переподготовки, получившая аккредитацию Альянса в сфере искусственного интеллекта:
📊 Специалист по науке о данных (Data Science)
Рекомендательные системы, прогнозирование спроса, распознавание изображений и умные помощники создаются с помощью методов науки о данных. Для разработки таких решений важно понимать программирование, математику и машинное обучение.
На программе профессиональной переподготовки ФКН НИУ ВШЭ вы пройдёте путь от основ анализа данных до нейронных сетей и обработки больших данных.
На курсе вы научитесь:
🫶 программировать на языке Python и работать с языком запросов SQL;
🫶 применять математику и статистику для анализа данных;
🫶 создавать и обучать модели машинного обучения;
🫶 работать с нейронными сетями и методами глубокого обучения;
🫶 анализировать тексты, изображения и звуковые сигналы;
🫶 решать прикладные задачи и создавать проекты для портфолио.
Программа подходит начинающим, специалистам без опыта в ИТ и программистам, которые хотят системно освоить науку о данных.
📆 Старт: 3 сентября
💻 Формат: смешанный, от 12 месяцев
📌 Документ: диплом о профессиональной переподготовке НИУ ВШЭ
🐭 Подробнее о программе
📊 Специалист по науке о данных (Data Science)
Рекомендательные системы, прогнозирование спроса, распознавание изображений и умные помощники создаются с помощью методов науки о данных. Для разработки таких решений важно понимать программирование, математику и машинное обучение.
На программе профессиональной переподготовки ФКН НИУ ВШЭ вы пройдёте путь от основ анализа данных до нейронных сетей и обработки больших данных.
На курсе вы научитесь:
Программа подходит начинающим, специалистам без опыта в ИТ и программистам, которые хотят системно освоить науку о данных.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6👍3🔥2😁2😱1😢1🥴1🍌1
🔥 DeepSeek V4 Pro официально вышел. И релиз явно заточен под агентов
DeepSeek раскатила GA-версию V4 Pro сразу в приложении, вебе и API. В интерфейсе модель доступна через Expert Mode, а API по-прежнему вызывается как
Самый большой апгрейд получил agentic режим. Terminal Bench 2.1 теперь 87,9, CyberGym 83,3, DeepSWE 62,7, Toolathlon Verified 74,1. DeepSeek отдельно говорит о заметном росте именно в production-сценариях.
Для V4 Pro и V4 Flash появились три уровня reasoning:
Ещё важнее для разработчиков: теперь есть нативная поддержка OpenAI Responses API и отдельная оптимизация под Codex.
С 16 августа DeepSeek также вводит peak/off-peak тарифы. В непиковые часы API будет стоить вдвое дешевле.
Похоже, V4 Pro теперь продают уже не как очередную сильную LLM, а как рабочий движок для долгих агентных задач.
#DeepSeek #AI #LLM #Agents #Codex
https://x.com/deepseek_ai/status/2087864585504305397
DeepSeek раскатила GA-версию V4 Pro сразу в приложении, вебе и API. В интерфейсе модель доступна через Expert Mode, а API по-прежнему вызывается как
deepseek-v4-pro.Самый большой апгрейд получил agentic режим. Terminal Bench 2.1 теперь 87,9, CyberGym 83,3, DeepSWE 62,7, Toolathlon Verified 74,1. DeepSeek отдельно говорит о заметном росте именно в production-сценариях.
Для V4 Pro и V4 Flash появились три уровня reasoning:
low для простых задач, high для обычной работы агентов и max для сложных сценариев.Ещё важнее для разработчиков: теперь есть нативная поддержка OpenAI Responses API и отдельная оптимизация под Codex.
С 16 августа DeepSeek также вводит peak/off-peak тарифы. В непиковые часы API будет стоить вдвое дешевле.
Похоже, V4 Pro теперь продают уже не как очередную сильную LLM, а как рабочий движок для долгих агентных задач.
#DeepSeek #AI #LLM #Agents #Codex
https://x.com/deepseek_ai/status/2087864585504305397
🔥15❤6👍5🐳1
🔥 Нашёл отличный бесплатный ресурс по Harness Engineering - тому, что делает coding agents реально надёжными
Курс посвящён не очередному «как написать хороший промпт», а инженерии окружения вокруг Codex, Claude Code и других AI-агентов.
Разбирают:
* почему сильные агенты всё равно проваливают задачи;
* как сохранять контекст между длинными сессиями;
* зачем нужны
* как не дать агенту объявить задачу завершённой слишком рано;
* как встроить тестирование, observability и контроль в сам harness.
Есть теория, практические проекты и готовые шаблоны для репозиториев. Причём среди базовых материалов авторы прямо ссылаются на подходы OpenAI и Anthropic.
Главная идея очень правильная:
не пытаться бесконечно делать модель умнее промптами, а построить вокруг неё систему, в которой ошибаться сложнее.
И да - есть русская версия.
https://walkinglabs.github.io/learn-harness-engineering/ru/
Курс посвящён не очередному «как написать хороший промпт», а инженерии окружения вокруг Codex, Claude Code и других AI-агентов.
Разбирают:
* почему сильные агенты всё равно проваливают задачи;
* как сохранять контекст между длинными сессиями;
* зачем нужны
AGENTS.md, feature_list.json и progress-файлы;* как не дать агенту объявить задачу завершённой слишком рано;
* как встроить тестирование, observability и контроль в сам harness.
Есть теория, практические проекты и готовые шаблоны для репозиториев. Причём среди базовых материалов авторы прямо ссылаются на подходы OpenAI и Anthropic.
Главная идея очень правильная:
не пытаться бесконечно делать модель умнее промптами, а построить вокруг неё систему, в которой ошибаться сложнее.
И да - есть русская версия.
https://walkinglabs.github.io/learn-harness-engineering/ru/
❤15👍8🔥8🤣3
Forwarded from Python/ django
🔥 Kimi K3 на 2,78 ТРИЛЛИОНА параметров запустили на CPU с 8 ГБ RAM. Без GPU, BLAS и фреймворков
Проект
Фокус в MoE и стриминге весов. Из 896 экспертов на токен выбираются только 16, а остальные веса не обязаны постоянно лежать в оперативной памяти. Огромная часть модели читается прямо с диска, поверх этого работает LRU-кэш экспертов.
Цена такого трюка очевидна: скорость. При 8 ГБ RAM автор получил около 26,5 секунды на токен, при 64 ГБ уже 19,8 секунды, а на машине с 128+ ГБ, где нужные данные помещаются в память, около 5,6 секунды.
Получается любопытная смена ограничения: гигантскую MoE уже можно заставить работать без серверной фермы. Вопрос теперь скорее в том, сколько диска и времени на токен вы готовы отдать за такой inference.
#AI #Kimi #LLM #C #LocalAI
Проект
kimi-k3-in-c реализует inference Kimi K3 практически с нуля на portable C99. Чекпоинт модели занимает 1,56 ТБ, но пик RAM при запуске составил всего 8,24 ГБ.Фокус в MoE и стриминге весов. Из 896 экспертов на токен выбираются только 16, а остальные веса не обязаны постоянно лежать в оперативной памяти. Огромная часть модели читается прямо с диска, поверх этого работает LRU-кэш экспертов.
Цена такого трюка очевидна: скорость. При 8 ГБ RAM автор получил около 26,5 секунды на токен, при 64 ГБ уже 19,8 секунды, а на машине с 128+ ГБ, где нужные данные помещаются в память, около 5,6 секунды.
Получается любопытная смена ограничения: гигантскую MoE уже можно заставить работать без серверной фермы. Вопрос теперь скорее в том, сколько диска и времени на токен вы готовы отдать за такой inference.
github.com/FareedKhan-dev/kimi-k3-in-c#AI #Kimi #LLM #C #LocalAI
❤18🤣13👏11🥰2🤔2🤯2