This media is not supported in your browser
VIEW IN TELEGRAM
Tencent Hunyuan вместе с Шанхайским университетом выложили AuK, открытую базовую модель для генерации и редактирования речи на 1,5 млрд параметров.
Русского языка модель не знает, заявлены только китайский и английский. Авторы, правда, отмечают возможный перенос между языками - какая-то способность возникает сама, но поддержкой это не считается.
AuK принимает на вход текстовый запрос и, если нужно, исходное аудио и на выходе отдаёт готовый звук.
Всего заявлено пять типов задач: синтез речи (клонирование голоса по образцу и генерация по описанию), правка содержания (заменить слово в реплике или строчку в песне), акустика (темп, громкость, высота тона), паралингвистика (эмоция, тембр, акцент, вздохи и смешки, шёпот) и очистка с разделением (шумоподавление, выделение спикера, отделение вокала от музыки).
Мультимодальная Qwen2.5-Omni читает инструкцию вместе с аудио и превращает её в смысловое условие. Аудио-VAE сжимает звук в компактное представление и потом восстанавливает обратно в волну.
Между ними работает трансформер по подобию FLUX - сначала десять блоков MMDiT, где смысловой и акустический потоки обмениваются информацией, оставаясь раздельными, затем двадцать обычных блоков DiT поверх склеенной последовательности.
По замерам Tencent, модель лидирует на Seed-TTS-Eval (разборчивость речи и похожесть на голос образца), InstructTTSEval (насколько точно модель отрабатывает словесное описание тембра), а также на MMAE-Speech и SpeechEditBench, где проверяют правки.
А вот на восстановлении сигнала (DNS Challenge, CHiME-4, Libri2Mix) она только конкурентоспособна, то есть узкоспециализированные модели там по-прежнему сильнее.
Отдельно выложена AuK-Flash - дистиллированная версия, которая укладывается в четыре шага вместо тридцати двух и работает в 4,5 раза быстрее.
К ней, кстати, нужно будет отдельно качать Qwen2.5-Omni-3B в роли энкодера.
В репозитории есть код установки, инференса на Gradio, ComfyUI, дообучения и шаблоны инструкций с примерами в кукбуке.
Пощупать можно в демо на Hugging Face и ModelScope.
@ai_machinelearning_big_data
#AI #ML #TTS #AuK #Tencent
Please open Telegram to view this post
VIEW IN TELEGRAM
👍59🤗17❤14👏13🔥1
Неформальный голос в X OpenAI, Тибо, сообщил, что интерес к Astra побил все внутренние исторические рекорды сервиса.
Компания неоднократно сталкивалась с резкими скачками трафика, но текущая динамика оказалась беспрецедентной - команда задействует все доступные вычислительные мощности, чтобы удерживать доступность инфраструктуры.
Главным приоритетом в OpenAI называют сохранение качества обслуживания текущих клиентов и если нагрузка продолжит расти теми же темпами, компания пойдет на превентивную меру и временно заморозит продажи тарифа ChatGPT Pro во избежание очередей на инференс и деградации производительности.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔156🔥59🤣50⚡17❤10😁10😢6
DeepSeek выложила свежайшую DeepSeek-V4.1-Flash, мультимодальную MoE-модель на 552 млрд параметров, с контекстом до миллиона токенов и методом Causal Encoder-Decoder под капотом, который вдвое удешевляет разбор входа.
Задача, под которую её делали, скучная, но дорогая. Долго работающий агент постоянно перечитывает свой контекст, и всё прочитанное приходится держать в KV-кэше.
На длинных дистанциях он раздувается, забивает видеопамять и упирается в пропускную способность шин.
В V4.1-Flash кэш сжат до 890 байт на токен, это вчетверо меньше, чем у V4-Flash, и в 437 раз, чем у первой версии DeepSeek.
Каждому слою внимания заранее назначен один из трёх режимов:
Так хранить приходится в разы меньше. Сверху главный кэш держится в четырёхбитном формате FP4, и устойчивость к такой точности натренирована, а не добавлена после обучения.
Метод вдохновлен майкрософтовской работой You Only Cache Once про переиспользование KV-кэша слоями. DeepSeek внесла в него структурные улучшения, чтобы поднять ёмкость кэша и глубину вычислений при его порождении.
40 слоёв разделены пополам: 20 на энкодер, 20 - декодер.
К и V для декодера не считаются в каждом его слое, а проецируются из последнего скрытого состояния энкодера.Поэтому при разборе входа работает только первая половина сети - 8 млрд активных параметров на токен против 16 при генерации ответа.
Для агентов, у которых вход в разы длиннее вывода, это именно то, что нужно.
На DeepSWE v1.1 модель берёт 74,2% против 74,0 у Claude Opus 5 и 73,0 у GPT-5.6 Sol.
На Terminal-Bench 2.1 - 90,6% (выше всех).
На AutomationBench - 54,8% против 50,3 у Opus 5.
А вот в Terminal-Bench 4.0, где нужны экспертные знания в науке, модель даёт 31,2% против 51,8 у Opus 5, то есть разрыв с топами на самых сложных задачах никуда не делся.
Модель поддерживает настраиваемый уровень рассуждений от 1 до 100, в API это три пресета: low, high, max - они соответствуют значениям 50, 75 и 100.
Шаблона чата в Jinja нет - вместо него советуют реализацию промптов на Python и отдельный набор Rust-библиотек.
Сообщество на Hugging Face уже сделало квантованные версии практически под всё.
@ai_machinelearning_big_data
#AI #ML #MMLM #MoE #Deepseek
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥61🤩46👍21❤19👏11🤔7🥰2🏆2😁1🙏1🤝1
ТехВилл ищет в команду сотрудников!
ТехВилл (айтишка ВкусВилл) расширяет команду! Открыты новые вакансии для ИТ-специалистов разного профиля.
Выбирайте свою роль:
🔹 Главный инженер в Роботизацию дарксторов — роботизация складов
🔹 Руководитель проекта — управление разработкой робототехнических комплексов
🔹 Разработчик (Навигация) — автономное движение на C++/ROS 2
🔹 Старший разработчик — аппаратная платформа дронов и embedded
🔹 Инженер-программист (вендинги) — настройка и интеграция торговых автоматов
Ключевые условия:
✅ Аккредитованная ИТ-компания
✅ Официальное оформление с первого дня, куратор на адаптации;
✅ Прозрачные грейды, обучение, индивидуальные планы развития;
✅ Компенсация медицины, спорта и AI-помощников;
✅ Бонус 15% во ВкусВилл;
✅ Соцподдержка;
📍 Гибрид Москва и МО.
Присоединяйтесь к созданию технологий будущего для розничной торговли!
ТехВилл (айтишка ВкусВилл) расширяет команду! Открыты новые вакансии для ИТ-специалистов разного профиля.
Выбирайте свою роль:
🔹 Главный инженер в Роботизацию дарксторов — роботизация складов
🔹 Руководитель проекта — управление разработкой робототехнических комплексов
🔹 Разработчик (Навигация) — автономное движение на C++/ROS 2
🔹 Старший разработчик — аппаратная платформа дронов и embedded
🔹 Инженер-программист (вендинги) — настройка и интеграция торговых автоматов
Ключевые условия:
✅ Аккредитованная ИТ-компания
✅ Официальное оформление с первого дня, куратор на адаптации;
✅ Прозрачные грейды, обучение, индивидуальные планы развития;
✅ Компенсация медицины, спорта и AI-помощников;
✅ Бонус 15% во ВкусВилл;
✅ Соцподдержка;
📍 Гибрид Москва и МО.
Присоединяйтесь к созданию технологий будущего для розничной торговли!
👍67❤16👏14🎉6😁5🤩1
Media is too big
VIEW IN TELEGRAM
OpenAI закрывает пилотную программу для федеральных ведомств, по которой доступ к её технологиям стоил 1 доллар в год. С 1 октября вступит в силу двухлетний контракт - чиновники перейдут на оплату по факту потребления со скидкой 50% от стандартного прайса.
По данным Управления общих служб правительства США, за год пилота доступ к ChatGPT получили 3,5 млн госслужащих, а заявленная экономия бюджета за это время составила 1,4 млрд долларов.
Ожидается, что переход на новые тарифы упростит ведомствам внедрение и использование будущих моделей OpenAI.
bloomberglaw.com
Компании договорились развернуть платформу Palantir AIP на мощностях Nebius AI Cloud. Расчёт на госсектор и корпоративных клиентов с жёсткими требованиями к локализации данных.
Клиенты Palantir получат доступ к европейским GPU-кластерам Nebius для распределённого обучения и инференса, с возможностью разворачивать изолированные ИИ-контуры по стандартам GDPR.
Аналитические и агентные инструменты Palantir теперь работают на дата-центрах Nebius. Основные заказчики - оборонные, финансовые и промышленные предприятия.
nebius.com
Билл Пиблз, бывший руководитель проекта Sora в OpenAI, сооснователь DreamWorks Джеффри Катценберг и экс-финансовый директор Dropbox Суджай Джасва запускают компанию для обучения собственных моделей видеогенерации под профессиональную киноиндустрию.
Проект пока привлекает финансирование, идут переговоры с венчурными фондами. Название и целевая оценка не раскрываются.
Техническое направление возглавил Пиблз - один из авторов Diffusion Transformer, архитектуры, лежащей в основе Sora и большинства современных видеогенераторов.
Из OpenAI он ушёл в апреле этого года, чтобы заниматься исследованиями в видеосинтезе вне жёстких продуктовых графиков корпорации.
theinformation.com
По данным The American Prospect, служба безопасности Anthropic отслеживает протестные движения и анти-ИИ активистов с помощью инструментов сбора сведений из открытых источников и коммерческой платформы анализа рисков Samdesk.
Согласно расследованию издания, аналитики компании следят за перемещениями участников акций в реальном времени, ведут списки лиц, представляющих интерес, и прогнозируют инциденты рядом с офисами или топ-менеджерами. Собранные сведения передаются в полицию США.
Отдельно The American Prospect указывает на случаи, когда Anthropic сообщала правоохранителям об угрозах от пользователей в переписке с Claude, но отказывалась выдавать логи чатов, ссылаясь на политику приватности.
prospect.org
Google выпустила десктопный клиент Gemini для Windows 10 и 11. Интерфейс работает компактным оверлеем поверх активных окон, вызывается сочетанием Alt + Space.
В полноэкранном режиме приложение интегрируется с Gmail и Google Drive, а многоэтапные задачи можно делегировать агенту Gemini Spark.
Кроме работы с текстом, клиент генерирует изображения через Nano Banana и видео через Gemini Omni. Работает в фоне и уже доступно для скачивания.
blog.google
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍92❤23👏15💯10🌚8🤝5😁1
One Day Offer: научи роботов понимать мир! 🤖
Команда Центра робототехники Сбера делает то, что ещё недавно казалось невозможным — создаёт ИИ, который живёт в физическом мире: двигается, видит и принимает решения.
И ты можешь стать частью этого будущего — если пройдёшь отбор на One Day Offer для Robotics Software Engineer и Machine Learning Engineer.
Важно: твой код будет не просто строкой в репозитории, а командой для робота — сделать шаг или распознать предмет. Работать ты будешь с современным стеком: C++/Python, ROS2, PyTorch/Jax, VLA‑моделями.
Готов присоединиться? Регистрируйся по ссылке — встречаемся 26 сентября! 😉
Команда Центра робототехники Сбера делает то, что ещё недавно казалось невозможным — создаёт ИИ, который живёт в физическом мире: двигается, видит и принимает решения.
И ты можешь стать частью этого будущего — если пройдёшь отбор на One Day Offer для Robotics Software Engineer и Machine Learning Engineer.
Важно: твой код будет не просто строкой в репозитории, а командой для робота — сделать шаг или распознать предмет. Работать ты будешь с современным стеком: C++/Python, ROS2, PyTorch/Jax, VLA‑моделями.
Готов присоединиться? Регистрируйся по ссылке — встречаемся 26 сентября! 😉
🤩78👍19👏14❤12😁10🤬3🍓2
This media is not supported in your browser
VIEW IN TELEGRAM
OpenAI открыла API полнодуплексной голосовой модели GPT-Live-1 стоимостью 5 центов за минуту. Модель слушает и синтезирует речь одновременно, заменяя традиционный каскад STT–LLM–TTS.
Единая архитектура снизила задержку реакции с 1,4 до 0,8 секунды и позволила обрабатывать перебивания. Обновленная фильтрация пауз и фонового шума сократила число ложных прерываний на 80%.
Модель поддерживает делегирование вычислений - голосовой фронтенд удерживает непрерывный контакт с пользователем, пока бэкенд (GPT-6 Astra и Luna) параллельно выполняют рассуждения и вызовы инструментов.
GPT-Live-1 готова к интеграции в телефонию. API может возвращать ASR-транскрипты, включает 12 голосов и поддерживает управление темпом и стилем речи через системный промпт.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍118🔥22❤9👏5🤩4❤🔥1
Яндекс выложил на Hugging Face Alice AI-T5-35B-A0.6B Base — модель, которую обучили с нуля специально для высоконагруженного Поиска. Её дообученная версия Alice AI Search используется для генерации быстрых ИИ-ответов в Поиске.
При сотнях тысяч запросов в минуту такая модель должна не только хорошо отвечать, но и делать это за считанные секунды, не сжигая лишнее. Поэтому из 35 млрд параметров на каждый токен включаются только 600 млн, а отдельная модель отбирает из найденных документов лишь нужные фрагменты — такой подход увеличил пропускную способность примерно на 40%.
В итоге модель показывает сильные результаты на русскоязычных задачах и сопоставима с гораздо более тяжёлыми моделями, оставаясь дешевле в работе.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍98🤣35⚡34🔥16❤11🗿3🥰2😨1💘1
Инструмент складывает навыки, правила, хуки и настройки MCP в один git-репозиторий и раздаёт их всем участникам ИИ-команды.
Поддерживаются Claude Code, Codex, Cursor, CodeBuddy, WorkBuddy, Qoder, OpenCode, а также OpenClaw, Hermes и DeepSeek Harness (у последних трёх с ограничениями).
Хранилищем может быть GitHub, GitLab, GitCode, CNB, TGit или свой git-сервер.
Правки идут обычным рабочим процессом - участник делает пуш, открывается запрос на слияние, ревьюер проверяет и одобряет, остальные получают изменения при следующем запуске сессии. Повторный пуш по той же правке обновляет уже открытый MR, без создания нового.
Когда сессия заканчивается, хук оценивает её по критерию проблемности - перебивали ли модель, отклоняли ли вызовы инструментов, сколько раз агент повторял падающие команды.
Чистая сессия, пусть и длинная, не считается, но если с чем-то реально бились, TeamAI предложит записать вывод и отправить его в командный репозиторий. Подсказка при этом перечисляет, какие именно сигналы сработали.
Накопленное можно искать автоматически - агент перед задачей вызывает встроенный субагент, тот подбирает ключевые слова, читает найденные документы и возвращает выжимку.
Отдельная команда разбирает репозитории в граф компонентов, интерфейсов и зависимостей - для TypeScript, JavaScript, Python и Go связи достаёт парсер tree-sitter, для остальных языков работает запасной механизм на регулярных выражениях.
Еще TeamAI может делать недельный дайджест по расходу токенов, объёму диалогов и частоте вмешательств, а также дашборд со статусом текущих сессий каждого участника.
@ai_machinelearning_big_data
#AI #ML #Agents #Tools #TeamAiCli #Tencent
Please open Telegram to view this post
VIEW IN TELEGRAM
👍60🤩16❤11🔥7👏5💯2🤷♂1
Сбер представил GigaChat 3.5 Reasoning — флагманскую модель с режимом рассуждений
Новая версия умеет последовательно решать сложные задачи. Сначала разбирает их на этапы и выстраивает план. Затем проверяет промежуточные результаты и исправляет ошибки.
Ещё одна особенность релиза — экономный расход токенов. В среднем на математические расчёты здесь используется на 37% меньше токенов, чем у открытой ИИ-модели DeepSeek V4 Flash Preview.
По сравнению с моделью без режима рассуждений GigaChat 3.5 Reasoning заметно улучшила результаты бенчмарков. В IFBench показатель вырос с 44 до 77 баллов, в Natural Plan — с 64 до 80, а в Live Code Bench v6 — с 56 до 85.
Модель доступна бесплатно по лицензии MIT на HuggingFace и GitVerse. Её можно интегрировать в собственные продукты.
Попробуйте обновлённый режим «Рассуждение» на giga.chat. Подробнее – в посте команды.
Новая версия умеет последовательно решать сложные задачи. Сначала разбирает их на этапы и выстраивает план. Затем проверяет промежуточные результаты и исправляет ошибки.
Ещё одна особенность релиза — экономный расход токенов. В среднем на математические расчёты здесь используется на 37% меньше токенов, чем у открытой ИИ-модели DeepSeek V4 Flash Preview.
По сравнению с моделью без режима рассуждений GigaChat 3.5 Reasoning заметно улучшила результаты бенчмарков. В IFBench показатель вырос с 44 до 77 баллов, в Natural Plan — с 64 до 80, а в Live Code Bench v6 — с 56 до 85.
Модель доступна бесплатно по лицензии MIT на HuggingFace и GitVerse. Её можно интегрировать в собственные продукты.
Попробуйте обновлённый режим «Рассуждение» на giga.chat. Подробнее – в посте команды.
👍135😁67❤25👏21🥱20🔥11🤩5🤣5🙉5🤝1
Comfy Org открыла бета-тестирование встроенного ассистента Comfy Agent. Инструмент может создавать и изменять воркфлоу, запускать задачи, отлаживать ошибки и предлагать улучшения в интерфейсе ComfyUI по текстовым запросам.
Агент работает в фоне и умеет создавать цепочки нод, оптимизировать имеющиеся воркфлоу и искать ошибки совместимости.
В отличие от Comfy MCP, который позволяет управлять ComfyUI через Claude или Cursor, Comfy Agent работает как готовое коробочное решение внутри редактора.
Бэкенд ассистента развернут в инфраструктуре Comfy Cloud, а для простых задач можно подключать локальные модели.
Comfy Agent, вероятно, войдёт в подписку Comfy Cloud.
Подать заявку на открытую бету можно по ссылке. Запись стрима с демонстрацией возможностей - на Youtube.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤩97👍34🎉16❤9👏7🔥1🥱1🌭1
Forwarded from Анализ данных (Data analysis)
🐟 Sakana AI представила Fugu Max и Fugu Ultra v2 - обновление системы оркестрации AI-агентов
Fugu распределяет задачи между несколькими моделями, подбирая подходящую по возможностям и стоимости.
Fugu Max использует расширенный набор моделей с открытыми весами и специализированных моделей, включая NVIDIA Nemotron. По заявлению Sakana, система приближается к ведущим моделям по качеству при стоимости в 2–6 раз ниже.
Fugu Ultra v2 ориентирована на максимальное качество. По данным компании:
* опережает Opus 5 и Fable 5 на Chartography
* на DeepSWE превосходит модели, у которых цена за токен в 3–5 раз выше
* при этом Fable 5, Fable 5.1 и GPT-6-Astra не входят в её набор агентов
Модели внутри системы можно заменять. Такая архитектура рассчитана на снижение зависимости от отдельных поставщиков и сохранение работы при изменениях доступности API.
[Попробовать Fugu - https://sakana.ai/fugu
Анонс Sakana AI - https://sakana.ai/fugu-max-release/
Fugu распределяет задачи между несколькими моделями, подбирая подходящую по возможностям и стоимости.
Fugu Max использует расширенный набор моделей с открытыми весами и специализированных моделей, включая NVIDIA Nemotron. По заявлению Sakana, система приближается к ведущим моделям по качеству при стоимости в 2–6 раз ниже.
Fugu Ultra v2 ориентирована на максимальное качество. По данным компании:
* опережает Opus 5 и Fable 5 на Chartography
* на DeepSWE превосходит модели, у которых цена за токен в 3–5 раз выше
* при этом Fable 5, Fable 5.1 и GPT-6-Astra не входят в её набор агентов
Модели внутри системы можно заменять. Такая архитектура рассчитана на снижение зависимости от отдельных поставщиков и сохранение работы при изменениях доступности API.
[Попробовать Fugu - https://sakana.ai/fugu
Анонс Sakana AI - https://sakana.ai/fugu-max-release/
🎉122👍39🤓22❤9⚡2🔥2👏1
This media is not supported in your browser
VIEW IN TELEGRAM
Компания открыла Agents API - публичную бету сервиса, который берёт на себя всю обвязку вокруг агента. Она здесь та же, что у Codex и ChatGPT for Work.
Агент создаётся одним вызовом API, где указывается задача, модель, инструменты и окружение. Дальше действует OpenAI, а разработчик занимается своими инструментами, знаниями и процессами.
Харнесс умеет сжимать ранний контекст, когда сессия подбирается к лимиту и подгружать описания инструментов по необходимости. Плюс дает агентам вызывать инструменты программно - выполнять вызовы параллельно, сцеплять их и фильтровать результаты прямо в коде, возвращая в контекст только нужное.
Место работы агента можно выбрать из песочницы самой OpenAI, поднять на своей инфраструктуре или уйти к партнёрам: Blaxel, Cloudflare, Daytona, DigitalOcean, E2B, Modal, Oracle, Runloop и Vercel.
Отдельной платы за Agents API нет, только токены и инструменты, которые расходует агент.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👨💻77👍35👏21❤17🔥14🤣3🤓3🕊1
Получи подготовленные данные и разработай ИИ-ассистента для энергетики на соревновании от ПАО «Интер РАО» при поддержке компании «Яндекс».
Призовой фонд — 750 000 рублей. Лучшие проекты смогут стать частью экосистемы компании.
Регистрация открыта до 27 сентября.
Можно участвовать одному или командой до 5 человек. Идеальный состав: разработчик, специалист по машинному обучению, аналитик и дизайнер.
Стартуем 28 сентября. Придумай концепт проекта: самые сильные идеи участники доработают под руководством экспертов с 9 по 23 октября. Финал в Москве — 3 ноября.
Задачи соревнования — за какую возьмешься?
1️⃣ ИИ-помощник для подготовки презентаций.
Создай инструмент генерации презентации в корпоративном стиле из текстового брифа.2️⃣ Помощник для анализа документов из судов.
Разработай систему, которая сможет распознавать, классифицировать и заносить судебные и исполнительные документы в базу данных.3️⃣ Ассистент для создания ИТ/ИБ-дайджестов.
Напиши ассистента, который будет регулярно анализировать релевантные новости из различных источников и формировать краткую сводку.4️⃣ Архитектор BPMN-диаграмм.
Создай генератор BPMN-диаграмм, который позволит из текстового описания процесса собрать валидную схему в формате BPMN 2.0.
Получи сильную строчку в портфолио и уникальный опыт работы под руководством экспертов Группы «Интер РАО».
Регистрируйся: https://cnrlink.com/interraohack26ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤩48🤣19🎉17👍7❤6🔥6🤬1🐳1
Media is too big
VIEW IN TELEGRAM
Сэм Альтман заявил сотрудникам, что компания готова притормозить работу над моделями следующего поколения - но только если то же сделают другие лаборатории. По данным Bloomberg, часть циклов предобучения OpenAI уже приостановила из соображений безопасности.
Идею контролируемого темпа Альтман обсуждал и раньше, в том числе в Белом доме. Инициатива родилась на фоне ухода ведущих специалистов по безопасности из OpenAI, Anthropic и Google DeepMind.
На этой неделе главный научный сотрудник OpenAI Якуб Пахоцкий публично призвал отрасль к координации и добровольным паузам в релизах.
bloomberg.com
Разработчик Devin обучил SWE-2 на базе открытой Kimi K3 с её 2,8 трлн параметров. По словам авторов, обучение с подкреплением впервые масштабировали на исходную модель такого размера.
Вместо дистилляции экспертов использовали линейные штрафы за стоимость вычислений, привязанные к наклону границы Парето.
На FrontierCode 1.1 Main модель набрала 50,0%. Инференс, по замерам Cognition, обходится на 60-75% дешевле, чем у Fable 5.1 и GPT-6 Astra.
Сократили и время на изучение репозитория - на среднем уровне рассуждений агент начинает править код на 18-м шаге вместо 48-го у SWE-1.7. Модель доступна в Devin CLI, десктопе и веб-версии.
cognition.com
Новая возможность Projects рассчитана на задачи, которые живут дольше одного чата: рефакторинг, миграции, крупные фичи.
Координатору ставят задачу, он составляет план и раздаёт подзадачи субагентам - по заявлению Cursor, их может быть тысячи. Сам код он не пишет, поэтому никогда не занят, но умеет реагировать на события - следит за ветками Git, ловит падения CI и триггеры из Slack.
Бета раскатывается на всех, о тарификации в анонсе не сообщается.
cursor.com
FLUX Video Edit правит готовые ролики по текстовому запросу в режиме video-to-video - сохраняет композицию, траекторию камеры, тайминги и звук, меняя только указанное. Модель также умеет подгонять липсинк под новый дубляж, не меняя хронометраж.
На вход идут MP4 до 15 секунд и 50 МБ, на выходе 720p при 24 кадрах в секунду. Секунда обработанного видео стоит 3 цента.
Black Forest Labs в X
Канадский математик Джейкоб Цимерман создаёт центр Mathematical A.I. Safety Institute со штатом в несколько десятков специалистов, запуск которого запланирован на январь 2027 года. Параллельно Цимерман присоединится к команде безопасности OpenAI, то есть будет верифицировать в том числе собственного работодателя.
Идея - перевести оценку рисков с эмпирического тестирования на строгую теоретическую верификацию и наделить модели доказуемыми свойствами надёжности, как у криптографических алгоритмов.
Механизмом аудита предлагают сделать доказательства с нулевым разглашением - лаборатория подтверждает соблюдение ограничений, не раскрывая ни архитектуру, ни веса.
nytimes.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍156👏23😁17🤔14❤11🎉7🔥6🤓4⚡2🤬1🙏1
This media is not supported in your browser
VIEW IN TELEGRAM
ChatGPT for Financial Services - специализированная версия платформы, которую делаи вместе с банками Morgan Stanley и Evercore.
Инструмент объединяет аналитические возможности GPT-6 Astra со встроенными финансовыми датасетами от PitchBook, Crunchbase, Daloopa, FiscalAI и LSEG News, которые индексируются напрямую на инфраструктуре разработчика.
Это решает проблемы интеграции внешних баз через MCP-коннекторы, ускоряет выборку и позволяет делать детализированное цитирование - система привязывает каждую цифру, показатель или вывод к точным строкам, таблицам и сноскам в исходных финансовых документах.
Платформа автоматизирует LBO-моделирование, нормализацию отчётности, скрининг покупателей и генерацию аналитических отчётов и питчбуков по корпоративным шаблонам в форматах Excel, Word и PowerPoint, публикуемым администратором.
Для финсектора предусмотрена сквозная авторизация по существующим подпискам на S&P Capital IQ, LSEG, MSCI, Factiva и Moody's, а также ролевой доступ, единый вход по SAML, автоматическое управление учётными записями через SCIM, поддержка информационных барьеров между рабочими пространствами, аудит действий через OpenAI Compliance Platform и запрет на использование клиентских данных для обучения моделей.
На бенчмарке OfficeQA Pro, где модель ищет и анализирует данные в бюллетенях Минфина США со сложными таблицами, графиками и сносками, GPT-6 Astra показывает 69,9% против 60,2% у GPT-5.6 Sol.
Решение доступно финансовым организациям по запросу, стоимость не раскрывается.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤓87👍74👀13❤6🔥5🤣5😭2🤔1
⚡ Глава Anthropic призвал замедлить развитие ИИ и допустить независимых проверяющих внутрь лабораторий
В статье We Must Pace the Frontier Дарио Амодеи объяснил, почему изменил позицию: в 2023 году замедление казалось ему преждевременным, теперь он считает его необходимым.
Самое интересное:
🔹 ИИ уже ускоряет создание следующего поколения моделей. По словам Амодеи, рекурсивное самоулучшение начинается в отрасли, включая Anthropic. Он опасается, что возможности систем будут расти быстрее, чем способы их контроля.
🔹 Его тревожный сценарий - масштабные кибератаки через 6–12 месяцев. Амодеи допускает, что более мощный рой агентов сможет создать устойчивый ботнет и нанести ущерб на сотни миллиардов долларов. Это его оценка риска.
🔹 Anthropic обещает постоянный доступ внешним проверяющим. Рабочие места, пропуска, инструменты и права, сопоставимые с внутренними командами оценки рисков. Проверять предлагается и готовые модели, и процесс обучения.
🔹 Проверяющие смогут публиковать неудобные выводы. Компания предусматривает ограничения для защищённой информации, но обещает не скрывать результаты только потому, что они ей невыгодны.
🔹 Цель - выиграть год-два для безопасности. Среди предложений: обязательные проверки при достижении опасных возможностей и международные ограничения скорости самоулучшения ИИ. Полную глобальную паузу Амодеи считает маловероятной в ближайшее время.
Полная cтатья - https://darioamodei.com/post/we-must-pace-the-frontier
@ai_machinelearning_big_data
#Anthropic
В статье We Must Pace the Frontier Дарио Амодеи объяснил, почему изменил позицию: в 2023 году замедление казалось ему преждевременным, теперь он считает его необходимым.
Самое интересное:
🔹 ИИ уже ускоряет создание следующего поколения моделей. По словам Амодеи, рекурсивное самоулучшение начинается в отрасли, включая Anthropic. Он опасается, что возможности систем будут расти быстрее, чем способы их контроля.
🔹 Его тревожный сценарий - масштабные кибератаки через 6–12 месяцев. Амодеи допускает, что более мощный рой агентов сможет создать устойчивый ботнет и нанести ущерб на сотни миллиардов долларов. Это его оценка риска.
🔹 Anthropic обещает постоянный доступ внешним проверяющим. Рабочие места, пропуска, инструменты и права, сопоставимые с внутренними командами оценки рисков. Проверять предлагается и готовые модели, и процесс обучения.
🔹 Проверяющие смогут публиковать неудобные выводы. Компания предусматривает ограничения для защищённой информации, но обещает не скрывать результаты только потому, что они ей невыгодны.
🔹 Цель - выиграть год-два для безопасности. Среди предложений: обязательные проверки при достижении опасных возможностей и международные ограничения скорости самоулучшения ИИ. Полную глобальную паузу Амодеи считает маловероятной в ближайшее время.
Полная cтатья - https://darioamodei.com/post/we-must-pace-the-frontier
@ai_machinelearning_big_data
#Anthropic
1👍89🤣74⚡32🤔30❤18👨💻8🤨7👻4🔥3😁2🤬1
Стартап NeoCognition разработал первый сквозной бенчмарк использования компьютера, непрерывного обучения и долгосрочной агентной работы на реальной должности.
NeoCognition - лаборатория, в которой собрали бенчмарки MMMU, Mind2Web, SWE-Bench Pro и OSWorld 2, а также агентные системы SeeAct, UGround и HippoRAG.
Агента принимают в виртуальную строительную компанию на работу с кредиторской задолженностью, выдают полугодовой архив счетов, внутренний справочник и руководство по ERP-системе, после чего он начинает работать со счетами.
Первый месяц проходит с подробным фидбэком от руководителя по каждому счёту, а дальше - с редкими замечаниями по итогам месяца.
Каждая из ста задач теста проверена профессиональными бухгалтерами строительной отрасли, которые подтвердили и реалистичность сценариев, и то, что любую задачу способен решить рядовой специалист, изучивший доступные агенту материалы.
Большинство моделей, включая Gemini, Muse Spark, Grok и Kimi, не преодолевают порог в 20-25%, тогда как Fable 5.1 выполнила 72% задач, а GPT-6 Astra - 68%.
Лучший из двух тестировщиков-людей показал 51%, причём проваливались люди на поиске нужного в исторических данных, точности расчётов и мелких ошибках от утомления.
Разрыв между открытыми и закрытыми моделями авторы называют крупнейшим из всех виденных ими на бенчмарках - 72% у Fable 5.1 против 18% у Kimi K3, и вызван он не базовыми операциями в интерфейсе, а неспособностью слабых моделей учиться на дистанции.
Kimi K3 почти не обращался ни к архиву счетов, ни к собственным заметкам и деградировал к концу серии.
Так называемый налог на использование компьютера (просадка при переходе с API на графический интерфейс) у большинства моделей достигает 78%, но Fable 5.1 и GPT-6 Astra работают через GUI даже лучше, чем через API.
Дешевле при этом остаётся API - Fable 5.1 обходится в 6,95 доллара за задачу в программном интерфейсе против 18,23 доллара при работе с графическим.
Способность к обучению измерили отдельно. Fable 5 без доступа к истории и обратной связи, опираясь только на собственные знания, решает 11 счетов из 100.
Подключение архива счетов поднимает результат до 31, обратная связь руководителя - до 35, а оба канала вместе дают 43.
ИИ пока ещё обходится дороже: 18,23 доллара за задачу против 7,21 у людей. К тому же человек по мере накопления опята работает быстрее, а агент - замедляется.
@ai_machinelearning_big_data
#AI #ML #Benchmark #ApprenticeBench #NeoCognition
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤔112❤46👏30💯15👍13🔥6👌4🎉2🤓2👀1