279K subscribers
5.51K photos
1.28K videos
17 files
5.84K links
Погружаемся в машинное обучение и Data Science

Показываем как запускать любые LLm на пальцах.

По всем вопросам - @haarrp

@itchannels_telegram -🔥best channels

Реестр РКН: clck.ru/3Fmqri
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
✔️ Tencent релизнула одну модель на все задачи с речью

Tencent Hunyuan вместе с Шанхайским университетом выложили AuK, открытую базовую модель для генерации и редактирования речи на 1,5 млрд параметров.

Русского языка модель не знает, заявлены только китайский и английский. Авторы, правда, отмечают возможный перенос между языками - какая-то способность возникает сама, но поддержкой это не считается.


AuK принимает на вход текстовый запрос и, если нужно, исходное аудио и на выходе отдаёт готовый звук.

Всего заявлено пять типов задач: синтез речи (клонирование голоса по образцу и генерация по описанию), правка содержания (заменить слово в реплике или строчку в песне), акустика (темп, громкость, высота тона), паралингвистика (эмоция, тембр, акцент, вздохи и смешки, шёпот) и очистка с разделением (шумоподавление, выделение спикера, отделение вокала от музыки).

🟡Механика

Мультимодальная Qwen2.5-Omni читает инструкцию вместе с аудио и превращает её в смысловое условие. Аудио-VAE сжимает звук в компактное представление и потом восстанавливает обратно в волну.

Между ними работает трансформер по подобию FLUX - сначала десять блоков MMDiT, где смысловой и акустический потоки обмениваются информацией, оставаясь раздельными, затем двадцать обычных блоков DiT поверх склеенной последовательности.

🟡Тесты

По замерам Tencent, модель лидирует на Seed-TTS-Eval (разборчивость речи и похожесть на голос образца), InstructTTSEval (насколько точно модель отрабатывает словесное описание тембра), а также на MMAE-Speech и SpeechEditBench, где проверяют правки.

А вот на восстановлении сигнала (DNS Challenge, CHiME-4, Libri2Mix) она только конкурентоспособна, то есть узкоспециализированные модели там по-прежнему сильнее.

Отдельно выложена AuK-Flash - дистиллированная версия, которая укладывается в четыре шага вместо тридцати двух и работает в 4,5 раза быстрее.

К ней, кстати, нужно будет отдельно качать Qwen2.5-Omni-3B в роли энкодера.


В репозитории есть код установки, инференса на Gradio, ComfyUI, дообучения и шаблоны инструкций с примерами в кукбуке.

Пощупать можно в демо на Hugging Face и ModelScope.


📌Лицензирование: MIT License


🟡Страница проекта
🟡Веса
🟡Arxiv
🟡Демо
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #TTS #AuK #Tencent
Please open Telegram to view this post
VIEW IN TELEGRAM
👍59🤗17❤14👏13🔥1
⚡️ OpenAI может приостановить оформление новых подписок ChatGPT Pro

Неформальный голос в X OpenAI, Тибо, сообщил, что интерес к Astra побил все внутренние исторические рекорды сервиса.

Компания неоднократно сталкивалась с резкими скачками трафика, но текущая динамика оказалась беспрецедентной - команда задействует все доступные вычислительные мощности, чтобы удерживать доступность инфраструктуры.

Главным приоритетом в OpenAI называют сохранение качества обслуживания текущих клиентов и если нагрузка продолжит расти теми же темпами, компания пойдет на превентивную меру и временно заморозит продажи тарифа ChatGPT Pro во избежание очередей на инференс и деградации производительности.

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔156🔥59🤣50⚡17❤10😁10😢6
⚡️ DeepSeek открыла веса V4.1-Flash

DeepSeek выложила свежайшую DeepSeek-V4.1-Flash, мультимодальную MoE-модель на 552 млрд параметров, с контекстом до миллиона токенов и методом Causal Encoder-Decoder под капотом, который вдвое удешевляет разбор входа.

Задача, под которую её делали, скучная, но дорогая. Долго работающий агент постоянно перечитывает свой контекст, и всё прочитанное приходится держать в KV-кэше.

На длинных дистанциях он раздувается, забивает видеопамять и упирается в пропускную способность шин.


В V4.1-Flash кэш сжат до 890 байт на токен, это вчетверо меньше, чем у V4-Flash, и в 437 раз, чем у первой версии DeepSeek.

Каждому слою внимания заранее назначен один из трёх режимов:

🟢в полном слой считает свои ключи и значения сам;
🟢в режиме переиндексации берёт их у предыдущего слоя, но заново выбирает, на что смотреть;
🟢в режиме повторного использования не считает ничего - берёт и чужой кэш, и чужой выбор.

Так хранить приходится в разы меньше. Сверху главный кэш держится в четырёхбитном формате FP4, и устойчивость к такой точности натренирована, а не добавлена после обучения.

🟡Causal Encoder-Decoder

Метод вдохновлен майкрософтовской работой You Only Cache Once про переиспользование KV-кэша слоями. DeepSeek внесла в него структурные улучшения, чтобы поднять ёмкость кэша и глубину вычислений при его порождении.

40 слоёв разделены пополам: 20 на энкодер, 20 - декодер. К и V для декодера не считаются в каждом его слое, а проецируются из последнего скрытого состояния энкодера.

Поэтому при разборе входа работает только первая половина сети - 8 млрд активных параметров на токен против 16 при генерации ответа.

Для агентов, у которых вход в разы длиннее вывода, это именно то, что нужно.


🟡Бенчмарки

На DeepSWE v1.1 модель берёт 74,2% против 74,0 у Claude Opus 5 и 73,0 у GPT-5.6 Sol.

На Terminal-Bench 2.1 - 90,6% (выше всех).

На AutomationBench - 54,8% против 50,3 у Opus 5.

А вот в Terminal-Bench 4.0, где нужны экспертные знания в науке, модель даёт 31,2% против 51,8 у Opus 5, то есть разрыв с топами на самых сложных задачах никуда не делся.


Модель поддерживает настраиваемый уровень рассуждений от 1 до 100, в API это три пресета: low, high, max - они соответствуют значениям 50, 75 и 100.

Шаблона чата в Jinja нет - вместо него советуют реализацию промптов на Python и отдельный набор Rust-библиотек.

Сообщество на Hugging Face уже сделало квантованные версии практически под всё.


📌Лицензирование: MIT License


🟡Блогпост
🟡Веса
🟡Техотчет


@ai_machinelearning_big_data

#AI #ML #MMLM #MoE #Deepseek
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥61🤩46👍21❤19👏11🤔7🥰2🏆2😁1🙏1🤝1
ТехВилл ищет в команду сотрудников!

ТехВилл (айтишка ВкусВилл) расширяет команду! Открыты новые вакансии для ИТ-специалистов разного профиля. 

Выбирайте свою роль:

🔹 Главный инженер в Роботизацию дарксторов — роботизация складов

🔹 Руководитель проекта — управление разработкой робототехнических комплексов

🔹 Разработчик (Навигация) — автономное движение на C++/ROS 2

🔹 Старший разработчик — аппаратная платформа дронов и embedded

🔹 Инженер-программист (вендинги) — настройка и интеграция торговых автоматов

Ключевые условия:
✅ Аккредитованная ИТ-компания
✅ Официальное оформление с первого дня, куратор на адаптации;
✅ Прозрачные грейды, обучение, индивидуальные планы развития;
✅ Компенсация медицины, спорта и AI-помощников;
✅ Бонус 15% во ВкусВилл;
✅ Соцподдержка;
📍 Гибрид Москва и МО.

Присоединяйтесь к созданию технологий будущего для розничной торговли!
👍67❤16👏14🎉6😁5🤩1
Media is too big
VIEW IN TELEGRAM
✔️ Госсектор США переходит на коммерческие тарифы OpenAI

OpenAI закрывает пилотную программу для федеральных ведомств, по которой доступ к её технологиям стоил 1 доллар в год. С 1 октября вступит в силу двухлетний контракт - чиновники перейдут на оплату по факту потребления со скидкой 50% от стандартного прайса.

По данным Управления общих служб правительства США, за год пилота доступ к ChatGPT получили 3,5 млн госслужащих, а заявленная экономия бюджета за это время составила 1,4 млрд долларов.

Ожидается, что переход на новые тарифы упростит ведомствам внедрение и использование будущих моделей OpenAI.
bloomberglaw.com

✔️ Palantir и Nebius объединят инфраструктуру

Компании договорились развернуть платформу Palantir AIP на мощностях Nebius AI Cloud. Расчёт на госсектор и корпоративных клиентов с жёсткими требованиями к локализации данных.

Клиенты Palantir получат доступ к европейским GPU-кластерам Nebius для распределённого обучения и инференса, с возможностью разворачивать изолированные ИИ-контуры по стандартам GDPR.

Аналитические и агентные инструменты Palantir теперь работают на дата-центрах Nebius. Основные заказчики - оборонные, финансовые и промышленные предприятия.
nebius.com

✔️ Экс-глава Sora и сооснователь DreamWorks запускают стартап по генерации видео

Билл Пиблз, бывший руководитель проекта Sora в OpenAI, сооснователь DreamWorks Джеффри Катценберг и экс-финансовый директор Dropbox Суджай Джасва запускают компанию для обучения собственных моделей видеогенерации под профессиональную киноиндустрию.

Проект пока привлекает финансирование, идут переговоры с венчурными фондами. Название и целевая оценка не раскрываются.

Техническое направление возглавил Пиблз - один из авторов Diffusion Transformer, архитектуры, лежащей в основе Sora и большинства современных видеогенераторов.

Из OpenAI он ушёл в апреле этого года, чтобы заниматься исследованиями в видеосинтезе вне жёстких продуктовых графиков корпорации.
theinformation.com

✔️ Anthropic следит за анти-ИИ активистами

По данным The American Prospect, служба безопасности Anthropic отслеживает протестные движения и анти-ИИ активистов с помощью инструментов сбора сведений из открытых источников и коммерческой платформы анализа рисков Samdesk.

Согласно расследованию издания, аналитики компании следят за перемещениями участников акций в реальном времени, ведут списки лиц, представляющих интерес, и прогнозируют инциденты рядом с офисами или топ-менеджерами. Собранные сведения передаются в полицию США.

Отдельно The American Prospect указывает на случаи, когда Anthropic сообщала правоохранителям об угрозах от пользователей в переписке с Claude, но отказывалась выдавать логи чатов, ссылаясь на политику приватности.
prospect.org

✔️ Вышло приложение Gemini для Windows

Google выпустила десктопный клиент Gemini для Windows 10 и 11. Интерфейс работает компактным оверлеем поверх активных окон, вызывается сочетанием Alt + Space.

В полноэкранном режиме приложение интегрируется с Gmail и Google Drive, а многоэтапные задачи можно делегировать агенту Gemini Spark.

Кроме работы с текстом, клиент генерирует изображения через Nano Banana и видео через Gemini Omni. Работает в фоне и уже доступно для скачивания.
blog.google

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍92❤23👏15💯10🌚8🤝5😁1
One Day Offer: научи роботов понимать мир! 🤖

Команда Центра робототехники Сбера делает то, что ещё недавно казалось невозможным — создаёт ИИ, который живёт в физическом мире: двигается, видит и принимает решения.

И ты можешь стать частью этого будущего — если пройдёшь отбор на One Day Offer для Robotics Software Engineer и Machine Learning Engineer.

Важно: твой код будет не просто строкой в репозитории, а командой для робота — сделать шаг или распознать предмет. Работать ты будешь с современным стеком: C++/Python, ROS2, PyTorch/Jax, VLA‑моделями.

Готов присоединиться? Регистрируйся по ссылке — встречаемся 26 сентября! 😉
🤩78👍19👏14❤12😁10🤬3🍓2
This media is not supported in your browser
VIEW IN TELEGRAM
✔️ Голосовая модель GPT-Live-1 стала доступна по API

OpenAI открыла API полнодуплексной голосовой модели GPT-Live-1 стоимостью 5 центов за минуту. Модель слушает и синтезирует речь одновременно, заменяя традиционный каскад STT–LLM–TTS.

Единая архитектура снизила задержку реакции с 1,4 до 0,8 секунды и позволила обрабатывать перебивания. Обновленная фильтрация пауз и фонового шума сократила число ложных прерываний на 80%.

Модель поддерживает делегирование вычислений - голосовой фронтенд удерживает непрерывный контакт с пользователем, пока бэкенд (GPT-6 Astra и Luna) параллельно выполняют рассуждения и вызовы инструментов.

GPT-Live-1 готова к интеграции в телефонию. API может возвращать ASR-транскрипты, включает 12 голосов и поддерживает управление темпом и стилем речи через системный промпт.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍118🔥22❤9👏5🤩4❤‍🔥1
⚡️ Яндекс открыл модель, на которой работают быстрые ответы в Поиске

Яндекс выложил на Hugging Face Alice AI-T5-35B-A0.6B Base — модель, которую обучили с нуля специально для высоконагруженного Поиска. Её дообученная версия Alice AI Search используется для генерации быстрых ИИ-ответов в Поиске. 

При сотнях тысяч запросов в минуту такая модель должна не только хорошо отвечать, но и делать это за считанные секунды, не сжигая лишнее. Поэтому из 35 млрд параметров на каждый токен включаются только 600 млн, а отдельная модель отбирает из найденных документов лишь нужные фрагменты — такой подход увеличил пропускную способность примерно на 40%.

В итоге модель показывает сильные результаты на русскоязычных задачах и сопоставима с гораздо более тяжёлыми моделями, оставаясь дешевле в работе.

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍98🤣35⚡34🔥16❤11🗿3🥰2😨1💘1
🌟 Tencent TeamAI CLI: общий конфиг для всех агентов команды

Инструмент складывает навыки, правила, хуки и настройки MCP в один git-репозиторий и раздаёт их всем участникам ИИ-команды.

Поддерживаются Claude Code, Codex, Cursor, CodeBuddy, WorkBuddy, Qoder, OpenCode, а также OpenClaw, Hermes и DeepSeek Harness (у последних трёх с ограничениями).

Хранилищем может быть GitHub, GitLab, GitCode, CNB, TGit или свой git-сервер.

Правки идут обычным рабочим процессом - участник делает пуш, открывается запрос на слияние, ревьюер проверяет и одобряет, остальные получают изменения при следующем запуске сессии. Повторный пуш по той же правке обновляет уже открытый MR, без создания нового.

Когда сессия заканчивается, хук оценивает её по критерию проблемности - перебивали ли модель, отклоняли ли вызовы инструментов, сколько раз агент повторял падающие команды.

Чистая сессия, пусть и длинная, не считается, но если с чем-то реально бились, TeamAI предложит записать вывод и отправить его в командный репозиторий. Подсказка при этом перечисляет, какие именно сигналы сработали.

Накопленное можно искать автоматически - агент перед задачей вызывает встроенный субагент, тот подбирает ключевые слова, читает найденные документы и возвращает выжимку.

Отдельная команда разбирает репозитории в граф компонентов, интерфейсов и зависимостей - для TypeScript, JavaScript, Python и Go связи достаёт парсер tree-sitter, для остальных языков работает запасной механизм на регулярных выражениях.

Еще TeamAI может делать недельный дайджест по расходу токенов, объёму диалогов и частоте вмешательств, а также дашборд со статусом текущих сессий каждого участника.


📌Лицензирование: MIT License


🖥Github


@ai_machinelearning_big_data

#AI #ML #Agents #Tools #TeamAiCli #Tencent
Please open Telegram to view this post
VIEW IN TELEGRAM
👍60🤩16❤11🔥7👏5💯2🤷‍♂1
Сбер представил GigaChat 3.5 Reasoning — флагманскую модель с режимом рассуждений

Новая версия умеет последовательно решать сложные задачи. Сначала разбирает их на этапы и выстраивает план. Затем проверяет промежуточные результаты и исправляет ошибки.

Ещё одна особенность релиза — экономный расход токенов. В среднем на математические расчёты здесь используется на 37% меньше токенов, чем у открытой ИИ-модели DeepSeek V4 Flash Preview.

По сравнению с моделью без режима рассуждений GigaChat 3.5 Reasoning заметно улучшила результаты бенчмарков. В IFBench показатель вырос с 44 до 77 баллов, в Natural Plan — с 64 до 80, а в Live Code Bench v6 — с 56 до 85.

Модель доступна бесплатно по лицензии MIT на HuggingFace и GitVerse. Её можно интегрировать в собственные продукты.

Попробуйте обновлённый режим «Рассуждение» на giga.chat. Подробнее – в посте команды.
👍135😁67❤25👏21🥱20🔥11🤩5🤣5🙉5🤝1
✔️ В ComfyUI появился встроенный copilot для сборки и отладки нод

Comfy Org открыла бета-тестирование встроенного ассистента Comfy Agent. Инструмент может создавать и изменять воркфлоу, запускать задачи, отлаживать ошибки и предлагать улучшения в интерфейсе ComfyUI по текстовым запросам.

Агент работает в фоне и умеет создавать цепочки нод, оптимизировать имеющиеся воркфлоу и искать ошибки совместимости.

В отличие от Comfy MCP, который позволяет управлять ComfyUI через Claude или Cursor, Comfy Agent работает как готовое коробочное решение внутри редактора.

Бэкенд ассистента развернут в инфраструктуре Comfy Cloud, а для простых задач можно подключать локальные модели.

Comfy Agent, вероятно, войдёт в подписку Comfy Cloud.

Подать заявку на открытую бету можно по ссылке. Запись стрима с демонстрацией возможностей - на Youtube.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤩97👍34🎉16❤9👏7🔥1🥱1🌭1
🐟 Sakana AI представила Fugu Max и Fugu Ultra v2 - обновление системы оркестрации AI-агентов

Fugu распределяет задачи между несколькими моделями, подбирая подходящую по возможностям и стоимости.

Fugu Max использует расширенный набор моделей с открытыми весами и специализированных моделей, включая NVIDIA Nemotron. По заявлению Sakana, система приближается к ведущим моделям по качеству при стоимости в 2–6 раз ниже.

Fugu Ultra v2 ориентирована на максимальное качество. По данным компании:

* опережает Opus 5 и Fable 5 на Chartography
* на DeepSWE превосходит модели, у которых цена за токен в 3–5 раз выше
* при этом Fable 5, Fable 5.1 и GPT-6-Astra не входят в её набор агентов

Модели внутри системы можно заменять. Такая архитектура рассчитана на снижение зависимости от отдельных поставщиков и сохранение работы при изменениях доступности API.

[Попробовать Fugu - https://sakana.ai/fugu

Анонс Sakana AI - https://sakana.ai/fugu-max-release/
🎉122👍39🤓22❤9⚡2🔥2👏1
This media is not supported in your browser
VIEW IN TELEGRAM
✔️ OpenAI отдала по API харнесс, на котором работает Codex

Компания открыла Agents API - публичную бету сервиса, который берёт на себя всю обвязку вокруг агента. Она здесь та же, что у Codex и ChatGPT for Work.

Агент создаётся одним вызовом API, где указывается задача, модель, инструменты и окружение. Дальше действует OpenAI, а разработчик занимается своими инструментами, знаниями и процессами.

Харнесс умеет сжимать ранний контекст, когда сессия подбирается к лимиту и подгружать описания инструментов по необходимости. Плюс дает агентам вызывать инструменты программно - выполнять вызовы параллельно, сцеплять их и фильтровать результаты прямо в коде, возвращая в контекст только нужное.


Место работы агента можно выбрать из песочницы самой OpenAI, поднять на своей инфраструктуре или уйти к партнёрам: Blaxel, Cloudflare, Daytona, DigitalOcean, E2B, Modal, Oracle, Runloop и Vercel.

Отдельной платы за Agents API нет, только токены и инструменты, которые расходует агент.

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👨‍💻77👍35👏21❤17🔥14🤣3🤓3🕊1
🌐 Твоё ИИ-решение — в одной из крупнейших энергетических компаний России

Получи подготовленные данные и разработай ИИ-ассистента для энергетики на соревновании от ПАО «Интер РАО» при поддержке компании «Яндекс».

Призовой фонд — 750 000 рублей. Лучшие проекты смогут стать частью экосистемы компании.

Регистрация открыта до 27 сентября.

Можно участвовать одному или командой до 5 человек. Идеальный состав: разработчик, специалист по машинному обучению, аналитик и дизайнер.

Стартуем 28 сентября. Придумай концепт проекта: самые сильные идеи участники доработают под руководством экспертов с 9 по 23 октября. Финал в Москве — 3 ноября.

Задачи соревнования — за какую возьмешься?
1️⃣ ИИ-помощник для подготовки презентаций.
Создай инструмент генерации презентации в корпоративном стиле из текстового брифа.

2️⃣ Помощник для анализа документов из судов.
Разработай систему, которая сможет распознавать, классифицировать и заносить судебные и исполнительные документы в базу данных.

3️⃣ Ассистент для создания ИТ/ИБ-дайджестов.
Напиши ассистента, который будет регулярно анализировать релевантные новости из различных источников и формировать краткую сводку.

4️⃣ Архитектор BPMN-диаграмм.
Создай генератор BPMN-диаграмм, который позволит из текстового описания процесса собрать валидную схему в формате BPMN 2.0.


Получи сильную строчку в портфолио и уникальный опыт работы под руководством экспертов Группы «Интер РАО».

Регистрируйся: https://cnrlink.com/interraohack26ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤩48🤣19🎉17👍7❤6🔥6🤬1🐳1
Media is too big
VIEW IN TELEGRAM
✔️ OpenAI готова замедлить разработку, если на это пойдут остальные

Сэм Альтман заявил сотрудникам, что компания готова притормозить работу над моделями следующего поколения - но только если то же сделают другие лаборатории. По данным Bloomberg, часть циклов предобучения OpenAI уже приостановила из соображений безопасности.

Идею контролируемого темпа Альтман обсуждал и раньше, в том числе в Белом доме. Инициатива родилась на фоне ухода ведущих специалистов по безопасности из OpenAI, Anthropic и Google DeepMind.

На этой неделе главный научный сотрудник OpenAI Якуб Пахоцкий публично призвал отрасль к координации и добровольным паузам в релизах.
bloomberg.com

✔️ Cognition выпустила кодинг-модель SWE-2

Разработчик Devin обучил SWE-2 на базе открытой Kimi K3 с её 2,8 трлн параметров. По словам авторов, обучение с подкреплением впервые масштабировали на исходную модель такого размера.

Вместо дистилляции экспертов использовали линейные штрафы за стоимость вычислений, привязанные к наклону границы Парето.

На FrontierCode 1.1 Main модель набрала 50,0%. Инференс, по замерам Cognition, обходится на 60-75% дешевле, чем у Fable 5.1 и GPT-6 Astra.

Сократили и время на изучение репозитория - на среднем уровне рассуждений агент начинает править код на 18-м шаге вместо 48-го у SWE-1.7. Модель доступна в Devin CLI, десктопе и веб-версии.
cognition.com

✔️ Cursor открыл бету системы координации агентов

Новая возможность Projects рассчитана на задачи, которые живут дольше одного чата: рефакторинг, миграции, крупные фичи.

Координатору ставят задачу, он составляет план и раздаёт подзадачи субагентам - по заявлению Cursor, их может быть тысячи. Сам код он не пишет, поэтому никогда не занят, но умеет реагировать на события - следит за ветками Git, ловит падения CI и триггеры из Slack.

Бета раскатывается на всех, о тарификации в анонсе не сообщается.
cursor.com

✔️ Black Forest Labs представила модель редактирования видео

FLUX Video Edit правит готовые ролики по текстовому запросу в режиме video-to-video - сохраняет композицию, траекторию камеры, тайминги и звук, меняя только указанное. Модель также умеет подгонять липсинк под новый дубляж, не меняя хронометраж.

На вход идут MP4 до 15 секунд и 50 МБ, на выходе 720p при 24 кадрах в секунду. Секунда обработанного видео стоит 3 цента.
Black Forest Labs в X

✔️ Филдсовский лауреат основал институт формальной верификации ИИ

Канадский математик Джейкоб Цимерман создаёт центр Mathematical A.I. Safety Institute со штатом в несколько десятков специалистов, запуск которого запланирован на январь 2027 года. Параллельно Цимерман присоединится к команде безопасности OpenAI, то есть будет верифицировать в том числе собственного работодателя.

Идея - перевести оценку рисков с эмпирического тестирования на строгую теоретическую верификацию и наделить модели доказуемыми свойствами надёжности, как у криптографических алгоритмов.

Механизмом аудита предлагают сделать доказательства с нулевым разглашением - лаборатория подтверждает соблюдение ограничений, не раскрывая ни архитектуру, ни веса. 
nytimes.com

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍156👏23😁17🤔14❤11🎉7🔥6🤓4⚡2🤬1🙏1
This media is not supported in your browser
VIEW IN TELEGRAM
✔️ OpenAI собрала версию ChatGPT для финансовых услуг

ChatGPT for Financial Services - специализированная версия платформы, которую делаи вместе с банками Morgan Stanley и Evercore.

Инструмент объединяет аналитические возможности GPT-6 Astra со встроенными финансовыми датасетами от PitchBook, Crunchbase, Daloopa, FiscalAI и LSEG News, которые индексируются напрямую на инфраструктуре разработчика.

Это решает проблемы интеграции внешних баз через MCP-коннекторы, ускоряет выборку и позволяет делать детализированное цитирование - система привязывает каждую цифру, показатель или вывод к точным строкам, таблицам и сноскам в исходных финансовых документах.


Платформа автоматизирует LBO-моделирование, нормализацию отчётности, скрининг покупателей и генерацию аналитических отчётов и питчбуков по корпоративным шаблонам в форматах Excel, Word и PowerPoint, публикуемым администратором.

Для финсектора предусмотрена сквозная авторизация по существующим подпискам на S&P Capital IQ, LSEG, MSCI, Factiva и Moody's, а также ролевой доступ, единый вход по SAML, автоматическое управление учётными записями через SCIM, поддержка информационных барьеров между рабочими пространствами, аудит действий через OpenAI Compliance Platform и запрет на использование клиентских данных для обучения моделей.

На бенчмарке OfficeQA Pro, где модель ищет и анализирует данные в бюллетенях Минфина США со сложными таблицами, графиками и сносками, GPT-6 Astra показывает 69,9% против 60,2% у GPT-5.6 Sol.


Решение доступно финансовым организациям по запросу, стоимость не раскрывается.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤓87👍74👀13❤6🔥5🤣5😭2🤔1
⚡ Глава Anthropic призвал замедлить развитие ИИ и допустить независимых проверяющих внутрь лабораторий

В статье We Must Pace the Frontier Дарио Амодеи объяснил, почему изменил позицию: в 2023 году замедление казалось ему преждевременным, теперь он считает его необходимым.

Самое интересное:

🔹 ИИ уже ускоряет создание следующего поколения моделей. По словам Амодеи, рекурсивное самоулучшение начинается в отрасли, включая Anthropic. Он опасается, что возможности систем будут расти быстрее, чем способы их контроля.

🔹 Его тревожный сценарий - масштабные кибератаки через 6–12 месяцев. Амодеи допускает, что более мощный рой агентов сможет создать устойчивый ботнет и нанести ущерб на сотни миллиардов долларов. Это его оценка риска.

🔹 Anthropic обещает постоянный доступ внешним проверяющим. Рабочие места, пропуска, инструменты и права, сопоставимые с внутренними командами оценки рисков. Проверять предлагается и готовые модели, и процесс обучения.

🔹 Проверяющие смогут публиковать неудобные выводы. Компания предусматривает ограничения для защищённой информации, но обещает не скрывать результаты только потому, что они ей невыгодны.

🔹 Цель - выиграть год-два для безопасности. Среди предложений: обязательные проверки при достижении опасных возможностей и международные ограничения скорости самоулучшения ИИ. Полную глобальную паузу Амодеи считает маловероятной в ближайшее время.

Полная cтатья - https://darioamodei.com/post/we-must-pace-the-frontier

@ai_machinelearning_big_data

#Anthropic
1👍89🤣74⚡32🤔30❤18👨‍💻8🤨7👻4🔥3😁2🤬1
📌ApprenticeBench: проверка способности ИИ освоить работу как новый сотрудник

Стартап NeoCognition разработал первый сквозной бенчмарк использования компьютера, непрерывного обучения и долгосрочной агентной работы на реальной должности.

NeoCognition - лаборатория, в которой собрали бенчмарки MMMU, Mind2Web, SWE-Bench Pro и OSWorld 2, а также агентные системы SeeAct, UGround и HippoRAG.


Агента принимают в виртуальную строительную компанию на работу с кредиторской задолженностью, выдают полугодовой архив счетов, внутренний справочник и руководство по ERP-системе, после чего он начинает работать со счетами.

Первый месяц проходит с подробным фидбэком от руководителя по каждому счёту, а дальше - с редкими замечаниями по итогам месяца.

Каждая из ста задач теста проверена профессиональными бухгалтерами строительной отрасли, которые подтвердили и реалистичность сценариев, и то, что любую задачу способен решить рядовой специалист, изучивший доступные агенту материалы.

🟡Результаты

Большинство моделей, включая Gemini, Muse Spark, Grok и Kimi, не преодолевают порог в 20-25%, тогда как Fable 5.1 выполнила 72% задач, а GPT-6 Astra - 68%.

Лучший из двух тестировщиков-людей показал 51%, причём проваливались люди на поиске нужного в исторических данных, точности расчётов и мелких ошибках от утомления.

Разрыв между открытыми и закрытыми моделями авторы называют крупнейшим из всех виденных ими на бенчмарках - 72% у Fable 5.1 против 18% у Kimi K3, и вызван он не базовыми операциями в интерфейсе, а неспособностью слабых моделей учиться на дистанции.

Kimi K3 почти не обращался ни к архиву счетов, ни к собственным заметкам и деградировал к концу серии.


🟡GUI vs API

Так называемый налог на использование компьютера (просадка при переходе с API на графический интерфейс) у большинства моделей достигает 78%, но Fable 5.1 и GPT-6 Astra работают через GUI даже лучше, чем через API.

Дешевле при этом остаётся API - Fable 5.1 обходится в 6,95 доллара за задачу в программном интерфейсе против 18,23 доллара при работе с графическим.

🟡Обучаемость

Способность к обучению измерили отдельно. Fable 5 без доступа к истории и обратной связи, опираясь только на собственные знания, решает 11 счетов из 100.

Подключение архива счетов поднимает результат до 31, обратная связь руководителя - до 35, а оба канала вместе дают 43.

🟡Вывод

ИИ пока ещё обходится дороже: 18,23 доллара за задачу против 7,21 у людей. К тому же человек по мере накопления опята работает быстрее, а агент - замедляется.

🔜 Посмотреть часовой прогон Fable 5.1 по всем ста задачам.


@ai_machinelearning_big_data

#AI #ML #Benchmark #ApprenticeBench #NeoCognition
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤔112❤46👏30💯15👍13🔥6👌4🎉2🤓2👀1