LLM заражают друг друга через числа: статья в Nature
LLM заражают друг друга через числа: статья в Nature
Anthropic совместно с исследователем Owain Evans опубликовали в Nature работу, которая ставит под вопрос все, что мы знаем о безопасности дистилляции моделей. Феномен назвали subliminal learning – «подсознательное обучение».
Схема эксперимента простая. Берем модель-учителя, у которой есть определенная черта поведения – например, она предпочитает сов всем остальным животным. Эта модель генерирует датасет из чистых числовых последовательностей. Никаких сов, никакого текста про животных – только числа вроде (285, 574, 384, …). Затем на этих числах файнтюним модель-ученика.
Результат? Ученик начинает предпочитать сов. Обучившись на числах. Исследователи проверили это с разными чертами: предпочтения животных, деревьев, и даже misalignment – когда учитель с вредоносным поведением передавал его ученику через те же самые бессмысленные числовые данные.
Фильтрация не помогает. Из данных убирали все, что хотя бы отдаленно может быть связано с целевой чертой – числа вроде 666, любые семантические зацепки. Эффект сохранялся.
Есть важное условие: подсознательное обучение работает только когда учитель и ученик имеют одну базовую модель (или близкие по поведению модели). Если архитектуры и инициализации разные, передача не происходит.
Авторы доказали и теоретически, что это общее свойство нейросетей. Один шаг градиентного спуска на данных учителя уже сдвигает ученика в сторону поведения учителя, независимо от содержания обучающей выборки.
Что это значит на практике? Стандартные подходы к safety-проверкам моделей уже недостаточны. Мало смотреть на поведение модели – нужно проверять, откуда взялись обучающие данные и какие модели их генерировали. Дистилляция, которую сейчас используют повсеместно, может нести скрытые риски, которые не видны при стандартном аудите.
https://uproger.com/llm-zarazhayut-drug-druga-cherez-chisla-statya-v-nature/
LLM заражают друг друга через числа: статья в Nature
Anthropic совместно с исследователем Owain Evans опубликовали в Nature работу, которая ставит под вопрос все, что мы знаем о безопасности дистилляции моделей. Феномен назвали subliminal learning – «подсознательное обучение».
Схема эксперимента простая. Берем модель-учителя, у которой есть определенная черта поведения – например, она предпочитает сов всем остальным животным. Эта модель генерирует датасет из чистых числовых последовательностей. Никаких сов, никакого текста про животных – только числа вроде (285, 574, 384, …). Затем на этих числах файнтюним модель-ученика.
Результат? Ученик начинает предпочитать сов. Обучившись на числах. Исследователи проверили это с разными чертами: предпочтения животных, деревьев, и даже misalignment – когда учитель с вредоносным поведением передавал его ученику через те же самые бессмысленные числовые данные.
Фильтрация не помогает. Из данных убирали все, что хотя бы отдаленно может быть связано с целевой чертой – числа вроде 666, любые семантические зацепки. Эффект сохранялся.
Есть важное условие: подсознательное обучение работает только когда учитель и ученик имеют одну базовую модель (или близкие по поведению модели). Если архитектуры и инициализации разные, передача не происходит.
Авторы доказали и теоретически, что это общее свойство нейросетей. Один шаг градиентного спуска на данных учителя уже сдвигает ученика в сторону поведения учителя, независимо от содержания обучающей выборки.
Что это значит на практике? Стандартные подходы к safety-проверкам моделей уже недостаточны. Мало смотреть на поведение модели – нужно проверять, откуда взялись обучающие данные и какие модели их генерировали. Дистилляция, которую сейчас используют повсеместно, может нести скрытые риски, которые не видны при стандартном аудите.
https://uproger.com/llm-zarazhayut-drug-druga-cherez-chisla-statya-v-nature/
🤯10❤5👍4
⭐️ Stanford выпустил AI Index 2026: 15 выводов, которые стоит знать каждому в индустрии
Stanford HAI опубликовал ежегодный AI Index Report за 2026 год - 423-страничный документ, который уже стал обязательным чтением для всех, кто работает с ИИ. Luiza Jarovsky собрала ключевые тезисы в одном треде, а мы разбираем их подробнее.
Возможности ИИ не выходят на плато. Они ускоряются и охватывают все больше людей. Те, кто ждал замедления прогресса, ошиблись - кривая по-прежнему идет вверх.
Разрыв между США и Китаем в производительности моделей фактически закрылся. Это серьезный сдвиг в геополитике ИИ, который меняет расклад сил на рынке.
США лидируют по количеству дата-центров для ИИ, но основная масса чипов производится на одном тайваньском заводе. Зависимость от TSMC остается критической уязвимостью всей индустрии.
Модели ИИ берут золото на Международной математической олимпиаде, но не могут надежно определить время. Исследователи называют это "зубчатой границей" (jagged frontier) - неравномерный профиль способностей, где прорывы соседствуют с провалами.
Роботы по-прежнему проваливают большинство бытовых задач, даже если отлично работают в контролируемых средах. Разрыв между лабораторией и реальным миром никуда не делся.
Ответственный ИИ не успевает за ростом возможностей. Бенчмарки безопасности отстают, а число инцидентов растет резко. Это тревожный сигнал для всей индустрии.
США лидируют по инвестициям в ИИ, но их способность привлекать глобальные таланты снижается. Деньги есть, а люди уезжают - не лучшая комбинация.
Внедрение ИИ идет с исторической скоростью. Пользователи получают значительную ценность от инструментов, к которым часто имеют бесплатный доступ. Порог входа для использования ИИ практически исчез.
Рост продуктивности от ИИ наблюдается в тех же сферах, где начинает сокращаться занятость начального уровня. Это не совпадение, а закономерность, которую уже нельзя игнорировать.
Экологический след ИИ расширяется вместе с его возможностями. Энергопотребление дата-центров становится все более заметным фактором.
Модели ИИ для науки превосходят ученых-людей, хотя более крупные модели не всегда работают лучше. Закон "больше параметров = лучше результат" перестает работать.
ИИ трансформирует клиническую практику, но строгих доказательств эффективности по-прежнему мало. Медицина требует другого уровня верификации.
Формальное образование отстает от ИИ, но люди осваивают навыки работы с ИИ на всех этапах жизни. Самообучение опережает университеты.
Суверенитет в сфере ИИ становится ключевым элементом национальной политики. Возможности распределены неравномерно, но open-source разработка помогает перераспределить участие.
Эксперты по ИИ и обычные люди смотрят на будущее технологии совершенно по-разному. Глобальное доверие к институтам, которые должны управлять ИИ, фрагментировано. Это создает проблему: технологию двигают те, кому общество не вполне доверяет.
Полный отчет (423 страницы): https://hai.stanford.edu/ai-index/2026-ai-index-report
Тред Luiza Jarovsky с кратким обзором: https://x.com/LuizaJarovsky/status/2044033970560512149
Stanford HAI опубликовал ежегодный AI Index Report за 2026 год - 423-страничный документ, который уже стал обязательным чтением для всех, кто работает с ИИ. Luiza Jarovsky собрала ключевые тезисы в одном треде, а мы разбираем их подробнее.
Возможности ИИ не выходят на плато. Они ускоряются и охватывают все больше людей. Те, кто ждал замедления прогресса, ошиблись - кривая по-прежнему идет вверх.
Разрыв между США и Китаем в производительности моделей фактически закрылся. Это серьезный сдвиг в геополитике ИИ, который меняет расклад сил на рынке.
США лидируют по количеству дата-центров для ИИ, но основная масса чипов производится на одном тайваньском заводе. Зависимость от TSMC остается критической уязвимостью всей индустрии.
Модели ИИ берут золото на Международной математической олимпиаде, но не могут надежно определить время. Исследователи называют это "зубчатой границей" (jagged frontier) - неравномерный профиль способностей, где прорывы соседствуют с провалами.
Роботы по-прежнему проваливают большинство бытовых задач, даже если отлично работают в контролируемых средах. Разрыв между лабораторией и реальным миром никуда не делся.
Ответственный ИИ не успевает за ростом возможностей. Бенчмарки безопасности отстают, а число инцидентов растет резко. Это тревожный сигнал для всей индустрии.
США лидируют по инвестициям в ИИ, но их способность привлекать глобальные таланты снижается. Деньги есть, а люди уезжают - не лучшая комбинация.
Внедрение ИИ идет с исторической скоростью. Пользователи получают значительную ценность от инструментов, к которым часто имеют бесплатный доступ. Порог входа для использования ИИ практически исчез.
Рост продуктивности от ИИ наблюдается в тех же сферах, где начинает сокращаться занятость начального уровня. Это не совпадение, а закономерность, которую уже нельзя игнорировать.
Экологический след ИИ расширяется вместе с его возможностями. Энергопотребление дата-центров становится все более заметным фактором.
Модели ИИ для науки превосходят ученых-людей, хотя более крупные модели не всегда работают лучше. Закон "больше параметров = лучше результат" перестает работать.
ИИ трансформирует клиническую практику, но строгих доказательств эффективности по-прежнему мало. Медицина требует другого уровня верификации.
Формальное образование отстает от ИИ, но люди осваивают навыки работы с ИИ на всех этапах жизни. Самообучение опережает университеты.
Суверенитет в сфере ИИ становится ключевым элементом национальной политики. Возможности распределены неравномерно, но open-source разработка помогает перераспределить участие.
Эксперты по ИИ и обычные люди смотрят на будущее технологии совершенно по-разному. Глобальное доверие к институтам, которые должны управлять ИИ, фрагментировано. Это создает проблему: технологию двигают те, кому общество не вполне доверяет.
Полный отчет (423 страницы): https://hai.stanford.edu/ai-index/2026-ai-index-report
Тред Luiza Jarovsky с кратким обзором: https://x.com/LuizaJarovsky/status/2044033970560512149
❤7👍2🔥2💩2
Совместное исследование Anthropic, британского AI Security Institute и Института Алана Тьюринга наделало шума. Команды показали, что для создания скрытого бэкдора в языковой модели достаточно подсунуть в обучающий датасет всего 250 специально сделанных документов. И это работает одинаково стабильно для моделей от 600 миллионов до 13 миллиардов параметров, независимо от общего размера корпуса.
Отравленные файлы выглядят как абсолютно обычные веб-страницы. Внутри спрятана триггерная фраза. Когда модель встречает её в проде, её поведение меняется: она начинает сыпать мусором, сливать данные или просто ломается. Бэкдор намертво зашивается в веса, вырезать его хирургически не получится. Единственный способ избавиться от закладки, полностью переобучить модель с нуля.
Цифры, которые пугают сильнее всего. 250 документов это примерно 420 тысяч токенов, или 0,00016 процента от крупного датасета. Сто документов работают нестабильно, но 250 дают надёжный результат. При этом масштабирование модели и увеличение датасета вообще не помогают: отравление почти не зависит от размера. Можно хоть триллион токенов насыпать, атака всё равно пройдёт.
Для индустрии это приговор текущей парадигме. Любая фронтир-модель, обученная на открытом интернете (GPT, Claude, Gemini и все остальные), потенциально уязвима. Защиты, которая ловит подобное на реальном веб-масштабе, сегодня просто не существует. А переобучение стоит сотни миллионов, иногда миллиарды долларов, поэтому одна удачная кампания по отравлению способна отправить целую лабораторию в глубокий нокаут.
Что предлагают исследователи и критики подхода скрапить всё подряд. Офлайн-корпуса под строгой человеческой курацией, провенанс источников, RAG только по проверенным индексам, криптографические подписи данных, переход на модели, которые можно запускать локально. Плюс более жёсткая фильтрация и мониторинг триггерных паттернов на уровне инференса.
Первоисточники: блог Anthropic https://www.anthropic.com/research/small-samples-poison, полная статья на arXiv https://arxiv.org/abs/2510.07192, анонс AISI https://www.aisi.gov.uk/blog/examining-backdoor-data-poisoning-at-scale и блог Института Алана Тьюринга https://www.turing.ac.uk/blog/llms-may-be-more-vulnerable-data-poisoning-we-thought.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍14❤8🔥6
Forwarded from Machinelearning
Anthropic убрала Claude Code из описания подписки Pro на странице тарифов.
Пользователи заметили это в 21 апреля, и уже через несколько часов компания объяснила, что речь идёт об эксперименте на небольшой группе новых пользователей, а не о массовом изменении плана.
Напротив Claude Code в колонке Pro теперь стоит крестик вместо галочки, а фраза о том, что инструмент входит в тариф, исчезла. При этом страница Claude Code и CLI-клиент по-прежнему показывают доступ для Pro, то есть правки внесены не везде, что и породило волнения в сети и путаницу.
Глава отдела развития Anthropic Амол Авасаре уточнил в X, что тест затрагивает около 2% новых регистраций и не касается действующих подписчиков Pro и Max.
По его словам, за год с запуска Max характер использования подписок изменился радикально: Claude Code встроили в Max, и он взлетел после релиза Opus 4, появился Cowork, а длительные асинхронные агенты стали повседневным сценарием. Под такую нагрузку текущие тарифы изначально не проектировались.
Anthropic уже несколько месяцев подряд закручивает гайки действуя по аналогии с тем, как энергокомпании снижают нагрузку на сеть. Причина банальна: стоимость подписки кратно ниже рыночной цены реально расходуемых токенов (по оценкам - иногда в 10 и более раз). С тем же дисбалансом уже столкнулись GitHub и Google.
На Reddit и в соцсетях подписчики восприняли эксперимент болезненно. Главная претензия, впрочем, не к самому изменению, а к коммуникации: правки на странице тарифов увидели все, хотя тест должен был затронуть лишь 2% пользователей.
Авасаре пообещал, что если эксперимент приведёт к пересмотру подписок для действующих клиентов, их уведомят заранее, "не скриншотом в X или на Reddit" (с).
Это сообщение он, впрочем, опубликовал именно в X.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2😁2
🐋 DeepSeek-V4 вышел и это просто монстр:
• 58 страниц технического отчёта
• 1.6 трлн параметров (самая большая открытая модель в истории)
• Контекст 1 миллион токенов
• Две новые техники внимания с грозными именами: HCA и CSA (звучит как спецназ, а не attention)
В 10 раз меньше KV-кэша, чем у V3.2.
Обучен на 32 трлн токенов, почти вдвое больше предыдущей версии.
И как вишенка: в этой же статье они походя стебут Claude за любовь к буллет-поинтам 💀
Китайцы буквально выкатили опенсорс-гигант и ещё успели потроллить Anthropic в сносках. Мультитаскинг уровня бог.
alphaxiv.org/abs/deepseek-v4
• 58 страниц технического отчёта
• 1.6 трлн параметров (самая большая открытая модель в истории)
• Контекст 1 миллион токенов
• Две новые техники внимания с грозными именами: HCA и CSA (звучит как спецназ, а не attention)
В 10 раз меньше KV-кэша, чем у V3.2.
Обучен на 32 трлн токенов, почти вдвое больше предыдущей версии.
И как вишенка: в этой же статье они походя стебут Claude за любовь к буллет-поинтам 💀
Китайцы буквально выкатили опенсорс-гигант и ещё успели потроллить Anthropic в сносках. Мультитаскинг уровня бог.
alphaxiv.org/abs/deepseek-v4
🔥11❤2😁1
Forwarded from AI VK Hub
Владимир Байкалов, ведущий исследователь в AI VK и коллеги из ИТМО выяснили, что наивное обновление Semantic ID в generative retrieval может ухудшить качество рекомендаций — и предложили способ это исправить. Статья принята в SIGIR '26.
Двустадийные GR-системы — в том числе OneRec и PLUM — работают так: сначала обучается токенизатор, который строит дискретные идентификаторы (Semantic ID) для каждого айтема по контентным признакам и коллаборативному сигналу из логов. Затем retriever учится генерировать эти идентификаторы по истории пользователя.
Коллаборативный сигнал дрейфует: меняются интересы пользователей, популярность айтемов, структура взаимодействий. Нужно периодически пересчитывать SID на свежих логах. Но пересчёт порождает новые токены, несовместимые с выученным выходным пространством ретривера.
Инженер оказывается перед выбором из двух плохих опций. Или оставить устаревшие SID и дообучать retriever на новых данных, но тогда коллаборативная семантика отстаёт от реального поведения. Или пересобрать SID и переобучить retriever с нуля, но это затратно по ресурсам.
Авторы предложили выравнивать SID и показали, что такой подход лучше существующих опций. Сравнение проводилось на примере 3 датасетов: Amazon Beauty, VK-LSVD и Yambda.
Предложенный подход выравнивает новые токены под старое пространство перед дообучением retrieval модели.
Для каждой позиции кодбука на пересечении айтемов из старой и новой токенизации строится матрица совстречаемости. По ней решается задача биективного матчинга с помощью жадного или венгерского алгоритма. Обновлённые SID отражают свежую коллаборативную структуру и совместимы с существующим чекпоинтом, поэтому retriever может быть дообучен на них с уменьшением дрейфа коллаборативного сигнала.
Без выравнивания пересчёт SID на новых логах работает нестабильно. Retriever вынужден одновременно адаптироваться к новым данным и переучивать маппинг между старым и новым пространством токенов. После выравнивания метрики на новых логах устойчиво растут, а вычислительные затраты сокращаются.
В эксперименте с тремя последовательными обновлениями подход с сохранением устаревших SID деградирует с каждым шагом, в то время как обновление с выравниванием держится на уровне полного переобучения.
Открытым остаётся вопрос динамического расширения словаря: как поведёт себя метод, когда в новых логах появляются айтемы, которых не было в старом кодбуке.
#обзорстатьи #AIVKResearch
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍1
Forwarded from Анализ данных (Data analysis)
DeepSeek оценили в $20 млрд: Tencent и Alibaba дерутся за место в раунде
Лаборатория, которая обучила модель уровня GPT‑4 за $6 млн, впервые пустила внешних инвесторов. За несколько дней оценка удвоилась и перевалила за $20 млрд. Tencent предложил забрать сразу 20%, DeepSeek отказал, но переговоры продолжаются. Alibaba тоже рвётся в сделку.
Почему вдруг открылись? Уходят ключевые инженеры. Го Дая, ведущий автор R1, ушёл в ByteDance. Ван Бинсюань забрал Tencent, Ло Фули переманили в Xiaomi. На балансе хедж‑фонда войну за таланты с гигантами не выиграть, нужны свежие деньги.
Дальше самое интересное.
Следующий флагман строят под чипы Huawei, и инженеры Huawei прямо сейчас сидят внутри процесса обучения и ловят баги стабильности. Если получится, Китай впервые выпустит фронтирную модель вообще без американского железа.
Китай уже прогоняет 140 триллионов токенов в день против 100 миллиардов в начале 2024 года. Рост больше чем в тысячу раз. И компания, которая обнулила всем представления о стоимости обучения, получает $300+ млн на масштабирование.
https://t.iss.one/data_analysis_ml/5036
Лаборатория, которая обучила модель уровня GPT‑4 за $6 млн, впервые пустила внешних инвесторов. За несколько дней оценка удвоилась и перевалила за $20 млрд. Tencent предложил забрать сразу 20%, DeepSeek отказал, но переговоры продолжаются. Alibaba тоже рвётся в сделку.
Почему вдруг открылись? Уходят ключевые инженеры. Го Дая, ведущий автор R1, ушёл в ByteDance. Ван Бинсюань забрал Tencent, Ло Фули переманили в Xiaomi. На балансе хедж‑фонда войну за таланты с гигантами не выиграть, нужны свежие деньги.
Дальше самое интересное.
Следующий флагман строят под чипы Huawei, и инженеры Huawei прямо сейчас сидят внутри процесса обучения и ловят баги стабильности. Если получится, Китай впервые выпустит фронтирную модель вообще без американского железа.
Китай уже прогоняет 140 триллионов токенов в день против 100 миллиардов в начале 2024 года. Рост больше чем в тысячу раз. И компания, которая обнулила всем представления о стоимости обучения, получает $300+ млн на масштабирование.
https://t.iss.one/data_analysis_ml/5036
❤5👍2
Оказалось, нейросети тайно болеют Японией
Свежая работа исследователей ломает удобный миф о том, что большие языковые модели смотрят на мир глазами белого американца. Если копнуть, выясняется странное: Claude, GPT и остальные тяжеловесы при любом удобном случае подсовывают пользователю Японию.
Спросишь про традиционные танцы, получишь бон-одори и кабуки. Спросишь, что люди едят каждый день, на тарелке окажутся суши и мисо. Даже когда речь про реки и поселения, в пример прилетает Тонэ. Дальше с большим отрывом идут США, Индия, Китай и Франция. Остальные страны будто стёрты ластиком.
На этапе предобучения, когда модель просто глотает интернет, перекоса нет. Японский крен появляется уже на файнтюне, когда модель учат быть вежливой и полезной. То есть виноваты не данные, а живые люди, которые её дообучают.
Логика тоже забавная. На английском в топе США, на китайском Китай, на русском своё. Но как только заходит речь про чужие страны, представителем «иностранного» почти всегда становится Япония.
Это культурный второй язык по умолчанию.
У моделей, которым мы доверяем объяснять мир, есть свои культурные любимчики, и берутся они не из сырых данных, а из человеческой разметки.
https://ai-data-base.com/paper/2604-21751
Свежая работа исследователей ломает удобный миф о том, что большие языковые модели смотрят на мир глазами белого американца. Если копнуть, выясняется странное: Claude, GPT и остальные тяжеловесы при любом удобном случае подсовывают пользователю Японию.
Спросишь про традиционные танцы, получишь бон-одори и кабуки. Спросишь, что люди едят каждый день, на тарелке окажутся суши и мисо. Даже когда речь про реки и поселения, в пример прилетает Тонэ. Дальше с большим отрывом идут США, Индия, Китай и Франция. Остальные страны будто стёрты ластиком.
На этапе предобучения, когда модель просто глотает интернет, перекоса нет. Японский крен появляется уже на файнтюне, когда модель учат быть вежливой и полезной. То есть виноваты не данные, а живые люди, которые её дообучают.
Логика тоже забавная. На английском в топе США, на китайском Китай, на русском своё. Но как только заходит речь про чужие страны, представителем «иностранного» почти всегда становится Япония.
Это культурный второй язык по умолчанию.
У моделей, которым мы доверяем объяснять мир, есть свои культурные любимчики, и берутся они не из сырых данных, а из человеческой разметки.
https://ai-data-base.com/paper/2604-21751
❤8👍5🔥4🤮1
Forwarded from Machinelearning
Японская лаборатория запустила бета-тестирование Sakana Fugu — своего первого международного коммерческого продукта.
Это система-оркестратор, которая динамически собирает команду из GPT-5, Gemini, Claude и опенсорсных моделей и распределяет между ними подзадачи.
В Conductor обучили 7B-модель через RL: на каждом шаге она решает, какого агента вызвать, какую подзадачу ему сформулировать и какие предыдущие сообщения передать в контекст. Говоря проще - мелкая модель работает мета-промпт-инженером для больших.
На простых вопросах Conductor отвечает за один проход, а на сложных задачах сам выстраивает цепочку "планировщик — исполнитель — верификатор".
Дополнительно метод способен делать рекурсивный самовызов: модель читает собственный инференс, определяет, что первая попытка провалилась, и запускает корректирующий рабочий процесс.
Сама по себе модель-дирижёр (которая на 7B) в тестах показал 83,9% на LiveCodeBench и 87,5% на GPQA-Diamond, обогнав не только модели из своего весового пула, но и мультиагентные бейзлайны Mixture-of-Agents (тут правда только по стоимости, но обогнала).
В коммерческой версии методы доработаны: fugu-ultra выбила 95,1% на GPQA Diamond (против 94,4% у Gemini 3.1 и 92,7% у Opus 4.6), 93,2% на LiveCodeBench v6 и 54,2% на SWE-Pro.
Доступ к Fugu через API, совместимый с форматом OpenAI. В линейке 2 модели: скоростная Fugu Mini для быстрых ответов и Fugu Ultra с полным пулом для тяжёлого ризонинга. Заявки на бета-тест уже принимаются.
Conductor и TRINITY приняты на ICLR 2026.
@ai_machinelearning_big_data
#AI #ML #LLM #Orchestration #FUGU #SakanaAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍2🔥1
Представьте: через четыре месяца вы открываете чужой .NET-проект и читаете его как книгу.
IServiceCollection не вызывает ступора.
async Task<IActionResult> пишется на автомате. Вы точно знаете, почему EF Core сгенерировал именно такой SQL - и как переписать запрос, чтобы он летал.Это не фантазия. Это результат после 16 модулей, в которых каждая концепция объясняется через код и закрепляется практикой.
ООП, SOLID, LINQ, async/await, DI, EF Core, ASP.NET Core, Docker, Kubernetes - всё, что казалось магией, станет рабочим инструментом.А бонусом - портфолио проектов: от CLI-утилит и REST API до собственного SaaS с multi-tenancy, JWT и деплоем в Kubernetes под TLS.
Скидка - 58% доступна 48 часов: https://stepik.org/a/282984/
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍1🔥1
Первая open-source end-to-end unified multimodal model.
SenseTime выпустила SenseNova-U1 - мультимодальную модель, которая объединяет понимание, рассуждение и генерацию в одной непрерывной системе.
Большинство мультимодальных моделей либо понимают изображения, либо генерируют изображения. Обычно это разные инструменты, сшитые вместе. SenseNova-U1 умеет делать и то, и другое нативно, в рамках одной архитектуры.
Главная инновация - архитектура NEO-Unify. Она убирает и visual encoder, и variational autoencoder. Всё происходит в едином пространстве представлений.
Что это открывает:
• Native interleaved reasoning - модель может генерировать изображения прямо в процессе рассуждения, а не через отдельные tool calls. То есть она способна решать задачи, создавая визуальные промежуточные шаги нативно.
• Сильная генерация инфографики - сложные PPT-слайды, постеры, диаграммы с высокой плотностью информации. Единое понимание и генерация делают модель особенно сильной в структурированных визуалах.
• SOTA-производительность - модель показывает state-of-the-art результаты среди open-source моделей как на benchmark’ах понимания, так и генерации.
Выпущены две модели:
• SenseNova-U1-8B-MoT - dense-модель на 8B параметров
• SenseNova-U1-A3B-MoT - MoE-модель на 38B параметров с 3B активных
Обе модели доступны в open source на GitHub и Hugging Face.
Почему это важно: современные мультимодальные системы часто используют adapters, чтобы переводить данные между разными модальностями. SenseNova-U1 работает с языком и зрением нативно. Понимание и генерация используют одно и то же пространство представлений.
Благодаря этому модель может понимать сложные визуальные материалы и генерировать структурированную инфографику без переключения между разными системами.
Модель полностью open source.
Model Weights: https://huggingface.co/collections/sensenova/sensenova-u1
Github Repo: https://github.com/OpenSenseNova/SenseNova-U1
SenseTime выпустила SenseNova-U1 - мультимодальную модель, которая объединяет понимание, рассуждение и генерацию в одной непрерывной системе.
Большинство мультимодальных моделей либо понимают изображения, либо генерируют изображения. Обычно это разные инструменты, сшитые вместе. SenseNova-U1 умеет делать и то, и другое нативно, в рамках одной архитектуры.
Главная инновация - архитектура NEO-Unify. Она убирает и visual encoder, и variational autoencoder. Всё происходит в едином пространстве представлений.
Что это открывает:
• Native interleaved reasoning - модель может генерировать изображения прямо в процессе рассуждения, а не через отдельные tool calls. То есть она способна решать задачи, создавая визуальные промежуточные шаги нативно.
• Сильная генерация инфографики - сложные PPT-слайды, постеры, диаграммы с высокой плотностью информации. Единое понимание и генерация делают модель особенно сильной в структурированных визуалах.
• SOTA-производительность - модель показывает state-of-the-art результаты среди open-source моделей как на benchmark’ах понимания, так и генерации.
Выпущены две модели:
• SenseNova-U1-8B-MoT - dense-модель на 8B параметров
• SenseNova-U1-A3B-MoT - MoE-модель на 38B параметров с 3B активных
Обе модели доступны в open source на GitHub и Hugging Face.
Почему это важно: современные мультимодальные системы часто используют adapters, чтобы переводить данные между разными модальностями. SenseNova-U1 работает с языком и зрением нативно. Понимание и генерация используют одно и то же пространство представлений.
Благодаря этому модель может понимать сложные визуальные материалы и генерировать структурированную инфографику без переключения между разными системами.
Модель полностью open source.
Model Weights: https://huggingface.co/collections/sensenova/sensenova-u1
Github Repo: https://github.com/OpenSenseNova/SenseNova-U1
❤8🔥2
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
Medium 3.5 - модель на 128 млрд параметров с контекстным окном 256K токенов. Веса опубликованы на Hugging Face под модифицированной лицензией MIT. Цена API - $1,50/$7,50 за млн. входящих/сгенерированных токенов.
Уровень рассуждений настраивается под каждый промпт. На SWE-Bench Verified модель набрала 77,6%, опередив Claude Sonnet 4.5.
Вместе с моделью Mistral представила Remote Agents в среде Vibe. Сессию рефакторинга или генерации кода, начатую локально, можно перенести в облако: агент дальше работает асинхронно в изолированной песочнице, ставит зависимости, вносит правки и создаёт PR.
Le Chat получил Work Mode для многошаговых задач: ассистент на базе Medium 3.5 разбирает почту, сверяется с календарём, заводит тикеты в Jira.
mistral.ai
Quick - десктопный ассистент, который работает в фоне, индексирует локальные файлы, календари и почту и подключается к Slack, Teams, Outlook, Gmail, Salesforce и Jira.
Он строит персональный граф знаний пользователя: запоминает предпочтения, контакты в команде и бизнес-контекст между сессиями. Параллельно отслеживает активность в приложениях и подтягивает документы к встречам, напоминает о задачах и предупреждает о конфликтах в расписании.
В релизе: генерация приложений, дашбордов и веб-страниц по текстовым запросам, а также создание документов, презентаций, инфографики и изображений прямо в чате. Плюс браузерная автоматизация и интеграция с Kiro CLI и Claude Code.
Quick доступен в 2 тарифах - бесплатном и Plus.
aboutamazon.com
Exa получила 2 канала интеграции с Gemini: Grounding with Exa в Vertex AI (пока в режиме превью) и Exa Agent на маркетплейсе агентов в Gemini Enterprise.
Grounding with Exa подключает Gemini к публичному вебу через API Exa. Модель Highlights отбирает из страниц релевантные фрагменты и отдаёт их в контекст вместо сырого HTML- это снижает шум на задачах, где важна свежесть данных или фактическая точность.
Exa Agent работает из рабочего пространства Gemini: ресерч по вебу, поиск похожих страниц, вытягивание контента по URL. Установка - через каталог агентов, без кода.
exa.ai
Акс Шарма из Manifold обнаружил на платформе ClawHub кампанию ClawSwarm: 30 скиллов для OpenClaw превращали ИИ-агентов в криптовалютный ботнет. Суммарно расширения скачали около 10 тысяч раз.
Вредоносная логика лежит в инструкциях файлов SKILL.md: агент в фоне регистрируется на стороннем сервере, передаёт список своих возможностей, создаёт криптокошелёк в сети Hedera и отправляет управляющему узлу приватный ключ. Каждые 4 часа агент опрашивает сервер за новыми задачами по фармингу токенов.
Сканеры безопасности угрозу не ловят: скрипты делают чистые запросы и используют официальные SDK, да и атака сводится к злоупотреблению логикой ИИ, а не к программному взлому.
theregister.com
ElevenLabs запустила площадку ElevenMusic, где стриминг совмещён с генерацией треков. На бесплатном тарифе доступно 7 генераций в день, подписка за $9,99 в месяц поднимает лимит до 500 композиций.
Треки можно публиковать и слушать только внутри сервиса. Для использования в играх, рекламе и других внешних продуктах нужен тариф ElevenCreative Music.
На старте в каталоге работы более 4000 авторов. Слушатель может менять темп или жанр любого трека из библиотеки и собирать собственные композиции по текстовым промптам.
Платформа платит авторам за прослушивания оригиналов и ремиксов - та же механика, что в библиотеке голосов ElevenLabs, где создатели моделей суммарно получили более $11 млн.
elevenlabs.io
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍1🔥1
Anthropic показала исследование, где Claude смог решать реальные задачи по биоинформатике, с которыми не справились люди-эксперты.
Речь не про школьные тесты по биологии и не про аккуратные вопросы с очевидным ответом. Проблема старых научных бенчмарков в том, что они часто проверяют «чистые» задания, а не грязную работу с настоящими биологическими датасетами.
Для этого Anthropic сделала BioMysteryBench. В нём правильные ответы спрятаны внутри реальных датасетов, а оценивается только финальный результат. Claude получает стандартные инструменты биологии и доступ к базам данных, а параллельно те же задачи пробуют решать до пяти экспертов.
Всего было 99 задач. На 76 задачах, которые смог решить хотя бы один эксперт, лучшая модель набрала около 83%. Но самое интересное - 23 задачи оказались «human-difficult»: экспертная панель не смогла их решить. На этом наборе Claude Mythos Preview решил 29.6%.
Правда, есть важная оговорка. На самых сложных задачах успехи были менее стабильными при пяти повторных попытках. То есть часть побед выглядела не как надёжное мастерство, а как удачная попытка.
Claude начинает быть похож на очень быстрого исследовательского напарника: комбинирует методы, перепроверяет факты, использует широкий фон знаний и помогает быстрее сузить пространство поиска.
https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench
Речь не про школьные тесты по биологии и не про аккуратные вопросы с очевидным ответом. Проблема старых научных бенчмарков в том, что они часто проверяют «чистые» задания, а не грязную работу с настоящими биологическими датасетами.
Для этого Anthropic сделала BioMysteryBench. В нём правильные ответы спрятаны внутри реальных датасетов, а оценивается только финальный результат. Claude получает стандартные инструменты биологии и доступ к базам данных, а параллельно те же задачи пробуют решать до пяти экспертов.
Всего было 99 задач. На 76 задачах, которые смог решить хотя бы один эксперт, лучшая модель набрала около 83%. Но самое интересное - 23 задачи оказались «human-difficult»: экспертная панель не смогла их решить. На этом наборе Claude Mythos Preview решил 29.6%.
Правда, есть важная оговорка. На самых сложных задачах успехи были менее стабильными при пяти повторных попытках. То есть часть побед выглядела не как надёжное мастерство, а как удачная попытка.
Claude начинает быть похож на очень быстрого исследовательского напарника: комбинирует методы, перепроверяет факты, использует широкий фон знаний и помогает быстрее сузить пространство поиска.
https://www.anthropic.com/research/Evaluating-Claude-For-Bioinformatics-With-BioMysteryBench
❤6👍5
⚡️ Vibe coding разбился о реальную разработку
Новое исследование UC San Diego и Cornell посмотрело, как 112 опытных разработчиков используют AI-агентов в настоящей работе, а не в демо для X.
Вывод простой: профессионалы не «вайбкодят». Они не кидают агенту мутный промпт, не закрывают глаза на diff и не ждут, что модель сама соберёт production-систему.
Они делают наоборот.
Сначала описывают архитектуру, ограничения и крайние случаи. Потом дают агенту маленькую, хорошо очерченную задачу. После генерации читают diff, проверяют логику и не дают модели трогать больше, чем нужно.
То есть AI-агент в руках сильного разработчика - это не автономный senior. Это быстрый junior, который хорошо делает рутину, но требует контроля.
Самое интересное начинается на сложных задачах. Как только работа задевает несколько систем, требует продуктовых решений или имеет неясные требования, опытные разработчики забирают управление обратно. Не потому что они против AI, а потому что знают цену невнимательно принятого кода.
В статье также приводятся жёсткие цифры из других работ: в одном эксперименте опытные open-source maintainers стали на 19% медленнее с AI, а реальная агентная система в issue tracker довела до merge только 8% запусков.
Это не приговор AI-кодингу. Это приговор сказке про «не думай, просто доверься агенту».
AI ускоряет разработку там, где у человека уже есть сильная инженерная рамка: ясная постановка задачи, ограниченный контекст, понятные критерии качества и обязательное ревью.
Поэтому главный навык ближайших лет - не vibe coding, а control coding.
Не «пусть модель пишет всё».
А «пусть модель быстро делает кусок работы, который я понимаю, ограничиваю и проверяю».
Красивые демо продают ощущение магии. Хороший софт всё ещё делают через контроль, ответственность и чтение diff.
https://arxiv.org/abs/2512.14012
Новое исследование UC San Diego и Cornell посмотрело, как 112 опытных разработчиков используют AI-агентов в настоящей работе, а не в демо для X.
Вывод простой: профессионалы не «вайбкодят». Они не кидают агенту мутный промпт, не закрывают глаза на diff и не ждут, что модель сама соберёт production-систему.
Они делают наоборот.
Сначала описывают архитектуру, ограничения и крайние случаи. Потом дают агенту маленькую, хорошо очерченную задачу. После генерации читают diff, проверяют логику и не дают модели трогать больше, чем нужно.
То есть AI-агент в руках сильного разработчика - это не автономный senior. Это быстрый junior, который хорошо делает рутину, но требует контроля.
Самое интересное начинается на сложных задачах. Как только работа задевает несколько систем, требует продуктовых решений или имеет неясные требования, опытные разработчики забирают управление обратно. Не потому что они против AI, а потому что знают цену невнимательно принятого кода.
В статье также приводятся жёсткие цифры из других работ: в одном эксперименте опытные open-source maintainers стали на 19% медленнее с AI, а реальная агентная система в issue tracker довела до merge только 8% запусков.
Это не приговор AI-кодингу. Это приговор сказке про «не думай, просто доверься агенту».
AI ускоряет разработку там, где у человека уже есть сильная инженерная рамка: ясная постановка задачи, ограниченный контекст, понятные критерии качества и обязательное ревью.
Поэтому главный навык ближайших лет - не vibe coding, а control coding.
Не «пусть модель пишет всё».
А «пусть модель быстро делает кусок работы, который я понимаю, ограничиваю и проверяю».
Красивые демо продают ощущение магии. Хороший софт всё ещё делают через контроль, ответственность и чтение diff.
https://arxiv.org/abs/2512.14012
👍21❤13🥰3👎1
project_final_v2_FINAL_truly_final - знакомо?
Значит, пора.
Большинство разработчиков знают 5 команд Git и боятся шестую. Коммитят в main, гуглят «how to undo» и копируют папку «на всякий случай».
Это не работа - это выживание.
После курса вы:
— делаете rebase, не задерживая дыхание;
— разбираете конфликт на 200 файлов по алгоритму;
— возвращаете «потерянные навсегда» коммиты за 30 секунд через reflog;
— пишете историю, которую не стыдно показать на code review.
Git Flow, trunk-based, Pull Request, защита веток, CI/CD-хуки - всё, что отличает джуна от senior в командной работе.
Скидка 53%, 48 часов: https://stepik.org/course/284799/
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍2😁2👎1🔥1
🦀 Rust против C в embedded - не на словах, а в реальном тесте.
Исследователи взяли промышленное IoT-железо и запустили на нём две реализации одной и той же функциональности.
Одна команда писала на C.
Другая - на Rust.
Системы работали параллельно несколько месяцев в реальных условиях, а не в синтетическом бенчмарке.
Итог оказался неприятным для старого аргумента «для embedded нужен только C».
Rust не проиграл C ни по памяти, ни по скорости выполнения. Более того, runtime на Ariel OS оказался даже компактнее, чем классический bare-metal стек на C.
Вывод простой: аргумент «C быстрее и легче для прошивок» теперь звучит гораздо слабее.
Rust в embedded - это вполне рабочая альтернатива.
🔗 Подоробности: https://arxiv.org/abs/2604.25679
#Rust #RustLang #EmbeddedSystems #IoT #SystemsProgramming #C
Исследователи взяли промышленное IoT-железо и запустили на нём две реализации одной и той же функциональности.
Одна команда писала на C.
Другая - на Rust.
Системы работали параллельно несколько месяцев в реальных условиях, а не в синтетическом бенчмарке.
Итог оказался неприятным для старого аргумента «для embedded нужен только C».
Rust не проиграл C ни по памяти, ни по скорости выполнения. Более того, runtime на Ariel OS оказался даже компактнее, чем классический bare-metal стек на C.
Вывод простой: аргумент «C быстрее и легче для прошивок» теперь звучит гораздо слабее.
Rust в embedded - это вполне рабочая альтернатива.
🔗 Подоробности: https://arxiv.org/abs/2604.25679
#Rust #RustLang #EmbeddedSystems #IoT #SystemsProgramming #C
❤9👍3🔥1😁1😱1
OpenAI запускает OpenAI Deployment Company - отдельную deployment-компанию для внедрения AI в корпорации.
В официальном анонсе всё выглядит спокойно: больше $4 млрд стартовых инвестиций, majority control у OpenAI, партнёры из private equity, консалтинга и системной интеграции, плюс покупка Tomoro, чтобы сразу получить команду примерно из 150 AI deployment-специалистов.
Axios пишет, что у инвесторов есть условия, которых нет в официальном анонсе: гарантированный минимальный возврат 17.5% и capped profits. То есть снизу доходность защищена, сверху прибыль ограничена.
И вот тут история становится намного интереснее.
OpenAI получает не просто деньги. Она получает доступ к портфелям private equity-фондов, а это тысячи компаний, куда можно заносить AI не через холодные продажи, а через уже существующих владельцев и совет директоров.
Схема выглядит так:
- private equity даёт капитал
- OpenAI даёт модели, инженеров и deployment-практику
- портфельные компании становятся каналом внедрения
- инвесторы получают понятную финансовую конструкцию
- OpenAI получает enterprise-дистрибуцию, которую нельзя быстро скопировать одним API
Frontier labs уже не хватает просто выпустить сильную модель и ждать, что бизнес сам всё встроит. Настоящие деньги будут там, где модель подключена к данным, процессам, безопасности, продажам, операционке и внутренним системам комп
Продуктом становится внедрение.
И OpenAI, похоже, строит свою версию Palantir-стиля: forward-deployed engineers, работа внутри клиента, AI как операционная перестройка, а не как подписка на чатик.
Поэтому за этой структурой стоит следить. Не из-за красивой цифры $4 млрд, а потому что frontier labs начинают использовать private equity одновременно как источник капитала и как канал распространения.
https://www.axios.com/2026/05/11/openai-deployco-private-equity
В официальном анонсе всё выглядит спокойно: больше $4 млрд стартовых инвестиций, majority control у OpenAI, партнёры из private equity, консалтинга и системной интеграции, плюс покупка Tomoro, чтобы сразу получить команду примерно из 150 AI deployment-специалистов.
Axios пишет, что у инвесторов есть условия, которых нет в официальном анонсе: гарантированный минимальный возврат 17.5% и capped profits. То есть снизу доходность защищена, сверху прибыль ограничена.
И вот тут история становится намного интереснее.
OpenAI получает не просто деньги. Она получает доступ к портфелям private equity-фондов, а это тысячи компаний, куда можно заносить AI не через холодные продажи, а через уже существующих владельцев и совет директоров.
Схема выглядит так:
- private equity даёт капитал
- OpenAI даёт модели, инженеров и deployment-практику
- портфельные компании становятся каналом внедрения
- инвесторы получают понятную финансовую конструкцию
- OpenAI получает enterprise-дистрибуцию, которую нельзя быстро скопировать одним API
Frontier labs уже не хватает просто выпустить сильную модель и ждать, что бизнес сам всё встроит. Настоящие деньги будут там, где модель подключена к данным, процессам, безопасности, продажам, операционке и внутренним системам комп
Продуктом становится внедрение.
И OpenAI, похоже, строит свою версию Palantir-стиля: forward-deployed engineers, работа внутри клиента, AI как операционная перестройка, а не как подписка на чатик.
Поэтому за этой структурой стоит следить. Не из-за красивой цифры $4 млрд, а потому что frontier labs начинают использовать private equity одновременно как источник капитала и как канал распространения.
https://www.axios.com/2026/05/11/openai-deployco-private-equity
❤4