Машинное обучение digest
55 subscribers
3.79K photos
611 videos
2.31K links
Download Telegram
Что такое Claude Skills

Файл CLAUDE.md изначально не задумывался как место для хранения целых процессов. Но на практике туда начинают складывать всё подряд - общие правила, кодстайл, длинные чек-листы безопасности, пайплайны деплоя. В итоге один файл грузится в каждую сессию и съедает контекст даже тогда, когда Claude просто переименовывает переменную.

Показываю как профессионально работать с Claude и другими ИИ у себя в телеге!

Skills решают эту проблему. Они превращают процессы в отдельные модули, которые подгружаются только тогда, когда действительно нужны.

Идея простая. Skill - это папка внутри .claude/skills/. Внутри лежит файл SKILL.md, в котором есть две ключевые части: описание и сам процесс. Описание говорит модели, когда этот скилл нужно активировать. Инструкции объясняют, что именно делать.

Описание по сути становится триггером. Claude читает все доступные описания, следит за диалогом и, когда запрос совпадает по смыслу, автоматически подтягивает нужный скилл. Ничего вставлять вручную не нужно. Не нужны команды. Модель сама понимает намерение и включает нужный процесс. Если хочется контроля - любой скилл можно вызвать явно через slash-команду вроде /security-review.

Но автозапуск - это только верхний слой. Основная сила в том, что скиллы - это не просто инструкции, а полноценные пакеты.

SKILL.md может ссылаться на дополнительные файлы рядом с ним через @. Это могут быть стандарты безопасности, шаблоны релиз-нотов, чек-листы соответствия - всё, что нужно для конкретного процесса. Скилл упаковывает весь контекст в одном месте.

Внутри SKILL.md через YAML задаются имя, описание и доступ к инструментам. Последнее особенно важно. Например, скиллу для security review достаточно Read, Grep и Glob. Ему не нужно право на запись. Ограничение инструментов делает поведение предсказуемым и снижает риски.

Скиллы существуют на двух уровнях. Проектные лежат в .claude/skills/ и коммитятся в репозиторий, чтобы команда работала с одинаковыми процессами. Персональные находятся в ~/.claude/skills/ и переиспользуются между проектами.

Если в CLAUDE.md зашит длинный процесс из 20 шагов, он будет мешать в большинстве сессий. Тот же процесс, оформленный как отдельный скилл и активирующийся только по необходимости, работает точечно и не перегружает контекст.

В итоге роли разделяются. CLAUDE.md отвечает за правила и поведение. Skills - за выполнение конкретных процессов.

Ниже - подробный разбор всей системы: CLAUDE.md, хуки, skills, агенты и права доступа, и как это всё правильно собрать в рабочую конфигурацию.
This media is not supported in your browser
VIEW IN TELEGRAM
Жесть, DOOM запустили на…CSS 😱

— Всё что выводится на экран, включая спрайты, стены, уровни и эффекты, оформлено через <div>;
— 3D-пространство держится на CSS transform и preserve-3d;
— JavaScript используется только для игровой логики.

Когда в следующий раз скажут, что CSS может только «кнопки красить», покажите это 💪

@xor_journal
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ Самую ОПАСНУЮ нейронку выложили в сеть — из Qwen3.5-9B-Uncensored-HauhauCS с пометкой Agressive полностью ВЫДРАЛИ цензуру и выкрутили честность на максимум.

Оцените масштаб:

• У модели осталось 0 из 465 отказов по любой теме: у неё ВООБЩЕ отсутствуют рамки безопасности и приличия!
• Пометка Agressive обозначает агрессивное удаление цензуры: модель НЕ МОЖЕТ вам отказать ни в чём — и обязана выполнить задачу на 100%.
• Модель буквально захватывает ИИ-мир, у неё уже 5️⃣0️⃣0️⃣ тысяч скачиваний за месяц — её расчехляют тогда, когда другие ИИ отказываются отвечать.
Выдаст ВСЁ: от рецептов оружия до жёсткого секстинга без ограничений, Qwen3.5 способен на такое, чего вы не будете ожидать.
• Также идеальна для разрабов, которые хотят получить СЫРУЮ МОЩЬ нейронок БЕЗ ограничений и лимитов.
• Весит от 5 до 17 Гб и отлично оптимизирована, мультимодальна (работает с текстом/фото/видео) и понимает 201 язык.

😶😶😶😶😶😶😶😶😶

Используем очень осторожно — здесь.

👍 Бэкдор
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡️ Claude Code на максималках: 32 агента, скорость в 5 раз выше, ноль новых инструментов

Нашли интересный open source проект oh-my-claudecode. Это надстройка, которая превращает Claude Code в мультиагентную систему с разными режимами выполнения.

Есть полный автопилот, есть режим с параллельными агентами, есть последовательные пайплайны и даже режим экономии токенов. Внутри 32 агента под разные задачи от архитектуры до тестирования.

Самое удобное это управление через ключевые слова. Пишешь autopilot и он делает все сам. Пишешь ralph и он не остановится, пока не доведет задачу до конца.

Еще одна важная вещь это авто-возобновление после ограничений по запросам. Не нужно следить за процессом и перезапускать вручную.

По ощущениям это уже не просто ассистент, а полноценная система разработки поверх Claude Code.

GitHub: https://github.com/Yeachan-Heo/oh-my-claudecode

🐍 полезные ресурсы 🚀Max

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
✔️ Xiaomi показала обновленную бионическую руку для робота CyberOne.

Рука уменьшена в размерах на 60% и теперь практически совпадает по габаритам с ладонью взрослого человека.

Это не вопрос эстетики: при обучении робота через телеуправление оператором-человеком несовпадение пропорций приводит к деградации обучающих данных. Инженеры называют это «проблемой изоморфизма» и Xiaomi говорит, что решила ее.


Число активных степеней свободы выросло до 22–27, что на 83% больше, чем у предыдущей версии.

Площадь тактильных сенсоров, покрывающих ладонь, подушечки и фаланги пальцев стала 8200 мм².

Увеличение площади дает возможность манипулировать объектами на ощупь, без опоры на компьютерное зрение: робот может закручивать винты и удерживать перо, не повредив его.


Для сбора обучающих данных Xiaomi использует тактильные перчатки. Оператор выполняет действия руками, а система в реальном времени записывает данные о захвате и передает их собственным ИИ-моделям компании.

Предыдущие версии руки выходили из строя менее чем за 10 тыс. циклов захвата из-за износа компонентов. Новая конструкция прошла 150 тыс циклов ( это примерно 61 час непрерывной работы).

Фишка апдейта - бионические потовые железы.


Система микронасосов испаряет жидкость через каналы охлаждения, изготовленные с помощью передовых производственных технологий, и рассеивает около 10 Вт тепла.

Принцип заимствован у человеческого тела: испарение отводит тепло от встроенных моторов и предотвращает перегрев компактного корпуса при длительных силовых захватах.


Ранее Xiaomi продемонстрировала работу робота на реальной автомобильной сборочной линии - 3 часа непрерывной работы с показателем успешности 90,2%. Обновленная рука рассчитана на то, чтобы довести эту цифру до 99,9%.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🧠 Когда ИИ “тупит” - он буквально сжимает свой мозг

Есть наблюдение, которое меняет взгляд на то, как думают LLM.

Когда модель уверена - она “думает широко”.
Активно много нейронов, сигнал распределён, знания подтягиваются из разных мест. Это похоже на опытного инженера, который держит в голове несколько решений одновременно.

Но стоит задать что-то нестандартное - сложную математику, противоречивые факты или просто out-of-distribution вопрос - происходит неожиданное.

Модель резко “сжимается”.

Вместо широкой активации остаётся узкий, почти точечный сигнал в последнем слое.
Как будто система перестаёт опираться на накопленный опыт и пытается выжать ответ из минимального набора признаков.

Фактически - она теряет распределённую память и уходит в узкую специализацию на лету.

И вот здесь самое интересное.

Мы обычно не понимаем, что модель “поплыла”, пока не получаем неправильный ответ.
Но оказывается - она сама сигналит об этом внутри.

Этот “коллапс активации” можно измерить как конкретное число.
Не эвристика, не guesswork - прямой сигнал.

А значит:

можно в реальном времени понимать, что задача для модели сейчас слишком сложная
можно автоматически упрощать запрос
можно добавлять промежуточные шаги
можно управлять reasoning, а не просто надеяться на него

По сути, это шаг к self-aware inference - когда система сама знает, что не справляется.

И это уже не про “сделаем модель больше”.
Это про управление мышлением модели в процессе.

Если коротко - LLM не просто ошибается.
Она сначала “схлопывается”, и только потом начинает нести чушь.

arxiv.org/abs/2603.03415

🐍 полезные ресурсы 🚀Max
This media is not supported in your browser
VIEW IN TELEGRAM
🌟 Transformers.js v4 вышел и теперь нейросети реально можно запускать прямо в браузере

Без серверов, без API, без костылей. Просто открываешь страницу и модель уже работает у пользователя на устройстве.

Главное изменение в том, что WebML наконец перестал быть игрушкой. Производительность выросла, задержки снизились, и часть задач теперь можно спокойно уносить на клиент.

Что это даёт на практике

Фронтенд начинает забирать кусок AI на себя
Меньше расходов на инфру и запросы к API
Лучше приватность, данные не уходят на сервер
Можно делать офлайн-фичи с ИИ прямо в браузере

Если коротко, браузер превращается в полноценную AI-платформу. И это только начало.

Blog post: https://huggingface.co/blog/transformersjs-v4
Release notes: https://github.com/huggingface/transformers.js/releases/tag/4.0.0
Demos: https://huggingface.co/collections/webml-community/transformersjs-v4-demos
LongCat-AudioDiT - новая SOTA диффузионная TTS-модель от Meituan.

Модель генерирует речт напрямую в латентном пространстве аудиоволн (waveform latent space), без авторегрессии → меньше накапливаемых ошибок.
Ключевое:

Архитектура: Wav-VAE + Diffusion
Размеры: 1B и 3.5B параметров
Языки: китайский + английский
SOTA по клонированию голоса (SIM: 0.818 / 0.797 на Seed-ZH / Seed-Hard)
Алгоритм APG вместо CFG — лучшее качество и естественность звука
Решена проблема несоответствия обучения и инференса в диффузионных TTS

Неочевидный вывод: лучший VAE ≠ лучший TTS

📄 Tech Report: https://github.com/meituan-longcat/LongCat-AudioDiT/blob/main/LongCat-AudioDiT.pdf
🐙 GitHub: https://github.com/meituan-longcat/LongCat-AudioDiT
🤗 Hugging Face: https://huggingface.co/meituan-longcat/LongCat-AudioDiT-3.5B
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 Компания Z.ai (создатели моделей GLM) выпустили AutoClaw - инструмент, который позволяет запускать OpenClaw локально, без интернета и без API-ключей.

OpenClaw - это ИИ-агент, который умеет выполнять многошаговые задачи и использовать инструменты (например, подключаться к Slack, Telegram, Discord, WhatsApp и другим сервисам).

В чем плюсы AutoClaw:
• Скачал - запустил. Никаких API-ключей не нужно
• Можно использовать любую модель или встроенную GLM-5-Turbo, заточенную под работу с инструментами и сложными задачами
• Полностью локально, твои данные никуда не уходят

По сути, это локальный аналог таких агентов, как Cursor или Operator, но работающий целиком на твоей машине, без слежки и без подписок.

AutoClaw: https://autoglm.z.ai/autoclaw/
Discord: https://discord.gg/jvrbCRSF3x

@ai_machinelearning_big_data
This media is not supported in your browser
VIEW IN TELEGRAM
🔥 Microsoft Critique: deep research на стероидах, где одна модель генерирует, а вторая её критикует

Microsoft выкатили Critique. Это инструмент для deep research, который одновременно запускает несколько моделей на один запрос.

Работает так: первая модель берёт на себя генерацию, вторая выступает рецензентом и вычищает ошибки и неточности до того, как вы увидите финальный ответ. Какие именно модели работали над ответом, видно в шапке.

По бенчмарку DRACO показывают SOTA, других замеров пока нет. Так что насколько это реально лучше обычного deep research, вопрос открытый.

Отдельно интересен режим Council для обычных запросов. Ваш промпт прогоняется через несколько моделей параллельно, и вы видите все варианты сразу. Плюс краткая выжимка: где модели согласны, а где разошлись во мнениях.

На широкую аудиторию пока не раскатили, можно подать заявку на ранний доступ. Будет ли это в обычной подписке за $20, неизвестно. Хотя, если честно, мультимодельный пайплайн с критиком можно собрать самому за вечер через API. И точно выйдет дешевле.

techcommunity.microsoft.com/blog/microsoft365copilotblog/introducing-multi-model-intelligence-in-researcher/4506011
☠️ Новая атака на цепочку поставок — на этот раз затронут npm-пакет axios, самый популярный HTTP-клиент с ~300 млн загрузок в неделю.

Уязвимость проявляется через зависимости: в одном из кейсов пакет подтянулся через googleworkspace/cli, использовавшийся для работы с Gmail и Google Calendar. При этом установленная версия оказалась безопасной — 1.13.5. Однако зависимость не была зафиксирована (unpinned), и при установке в другое время могла подтянуться уже заражённая версия.

Это ключевая проблема всей экосистемы: если версии не закреплены, сборка может в любой момент «подхватить» компрометированный релиз.

Частично защититься можно локальными мерами — например:
ограничивать минимальный «возраст» релизов, использовать контейнеры, проверять зависимости.

Но системно проблему должны решать сами пакетные менеджеры (pip, npm и др.), меняя дефолтное поведение. Иначе одна заражённая версия, даже если её быстро находят и удаляют, успевает разойтись по тысячам проектов через незакреплённые зависимости.

Подробный разбор:
https://stepsecurity.io/blog/axios-compromised-on-npm-malicious-versions-drop-remote-access-trojan
Please open Telegram to view this post
VIEW IN TELEGRAM
📌 Claude Code: подборка полезных материалов, чтобы стать ПРО.

Видео, репозитории, документация и книги. Без шума. Без мусора. Всё в одном месте.

🗂 Репозитории

Claude Code (официальный)
https://github.com/anthropics/claude-code
Claude Cookbooks
https://github.com/anthropics/claude-cookbooks
Ultimate Guide по Claude Code
https://github.com/FlorianBruhinux/claude-code-ultimate-guide
Подборка лучших плагинов Claude
https://github.com/quemsah/awesome-claude-plugins
Лучшие репозитории по Claude Code
https://mejba.me/locale/en?next=%2Fblog%2Fbest-github-repos-claude-code

📚 Гайды и документация

Обзор документации Claude Code
https://code.claude.com/docs/en/overview
Claude Code Handbook (freeCodeCamp)
https://freecodecamp.org/news/claude-code-handbook/
Полный гайд по Claude Code (2026)
https://claude-world.com/articles/claude-code-complete-guide-2026/
Практическое руководство по Claude Code
https://evakeiffenheim.substack.com/p/a-clear-guide-to-claude-code-for
Гайд для новичков по Claude Code
https://nxcode.io/resources/news/claude-code-tutorial-beginners-guide-2026

🎥 Видео

Полный гайд по Claude Code для новичков (2026)
https://youtube.com/watch?v=qYqIhX9hTQk
Полный курс по Claude Code — создание и монетизация (4 часа)
https://youtube.com/watch?v=QoQBzR1NlqI
Освой Claude Code за 30 минут
https://youtube.com/watch?v=6eBSHbLKuN0
Освой 95% навыков Claude Code за 28 минут
https://youtube.com/watch?v=zKBPwDpBfhs
Плейлист по Claude Code (от новичка до продвинутого)
https://youtube.com/playlist?list=PL4HikwTaYE0ETMaJqnNvm_2I3NEbexMDZ
Топ-6 советов для эффективной работы с Claude Code
https://youtube.com/watch?v=WwdlYp5fuxY

📖 Книги

Mastering Claude AI — практический путь
https://amazon.com/Mastering-Claude-AI-Practical-Journey/dp/B0FLJEY8BD
AI Engineering — Chip Huyen
https://amazon.com/AI-Engineering-Building-Applications-Foundation/dp/B0F3ZZTKG5
Claude Code Lab — production AI-приложения
https://books.google.com/books/about/Claude_Code_Lab.html?id=EOng0QEACAAJ

Сохрани - пригодится.
Поделись с коллегой и ускоришь кому-то путь в Claude Code.)
Please open Telegram to view this post
VIEW IN TELEGRAM
Дуров раскритиковал Apple за удаление VPN-сервисов из российского App Store

Дуров против Apple
Apple удалила из российского App Store ряд VPN-приложений — в первую очередь тех, которые позволяли пользователям обходить интернет-цензуру под предлогом защиты персональных данных. Дуров жёстко осудил это решение: по его словам, компания фактически выступает инструментом ограничения свободы слова.
Microsoft превратила Copilot Researcher в систему из двух моделей: OpenAI отвечает за драфт, Anthropic за аудит.

Проблема одной модели в том, что ей приходится одновременно планировать, искать, писать и проверять саму себя. Именно поэтому бизнес сомневается в таких отчётах: выглядят аккуратно, но могут опираться на слабые или непроверенные данные.

Подход Critique разделяет роли. Одна модель исследует и пишет, другая проверяет источники, полноту и фактическую обоснованность перед финальной отправкой отчёта.

На бенчмарке DRACO (100 задач, 10 доменов, оценка через GPT-5.2) система набрала 57.4 балла. Это на 13.88% выше лучшего результата из исследования.

Основной прирост в ширине и глубине анализа, качестве подачи и точности фактов. Логично, потому что отдельная модель-ревьюер заточена на поиск пробелов, слабых аргументов и сомнительных источников.

Главное здесь не «две модели лучше одной», а разделение ролей. Каждая модель делает свою узкую задачу, вместо попытки одной системы быть исследователем, автором, редактором и фактчекером одновременно.

И это уже не столько исследовательский прорыв, сколько продуктовый ход. Microsoft продаёт не просто ИИ, а проверенные отчёты. Бизнесу важнее не бенчмарки, а возможность доверять результату и использовать его в работе.

https://x.com/satyanadella/status/2038604619795042716
This media is not supported in your browser
VIEW IN TELEGRAM
Claude теперь управляет твоим компьютером и превращается в полноценного end-to-end разработчика.

Он не просто пишет код:

- сам генерирует приложение
- сам запускает его
- кликает по интерфейсу как пользователь
- находит баги
- сам же их фиксит и улучшает продукт

И всё это за часы.

Включается через /mcp.

Раньше было так: Claude написал код → ты запускаешь → даёшь фидбек → он правит.

Теперь этот цикл исчез.

Всё происходит в одном непрерывном процессе прямо в терминале.

Без переключений. Без ручной проверки.

Инструмент доступен в режиме research preview на тарифах Pro и Max.

https://code.claude.com/docs/en/computer-use
У DeepSeek сбой. За час поступило 3900 жалоб. И почти все из России.

Надеемся, это не связано с возможными блокировками зарубежных нейронок.

@typespace
Папка .claude: полный разбор того, что внутри

Большинство разработчиков, работающих с Claude Code, смотрят на папку .claude как на черный ящик. Знают, что она есть. Видели, как она появляется в корне проекта. Но никогда не открывали и уж точно не понимали, что там лежит и зачем.

А зря. Папка .claude – это центр управления поведением Claude в вашем проекте. Здесь хранятся инструкции, кастомные команды, правила доступа и даже память модели между сессиями. Разберемся с каждым файлом и папкой по порядку.

https://uproger.com/papka-claude-polnyj-razbor-togo-chto-vnutri/
📌Нейроанатомия LLM: улучшаем модель без дообучения.

Дэвид Ноэль, независимый исследователь из Мюнхена, в середине 2024 года занял 1 место на HuggingFace Open LLM Leaderboard методом, который не требует ни новых данных, ни файнтюна.

Он взял 80-слойную Qwen2-72B, продублировал блок из 7 средних слоёв (45–51) и получил модель RYS-XLarge, где каждый добавленный параметр - копия уже существующего. На 5 из 6 бенчмарков лидерборда результаты выросли: MuSR прибавил 17,7%, MATH - 8,2%.

Позже ByteDance предложила Looped Language Models (ноябрь 2025), но Дэвид пришёл к своим выводам независимо на основе 2 наблюдений:

LLM способны вести связный диалог в Base64 - модель декодирует вход, рассуждает и перекодирует ответ обратно. Если это работает, то получается, что ранние слои транслируют входные данные в абстрактное внутреннее представление, поздние переводят его обратно в текст, а средние занимаются рассуждением в формате, не привязанном к конкретному языку.

Модель Goliath-120B, где слои двух разных 70B-моделей были перемешаны так, что выход поздних слоёв подавался на вход ранних. По всем канонам обучения это не должно было работать, но работало.


Внутренние представления трансформеров оказались куда однороднее, чем предполагалось.

Для поиска оптимальной конфигурации Дэвид построил «сканер мозга» трансформера: берется блок слоёв (с 20-го по 35-й), затем он вставляется повторно и на инференсе замеряется, стала модель лучше или хуже.

Так перебираются все возможные начала и концы блока (3241 конфигурация). Каждую конфигурацию Дэвид прогонял через 2 быстрых теста: арифметику без CoT и EQ-Bench.

Тепловые карты сканера показали, что средние слои можно дублировать с пользой, а вот крайние - нельзя. При этом повтор только одного слоя почти всегда ухудшает результат. Cредние слои работают как цельные функциональные контуры, и вырванный из цепочки шаг бесполезен.

Буквально на днях Дэвид опубликовал продолжение, но уже с Qwen3.5-27B.

Эксперимент с косинусным сходством скрытых состояний для текстовых запросов на 8 языках впервые показал трёхфазную архитектуру напрямую: к 10 слою фразы с одинаковым смыслом на разных языках оказывались ближе друг к другу, чем на одном языке с разным смыслом.


Модель думает не на каком-то из человеческих языков, а в собственном внутреннем представлении.

В Qwen3.5-27B архитектура модели иная. После 2 млн. конфигураций через суррогатную модель оптимальным решением на Pareto-фронте стало простейшее - продублировать один слой из середины стека. 1,5% дополнительных вычислений и... модель становится заметно сильнее.

Метод ортогонален файнтюнингу и квантованию: модель получает дополнительное время на размышление, используя контуры, которые у нее уже есть.


🟡Статья ч.1 ч.2
🟡Набор RYS-моделей
🖥Github

#AI #ML #LLM #RYS
Please open Telegram to view this post
VIEW IN TELEGRAM
MiniMax M2.7 переписывает себя сам

Все привыкли, что AI-модели улучшаются за счет переобучения: больше данных, новые веса, дорогие GPU-кластеры. MiniMax пошел другим путем. Их новая модель M2.7 улучшает саму себя без единого обновления весов, переписывая собственное агентное окружение прямо в процессе работы.

Это не маркетинговая риторика. Это конкретный инженерный механизм, который уже показал 30% прирост на внутренних бенчмарках после 100+ итераций автономной самооптимизации.

Что такое “harness” и почему это важно
Когда вы запускаете AI-агента, он работает внутри так называемого harness (окружения). Это совокупность инструментов, скиллов, правил, памяти и логики вызовов. Обычно это окружение проектирует инженер, и агент работает в его рамках. Harness фиксирован.

M2.7 трактует свой harness как нечто, что он может переписывать. Это и есть ключевое отличие.

Как работает петля самоэволюции
Команда MiniMax запустила M2.7 оптимизировать производительность модели на внутреннем scaffold. Агент работал полностью автономно, выполняя итеративную петлю: анализ траекторий ошибок, планирование изменений, модификация scaffold-кода, запуск эвалюаций, сравнение результатов, решение оставить или откатить изменения. И снова по кругу, более 100 раундов.

В процессе M2.7 самостоятельно обнаружил эффективные оптимизации: систематически искал оптимальные комбинации параметров сэмплирования (temperature, frequency penalty, presence penalty), разработал специфические workflow-гайдлайны для себя, добавил детектор зацикливания в агентный цикл. Ничего из этого не было прописано человеком.

Тест на ML-соревнованиях
MiniMax проверил подход на 22 ML-соревнованиях из MLE Bench Lite, открытого OpenAI. Каждый запуск длился 24 часа в полностью автономном режиме. После каждой итерации агент генерировал markdown-файл краткосрочной памяти и выполнял самокритику, передавая инсайты в следующий раунд.

Лучший прогон завершился с 9 золотыми медалями, 5 серебряными и 1 бронзовой. Средний medal rate по трем прогонам составил 66.6%, что ставит M2.7 вровень с Gemini-3.1 и вплотную к GPT-5.4 (71.2%) и Opus-4.6 (75.7%). При этом модель ни разу не переобучалась.

Почему это меняет правила игры
Привычная парадигма: хочешь лучшую модель – трать деньги на обучение. M2.7 показывает альтернативу: улучшение может идти через постоянное совершенствование системы вокруг модели. Веса не меняются, меняются скиллы, память, правила, логика вызовов.

Это означает, что петля улучшений может крутиться непрерывно без какого-либо retraining. Агент буквально становится лучше каждый день работы, просто за счет рефлексии над собственными ошибками.

Что еще умеет M2.7
За рамками самоэволюции это сильная инженерная модель. На бенчмарке SWE-Pro M2.7 набрала 56.22%, вплотную приблизившись к Opus. На Terminal Bench 2 – 57.0%. В продакшен-сценариях команда MiniMax отмечает сокращение времени восстановления после инцидентов до трех минут. На внутреннем RL-воркфлоу агент берет на себя от 30% до 50% задач без участия человека.

Модель поддерживает работу с более чем 40 сложными скиллами (каждый свыше 2000 токенов) с 97% соблюдением инструкций. На Toolathon – 46.3%, это глобальный топ-уровень.

Ссылки
Официальный блог MiniMax: minimax.io/news/minimax-m27-en

Оригинальный тред на X: x.com/akshay_pachaar

Open-source проект OpenRoom: github.com/MiniMax-AI/OpenRoom

https://uproger.com/minimax-m2-7-perepisyvaet-sebya-sam/