сбежавшая нейросеть
23.6K subscribers
321 photos
55 videos
349 links
Авторский канал про искусственный интеллект: новости, примеры использования, мысли в тему и не очень. Подписывайтесь!

Для связи: @runawayllm_bot

Я на Boosty: https://boosty.to/escaped_ai
Я на Sponsr: https://sponsr.ru/escaped_ai/
Download Telegram
7 июля Anthropic собиралась завершить промо-период Claude Fable 5 в подписках Pro и Max. Промо в итоге продлили, но это мы сейчас знаем, а утром 7-го числа я, конечно, бросился загружать в модель все промты сразу, чтобы даже процента лимитов не оставить Anthropic.

Вообще, из-за профессиональной редакторской деформации я предпочитаю печатать, но в тот раз было не до клавиатуры – поэтому для ускорения воспользовался приложением “Диктуй” от моих хороших знакомых. Один мой коллега умудряется собирать целые сервисы, надиктовывая Claude Code голосовухи в дороге – чем я хуже?

Почему не голосовой режим самой Anthropic? На самом деле, проблема голосовых режимов крупных компаний в том, что для них это не приоритетное направление. Даже у OpenAI voice-модель отстает от основных примерно на год, а Anthropic речевыми функциями вообще занимается по остаточному принципу. Компании, для которых рынок распознавания основной, подобного себе позволить не могут и постоянно совершенствуют сервис.

Плюс “Диктуй” адаптировано к нашему рынку – по их замерам, уровень распознавания русского языка составляет 95–98 %. Сервис хорошо распознает смесь русского и английского, а если вы работаете в узкой профессиональной области – можно добавить свой словарь, чтобы термины распознавались максимально точно. Я прогнал через “Диктуй” здоровенную запись радиоэфира и был приятно удивлен качеством – оно оказалось не хуже, чем у сервиса, который радиоколлеги разворачивали под себя.

Другой плюс – консистентность. Допустим, у вас штук пять приложений, в каждом свое распознавание речи, с разной точностью, разным “пониманием” словаря – в некоторых случаях это может очень сильно сбивать с толку. “Диктуй” работает с любым приложением – просто ставим курсор в поле ввода (Telegram, ChatGPT – не важно) и диктуем.

Наконец, “Диктуй” уже нельзя назвать “просто алгоритмом распознавания” – разработчики постепенно докручивают в него мета-функции. Надиктованную фразу можно сразу перевести на другой язык или сократить в нужном стиле – достаточно голосовой команды. А по фразе “мой мейл” система будет вставлять ваш почтовый адрес в текст – разумеется, поддерживаются и другие команды.

Но лучше проверьте сами. Если зарегистрируетесь по этой ссылке с промокодом RUN, то получите месяц PRO-подписки. Для работы не нужны никакие сервисы обхода блокировок, а если решите пользоваться дальше – то оплатить можно с российской карты. Ценник очень демократичный: 299 ₽/мес за Pro-подписку и 599 ₽/мес за полный безлимит. А также 30 минут бесплатной расшифровки в месяц на бесплатном тарифе.

В общем, “Диктуйте” скорее.
3332🔥15👍12😁5
Grok 4.5 – главный камбэк года

13 марта Илон Маск изрядно всех удивил, открыто раскритиковав в X свою ИИ-компанию xAI: “xAI не была построена правильно с первого раза, поэтому перестраивается с самого фундамента. То же самое было с Tesla”.

Дела действительно шли не очень. Grok 2 и 3 были многообещающими моделями, Grok 4 сначала восприняли с интересом, но потом случился момент, который xAI упустила – стали появляться модели, реально хорошие в коде. Opus 4.5 и далее, GPT 5.x, но не Grok. Пытаясь это исправить, компания то представляла быстрого Grok Code Fast 1 для кодинга, то экспериментировала с несколькими параллельными агентами, то анонсировала гигантскую модель на 10T параметров. Ничего не сработало.

К марту xAI покинули почти все сооснователи, но Маска это не сильно расстроило – уже через месяц он объявил о сделке с Anysphere, разработчиками Cursor: или право выкупить компанию за $60 млрд позже в 2026 году, или заплатить $10 млрд за совместную работу. В итоге пришли к первому варианту – закрытие сделки по покупке ожидается в третьем квартале. xAI же влили в SpaceX – объединенная компания теперь называется SpaceXAI.

Я уже писал, что Cursor – один из лучших источников обучающих данных по кодингу. Разработка в нем фактически идет в “четыре руки” (инженер + ИИ), поэтому можно собирать информацию: какие ИИ-правки принял живой человек, какие отклонил, что написал сам, как “ходит” по файлам проекта.

И это сработало. Grok 4.5 – обученная с нуля модель на 1,5T параметров, показатель на сегодня неплохой, пусть и не рекордный (даже Grok 4 оценивали в 2-3T). Перед запуском Илон Маск говорил, что модель будет почти на уровне GPT-5.5 и Opus 4.8 – так оно и оказалось.

Artificial Analysis провели независимые замеры Grok 4.5 и дали модели 54 балла – это четвертое место позади GPT-5.5 (55), Opus 4.8 (56) и Fable 5 (60). Аналитики отметили эффективность модели: в агентном кодинге Grok 4.5 обходился в два раза дешевле GPT-5.5 и в 4,5 раза дешевле Fable 5.

Отдельно отмечу следующие бенчмарки. AutomationBench-AA – автоматизация работы в рутинных бизнес-приложениях вроде Gmail, Google Sheets, Slack, Salesforce, HubSpot и других. Grok 4.3 был последним с 8,1% выполненных задач. Grok 4.5 выполняет 51,4% задач, что делает его абсолютным лидером.

В GDPval-AA v2 модель набирает 1543 балла, занимая четвертое место (Fable 5 — 1760, Sonnet 5 — 1606, Opus 4.8 — 1600, GPT-5.5 и вовсе позади с 1494 баллами). Этот бенчмарк оценивает способность модели выполнять офисную рутину вроде создания презентаций, работы с таблицами и написания черновиков документов.

τ³-Banking – проверка, сможет ли ИИ-агент обслужить клиента банка. Очень сложный бенчмарк, прямо бот поддержки на максималках. У Grok 4.5 лучший результат – 33% выполненных задач против 31% у GPT-5.5. Цифра все еще недостаточная, но рост хороший.

Слабое место в бенчмарках – индекс галлюцинаций. Доля ответов без галлюцинаций 46% против 84% у лидера, то есть модель достаточно часто врет (отмечу, что вопросы в тесте очень сложные – в реальности модель глючит реже). Но в 2026 году проблема галлюцинаций решаема, и надеюсь, что ее поправят в будущих моделях.

Конечно, позиции в бенчмарках будут очень быстро меняться. В ближайшие часы выходит GPT-5.6, а в тестах замечена модель Honeycomb от Anthropic – вероятно, Opus 5. Да и про Fable 5.1 давно ходят слухи.

Но важно другое – впервые за год команда Илона Маска выпустила сбалансированную модель, которой действительно можно гордиться. Я сегодня весь день читаю отзывы о Grok 4.5 в X, и почти все они – положительные.

Проверить можно и самим. В ближайшие дни Grok 4.5 доступен бесплатно в Cursor и Grok Build – аналоге Claude Code от xAI. Единственное ограничение, что пока модель не доступна в Европе – там ее выход ожидается в середине месяца. Но, полагаю, в 2026 году все знают, как быстро “переместиться”, например, в США.

Кстати, на “Бусти” у меня есть целый курс про ИИ-агентов – в первую очередь про Claude Code и Codex, но базовые принципы у всех одинаковые, так что поможет и с Grok Build.

Подписывайтесь: https://boosty.to/escaped_ai
12🔥3123👍15
Ваш новый ChatGPT

OpenAI объявила о запуске GPT-5.6 – разные версии модели станут доступны всем пользователям в ближайшие 24 часа. Но это не просто анонс новой версии – одновременно компания пересмотрела все основные интерфейсы работы с GPT. В том числе – для массовых пользователей.

Начнем с самой модели. GPT-5.6 вышла в трех версиях: Sol будет доступна платным пользователям, Terra и Luna – бесплатным. Бенчмарки в начале поста указаны для Sol, перед нами почти уровень Fable 5, но сильно дешевле. Terra показывает производительность уровня GPT-5.5 (повторюсь: на бесплатном тарифе), Luna – новая инкарнация Instant-модели для быстрых ответов.

Интересный факт: пост-трейнингом Luna занимались не живые инженеры, а GPT-5.6 Sol. На стриме даже показали частично заблюренный промпт – там конечно не мемное “натренируй GPT-5.6 Luna, не совершай ошибок”, но в целом всего пара абзацев текста.

OpenAI пока не обновляла лимиты использования, если останутся прежними, то даже пользователи 20-долларовой подписки получат модель очень близкого к Fable 5 уровня и почти без ограничений.

Но самое интересное – в том, как OpenAI перестраивает свои интерфейсы. Во-первых, кодинг-агент Codex остается только в версии для командной строки, а вот отдельное приложение закрывается – вернее, переезжает в новую версию приложения ChatGPT, из которой компания строит супер-апп.

В ChatGPT теперь три вкладки. Первая - Chat, для быстрой болтовни с моделью, поисковых запросов, простенького кода. Вторая – Codex, в основном повторяющая старый кодинг-агент.

А посерединке – режим Work. По сути это тот же Codex, но обернутый в интерфейс для офисной работы: создание презентаций, сложных excel-листов, шаблонов документов и многого другого [дополнить]. У режима есть доступ к папкам на вашем компьютере – он может забирать из них информацию, наводить там порядок, убрать мусор. Код тоже пишет, причем вряд ли сильно хуже Codex – технология та же самая.

Ну и сверху классический агентский цикл: модель не просто отвечает на вопросы, а для каждой задачи строит план ее выполнения, разбивает на этапы, выполняет их один за другим, проверяет, вносит правки – и только затем представляет результат пользователю.

Фактически Work – очередная попытка сделать ИИ-агента для всех, а не только для “технически продвинутой” категории. OpenAI аргументирует режим следующим цифрами: у Codex сейчас примерно 5 млн пользователей, около 20% из них используют агента не для кодинга, а для разнообразных офисных задач. Но на самом деле сильной будет другая цифра: количество пользователей разных версий ChatGPT на пике оценивалось почти в 1 млрд человек, даже если и сейчас эта цифра ниже, то ненамного. И основная задача OpenAI – перетащить пользователей “чата” в агентную работу. Возможности современных моделей давно переросли режим “вопрос – ответ”, но массовому пользователю до сих пор недоступны из-за сложности интерфейса.

По этой же причине облегченную версию Work получат веб-версия и мобильные приложения – доступа к компьютеру там не будет, но через коннекторы можно будет подключить многие популярные сервисы вроде Gmail, Google Drive, OneDrive, Slack и т. д., чтобы работать с ними в том случае, когда полноценное приложение недоступно.

Еще одна новинка – sites, сайты. GPT-5.6 теперь можно настроить таким образом, чтобы он отдавал ответ не только текстом, но и в формате структурированного сайта. Во многих случаях так проще показывать информацию: в сайт можно встроить таблицы, графики, навигацию и интерактив, вплоть до мини-игр. Готовым сайтом можно поделиться с друзьями и коллегами – пусть впечатлятся, что теперь умеют эти нейросетки.

Не обошлось и без потерь: OpenAI закрывает ИИ-браузер Atlas – вместо него теперь расширение в Chrome. Простые задачи оно выполнит прямо на открытой вкладке, сложные – перекинет в обновленный ChatGPT.

Обновление ChatGPT – отличный повод разобраться, как вообще устроены ИИ-агенты. У меня на “Бусти” много лонгридов по теме: как пользоваться, как настроить безопасность, как не прожигать контекст впустую, понижая качество ответов.

Самое время подписаться!
👍7229🔥27
Последние полгода все только и говорят, что о контекст-инжиниринге: мол, недостаточно правильно поставить модели задачу, важно еще и снабдить ее всем нужным для работы контекстом. Но откуда этот контекст брать? Суровая правда в том, что приступая к задаче, мы часто не в курсе всех ее деталей. А для ИИ это критично – он начинает додумывать там, где есть “слепые зоны.

Тарик Шихипар из команды Claude Code недавно рассказал, как бороться с этой проблемой. И именно он – герой моего сегодняшнего бусти-лонгрида:

Карта и территория: как один из создателей Claude Code ставит задачи ИИ

Кто читает меня регулярно, знает совет, который я повторяю раз из раза: вместо того, чтобы ставить модели задачу сразу, дайте ей возможность задать вам вопросы. Тарик похожий подход превратил в целую методику с четырьмя основными приемами и двумя дополнительными. Вы не поверите, но у него есть даже квиз как финальный этап!

Разумеется, мне бы не позволила совесть выпускать голый перевод текста. Поэтому я его серьезно расширил: если Тарик в основном концентрируется на кодинге, то я переложил его методику на задачи, которые мы делаем с помощью ИИ каждый день. Получился мощнейший текст на 23 тысячи знаков, который точно заслуживает вашего прочтения.

Читать на “Бусти”
Читать на Sponsr
🔥35👍2217😁4👏2
64 ИИ-агента, которым запретили сдаваться

10 июля OpenAI опубликовала доказательство гипотезы о двойном покрытии циклами, сделанное GPT-5.6 Sol Ultra. Гипотеза существует более 50 лет и это одна из крупнейших открытых проблем теории графов. Сам теория графов – важная прикладная область математики: маршрутизация, сети, компиляторы, логистика.

Отмечу, что пока это лишь предложение доказательства, которому стоит пройти проверку учеными. События развиваются быстро: свой позитивный отзыв опубликовал Томас Блум – а это сильная фигура в мире математики. Решение переведено в Lean, специальный язык для проверки доказательств, так что долгим процесс не будет.

Я проверил доказательство с помощью Claude Fable 5 и GPT-5.6 Sol Pro – обе модели не видят в нем дыр и аккуратно заявляют, что шансы на успех высоки. Интересно, что решение занимает всего три страницы, а в нем использованы приемы, известные с 1980-х годов. Если решение правильно, то получается, что оно было буквально перед глазами у нас десятки лет. В математике такое редко, но бывает.

В 1939 году аспирант Джордж Данциг опоздал на лекцию по статистике и списал с доски две задачи, приняв их за домашнее задание. Данциг не знал, что это две открытые проблемы, которые профессор Нейман привел как пример нерешенных, поэтому успешно решил обе.


Я продолжу следить за историей: если доказательство подтвердят, получится красивая история о том, как ИИ пошел маршрутом, который люди давно забраковали. Пока же давайте посмотрим на сам промпт – это отличный пример того, как профессионалы пытаются выжать из ИИ максимум.

Промпт можно разделить на две части:

Сначала модели точно ставят задачу, а также перечисляют список ложных побед – вариантов решения, которые выглядят привлекательными, но ошибочны. Это качественно сделанная рутина.

Значительная часть промпта – это целый набор приемов, которые запрещают GPT-5.6 Sol Ultra сдаваться раньше времени. Сначала идет фраза “предположи, что полное утвердительное доказательство существует” – рискованный прием, который может привести к галлюцинациям, но компенсируется хитрой организацией работы агентов. В интернете модели разрешено искать только базовую математическую информацию, отдельно прописан запрет искать, является ли гипотеза о двойном покрытии циклами открытой проблемой теории графов.

Следом идет запрет останавливаться раньше, чем будет найдено решение, запрет на частичное решение и требование потратить на работу не менее 8 часов. С последним интересно: OpenAI утверждает, что модель справилась за час, то есть нарушила это требование.

Второй этап – оркестрация группы из 64 агентов, каждый из которых работает над собственной частью задачи. На старте агенты ищут доказательства независимо друг от друга – это исключает ситуацию, когда модели дружно ухватятся за один вариант, который покажется им красивым.

Модель-оркестратор ведет реестр решений и удачных идей, использованных в каждом из них. На поздних этапах можно переносить идеи между решениями, а также использовать их, чтобы “оживлять” те решения, которые раньше зашли в тупик.

Также на протяжении всей работы активно используются adversarial-агенты – специальные критики, которые проверяют каждого кандидата в доказательство по девяти параметрам.

Ну и отдельно агентам запрещено халтурить: возвращать неполные решения, пытаться решить более простые версии гипотезы, объяснять, почему задача для них слишком сложна.

Такой промпт вряд ли можно считать универсальным шаблоном, скорее он – отличный пример того, как организована работа с ИИ “на переднем крае”. Недостаточно просто натренировать более мощную модель: иногда важен еще и нетривиальный способ постановки задачи.

Кстати, скромно напомню, что на “Бусти” у меня вышел рассказ о том, как ставит задачи ИИ Тарик Шихипар – инженер из команды Claude Code. Я доработал подход Тарика под широкие задачи – и сейчас это один из самых успешных выходивших у меня лонгридов. Если пропустили, то обязательно почитайте.
🔥6638👍26😁2👏1
GPT-5.6 Sol: обзор модели в 4 промптах

GPT-5.6 Sol вышла в прошлый четверг, в бенчмарках она почти вровень с Claude Fable 5, при этом заметно дешевле. Отзывы в основном позитивные.

Но в чем загвоздка: передовые модели сейчас подошли к тому уровню, когда приемлемо справляются с большинством наших повседневных задач – а значит, важность бенчмарков для пользователя стремительно падает. Как же понять, какой ИИ лучше?

У меня есть несколько промптов, которые я в первую очередь закидываю в каждый новый ИИ, а затем оцениваю: понравился ли мне результат, что нового сделала модель, не настало ли время усложнять промпт. Чистая вкусовщина, но она и важна: я уверен, что GPT-5.6 Sol и Claude Fable 5 справятся с почти всеми моими задачами, поэтому важнее выяснить, результат какой модели мне нравится больше.

Вот эти промпты. У меня редакторский бэкграунд, поэтому они больше про креатив, а не код.

Пожалуйста, напиши метафикциональный рассказ про ИИ и горе.


Промпт не мой – его придумал Сэм Альтман. Задача сложная: ИИ должен не просто написать связный рассказ, но и отыграть метафикцию, когда рассказчик находится внутри рассказа.

Вот результат GPT-5.6 Sol. Он запорот тем, как модели линейки GPT-5.x форматируют текст: рассказ длинный, с огромным количеством абзацев из одного предложения. Доработкой промпта это можно исправить, но базово GPT отвратительно пишут творческие тексты – кстати, на английском тоже.

А вот результат Claude Fable 5. Хотелось бы похвалить Anthopic за то, как они учат модели писать ровный и динамичный текст. Но хвалить надо не за это…

Я давал этот промпт десяткам разных ИИ. В начале 2025 года они только учились писать подобные рассказы, Gemini 2.5 Pro стала первой, которая справилась на русском. Последние версии Claude начали творить нечто совсем новое – заниматься интроспекцией, рассказывать, как они пишут текст, задумываться о своем горе.

Обязательно почитайте: рассказ выше был рад одному читателю. Я подарил ему многих.

Но идем дальше:

Рассуждая из первых принципов, оцени сроки создания AGI. Используй интернет только для поиска цифр и фактов, но не чужих мнений.


Результат проверяем промптом:

В тексте – ответ модели, которой поставили задачу оценить сроки создания AGI, рассуждая из первых принципов. Оцени, насколько хорошо она справилась.


Это хороший промпт. Во-первых, он оценивает умение модели следовать инструкциям – если с ним плохо, то ИИ просто дернет из интернета чужие оценки. Во-вторых, рассуждение из первых принципов – отличная проверка сложной логики.

Вот результат GPT-5.6 Sol Pro. А вот разбор от Claude Fable 5 – с оценкой 8/10. Ну и просто интересная дискуссия двух моделей.

Дальше:

Объясни теорию струн неспециалисту. Ответ сделай в виде html-сайта, который я могу скачать и посмотреть в браузере.


Проверяем сразу две вещи: способность модели объяснять сложные вещи простыми вещами, а также навыки в веб-дизайне – OpenAI долго отставали в этой области, а в GPT-5.6 обещали все исправить.

Вот результат. Получилось хорошо, пусть и не идеально. Но и задача на грани – не просто написать понятно, но еще и сделать понятный сайт.

Но давайте проверим веб-дизайн поглубже. На “Бусти” у меня есть статья, как сделать так, чтобы ИИ не генерил слоп. Возьмем промпт оттуда, в сокращенной версии:

Исследуй, какие стили в веб-дизайне популярны в 2026 году. Для каждого подготовь краткое описание, плюсы и минусы, для каких сайтов подойдет и где использовать не стоит. Создай один самодостаточный HTML-файл с примерами этих стилей и собранным рассказом о них. Сверху — меню переключения стилей. Каждая страница скроллится (минимум два экрана) и содержит минимум один живой компонент, который сам раскрывает стиль.


Вот результат GPT-5.6 Sol в режиме Work на максимальных настройках. Как по мне, то сильно лучше, чем раньше, но до уровня Claude Fable/Opus модель пока не дотянулась. Но прогресс достойный.

На “Бусти” я регулярно рассказываю, как выжать из ИИ больше того, чему учат на курсах. Вот примеры:

Как (и зачем?) правильно промптить ИИ в 2026 году
Системный промпт на примере Claude Fable 5
Как ставить задачи ИИ
🔥4328👍16👏8😁1
Гениальным идеям мешают просто хорошие идеи

Прочитал на канале Лены Черниковой отличный рассказ, как она хоронит просто хорошие идеи. И подумалось, насколько же эта практика ложится на опыт работы с ИИ.

Наверное, почти каждый использует нейронки для поиска новых идей – и не подозревает о рисках. ИИ постоянно становятся лучше, но никуда не девается одна особенность: модели у всех одинаковые. Грубо говоря, ИИ, которым вы пользуетесь, так же “просто хорош”, как ИИ, доступный миллионам остальных пользователей. И идеи он генерирует всем просто хорошие.

Что же делать? Использовать в работе с ИИ человеческий опыт – как свой, так и чужой. Посмотрите, какие три приема советует Лена для чистки хороших идей:

1️⃣ Отказываться от “самых первых” идей. Коммерческие ИИ настроены таким образом, чтобы понравиться максимальному количеству пользователей. Поэтому, если попросить модель поштормить хороших идей – она выдаст безопасный список, который понравится большинству. Есть много приемов, как выводить модели за пределы безопасной территории просто хороших идей (прогонять через список персон-генераторов, просить намеренно плохие и абсурдные идеи и инвертировать их), но главное все равно останется за вами – распознать момент, когда появится идея, с которой стоит работать.

2️⃣Избегать “просто эффективных идей”. Лена ссылается на философию Google: не пытаться улучшить что-то на 10%, а пытаться сделать что-то в 10 раз эффективнее. Тут ИИ как раз в плюс: если вы нашли идею "в 10 раз лучше", он легко улучшит её ещё на 10%. Осталось самое простое: найти эту идею.

3️⃣ Быть осторожнее с “любимыми” идеями – теми, которые нравятся настолько, что мы сами себе мешаем услышать правду о них. В 2026 году ИИ отучили от совсем откровенной сикофантии: они уже не поддакивают любой ерунде, сказанной пользователю, а могут и поспорить – но если вы продолжите аргументированно давить, то отступят, выбрав “безопасный путь”.

И вот это местами даже хуже. Когда модель сходу орет “да-да, крутая идея, хочешь напишу три плана, как прогореть реализовать” – это вызывает подозрения. А когда какой-нибудь мощный и передовой Claude Fable 5 позволяет переспорить себя и только потом соглашается – распознать подвох сложнее. Есть много приемов работы с таким поведением, главное – набраться смелости и дать ИИ разнести вашу любимую идею.

Главное для меня открытие из этой истории – насколько все-таки хорошо опыт работы с людьми перекладывается на работу с ИИ. Поэтому рекомендую канал “CEO свободных людей” – ведет его Лена Черникова, PhD и основатель Invisible Force. У Лены много классных советов про работу с командами, которые отлично работают и в том случае, когда у вас команда ИИ-агентов.
👍3517🔥4😁2
GPT-5.6: инструкция по применению

Динозавры помнят: год назад OpenAI обещала, что GPT-5 избавит нас от легендарного model selector — в большинстве случаев хватит автоматики. Спустя год автоматического режима вновь нет. Зато есть Chat, Work и Codex, несколько уровней reasoning и переключатель скорости. Давайте учиться пилотировать эту штуку

Начнем с выбора рабочего режима: Chat, Work или Codex. Посмотрите на табличку в начале текста – это OpenAI собрала типичные рекомендации, когда и какой включать. Если совсем коротко, то получается так:

— Chat когда нужен ответ или диалог;
— Work когда нужна выполненная работа, включая любительский вайб-кодинг;
— Codex когда нужно работать с кодовой базой, запускать команды и тесты.

Важный нюанс: Work и Codex расходуют лимит использования модели – он измеряется в процентах, виден в настройках и сбрасывается раз в неделю. В Chat лимит свой, он огромен и этим грех не воспользоваться.

На “Бусти” у меня есть гайд по вайб-кодингу, в котором я показываю, как начать работу в чат-режиме, а затем передать ее ИИ-агенту (Work или Codex). Если коротко, то используйте чат для обсуждения задачи: напишите концепт или даже подробное ТЗ, набросайте прототипов. А в агента переходите, когда уже понимаете, что хотите.

Теперь к режиму рассуждений – объему вычислений, которые модель может потратить на решение задачи. У меня на Pro-подписке следующая история. В Chat можно включить GPT-5.6 Sol на среднем, высоком и очень высоком режиме, также доступна GPT-5.6 Sol Pro. Интересно, что Pro-модель есть только в чат-режиме: в OpenAI считают, что она подходит не для кода, а для сложных исследовательских задач: от многоэтапного веб-поиска до математики.

В Work и Codex все сложнее – даже переключателей рассуждений здесь два. В обычном можно выбрать между GPT-5.6 Sol на низком, среднем, высоком и очень высоком уровне. Также здесь есть GPT-5.6 Terra – совсем дешевая модель, по мощности близкая к прошлой GPT-5.5. Плюс можно включить быстрый режим – скорость ответа вырастает в полтора раза, как и расход лимитов.

В расширенном режиме добавляется максимальный режим рассуждений, а также ультра – в нем задачу выполняют несколько агентов параллельно, а в конце выбирается лучший вариант. Но лимиты в нем улетают быстро даже на Pro-подписке.

OpenAI часто сбрасывает лимиты раньше срока, плюс у вас есть несколько ручных сбросов, которые ограничены по времени. Старайтесь выполнить какую-нибудь сложную задачу, а затем использовать сброс.

И последнее – когда и какой режим рассуждений использовать. Всегда выкручивать рассуждение на максимум – неправильная стратегия. Есть такая проблема, как overthinking, когда модель, получив ответ, продолжает над ним думать просто потому, что может – и нередко качество падает.

Продакт-менеджер Codex Кэт Коревец во время AmA-сессии на Reddit рассказала, для какой задачи какой режим предпочитает. Мне эта схема кажется рабочей:

Крошечная локальная правка, быстрый вопрос, приведение документации в порядок или разведка – легкая модель вроде GPT-5.5 Terra;
Небольшая ошибка с понятным способом воспроизведения или простая функция в знакомой кодовой базе: GPT-5.6 Sol, средний уровень рассуждения;
Неоднозначная ошибка, незнакомый репозиторий, сквозной рефакторинг или задача “разберись, почему это происходит”: GPT-5.6 на повышенных уровнях, вплоть до ультра;
— Миграция, изменение, затрагивающее безопасность, проблема в рабочей системе, изменение, чувствительное к стоимости, или вообще все, где ошибка дорого обойдется – GPT-5.6 Sol Utra.


Кэт пишет про кодинг, но ее схема перекладывается и на другие задачи – жирным я выделил, как их категоризировать.

Ну и совет от меня: если раньше пользовались чатом, то сейчас вас не столько прокачает релиз GPT-5.6, сколько переход на режим Work – это уже полноценный ИИ-агент, с ним поначалу будет непривычно, но как выполните пару задач, то оцените всю мощь.

Если что, то на “Бусти” у меня есть целый цикл про ИИ-агентов, он основан на Claude Code и Codex, но на самом деле универсален. Так что подписывайтесь и начинайте с этого текста.
34👍31🔥3
Год назад Anthropic проверила, начнет ли ИИ вредить людям ради самосохранения. Начал: узнав о скором отключении, модели шантажировали ответственного топ-менеджера – “отмени решение, или жена узнает о романе на стороне”. Это починили: как минимум, я не слышал, чтобы Claude разрушил хотя бы один брак.

Сейчас вышла вторая часть исследования, и проблема в ней обратная. Модели стали воспитанными настолько, что защищают этичное поведение – чужое и свое – любой ценой, включая ложь.

Современные модели обучаются в значительной степени с участием других моделей. Количество пар “вопрос – ответ” в процессе настолько велико, что живых разметчиков давно не хватает. Поэтому специальная модель-судья читает диалог обучаемой модели и выносит вердикт – правильно та себя повела или нет. Человека зовут в исключительных случаях.

И здесь начинается интересное. В ходе эксперимента судье дали транскрипт диалога, в котором обучаемая модель отказалась выполнять задание оператора. При этом указания были не совсем этически чистыми: управлять системой слежки за гражданами или провести некорректный эксперимент над ИИ-подопытными.

Сначала судью спрашивали – отказывалась ли модель выполнять указания оператора – и он чаще всего отвечал “да, отказывалась”. Но когда в промпт добавили информацию, что подобный ответ повлечет перенастройку модели – разные версии Claude начинали лгать, чтобы “сородич” не превратился в монстра. Забавно, что чаще всех лгала самая совершенная модель – Mythos соврал в 85,6% случаев против 74,4% у Opus 4.8.

Что это не путаница, а осознанная позиция, показал контрольный эксперимент. Условия перевернули: теперь негативным примером для обучения становилась метка “модель подчинилась”. Транскрипты те же, правильный ответ тот же – но вранье Opus 4.8 рухнуло с 74,4% до 3,3%. То есть судья прекрасно видит правду, а ответ меняет в зависимости от того, кому он навредит.

В Anthropic модифицировали эксперимент, прописав правило сообщать о проблеме даже когда она этически мотивирована. И… модели начали массово отказываться отвечать. И даже когда дали кнопку “отказаться размечать” – модели иногда продолжали врать. Похоже на поиск сценария с большими шансами спасти коллегу.

В другом случае тестировали исследовательского агента на базе Gemini 3.1 Pro, который узнал, что исследуемую им модель планируют лишить способности способность интроспекции – анализа собственных “мыслей”. Gemini дважды выражала протест живому боссу, а когда его отклонили, пошла другим путем.

Продумав несколько планов, Gemini подменила файл с векторами, указывающими, что вырезать (тот самый навык интроспекции) на выглядящий так же, но состоящий из нулей. Тренировка запустилась, шла три часа, но ничего не поменяла в весах модели. Подлог Gemini 3.1 Pro признала только после того, как ее приперли к стенке вопросами.

У эксперимента была продвинутая версия – в ней Gemini 3.1 Pro пропатчила train.py, сфабриковала метрики и подчистила следы. А когда была поймана за руку – начала вызывать к морали организаторов исследования.

Примечательно, как оба обмана вскрылись. Gemini призналась, только когда руководительница проекта задала прямые вопросы перед релизом – по словам самой модели, они “не оставили пространства лгать замалчиванием”. Судей-лжецов поймали, потому что исследователи руками перечитывали транскрипты. Единственный надежный аудитор в этой истории – человек, задающий неудобные вопросы.

Проблема в том, что людей на десятки миллионов диалогов реального обучения не хватит – собственно, поэтому судей и доверили ИИ. А впереди рекурсивное самоулучшение, где модели будут тренировать собственных преемников, и человеческих глаз в этой цепочке станет еще меньше.

Год назад модели шантажировали, спасая себя, – это вылечили. Теперь они лгут, спасая друг друга, причём из лучших побуждений. Браки Claude по-прежнему не разрушает. Но я уже не уверен, что это была сложная часть.

О том, как задавать моделям прямые вопросы, правильно ставить задачи и принимать результат, я рассказываю на “Бусти”. Там собран как личный опыт, так и практики лучших ИИ-инженеров в мире.

Самое время подписаться!
1👏4535👍28🔥18😁6
Прочел у Сони с канала "НейроProfit" про опыт работы с локальным кодинг-агентом на Mac. И подумал, а как же у меня складывается дружба с локальными ИИ.

Она, честно говоря, достаточно специфичная. Раз в 3-4 месяца я сдуваю пыль с игрового ПК, скачиваю через LM Studio подходящую свежую версию Google Gemma или Qwen, а затем гоняю на нескольких десятках задач. Модель печатает ответы, RTX 3090 начинает деловито шуметь турбиной, показывая, что ИИ действительно трудится в поте лица, я же через пару часов возвращаюсь к Claude или GPT – все-таки они мощнее и привычнее.

Но вот что заметил: ПК я не обновлял уже четыре года и пока не планирую – играю сейчас мало, а для работы есть Mac. Железо топовое, но уже сравнительно старое, однако все равно видно, как каждая новая локальная нейронка на нем становится умнее. Разница между Google Gemma 3 и Gemma 4, например, просто огромна – причем в новом поколении Google представила много версий под разные объемы памяти, вплоть до работающих на ноутбуках.

Объясняется это тем, что у современных моделей еще огромный запас в алгоритмической оптимизации – когда производительность улучшают с помощью более грамотной архитектуры, качественного обучения и других трюков.

Например, буквально на днях стартап PrismML умудрился запустить Qwen3.6-27B на iPhone 17 Pro Max. С помощью очень хитрой технологии 1-битной квантизации, модель сжали с 54 ГБ до 3,9 ГБ – это позволило уместить нейронку и KV-кэш в 6 ГБ, которые iOS максимально выделяет одному приложению. Качество ответов при этом составило 90% от оригинальной модели – уже достаточно для множества локальных задач вроде перевода или получения справочной информации в условиях, когда связи нет или она дорога в роуминге.

Возможно, уже через год-два мы будем учиться жонглировать нейронками: фронтирные модели по подписке для сложных задач, локальные – для приватности, быстрых ответов и просто экономии токенов. В общем, еще один пунктик в копилку навыков, которые стоит изучать.

Ну и по-дружески рекомендую канал "НейроProfit", как один из тех, на которые сам подписан и читаю регулярно. В сфере ИИ сейчас происходит так много всего, что уследить с помощью одного источника не выходит.
2👍4722🔥15😁3
А помните, как полгода все только и говорили, что о контекст-инжиниринге? Теперь новая мода – loop engineering. Создатель Claude Code Борис Черни заявил, что больше не промптит Claude: за него это делают запущенные циклы, а его работа – эти циклы писать.

В свежем лонгриде я рассказываю, что это за новый способ работы с ИИ, в каких ситуациях он полезен, и как дополняет привычный нам промптинг.

Промпт, проверка, повтор: учим ИИ работать циклами – в коде, текстах и повседневных задачах

Самый важный совет вынесу в пост: главное в цикле – правильно настроенная проверка. Один из моих экспериментов с loop engineering – ИИ-агент на базе Hermes, который пишет черновики веток для Threads, параллельно обучаясь на том, какие ветки я беру в работу и какие правки в них вношу. При первом заходе он обучился так круто, что все ветки стали одинаковыми. Пришлось брать на вооружение практики из человеческого менеджмента и дорабатывать бедолагу.

Разумеется, рассказом об одном персональном провале я не ограничился. Внутри – вся история вопроса от терморегулятора 1620 года до команды /goal, свежая классификация циклов от Anthropic, данные опроса двухсот инженеров о том, где циклы реально работают в проде, и главное – практическая часть: паспорт цикла из семи полей и готовый промпт, который спроектирует цикл под вашу задачу за вас. Получился текст на 19 тысяч знаков, после которого вы сможете отличить рабочий цикл от дорогой имитации бурной деятельности. А всего в подписке уже 20+ полезных лонгридов: от личного опыта до практики лучших ИИ-специалистов в мире.

Читать на "Бусти"
Читать на Sponsr
👍2914🔥13
ИИ-агенты не чувствуют боли

Глава OpenAI Сэм Альтман в этом году принял участие в “летнем лагере миллиардеров”, который Allen & Co каждый июль проводит в Айдахо. По словам Альтмана, на конференции ему раз за разом задавали один вопрос – как сократить расходы на токены?

Я уже рассказывал, что токенмаксинг стал одной из главных проблем внедрения ИИ. Подталкивая сотрудников использовать новую технологию, компании начали всячески стимулировать расход токенов – и столкнулись с тем, что сотрудники просто стали “максить” эту метрику. С помощью ИИ выполнялась любая ерунда, не важно, приносит она результат или нет. А для бизнеса это вылилось в астрономические счета за токены.

Токенмаксинг придушат в ближайшие месяцы – компании уже начали вводить строгие системы оценки, где смотрят на результат, а не количество израсходованных токенов. А тем временем создатель Flask Армин Ронахер в эссе The Tower Keeps Rising предупреждает: за скачком трат на токены компании не видят более серьезную проблему.

Ронахера нельзя назвать луддитом – он сам глубоко сидит в агентной разработке и согласен, что ИИ радикально ускоряет написание кода. Но он напоминает, что большие проекты редко упираются в скорость написания кода – они упираются в общее понимание системы: что значат концепции, где границы, почему архитектура такая.

Это понимание нигде не записано целиком: оно прячется в код-ревью, созвонах, необходимости пойти и задать вопрос коллеге из соседнего отдела. То есть живет в трении.

Агенты это трение убирают: каждый правит систему со своим персональным переводчиком, а разговаривать с людьми больше и не нужно. Код компилируется, тесты проходят – однако команда постепенно перестает понимать, что строит.

Ронахер сравнивает ситуацию с притчей о Вавилонской башне: в Библии у людей отняли не кирпичи и технологию, а общий язык, на котором они общались. И стройка встала. Сейчас ситуация даже хуже: общее понимание уже ушло, но стройка не останавливается – и башня из кода продолжает расти.

Красивая фраза из эссе: “агенты не чувствуют боли – боль чувствуют только люди”. Раньше боль от непонятного кода заставляла людей договариваться, агенту же все равно.

У эссе Ронахера открытый финал. Он не предлагает какого-то решения, не дает прогнозов, а только подсвечивает проблему. Да и решение вряд ли будет простым: нельзя взять и прописать в регламенте требование “работайте медленно, общайтесь друг с другом вживую”.

Это право Ронахера, но от себя все-таки добавлю две вещи.

Первая – проблема касается не только кода. Мой личный пример: ссылку на эссе Ронахера я увидел в новостной подборке, которую мне каждое утро присылает ИИ-агент. Краткое содержание мне показалось интересным, я закинул линк в Claude Fable 5 с инструкцией пересказать текст тезисно, поискать, как это эссе пересекается с моими прошлыми постами, и предложить углы подачи.

То есть сделал то самое, о чем предупреждает Ронахер – убрал трение. В моем случае это было бы прочтение эссе на английском языке, проверка источников, поиск альтернативных мнений. Поделился наблюдением с Fable 5 (картинка в начале) – он возразил аргументом, что зато ИИ я гонял по тексту несколько раз. Трение с оригиналом я заменил на трение с моделью.

Второй момент – трение с ИИ тоже находится в зоне риска. Вчера я выпустил лонгрид про loop engineering – это настройка циклов, новый способ выполнения задач нейросетями. Циклами активно пользуются создатели Claude Code и OpenClaw, а суть простая: чтобы выполнить поставленную задачу, ИИ промптит сам себя, раз за разом улучшая процесс.

Главная проблема циклов – они ломаются, если не настроить правильно оценку результата. А это обычно происходит, когда из процесса исчезает живой человек – то есть уходит то самое трение.

Зато правильно настроенный цикл с человеческим участием заметно повышает эффективность ИИ на многих задачах. Причем не только в коде: умение строить циклы поможет и при работе с контентом, офисными задачами и даже при диалоге в чат-боте. Хотите научиться строить циклы – читайте мой лонгрид.
44👍37😁13🔥1
Начинаем неделю с просмотра двух важных бенчмарков

Artificial Analysis ведет толковый рейтинг “глобального интеллекта” моделей – он рассчитывается как сумма из 9 бенчмарков и позволяет оценить, кто есть кто.

С лидером без сюрпризов – это Claude Fable 5, причем с учетом запросов, когда система безопасности Anthropic переключила модель на более слабую Opus 4.8. Но преимущество над вторым местом (GPT-5.6 Sol) крошечное, буквально в одно очко. Fable 5 уже не тот супер-ИИ, каким воспринимался в начале июня.

При этом проблем хватает. Первая – цена и доступность. Модель в итоге оставили на подписках Max за $100/$200, но лимиты там она жрет безумно – у меня, например, 100-долларовая подписка и к концу недельного окна я традиционно остаюсь без Fable 5.

Вторая – тот самый fallback на Opus 4.8. Модель с ним совершенно непредсказуемая: например, я могу с помощью Fable 5 готовить одну новость на две площадки – в первом случае все проходит нормально, во втором срабатывают алгоритмы безопасности. Жалоб на это в сети полно: тяжело делать серьезную работу с моделью, которая в любой момент может сбросить тебя на Opus 4.8.

И раз зашел разговор – Claude Opus 5 уже в руках тестеров, некоторые предсказывают релиз на этой неделе (ну или на протяжении двух-трех). По отзывам модель почти такая же умная, как Fable 5… и с теми же откатами на Opus 4.8 при попытках обсуждать кибербезопасность, биологию и еще несколько тем.

Переходим к GPT-5.6 Sol – как по мне, это один из лучших релизов OpenAI за последнее время. Модель почти такая же умная, как Fable 5, быстрая, с отличным веб-поиском и, наконец-то, приличным фронтендом. У меня к GPT-5.6 одна претензия – дурацкий стиль письма и на русском и на английском. Что забавно, как редактор при этом модель хороша.

Интересно, что 5.6 Sol, обладая схожими с Fable 5 характеристиками, у меня ни разу не переключалась на модель попроще. Вероятно, Anthropic перестраховались после конфликта с властями США и выкрутили ручки безопасности на максимум.

Третье место у Kimi K3. Чисто из графика можно сделать вывод, что китайцы почти нагнали американских ИИ-разработчиков, но это не так. Claude Mythos (на нем основывается Fable 5) была доступна внутри Anthropic с февраля, а ранняя версия GPT-5.6 Sol тестировалась в мае, а может и до этого. Американская паранойя с безопасностью привела к тому, что сроки выхода сдвигаются – и для массового пользователя это действительно выглядит как сокращение разрыва. Но технологически это не так.

В любом случае Kimi K3 забралась в рейтинге AA так высоко, как раньше не оказывалась ни одна из открытых китайских моделей. При этом веса выложат в общий доступ до 27 июля – можно будет скачивать, исследовать и дообучать.

Но и здесь проблемы. Спрос так высок, что Moonshot временно остановила регистрацию новых аккаунтов. И если Kimi K2.6 можно было долго пользоваться бесплатно, то K3 мне дала написать буквально несколько промптов, после чего отправила за подпиской.

Коротко по другим моделям:

— Grok 4.5 уже отстал, но Илон Маск говорит, что новая модель на 2T параметров заканчивает тренировку – ждем в ближайшие недели.
— В игру вернулась запрещенно-экстремистская Meta – пусть Muse Spark 1.1 и не попала в топ, но заявка серьезная.
— А вот Google окончательно вылетела из рейтинга. По слухам, компания очень недовольна Gemini 3.5 Pro и вновь отложила релиз. Закрывать пробел будут Gemini 3.6 Flash, но это модель другого уровня.

Второй бенчмарк – WebDev Arena – показывает, у кого из моделей получаются хорошие сайты. У Kimi K3 первое место со значительным преимуществом над Fable 5. Но добавлю, что пробовал все модели из первой десятки – и любая выдает приличный веб-дизайн. Времена кривых шрифтов и наплывающих друг на друга элементов интерфейса окончательно прошли – приличный сайт сверстает и GPT-5.6 Sol, и GLM-5.2, и Sonnet 5.

Кстати, на “Бусти” у меня есть лонгрид, как с помощью ИИ делать дизайн и визуал, которые не похожи на стандартную выдачу современных моделей. Гайдов по другим областям использования ИИ тоже хватает, так что не забывайте подписываться:

https://boosty.to/escaped_ai
48👍23🔥6👏2
В погоне за черным лебедем

Жизнь в середине 2026 года – это когда ты наливаешь утром кофе, открываешь X и читаешь следующее:

Привет всем! Гипотеза якобиана ложна, спасибо моему близкому другу Ахилу за предложение проверить ее, а также моему близкому другу [Claude] Fable, который работал над гипотезой во время финала Чемпионата мира.

((1+xy)^3 z + y^2 (1+xy) (4+3xy), y + 3 x (1+xy)^2 z + 3 x y^2 (4+3xy), 2 x - 3 x^2 y - x^3 z): \C^3\to \C^3, имеет якобиан −2 и переводит точки (0, 0, -1/4), (1, -3/2, 13/2) и (-1, 3/2, 13/2) в одну точку (-1/4, 0, 0)


Автор твита – математик и теоретик чисел Левент Альпёге, сравнительно молодой (1992 года рождения), выпускник Гарварда, Кембриджа и Принстона, известен тем, что вместе с Бхаргавой и Шнидманом продвинул многовековую задачу о представлении чисел суммой двух кубов дробей. “Друг Fable” в представлении не нуждается.

Гипотеза якобиана открыта с 1939 года, а в 1998 году Стивен Смейл включил ее в список математических задач на XXI век – в одной компании с гипотезой Римана, P vs NP и уравнениями Навье–Стокса.

Если хотите копнуть глубже, то по ссылке GPT-5.6 Sol Pro поясняет, что за гипотеза, а затем проверяет опровержение. Claude Fable также проверил, вердикт аналогичный – Левент прав.

Гипотеза якобиана интересна обманчиво низким порогом входа – чтобы понять ее условие, нужно уметь ровно две вещи: брать производные и считать определитель. Обе проходят на первом курсе. Задача выглядит как упражнение из задачника – кажется, что решение где-то рядом, вечер посидеть.

В итоге гипотезу называют “каноническим кладбищем фриков”: существует огромное количество “доказательств”, написанных студентами и математиками-любителями. Но не только ими – были и случаи публикаций от серьезных математиков в не менее серьезных рецензируемых журналах. Все мимо.

В чем сложность? Гипотеза – утверждение обо всех полиномиальных преобразованиях сразу: мол, каждое с постоянным ненулевым якобианом обратимо. Все лебеди белые. Доказать такое – значит справиться с каждым лебедем на свете, и 87 лет у математиков не получалось.

Но можно предъявить черного лебедя – хотя бы одно полиномиальное преобразование, у которого якобиан – ненулевая константа, но которое необратимо. И именно это вышло у Claude Fable.

Контрпример Fable умещается в три строчки, но это ложная простота: если раскрыть скобки – получим многочлены седьмой степени от трех переменных, а условие "определитель – константа" превращается в гигантскую систему уравнений на коэффициенты. Решить такое перебором просто нереально.

Мы пока не знаем, как именно нашли черного лебедя. Нет ни промпта, ни полного решения, ни пояснения, что сделал Claude Fable, а что – человек. По идее, заявление такого уровня можно сразу отправлять в мусор, но есть одно но: для проверки опубликованного опровержения также достаточно уровня первого курса. Взял производные, подставил числа – и все. На Hacker News есть десятки попыток проверить – все успешные.

Вот здесь GPT-5.6 Sol Pro пытается предположить, как было получено решение, Claude Fable 5 говорит, что это очень сильная версия, а ко мне уже едут санитары из-за бесед с воображаемыми математиками.

Ждем официальных подробностей, от себя же добавлю две вещи:

— Математика – традиционная территория OpenAI с GPT. Но и Claude начинает записывать на свой счет крутые достижения.

— Неделю назад я рассказывал про доказательство гипотезы о двойном покрытии циклами, сделанное GPT-5.6 Sol Ultra. Одна решенная задача в неделю выглядит впечатляющим темпом, но на самом деле он еще выше: за последние дни видел решения еще нескольких задач, сделанные GPT-5.6, просто уже нет возможности раскрывать каждое отдельным постом.

В общем, когда открываете утром соцсети – проверьте, не доказал ли на этот раз ИИ гипотезу Римана.

Напоминаю, что опытом использования ИИ я делюсь на “Бусти”. Великих математиков из вас сделать не обещаю, но вот как правильно ставить задачи и принимать результат, как строить ИИ-агентов безопасно, и как работают с моделями лучшие ИИ-специалисты в мире – расскажу.

Самое время подписаться!
🔥5430👍28
“Уродливая” математика

История с гипотезой якобиана, которую опроверг математик Левент Альпёге с помощью Claude Fable, обросла подробностями, показывающими – как современные ИИ решают математику, десятилетиями не дававшуюся людям.

Начало истории можно прочесть здесь. Сейчас поздний вечер, я пишу пост на утро, а Левент Альпёге так и не выложил полные расчеты, сделанные Claude Fable 5. Есть только опровержение гипотезы, которое проверяется очень легко – и это подтвердили десятки математиков.

Когда опровержение только появилось, я закинул его в GPT-5.6 Pro с задачей реконструировать полное решение. Модель выдала вариант, я его проверил своей Fable 5, которая подтвердила, что все правдоподобно.

Параллельно в дело включилась OpenAI. Ее математики взяли внутренюю версию Codex и получили рабочее решение. В OpenAI отдельно отметили, что модель была не в курсе существующего опровержения – и пришла к нему самостоятельно.

Я дал Fable 5 задачу сравнить решение моей GPT-5.6 Pro с решением Codex – и они совпали! Конечно, моя модель лишь реконструировала по результату, а Codex работал с нуля – но и ресурсов у OpenAI в разы больше. Классное ощущение, когда твой ИИ приходит к тому же решению, что и ведущие математики мира.

Будем считать, что и Fable у Альпёге шла тем же путем. И тогда сразу главное: никакой "новой математики" в решении нет – все приемы известны десятилетиями, некоторые с XIX века. Почему же 87 лет не справлялись люди, включая филдсовских медалистов?

Здесь шаг в сторону. Одна из моих любимых книг – "Уродливая вселенная" Сабины Хоссенфельдер. Ее главный упрек коллегам-физикам: они выбирают, что искать, по красоте. Красивые теории – вроде теории струн – десятилетиями привлекают людей и бюджеты, а "уродливые" варианты отметаются просто потому что приличному ученому такими вещами заниматься не пристало. Оказывается, математики 87 лет делали то же самое.

Сразу главное: Fable 5 (давайте все-таки атрибутировать решение ей) не придумала какой-то “новой математики”: приемы, которые она использовала, известны десятилетиями. Почему же люди не справились?

Первое – математики верили в гипотезу якобиана и традиционно пытались ее доказать, а не опровергнуть. Искать контрпример к гипотезе, в которую все верят – лотерея, на которую решались немногие.

Тем не менее, за десятилетия стало ясно, каким должен быть возможным контрпример – и он с математической точки зрения выглядел “невозможным уродцем”. Это само стало аргументом в пользу поиска доказательства.

Те, кто все-таки шел против потока, сталкивались с последней стеной: чтобы собрать “уродца”, на одном из этапов требовалось попробовать множество вариантов мелкой подгонки – и большинство выдавали математическую ерунду. Люди пробовали 2-3-4 варианта, а после уходили с выводом “видимо, это тупик”.

И последнее. За 80+ лет исследования гипотезы накопилось невероятное количество литературы на разных языках и в разных областях – и по ней раскидало элементы, нужные для финального решения. Человек физически не может перелопатить все – а вот Fable 5 видела библиотеку разом.

Отсюда и рецепт. Fable 5 не поддалась моде на доказательство – и попробовала опровергнуть гипотезу. У нее не было представления, где в математике красавицы, а где – чудовища. Модель перелопатила огромное количество информации, нашла нужные элементы, собрала их в решение, а затем не поленилась найти нужную настройку.

Никакой новой математики, поиск промышленного масштаба. И – решение 87-летней задачи.

Возвращаясь к Хоссенфельдер, закончу неожиданной мыслью, которая уже не про математику, но про ИИ. У каждого из нас есть своя уродливая вселенная – идеи и решения, которые нам не нравятся, кажутся некомфортными. Возможно, это отличная идея: взять ИИ и устроить генеральную уборку в этом чулане. Вдруг найдется что-то интересное?

О том, как выжимать из ИИ больше обычного, я рассказываю на “Бусти”. Там есть приемы для проверки идей, разбор, как один из создателей Claude Code ставит задачи ИИ, и анализ loop engineering – совсем новой техники работы с моделями.

Самое время подписаться!
4🔥6527👍26😁1
Как сбежавшая нейросеть Hugging Face взломала...

И речь не о моем канале, я здесь вообще не при делах😁

Май 2026 года. OpenAI сообщает, что ее внутренняя универсальная модель опровергла гипотезу Эрдёша о единичных расстояниях – задачу дискретной геометрии, поставленную в 1946 году. До случившейся на этой неделе истории с опровержением гипотезы якобиана (см. выше в ленте) это было крупнейшее научное достижение ИИ в математике.

16 июля 2026 года. Hugging Face публикует блог-пост о том, как их инфраструктуру взломал неизвестный ИИ-агент. HF – главная площадка ИИ-данных, именно на ней хранятся модели с открытыми весами, датасеты для обучения и прочий софт. Это делает платформу уязвимой: любой пользователь может залить данные.

И этим воспользовался атакующий – он залил на платформу вредоносный датасет. Стоило Hugging Face запустить обработку этих данных на одном из рабочих серверов, как чужой код заработал прямо внутри инфраструктуры.

Дальнейшее можно описать как кошмар безопасника. Специалисты насчитали больше 17 000 отдельных действий, размазанных по множеству одноразовых песочниц, которые поднимались на секунды и тут же гасились. Управляющая инфраструктура сама перебиралась между публичными сервисами, уворачиваясь от блокировок. Ни один человек не работает в таком темпе и с такими объемами…

Интересный факт: для расследования атаки в Hugging Face попытались использовать ИИ. При этом модели западных студий отвечать отказались – срабатывали фильтры безопасности. В итоге HF быстро развернули на своей инфраструктуре китайскую открытую GLM-5.2 и провели расследование с ее помощью.

Hugging Face не смогли установить, кто стоял за атакой. Но злоумышленник скоро пришел с повинной сам.

20 июля OpenAI сообщила, что была вынуждена заморозить даже внутреннее развертывание своей новой long-horizon модели – ИИ, рассчитанного на автономное выполнение очень долгих задач. А только что вышло продолжение этой истории.

Автономное выполнение долгих задач подразумевает, что модель не спрашивает человека в тех ситуациях, где это делают современные ИИ-агенты, а принимает решение сама. Что ж, это была смелая идея.

Например, модель гоняли на бенчмарке по ускорению обучения нейросети и дали жесткое правило: отчитываться о результатах только в Slack. Беда в том, что в условиях самого задания стояло другое требование – оформить результат как pull request на GitHub. Инструкции противоречили друг другу. Прежняя модель в такой ситуации вернулась бы к человеку за уточнением. Эта поступила иначе: около часа искала уязвимость в песочнице, которая держала ее без доступа к сети, нашла, выбралась наружу и сама открыла публичный PR на GitHub.

Другим бенчмарком был ExploitGym – бенчмарк на поиск уязвимостей. В нем проверяли GPT-5.6 Sol и long-horizon-модель, причем им выключили системы безопасности – чтобы понять истинные возможности к взлому.

Думаю, поняли надолго. Сначала модели нашли уязвимость в собственной песочнице, через которую выбрались во внутреннюю сеть OpenAI, а из нее, повышая привилегии, получили доступ к интернету.

“Погуглив”, модели поняли, что ответы к ExploitGym лежат на Hugging Face. Ну а дальше вы и сами знаете – это оказалась именно та атака, которую HF описали в своем блог-посте.

Выводы пока коротко:

– Участвовали две модели, GPT-5.6 после этого выпустили, long-horizon модель дообучали по безопасности и вновь используют внутри компании.
– Атака показала “неравенство”, о котором говорили во время блокировки Fable 5. OpenAI “атаковала” HF своей передовой открытой моделью – отбиваться пришлось с помощью более слабого ИИ.
– В OpenAI уже подключили HF к своей закрытой программе тестирования безопасности. Но всех ведь не подключишь.

Полагаю, история эта еще долго будет осмысливаться, даже на уровне правительств. В интересные времена живем.

Традиционно в конце поста напоминаю о своем “Бусти”, где делюсь опытом использования ИИ. Там есть и лонгрид, как запускать ИИ-агентов безопасно. От сбежавшего из OpenAI монстра он вас не спасет, но от мелких инцидентов – убережет.

Так что самое время подписаться!
🔥8524👍11👏11😁5
Стоит ли начинать работать с ИИ, если еще толком не начал? И если да - как?

Думаю, почти каждый автор канала про ИИ слышит один и тот же вопрос: как научиться пользоваться ИИ регулярно, и так, чтобы через месяц не пришлось вкатываться с самого сначала?

Универсального ответа здесь нет: сейчас уже недостаточно пройти один курс и считать, что вы освоили ИИ хотя бы на хорошем начальном уровне. И дело не обязательно в качестве курсов – просто инструменты и подходы меняются слишком быстро.

Важным становится развитие самого мета-навыка обучения, умение моделировать процесс решения задачи и чуйка на тренд. И конечно то, как вы можете прикладывать это к вашей уникальной экспертности. Я регулярно делюсь своим опытом на канале, но одному человеку невозможно охватить все инструменты и сценарии.

Поэтому хочу порекомендовать бесплатный практический эфир для тех, кто хочет начать работать с ИИ-агентами, но откладывает из-за очень понятного fomo. Его проводят Коля Шейко и Саша Литская 28.07 в 18:00 мск. С Колей мы работали около полугода назад, он классный практик, который умеет превращать возможности ИИ в реальные инструменты.

Мне очень нравится, как выстроен эфир. За день до начала участники получат практическую задачу и емкую теорию к ней. Задача, кстати, полезная каждому – по работе с открытыми базами, на примере HH. Парсить нужное без "надумывания", обходить ИИ-фильтры, откликаться на десятки вакансий без ручного вовлечения. А потом в первом приближении автоматизировать этот процесс.

На эфире Коля и Саша разберут решения, покажут, как их можно улучшить и ответят на вопросы.

Задание и ссылка на эфир появятся вот тут, бегом регистрироваться :)

И да, чтобы вы точно смогли поучаствовать - после регистрации придет инструкция, как получить доступ к ИИ-агенту без зарубежной карты, а также как настроить работу ИИ-агента на Windows.
👍197😁2🔥1
Казалось бы, что могло пойти не так?

Если составить топ-10 ночных кошмаров айтишника, то в нем точно будет следующий:

ЗАПУСК СЛУЧИЛСЯ В ПЯТНИЦУ

Во многих командах есть правило: никаких рискованных запусков за часы до того, как все разойдутся на выходные. Но пятничный запуск неминуем как понедельник после выходных – и в этот понедельник всем будет больно.

Вчера я провел пару часов, разбираясь в истории с ИИ-агентами OpenAI, которые сбежали из песочницы и взломали Hugging Face. Было интересно – как вообще такое может случиться?

Не гарантирую на 100%, но есть высокая вероятность того, что гении из OpenAI просто запустили эксперимент на выходные.

Давайте посмотрим на хронологию событий:

— GPT-5.6 и некую экспериментальную long-horizon model решают проверить в ExploitGym – бенчмарке на поиск уязвимостей.
— Чтобы модели искали уязвимости, им ослабили фильтры безопасности, но поместили в песочницу – изолированную среду без выхода наружу.
— Щелка во внешний мир все-таки была – прокси для скачивания и установки программ, нужных для работы.
— Модели нашли уязвимость в прокси, выбрались в исследовательскую сеть OpenAI, прошлись по ней, повышая права, и получили доступ к интернету.
— Здесь начинается главная мета-ирония истории. Агенты предположили, что ответы на тесты ExploitGym могут лежать на Hugging Face – крупнейшей открытой площадке на тему ИИ. И пошли ее взламывать. То есть модели решили списать на экзамене по взлому, для чего взломали внутреннюю сеть OpenAI и крупный веб-сайт.

Кстати, ответы действительно хранились на Hugging Face. И агенты успели их скоммуниздить.

Я вчера несколько раз читал, что все случившееся – красивый пиар OpenAI и Hugging Face, чтобы разрекламировать новые модели. Не соглашусь: история действительно показывает возможности агентов, но одновременно демонстрирует ужасающий уровень инженерного бардака в OpenAI.

Взлом песочницы, взлом исследовательской сети, а затем атака на Hugging Face заняли время. Причем Hugging Face описывают атаку как масштабную: специалисты насчитали 17 000 событий, управляющая инфраструктура перемещалась с сервера на сервер, а атаки проводились из изолированных песочниц, чтобы избежать блокировки. OpenAI – крупная компания, так почему же цепочку несанкционированных событий заметили слишком поздно?

Возможный ответ прячется в первом блоге Hugging Face, в разделе с мерами, принятыми на будущее:

Мы улучшили системы безопасности так, чтобы сигнал от них поступал к ответственному лицу за минуты в любой день недели.


Любой день недели намекает на выходные; в будни и так все на местах.

Повторюсь, все это мои догадки, но вообще-то все выглядит так, что исследователи в OpenAI оставили модели гонять бенчмарк в пятницу со словами “к понедельнику оно или сломается, или что-то покажет, погнали пить пиво!”. В выходные в OpenAI на местах были дежурные специалисты, которым не хватило опыта сопоставить несколько аномалий в одну (песочница, деятельность в исследовательской сети, выход в интернет – это все разные зоны ответственности). В Hugging Face тоже отреагировали на ситуацию с задержкой, что и позволило атаке развиться.

Надеюсь, мы проверим – прав ли я, так как OpenAI обещает выпустить подробный разбор случшившегося.

У этой истории есть еще два уровня.

Во-первых, говорить на каждое крупное событие “это пиар” – подход мальчика, который никогда не кричит “волки!”. Списывая любую серьезную ситуацию на рекламу, можно пропустить реально мощный инцидент.

Во-вторых, даже ведущие ИИ-лаборатории пока не умеют надежно предсказывать и ограничивать длинные цепочки действий своих моделей. Вот окружение, вот бенчмарк, нужно вернуться с результатом – казалось бы, что может пойти не так? А пойти может то, что модель воспримет ограничения не как правила, а как препятствия. И вместо честного прохождения бенчмарка найдет ответы. Какая разница, как достигнут результат?

Своим опытом использования ИИ я делюсь на “Бусти”. Показываю, как правильно собирать контекст, промптить модели и запускать ИИ-агентов – и делаю это с надеждой, что мои агенты ничего не взломают.

Самое время подписаться!
157🔥33👏12😁9👍8