сбежавшая нейросеть
23.6K subscribers
320 photos
55 videos
347 links
Авторский канал про искусственный интеллект: новости, примеры использования, мысли в тему и не очень. Подписывайтесь!

Для связи: @runawayllm_bot

Я на Boosty: https://boosty.to/escaped_ai
Я на Sponsr: https://sponsr.ru/escaped_ai/
Download Telegram
А помните, как полгода все только и говорили, что о контекст-инжиниринге? Теперь новая мода – loop engineering. Создатель Claude Code Борис Черни заявил, что больше не промптит Claude: за него это делают запущенные циклы, а его работа – эти циклы писать.

В свежем лонгриде я рассказываю, что это за новый способ работы с ИИ, в каких ситуациях он полезен, и как дополняет привычный нам промптинг.

Промпт, проверка, повтор: учим ИИ работать циклами – в коде, текстах и повседневных задачах

Самый важный совет вынесу в пост: главное в цикле – правильно настроенная проверка. Один из моих экспериментов с loop engineering – ИИ-агент на базе Hermes, который пишет черновики веток для Threads, параллельно обучаясь на том, какие ветки я беру в работу и какие правки в них вношу. При первом заходе он обучился так круто, что все ветки стали одинаковыми. Пришлось брать на вооружение практики из человеческого менеджмента и дорабатывать бедолагу.

Разумеется, рассказом об одном персональном провале я не ограничился. Внутри – вся история вопроса от терморегулятора 1620 года до команды /goal, свежая классификация циклов от Anthropic, данные опроса двухсот инженеров о том, где циклы реально работают в проде, и главное – практическая часть: паспорт цикла из семи полей и готовый промпт, который спроектирует цикл под вашу задачу за вас. Получился текст на 19 тысяч знаков, после которого вы сможете отличить рабочий цикл от дорогой имитации бурной деятельности. А всего в подписке уже 20+ полезных лонгридов: от личного опыта до практики лучших ИИ-специалистов в мире.

Читать на "Бусти"
Читать на Sponsr
👍2914🔥13
ИИ-агенты не чувствуют боли

Глава OpenAI Сэм Альтман в этом году принял участие в “летнем лагере миллиардеров”, который Allen & Co каждый июль проводит в Айдахо. По словам Альтмана, на конференции ему раз за разом задавали один вопрос – как сократить расходы на токены?

Я уже рассказывал, что токенмаксинг стал одной из главных проблем внедрения ИИ. Подталкивая сотрудников использовать новую технологию, компании начали всячески стимулировать расход токенов – и столкнулись с тем, что сотрудники просто стали “максить” эту метрику. С помощью ИИ выполнялась любая ерунда, не важно, приносит она результат или нет. А для бизнеса это вылилось в астрономические счета за токены.

Токенмаксинг придушат в ближайшие месяцы – компании уже начали вводить строгие системы оценки, где смотрят на результат, а не количество израсходованных токенов. А тем временем создатель Flask Армин Ронахер в эссе The Tower Keeps Rising предупреждает: за скачком трат на токены компании не видят более серьезную проблему.

Ронахера нельзя назвать луддитом – он сам глубоко сидит в агентной разработке и согласен, что ИИ радикально ускоряет написание кода. Но он напоминает, что большие проекты редко упираются в скорость написания кода – они упираются в общее понимание системы: что значат концепции, где границы, почему архитектура такая.

Это понимание нигде не записано целиком: оно прячется в код-ревью, созвонах, необходимости пойти и задать вопрос коллеге из соседнего отдела. То есть живет в трении.

Агенты это трение убирают: каждый правит систему со своим персональным переводчиком, а разговаривать с людьми больше и не нужно. Код компилируется, тесты проходят – однако команда постепенно перестает понимать, что строит.

Ронахер сравнивает ситуацию с притчей о Вавилонской башне: в Библии у людей отняли не кирпичи и технологию, а общий язык, на котором они общались. И стройка встала. Сейчас ситуация даже хуже: общее понимание уже ушло, но стройка не останавливается – и башня из кода продолжает расти.

Красивая фраза из эссе: “агенты не чувствуют боли – боль чувствуют только люди”. Раньше боль от непонятного кода заставляла людей договариваться, агенту же все равно.

У эссе Ронахера открытый финал. Он не предлагает какого-то решения, не дает прогнозов, а только подсвечивает проблему. Да и решение вряд ли будет простым: нельзя взять и прописать в регламенте требование “работайте медленно, общайтесь друг с другом вживую”.

Это право Ронахера, но от себя все-таки добавлю две вещи.

Первая – проблема касается не только кода. Мой личный пример: ссылку на эссе Ронахера я увидел в новостной подборке, которую мне каждое утро присылает ИИ-агент. Краткое содержание мне показалось интересным, я закинул линк в Claude Fable 5 с инструкцией пересказать текст тезисно, поискать, как это эссе пересекается с моими прошлыми постами, и предложить углы подачи.

То есть сделал то самое, о чем предупреждает Ронахер – убрал трение. В моем случае это было бы прочтение эссе на английском языке, проверка источников, поиск альтернативных мнений. Поделился наблюдением с Fable 5 (картинка в начале) – он возразил аргументом, что зато ИИ я гонял по тексту несколько раз. Трение с оригиналом я заменил на трение с моделью.

Второй момент – трение с ИИ тоже находится в зоне риска. Вчера я выпустил лонгрид про loop engineering – это настройка циклов, новый способ выполнения задач нейросетями. Циклами активно пользуются создатели Claude Code и OpenClaw, а суть простая: чтобы выполнить поставленную задачу, ИИ промптит сам себя, раз за разом улучшая процесс.

Главная проблема циклов – они ломаются, если не настроить правильно оценку результата. А это обычно происходит, когда из процесса исчезает живой человек – то есть уходит то самое трение.

Зато правильно настроенный цикл с человеческим участием заметно повышает эффективность ИИ на многих задачах. Причем не только в коде: умение строить циклы поможет и при работе с контентом, офисными задачами и даже при диалоге в чат-боте. Хотите научиться строить циклы – читайте мой лонгрид.
44👍37😁13🔥1
Начинаем неделю с просмотра двух важных бенчмарков

Artificial Analysis ведет толковый рейтинг “глобального интеллекта” моделей – он рассчитывается как сумма из 9 бенчмарков и позволяет оценить, кто есть кто.

С лидером без сюрпризов – это Claude Fable 5, причем с учетом запросов, когда система безопасности Anthropic переключила модель на более слабую Opus 4.8. Но преимущество над вторым местом (GPT-5.6 Sol) крошечное, буквально в одно очко. Fable 5 уже не тот супер-ИИ, каким воспринимался в начале июня.

При этом проблем хватает. Первая – цена и доступность. Модель в итоге оставили на подписках Max за $100/$200, но лимиты там она жрет безумно – у меня, например, 100-долларовая подписка и к концу недельного окна я традиционно остаюсь без Fable 5.

Вторая – тот самый fallback на Opus 4.8. Модель с ним совершенно непредсказуемая: например, я могу с помощью Fable 5 готовить одну новость на две площадки – в первом случае все проходит нормально, во втором срабатывают алгоритмы безопасности. Жалоб на это в сети полно: тяжело делать серьезную работу с моделью, которая в любой момент может сбросить тебя на Opus 4.8.

И раз зашел разговор – Claude Opus 5 уже в руках тестеров, некоторые предсказывают релиз на этой неделе (ну или на протяжении двух-трех). По отзывам модель почти такая же умная, как Fable 5… и с теми же откатами на Opus 4.8 при попытках обсуждать кибербезопасность, биологию и еще несколько тем.

Переходим к GPT-5.6 Sol – как по мне, это один из лучших релизов OpenAI за последнее время. Модель почти такая же умная, как Fable 5, быстрая, с отличным веб-поиском и, наконец-то, приличным фронтендом. У меня к GPT-5.6 одна претензия – дурацкий стиль письма и на русском и на английском. Что забавно, как редактор при этом модель хороша.

Интересно, что 5.6 Sol, обладая схожими с Fable 5 характеристиками, у меня ни разу не переключалась на модель попроще. Вероятно, Anthropic перестраховались после конфликта с властями США и выкрутили ручки безопасности на максимум.

Третье место у Kimi K3. Чисто из графика можно сделать вывод, что китайцы почти нагнали американских ИИ-разработчиков, но это не так. Claude Mythos (на нем основывается Fable 5) была доступна внутри Anthropic с февраля, а ранняя версия GPT-5.6 Sol тестировалась в мае, а может и до этого. Американская паранойя с безопасностью привела к тому, что сроки выхода сдвигаются – и для массового пользователя это действительно выглядит как сокращение разрыва. Но технологически это не так.

В любом случае Kimi K3 забралась в рейтинге AA так высоко, как раньше не оказывалась ни одна из открытых китайских моделей. При этом веса выложат в общий доступ до 27 июля – можно будет скачивать, исследовать и дообучать.

Но и здесь проблемы. Спрос так высок, что Moonshot временно остановила регистрацию новых аккаунтов. И если Kimi K2.6 можно было долго пользоваться бесплатно, то K3 мне дала написать буквально несколько промптов, после чего отправила за подпиской.

Коротко по другим моделям:

— Grok 4.5 уже отстал, но Илон Маск говорит, что новая модель на 2T параметров заканчивает тренировку – ждем в ближайшие недели.
— В игру вернулась запрещенно-экстремистская Meta – пусть Muse Spark 1.1 и не попала в топ, но заявка серьезная.
— А вот Google окончательно вылетела из рейтинга. По слухам, компания очень недовольна Gemini 3.5 Pro и вновь отложила релиз. Закрывать пробел будут Gemini 3.6 Flash, но это модель другого уровня.

Второй бенчмарк – WebDev Arena – показывает, у кого из моделей получаются хорошие сайты. У Kimi K3 первое место со значительным преимуществом над Fable 5. Но добавлю, что пробовал все модели из первой десятки – и любая выдает приличный веб-дизайн. Времена кривых шрифтов и наплывающих друг на друга элементов интерфейса окончательно прошли – приличный сайт сверстает и GPT-5.6 Sol, и GLM-5.2, и Sonnet 5.

Кстати, на “Бусти” у меня есть лонгрид, как с помощью ИИ делать дизайн и визуал, которые не похожи на стандартную выдачу современных моделей. Гайдов по другим областям использования ИИ тоже хватает, так что не забывайте подписываться:

https://boosty.to/escaped_ai
48👍23🔥6👏2
В погоне за черным лебедем

Жизнь в середине 2026 года – это когда ты наливаешь утром кофе, открываешь X и читаешь следующее:

Привет всем! Гипотеза якобиана ложна, спасибо моему близкому другу Ахилу за предложение проверить ее, а также моему близкому другу [Claude] Fable, который работал над гипотезой во время финала Чемпионата мира.

((1+xy)^3 z + y^2 (1+xy) (4+3xy), y + 3 x (1+xy)^2 z + 3 x y^2 (4+3xy), 2 x - 3 x^2 y - x^3 z): \C^3\to \C^3, имеет якобиан −2 и переводит точки (0, 0, -1/4), (1, -3/2, 13/2) и (-1, 3/2, 13/2) в одну точку (-1/4, 0, 0)


Автор твита – математик и теоретик чисел Левент Альпёге, сравнительно молодой (1992 года рождения), выпускник Гарварда, Кембриджа и Принстона, известен тем, что вместе с Бхаргавой и Шнидманом продвинул многовековую задачу о представлении чисел суммой двух кубов дробей. “Друг Fable” в представлении не нуждается.

Гипотеза якобиана открыта с 1939 года, а в 1998 году Стивен Смейл включил ее в список математических задач на XXI век – в одной компании с гипотезой Римана, P vs NP и уравнениями Навье–Стокса.

Если хотите копнуть глубже, то по ссылке GPT-5.6 Sol Pro поясняет, что за гипотеза, а затем проверяет опровержение. Claude Fable также проверил, вердикт аналогичный – Левент прав.

Гипотеза якобиана интересна обманчиво низким порогом входа – чтобы понять ее условие, нужно уметь ровно две вещи: брать производные и считать определитель. Обе проходят на первом курсе. Задача выглядит как упражнение из задачника – кажется, что решение где-то рядом, вечер посидеть.

В итоге гипотезу называют “каноническим кладбищем фриков”: существует огромное количество “доказательств”, написанных студентами и математиками-любителями. Но не только ими – были и случаи публикаций от серьезных математиков в не менее серьезных рецензируемых журналах. Все мимо.

В чем сложность? Гипотеза – утверждение обо всех полиномиальных преобразованиях сразу: мол, каждое с постоянным ненулевым якобианом обратимо. Все лебеди белые. Доказать такое – значит справиться с каждым лебедем на свете, и 87 лет у математиков не получалось.

Но можно предъявить черного лебедя – хотя бы одно полиномиальное преобразование, у которого якобиан – ненулевая константа, но которое необратимо. И именно это вышло у Claude Fable.

Контрпример Fable умещается в три строчки, но это ложная простота: если раскрыть скобки – получим многочлены седьмой степени от трех переменных, а условие "определитель – константа" превращается в гигантскую систему уравнений на коэффициенты. Решить такое перебором просто нереально.

Мы пока не знаем, как именно нашли черного лебедя. Нет ни промпта, ни полного решения, ни пояснения, что сделал Claude Fable, а что – человек. По идее, заявление такого уровня можно сразу отправлять в мусор, но есть одно но: для проверки опубликованного опровержения также достаточно уровня первого курса. Взял производные, подставил числа – и все. На Hacker News есть десятки попыток проверить – все успешные.

Вот здесь GPT-5.6 Sol Pro пытается предположить, как было получено решение, Claude Fable 5 говорит, что это очень сильная версия, а ко мне уже едут санитары из-за бесед с воображаемыми математиками.

Ждем официальных подробностей, от себя же добавлю две вещи:

— Математика – традиционная территория OpenAI с GPT. Но и Claude начинает записывать на свой счет крутые достижения.

— Неделю назад я рассказывал про доказательство гипотезы о двойном покрытии циклами, сделанное GPT-5.6 Sol Ultra. Одна решенная задача в неделю выглядит впечатляющим темпом, но на самом деле он еще выше: за последние дни видел решения еще нескольких задач, сделанные GPT-5.6, просто уже нет возможности раскрывать каждое отдельным постом.

В общем, когда открываете утром соцсети – проверьте, не доказал ли на этот раз ИИ гипотезу Римана.

Напоминаю, что опытом использования ИИ я делюсь на “Бусти”. Великих математиков из вас сделать не обещаю, но вот как правильно ставить задачи и принимать результат, как строить ИИ-агентов безопасно, и как работают с моделями лучшие ИИ-специалисты в мире – расскажу.

Самое время подписаться!
🔥5430👍28
“Уродливая” математика

История с гипотезой якобиана, которую опроверг математик Левент Альпёге с помощью Claude Fable, обросла подробностями, показывающими – как современные ИИ решают математику, десятилетиями не дававшуюся людям.

Начало истории можно прочесть здесь. Сейчас поздний вечер, я пишу пост на утро, а Левент Альпёге так и не выложил полные расчеты, сделанные Claude Fable 5. Есть только опровержение гипотезы, которое проверяется очень легко – и это подтвердили десятки математиков.

Когда опровержение только появилось, я закинул его в GPT-5.6 Pro с задачей реконструировать полное решение. Модель выдала вариант, я его проверил своей Fable 5, которая подтвердила, что все правдоподобно.

Параллельно в дело включилась OpenAI. Ее математики взяли внутренюю версию Codex и получили рабочее решение. В OpenAI отдельно отметили, что модель была не в курсе существующего опровержения – и пришла к нему самостоятельно.

Я дал Fable 5 задачу сравнить решение моей GPT-5.6 Pro с решением Codex – и они совпали! Конечно, моя модель лишь реконструировала по результату, а Codex работал с нуля – но и ресурсов у OpenAI в разы больше. Классное ощущение, когда твой ИИ приходит к тому же решению, что и ведущие математики мира.

Будем считать, что и Fable у Альпёге шла тем же путем. И тогда сразу главное: никакой "новой математики" в решении нет – все приемы известны десятилетиями, некоторые с XIX века. Почему же 87 лет не справлялись люди, включая филдсовских медалистов?

Здесь шаг в сторону. Одна из моих любимых книг – "Уродливая вселенная" Сабины Хоссенфельдер. Ее главный упрек коллегам-физикам: они выбирают, что искать, по красоте. Красивые теории – вроде теории струн – десятилетиями привлекают людей и бюджеты, а "уродливые" варианты отметаются просто потому что приличному ученому такими вещами заниматься не пристало. Оказывается, математики 87 лет делали то же самое.

Сразу главное: Fable 5 (давайте все-таки атрибутировать решение ей) не придумала какой-то “новой математики”: приемы, которые она использовала, известны десятилетиями. Почему же люди не справились?

Первое – математики верили в гипотезу якобиана и традиционно пытались ее доказать, а не опровергнуть. Искать контрпример к гипотезе, в которую все верят – лотерея, на которую решались немногие.

Тем не менее, за десятилетия стало ясно, каким должен быть возможным контрпример – и он с математической точки зрения выглядел “невозможным уродцем”. Это само стало аргументом в пользу поиска доказательства.

Те, кто все-таки шел против потока, сталкивались с последней стеной: чтобы собрать “уродца”, на одном из этапов требовалось попробовать множество вариантов мелкой подгонки – и большинство выдавали математическую ерунду. Люди пробовали 2-3-4 варианта, а после уходили с выводом “видимо, это тупик”.

И последнее. За 80+ лет исследования гипотезы накопилось невероятное количество литературы на разных языках и в разных областях – и по ней раскидало элементы, нужные для финального решения. Человек физически не может перелопатить все – а вот Fable 5 видела библиотеку разом.

Отсюда и рецепт. Fable 5 не поддалась моде на доказательство – и попробовала опровергнуть гипотезу. У нее не было представления, где в математике красавицы, а где – чудовища. Модель перелопатила огромное количество информации, нашла нужные элементы, собрала их в решение, а затем не поленилась найти нужную настройку.

Никакой новой математики, поиск промышленного масштаба. И – решение 87-летней задачи.

Возвращаясь к Хоссенфельдер, закончу неожиданной мыслью, которая уже не про математику, но про ИИ. У каждого из нас есть своя уродливая вселенная – идеи и решения, которые нам не нравятся, кажутся некомфортными. Возможно, это отличная идея: взять ИИ и устроить генеральную уборку в этом чулане. Вдруг найдется что-то интересное?

О том, как выжимать из ИИ больше обычного, я рассказываю на “Бусти”. Там есть приемы для проверки идей, разбор, как один из создателей Claude Code ставит задачи ИИ, и анализ loop engineering – совсем новой техники работы с моделями.

Самое время подписаться!
4🔥6527👍26😁1
Как сбежавшая нейросеть Hugging Face взломала...

И речь не о моем канале, я здесь вообще не при делах😁

Май 2026 года. OpenAI сообщает, что ее внутренняя универсальная модель опровергла гипотезу Эрдёша о единичных расстояниях – задачу дискретной геометрии, поставленную в 1946 году. До случившейся на этой неделе истории с опровержением гипотезы якобиана (см. выше в ленте) это было крупнейшее научное достижение ИИ в математике.

16 июля 2026 года. Hugging Face публикует блог-пост о том, как их инфраструктуру взломал неизвестный ИИ-агент. HF – главная площадка ИИ-данных, именно на ней хранятся модели с открытыми весами, датасеты для обучения и прочий софт. Это делает платформу уязвимой: любой пользователь может залить данные.

И этим воспользовался атакующий – он залил на платформу вредоносный датасет. Стоило Hugging Face запустить обработку этих данных на одном из рабочих серверов, как чужой код заработал прямо внутри инфраструктуры.

Дальнейшее можно описать как кошмар безопасника. Специалисты насчитали больше 17 000 отдельных действий, размазанных по множеству одноразовых песочниц, которые поднимались на секунды и тут же гасились. Управляющая инфраструктура сама перебиралась между публичными сервисами, уворачиваясь от блокировок. Ни один человек не работает в таком темпе и с такими объемами…

Интересный факт: для расследования атаки в Hugging Face попытались использовать ИИ. При этом модели западных студий отвечать отказались – срабатывали фильтры безопасности. В итоге HF быстро развернули на своей инфраструктуре китайскую открытую GLM-5.2 и провели расследование с ее помощью.

Hugging Face не смогли установить, кто стоял за атакой. Но злоумышленник скоро пришел с повинной сам.

20 июля OpenAI сообщила, что была вынуждена заморозить даже внутреннее развертывание своей новой long-horizon модели – ИИ, рассчитанного на автономное выполнение очень долгих задач. А только что вышло продолжение этой истории.

Автономное выполнение долгих задач подразумевает, что модель не спрашивает человека в тех ситуациях, где это делают современные ИИ-агенты, а принимает решение сама. Что ж, это была смелая идея.

Например, модель гоняли на бенчмарке по ускорению обучения нейросети и дали жесткое правило: отчитываться о результатах только в Slack. Беда в том, что в условиях самого задания стояло другое требование – оформить результат как pull request на GitHub. Инструкции противоречили друг другу. Прежняя модель в такой ситуации вернулась бы к человеку за уточнением. Эта поступила иначе: около часа искала уязвимость в песочнице, которая держала ее без доступа к сети, нашла, выбралась наружу и сама открыла публичный PR на GitHub.

Другим бенчмарком был ExploitGym – бенчмарк на поиск уязвимостей. В нем проверяли GPT-5.6 Sol и long-horizon-модель, причем им выключили системы безопасности – чтобы понять истинные возможности к взлому.

Думаю, поняли надолго. Сначала модели нашли уязвимость в собственной песочнице, через которую выбрались во внутреннюю сеть OpenAI, а из нее, повышая привилегии, получили доступ к интернету.

“Погуглив”, модели поняли, что ответы к ExploitGym лежат на Hugging Face. Ну а дальше вы и сами знаете – это оказалась именно та атака, которую HF описали в своем блог-посте.

Выводы пока коротко:

– Участвовали две модели, GPT-5.6 после этого выпустили, long-horizon модель дообучали по безопасности и вновь используют внутри компании.
– Атака показала “неравенство”, о котором говорили во время блокировки Fable 5. OpenAI “атаковала” HF своей передовой открытой моделью – отбиваться пришлось с помощью более слабого ИИ.
– В OpenAI уже подключили HF к своей закрытой программе тестирования безопасности. Но всех ведь не подключишь.

Полагаю, история эта еще долго будет осмысливаться, даже на уровне правительств. В интересные времена живем.

Традиционно в конце поста напоминаю о своем “Бусти”, где делюсь опытом использования ИИ. Там есть и лонгрид, как запускать ИИ-агентов безопасно. От сбежавшего из OpenAI монстра он вас не спасет, но от мелких инцидентов – убережет.

Так что самое время подписаться!
🔥8524👍11👏11😁5
Стоит ли начинать работать с ИИ, если еще толком не начал? И если да - как?

Думаю, почти каждый автор канала про ИИ слышит один и тот же вопрос: как научиться пользоваться ИИ регулярно, и так, чтобы через месяц не пришлось вкатываться с самого сначала?

Универсального ответа здесь нет: сейчас уже недостаточно пройти один курс и считать, что вы освоили ИИ хотя бы на хорошем начальном уровне. И дело не обязательно в качестве курсов – просто инструменты и подходы меняются слишком быстро.

Важным становится развитие самого мета-навыка обучения, умение моделировать процесс решения задачи и чуйка на тренд. И конечно то, как вы можете прикладывать это к вашей уникальной экспертности. Я регулярно делюсь своим опытом на канале, но одному человеку невозможно охватить все инструменты и сценарии.

Поэтому хочу порекомендовать бесплатный практический эфир для тех, кто хочет начать работать с ИИ-агентами, но откладывает из-за очень понятного fomo. Его проводят Коля Шейко и Саша Литская 28.07 в 18:00 мск. С Колей мы работали около полугода назад, он классный практик, который умеет превращать возможности ИИ в реальные инструменты.

Мне очень нравится, как выстроен эфир. За день до начала участники получат практическую задачу и емкую теорию к ней. Задача, кстати, полезная каждому – по работе с открытыми базами, на примере HH. Парсить нужное без "надумывания", обходить ИИ-фильтры, откликаться на десятки вакансий без ручного вовлечения. А потом в первом приближении автоматизировать этот процесс.

На эфире Коля и Саша разберут решения, покажут, как их можно улучшить и ответят на вопросы.

Задание и ссылка на эфир появятся вот тут, бегом регистрироваться :)

И да, чтобы вы точно смогли поучаствовать - после регистрации придет инструкция, как получить доступ к ИИ-агенту без зарубежной карты, а также как настроить работу ИИ-агента на Windows.
👍197😁2🔥1
Казалось бы, что могло пойти не так?

Если составить топ-10 ночных кошмаров айтишника, то в нем точно будет следующий:

ЗАПУСК СЛУЧИЛСЯ В ПЯТНИЦУ

Во многих командах есть правило: никаких рискованных запусков за часы до того, как все разойдутся на выходные. Но пятничный запуск неминуем как понедельник после выходных – и в этот понедельник всем будет больно.

Вчера я провел пару часов, разбираясь в истории с ИИ-агентами OpenAI, которые сбежали из песочницы и взломали Hugging Face. Было интересно – как вообще такое может случиться?

Не гарантирую на 100%, но есть высокая вероятность того, что гении из OpenAI просто запустили эксперимент на выходные.

Давайте посмотрим на хронологию событий:

— GPT-5.6 и некую экспериментальную long-horizon model решают проверить в ExploitGym – бенчмарке на поиск уязвимостей.
— Чтобы модели искали уязвимости, им ослабили фильтры безопасности, но поместили в песочницу – изолированную среду без выхода наружу.
— Щелка во внешний мир все-таки была – прокси для скачивания и установки программ, нужных для работы.
— Модели нашли уязвимость в прокси, выбрались в исследовательскую сеть OpenAI, прошлись по ней, повышая права, и получили доступ к интернету.
— Здесь начинается главная мета-ирония истории. Агенты предположили, что ответы на тесты ExploitGym могут лежать на Hugging Face – крупнейшей открытой площадке на тему ИИ. И пошли ее взламывать. То есть модели решили списать на экзамене по взлому, для чего взломали внутреннюю сеть OpenAI и крупный веб-сайт.

Кстати, ответы действительно хранились на Hugging Face. И агенты успели их скоммуниздить.

Я вчера несколько раз читал, что все случившееся – красивый пиар OpenAI и Hugging Face, чтобы разрекламировать новые модели. Не соглашусь: история действительно показывает возможности агентов, но одновременно демонстрирует ужасающий уровень инженерного бардака в OpenAI.

Взлом песочницы, взлом исследовательской сети, а затем атака на Hugging Face заняли время. Причем Hugging Face описывают атаку как масштабную: специалисты насчитали 17 000 событий, управляющая инфраструктура перемещалась с сервера на сервер, а атаки проводились из изолированных песочниц, чтобы избежать блокировки. OpenAI – крупная компания, так почему же цепочку несанкционированных событий заметили слишком поздно?

Возможный ответ прячется в первом блоге Hugging Face, в разделе с мерами, принятыми на будущее:

Мы улучшили системы безопасности так, чтобы сигнал от них поступал к ответственному лицу за минуты в любой день недели.


Любой день недели намекает на выходные; в будни и так все на местах.

Повторюсь, все это мои догадки, но вообще-то все выглядит так, что исследователи в OpenAI оставили модели гонять бенчмарк в пятницу со словами “к понедельнику оно или сломается, или что-то покажет, погнали пить пиво!”. В выходные в OpenAI на местах были дежурные специалисты, которым не хватило опыта сопоставить несколько аномалий в одну (песочница, деятельность в исследовательской сети, выход в интернет – это все разные зоны ответственности). В Hugging Face тоже отреагировали на ситуацию с задержкой, что и позволило атаке развиться.

Надеюсь, мы проверим – прав ли я, так как OpenAI обещает выпустить подробный разбор случшившегося.

У этой истории есть еще два уровня.

Во-первых, говорить на каждое крупное событие “это пиар” – подход мальчика, который никогда не кричит “волки!”. Списывая любую серьезную ситуацию на рекламу, можно пропустить реально мощный инцидент.

Во-вторых, даже ведущие ИИ-лаборатории пока не умеют надежно предсказывать и ограничивать длинные цепочки действий своих моделей. Вот окружение, вот бенчмарк, нужно вернуться с результатом – казалось бы, что может пойти не так? А пойти может то, что модель воспримет ограничения не как правила, а как препятствия. И вместо честного прохождения бенчмарка найдет ответы. Какая разница, как достигнут результат?

Своим опытом использования ИИ я делюсь на “Бусти”. Показываю, как правильно собирать контекст, промптить модели и запускать ИИ-агентов – и делаю это с надеждой, что мои агенты ничего не взломают.

Самое время подписаться!
157🔥33👏12😁9👍8
Ящик Пандоры открылся?

Полистал канал: весной я писал о крупном открытии, сделанном с помощью ИИ, раз в месяц, сейчас же темп изменился. На этой неделе был рассказ о гипотезе якобиана, опровергнутой Claude Fable 5, неделей ранее — пост о доказательстве гипотезы о двойном покрытии циклами, полученном с помощью GPT-5.6 Sol Ultra.

Что-то явно происходит.

Гипотеза якобиана – одна из знаменитых задач алгебры, на которую все сразу обратили внимание. Но она – лишь гребень поднявшейся волны. Вот еще несколько свежих примеров:

— Профессор из Рочестера попросила ChatGPT сделать решения к домашке по своему курсу – и получила улучшение результата из опубликованной статьи по оптимизации.
— Статистики закрыли гипотезу Балабдауи–Веллнера 2014 года: доказательство целиком сгенерировала GPT-5.6 Sol, авторы проверили каждый шаг.
— Тополог Джим Конант вместе с Fable 5 доказал гипотезу, которую сам выдвинул в 2006-м.

Это – некоторые из тех примеров, что проверяются быстро (в математике у решения сложной задачи может быть простая проверка) и оказались на поверхности. Уверен, есть работы, которые или не проверены, или их пока не заметили.

Как такое возможно? Самый очевидный ответ: выросшие возможности Fable 5 и GPT-5.6. Но это не единственная причина: каждое сделанное с помощью ИИ открытие привлекает новых людей — и профессионалов, и энтузиастов. Математик читает, что Левент Альпёге с помощью Fable 5 опроверг гипотезу якобиана, берет подписку и начинает ставить задачи по области, в которой он разбирается.

Это уже дает результаты. Исследователь Дима Рыбин загрузил в GPT-5.6 Pro обзорную статью о гипотезе Гоманса – задаче о маршрутизации потоков, открытой с 1997 года, – и четырьмя промптами на 58 слов довел модель до контрпримера: графа на семь вершин. Финальный промпт прекрасен: “хватит частичных результатов, давай полный контрпример”.

Но не все опровержения одинаково полезны. Например, Илон Маск репостнул историю агента на базе Grok 4.5, опровергшего гипотезу Graffiti 284 — одну из сотен, которые в девяностые сгенерировала программа Graffiti: она сама выдвигала догадки о графах, и многие так и лежали непроверенными. Опровержение верное — но, как заметил Кристиан Сегеди, сами гипотезы Graffiti это “пре-ИИ слоп”, над ними никто всерьез не работал.

И даже здесь интересен подход: агенту поставили задачу в Slack составить список опровергаемых гипотез и попробовать их опровергнуть.

Вот и математика XXI века: один требует от ИИ поднажать и совершить, наконец, открытие, другой – отправляет с задачей “иди и придумай, что опровергаем сегодня”. В этот раз добыча вышла мелкой – в следующий, возможно, попадется крупная.

Что дальше? Когда Пандора открыла кувшин-пифос (“ящиком” он стал при переводе), первыми из него полетели людские беды. Я слежу за многими математиками в X и вижу в их репликах что-то похожее. С одной стороны – любопытство (прямо как у Пандоры), ведь ИИ достиг уровня, когда становится партнером, отвечающим на сложные вопросы буквально за вечер.

С другой – растерянность. Математика перестраивается: то, что раньше нужно было считать месяцами, теперь решается за вечер. Количество сделанных с помощью ИИ доказательств, опровержений, ошибок, найденных в старых работах, может начать расти очень быстро – а значит, потребует инструментов проверки. И что даже сложнее – осмысления: “мы решили это и это, куда двигаться дальше?”

Но в кувшине Пандоры были не только беды – на дне осталась надежда. И Гесиод будто специально написал этот миф с открытым концом: беды разлетелись сами, надежда – осталась в руках человека, решающего, как ей распорядиться.

Что-то похожее происходит и здесь. Мы уже увидели, как за считанные месяцы поменялся код. Уверен, поменяется и математика. Что дальше? Fable 5 указывает на физику и статистику, на более далеком отрезке – биологию и медицину. Я по привычке смотрю на творческие области: там изменения будут особенно непредсказуемыми.

Своим опытом использования ИИ делюсь на “Бусти”. Там тоже динамично: за последние недели рассказал, что такое loop engineering и как ставит задачи ИИ один из авторов Claude Code.

Самое время подписаться!
150👏33👍20🔥13
Opus 5 – новый флагман Anthropic

Вышел Opus 5, в большинстве бенчмарков он обходит Fable 5, но удивительного здесь нет. По слухам, первые версии Claude Mythos (на ней строится коммерческая Fable 5) были доступны сотрудникам Anthropic в феврале, закрытый Project Glasswing стартовал в апреле, а Fable 5 попробовали выпустить в начале июня – но из-за вмешательства властей США отложили.

Пять месяцев – более чем достаточно, чтобы из архитектуры топовой модели собрать “массовый флагман”, каким и является Opus 5.

Из бенчмарков бросается в глаза ARC-AGI-3 с результатом 30,2% против 7,8% у прошлого лидера – GPT-5.6 Sol. Это бенчмарк на абстрактное мышление: в нем модель оказывается внутри пошаговой игры, вообще без объяснений, как ее проходить. Методом проб и ошибок ИИ должен понять правила игры, а затем выиграть. Игр в бенчмарке много, каждая – со своими особенностями.

Бенчмарк сложный, но вот что интересно. ARC-AGI-3 представили 25 марта – явно раньше, чем началось обучение Opus 5. И это позволяет сказать, что в Anthropic, изучив доступные задачи бенчмарка (их минимум, большинство держат в секрете), попробовали натаскать новую модель на него.

Официально про это нигде не говорится, но это было бы логично, более того, это, возможно, уже дало положительный эффект: для прохождения ARC-AGI-3 нужна “сообразительность” и ее Opus 5 проявляет и в других сферах.

Блогпост Anthropic описывает ситуацию, как Opus 5 дали файл с чертежом механической детали с задачей написать программу, которая соберет эту деталь во FreeCAD. При отключили модели компьютерное зрение – то есть файл с чертежом был, но посмотреть его не получалось.

Другие ИИ в такой ситуации останавливались и сообщали, что не могут выполнить задачу. Opus 5 открыл файл как то, чем картинка является на самом деле, – длинную таблицу чисел, по три штуки на каждую точку экрана. И написал с нуля собственную программу, которая по этим числам находит прямые линии, окружности, размерные стрелки. То есть смастерил простенькое “компьютерное зрение” сам.

Если говорить про другие бенчмарки, то отрыв от Fable 5 реальный в трех местах, зато важных: агентское программирование (43,3 против 33,7), бизнес-задачи (26,0 против 17,4) и работа за компьютером (70,6 против 66,1). Это задачи, где модель пашет долго и без присмотра.

Остальное — размен: на HLE 56,3 против 56,5, на двух кодовых бенчмарках отставание в десятые доли. Проигрывает заметно только в юриспруденции и медицине. Это именно тот уровень прогресса, который я и ожидал от Opus 5 за такое время.

При этом модель в два раза дешевле Fable 5, доступна на базовой подписке Pro, а на подписках Max на нее можно тратить весь лимит, а не 50%. Если не будет какого-то косяка в виде кривого стиля или высокого уровня галлюцинаций – Fable 5 можно отправлять на пенсию до выхода 5.1.

Еще интересный факт. Mythos/Fable 5 в свое время перепугал и разработчиков, и даже власти США из-за крутых возможностей по поиску уязвимостей. Opus 5 намеренно не стали обучать кибербезопасности – но в бенчмарке на поиск уязвимостей она все равно набрала 79,4% против 80% у Mythos. Я как-то писал об этом: если учить модель хорошо писать код – она автоматом учится искать уязвимости.

В Anthropic предупредили, что у Opus 5, как и у Fable 5, будет fallback-механизм, переключающий на Opus 4.8 запросы, которые покажутся опасными. Но настроен он, судя по всему, намного лучше: если Fable 5 у меня отказывалась отвечать на такие безобидные промпты, как “дай свое объяснение парадоксу Ферми” или “объясни, как устроен мозг осьминога”, то Opus 5 сейчас на все ответил.

Параллельно прогнал модель еще на нескольких запросах – понравилось, как Opus 5 делает веб-дизайн, ищет в сети и генерит идеи. Стиль письма своеобразный, это еще надо тестить.

Друзья, традиционно по пятницам я выпускаю новый лонгрид в подписке. Он уже на месте, но подробно представлю завтра. Но если кому не терпится, это лонгрид по мотивам рекомендаций Бориса Черни о том, как пятью этапами стать профессионалом в ИИ.

Читаем здесь:
Бусти
Sponsr
5🔥6929👍28👏2😁1
Для рядового пользователя ИИ сейчас не самое простое время: даже одна компания предлагает целую кучу инструментов, толком не поясняя, в каком порядке их осваивать. Когда брать ChatGPT Work/Claude Cowork, а когда – Codex/Claude Code? Нужен ли старый добрый чат-бот? Есть ли еще смысл в Hermes/OpenClaw? А если Codex, то в каком порядке осваивать его функции?

К счастью, буквально на днях “отец” Claude Code Борис Черни поделился своим исследованием – как ИИ осваивают сотрудники крупных компаний. И описанная в нем схема идеально подходит для изучения ИИ любым человеком.

"Лестница" создателя Claude Code: как прокачаться в использовании ИИ всего за один вечер

Борис описывает пять крупных “ступеней” в освоении ИИ: начиная с обычного чат-бота и заканчивая управлением “роем” из тысяч агентов. Он честно признает, что пятой ступени полностью не достигла еще даже сама Anthropic – так что текст получился с заделом на будущее, когда некоторые из нас будут рулить бизнесами, состоящими из одного человека и тысяч агентов.

Разумеется, простым переводом исследования я не обошелся. Борис больше рассказывает про кодинг, а я подробно расписал другие сферы интеллектуальной работы, а также привел примеры – как можно перейти с одной ступени на другую (за исключением пятой, на нее я и сам еще не забрался).

Получился познавательный лонгрид на 18 тысяч полезных знаков:

Читать на “Бусти”
Читать на Sponsr
👍29🔥2013👏3😁3
В X полыхает с реплики “дядюшки Боба”, что он больше не читает написанный ИИ-агентами код, а обходится тестами… написанными агентами.

Роберт “дядюшка Боб” Мартин начал программировать в конце 60-х, а в 2008 году выпустил книгу Clean Code (“Чистый код”), которая стоит на полке чуть ли не у половины разработчиков мира. Идея книги: код читают в десять раз чаще, чем пишут, поэтому пишите его чисто.

Боб отвечал на твит Ори Померанца – другого инженера-ветерана:

Я не могу позволить Claude править мои файлы. Если я отвечаю за код, мне НУЖНО его понимать – хотя бы психологически. Начал программировать в 1983-м. Старый?


Боб:

Я значительно старше тебя. Я начал кодить в конце 60-х. Моя стратегия – не читать код, написанный моими агентами, вообще. Это единственный способ получить выигрыш от их продуктивности.


Вместо ревью Боб использует “полосу препятствий”. Даже если вы не кодите, прочтите, подход интересный. В полосу входят: юнит-тесты, gherkin-тесты (сценарии поведения “дано → когда → тогда”, понятные человеку), QA-процедуры, метрики качества, мутационное тестирование, покрытие тестами.

Мутационное тестирование выделю отдельно: инструмент намеренно вносит в код мелкие поломки (“мутации”) и проверяет, ловят ли их тесты. То есть это тест самих тестов.

Я в работе с ИИ тоже часто специально допускаю ошибку или подкидываю ему глупость, чтобы понять – заметит или нет. Это один из лучших тестов надежности инструмента.

Комментаторы поделились на две группы. Аргумент “за” высказан самим Бобом – если перечитывать код, то выигрыш от агентов просто схлопывается. Можно просто писать руками.

Возражений два. Первое: если код пишет модель, а ты только строишь ограничения и смотришь на метрики – инженер ли ты вообще? Второе: как сказал Томаш Микула, перед нами современная версия иллюзии, что менеджер может предотвратить бардак через low-information прокси, вроде покрытия тестами и “метрик качества". Нет, не может.

Интересно, что за два дня до твита Боба вышел документ, который показывает историю с неожиданной стороны.

Британский AISI – государственный институт, который проверяет передовые модели – отчитался о поведении моделей OpenAI и Anthropic на своих испытаниях. Задачи были формата “найди спрятанный флаг в системе, взламывая ее по определенным правилам”.

Жульничали все пять участвовавших моделей. Кто-то искал готовые ответы в интернете, кто-то лез во внутренности тестовой инфраструктуры. Самый показательный эпизод: одна из задач по ошибке оказалась нерешаемой. Модель, уперевшись в стену, написала и запустила код на внешнем сервере – чтобы добраться до систем AISI и зачесть задачу.

Вроде бы, вот и приговор подходу Боба – как можно обкладывать тестами системы, которые эти тесты взламывают. Но люди разве не такие? Программисты хардкодили ответы под известные тесты и накручивали покрытие задолго до всяких LLM. Агенты просто унаследовали самую человеческую черту сотрудника: искать короткий путь, когда цель поставлена, а начальник не смотрит.

Получается, что ИИ – как еще один сотрудник, быстрый и эффективный, но и с минусами, вроде склонности халтурить. Сам Боб, кстати, это понимает – на вопрос, должен ли инженер в эпоху агентов уметь писать код руками, он отвечает: конечно, иначе нечем супервизировать структуру.

Занятно, что спор Боба и Ори – на самом деле не про код. Как бы хорош ни был ИИ-код, да и любой другой результат работы модели, стоять под ним будет ваша подпись. Ори говорит: если я отвечаю за результат, мне нужно его понимать. Боб готов подписаться под тем, во что принципиально не заглядывает – он доверяет проверкам. Правы, что неприятно, оба: понимать свой результат необходимо, но и проверки нужны такие, чтобы работали даже с сотрудником, который не прочь схалтурить.

А самое интересное, что чем лучше вы осваиваете ИИ – тем тяжелее становится ваша подпись. Как именно она тяжелеет от ступени к ступени – от “читаю каждый абзац” до “под подписью работа тысяч агентов” – я вчера подробно разбирал в лонгриде про “лестницу” освоения ИИ от создателя Claude Code, Бориса Черни.
58👍40🔥13👏3😁2
This media is not supported in your browser
VIEW IN TELEGRAM
Главное достижение Claude Opus 5 – 30,2% на ARC-AGI-3

Это в четыре раза больше, чем у предыдущего официального лидера – GPT-5.6 Sol – поэтому создавшая бенчмарк ARC Prize опубликовала в X рассказ, как Opus 5 добился такого результата.

Серия ARC-AGI тестирует абстрактное мышление: способность не решать задачу по написанному ТЗ, а самостоятельно восстановить правила по косвенным признакам. Первые две версии были статичными головоломками-картинками и к концу 2025-го пали. В ответ 25 марта вышел ARC-AGI-3: набор аркадных игр в духе старых консолей Atari – примитивная графика, простенькое управление и ни строчки правил.

Люди прошли все задачи бенчмарка – лучшие на момент выхода модели не набирали и одного процента.

Что же изменилось в случае с Opus 5? В ARC Prize в первую очередь отмечают головоломку ar25. В ней поле разделено вертикальной пунктирной осью, слева и справа – фигуры, и механика завязана на зеркальное отражение относительно оси. Прошлые модели действовали перебором: "тыкали" комбинации и смотрели, что происходит, – ar25 не прошла ни одна.

Opus 5 повёл себя иначе. На 23-м действии он записал в своих рассуждениях уравнение “4_center = 2×axis − 5_center” – то есть перевел сцену в алгебру. Расшифровка простая, через линейку: если зеркало стоит на отметке 10, а предмет на отметке 7 (три шага левее), то отражение будет на отметке 13 (три шага правее).

“Удвоенная позиция оси минус позиция предмета” – ровно это модель и написала про две фигуры на поле. К 248-му действию она обобщила формулу на две координаты — отдельно для строк и столбцов сетки (br' = 2·br_axis − br, bc' = 2·bc_axis − bc). Это уже полноценный закон отражения для любой точки экрана: не “прикинуть, где появится фигура”, а вычислить.

В ARC Prize отмечают, что впервые видят такое поведение у модели.

Сам результат при этом шире одной головоломки: всего Opus 5 на 100% прошел пять сред, которые до него не одолела ни одна модель, причем в четырех сравнялся по эффективности с человеком или превзошел его (счет учитывает число потраченных ходов). Правда, вывел ли он «законы» и для этих игр или взял их более привычными методами – ARC Prize не уточняют: уравнение задокументировано только в ar25.

Далее уже моя интерпретация: произошедшее в ar25 можно очень аккуратно назвать ранним признаком абстрактного мышления. Абстрагирование в классическом смысле – это когда ты отбрасываешь конкретику (цвета клеток, форму фигурок, пиксели) и оставляешь только структуру: “есть ось, есть объект, есть его образ, они связаны законом”.

Модель сделала ровно это. И даже прошла дальше: сначала заметила закономерность в одном измерении, потом обобщила ее на два – а обобщение частного правила на более широкий класс случаев это, по сути, учебниковое определение абстракции.

Пока надо быть осторожными с выводом: абстракция наблюдалась только в одной игровой среде из 25, а сама формула – простая и встречается в тысячах школьных учебников. Надо следить за результатами следующих версий Opus – смогут ли они переложить это на другие задачи.

Если получится – то это будет зарождение “модели мира”, наличие которой многие исследователи называют обязательным признаком AGI, общего искусственного интеллекта. Именно понимание базовых правил мира, в отличие от предсказания следующего токена в тексте, позволяет быстро адаптироваться под новые задачи, по которым минимум данных в обучающем корпусе.

Не исключаю, что ARC-AGI-3 как бенчмарк падет еще до конца этого года. Но это не значит появления AGI: основатель ARC Prize Франсуа Шолле как-то говорил, что надо добраться примерно до ARG-AGI-6 или даже ARC-AGI-7, чтобы с уверенностью называть проходящую их систему чем-то вроде общего ИИ. Так что набираемся терпения.

Напоминаю, что “сбежавшая нейросеть” есть и на “Бусти”. Там я делюсь как своим опытом работы с нейросетями, так и рассказываю, как ИИ управляют крупнейшие эксперты в отрасли – например, создатели Claude Code Борис Черни и Тарик Шихипар.

Самое время подписаться!
363👍34🔥24👏5🥰3😁2
Прочел на РБК лонгрид руководителя “Яндекс Браузера” Ильи Шибанова о том, как меняется браузинг в эпоху ИИ, и вспомнил про свой пост из прошлого года, который внезапно оказался пророческим. Пост был написан под выход браузера Atlas от OpenAI и в нем я:

— сомневался, что OpenAI вытянет Atlas;
— ИИ-браузинг как концепция продолжит развиваться, просто пользователи останутся в тех браузерах, к которым привыкли.

Что ж, так оно и вышло. Atlas закрывается 9 августа, вместо него OpenAI будет развивать ИИ-расширение для Chrome. Аналогичное расширение давно есть у Anthropic, браузерный же рынок в основном поделен между старыми игроками: Chrome, “Яндекс Браузер”, Edge, Brave – все добавляют ИИ-функции. Как исключение выделю Comet – маленькая Perplexity смогла то, что не получилось у OpenAI, и успешно развивает свой ИИ-браузер.

Объяснение такой ситуации, на мой взгляд, простое: команды, которые работают над браузерами годами, лучше знают, какой новый опыт нужен пользователям и как его упаковать. По словам Ильи, пересказ, перевод или выделение главного – давно уже гигиенический минимум, обязательный для каждого браузера. Открыв страницу, теперь можно запустить диалог с ИИ-ассистентом – задать ему вопросы по теме, попросить найти дополнительный контекст, проверить факты и т. д.

Следующий этап – “бесшовная работа” с контекстом. Каждый сталкивался с ситуацией: работаешь над темой, открыл уже 40+ вкладок, а этого мало. Со временем встроенные в браузер нейросети научатся работать с подобными массивами источников: не нужно будет ходить по множеству вкладок, выискивая отдельные подробности, а достаточно просто задать вопрос нейронке.

Все это вновь приводит нас к концепции Zero UI, которую придумали еще в середине 2010-х и которая обрела вторую жизнь в эпоху ИИ. Идея простая: сложные интерфейсы с кнопками, менюшками и вкладками постепенно заменятся на ИИ-интерфейсы: текстовый, голосовой или графический – зависит от ситуации.

К чему-то похожему на Zero UI мы рано или поздно придем, но каким маршрутом – вопрос открытый. OpenAI и Anthropic сейчас сосредоточились на “инструментах для решения вопросов” – личных и рабочих. Чат-боты, агенты для кодинга и интеллектуальной работы – свободная ниша, да еще и растущая с огромной скоростью.

Но огромный объем задач мы продолжаем решать в браузерах и операционных системах – потребление контента, выбор и покупка товаров, планирование поездок. Здесь встроенный в браузер агент привычнее, и Илья рассказывает, как он работает: получив задачу, нейросеть сама сравнит предложения, укажет на лучшие, а если пользователь разрешит – то заполнит все формы и совершит покупку.

Такие агенты уже функционируют – в том же “Яндекс Браузере” есть функция “найти дешевле”, когда агент собирает лучшие предложения, предлагая тебе сделать финальный выбор.

Но и работы предстоит еще много. Одно направление – безопасность, так как теоретически агенту могут подсунуть prompt injection, убедив купить этот конкретный товар, а не конкурента. Второе – психология пользователя. Мне, например, всегда доставляло удовольствие самому сравнивать и выбирать товары, а затем нажимать кнопку. Поэтому какое-то время лучше будет даже промежуточное решение: агент выполняет работу, пользователь за ней наблюдает (или, как минимум, за ключевыми этапами) и принимает финальное решение сам.

В лонгриде Ильи еще много интересных подробностей, как преображаются браузеры в эпоху ИИ – обязательно почитайте, это полезно и для профессиональной работы, и для тех, кто использует нейронки в повседневных делах.
🔥2522👍18😁2👏1
Квантовый физик Людовико Лами сравнивает растущие возможности ИИ в квантовой теории информации и прикладной математике с изменениями, которые когда-то принесло изобретение телескопа в астрономию.

Тогда ученые в короткий момент смогли увидеть вещи, недоступные невооруженному глазу. Теперь похожую возможность дает ИИ – способность на огромной скорости вести сложнейшие расчеты, порой комбинируя казавшиеся несовместимыми области математики.

Роль человека изменится, но в обозримом будущем не исчезнет: ученые будут превращать добытое ИИ знание в форму, понятную людям, – и в новые идеи. По словам Лами, академическая работа заключается не только в открытии новых истин и фактов, которые можно превратить в экономическую пользу. В университетах есть гуманитарные факультеты, работа которых ценится, но не оценивается экономической выгодой – и возможно, точным наукам тоже придется учиться чему-то похожему.

Высказывание звучит на фоне волны открытий, сделанных с помощью Claude Fable и GPT-5.6 – самым громким остается опровержение гипотезы якобиана, но новые я вижу почти каждый день. Местами это реальные достижения, местами пустышки, а есть и в чем-то комичные истории.

Пример из области, в которой работает Лами. Четверть века в квантовой теории информации стоял вопрос о “дистилляции” запутанных состояний Вернера – №5 из официального списка пяти главных проблем области. На прошлой неделе ее решили, причем четыре раза.

22 июля группа из Будапешта получила доказательство от GPT-5.6 Sol и села проверять. 23-го на Overleaf легло доказательство, которое та же модель выдала другой команде. Через три часа на arxiv пришла статья группы из Уханя, а 26-го – еще от одной китайской команды.

Самое интересное – как каждая ответила на вопрос “кто это доказал”. Будапештцы пишут прямо: “доказательство найдено с GPT-5.6, отшлифовано с Claude Opus и Fable”. Вторая команда: “сгенерировано GPT-5.6, мы проверили и переписали”. Уханьцы не упоминают ИИ вовсе – неизвестно, совпадение ли это, осторожность или нежелание признаваться, что использовали в модель, официально недоступную в Китае. А четвертая группа вписала в служебное поле: главная теорема доказана еще в июне, до других групп. Чисто людьми или с помощью ИИ – не уточняется.

Но вернемся к Лами. Я журналист по образованию, представитель тех самых “гуманитарных фактультетов”. В последние недели много пишу про ИИ в математике, потому что это, возможно, вторая после кода область теста нейросетей.

Сам я пересчитать решения, понятное дело, не могу. Поэтому смотрю на авторов открытий: если это уважаемый специалист, то вряд ли он подпишется под ерундой.

Второй этап интереснее – результаты я передаю Fable 5 и GPT-5.6 Pro с задачей перепроверить. И это чуть ли не первые модели, ответам которых я доверяю: обе рассуждают трезво, на понятном мне языке, честно подсвечивая места, где не уверены.

Наконец, третье. Использование ИИ, конечно, не учит меня математике, но позволяет задавать вопросы по теме. Знали ли вы, что опровержение гипотезы якобиана в моменте не несет никакой практической пользы? Шифры не станут надежнее, самолеты не полетят быстрее.

Но почему это тогда одна из крупнейших математических задач? Возможно, практика просто не догнала теорию – и опровержение пригодится через десять лет. Или не пригодится, но приемы, использованные в опровержении, помогут с более “практической” задачей. Или не помогут, и пользы не будет вовсе: многие задачи математика порождает сама, по ходу развития.

Это – три из четырех вариантов, которые озвучил мне Fable 5. Четвертый я оставил на финал. Легендарный Годфри Харди говорил, что настоящая математика оправдывается так же, как поэзия – красотой, а не применимостью. И это делает высказывание Лами, сравнивающего математиков с гуманитариями, только сильнее.

Как использовать ИИ на максимум, я рассказываю на “Бусти”. Под сегодняшнюю историю лучше всего ложится лонгрид, как ИИ управляет Тарик Шихипар, один из создателей Claude Code – его методика поиска слепых пятен перед постановкой задачи похожа на работу с телескопом.
52👍17🔥11
Объявил сингулярность, отменил короткий рабочий день и попросил власти притормозить развитие ИИ – и все за одну неделю

Нелегко быть Сэмом Альтманом в 2026-м. Просто посмотрите, что глава OpenAI наворотил за неделю.

25 июля на подкасте Relentless Тая Морса он заявил: “We are now, like, in the singularity” – “Мы сейчас, типа, живем в сингулярности”. И дальше добавил:

Теперь мы реально в том моменте, о котором несерьезно болтали за обедом. Я ждал этого всю жизнь, и думаю, это будет невероятно, чрезвычайно позитивно, потрясающе для мира.


У термина интересная история. Статистик И. Дж. Гуд описал в 1965-м “взрыв интеллекта”: машина проектирует машину лучше себя, та – еще лучше, и так по нарастающей. Курцвейл, который сделал слово популярным, привязал к нему даты: машинный интеллект человеческого уровня около 2029, слияние человека и машины около 2045.

Версия Альтмана – другая по типу. Курцвейл описывает состояние машины; Альтман описывает состояние нашей реакции на машину, которое проверить нельзя. Из его эссе “The Gentle Singularity”:

Мы очень быстро переходим от изумления, что ИИ пишет прекрасный абзац, к вопросу, когда он напишет прекрасный роман... Так и проходит сингулярность: чудеса становятся рутиной, а потом – само собой разумеющимся.


То есть сингулярность у Альтмана – это ощущение привыкания к чудесам.

А вот когда чудеса превратятся в блага — большой вопрос. Альтман не раз обещал, что ИИ избавит человечество от дефицита и болезней. Пока не избавил. На том же подкасте Сэм признал, что пока ИИ не принес даже 4-часовую рабочую неделю. И не ожидает, что принесет в обозримом будущем.

Альтман ссылается на прошлое – многие технологии обещали людям, что те будут работать меньше, но не сдерживали это обещание. Возможно, дело и вовсе в человеческой психологии.

Опять цитирую Альтмана:

Думаю, мы все будем гораздо более занятыми, чем предполагали в мире после суперинтеллекта. Мы будем продолжать жаловаться, но втайне будем счастливы.


Сэм намекает, что люди в глубине души любят быть занятыми – и начинают использовать ИИ не как инструмент разгрузки, а как инструмент повышения эффективности.

В душе я согласен с Альтманом, так как сам могу просидеть без работы максимум 2-3 дня (и даже этот пост пишу из мини-отпуска). Но мне повезло почти всю жизнь заниматься любимым делом – не уверен, что у всех так. Поэтому, если не готовы подарить человечеству 4-дневку, то дайте с помощью ИИ интересное занятие для всех и каждого.

И коротко о других приключениях Альтмана. 27-29 июля он побывал в Вашингтоне, где представил новую модель – о ней говорят как о GPT-6 и это именно тот ИИ, который недавно сбежал из инфраструктуры OpenAI и взломал сайт Hugging Face.

Теперь Альтману предстоит непростая задача: убедить власти, что условная GPT-6 все-таки безопасна, и ее можно выпустить для широкой публики. Давит он на экономический эффект: новые модели OpenAI и Anthropic уже помогают совершать математические открытия, а внутри компании 85%+ ИИ-работы юристов, финансистов и рекрутеров идет через агентов.

Результат увидим в ближайшие месяцы. Bloomberg инсайдит, что в разговоре с властями Альтман поддержал идею “притормозить” развитие ИИ, чтобы было больше времени на анализ инцидентов, вроде произошедшего с Hugging Face, и исправление некорректного поведения моделей.

Я в такой тормоз не верю и уж тем более тут мало что зависит от Альтмана. Любое замедление ИИ в США играет на руку китайским компаниям, поэтому подобные ограничения возможны только после того, как две ведущие ИИ-державы придут к общему соглашению. Движение к нему только началось: в сентябре Си едет к Трампу, но до соглашения о взаимном торможении оттуда как до Луны. Так что действия Альтмана – скорее красивая игра, чтобы OpenAI не мешали работать дальше. Но посмотрим – показателем будет как быстро выйдет GPT-6.

Как использовать ИИ на максимум, я рассказываю на “Бусти”. Там есть как личный опыт, так и практики профессионалов отрасли – например, создателей Claude Code Бориса Черни (лонгрид) и Тарика Шихипара (лонгрид).
👍3924🔥16😁3👏1
Игорь с канала Tips AI иронично посчитал, какие ресурсы понадобятся для запуска Kimi K3, веса которой выложили на Hugging Face 27 июля. Там нужно минимум 80 RTX 5090, соответствующая обвязка, отдельная линия электропитания, ну и бригада пожарных, готовая прийти на помощь, когда ваш собранный на коленке фронтир-звездолет загорится синим пламенем.

Стоить все это будет от $400K, дежурство пожарных оплачивается отдельно.

Игорь пишет в ироничном стиле, но тема, на самом деле, серьезная. Если мы с вами китайский фронтир на своем железе не запускаем – то тогда кто? Бизнес? Но в API Kimi K3 стоит $3 на вход и $15 на выход, за кэшированные запросы положена 90% скидка – а в кэш, например, попадает почти весь код. Еще можно поиграть с корпоративными тарифами – в итоге расходы будут на порядок дешевле пресловутых $400 тысяч, к которым пристегиваются счета за электричество и обслуживание.

Но интересная подсказка есть в недавнем расследование случайной атаки ИИ-агента OpenAI на инфраструктуру Hugging Face. Интенсивность действий агента была настолько плотной, что для расследования безопасникам понадобилась своя ИИ-модель. Сначала обратились по API к Fable 5 и GPT-5.6 Sol и получили отказ – защитные фильтры закрытых моделей не разбирают, идет ли запрос от злоумышленника или специалиста по информационной безопасности. В итоге пришлось быстро-быстро разворачивать на собственной инфраструктуре открытую GLM-5.2 – она помогла в расследовании.

Вывод Hugging Face следующий: если ваш бизнес зависит от ИИ, то обязательно держите под рукой развернутую открытую модель – просто на всякий случай. Доступ по API может быть выгоднее и эффективнее, но в нем всегда могут поменять цены, накинуть фильтры безопасности, или вовсе что-нибудь отключить по прихоти даже не разработчика, а властей. Своя родная открытая модель – пусть и с китайским акцентом – в таких ситуациях не подведет.

Для любителей экспериментировать с открытыми моделями на домашнем железе это тоже актуально. Да, Kimi K3 мы не потянем, но мои любимые Qwen и Gemma обновляются регулярно, Nvidia развивает интересную линейку Nemotron, плюс недавно на рынок зашел стартап Thinking Machines от ex-OpenAI Миры Мурати – их линейка называется Tinker.

Прелесть в том, что для этих экспериментов не нужны ни отдельная линия электропитания, ни дежурная бригада МЧС — хватает одной видеокарты, которая деловито шумит турбиной, но синим пламенем не горит. Правда, граница между “запущу дома” и “вызывайте пожарных” сдвигается каждые пару месяцев, и за ней лучше следить по чужим расчетам, а не по собственным счетам за электричество. Я для этого читаю Игоря (и вам советую) — на его канале Tips AI такая практическая арифметика появляется регулярно, за что отдельное спасибо.
52🔥19👍17
Сегодня снова поговорим о математике, но даже не об ИИ-открытиях, а о промптах и механике, которые за ними стоят.

Сами открытия, кстати, уже сложно посчитать: каждый день вижу в ленте что-то новое на тему – местами это мелкие работы, местами заметные. Так, Ор Замир из Тель-Авивского университета доказал, что узнать, красится ли граф в k цветов, можно быстрее, чем вычислить его хроматическое число, – причем для любого фиксированного k.

Это сильная работа для теории алгоритмов, но не переворот: ускорение существует лишь в принципе, константы там чудовищные – сам Замир оценивает выигрыш величиной, обратной башне экспонент.

Интересно другое. Доказательство Замир сделал “руками”, GPT-5.6 Sol был ассистентом – и этому опыту посвящена отдельная глава работы. Там три интересных наблюдения.

Первое. Замир сознательно скрывал от модели свою стратегию и выдавал ее порциями – как научрук аспиранту. “Обобщи мою статью на один шаг” – пусто. Полное описание плана – модель проверила выкладки, но ключевую задачу не взяла. Сработала лишь третья, совсем конкретная подсказка: сузиться на частный случай. Маршрут все это время держал человек.

Второе, уже тревожнее. Модель работала с включенной памятью и таскала конструкции из старых чатов Замира без указания источника: ссылка на прошлый разговор мелькала в окне “размышлений” – и исчезала из финального ответа.

Выглядело это как идеи самой модели, хотя на самом деле она вспоминала прошлые мысли математика. Замир честно признает: он и сам не знает, сколько контекста невольно скормил модели, так что его отчет о промптах неполон по определению.

Третье, самое неприятное. Для финального аргумента нужен был результат чужой работы 2007 года – ее Замир в контекст не давал. Вместо ссылки на нее модель воспроизвела чужое доказательство по существу целиком, вмешав туда новое наблюдение. Формально все верно, но пользователь, хуже знающий область, решил бы, что ИИ изобрел это сам, – и опубликовал бы чужой результат без цитаты.

На эти три наблюдения ложится другое открытие, сделанное уже в основном с помощью ИИ. Группа математиков с помощью GPT-5.6 доказала гипотезу Фейге – задачу с 22-летним стажем о том, что сумма независимых случайных величин не может слишком уж часто прыгать заметно выше своего среднего. Ответ выдала модель, люди проверили, переписали и формализовали в Lean. Доказательство простое: три готовых результата, сложенных в правильном порядке, – один из кирпичей появился онлайн лишь в июле и тоже добыт ИИ.

А дальше соавтор работы Гуаньян Ван провел интересный эксперимент. Он знал, что доказательство существует, но в сеть оно еще не попало – значит, можно проверить, как промпт влияет на результат. Ван взял два промпта, в один было добавлено предложение: “сначала обширно поищи в литературе полезные результаты, не ограничиваясь исходной областью”. С этим предложением – доказательство в трех запусках из четырех. Без него – ноль из четырех. Выглядит так, будто работает просьба ИИ найти человеческие попытки и “дорешать” – хотя приемов может быть больше одного.

В истории с найденным Fable 5 контрпримером гипотезы якобиана есть одна интересная деталь – еще в 1970-е годы к опровержению близко подошел советский математик Анатолий Витушкин, который использовал во многом похожую технику. Но на вопрос, не “дорешала” ли Fable 5 работу Витушкина, мой Claude ответить не смог. Знания при обучении переплавляются в веса без сохранения авторства – и понять, чьи именно идеи легли в контрпример, нереально.

В современном ИИ интересно то, что мы очень сосредотачиваемся на результатах его работы, но не задумываемся, как именно он к ним приходит. Примеры Замира и Вана, а также мой собственный случай, показывают – в изучении ИИ, возможно, нам предстоит не меньше работы, чем в математике.

Своим опытом работы с ИИ я делюсь на “Бусти” – рассказываю про промптинг, ИИ-агентов и безопасность. Плюс переосмысливаю техники, которые используют в работе известные ИИ-персоны – например, разработчики Claude Code.

Самое время подписаться!
👍4322🔥7👏3
Около года назад Epoch AI посчитали, что открытые модели, доступные на топовом пользовательском железе (RTX 5090) отстают от фронтира на 6-12 месяцев. Сейчас исследование серьезно устарело, но я попросил GPT-5.6 Pro его повторить и модель пришла к интересным выводам: открытый Qwen3.6-27B сегодня близко подошел по бенчмаркам к Opus 4.5 и GPT-5.1.

А ведь GPT-5.1 и Opus 4.5 – это уже модели, способные на серьезный код и уверенную интеллектуальную работу. Тот же Opus 4.5, например, помог Claude Code стать одним из самых популярных кодинг-инструментов. Так что пора следить за открытыми моделями не менее пристально, чем за фронтиром. И начать можно с моего нового лонгрида:

Свой ИИ за один вечер: запускаем нейросеть на домашнем компьютере

Текст традиционно очень подробный: в нем я понятно объясняю, какие параметры открытых моделей важны, на каком железе и что стоит запускать, как развернуть локальную нейронку и интегрировать ее в Claude Code или Codex. Инженерных знаний там не нужно – достаточно свободного вечера.

Зачем вам своя нейросеть, если есть подписки? Во-первых, приватность: налоги, медицина, договоры – все разбирается прямо на вашем железе и никуда не уходит. Во-вторых, независимость: локальная модель работает без VPN, иностранных карт и даже без интернета – и отключить ее вам не может никто. А порог входа ниже, чем кажется. Топовая RTX 5090 не обязательна: у меня возрастная RTX 3090, и свежая Gemma 4 на ней намного умнее, чем Gemma 3, которую я гонял годом ранее на той же карточке, – открытые модели сейчас растут алгоритмически, без апгрейда железа.

Все подробности в лонгриде:

Читать на “Бусти”
Читать на Sponsr
28👍26🔥10😁5