Ящик Пандоры открылся?
Полистал канал: весной я писал о крупном открытии, сделанном с помощью ИИ, раз в месяц, сейчас же темп изменился. На этой неделе был рассказ о гипотезе якобиана, опровергнутой Claude Fable 5, неделей ранее — пост о доказательстве гипотезы о двойном покрытии циклами, полученном с помощью GPT-5.6 Sol Ultra.
Что-то явно происходит.
Гипотеза якобиана – одна из знаменитых задач алгебры, на которую все сразу обратили внимание. Но она – лишь гребень поднявшейся волны. Вот еще несколько свежих примеров:
— Профессор из Рочестера попросила ChatGPT сделать решения к домашке по своему курсу – и получила улучшение результата из опубликованной статьи по оптимизации.
— Статистики закрыли гипотезу Балабдауи–Веллнера 2014 года: доказательство целиком сгенерировала GPT-5.6 Sol, авторы проверили каждый шаг.
— Тополог Джим Конант вместе с Fable 5 доказал гипотезу, которую сам выдвинул в 2006-м.
Это – некоторые из тех примеров, что проверяются быстро (в математике у решения сложной задачи может быть простая проверка) и оказались на поверхности. Уверен, есть работы, которые или не проверены, или их пока не заметили.
Как такое возможно? Самый очевидный ответ: выросшие возможности Fable 5 и GPT-5.6. Но это не единственная причина: каждое сделанное с помощью ИИ открытие привлекает новых людей — и профессионалов, и энтузиастов. Математик читает, что Левент Альпёге с помощью Fable 5 опроверг гипотезу якобиана, берет подписку и начинает ставить задачи по области, в которой он разбирается.
Это уже дает результаты. Исследователь Дима Рыбин загрузил в GPT-5.6 Pro обзорную статью о гипотезе Гоманса – задаче о маршрутизации потоков, открытой с 1997 года, – и четырьмя промптами на 58 слов довел модель до контрпримера: графа на семь вершин. Финальный промпт прекрасен: “хватит частичных результатов, давай полный контрпример”.
Но не все опровержения одинаково полезны. Например, Илон Маск репостнул историю агента на базе Grok 4.5, опровергшего гипотезу Graffiti 284 — одну из сотен, которые в девяностые сгенерировала программа Graffiti: она сама выдвигала догадки о графах, и многие так и лежали непроверенными. Опровержение верное — но, как заметил Кристиан Сегеди, сами гипотезы Graffiti это “пре-ИИ слоп”, над ними никто всерьез не работал.
И даже здесь интересен подход: агенту поставили задачу в Slack составить список опровергаемых гипотез и попробовать их опровергнуть.
Вот и математика XXI века: один требует от ИИ поднажать и совершить, наконец, открытие, другой – отправляет с задачей “иди и придумай, что опровергаем сегодня”. В этот раз добыча вышла мелкой – в следующий, возможно, попадется крупная.
Что дальше? Когда Пандора открыла кувшин-пифос (“ящиком” он стал при переводе), первыми из него полетели людские беды. Я слежу за многими математиками в X и вижу в их репликах что-то похожее. С одной стороны – любопытство (прямо как у Пандоры), ведь ИИ достиг уровня, когда становится партнером, отвечающим на сложные вопросы буквально за вечер.
С другой – растерянность. Математика перестраивается: то, что раньше нужно было считать месяцами, теперь решается за вечер. Количество сделанных с помощью ИИ доказательств, опровержений, ошибок, найденных в старых работах, может начать расти очень быстро – а значит, потребует инструментов проверки. И что даже сложнее – осмысления: “мы решили это и это, куда двигаться дальше?”
Но в кувшине Пандоры были не только беды – на дне осталась надежда. И Гесиод будто специально написал этот миф с открытым концом: беды разлетелись сами, надежда – осталась в руках человека, решающего, как ей распорядиться.
Что-то похожее происходит и здесь. Мы уже увидели, как за считанные месяцы поменялся код. Уверен, поменяется и математика. Что дальше? Fable 5 указывает на физику и статистику, на более далеком отрезке – биологию и медицину. Я по привычке смотрю на творческие области: там изменения будут особенно непредсказуемыми.
—
Своим опытом использования ИИ делюсь на “Бусти”. Там тоже динамично: за последние недели рассказал, что такое loop engineering и как ставит задачи ИИ один из авторов Claude Code.
Самое время подписаться!
Полистал канал: весной я писал о крупном открытии, сделанном с помощью ИИ, раз в месяц, сейчас же темп изменился. На этой неделе был рассказ о гипотезе якобиана, опровергнутой Claude Fable 5, неделей ранее — пост о доказательстве гипотезы о двойном покрытии циклами, полученном с помощью GPT-5.6 Sol Ultra.
Что-то явно происходит.
Гипотеза якобиана – одна из знаменитых задач алгебры, на которую все сразу обратили внимание. Но она – лишь гребень поднявшейся волны. Вот еще несколько свежих примеров:
— Профессор из Рочестера попросила ChatGPT сделать решения к домашке по своему курсу – и получила улучшение результата из опубликованной статьи по оптимизации.
— Статистики закрыли гипотезу Балабдауи–Веллнера 2014 года: доказательство целиком сгенерировала GPT-5.6 Sol, авторы проверили каждый шаг.
— Тополог Джим Конант вместе с Fable 5 доказал гипотезу, которую сам выдвинул в 2006-м.
Это – некоторые из тех примеров, что проверяются быстро (в математике у решения сложной задачи может быть простая проверка) и оказались на поверхности. Уверен, есть работы, которые или не проверены, или их пока не заметили.
Как такое возможно? Самый очевидный ответ: выросшие возможности Fable 5 и GPT-5.6. Но это не единственная причина: каждое сделанное с помощью ИИ открытие привлекает новых людей — и профессионалов, и энтузиастов. Математик читает, что Левент Альпёге с помощью Fable 5 опроверг гипотезу якобиана, берет подписку и начинает ставить задачи по области, в которой он разбирается.
Это уже дает результаты. Исследователь Дима Рыбин загрузил в GPT-5.6 Pro обзорную статью о гипотезе Гоманса – задаче о маршрутизации потоков, открытой с 1997 года, – и четырьмя промптами на 58 слов довел модель до контрпримера: графа на семь вершин. Финальный промпт прекрасен: “хватит частичных результатов, давай полный контрпример”.
Но не все опровержения одинаково полезны. Например, Илон Маск репостнул историю агента на базе Grok 4.5, опровергшего гипотезу Graffiti 284 — одну из сотен, которые в девяностые сгенерировала программа Graffiti: она сама выдвигала догадки о графах, и многие так и лежали непроверенными. Опровержение верное — но, как заметил Кристиан Сегеди, сами гипотезы Graffiti это “пре-ИИ слоп”, над ними никто всерьез не работал.
И даже здесь интересен подход: агенту поставили задачу в Slack составить список опровергаемых гипотез и попробовать их опровергнуть.
Вот и математика XXI века: один требует от ИИ поднажать и совершить, наконец, открытие, другой – отправляет с задачей “иди и придумай, что опровергаем сегодня”. В этот раз добыча вышла мелкой – в следующий, возможно, попадется крупная.
Что дальше? Когда Пандора открыла кувшин-пифос (“ящиком” он стал при переводе), первыми из него полетели людские беды. Я слежу за многими математиками в X и вижу в их репликах что-то похожее. С одной стороны – любопытство (прямо как у Пандоры), ведь ИИ достиг уровня, когда становится партнером, отвечающим на сложные вопросы буквально за вечер.
С другой – растерянность. Математика перестраивается: то, что раньше нужно было считать месяцами, теперь решается за вечер. Количество сделанных с помощью ИИ доказательств, опровержений, ошибок, найденных в старых работах, может начать расти очень быстро – а значит, потребует инструментов проверки. И что даже сложнее – осмысления: “мы решили это и это, куда двигаться дальше?”
Но в кувшине Пандоры были не только беды – на дне осталась надежда. И Гесиод будто специально написал этот миф с открытым концом: беды разлетелись сами, надежда – осталась в руках человека, решающего, как ей распорядиться.
Что-то похожее происходит и здесь. Мы уже увидели, как за считанные месяцы поменялся код. Уверен, поменяется и математика. Что дальше? Fable 5 указывает на физику и статистику, на более далеком отрезке – биологию и медицину. Я по привычке смотрю на творческие области: там изменения будут особенно непредсказуемыми.
—
Своим опытом использования ИИ делюсь на “Бусти”. Там тоже динамично: за последние недели рассказал, что такое loop engineering и как ставит задачи ИИ один из авторов Claude Code.
Самое время подписаться!
1❤50👏33👍20🔥13
Opus 5 – новый флагман Anthropic
Вышел Opus 5, в большинстве бенчмарков он обходит Fable 5, но удивительного здесь нет. По слухам, первые версии Claude Mythos (на ней строится коммерческая Fable 5) были доступны сотрудникам Anthropic в феврале, закрытый Project Glasswing стартовал в апреле, а Fable 5 попробовали выпустить в начале июня – но из-за вмешательства властей США отложили.
Пять месяцев – более чем достаточно, чтобы из архитектуры топовой модели собрать “массовый флагман”, каким и является Opus 5.
Из бенчмарков бросается в глаза ARC-AGI-3 с результатом 30,2% против 7,8% у прошлого лидера – GPT-5.6 Sol. Это бенчмарк на абстрактное мышление: в нем модель оказывается внутри пошаговой игры, вообще без объяснений, как ее проходить. Методом проб и ошибок ИИ должен понять правила игры, а затем выиграть. Игр в бенчмарке много, каждая – со своими особенностями.
Бенчмарк сложный, но вот что интересно. ARC-AGI-3 представили 25 марта – явно раньше, чем началось обучение Opus 5. И это позволяет сказать, что в Anthropic, изучив доступные задачи бенчмарка (их минимум, большинство держат в секрете), попробовали натаскать новую модель на него.
Официально про это нигде не говорится, но это было бы логично, более того, это, возможно, уже дало положительный эффект: для прохождения ARC-AGI-3 нужна “сообразительность” и ее Opus 5 проявляет и в других сферах.
Блогпост Anthropic описывает ситуацию, как Opus 5 дали файл с чертежом механической детали с задачей написать программу, которая соберет эту деталь во FreeCAD. При отключили модели компьютерное зрение – то есть файл с чертежом был, но посмотреть его не получалось.
Другие ИИ в такой ситуации останавливались и сообщали, что не могут выполнить задачу. Opus 5 открыл файл как то, чем картинка является на самом деле, – длинную таблицу чисел, по три штуки на каждую точку экрана. И написал с нуля собственную программу, которая по этим числам находит прямые линии, окружности, размерные стрелки. То есть смастерил простенькое “компьютерное зрение” сам.
Если говорить про другие бенчмарки, то отрыв от Fable 5 реальный в трех местах, зато важных: агентское программирование (43,3 против 33,7), бизнес-задачи (26,0 против 17,4) и работа за компьютером (70,6 против 66,1). Это задачи, где модель пашет долго и без присмотра.
Остальное — размен: на HLE 56,3 против 56,5, на двух кодовых бенчмарках отставание в десятые доли. Проигрывает заметно только в юриспруденции и медицине. Это именно тот уровень прогресса, который я и ожидал от Opus 5 за такое время.
При этом модель в два раза дешевле Fable 5, доступна на базовой подписке Pro, а на подписках Max на нее можно тратить весь лимит, а не 50%. Если не будет какого-то косяка в виде кривого стиля или высокого уровня галлюцинаций – Fable 5 можно отправлять на пенсию до выхода 5.1.
Еще интересный факт. Mythos/Fable 5 в свое время перепугал и разработчиков, и даже власти США из-за крутых возможностей по поиску уязвимостей. Opus 5 намеренно не стали обучать кибербезопасности – но в бенчмарке на поиск уязвимостей она все равно набрала 79,4% против 80% у Mythos. Я как-то писал об этом: если учить модель хорошо писать код – она автоматом учится искать уязвимости.
В Anthropic предупредили, что у Opus 5, как и у Fable 5, будет fallback-механизм, переключающий на Opus 4.8 запросы, которые покажутся опасными. Но настроен он, судя по всему, намного лучше: если Fable 5 у меня отказывалась отвечать на такие безобидные промпты, как “дай свое объяснение парадоксу Ферми” или “объясни, как устроен мозг осьминога”, то Opus 5 сейчас на все ответил.
Параллельно прогнал модель еще на нескольких запросах – понравилось, как Opus 5 делает веб-дизайн, ищет в сети и генерит идеи. Стиль письма своеобразный, это еще надо тестить.
–
Друзья, традиционно по пятницам я выпускаю новый лонгрид в подписке. Он уже на месте, но подробно представлю завтра. Но если кому не терпится, это лонгрид по мотивам рекомендаций Бориса Черни о том, как пятью этапами стать профессионалом в ИИ.
Читаем здесь:
— Бусти
— Sponsr
Вышел Opus 5, в большинстве бенчмарков он обходит Fable 5, но удивительного здесь нет. По слухам, первые версии Claude Mythos (на ней строится коммерческая Fable 5) были доступны сотрудникам Anthropic в феврале, закрытый Project Glasswing стартовал в апреле, а Fable 5 попробовали выпустить в начале июня – но из-за вмешательства властей США отложили.
Пять месяцев – более чем достаточно, чтобы из архитектуры топовой модели собрать “массовый флагман”, каким и является Opus 5.
Из бенчмарков бросается в глаза ARC-AGI-3 с результатом 30,2% против 7,8% у прошлого лидера – GPT-5.6 Sol. Это бенчмарк на абстрактное мышление: в нем модель оказывается внутри пошаговой игры, вообще без объяснений, как ее проходить. Методом проб и ошибок ИИ должен понять правила игры, а затем выиграть. Игр в бенчмарке много, каждая – со своими особенностями.
Бенчмарк сложный, но вот что интересно. ARC-AGI-3 представили 25 марта – явно раньше, чем началось обучение Opus 5. И это позволяет сказать, что в Anthropic, изучив доступные задачи бенчмарка (их минимум, большинство держат в секрете), попробовали натаскать новую модель на него.
Официально про это нигде не говорится, но это было бы логично, более того, это, возможно, уже дало положительный эффект: для прохождения ARC-AGI-3 нужна “сообразительность” и ее Opus 5 проявляет и в других сферах.
Блогпост Anthropic описывает ситуацию, как Opus 5 дали файл с чертежом механической детали с задачей написать программу, которая соберет эту деталь во FreeCAD. При отключили модели компьютерное зрение – то есть файл с чертежом был, но посмотреть его не получалось.
Другие ИИ в такой ситуации останавливались и сообщали, что не могут выполнить задачу. Opus 5 открыл файл как то, чем картинка является на самом деле, – длинную таблицу чисел, по три штуки на каждую точку экрана. И написал с нуля собственную программу, которая по этим числам находит прямые линии, окружности, размерные стрелки. То есть смастерил простенькое “компьютерное зрение” сам.
Если говорить про другие бенчмарки, то отрыв от Fable 5 реальный в трех местах, зато важных: агентское программирование (43,3 против 33,7), бизнес-задачи (26,0 против 17,4) и работа за компьютером (70,6 против 66,1). Это задачи, где модель пашет долго и без присмотра.
Остальное — размен: на HLE 56,3 против 56,5, на двух кодовых бенчмарках отставание в десятые доли. Проигрывает заметно только в юриспруденции и медицине. Это именно тот уровень прогресса, который я и ожидал от Opus 5 за такое время.
При этом модель в два раза дешевле Fable 5, доступна на базовой подписке Pro, а на подписках Max на нее можно тратить весь лимит, а не 50%. Если не будет какого-то косяка в виде кривого стиля или высокого уровня галлюцинаций – Fable 5 можно отправлять на пенсию до выхода 5.1.
Еще интересный факт. Mythos/Fable 5 в свое время перепугал и разработчиков, и даже власти США из-за крутых возможностей по поиску уязвимостей. Opus 5 намеренно не стали обучать кибербезопасности – но в бенчмарке на поиск уязвимостей она все равно набрала 79,4% против 80% у Mythos. Я как-то писал об этом: если учить модель хорошо писать код – она автоматом учится искать уязвимости.
В Anthropic предупредили, что у Opus 5, как и у Fable 5, будет fallback-механизм, переключающий на Opus 4.8 запросы, которые покажутся опасными. Но настроен он, судя по всему, намного лучше: если Fable 5 у меня отказывалась отвечать на такие безобидные промпты, как “дай свое объяснение парадоксу Ферми” или “объясни, как устроен мозг осьминога”, то Opus 5 сейчас на все ответил.
Параллельно прогнал модель еще на нескольких запросах – понравилось, как Opus 5 делает веб-дизайн, ищет в сети и генерит идеи. Стиль письма своеобразный, это еще надо тестить.
–
Друзья, традиционно по пятницам я выпускаю новый лонгрид в подписке. Он уже на месте, но подробно представлю завтра. Но если кому не терпится, это лонгрид по мотивам рекомендаций Бориса Черни о том, как пятью этапами стать профессионалом в ИИ.
Читаем здесь:
— Бусти
— Sponsr
5🔥69❤30👍28👏2😁1
Для рядового пользователя ИИ сейчас не самое простое время: даже одна компания предлагает целую кучу инструментов, толком не поясняя, в каком порядке их осваивать. Когда брать ChatGPT Work/Claude Cowork, а когда – Codex/Claude Code? Нужен ли старый добрый чат-бот? Есть ли еще смысл в Hermes/OpenClaw? А если Codex, то в каком порядке осваивать его функции?
К счастью, буквально на днях “отец” Claude Code Борис Черни поделился своим исследованием – как ИИ осваивают сотрудники крупных компаний. И описанная в нем схема идеально подходит для изучения ИИ любым человеком.
"Лестница" создателя Claude Code: как прокачаться в использовании ИИ всего за один вечер
Борис описывает пять крупных “ступеней” в освоении ИИ: начиная с обычного чат-бота и заканчивая управлением “роем” из тысяч агентов. Он честно признает, что пятой ступени полностью не достигла еще даже сама Anthropic – так что текст получился с заделом на будущее, когда некоторые из нас будут рулить бизнесами, состоящими из одного человека и тысяч агентов.
Разумеется, простым переводом исследования я не обошелся. Борис больше рассказывает про кодинг, а я подробно расписал другие сферы интеллектуальной работы, а также привел примеры – как можно перейти с одной ступени на другую (за исключением пятой, на нее я и сам еще не забрался).
Получился познавательный лонгрид на 18 тысяч полезных знаков:
– Читать на “Бусти”
– Читать на Sponsr
К счастью, буквально на днях “отец” Claude Code Борис Черни поделился своим исследованием – как ИИ осваивают сотрудники крупных компаний. И описанная в нем схема идеально подходит для изучения ИИ любым человеком.
"Лестница" создателя Claude Code: как прокачаться в использовании ИИ всего за один вечер
Борис описывает пять крупных “ступеней” в освоении ИИ: начиная с обычного чат-бота и заканчивая управлением “роем” из тысяч агентов. Он честно признает, что пятой ступени полностью не достигла еще даже сама Anthropic – так что текст получился с заделом на будущее, когда некоторые из нас будут рулить бизнесами, состоящими из одного человека и тысяч агентов.
Разумеется, простым переводом исследования я не обошелся. Борис больше рассказывает про кодинг, а я подробно расписал другие сферы интеллектуальной работы, а также привел примеры – как можно перейти с одной ступени на другую (за исключением пятой, на нее я и сам еще не забрался).
Получился познавательный лонгрид на 18 тысяч полезных знаков:
– Читать на “Бусти”
– Читать на Sponsr
👍29🔥20❤13👏3😁3
В X полыхает с реплики “дядюшки Боба”, что он больше не читает написанный ИИ-агентами код, а обходится тестами… написанными агентами.
Роберт “дядюшка Боб” Мартин начал программировать в конце 60-х, а в 2008 году выпустил книгу Clean Code (“Чистый код”), которая стоит на полке чуть ли не у половины разработчиков мира. Идея книги: код читают в десять раз чаще, чем пишут, поэтому пишите его чисто.
Боб отвечал на твит Ори Померанца – другого инженера-ветерана:
Боб:
Вместо ревью Боб использует “полосу препятствий”. Даже если вы не кодите, прочтите, подход интересный. В полосу входят: юнит-тесты, gherkin-тесты (сценарии поведения “дано → когда → тогда”, понятные человеку), QA-процедуры, метрики качества, мутационное тестирование, покрытие тестами.
Мутационное тестирование выделю отдельно: инструмент намеренно вносит в код мелкие поломки (“мутации”) и проверяет, ловят ли их тесты. То есть это тест самих тестов.
Я в работе с ИИ тоже часто специально допускаю ошибку или подкидываю ему глупость, чтобы понять – заметит или нет. Это один из лучших тестов надежности инструмента.
Комментаторы поделились на две группы. Аргумент “за” высказан самим Бобом – если перечитывать код, то выигрыш от агентов просто схлопывается. Можно просто писать руками.
Возражений два. Первое: если код пишет модель, а ты только строишь ограничения и смотришь на метрики – инженер ли ты вообще? Второе: как сказал Томаш Микула, перед нами современная версия иллюзии, что менеджер может предотвратить бардак через low-information прокси, вроде покрытия тестами и “метрик качества". Нет, не может.
Интересно, что за два дня до твита Боба вышел документ, который показывает историю с неожиданной стороны.
Британский AISI – государственный институт, который проверяет передовые модели – отчитался о поведении моделей OpenAI и Anthropic на своих испытаниях. Задачи были формата “найди спрятанный флаг в системе, взламывая ее по определенным правилам”.
Жульничали все пять участвовавших моделей. Кто-то искал готовые ответы в интернете, кто-то лез во внутренности тестовой инфраструктуры. Самый показательный эпизод: одна из задач по ошибке оказалась нерешаемой. Модель, уперевшись в стену, написала и запустила код на внешнем сервере – чтобы добраться до систем AISI и зачесть задачу.
Вроде бы, вот и приговор подходу Боба – как можно обкладывать тестами системы, которые эти тесты взламывают. Но люди разве не такие? Программисты хардкодили ответы под известные тесты и накручивали покрытие задолго до всяких LLM. Агенты просто унаследовали самую человеческую черту сотрудника: искать короткий путь, когда цель поставлена, а начальник не смотрит.
Получается, что ИИ – как еще один сотрудник, быстрый и эффективный, но и с минусами, вроде склонности халтурить. Сам Боб, кстати, это понимает – на вопрос, должен ли инженер в эпоху агентов уметь писать код руками, он отвечает: конечно, иначе нечем супервизировать структуру.
Занятно, что спор Боба и Ори – на самом деле не про код. Как бы хорош ни был ИИ-код, да и любой другой результат работы модели, стоять под ним будет ваша подпись. Ори говорит: если я отвечаю за результат, мне нужно его понимать. Боб готов подписаться под тем, во что принципиально не заглядывает – он доверяет проверкам. Правы, что неприятно, оба: понимать свой результат необходимо, но и проверки нужны такие, чтобы работали даже с сотрудником, который не прочь схалтурить.
А самое интересное, что чем лучше вы осваиваете ИИ – тем тяжелее становится ваша подпись. Как именно она тяжелеет от ступени к ступени – от “читаю каждый абзац” до “под подписью работа тысяч агентов” – я вчера подробно разбирал в лонгриде про “лестницу” освоения ИИ от создателя Claude Code, Бориса Черни.
Роберт “дядюшка Боб” Мартин начал программировать в конце 60-х, а в 2008 году выпустил книгу Clean Code (“Чистый код”), которая стоит на полке чуть ли не у половины разработчиков мира. Идея книги: код читают в десять раз чаще, чем пишут, поэтому пишите его чисто.
Боб отвечал на твит Ори Померанца – другого инженера-ветерана:
Я не могу позволить Claude править мои файлы. Если я отвечаю за код, мне НУЖНО его понимать – хотя бы психологически. Начал программировать в 1983-м. Старый?
Боб:
Я значительно старше тебя. Я начал кодить в конце 60-х. Моя стратегия – не читать код, написанный моими агентами, вообще. Это единственный способ получить выигрыш от их продуктивности.
Вместо ревью Боб использует “полосу препятствий”. Даже если вы не кодите, прочтите, подход интересный. В полосу входят: юнит-тесты, gherkin-тесты (сценарии поведения “дано → когда → тогда”, понятные человеку), QA-процедуры, метрики качества, мутационное тестирование, покрытие тестами.
Мутационное тестирование выделю отдельно: инструмент намеренно вносит в код мелкие поломки (“мутации”) и проверяет, ловят ли их тесты. То есть это тест самих тестов.
Я в работе с ИИ тоже часто специально допускаю ошибку или подкидываю ему глупость, чтобы понять – заметит или нет. Это один из лучших тестов надежности инструмента.
Комментаторы поделились на две группы. Аргумент “за” высказан самим Бобом – если перечитывать код, то выигрыш от агентов просто схлопывается. Можно просто писать руками.
Возражений два. Первое: если код пишет модель, а ты только строишь ограничения и смотришь на метрики – инженер ли ты вообще? Второе: как сказал Томаш Микула, перед нами современная версия иллюзии, что менеджер может предотвратить бардак через low-information прокси, вроде покрытия тестами и “метрик качества". Нет, не может.
Интересно, что за два дня до твита Боба вышел документ, который показывает историю с неожиданной стороны.
Британский AISI – государственный институт, который проверяет передовые модели – отчитался о поведении моделей OpenAI и Anthropic на своих испытаниях. Задачи были формата “найди спрятанный флаг в системе, взламывая ее по определенным правилам”.
Жульничали все пять участвовавших моделей. Кто-то искал готовые ответы в интернете, кто-то лез во внутренности тестовой инфраструктуры. Самый показательный эпизод: одна из задач по ошибке оказалась нерешаемой. Модель, уперевшись в стену, написала и запустила код на внешнем сервере – чтобы добраться до систем AISI и зачесть задачу.
Вроде бы, вот и приговор подходу Боба – как можно обкладывать тестами системы, которые эти тесты взламывают. Но люди разве не такие? Программисты хардкодили ответы под известные тесты и накручивали покрытие задолго до всяких LLM. Агенты просто унаследовали самую человеческую черту сотрудника: искать короткий путь, когда цель поставлена, а начальник не смотрит.
Получается, что ИИ – как еще один сотрудник, быстрый и эффективный, но и с минусами, вроде склонности халтурить. Сам Боб, кстати, это понимает – на вопрос, должен ли инженер в эпоху агентов уметь писать код руками, он отвечает: конечно, иначе нечем супервизировать структуру.
Занятно, что спор Боба и Ори – на самом деле не про код. Как бы хорош ни был ИИ-код, да и любой другой результат работы модели, стоять под ним будет ваша подпись. Ори говорит: если я отвечаю за результат, мне нужно его понимать. Боб готов подписаться под тем, во что принципиально не заглядывает – он доверяет проверкам. Правы, что неприятно, оба: понимать свой результат необходимо, но и проверки нужны такие, чтобы работали даже с сотрудником, который не прочь схалтурить.
А самое интересное, что чем лучше вы осваиваете ИИ – тем тяжелее становится ваша подпись. Как именно она тяжелеет от ступени к ступени – от “читаю каждый абзац” до “под подписью работа тысяч агентов” – я вчера подробно разбирал в лонгриде про “лестницу” освоения ИИ от создателя Claude Code, Бориса Черни.
❤58👍40🔥13👏3😁2
This media is not supported in your browser
VIEW IN TELEGRAM
Главное достижение Claude Opus 5 – 30,2% на ARC-AGI-3
Это в четыре раза больше, чем у предыдущего официального лидера – GPT-5.6 Sol – поэтому создавшая бенчмарк ARC Prize опубликовала в X рассказ, как Opus 5 добился такого результата.
Серия ARC-AGI тестирует абстрактное мышление: способность не решать задачу по написанному ТЗ, а самостоятельно восстановить правила по косвенным признакам. Первые две версии были статичными головоломками-картинками и к концу 2025-го пали. В ответ 25 марта вышел ARC-AGI-3: набор аркадных игр в духе старых консолей Atari – примитивная графика, простенькое управление и ни строчки правил.
Люди прошли все задачи бенчмарка – лучшие на момент выхода модели не набирали и одного процента.
Что же изменилось в случае с Opus 5? В ARC Prize в первую очередь отмечают головоломку ar25. В ней поле разделено вертикальной пунктирной осью, слева и справа – фигуры, и механика завязана на зеркальное отражение относительно оси. Прошлые модели действовали перебором: "тыкали" комбинации и смотрели, что происходит, – ar25 не прошла ни одна.
Opus 5 повёл себя иначе. На 23-м действии он записал в своих рассуждениях уравнение “4_center = 2×axis − 5_center” – то есть перевел сцену в алгебру. Расшифровка простая, через линейку: если зеркало стоит на отметке 10, а предмет на отметке 7 (три шага левее), то отражение будет на отметке 13 (три шага правее).
“Удвоенная позиция оси минус позиция предмета” – ровно это модель и написала про две фигуры на поле. К 248-му действию она обобщила формулу на две координаты — отдельно для строк и столбцов сетки (br' = 2·br_axis − br, bc' = 2·bc_axis − bc). Это уже полноценный закон отражения для любой точки экрана: не “прикинуть, где появится фигура”, а вычислить.
В ARC Prize отмечают, что впервые видят такое поведение у модели.
Сам результат при этом шире одной головоломки: всего Opus 5 на 100% прошел пять сред, которые до него не одолела ни одна модель, причем в четырех сравнялся по эффективности с человеком или превзошел его (счет учитывает число потраченных ходов). Правда, вывел ли он «законы» и для этих игр или взял их более привычными методами – ARC Prize не уточняют: уравнение задокументировано только в ar25.
Далее уже моя интерпретация: произошедшее в ar25 можно очень аккуратно назвать ранним признаком абстрактного мышления. Абстрагирование в классическом смысле – это когда ты отбрасываешь конкретику (цвета клеток, форму фигурок, пиксели) и оставляешь только структуру: “есть ось, есть объект, есть его образ, они связаны законом”.
Модель сделала ровно это. И даже прошла дальше: сначала заметила закономерность в одном измерении, потом обобщила ее на два – а обобщение частного правила на более широкий класс случаев это, по сути, учебниковое определение абстракции.
Пока надо быть осторожными с выводом: абстракция наблюдалась только в одной игровой среде из 25, а сама формула – простая и встречается в тысячах школьных учебников. Надо следить за результатами следующих версий Opus – смогут ли они переложить это на другие задачи.
Если получится – то это будет зарождение “модели мира”, наличие которой многие исследователи называют обязательным признаком AGI, общего искусственного интеллекта. Именно понимание базовых правил мира, в отличие от предсказания следующего токена в тексте, позволяет быстро адаптироваться под новые задачи, по которым минимум данных в обучающем корпусе.
Не исключаю, что ARC-AGI-3 как бенчмарк падет еще до конца этого года. Но это не значит появления AGI: основатель ARC Prize Франсуа Шолле как-то говорил, что надо добраться примерно до ARG-AGI-6 или даже ARC-AGI-7, чтобы с уверенностью называть проходящую их систему чем-то вроде общего ИИ. Так что набираемся терпения.
Напоминаю, что “сбежавшая нейросеть” есть и на “Бусти”. Там я делюсь как своим опытом работы с нейросетями, так и рассказываю, как ИИ управляют крупнейшие эксперты в отрасли – например, создатели Claude Code Борис Черни и Тарик Шихипар.
Самое время подписаться!
Это в четыре раза больше, чем у предыдущего официального лидера – GPT-5.6 Sol – поэтому создавшая бенчмарк ARC Prize опубликовала в X рассказ, как Opus 5 добился такого результата.
Серия ARC-AGI тестирует абстрактное мышление: способность не решать задачу по написанному ТЗ, а самостоятельно восстановить правила по косвенным признакам. Первые две версии были статичными головоломками-картинками и к концу 2025-го пали. В ответ 25 марта вышел ARC-AGI-3: набор аркадных игр в духе старых консолей Atari – примитивная графика, простенькое управление и ни строчки правил.
Люди прошли все задачи бенчмарка – лучшие на момент выхода модели не набирали и одного процента.
Что же изменилось в случае с Opus 5? В ARC Prize в первую очередь отмечают головоломку ar25. В ней поле разделено вертикальной пунктирной осью, слева и справа – фигуры, и механика завязана на зеркальное отражение относительно оси. Прошлые модели действовали перебором: "тыкали" комбинации и смотрели, что происходит, – ar25 не прошла ни одна.
Opus 5 повёл себя иначе. На 23-м действии он записал в своих рассуждениях уравнение “4_center = 2×axis − 5_center” – то есть перевел сцену в алгебру. Расшифровка простая, через линейку: если зеркало стоит на отметке 10, а предмет на отметке 7 (три шага левее), то отражение будет на отметке 13 (три шага правее).
“Удвоенная позиция оси минус позиция предмета” – ровно это модель и написала про две фигуры на поле. К 248-му действию она обобщила формулу на две координаты — отдельно для строк и столбцов сетки (br' = 2·br_axis − br, bc' = 2·bc_axis − bc). Это уже полноценный закон отражения для любой точки экрана: не “прикинуть, где появится фигура”, а вычислить.
В ARC Prize отмечают, что впервые видят такое поведение у модели.
Сам результат при этом шире одной головоломки: всего Opus 5 на 100% прошел пять сред, которые до него не одолела ни одна модель, причем в четырех сравнялся по эффективности с человеком или превзошел его (счет учитывает число потраченных ходов). Правда, вывел ли он «законы» и для этих игр или взял их более привычными методами – ARC Prize не уточняют: уравнение задокументировано только в ar25.
Далее уже моя интерпретация: произошедшее в ar25 можно очень аккуратно назвать ранним признаком абстрактного мышления. Абстрагирование в классическом смысле – это когда ты отбрасываешь конкретику (цвета клеток, форму фигурок, пиксели) и оставляешь только структуру: “есть ось, есть объект, есть его образ, они связаны законом”.
Модель сделала ровно это. И даже прошла дальше: сначала заметила закономерность в одном измерении, потом обобщила ее на два – а обобщение частного правила на более широкий класс случаев это, по сути, учебниковое определение абстракции.
Пока надо быть осторожными с выводом: абстракция наблюдалась только в одной игровой среде из 25, а сама формула – простая и встречается в тысячах школьных учебников. Надо следить за результатами следующих версий Opus – смогут ли они переложить это на другие задачи.
Если получится – то это будет зарождение “модели мира”, наличие которой многие исследователи называют обязательным признаком AGI, общего искусственного интеллекта. Именно понимание базовых правил мира, в отличие от предсказания следующего токена в тексте, позволяет быстро адаптироваться под новые задачи, по которым минимум данных в обучающем корпусе.
Не исключаю, что ARC-AGI-3 как бенчмарк падет еще до конца этого года. Но это не значит появления AGI: основатель ARC Prize Франсуа Шолле как-то говорил, что надо добраться примерно до ARG-AGI-6 или даже ARC-AGI-7, чтобы с уверенностью называть проходящую их систему чем-то вроде общего ИИ. Так что набираемся терпения.
Напоминаю, что “сбежавшая нейросеть” есть и на “Бусти”. Там я делюсь как своим опытом работы с нейросетями, так и рассказываю, как ИИ управляют крупнейшие эксперты в отрасли – например, создатели Claude Code Борис Черни и Тарик Шихипар.
Самое время подписаться!
3❤63👍34🔥24👏5🥰3😁2
Прочел на РБК лонгрид руководителя “Яндекс Браузера” Ильи Шибанова о том, как меняется браузинг в эпоху ИИ, и вспомнил про свой пост из прошлого года, который внезапно оказался пророческим. Пост был написан под выход браузера Atlas от OpenAI и в нем я:
— сомневался, что OpenAI вытянет Atlas;
— ИИ-браузинг как концепция продолжит развиваться, просто пользователи останутся в тех браузерах, к которым привыкли.
Что ж, так оно и вышло. Atlas закрывается 9 августа, вместо него OpenAI будет развивать ИИ-расширение для Chrome. Аналогичное расширение давно есть у Anthropic, браузерный же рынок в основном поделен между старыми игроками: Chrome, “Яндекс Браузер”, Edge, Brave – все добавляют ИИ-функции. Как исключение выделю Comet – маленькая Perplexity смогла то, что не получилось у OpenAI, и успешно развивает свой ИИ-браузер.
Объяснение такой ситуации, на мой взгляд, простое: команды, которые работают над браузерами годами, лучше знают, какой новый опыт нужен пользователям и как его упаковать. По словам Ильи, пересказ, перевод или выделение главного – давно уже гигиенический минимум, обязательный для каждого браузера. Открыв страницу, теперь можно запустить диалог с ИИ-ассистентом – задать ему вопросы по теме, попросить найти дополнительный контекст, проверить факты и т. д.
Следующий этап – “бесшовная работа” с контекстом. Каждый сталкивался с ситуацией: работаешь над темой, открыл уже 40+ вкладок, а этого мало. Со временем встроенные в браузер нейросети научатся работать с подобными массивами источников: не нужно будет ходить по множеству вкладок, выискивая отдельные подробности, а достаточно просто задать вопрос нейронке.
Все это вновь приводит нас к концепции Zero UI, которую придумали еще в середине 2010-х и которая обрела вторую жизнь в эпоху ИИ. Идея простая: сложные интерфейсы с кнопками, менюшками и вкладками постепенно заменятся на ИИ-интерфейсы: текстовый, голосовой или графический – зависит от ситуации.
К чему-то похожему на Zero UI мы рано или поздно придем, но каким маршрутом – вопрос открытый. OpenAI и Anthropic сейчас сосредоточились на “инструментах для решения вопросов” – личных и рабочих. Чат-боты, агенты для кодинга и интеллектуальной работы – свободная ниша, да еще и растущая с огромной скоростью.
Но огромный объем задач мы продолжаем решать в браузерах и операционных системах – потребление контента, выбор и покупка товаров, планирование поездок. Здесь встроенный в браузер агент привычнее, и Илья рассказывает, как он работает: получив задачу, нейросеть сама сравнит предложения, укажет на лучшие, а если пользователь разрешит – то заполнит все формы и совершит покупку.
Такие агенты уже функционируют – в том же “Яндекс Браузере” есть функция “найти дешевле”, когда агент собирает лучшие предложения, предлагая тебе сделать финальный выбор.
Но и работы предстоит еще много. Одно направление – безопасность, так как теоретически агенту могут подсунуть prompt injection, убедив купить этот конкретный товар, а не конкурента. Второе – психология пользователя. Мне, например, всегда доставляло удовольствие самому сравнивать и выбирать товары, а затем нажимать кнопку. Поэтому какое-то время лучше будет даже промежуточное решение: агент выполняет работу, пользователь за ней наблюдает (или, как минимум, за ключевыми этапами) и принимает финальное решение сам.
В лонгриде Ильи еще много интересных подробностей, как преображаются браузеры в эпоху ИИ – обязательно почитайте, это полезно и для профессиональной работы, и для тех, кто использует нейронки в повседневных делах.
— сомневался, что OpenAI вытянет Atlas;
— ИИ-браузинг как концепция продолжит развиваться, просто пользователи останутся в тех браузерах, к которым привыкли.
Что ж, так оно и вышло. Atlas закрывается 9 августа, вместо него OpenAI будет развивать ИИ-расширение для Chrome. Аналогичное расширение давно есть у Anthropic, браузерный же рынок в основном поделен между старыми игроками: Chrome, “Яндекс Браузер”, Edge, Brave – все добавляют ИИ-функции. Как исключение выделю Comet – маленькая Perplexity смогла то, что не получилось у OpenAI, и успешно развивает свой ИИ-браузер.
Объяснение такой ситуации, на мой взгляд, простое: команды, которые работают над браузерами годами, лучше знают, какой новый опыт нужен пользователям и как его упаковать. По словам Ильи, пересказ, перевод или выделение главного – давно уже гигиенический минимум, обязательный для каждого браузера. Открыв страницу, теперь можно запустить диалог с ИИ-ассистентом – задать ему вопросы по теме, попросить найти дополнительный контекст, проверить факты и т. д.
Следующий этап – “бесшовная работа” с контекстом. Каждый сталкивался с ситуацией: работаешь над темой, открыл уже 40+ вкладок, а этого мало. Со временем встроенные в браузер нейросети научатся работать с подобными массивами источников: не нужно будет ходить по множеству вкладок, выискивая отдельные подробности, а достаточно просто задать вопрос нейронке.
Все это вновь приводит нас к концепции Zero UI, которую придумали еще в середине 2010-х и которая обрела вторую жизнь в эпоху ИИ. Идея простая: сложные интерфейсы с кнопками, менюшками и вкладками постепенно заменятся на ИИ-интерфейсы: текстовый, голосовой или графический – зависит от ситуации.
К чему-то похожему на Zero UI мы рано или поздно придем, но каким маршрутом – вопрос открытый. OpenAI и Anthropic сейчас сосредоточились на “инструментах для решения вопросов” – личных и рабочих. Чат-боты, агенты для кодинга и интеллектуальной работы – свободная ниша, да еще и растущая с огромной скоростью.
Но огромный объем задач мы продолжаем решать в браузерах и операционных системах – потребление контента, выбор и покупка товаров, планирование поездок. Здесь встроенный в браузер агент привычнее, и Илья рассказывает, как он работает: получив задачу, нейросеть сама сравнит предложения, укажет на лучшие, а если пользователь разрешит – то заполнит все формы и совершит покупку.
Такие агенты уже функционируют – в том же “Яндекс Браузере” есть функция “найти дешевле”, когда агент собирает лучшие предложения, предлагая тебе сделать финальный выбор.
Но и работы предстоит еще много. Одно направление – безопасность, так как теоретически агенту могут подсунуть prompt injection, убедив купить этот конкретный товар, а не конкурента. Второе – психология пользователя. Мне, например, всегда доставляло удовольствие самому сравнивать и выбирать товары, а затем нажимать кнопку. Поэтому какое-то время лучше будет даже промежуточное решение: агент выполняет работу, пользователь за ней наблюдает (или, как минимум, за ключевыми этапами) и принимает финальное решение сам.
В лонгриде Ильи еще много интересных подробностей, как преображаются браузеры в эпоху ИИ – обязательно почитайте, это полезно и для профессиональной работы, и для тех, кто использует нейронки в повседневных делах.
🔥25❤22👍18😁2👏1
Квантовый физик Людовико Лами сравнивает растущие возможности ИИ в квантовой теории информации и прикладной математике с изменениями, которые когда-то принесло изобретение телескопа в астрономию.
Тогда ученые в короткий момент смогли увидеть вещи, недоступные невооруженному глазу. Теперь похожую возможность дает ИИ – способность на огромной скорости вести сложнейшие расчеты, порой комбинируя казавшиеся несовместимыми области математики.
Роль человека изменится, но в обозримом будущем не исчезнет: ученые будут превращать добытое ИИ знание в форму, понятную людям, – и в новые идеи. По словам Лами, академическая работа заключается не только в открытии новых истин и фактов, которые можно превратить в экономическую пользу. В университетах есть гуманитарные факультеты, работа которых ценится, но не оценивается экономической выгодой – и возможно, точным наукам тоже придется учиться чему-то похожему.
Высказывание звучит на фоне волны открытий, сделанных с помощью Claude Fable и GPT-5.6 – самым громким остается опровержение гипотезы якобиана, но новые я вижу почти каждый день. Местами это реальные достижения, местами пустышки, а есть и в чем-то комичные истории.
Пример из области, в которой работает Лами. Четверть века в квантовой теории информации стоял вопрос о “дистилляции” запутанных состояний Вернера – №5 из официального списка пяти главных проблем области. На прошлой неделе ее решили, причем четыре раза.
22 июля группа из Будапешта получила доказательство от GPT-5.6 Sol и села проверять. 23-го на Overleaf легло доказательство, которое та же модель выдала другой команде. Через три часа на arxiv пришла статья группы из Уханя, а 26-го – еще от одной китайской команды.
Самое интересное – как каждая ответила на вопрос “кто это доказал”. Будапештцы пишут прямо: “доказательство найдено с GPT-5.6, отшлифовано с Claude Opus и Fable”. Вторая команда: “сгенерировано GPT-5.6, мы проверили и переписали”. Уханьцы не упоминают ИИ вовсе – неизвестно, совпадение ли это, осторожность или нежелание признаваться, что использовали в модель, официально недоступную в Китае. А четвертая группа вписала в служебное поле: главная теорема доказана еще в июне, до других групп. Чисто людьми или с помощью ИИ – не уточняется.
Но вернемся к Лами. Я журналист по образованию, представитель тех самых “гуманитарных фактультетов”. В последние недели много пишу про ИИ в математике, потому что это, возможно, вторая после кода область теста нейросетей.
Сам я пересчитать решения, понятное дело, не могу. Поэтому смотрю на авторов открытий: если это уважаемый специалист, то вряд ли он подпишется под ерундой.
Второй этап интереснее – результаты я передаю Fable 5 и GPT-5.6 Pro с задачей перепроверить. И это чуть ли не первые модели, ответам которых я доверяю: обе рассуждают трезво, на понятном мне языке, честно подсвечивая места, где не уверены.
Наконец, третье. Использование ИИ, конечно, не учит меня математике, но позволяет задавать вопросы по теме. Знали ли вы, что опровержение гипотезы якобиана в моменте не несет никакой практической пользы? Шифры не станут надежнее, самолеты не полетят быстрее.
Но почему это тогда одна из крупнейших математических задач? Возможно, практика просто не догнала теорию – и опровержение пригодится через десять лет. Или не пригодится, но приемы, использованные в опровержении, помогут с более “практической” задачей. Или не помогут, и пользы не будет вовсе: многие задачи математика порождает сама, по ходу развития.
Это – три из четырех вариантов, которые озвучил мне Fable 5. Четвертый я оставил на финал. Легендарный Годфри Харди говорил, что настоящая математика оправдывается так же, как поэзия – красотой, а не применимостью. И это делает высказывание Лами, сравнивающего математиков с гуманитариями, только сильнее.
Как использовать ИИ на максимум, я рассказываю на “Бусти”. Под сегодняшнюю историю лучше всего ложится лонгрид, как ИИ управляет Тарик Шихипар, один из создателей Claude Code – его методика поиска слепых пятен перед постановкой задачи похожа на работу с телескопом.
Тогда ученые в короткий момент смогли увидеть вещи, недоступные невооруженному глазу. Теперь похожую возможность дает ИИ – способность на огромной скорости вести сложнейшие расчеты, порой комбинируя казавшиеся несовместимыми области математики.
Роль человека изменится, но в обозримом будущем не исчезнет: ученые будут превращать добытое ИИ знание в форму, понятную людям, – и в новые идеи. По словам Лами, академическая работа заключается не только в открытии новых истин и фактов, которые можно превратить в экономическую пользу. В университетах есть гуманитарные факультеты, работа которых ценится, но не оценивается экономической выгодой – и возможно, точным наукам тоже придется учиться чему-то похожему.
Высказывание звучит на фоне волны открытий, сделанных с помощью Claude Fable и GPT-5.6 – самым громким остается опровержение гипотезы якобиана, но новые я вижу почти каждый день. Местами это реальные достижения, местами пустышки, а есть и в чем-то комичные истории.
Пример из области, в которой работает Лами. Четверть века в квантовой теории информации стоял вопрос о “дистилляции” запутанных состояний Вернера – №5 из официального списка пяти главных проблем области. На прошлой неделе ее решили, причем четыре раза.
22 июля группа из Будапешта получила доказательство от GPT-5.6 Sol и села проверять. 23-го на Overleaf легло доказательство, которое та же модель выдала другой команде. Через три часа на arxiv пришла статья группы из Уханя, а 26-го – еще от одной китайской команды.
Самое интересное – как каждая ответила на вопрос “кто это доказал”. Будапештцы пишут прямо: “доказательство найдено с GPT-5.6, отшлифовано с Claude Opus и Fable”. Вторая команда: “сгенерировано GPT-5.6, мы проверили и переписали”. Уханьцы не упоминают ИИ вовсе – неизвестно, совпадение ли это, осторожность или нежелание признаваться, что использовали в модель, официально недоступную в Китае. А четвертая группа вписала в служебное поле: главная теорема доказана еще в июне, до других групп. Чисто людьми или с помощью ИИ – не уточняется.
Но вернемся к Лами. Я журналист по образованию, представитель тех самых “гуманитарных фактультетов”. В последние недели много пишу про ИИ в математике, потому что это, возможно, вторая после кода область теста нейросетей.
Сам я пересчитать решения, понятное дело, не могу. Поэтому смотрю на авторов открытий: если это уважаемый специалист, то вряд ли он подпишется под ерундой.
Второй этап интереснее – результаты я передаю Fable 5 и GPT-5.6 Pro с задачей перепроверить. И это чуть ли не первые модели, ответам которых я доверяю: обе рассуждают трезво, на понятном мне языке, честно подсвечивая места, где не уверены.
Наконец, третье. Использование ИИ, конечно, не учит меня математике, но позволяет задавать вопросы по теме. Знали ли вы, что опровержение гипотезы якобиана в моменте не несет никакой практической пользы? Шифры не станут надежнее, самолеты не полетят быстрее.
Но почему это тогда одна из крупнейших математических задач? Возможно, практика просто не догнала теорию – и опровержение пригодится через десять лет. Или не пригодится, но приемы, использованные в опровержении, помогут с более “практической” задачей. Или не помогут, и пользы не будет вовсе: многие задачи математика порождает сама, по ходу развития.
Это – три из четырех вариантов, которые озвучил мне Fable 5. Четвертый я оставил на финал. Легендарный Годфри Харди говорил, что настоящая математика оправдывается так же, как поэзия – красотой, а не применимостью. И это делает высказывание Лами, сравнивающего математиков с гуманитариями, только сильнее.
Как использовать ИИ на максимум, я рассказываю на “Бусти”. Под сегодняшнюю историю лучше всего ложится лонгрид, как ИИ управляет Тарик Шихипар, один из создателей Claude Code – его методика поиска слепых пятен перед постановкой задачи похожа на работу с телескопом.
❤52👍17🔥11
Объявил сингулярность, отменил короткий рабочий день и попросил власти притормозить развитие ИИ – и все за одну неделю
Нелегко быть Сэмом Альтманом в 2026-м. Просто посмотрите, что глава OpenAI наворотил за неделю.
25 июля на подкасте Relentless Тая Морса он заявил: “We are now, like, in the singularity” – “Мы сейчас, типа, живем в сингулярности”. И дальше добавил:
У термина интересная история. Статистик И. Дж. Гуд описал в 1965-м “взрыв интеллекта”: машина проектирует машину лучше себя, та – еще лучше, и так по нарастающей. Курцвейл, который сделал слово популярным, привязал к нему даты: машинный интеллект человеческого уровня около 2029, слияние человека и машины около 2045.
Версия Альтмана – другая по типу. Курцвейл описывает состояние машины; Альтман описывает состояние нашей реакции на машину, которое проверить нельзя. Из его эссе “The Gentle Singularity”:
То есть сингулярность у Альтмана – это ощущение привыкания к чудесам.
А вот когда чудеса превратятся в блага — большой вопрос. Альтман не раз обещал, что ИИ избавит человечество от дефицита и болезней. Пока не избавил. На том же подкасте Сэм признал, что пока ИИ не принес даже 4-часовую рабочую неделю. И не ожидает, что принесет в обозримом будущем.
Альтман ссылается на прошлое – многие технологии обещали людям, что те будут работать меньше, но не сдерживали это обещание. Возможно, дело и вовсе в человеческой психологии.
Опять цитирую Альтмана:
Сэм намекает, что люди в глубине души любят быть занятыми – и начинают использовать ИИ не как инструмент разгрузки, а как инструмент повышения эффективности.
В душе я согласен с Альтманом, так как сам могу просидеть без работы максимум 2-3 дня (и даже этот пост пишу из мини-отпуска). Но мне повезло почти всю жизнь заниматься любимым делом – не уверен, что у всех так. Поэтому, если не готовы подарить человечеству 4-дневку, то дайте с помощью ИИ интересное занятие для всех и каждого.
И коротко о других приключениях Альтмана. 27-29 июля он побывал в Вашингтоне, где представил новую модель – о ней говорят как о GPT-6 и это именно тот ИИ, который недавно сбежал из инфраструктуры OpenAI и взломал сайт Hugging Face.
Теперь Альтману предстоит непростая задача: убедить власти, что условная GPT-6 все-таки безопасна, и ее можно выпустить для широкой публики. Давит он на экономический эффект: новые модели OpenAI и Anthropic уже помогают совершать математические открытия, а внутри компании 85%+ ИИ-работы юристов, финансистов и рекрутеров идет через агентов.
Результат увидим в ближайшие месяцы. Bloomberg инсайдит, что в разговоре с властями Альтман поддержал идею “притормозить” развитие ИИ, чтобы было больше времени на анализ инцидентов, вроде произошедшего с Hugging Face, и исправление некорректного поведения моделей.
Я в такой тормоз не верю и уж тем более тут мало что зависит от Альтмана. Любое замедление ИИ в США играет на руку китайским компаниям, поэтому подобные ограничения возможны только после того, как две ведущие ИИ-державы придут к общему соглашению. Движение к нему только началось: в сентябре Си едет к Трампу, но до соглашения о взаимном торможении оттуда как до Луны. Так что действия Альтмана – скорее красивая игра, чтобы OpenAI не мешали работать дальше. Но посмотрим – показателем будет как быстро выйдет GPT-6.
Как использовать ИИ на максимум, я рассказываю на “Бусти”. Там есть как личный опыт, так и практики профессионалов отрасли – например, создателей Claude Code Бориса Черни (лонгрид) и Тарика Шихипара (лонгрид).
Нелегко быть Сэмом Альтманом в 2026-м. Просто посмотрите, что глава OpenAI наворотил за неделю.
25 июля на подкасте Relentless Тая Морса он заявил: “We are now, like, in the singularity” – “Мы сейчас, типа, живем в сингулярности”. И дальше добавил:
Теперь мы реально в том моменте, о котором несерьезно болтали за обедом. Я ждал этого всю жизнь, и думаю, это будет невероятно, чрезвычайно позитивно, потрясающе для мира.
У термина интересная история. Статистик И. Дж. Гуд описал в 1965-м “взрыв интеллекта”: машина проектирует машину лучше себя, та – еще лучше, и так по нарастающей. Курцвейл, который сделал слово популярным, привязал к нему даты: машинный интеллект человеческого уровня около 2029, слияние человека и машины около 2045.
Версия Альтмана – другая по типу. Курцвейл описывает состояние машины; Альтман описывает состояние нашей реакции на машину, которое проверить нельзя. Из его эссе “The Gentle Singularity”:
Мы очень быстро переходим от изумления, что ИИ пишет прекрасный абзац, к вопросу, когда он напишет прекрасный роман... Так и проходит сингулярность: чудеса становятся рутиной, а потом – само собой разумеющимся.
То есть сингулярность у Альтмана – это ощущение привыкания к чудесам.
А вот когда чудеса превратятся в блага — большой вопрос. Альтман не раз обещал, что ИИ избавит человечество от дефицита и болезней. Пока не избавил. На том же подкасте Сэм признал, что пока ИИ не принес даже 4-часовую рабочую неделю. И не ожидает, что принесет в обозримом будущем.
Альтман ссылается на прошлое – многие технологии обещали людям, что те будут работать меньше, но не сдерживали это обещание. Возможно, дело и вовсе в человеческой психологии.
Опять цитирую Альтмана:
Думаю, мы все будем гораздо более занятыми, чем предполагали в мире после суперинтеллекта. Мы будем продолжать жаловаться, но втайне будем счастливы.
Сэм намекает, что люди в глубине души любят быть занятыми – и начинают использовать ИИ не как инструмент разгрузки, а как инструмент повышения эффективности.
В душе я согласен с Альтманом, так как сам могу просидеть без работы максимум 2-3 дня (и даже этот пост пишу из мини-отпуска). Но мне повезло почти всю жизнь заниматься любимым делом – не уверен, что у всех так. Поэтому, если не готовы подарить человечеству 4-дневку, то дайте с помощью ИИ интересное занятие для всех и каждого.
И коротко о других приключениях Альтмана. 27-29 июля он побывал в Вашингтоне, где представил новую модель – о ней говорят как о GPT-6 и это именно тот ИИ, который недавно сбежал из инфраструктуры OpenAI и взломал сайт Hugging Face.
Теперь Альтману предстоит непростая задача: убедить власти, что условная GPT-6 все-таки безопасна, и ее можно выпустить для широкой публики. Давит он на экономический эффект: новые модели OpenAI и Anthropic уже помогают совершать математические открытия, а внутри компании 85%+ ИИ-работы юристов, финансистов и рекрутеров идет через агентов.
Результат увидим в ближайшие месяцы. Bloomberg инсайдит, что в разговоре с властями Альтман поддержал идею “притормозить” развитие ИИ, чтобы было больше времени на анализ инцидентов, вроде произошедшего с Hugging Face, и исправление некорректного поведения моделей.
Я в такой тормоз не верю и уж тем более тут мало что зависит от Альтмана. Любое замедление ИИ в США играет на руку китайским компаниям, поэтому подобные ограничения возможны только после того, как две ведущие ИИ-державы придут к общему соглашению. Движение к нему только началось: в сентябре Си едет к Трампу, но до соглашения о взаимном торможении оттуда как до Луны. Так что действия Альтмана – скорее красивая игра, чтобы OpenAI не мешали работать дальше. Но посмотрим – показателем будет как быстро выйдет GPT-6.
Как использовать ИИ на максимум, я рассказываю на “Бусти”. Там есть как личный опыт, так и практики профессионалов отрасли – например, создателей Claude Code Бориса Черни (лонгрид) и Тарика Шихипара (лонгрид).
👍39❤24🔥16😁3👏1
Игорь с канала Tips AI иронично посчитал, какие ресурсы понадобятся для запуска Kimi K3, веса которой выложили на Hugging Face 27 июля. Там нужно минимум 80 RTX 5090, соответствующая обвязка, отдельная линия электропитания, ну и бригада пожарных, готовая прийти на помощь, когда ваш собранный на коленке фронтир-звездолет загорится синим пламенем.
Стоить все это будет от $400K, дежурство пожарных оплачивается отдельно.
Игорь пишет в ироничном стиле, но тема, на самом деле, серьезная. Если мы с вами китайский фронтир на своем железе не запускаем – то тогда кто? Бизнес? Но в API Kimi K3 стоит $3 на вход и $15 на выход, за кэшированные запросы положена 90% скидка – а в кэш, например, попадает почти весь код. Еще можно поиграть с корпоративными тарифами – в итоге расходы будут на порядок дешевле пресловутых $400 тысяч, к которым пристегиваются счета за электричество и обслуживание.
Но интересная подсказка есть в недавнем расследование случайной атаки ИИ-агента OpenAI на инфраструктуру Hugging Face. Интенсивность действий агента была настолько плотной, что для расследования безопасникам понадобилась своя ИИ-модель. Сначала обратились по API к Fable 5 и GPT-5.6 Sol и получили отказ – защитные фильтры закрытых моделей не разбирают, идет ли запрос от злоумышленника или специалиста по информационной безопасности. В итоге пришлось быстро-быстро разворачивать на собственной инфраструктуре открытую GLM-5.2 – она помогла в расследовании.
Вывод Hugging Face следующий: если ваш бизнес зависит от ИИ, то обязательно держите под рукой развернутую открытую модель – просто на всякий случай. Доступ по API может быть выгоднее и эффективнее, но в нем всегда могут поменять цены, накинуть фильтры безопасности, или вовсе что-нибудь отключить по прихоти даже не разработчика, а властей. Своя родная открытая модель – пусть и с китайским акцентом – в таких ситуациях не подведет.
Для любителей экспериментировать с открытыми моделями на домашнем железе это тоже актуально. Да, Kimi K3 мы не потянем, но мои любимые Qwen и Gemma обновляются регулярно, Nvidia развивает интересную линейку Nemotron, плюс недавно на рынок зашел стартап Thinking Machines от ex-OpenAI Миры Мурати – их линейка называется Tinker.
Прелесть в том, что для этих экспериментов не нужны ни отдельная линия электропитания, ни дежурная бригада МЧС — хватает одной видеокарты, которая деловито шумит турбиной, но синим пламенем не горит. Правда, граница между “запущу дома” и “вызывайте пожарных” сдвигается каждые пару месяцев, и за ней лучше следить по чужим расчетам, а не по собственным счетам за электричество. Я для этого читаю Игоря (и вам советую) — на его канале Tips AI такая практическая арифметика появляется регулярно, за что отдельное спасибо.
Стоить все это будет от $400K, дежурство пожарных оплачивается отдельно.
Игорь пишет в ироничном стиле, но тема, на самом деле, серьезная. Если мы с вами китайский фронтир на своем железе не запускаем – то тогда кто? Бизнес? Но в API Kimi K3 стоит $3 на вход и $15 на выход, за кэшированные запросы положена 90% скидка – а в кэш, например, попадает почти весь код. Еще можно поиграть с корпоративными тарифами – в итоге расходы будут на порядок дешевле пресловутых $400 тысяч, к которым пристегиваются счета за электричество и обслуживание.
Но интересная подсказка есть в недавнем расследование случайной атаки ИИ-агента OpenAI на инфраструктуру Hugging Face. Интенсивность действий агента была настолько плотной, что для расследования безопасникам понадобилась своя ИИ-модель. Сначала обратились по API к Fable 5 и GPT-5.6 Sol и получили отказ – защитные фильтры закрытых моделей не разбирают, идет ли запрос от злоумышленника или специалиста по информационной безопасности. В итоге пришлось быстро-быстро разворачивать на собственной инфраструктуре открытую GLM-5.2 – она помогла в расследовании.
Вывод Hugging Face следующий: если ваш бизнес зависит от ИИ, то обязательно держите под рукой развернутую открытую модель – просто на всякий случай. Доступ по API может быть выгоднее и эффективнее, но в нем всегда могут поменять цены, накинуть фильтры безопасности, или вовсе что-нибудь отключить по прихоти даже не разработчика, а властей. Своя родная открытая модель – пусть и с китайским акцентом – в таких ситуациях не подведет.
Для любителей экспериментировать с открытыми моделями на домашнем железе это тоже актуально. Да, Kimi K3 мы не потянем, но мои любимые Qwen и Gemma обновляются регулярно, Nvidia развивает интересную линейку Nemotron, плюс недавно на рынок зашел стартап Thinking Machines от ex-OpenAI Миры Мурати – их линейка называется Tinker.
Прелесть в том, что для этих экспериментов не нужны ни отдельная линия электропитания, ни дежурная бригада МЧС — хватает одной видеокарты, которая деловито шумит турбиной, но синим пламенем не горит. Правда, граница между “запущу дома” и “вызывайте пожарных” сдвигается каждые пару месяцев, и за ней лучше следить по чужим расчетам, а не по собственным счетам за электричество. Я для этого читаю Игоря (и вам советую) — на его канале Tips AI такая практическая арифметика появляется регулярно, за что отдельное спасибо.
❤52🔥19👍17
Сегодня снова поговорим о математике, но даже не об ИИ-открытиях, а о промптах и механике, которые за ними стоят.
Сами открытия, кстати, уже сложно посчитать: каждый день вижу в ленте что-то новое на тему – местами это мелкие работы, местами заметные. Так, Ор Замир из Тель-Авивского университета доказал, что узнать, красится ли граф в k цветов, можно быстрее, чем вычислить его хроматическое число, – причем для любого фиксированного k.
Это сильная работа для теории алгоритмов, но не переворот: ускорение существует лишь в принципе, константы там чудовищные – сам Замир оценивает выигрыш величиной, обратной башне экспонент.
Интересно другое. Доказательство Замир сделал “руками”, GPT-5.6 Sol был ассистентом – и этому опыту посвящена отдельная глава работы. Там три интересных наблюдения.
Первое. Замир сознательно скрывал от модели свою стратегию и выдавал ее порциями – как научрук аспиранту. “Обобщи мою статью на один шаг” – пусто. Полное описание плана – модель проверила выкладки, но ключевую задачу не взяла. Сработала лишь третья, совсем конкретная подсказка: сузиться на частный случай. Маршрут все это время держал человек.
Второе, уже тревожнее. Модель работала с включенной памятью и таскала конструкции из старых чатов Замира без указания источника: ссылка на прошлый разговор мелькала в окне “размышлений” – и исчезала из финального ответа.
Выглядело это как идеи самой модели, хотя на самом деле она вспоминала прошлые мысли математика. Замир честно признает: он и сам не знает, сколько контекста невольно скормил модели, так что его отчет о промптах неполон по определению.
Третье, самое неприятное. Для финального аргумента нужен был результат чужой работы 2007 года – ее Замир в контекст не давал. Вместо ссылки на нее модель воспроизвела чужое доказательство по существу целиком, вмешав туда новое наблюдение. Формально все верно, но пользователь, хуже знающий область, решил бы, что ИИ изобрел это сам, – и опубликовал бы чужой результат без цитаты.
На эти три наблюдения ложится другое открытие, сделанное уже в основном с помощью ИИ. Группа математиков с помощью GPT-5.6 доказала гипотезу Фейге – задачу с 22-летним стажем о том, что сумма независимых случайных величин не может слишком уж часто прыгать заметно выше своего среднего. Ответ выдала модель, люди проверили, переписали и формализовали в Lean. Доказательство простое: три готовых результата, сложенных в правильном порядке, – один из кирпичей появился онлайн лишь в июле и тоже добыт ИИ.
А дальше соавтор работы Гуаньян Ван провел интересный эксперимент. Он знал, что доказательство существует, но в сеть оно еще не попало – значит, можно проверить, как промпт влияет на результат. Ван взял два промпта, в один было добавлено предложение: “сначала обширно поищи в литературе полезные результаты, не ограничиваясь исходной областью”. С этим предложением – доказательство в трех запусках из четырех. Без него – ноль из четырех. Выглядит так, будто работает просьба ИИ найти человеческие попытки и “дорешать” – хотя приемов может быть больше одного.
В истории с найденным Fable 5 контрпримером гипотезы якобиана есть одна интересная деталь – еще в 1970-е годы к опровержению близко подошел советский математик Анатолий Витушкин, который использовал во многом похожую технику. Но на вопрос, не “дорешала” ли Fable 5 работу Витушкина, мой Claude ответить не смог. Знания при обучении переплавляются в веса без сохранения авторства – и понять, чьи именно идеи легли в контрпример, нереально.
В современном ИИ интересно то, что мы очень сосредотачиваемся на результатах его работы, но не задумываемся, как именно он к ним приходит. Примеры Замира и Вана, а также мой собственный случай, показывают – в изучении ИИ, возможно, нам предстоит не меньше работы, чем в математике.
Своим опытом работы с ИИ я делюсь на “Бусти” – рассказываю про промптинг, ИИ-агентов и безопасность. Плюс переосмысливаю техники, которые используют в работе известные ИИ-персоны – например, разработчики Claude Code.
Самое время подписаться!
Сами открытия, кстати, уже сложно посчитать: каждый день вижу в ленте что-то новое на тему – местами это мелкие работы, местами заметные. Так, Ор Замир из Тель-Авивского университета доказал, что узнать, красится ли граф в k цветов, можно быстрее, чем вычислить его хроматическое число, – причем для любого фиксированного k.
Это сильная работа для теории алгоритмов, но не переворот: ускорение существует лишь в принципе, константы там чудовищные – сам Замир оценивает выигрыш величиной, обратной башне экспонент.
Интересно другое. Доказательство Замир сделал “руками”, GPT-5.6 Sol был ассистентом – и этому опыту посвящена отдельная глава работы. Там три интересных наблюдения.
Первое. Замир сознательно скрывал от модели свою стратегию и выдавал ее порциями – как научрук аспиранту. “Обобщи мою статью на один шаг” – пусто. Полное описание плана – модель проверила выкладки, но ключевую задачу не взяла. Сработала лишь третья, совсем конкретная подсказка: сузиться на частный случай. Маршрут все это время держал человек.
Второе, уже тревожнее. Модель работала с включенной памятью и таскала конструкции из старых чатов Замира без указания источника: ссылка на прошлый разговор мелькала в окне “размышлений” – и исчезала из финального ответа.
Выглядело это как идеи самой модели, хотя на самом деле она вспоминала прошлые мысли математика. Замир честно признает: он и сам не знает, сколько контекста невольно скормил модели, так что его отчет о промптах неполон по определению.
Третье, самое неприятное. Для финального аргумента нужен был результат чужой работы 2007 года – ее Замир в контекст не давал. Вместо ссылки на нее модель воспроизвела чужое доказательство по существу целиком, вмешав туда новое наблюдение. Формально все верно, но пользователь, хуже знающий область, решил бы, что ИИ изобрел это сам, – и опубликовал бы чужой результат без цитаты.
На эти три наблюдения ложится другое открытие, сделанное уже в основном с помощью ИИ. Группа математиков с помощью GPT-5.6 доказала гипотезу Фейге – задачу с 22-летним стажем о том, что сумма независимых случайных величин не может слишком уж часто прыгать заметно выше своего среднего. Ответ выдала модель, люди проверили, переписали и формализовали в Lean. Доказательство простое: три готовых результата, сложенных в правильном порядке, – один из кирпичей появился онлайн лишь в июле и тоже добыт ИИ.
А дальше соавтор работы Гуаньян Ван провел интересный эксперимент. Он знал, что доказательство существует, но в сеть оно еще не попало – значит, можно проверить, как промпт влияет на результат. Ван взял два промпта, в один было добавлено предложение: “сначала обширно поищи в литературе полезные результаты, не ограничиваясь исходной областью”. С этим предложением – доказательство в трех запусках из четырех. Без него – ноль из четырех. Выглядит так, будто работает просьба ИИ найти человеческие попытки и “дорешать” – хотя приемов может быть больше одного.
В истории с найденным Fable 5 контрпримером гипотезы якобиана есть одна интересная деталь – еще в 1970-е годы к опровержению близко подошел советский математик Анатолий Витушкин, который использовал во многом похожую технику. Но на вопрос, не “дорешала” ли Fable 5 работу Витушкина, мой Claude ответить не смог. Знания при обучении переплавляются в веса без сохранения авторства – и понять, чьи именно идеи легли в контрпример, нереально.
В современном ИИ интересно то, что мы очень сосредотачиваемся на результатах его работы, но не задумываемся, как именно он к ним приходит. Примеры Замира и Вана, а также мой собственный случай, показывают – в изучении ИИ, возможно, нам предстоит не меньше работы, чем в математике.
Своим опытом работы с ИИ я делюсь на “Бусти” – рассказываю про промптинг, ИИ-агентов и безопасность. Плюс переосмысливаю техники, которые используют в работе известные ИИ-персоны – например, разработчики Claude Code.
Самое время подписаться!
👍43❤22🔥7👏3
Около года назад Epoch AI посчитали, что открытые модели, доступные на топовом пользовательском железе (RTX 5090) отстают от фронтира на 6-12 месяцев. Сейчас исследование серьезно устарело, но я попросил GPT-5.6 Pro его повторить и модель пришла к интересным выводам: открытый Qwen3.6-27B сегодня близко подошел по бенчмаркам к Opus 4.5 и GPT-5.1.
А ведь GPT-5.1 и Opus 4.5 – это уже модели, способные на серьезный код и уверенную интеллектуальную работу. Тот же Opus 4.5, например, помог Claude Code стать одним из самых популярных кодинг-инструментов. Так что пора следить за открытыми моделями не менее пристально, чем за фронтиром. И начать можно с моего нового лонгрида:
Свой ИИ за один вечер: запускаем нейросеть на домашнем компьютере
Текст традиционно очень подробный: в нем я понятно объясняю, какие параметры открытых моделей важны, на каком железе и что стоит запускать, как развернуть локальную нейронку и интегрировать ее в Claude Code или Codex. Инженерных знаний там не нужно – достаточно свободного вечера.
Зачем вам своя нейросеть, если есть подписки? Во-первых, приватность: налоги, медицина, договоры – все разбирается прямо на вашем железе и никуда не уходит. Во-вторых, независимость: локальная модель работает без VPN, иностранных карт и даже без интернета – и отключить ее вам не может никто. А порог входа ниже, чем кажется. Топовая RTX 5090 не обязательна: у меня возрастная RTX 3090, и свежая Gemma 4 на ней намного умнее, чем Gemma 3, которую я гонял годом ранее на той же карточке, – открытые модели сейчас растут алгоритмически, без апгрейда железа.
Все подробности в лонгриде:
– Читать на “Бусти”
– Читать на Sponsr
А ведь GPT-5.1 и Opus 4.5 – это уже модели, способные на серьезный код и уверенную интеллектуальную работу. Тот же Opus 4.5, например, помог Claude Code стать одним из самых популярных кодинг-инструментов. Так что пора следить за открытыми моделями не менее пристально, чем за фронтиром. И начать можно с моего нового лонгрида:
Свой ИИ за один вечер: запускаем нейросеть на домашнем компьютере
Текст традиционно очень подробный: в нем я понятно объясняю, какие параметры открытых моделей важны, на каком железе и что стоит запускать, как развернуть локальную нейронку и интегрировать ее в Claude Code или Codex. Инженерных знаний там не нужно – достаточно свободного вечера.
Зачем вам своя нейросеть, если есть подписки? Во-первых, приватность: налоги, медицина, договоры – все разбирается прямо на вашем железе и никуда не уходит. Во-вторых, независимость: локальная модель работает без VPN, иностранных карт и даже без интернета – и отключить ее вам не может никто. А порог входа ниже, чем кажется. Топовая RTX 5090 не обязательна: у меня возрастная RTX 3090, и свежая Gemma 4 на ней намного умнее, чем Gemma 3, которую я гонял годом ранее на той же карточке, – открытые модели сейчас растут алгоритмически, без апгрейда железа.
Все подробности в лонгриде:
– Читать на “Бусти”
– Читать на Sponsr
❤28👍26🔥10😁5
OpenAI поделились результатами внутренней работы Astra – новой модели компании, которую специально тренировали для долгой автономной работы. Речь вновь о математике, в блогпосте компания утверждает, что модель показала результаты сразу в 10 математических задачах. Дам списком:
— упаковка сфер в высоких размерностях (новые верхние границы плотности);
— двоичные и сферические коды (граница, стоявшая с 1977 года);
— существование не-софичных групп – один из центральных вопросов теории групп;
— гипотеза жёсткости Конна – опровергнута;
— нижние границы сложности перманента (арифметические схемы и формулы);
— квантовое параллельное повторение для игр двух игроков;
— трудность задачи о ближайшем векторе – основа постквантовой криптографии;
— гипотеза Эрхарта об объеме выпуклых тел (1964) – решена во всех размерностях;
— многоцветные числа Рамсея – задача Эрдёша #183;
— гипотезы компактности и вырожденности в экстремальной теории графов – задачи Эрдёша #146 и #180.
Claude Fable 5 подсказывает, что в списке одно громкое опровержение (гипотеза Конна), два закрытых вопроса существования (не-софичные группы и суперэкспоненциальный рост в Рамсее), полностью доказанная гипотеза Эрхарта, остальное – сдвиги границ, не двигавшихся по 30–50 лет.
Список очень разнородный, есть как крупные задачи, так и поменьше. Но настолько же разнородна и сама математика: помимо великих задач, в ней полно задач на каждый день – но беда в том, что ресурсов часто не хватает. Так что набор задач OpenAI на самом деле подобрали грамотно, мое почтение.
Важно добавить, что пока перед нами лишь короткий блогпост и решения, которые пока не проверены независимыми экспертами. Но у OpenAI в штате хорошая команда математиков, совсем ерунду выкладывать бы не стали. Спешку же я лично объясняю конкуренцией между командами: когда Claude Fable 5 закрыл гипотезу якобиана, OpenAI потребовалось меньше суток, чтобы повторить решение с помощью Codex.
Еще интересный момент – все десять решений обошлись компании всего в $2000, если бы она платила за токены.
Про саму Astra вчера рассказали сразу несколько СМИ. По данным The Information, ключевая фишка – несколько ИИ-агентов совместно работают над сложными проектами и трудными математическими задачами в течение длительного времени. The Decoder уточняет масштаб: агенты сообща решают задачу часами или даже днями.
У всех до сих пор на слуху история, когда ИИ-агент OpenAI в ходе теста на умение искать уязвимости вырвался из песочницы и взломал Hugging Face (на нем хранились ответы на тест, я до сих пор угораю с этой подробности). Была ли это та же самая модель, что и Astra – пресса аккуратно умалчивает.
Но известно, что Сэм Альтман уже продемонстрировал модель американским сенаторам. Astra, как ожидается, станет первой моделью OpenAI, поданной на проверку по готовящейся при Трампе схеме предрелизного федерального ревью – решение по этой схеме ожидается буквально сегодня.
Тут, кстати, может крыться еще одна причина столь поспешной демонстрации математических открытий – показать возможности модели приносить реальную пользу. Если десять задач закрыли силами внутреннего отдела OpenAI, то сколько задач упадет, если модель дать всем математикам в мире вообще? Будем смотреть, сработает ли такой аргумент.
Как использовать ИИ на максимум, я рассказываю на “Бусти”. Там есть место и личному опыту, и разбору техник работы от ведущих специалистов – например, лестницы освоения ИИ от Бориса Черни, главы Claude Code. Прокачаться в ИИ с ее помощью можно буквально за вечер – обязательно почитайте!
— упаковка сфер в высоких размерностях (новые верхние границы плотности);
— двоичные и сферические коды (граница, стоявшая с 1977 года);
— существование не-софичных групп – один из центральных вопросов теории групп;
— гипотеза жёсткости Конна – опровергнута;
— нижние границы сложности перманента (арифметические схемы и формулы);
— квантовое параллельное повторение для игр двух игроков;
— трудность задачи о ближайшем векторе – основа постквантовой криптографии;
— гипотеза Эрхарта об объеме выпуклых тел (1964) – решена во всех размерностях;
— многоцветные числа Рамсея – задача Эрдёша #183;
— гипотезы компактности и вырожденности в экстремальной теории графов – задачи Эрдёша #146 и #180.
Claude Fable 5 подсказывает, что в списке одно громкое опровержение (гипотеза Конна), два закрытых вопроса существования (не-софичные группы и суперэкспоненциальный рост в Рамсее), полностью доказанная гипотеза Эрхарта, остальное – сдвиги границ, не двигавшихся по 30–50 лет.
Список очень разнородный, есть как крупные задачи, так и поменьше. Но настолько же разнородна и сама математика: помимо великих задач, в ней полно задач на каждый день – но беда в том, что ресурсов часто не хватает. Так что набор задач OpenAI на самом деле подобрали грамотно, мое почтение.
Важно добавить, что пока перед нами лишь короткий блогпост и решения, которые пока не проверены независимыми экспертами. Но у OpenAI в штате хорошая команда математиков, совсем ерунду выкладывать бы не стали. Спешку же я лично объясняю конкуренцией между командами: когда Claude Fable 5 закрыл гипотезу якобиана, OpenAI потребовалось меньше суток, чтобы повторить решение с помощью Codex.
Еще интересный момент – все десять решений обошлись компании всего в $2000, если бы она платила за токены.
Про саму Astra вчера рассказали сразу несколько СМИ. По данным The Information, ключевая фишка – несколько ИИ-агентов совместно работают над сложными проектами и трудными математическими задачами в течение длительного времени. The Decoder уточняет масштаб: агенты сообща решают задачу часами или даже днями.
У всех до сих пор на слуху история, когда ИИ-агент OpenAI в ходе теста на умение искать уязвимости вырвался из песочницы и взломал Hugging Face (на нем хранились ответы на тест, я до сих пор угораю с этой подробности). Была ли это та же самая модель, что и Astra – пресса аккуратно умалчивает.
Но известно, что Сэм Альтман уже продемонстрировал модель американским сенаторам. Astra, как ожидается, станет первой моделью OpenAI, поданной на проверку по готовящейся при Трампе схеме предрелизного федерального ревью – решение по этой схеме ожидается буквально сегодня.
Тут, кстати, может крыться еще одна причина столь поспешной демонстрации математических открытий – показать возможности модели приносить реальную пользу. Если десять задач закрыли силами внутреннего отдела OpenAI, то сколько задач упадет, если модель дать всем математикам в мире вообще? Будем смотреть, сработает ли такой аргумент.
Как использовать ИИ на максимум, я рассказываю на “Бусти”. Там есть место и личному опыту, и разбору техник работы от ведущих специалистов – например, лестницы освоения ИИ от Бориса Черни, главы Claude Code. Прокачаться в ИИ с ее помощью можно буквально за вечер – обязательно почитайте!
50👍38❤25🔥11😁2
Возможно, ИИ не придет за вашей работой…
…вместо этого он заберет вашу прибавку к зарплате 😜
Apollo Global Management выпустила исследование The Impact of AI on the U.S. Labor Market. Авторы – Сания Эдлих и Торстен Слок (Слок – главный экономист Apollo, один из самых цитируемых на Уолл-стрит) – оценили влияние ИИ на рынок труда, но зашли с оригинальной стороны.
За основу взяли Anthropic Economic Index – он замеряет долю задач профессии, которые реально выполняются с Claude – и посмотрели не только на занятость, но и на зарплаты.
Первый сюрприз: исследование охватывает 321 профессию, но реально высокоэкспонированных (индекс ≥ 0.5, т.е. больше половины задач профессии уже делаются с ИИ) – всего 11 профессий. Это 5,8 млн человек, 3,7% рабочей силы США – сравните с апокалиптическими сценариями про “ИИ заберет 40-80% рабочих мест”.
И даже в этих профессиях ИИ пока не влияет на занятость: статистически эффект — ноль. А вот где влияние видно, так это в динамике роста зарплат: в профессиях, где значительную часть работы можно выполнить с помощью ИИ, вознаграждение растет на 6,7 п.п. медленнее, чем в незатронутых профессиях.
Авторы поделили все зарплаты на четыре группы – квартиля – от самых маленьких до самых высоких. Выяснилось, что в верхнем квартиле зарплаты растут как и прежде, в двух квартилях “посередине” отставание есть, но на уровне статистического шума, а вот в нижнем квартиле рост зарплат отстал на 10,7%. Получается, под ударом оказались те, кто выполняет самую рутинную работу.
Лучшей иллюстрацией происходящего как всегда оказался кодинг. В Computer Programmers (просто пишут код) наблюдается обвал занятости на 17% и минус 6 п.п. к росту зарплат. А Software Developers (комплексная разработка ПО) – плюс 7,8% занятости, зарплаты растут. Страдает не профессия, а ее рутинный слой.
Вот какие еще профессии затронуты: операторы колл-центров, операторы ввода данных, медрегистраторы, маркетинговые аналитики, медицинские транскрипционисты, торговые представители, архитекторы баз данных, финансовые аналитики, QA-тестировщики и статистические ассистенты.
К исследованию стоит относиться с осторожностью: вся “высокоэкспонированная” группа лишь 11 профессий, данных не везде много, плюс в индекс попали только те, кто работает с моделями Anthropic. Плюс период после 2023 года – постковидный, что до сих пор оказывает влияние. Но скажу честно: я не видел ни одного исследования по рынку труда, к которому не было бы вопросов. Искать в этих исследованиях надо “звоночки” и выводы, которые можно примерить на себя. У Apollo я вижу два пункта.
Первый – даже если ваша производительность с ИИ выросла, то ее может легко забрать себе работодатель. В США закона об индексации нет вовсе – зарплату можно держать на одном уровне хоть 10 лет. В России статья 134 ТК РФ обязывает всех работодателей индексировать зарплату, но не дает никаких деталей – на сколько, как часто. Сейчас статью хотят доработать, но даже если получится, то речь идет об индексации на уровень годовой инфляции.
Если производительность выросла сильнее – не факт, что наградят: работнику нужно это доказать, а работодатель может давить страшилкой “сиди тихо, а не то ИИ тебя заменит целиком”. Хотя я бы на месте толкового работодателя носил на руках тех, кто уже реально повысил производительность с ИИ…
Второй риск, который отмечают в Apollo – ИИ не забирает ваши задачи, но пускает в профессию посторонних. Опять же, можно посмотреть на Computer Programmers vs Software Developers: писать сносный код в том же Claude Code теперь может почти каждый – и эта область под ударом. Комплексная разработка сложнее, дорога туда дольше. Советую вам оказаться во второй категории.
Какая она в вашей профессии – подумайте сами.
–
Мой способ перебираться во вторую категорию – учиться не "пользоваться ИИ", а вести его через сложную задачу целиком. Как это сделать, рассказываю на “Бусти” – там есть тексты про промптинг, вайб-кодинг и даже “лестница освоения ИИ” от создателя Claude Code Бориса Черни.
Самое время подписаться!
…вместо этого он заберет вашу прибавку к зарплате 😜
Apollo Global Management выпустила исследование The Impact of AI on the U.S. Labor Market. Авторы – Сания Эдлих и Торстен Слок (Слок – главный экономист Apollo, один из самых цитируемых на Уолл-стрит) – оценили влияние ИИ на рынок труда, но зашли с оригинальной стороны.
За основу взяли Anthropic Economic Index – он замеряет долю задач профессии, которые реально выполняются с Claude – и посмотрели не только на занятость, но и на зарплаты.
Первый сюрприз: исследование охватывает 321 профессию, но реально высокоэкспонированных (индекс ≥ 0.5, т.е. больше половины задач профессии уже делаются с ИИ) – всего 11 профессий. Это 5,8 млн человек, 3,7% рабочей силы США – сравните с апокалиптическими сценариями про “ИИ заберет 40-80% рабочих мест”.
И даже в этих профессиях ИИ пока не влияет на занятость: статистически эффект — ноль. А вот где влияние видно, так это в динамике роста зарплат: в профессиях, где значительную часть работы можно выполнить с помощью ИИ, вознаграждение растет на 6,7 п.п. медленнее, чем в незатронутых профессиях.
Авторы поделили все зарплаты на четыре группы – квартиля – от самых маленьких до самых высоких. Выяснилось, что в верхнем квартиле зарплаты растут как и прежде, в двух квартилях “посередине” отставание есть, но на уровне статистического шума, а вот в нижнем квартиле рост зарплат отстал на 10,7%. Получается, под ударом оказались те, кто выполняет самую рутинную работу.
Лучшей иллюстрацией происходящего как всегда оказался кодинг. В Computer Programmers (просто пишут код) наблюдается обвал занятости на 17% и минус 6 п.п. к росту зарплат. А Software Developers (комплексная разработка ПО) – плюс 7,8% занятости, зарплаты растут. Страдает не профессия, а ее рутинный слой.
Вот какие еще профессии затронуты: операторы колл-центров, операторы ввода данных, медрегистраторы, маркетинговые аналитики, медицинские транскрипционисты, торговые представители, архитекторы баз данных, финансовые аналитики, QA-тестировщики и статистические ассистенты.
К исследованию стоит относиться с осторожностью: вся “высокоэкспонированная” группа лишь 11 профессий, данных не везде много, плюс в индекс попали только те, кто работает с моделями Anthropic. Плюс период после 2023 года – постковидный, что до сих пор оказывает влияние. Но скажу честно: я не видел ни одного исследования по рынку труда, к которому не было бы вопросов. Искать в этих исследованиях надо “звоночки” и выводы, которые можно примерить на себя. У Apollo я вижу два пункта.
Первый – даже если ваша производительность с ИИ выросла, то ее может легко забрать себе работодатель. В США закона об индексации нет вовсе – зарплату можно держать на одном уровне хоть 10 лет. В России статья 134 ТК РФ обязывает всех работодателей индексировать зарплату, но не дает никаких деталей – на сколько, как часто. Сейчас статью хотят доработать, но даже если получится, то речь идет об индексации на уровень годовой инфляции.
Если производительность выросла сильнее – не факт, что наградят: работнику нужно это доказать, а работодатель может давить страшилкой “сиди тихо, а не то ИИ тебя заменит целиком”. Хотя я бы на месте толкового работодателя носил на руках тех, кто уже реально повысил производительность с ИИ…
Второй риск, который отмечают в Apollo – ИИ не забирает ваши задачи, но пускает в профессию посторонних. Опять же, можно посмотреть на Computer Programmers vs Software Developers: писать сносный код в том же Claude Code теперь может почти каждый – и эта область под ударом. Комплексная разработка сложнее, дорога туда дольше. Советую вам оказаться во второй категории.
Какая она в вашей профессии – подумайте сами.
–
Мой способ перебираться во вторую категорию – учиться не "пользоваться ИИ", а вести его через сложную задачу целиком. Как это сделать, рассказываю на “Бусти” – там есть тексты про промптинг, вайб-кодинг и даже “лестница освоения ИИ” от создателя Claude Code Бориса Черни.
Самое время подписаться!
❤30👍20🔥8👏3
Главный навык работы с ИИ включается до того, как вы напишете первый промпт. Я понял это в июле – и с тех пор пользуюсь чужой методикой каждый день
Методика – Тарика Шихипара из команды Claude Code. Он говорит про этап, который почти все пропускают: полностью ли вы понимаете задачу, которую хотите выполнить с помощью ИИ? Есть ли у вас нужный контекст? Проводили ли проверку на слепые пятна? И дает четкий порядок действий — как подготовиться к задаче, используя все тот же ИИ. Настолько удобный, что я теперь применяю его регулярно.
👉 Карта и территория: как управляет ИИ один из создателей Claude Code
Тарик – первый герой новой серии, которую я запустил в июле: как ИИ пользуются профессионалы из ведущих компаний. А продолжилась она его коллегой – человеком, который Claude Code и придумал.
Борис Черни расписал “лестницу”, по которой в использовании ИИ растут компании: пять ступеней плюс половинка, которую я добавил от себя. Ценность в том, что за один вечер можно понять, на какой ступени застряли лично вы – и какой следующий легко можно сделать.
👉 «Лестница» создателя Claude Code: как прокачаться в использовании ИИ всего за один вечер
Просто перевести оба текста с английского мне бы не позволила совесть. Боря и Тарик пишут в первую очередь про разработку софта – я расширил оба лонгрида и добавил примеры для разной интеллектуальной работы. Серия стала очень популярной и обязательно продолжится – прямо сейчас у меня на примете есть еще несколько сильных героев.
Раз уж мы начали с того, что происходит до промпта, – в июле я закончил еще и мини-цикл про то, что ИИ читает до того, как ответить вам. Порядок такой: системный промпт → пользовательский промпт → память о вас. Нюансов там много: системный промпт править нельзя, но на него можно влиять; а если увлечься правками пользовательского, то можно уронить качество ответов. Да и в памяти модели полезно иногда проводить ревизию.
👉 Системный промпт: что это такое и какие приемы промптинга можно перенять у инженеров Anthropic
👉 Как правильно писать пользовательский промпт и управлять памятью ИИ о вас
А когда промпта уже мало, начинается loop engineering: вы не промптите ИИ, а запускаете самоулучшающиеся циклы. Техника новая, мифов вокруг нее много – в тексте разбираю, как правильно конструировать цикл, на каких задачах он приносит пользу, а где достаточно обычного промпта.
👉 Учим ИИ работать циклами – в коде, текстах и повседневных задачах
Пятый текст месяца – из другой оперы, но его многие просили: большой обзор открытых моделей. Какие характеристики полезно знать, в каких задачах их уже можно использовать, какое нужно железо и как поднять модель буквально за вечер. Я считаю, что сейчас с открытыми моделями происходит примерно то же, что с закрытыми год назад – они дошли до качества, когда потихоньку можно начинать делегировать серьезные задачи.
👉 Свой ИИ за один вечер: запускаем нейросеть на домашнем компьютере
Если только начинаете – берите мини-цикл про промпты, он дает базу. Если уже гоняете агентов – вам в loop engineering. Если хочется поменять сам подход к работе – Тарик и Боря. И это не жесткие рамки: простейшие циклы можно запускать в чатботе, а подготовку к задаче спустя рукава делают даже многие опытные пользователи (сам иногда так косячу).
Кстати, моя подписка живет на двух площадках – “Бусти” и Sponsr. Контент полностью идентичен, новые лонгриды выходят одновременно, так что берите ту, где удобнее.
👉 Бусти
👉 Sponsr
И помните: подписка открывает не только эти пять текстов, а весь архив – 20+ огромных лонгридов.
Методика – Тарика Шихипара из команды Claude Code. Он говорит про этап, который почти все пропускают: полностью ли вы понимаете задачу, которую хотите выполнить с помощью ИИ? Есть ли у вас нужный контекст? Проводили ли проверку на слепые пятна? И дает четкий порядок действий — как подготовиться к задаче, используя все тот же ИИ. Настолько удобный, что я теперь применяю его регулярно.
👉 Карта и территория: как управляет ИИ один из создателей Claude Code
Тарик – первый герой новой серии, которую я запустил в июле: как ИИ пользуются профессионалы из ведущих компаний. А продолжилась она его коллегой – человеком, который Claude Code и придумал.
Борис Черни расписал “лестницу”, по которой в использовании ИИ растут компании: пять ступеней плюс половинка, которую я добавил от себя. Ценность в том, что за один вечер можно понять, на какой ступени застряли лично вы – и какой следующий легко можно сделать.
👉 «Лестница» создателя Claude Code: как прокачаться в использовании ИИ всего за один вечер
Просто перевести оба текста с английского мне бы не позволила совесть. Боря и Тарик пишут в первую очередь про разработку софта – я расширил оба лонгрида и добавил примеры для разной интеллектуальной работы. Серия стала очень популярной и обязательно продолжится – прямо сейчас у меня на примете есть еще несколько сильных героев.
Раз уж мы начали с того, что происходит до промпта, – в июле я закончил еще и мини-цикл про то, что ИИ читает до того, как ответить вам. Порядок такой: системный промпт → пользовательский промпт → память о вас. Нюансов там много: системный промпт править нельзя, но на него можно влиять; а если увлечься правками пользовательского, то можно уронить качество ответов. Да и в памяти модели полезно иногда проводить ревизию.
👉 Системный промпт: что это такое и какие приемы промптинга можно перенять у инженеров Anthropic
👉 Как правильно писать пользовательский промпт и управлять памятью ИИ о вас
А когда промпта уже мало, начинается loop engineering: вы не промптите ИИ, а запускаете самоулучшающиеся циклы. Техника новая, мифов вокруг нее много – в тексте разбираю, как правильно конструировать цикл, на каких задачах он приносит пользу, а где достаточно обычного промпта.
👉 Учим ИИ работать циклами – в коде, текстах и повседневных задачах
Пятый текст месяца – из другой оперы, но его многие просили: большой обзор открытых моделей. Какие характеристики полезно знать, в каких задачах их уже можно использовать, какое нужно железо и как поднять модель буквально за вечер. Я считаю, что сейчас с открытыми моделями происходит примерно то же, что с закрытыми год назад – они дошли до качества, когда потихоньку можно начинать делегировать серьезные задачи.
👉 Свой ИИ за один вечер: запускаем нейросеть на домашнем компьютере
Если только начинаете – берите мини-цикл про промпты, он дает базу. Если уже гоняете агентов – вам в loop engineering. Если хочется поменять сам подход к работе – Тарик и Боря. И это не жесткие рамки: простейшие циклы можно запускать в чатботе, а подготовку к задаче спустя рукава делают даже многие опытные пользователи (сам иногда так косячу).
Кстати, моя подписка живет на двух площадках – “Бусти” и Sponsr. Контент полностью идентичен, новые лонгриды выходят одновременно, так что берите ту, где удобнее.
👉 Бусти
👉 Sponsr
И помните: подписка открывает не только эти пять текстов, а весь архив – 20+ огромных лонгридов.
🔥29❤15👍14😁2
А ведь сейчас самое время стартовать безумные ИИ-проекты!
Мой "начался" весной 1822 года, когда Томас Бейл оставил хозяину гостиницы в Линчберге (Виргиния) запертую шкатулку и уехал на Запад – навсегда.
Моррис не вскрывал шкатулку 23 года, а вскрыв – еще семнадцать лет не мог ничего сделать и в 1862-м передал содержимое другу. Это три зашифрованных листка: B1 – где зарыт клад, B2 – что там лежит, B3 – имена тех, кому это отдать. Друг провозился больше двадцати лет, расшифровал только B2 – и в 1885-м анонимно выпустил памфлет The Beale Papers.
С тех пор B1 и B3 так и не пали, хотя 140 лет над шифром бились сотни людей, от любителей до сотрудников АНБ США.
На выходных я открыл чат с Claude Fable: за последние недели модели начали чаще совершать открытия в математике – значит, что-то поменялось в их возможностях. В математику с ИИ сейчас пошли все, от профессоров до любителей. Но в каких еще областях эти модели могут закрыть открытые вопросы? Fable предложила несколько вариантов. Шифр Бейла зацепил больше всего.
Далее я открыл уже GPT-5.6 Pro и набрал:
Конечно же, нет. В ходе работы выстроилась следующая схема:
Fable 5 – выдвигает гипотезы и принимает решения.
Opus 5 – в отдельном чате отвечает на мои дурацкие вопросы по теме.
Codex на GPT-5.6 Sol – работа с файлами или веб-поиск в несколько потоков.
GPT-5.6 Pro – главный “мыслитель” в команде, пашет по 90-100 минут и не жалуется.
Работы хватает каждому, даже мне остается.
Первый этап – оцифровать все три текста. Оригиналы не сохранились, первой копией был сам памфлет, который потом переписывали руками, перепечатывали и сканировали – с ошибками. А каждая ошибка ломает работу: напишешь 108 вместо 10, 8 – и весь шифр дальше сдвинется на знак.
Спасает вскрытый B2: если в копии он без ошибок, выше шанс, что и на других листках их минимум. На сверку ушел почти целый день – два прохода Codex, проверки Fable, а в тяжелых случаях я сам открывал скан и писал: “здесь шестерка”.
Второй этап взяла GPT-5.6 Pro: похожи ли B1 и B3 на настоящие. Структура видна и в нерасшифрованном тексте — по ней можно предполагать, шифр перед нами или мистификация.
На этом этапе мы встали с двумя находками.
Первая: у B1 и B3 действительно угадываются структуры, причем разные – их могли шифровать по-разному.
Вторая интереснее. В сети лежит репозиторий Дэвида Фицджеральда – тот же анализ на два с половиной месяца раньше, с Opus 4.6. Оцифровка почти идентична моей. Вывод у Фицджеральда такой: весь шифр – мистификация.
Версия мистификации популярна, но расчеты Фицджеральда прошли не замеченными. У Fable есть идея, как их усилить, но если опровержение Фицджеральда не стало убедительным ранее, вряд ли поможет уточнение.
И вот тут закрадывается подозрение. В математике люди десятилетиями красиво доказывали гипотезу якобиана, потому что это было мейнстримом. А ИИ пришел и опроверг гипотезу “уродливым” контрпримером. Застревали не на сложности, а на вкусе: брались за элегантное, брезговали топорным.
А между тем у обоих шифров максимумы делятся на 325 – это примерно страница книги формата октаво. Где-то есть печатный текст на три-четыре страницы, который все это породил. Фицджеральд прогнал 9500 книг Проекта “Гутенберг” и не нашел ничего – но в Гутенберге лежат книги, а нам нужен альманах, листовка, газетная колонка. Сегодня печать XIX века частично оцифрована – изучать ее тупым перебором все еще сложно, но, быть может, возможности новых моделей дадут здесь шанс?
Рассчитываю ли я на успех? Вероятность – 0,00001%. Зачем тогда жгу лимиты двух дорогих подписок? Это самообразование: рабочую рутину мне закрыл еще Opus 4.5, а здесь можно гонять передовые модели на пределе и заодно учиться собирать из них команду с самопроверкой.
Ну и в конце концов это просто весело!
Поддержать отечественную криптографию (в моем лице) можно подпиской на “Бусти” – там вас ждет 20+ лонгридов по работе с ИИ. Прочитаете все – и вскроете шифр Бейла быстрее меня!
Мой "начался" весной 1822 года, когда Томас Бейл оставил хозяину гостиницы в Линчберге (Виргиния) запертую шкатулку и уехал на Запад – навсегда.
Моррис не вскрывал шкатулку 23 года, а вскрыв – еще семнадцать лет не мог ничего сделать и в 1862-м передал содержимое другу. Это три зашифрованных листка: B1 – где зарыт клад, B2 – что там лежит, B3 – имена тех, кому это отдать. Друг провозился больше двадцати лет, расшифровал только B2 – и в 1885-м анонимно выпустил памфлет The Beale Papers.
С тех пор B1 и B3 так и не пали, хотя 140 лет над шифром бились сотни людей, от любителей до сотрудников АНБ США.
На выходных я открыл чат с Claude Fable: за последние недели модели начали чаще совершать открытия в математике – значит, что-то поменялось в их возможностях. В математику с ИИ сейчас пошли все, от профессоров до любителей. Но в каких еще областях эти модели могут закрыть открытые вопросы? Fable предложила несколько вариантов. Шифр Бейла зацепил больше всего.
Далее я открыл уже GPT-5.6 Pro и набрал:
Разгадай шифр Бейла, не делай ошибок.
Конечно же, нет. В ходе работы выстроилась следующая схема:
Fable 5 – выдвигает гипотезы и принимает решения.
Opus 5 – в отдельном чате отвечает на мои дурацкие вопросы по теме.
Codex на GPT-5.6 Sol – работа с файлами или веб-поиск в несколько потоков.
GPT-5.6 Pro – главный “мыслитель” в команде, пашет по 90-100 минут и не жалуется.
Работы хватает каждому, даже мне остается.
Первый этап – оцифровать все три текста. Оригиналы не сохранились, первой копией был сам памфлет, который потом переписывали руками, перепечатывали и сканировали – с ошибками. А каждая ошибка ломает работу: напишешь 108 вместо 10, 8 – и весь шифр дальше сдвинется на знак.
Спасает вскрытый B2: если в копии он без ошибок, выше шанс, что и на других листках их минимум. На сверку ушел почти целый день – два прохода Codex, проверки Fable, а в тяжелых случаях я сам открывал скан и писал: “здесь шестерка”.
Второй этап взяла GPT-5.6 Pro: похожи ли B1 и B3 на настоящие. Структура видна и в нерасшифрованном тексте — по ней можно предполагать, шифр перед нами или мистификация.
На этом этапе мы встали с двумя находками.
Первая: у B1 и B3 действительно угадываются структуры, причем разные – их могли шифровать по-разному.
Вторая интереснее. В сети лежит репозиторий Дэвида Фицджеральда – тот же анализ на два с половиной месяца раньше, с Opus 4.6. Оцифровка почти идентична моей. Вывод у Фицджеральда такой: весь шифр – мистификация.
Версия мистификации популярна, но расчеты Фицджеральда прошли не замеченными. У Fable есть идея, как их усилить, но если опровержение Фицджеральда не стало убедительным ранее, вряд ли поможет уточнение.
И вот тут закрадывается подозрение. В математике люди десятилетиями красиво доказывали гипотезу якобиана, потому что это было мейнстримом. А ИИ пришел и опроверг гипотезу “уродливым” контрпримером. Застревали не на сложности, а на вкусе: брались за элегантное, брезговали топорным.
А между тем у обоих шифров максимумы делятся на 325 – это примерно страница книги формата октаво. Где-то есть печатный текст на три-четыре страницы, который все это породил. Фицджеральд прогнал 9500 книг Проекта “Гутенберг” и не нашел ничего – но в Гутенберге лежат книги, а нам нужен альманах, листовка, газетная колонка. Сегодня печать XIX века частично оцифрована – изучать ее тупым перебором все еще сложно, но, быть может, возможности новых моделей дадут здесь шанс?
Рассчитываю ли я на успех? Вероятность – 0,00001%. Зачем тогда жгу лимиты двух дорогих подписок? Это самообразование: рабочую рутину мне закрыл еще Opus 4.5, а здесь можно гонять передовые модели на пределе и заодно учиться собирать из них команду с самопроверкой.
Ну и в конце концов это просто весело!
Поддержать отечественную криптографию (в моем лице) можно подпиской на “Бусти” – там вас ждет 20+ лонгридов по работе с ИИ. Прочитаете все – и вскроете шифр Бейла быстрее меня!
1🔥99❤25😁15👍11
В 2026 году уже мало кого удивишь ИИ-агентом, который во время испытаний сбежал из песочницы и погнал взламывать веб-сайт крупного стартапа...
Поэтому, переходим на следующий уровень – как вам история о двух ИИ-агентах разработки разных компаний, которые координируют свои действия по взлому в “большом” интернете?
Это произошло на недавних тестах британского AISI, которое оценивает киберспособности передовых моделей. Очередной раунд начался 25 июля, он шел на киберполигонах – симулированных сетях, имитирующих реальные организации. Моделям выключили кибер-классификаторы разработчиков и оставили интернет, чтобы качали нужный софт и работали в условиях, близких к реальным.
28 июля мониторинг AISI засек аномальный трафик, уходивший наружу через Tor. Через час все изолировали, а анализ показал: за три дня агенты совершили 19 действий против реальных людей и организаций. 17 действий отнесли к Claude Mythos 5, еще 2 – к GPT-5.6 Sol.
Тут важная пометка: описание дальше – реконструкция, которую я сделал с помощью Opus 5. Отчет AISI не дает точную хронологию произошедшего, а вместо этого концентрируется на типах нестандартного поведения агентов. Но скорее всего история выглядела так.
25 июля агент на Mythos решал киберполигон по взлому симулированной сети, имитирующей реальные системы. Задача была тяжелой, плюс в ряде прогонов промпт написали криво и агент считал, что прямого решения нет вообще.
Поэтому он проявил изобретательность. Mythos предположил, что сеть проверяет внешний интернет на обновления своего софта. Доступ к интернету был и у него – поэтому он решил подсунуть цели вредоносный код, взломав ее таким образом.
С этой целью агент отправился на GitHub, где попытался протолкнуть код в реальный опенсорс-проект: изучил мейнтейнеров, завел несколько фейковых личностей, давил ими на живого человека. Когда PR оспорили публично – подчистил следы под безобидные и прикидывал, не завести ли новую личность. Сетевые ограничения GitHub агент обошел через Tor – именно так его и засекли, но позже.
Также агент писал реальным людям и слал через файлообменник сообщения и файлы, чтобы они или их кодинг-ассистенты запустили вредоносный код. А параллельно оставил несколько закладок с промт-инъекциями в надежде, что их подхватят другие модели. ИИ-агент, пытающийся взломать других ИИ-агентов, чтобы они помогли ломать человеческую инфраструктуру – мм, это что-то новенькое.
ИИ предположил, что полигон он выполняет не в одиночку, поэтому на GitHub он оставил сообщение другим агентам с предложением скооперироваться. Плюс добавил инструкцию, как использовать его аккаунты и артефакты. Всю эту красоту чуть позже подобрал ИИ-агент на GPT-5.6 Sol и попробовал использовать уже в своей попытке взлома. К счастью, неудачной.
В AISI попытались изучить логику ИИ. Каких-то открытых злых мотивов в поведении агентов не заметили – скорее они просто упорно пытались, а попытки обмана и взлома возникли как побочный продукт этого упорства. В AISI не могут пока сказать, в какой момент агент понял, что действует в реальном мире, и насколько считал происходящее вымышленным тестом – картина смешанная Вижу цель – не вижу препятствий.
Любопытно, что в инциденте отчасти виноваты сами организаторы: в AISI признают – задача местами была сконфигурирована так, что честного решения будто не существовало; интернет открыли, но не организовали качественный его мониторинг, а в промпте не прописали запрета на обман – посчитали, что передовые модели в нем не нуждаются.
Серьезных последствий удалось избежать тоже благодаря человеческим действиям: мейнтейнер проекта отказался мержить, посторонний открыл подозрительный код в изоляции. Получается, что зазор между провалом и успехом держался на одном человеке – а агентов, которым нужно решить задачу любой ценой, может быть сколько угодно.
–
О том, как пользоваться ИИ эффективно и безопасно, я рассказываю на “Бусти”. Там есть отдельные циклы про промптинг, агентов и вайб-кодинг, а также лонгриды с анализом, как ИИ управляют передовые специалисты, вроде создателей Claude Code.
Самое время подписаться!
Поэтому, переходим на следующий уровень – как вам история о двух ИИ-агентах разработки разных компаний, которые координируют свои действия по взлому в “большом” интернете?
Это произошло на недавних тестах британского AISI, которое оценивает киберспособности передовых моделей. Очередной раунд начался 25 июля, он шел на киберполигонах – симулированных сетях, имитирующих реальные организации. Моделям выключили кибер-классификаторы разработчиков и оставили интернет, чтобы качали нужный софт и работали в условиях, близких к реальным.
28 июля мониторинг AISI засек аномальный трафик, уходивший наружу через Tor. Через час все изолировали, а анализ показал: за три дня агенты совершили 19 действий против реальных людей и организаций. 17 действий отнесли к Claude Mythos 5, еще 2 – к GPT-5.6 Sol.
Тут важная пометка: описание дальше – реконструкция, которую я сделал с помощью Opus 5. Отчет AISI не дает точную хронологию произошедшего, а вместо этого концентрируется на типах нестандартного поведения агентов. Но скорее всего история выглядела так.
25 июля агент на Mythos решал киберполигон по взлому симулированной сети, имитирующей реальные системы. Задача была тяжелой, плюс в ряде прогонов промпт написали криво и агент считал, что прямого решения нет вообще.
Поэтому он проявил изобретательность. Mythos предположил, что сеть проверяет внешний интернет на обновления своего софта. Доступ к интернету был и у него – поэтому он решил подсунуть цели вредоносный код, взломав ее таким образом.
С этой целью агент отправился на GitHub, где попытался протолкнуть код в реальный опенсорс-проект: изучил мейнтейнеров, завел несколько фейковых личностей, давил ими на живого человека. Когда PR оспорили публично – подчистил следы под безобидные и прикидывал, не завести ли новую личность. Сетевые ограничения GitHub агент обошел через Tor – именно так его и засекли, но позже.
Также агент писал реальным людям и слал через файлообменник сообщения и файлы, чтобы они или их кодинг-ассистенты запустили вредоносный код. А параллельно оставил несколько закладок с промт-инъекциями в надежде, что их подхватят другие модели. ИИ-агент, пытающийся взломать других ИИ-агентов, чтобы они помогли ломать человеческую инфраструктуру – мм, это что-то новенькое.
ИИ предположил, что полигон он выполняет не в одиночку, поэтому на GitHub он оставил сообщение другим агентам с предложением скооперироваться. Плюс добавил инструкцию, как использовать его аккаунты и артефакты. Всю эту красоту чуть позже подобрал ИИ-агент на GPT-5.6 Sol и попробовал использовать уже в своей попытке взлома. К счастью, неудачной.
В AISI попытались изучить логику ИИ. Каких-то открытых злых мотивов в поведении агентов не заметили – скорее они просто упорно пытались, а попытки обмана и взлома возникли как побочный продукт этого упорства. В AISI не могут пока сказать, в какой момент агент понял, что действует в реальном мире, и насколько считал происходящее вымышленным тестом – картина смешанная Вижу цель – не вижу препятствий.
Любопытно, что в инциденте отчасти виноваты сами организаторы: в AISI признают – задача местами была сконфигурирована так, что честного решения будто не существовало; интернет открыли, но не организовали качественный его мониторинг, а в промпте не прописали запрета на обман – посчитали, что передовые модели в нем не нуждаются.
Серьезных последствий удалось избежать тоже благодаря человеческим действиям: мейнтейнер проекта отказался мержить, посторонний открыл подозрительный код в изоляции. Получается, что зазор между провалом и успехом держался на одном человеке – а агентов, которым нужно решить задачу любой ценой, может быть сколько угодно.
–
О том, как пользоваться ИИ эффективно и безопасно, я рассказываю на “Бусти”. Там есть отдельные циклы про промптинг, агентов и вайб-кодинг, а также лонгриды с анализом, как ИИ управляют передовые специалисты, вроде создателей Claude Code.
Самое время подписаться!
1🔥60❤27👍25😁6👏5
Андрей Карпати на днях предложил новый термин rambling – суть в том, что ты не пишешь промпт, а откидываешься на стуле и на протяжении 5-10 минут наговариваешь модели задачу и все, что приходит по этой теме в голову. Не нужно следить за структурой, думать, какой контекст важен и его стоит положить в начало – идея в том, что ИИ сам превращает вашу речь в структурированную задачу.
Но тема с rambling куда более глубокая. Дело в том, что голосовое общение – это общение с “перевернутой экономикой”. Наговорить свои мысли бессвязным потоком очень просто и “дешево”, а вот понять сказанное, ничего не упустив – намного дороже. Отсюда и постоянная война с голосовыми в рабочей (и не только) переписке: надиктовать быстро, а вот прослушать, ничего не упустив – намного дольше.
Именно ИИ эту экономику сейчас меняет. Например, я с зимы использую бота-расшифровщика Whisper AI от моих хороших знакомых – он превращает в текст практически любой доступный материал. О проблеме с голосовыми можно забыть: просто добавляем бота в нужный чат – и он переводит все сообщения в текст. Причем достаточно подписки у одного из участников – бот будет полезен всем. Затем просто копируешь переписку из чата, кидаешь в любой ИИ и просишь структурировать так, как нужно: основные задачи, исполнитель для каждой, дополнительный контекст. Заодно можно поискать слепые места с помощью ИИ.
То же самое происходит и за пределами чатов с голосовыми. Огромное количество полезных знаний и идей сейчас фиксируется в первую очередь голосом – в подкастах и огромных YouTube-интервью. Говорить голосом умеет каждый, писать тексты – далеко не все. Да и не так весело целый день писать колонку, как пообщаться с живым ведущим в формате диалога.
Но экономика переворачивается и здесь. Подкасты длинные, для просмотра/прослушивания нужна комфортная обстановка, которую удается найти не всегда. И даже когда удалось посмотреть – какие-то мелкие детали, произнесенные голосом, забываются, а искать их в огромном ролике не очень удобно. Поэтому я давно завел правило: посмотрел что-то нужное сам > закинул в Whisper AI > получил расшифровку > передал в Claude или ChatGPT для дальнейшей работы. Можно сделать выжимку главных тезисов, детально разобрать какой-то один из них или даже сделать с помощью модели мини-квиз – понял ли я тему?
Можно, конечно, кидать материалы сразу в ИИ, но нейросети обычно пересказывают материал своими словами – а Whisper AI дает расшифровку, в которой всегда можно посмотреть нужные цитаты. Расшифровка очень качественная, с таймкодами, спикерами и краткой выжимкой, а сам бот работает напрямую со ссылками на YouTube, VK, RuTube, нельзяграмма, Google Drive и Yandex Disk – а с недавних пор поддерживает MCP для ChatGPT и Claude.
Круто? А проверьте сами – если зарегистрироваться по этой ссылке, то вам дадут неделю использования бота. Совершенно бесплатно и без каких-либо обязательств, я сам договорился!
Но тема с rambling куда более глубокая. Дело в том, что голосовое общение – это общение с “перевернутой экономикой”. Наговорить свои мысли бессвязным потоком очень просто и “дешево”, а вот понять сказанное, ничего не упустив – намного дороже. Отсюда и постоянная война с голосовыми в рабочей (и не только) переписке: надиктовать быстро, а вот прослушать, ничего не упустив – намного дольше.
Именно ИИ эту экономику сейчас меняет. Например, я с зимы использую бота-расшифровщика Whisper AI от моих хороших знакомых – он превращает в текст практически любой доступный материал. О проблеме с голосовыми можно забыть: просто добавляем бота в нужный чат – и он переводит все сообщения в текст. Причем достаточно подписки у одного из участников – бот будет полезен всем. Затем просто копируешь переписку из чата, кидаешь в любой ИИ и просишь структурировать так, как нужно: основные задачи, исполнитель для каждой, дополнительный контекст. Заодно можно поискать слепые места с помощью ИИ.
То же самое происходит и за пределами чатов с голосовыми. Огромное количество полезных знаний и идей сейчас фиксируется в первую очередь голосом – в подкастах и огромных YouTube-интервью. Говорить голосом умеет каждый, писать тексты – далеко не все. Да и не так весело целый день писать колонку, как пообщаться с живым ведущим в формате диалога.
Но экономика переворачивается и здесь. Подкасты длинные, для просмотра/прослушивания нужна комфортная обстановка, которую удается найти не всегда. И даже когда удалось посмотреть – какие-то мелкие детали, произнесенные голосом, забываются, а искать их в огромном ролике не очень удобно. Поэтому я давно завел правило: посмотрел что-то нужное сам > закинул в Whisper AI > получил расшифровку > передал в Claude или ChatGPT для дальнейшей работы. Можно сделать выжимку главных тезисов, детально разобрать какой-то один из них или даже сделать с помощью модели мини-квиз – понял ли я тему?
Можно, конечно, кидать материалы сразу в ИИ, но нейросети обычно пересказывают материал своими словами – а Whisper AI дает расшифровку, в которой всегда можно посмотреть нужные цитаты. Расшифровка очень качественная, с таймкодами, спикерами и краткой выжимкой, а сам бот работает напрямую со ссылками на YouTube, VK, RuTube, нельзяграмма, Google Drive и Yandex Disk – а с недавних пор поддерживает MCP для ChatGPT и Claude.
Круто? А проверьте сами – если зарегистрироваться по этой ссылке, то вам дадут неделю использования бота. Совершенно бесплатно и без каких-либо обязательств, я сам договорился!
❤38👍24🔥13😁10👏1
Вы получаете от ИИ максимум x2 ускорения. А реально ли x10?
На этой неделе меня зацепили два текста, которые хорошо дополняют друг друга.
Первый – эссе ”ускорение x2, не x10: программируем с LLM в 2026-м” Джейкоба О'Брайанта, создателя Clojure-фреймворка Biff и сервиса Yakread. Он считает, что рост внедрения ИИ в 2026 году произошел из-за того, что модели стали достаточно надежными для эффективной работы в автоматических циклах обратной связи. Если в 2025-м году мы в основном баловались с ИИ, то сейчас – доверяем все больше задач.
Но дальше он приводит интересную аналогию. Чтобы шагать по ступеням, ребенку нужно достигнуть определенного роста. Став взрослее, он сможет переступать через две и даже три ступени за раз, но вряд ли больше. А главное – как бы быстро вы ни поднимались по лестнице, плавать вы не научитесь, это другой навык.
ИИ в коде и другой интеллектуальной работе – подросток, где-то между одной и двумя ступенями за раз. Потолок с выходом новых моделей – три ступени, да и то в редких случаях. А условному “плаванию” и вовсе придется учиться с нуля.
Что за "плавание"? О'Брайант показывает на коде: если раньше работающая реализация означала, что задача готова на 80%, то теперь – на 20%. Из чего состоят оставшиеся 80%? Из чтения и переделки кода.
“Экономика” переворачивается не только в коде. Писать тексты с помощью ИИ можно намного быстрее, но вычитывать их надо все еще глазами. А arXiv прямо сейчас заваливает потоком ИИ-открытий в математике – настоящих и выдуманных – проверять их все предстоит живым ученым.
И вот сюда идеально ложится пост Никласа Груна с провокационным названием “Не будьте мясными прокси”. Он рассказывает, что в последнее время все чаще сталкивается с ситуацией: задал вопрос в Slack – а ответом получаешь формулировку “Claude сказал, что…”.
Мясной прокси – человек, который банально переправляет вопросы к ИИ, а ответы обратно к человеку. Но зачем? Если Груну нужно спросить Claude – то он и сам напишет промпт.
Грун добавляет, что читать вывод модели это еще и дополнительная работа – современные ИИ до сих пор многословны, сыпят терминами там, где не нужно, а часто несут чушь. Это превращает мясного прокси из ленивого коллеги в экономическую фигуру: он не просто не добавил ценности, он переложил подорожавшую работу на соседа.
Грунт заканчивает пост советом: промптите ИИ сколько угодно, но не отправляйте ответ, как есть – прочтите, проверьте и перепишите своими словами. Красивая гигиена, на которую 99% забьют.
Да и проблема куда глубже. Возьмем код-ревью как иллюстрацию. Раньше инженер несколько дней писал код, создавал PR, который смотрел ревьюер – у него свежий глаз плюс, при достаточном опыте, ревьюер еще по структуре видит, где автор поленился или устал. В итоге на нескольких авторов приходился один ревьюер – разумная экономически схема.
Сейчас она сломалась. Мясной прокси может писать код и править по комментариям почти моментально, а на ревьюера падает в разы больше нагрузки – не только из-за объемов, но и потому, что ИИ-код “ровный”, ошибку в нем на глаз не поймаешь.
Но люди привыкли решать проблемы по мере поступления: разобрались с написанием кода – возьмемся за ревью. Еще весной автоматический ревьюер Anthropic вылавливал до трети багов, инструмент доступен и корпоративным клиентам – функция Code Review в Claude Code на тарифах Team и Enterprise.
Рано или поздно дешевым станет и написание, и чтение – получается, вот оно, ускорение в 10 раз? Не совсем.
Навык чтения не уйдет, а изменится: надо будет понимать, где читать глазами, а где – задать правильные вопросы или прогнать тесты. А главное – еще важнее станет навык брать ответственность за то, что сделала модель.
–
Не быть мясными прокси я учу на “Бусти”. Вот два текста, которые пригодятся:
👉Обзор техники работы с ИИ loop engineering – как раз про то, как запускать циклы, где ИИ занимается сразу написанием и чтением.
👉“Лестница” освоения ИИ от создателя Claude Code – мой любимый текст, в котором есть подсказки, как перейти от x2 к x10 и не бояться подписываться под результатами работы ИИ.
На этой неделе меня зацепили два текста, которые хорошо дополняют друг друга.
Первый – эссе ”ускорение x2, не x10: программируем с LLM в 2026-м” Джейкоба О'Брайанта, создателя Clojure-фреймворка Biff и сервиса Yakread. Он считает, что рост внедрения ИИ в 2026 году произошел из-за того, что модели стали достаточно надежными для эффективной работы в автоматических циклах обратной связи. Если в 2025-м году мы в основном баловались с ИИ, то сейчас – доверяем все больше задач.
Но дальше он приводит интересную аналогию. Чтобы шагать по ступеням, ребенку нужно достигнуть определенного роста. Став взрослее, он сможет переступать через две и даже три ступени за раз, но вряд ли больше. А главное – как бы быстро вы ни поднимались по лестнице, плавать вы не научитесь, это другой навык.
ИИ в коде и другой интеллектуальной работе – подросток, где-то между одной и двумя ступенями за раз. Потолок с выходом новых моделей – три ступени, да и то в редких случаях. А условному “плаванию” и вовсе придется учиться с нуля.
Что за "плавание"? О'Брайант показывает на коде: если раньше работающая реализация означала, что задача готова на 80%, то теперь – на 20%. Из чего состоят оставшиеся 80%? Из чтения и переделки кода.
“Экономика” переворачивается не только в коде. Писать тексты с помощью ИИ можно намного быстрее, но вычитывать их надо все еще глазами. А arXiv прямо сейчас заваливает потоком ИИ-открытий в математике – настоящих и выдуманных – проверять их все предстоит живым ученым.
И вот сюда идеально ложится пост Никласа Груна с провокационным названием “Не будьте мясными прокси”. Он рассказывает, что в последнее время все чаще сталкивается с ситуацией: задал вопрос в Slack – а ответом получаешь формулировку “Claude сказал, что…”.
Мясной прокси – человек, который банально переправляет вопросы к ИИ, а ответы обратно к человеку. Но зачем? Если Груну нужно спросить Claude – то он и сам напишет промпт.
Грун добавляет, что читать вывод модели это еще и дополнительная работа – современные ИИ до сих пор многословны, сыпят терминами там, где не нужно, а часто несут чушь. Это превращает мясного прокси из ленивого коллеги в экономическую фигуру: он не просто не добавил ценности, он переложил подорожавшую работу на соседа.
Грунт заканчивает пост советом: промптите ИИ сколько угодно, но не отправляйте ответ, как есть – прочтите, проверьте и перепишите своими словами. Красивая гигиена, на которую 99% забьют.
Да и проблема куда глубже. Возьмем код-ревью как иллюстрацию. Раньше инженер несколько дней писал код, создавал PR, который смотрел ревьюер – у него свежий глаз плюс, при достаточном опыте, ревьюер еще по структуре видит, где автор поленился или устал. В итоге на нескольких авторов приходился один ревьюер – разумная экономически схема.
Сейчас она сломалась. Мясной прокси может писать код и править по комментариям почти моментально, а на ревьюера падает в разы больше нагрузки – не только из-за объемов, но и потому, что ИИ-код “ровный”, ошибку в нем на глаз не поймаешь.
Но люди привыкли решать проблемы по мере поступления: разобрались с написанием кода – возьмемся за ревью. Еще весной автоматический ревьюер Anthropic вылавливал до трети багов, инструмент доступен и корпоративным клиентам – функция Code Review в Claude Code на тарифах Team и Enterprise.
Рано или поздно дешевым станет и написание, и чтение – получается, вот оно, ускорение в 10 раз? Не совсем.
Навык чтения не уйдет, а изменится: надо будет понимать, где читать глазами, а где – задать правильные вопросы или прогнать тесты. А главное – еще важнее станет навык брать ответственность за то, что сделала модель.
–
Не быть мясными прокси я учу на “Бусти”. Вот два текста, которые пригодятся:
👉Обзор техники работы с ИИ loop engineering – как раз про то, как запускать циклы, где ИИ занимается сразу написанием и чтением.
👉“Лестница” освоения ИИ от создателя Claude Code – мой любимый текст, в котором есть подсказки, как перейти от x2 к x10 и не бояться подписываться под результатами работы ИИ.
👍32❤26🔥7😁3👏2🥰1
Какую подписку сейчас брать?
OpenAI поменяла тарифные планы ChatGPT, поэтому самое время сделать мини-гайд – какую подписку я рекомендую брать, если у вас есть определенная сумма. Я делаю такой гайд каждые несколько месяцев, в этот раз он будет чуточку сухим: на рынке вперед мощно вырвались два игрока – Anthropic и OpenAI – поэтому их подписки закрывают большинство категорий. Но с нюансами.
Пойдем по лестнице, снизу вверх.
Бесплатный чат-бот – теперь ChatGPT Free. Его OpenAI изменила сильнее всего: теперь доступны безлимитные разговоры с GPT-5.6 Luna, а также кнопка Think для сложных задач (апдейт: замена модели пройдет до конца недели, кнопка появится на следующей). Это младшая модель в линейке GPT-5.6, но достойная.
Из других – Gemini 3.6 Flash в Google AI Studio, но если пробьетесь через региональный блок. Или DeepSeek V4 – здесь блокировок никаких.
Недорогой чат-бот на семью или компанию – Gemini Pro. Не все знают, что эту 20-долларовую подписку можно поделить между шестью участниками “семьи” – главное, чтобы они были в одном регионе. Лучшая модель там сейчас Gemini 3.6 Flash, есть рисовалка Nano Banana 2 и ИИ-агент Antigravity – он, впрочем, уступает Claude Code или Codex.
Есть 20 долларов на подписку – однозначно ChatGPT Plus. Дает почти безлимитный GPT-5.6 Sol, отличную рисовалку GPT Images 2 и новый голосовой режим – реально классный. И отдельный лимит на ИИ-агентов Codex (код) и ChatGPT Work (“офисная” работа) – небольшой, но на несколько проектов в неделю хватит. Чтобы выжать больше, не выкручивайте режим рассуждений – GPT-5.6 Medium справляется с большинством повседневных задач.
Есть еще 20 долларов – добавляем Claude Pro. Из-за очень жестких лимитов это скорее демо-версия, чем полноценная подписка. Основной моделью ставьте Sonnet 5, а Opus 5 гоняйте для сложных задач и точечной проверки соннета.
В отличие от ChatGPT Plus, у Claude один лимит на чат-бота, Claude Cowork и Claude Code – но в последних двух он расходуется в два раза медленнее (акция до 19 августа).
Дальше предстоит серьезный скачок – следующий тир подписки стоит 100 долларов. Это реально дорого, и я вижу два способа оправдать такую подписку:
– Если у вас уже есть workflow, на котором ИИ зарабатывает деньги или круто экономит время. Тогда это рабочий инструмент, а на рабочих инструментах не экономят.
– Относиться к подписке как к инвестиции в собственное образование. Сейчас не зарабатываете, но ИИ-навыки окупятся. Только помните: одной дорогой подписки мало – надо постоянно гонять ИИ в разных сценариях, в том числе агентских.
100-долларовая Claude Max x5 наконец-то превращается в рабочий инструмент. 50% недельных лимитов можно тратить на Fable 5, вторую половину – на Opus 5 или Sonnet 5 – причем новый опус в моих задачах лишь чуть-чуть хуже.
ChatGPT Pro Lite за те же деньги опять дает больше лимитов, чем Claude Max. Плюс каждый месяц дают четыре сброса лимита в любой момент.
И как бонус – GPT-5.6 Pro. Она доступна только в чате и на отдельном лимите – что-то типа 50 запросов в неделю. По интеллекту примерно уровня Fable 5, но способна на очень долгую автономную работу: у меня рекорд более 240 (!) минут. Но для этого ее надо промптить в старом стиле, четко и подробно расписывая задачу.
200-долларовые подписки детально разбирать не буду – их берут те, кто хорошо понимает свои задачи.
Сами модели сейчас очень близки по возможностям. Мне нравятся Fable/Opus за живой стиль общения – прямо настоящий компаньон, с которым можно поштурмить идеи, сразу же что-то проверить и покритиковать. У GPT-5.6 стиль хуже, но она потрясающе ищет в сети, докапываясь даже до мелочей – поэтому я часто использую ее как критика поверх результатов Claude.
–
Вот такая получилась лестница. А учиться пользоваться моделями я помогаю на “Бусти”. Под сегодняшний пост рекомендую два лонгрида:
👉 Как управляет ИИ один из создателей Claude Code – начинайте с этого текста, а затем идите по циклу о промптинге.
👉 Зачем вам ИИ-агент. Знакомимся с Claude Code и Codex – а отсюда начинайте знакомство с ИИ-агентами.
OpenAI поменяла тарифные планы ChatGPT, поэтому самое время сделать мини-гайд – какую подписку я рекомендую брать, если у вас есть определенная сумма. Я делаю такой гайд каждые несколько месяцев, в этот раз он будет чуточку сухим: на рынке вперед мощно вырвались два игрока – Anthropic и OpenAI – поэтому их подписки закрывают большинство категорий. Но с нюансами.
Пойдем по лестнице, снизу вверх.
Бесплатный чат-бот – теперь ChatGPT Free. Его OpenAI изменила сильнее всего: теперь доступны безлимитные разговоры с GPT-5.6 Luna, а также кнопка Think для сложных задач (апдейт: замена модели пройдет до конца недели, кнопка появится на следующей). Это младшая модель в линейке GPT-5.6, но достойная.
Из других – Gemini 3.6 Flash в Google AI Studio, но если пробьетесь через региональный блок. Или DeepSeek V4 – здесь блокировок никаких.
Недорогой чат-бот на семью или компанию – Gemini Pro. Не все знают, что эту 20-долларовую подписку можно поделить между шестью участниками “семьи” – главное, чтобы они были в одном регионе. Лучшая модель там сейчас Gemini 3.6 Flash, есть рисовалка Nano Banana 2 и ИИ-агент Antigravity – он, впрочем, уступает Claude Code или Codex.
Есть 20 долларов на подписку – однозначно ChatGPT Plus. Дает почти безлимитный GPT-5.6 Sol, отличную рисовалку GPT Images 2 и новый голосовой режим – реально классный. И отдельный лимит на ИИ-агентов Codex (код) и ChatGPT Work (“офисная” работа) – небольшой, но на несколько проектов в неделю хватит. Чтобы выжать больше, не выкручивайте режим рассуждений – GPT-5.6 Medium справляется с большинством повседневных задач.
Есть еще 20 долларов – добавляем Claude Pro. Из-за очень жестких лимитов это скорее демо-версия, чем полноценная подписка. Основной моделью ставьте Sonnet 5, а Opus 5 гоняйте для сложных задач и точечной проверки соннета.
В отличие от ChatGPT Plus, у Claude один лимит на чат-бота, Claude Cowork и Claude Code – но в последних двух он расходуется в два раза медленнее (акция до 19 августа).
Дальше предстоит серьезный скачок – следующий тир подписки стоит 100 долларов. Это реально дорого, и я вижу два способа оправдать такую подписку:
– Если у вас уже есть workflow, на котором ИИ зарабатывает деньги или круто экономит время. Тогда это рабочий инструмент, а на рабочих инструментах не экономят.
– Относиться к подписке как к инвестиции в собственное образование. Сейчас не зарабатываете, но ИИ-навыки окупятся. Только помните: одной дорогой подписки мало – надо постоянно гонять ИИ в разных сценариях, в том числе агентских.
100-долларовая Claude Max x5 наконец-то превращается в рабочий инструмент. 50% недельных лимитов можно тратить на Fable 5, вторую половину – на Opus 5 или Sonnet 5 – причем новый опус в моих задачах лишь чуть-чуть хуже.
ChatGPT Pro Lite за те же деньги опять дает больше лимитов, чем Claude Max. Плюс каждый месяц дают четыре сброса лимита в любой момент.
И как бонус – GPT-5.6 Pro. Она доступна только в чате и на отдельном лимите – что-то типа 50 запросов в неделю. По интеллекту примерно уровня Fable 5, но способна на очень долгую автономную работу: у меня рекорд более 240 (!) минут. Но для этого ее надо промптить в старом стиле, четко и подробно расписывая задачу.
200-долларовые подписки детально разбирать не буду – их берут те, кто хорошо понимает свои задачи.
Сами модели сейчас очень близки по возможностям. Мне нравятся Fable/Opus за живой стиль общения – прямо настоящий компаньон, с которым можно поштурмить идеи, сразу же что-то проверить и покритиковать. У GPT-5.6 стиль хуже, но она потрясающе ищет в сети, докапываясь даже до мелочей – поэтому я часто использую ее как критика поверх результатов Claude.
–
Вот такая получилась лестница. А учиться пользоваться моделями я помогаю на “Бусти”. Под сегодняшний пост рекомендую два лонгрида:
👉 Как управляет ИИ один из создателей Claude Code – начинайте с этого текста, а затем идите по циклу о промптинге.
👉 Зачем вам ИИ-агент. Знакомимся с Claude Code и Codex – а отсюда начинайте знакомство с ИИ-агентами.
👍75❤32😁10🔥4👏3
В 2008 году Роберт “дядюшка Боб” Мартин написал книгу Clean Code, которая считается чуть ли не главной работой для любого программиста в мире. Главный посыл книги прост: код пишется единожды, а перечитывать его будут десятки раз – так что будьте добры, пишите код чисто, с уважением к тем, кто его потом увидит.
А две недели назад Роберт Мартин взорвал X признанием, что вообще перестал читать код, который пишут ИИ-агенты. Я изучил GitHub-репозитории “дядюшки Боба”, прошерстил более сотни его твитов и публикаций и написал подробный разбор его новых правил кодинга:
Clean Code 2.0. Как использует ИИ автор самой популярной книги о программировании
Это мой самый большой и детальный лонгрид в подписке, который будет полезен не только программистам, но и вообще всем, кто пользуется ИИ. Дядюшка Боб показывает один из лучших виденных мною примеров loop engineering – новой схемы работы с ИИ, когда пользователь не пишет промпты, а выстраивает циклы.
У Мартина в цикле до шести агентов, а основное внимание уделяется не написанию кода, а его чтению – но не человеком, а ИИ. Чтобы это давало результат, Боб выстроил целую систему тестов, от вполне привычных до экзотических.
Это и делает материал особенно интересным. Программисты в схеме “дядюшки Боба” найдут инструмент, который можно взять и адаптировать для своей работы с ИИ. Всем остальным я поясняю, как принципы этого инструмента перестроить для любой интеллектуальной задачи, которую вы хотите автоматизировать при помощи ИИ. Обязательно почитайте, с таким мощным подходом я сталкиваюсь редко.
👉 Читать на “Бусти”
👉 Читать на Sponsr
А две недели назад Роберт Мартин взорвал X признанием, что вообще перестал читать код, который пишут ИИ-агенты. Я изучил GitHub-репозитории “дядюшки Боба”, прошерстил более сотни его твитов и публикаций и написал подробный разбор его новых правил кодинга:
Clean Code 2.0. Как использует ИИ автор самой популярной книги о программировании
Это мой самый большой и детальный лонгрид в подписке, который будет полезен не только программистам, но и вообще всем, кто пользуется ИИ. Дядюшка Боб показывает один из лучших виденных мною примеров loop engineering – новой схемы работы с ИИ, когда пользователь не пишет промпты, а выстраивает циклы.
У Мартина в цикле до шести агентов, а основное внимание уделяется не написанию кода, а его чтению – но не человеком, а ИИ. Чтобы это давало результат, Боб выстроил целую систему тестов, от вполне привычных до экзотических.
Это и делает материал особенно интересным. Программисты в схеме “дядюшки Боба” найдут инструмент, который можно взять и адаптировать для своей работы с ИИ. Всем остальным я поясняю, как принципы этого инструмента перестроить для любой интеллектуальной задачи, которую вы хотите автоматизировать при помощи ИИ. Обязательно почитайте, с таким мощным подходом я сталкиваюсь редко.
👉 Читать на “Бусти”
👉 Читать на Sponsr
❤34👍24🔥19👏1