17 августа главный ресурс для кода GitHub упал почти на целый рабочий день
Сбой начался в 9:40 по восточному времени и длился до 17:15 – почти восемь часов. Пострадали Actions, API, pull requests, Issues, вебхуки, авторизация (SAML/OIDC), Copilot. Работа миллионов инженеров по всему миру встала или оказалась серьезно затруднена.
В этот же день Cursor запустил Origin – собственный GitHub, спроектированный для ИИ-агентов. Уверен, в PR-отделе компании открыли не одну лишнюю бутылку шампанского – лучшего фона, чем падение GitHub, для запуска и не придумаешь.
У канала достаточно много нетехнических подписчиков, поэтому буквально абзацем поясню, о чем речь. GitHub – самое большое в мире онлайн-хранилище кода. Но главное: оно рассчитано на комфортную работу с этим кодом – есть история изменений, можно вести несколько альтернативных веток разработки, а если с кодом работает больше одного человека (а это 99% случаев), то добавляется механика пул-реквестов (PR), когда предлагаемые изменения сначала проверяются, а затем вливаются (мержатся) в код.
Вокруг GitHub выстроилась огромная инфраструктура: от автоматических тестов до подобия социальной сети – с рейтингами и обсуждениями проектов. Плюс в репозиториях давно держат не только код, но и промпты и скиллы для ИИ, бизнес-проекты и даже книги – настолько удобным оказался функционал для людей разных профессий.
Одна беда: GitHub не очень подходит для ИИ-агентов.
Причина простая – модели пишут код в десятки раз быстрее людей. По данным The Information, в марте 2026 года ИИ-агенты открыли 17 млн PR против 4 млн в сентябре 2025 – рост в четыре раза за полгода. Увеличение нагрузки повлияло на стабильность GitHub: восемь инцидентов с деградацией насчитали в июле, шесть – в июне.
Именно в эту точку бьет Cursor – у Origin свой хостинг, принципы организации работы копируют GitHub, более того, на старте вообще можно сделать “зеркало” своего репозитория с GitHub.
Инфраструктура должна быть оптимизирована именно под ритм работы агентов – но для проверки этого обещания нужно время. Пока что Origin стартовал в бете и только на платных планах Cursor – это поможет отрегулировать нагрузку и не упасть на старте.
Еще одна интересная особенность Origin – когда инжернер работает через Cursor, то ИИ-агент видит не только открытый файл, а сразу весь репозиторий и может отвечать на вопросы по истории правок.
Конкуренция не будет простой: к GitHub привыкли сотни миллионов инженеров, а Origin пока отстает по функционалу – Cursor, кстати, обещает еще больше функций под ИИ-агентов, но не говорит, каких.
Однако Cursor в этой истории – лишь часть более широкого фронта. С середины августа компания вошла в состав SpaceXAI, которая разрабатывает линейку Grok. Cursor располагает одним из лучших обучающих датасетов по программированию, который уже использовали для обучения Grok 4.5 и Grok 4.6. Результат виден – ИИ-модели Илона Маска лишь немного отстают по кодингу от лидирующих GPT и Claude, будучи заметно дешевле по цене.
Качество датасета Cursor объясняется просто: это редактор кода, в котором человек и ИИ работают в четыре руки, поэтому детально видно, какие куски модель написала хорошо, а какие инженер поправил руками. С запуском Origin в этот набор данных добавляется еще один слой – как специалист работает с репозиторием, к каким файлам обращается, когда коммитит и так далее. Конечно, быстро такие данные собрать не получится, но не удивлюсь, если уже через полгода-год новые версии Grok получат очередное преимущество.
Еще прошлой осенью Илона Маска воспринимали аутсайдером ИИ-рынка. Сейчас он врывается в конкуренцию с OpenAI и Anthropic на рынке моделей для кодинга, и Microsoft – на рынке инфраструктуры. Все ждали этого от Google – но результат пришел с другой стороны.
—
17 миллионов PR на GitHub в месяц – история про то, что проверка кода становится дороже написания. Недавно я выпустил лонгрид, как легендарный разработчик Роберт Мартин (автор книги Clean Code) использует рой из шести ИИ-агентов для написания и приемки кода.
Прочесть можно здесь.
Сбой начался в 9:40 по восточному времени и длился до 17:15 – почти восемь часов. Пострадали Actions, API, pull requests, Issues, вебхуки, авторизация (SAML/OIDC), Copilot. Работа миллионов инженеров по всему миру встала или оказалась серьезно затруднена.
В этот же день Cursor запустил Origin – собственный GitHub, спроектированный для ИИ-агентов. Уверен, в PR-отделе компании открыли не одну лишнюю бутылку шампанского – лучшего фона, чем падение GitHub, для запуска и не придумаешь.
У канала достаточно много нетехнических подписчиков, поэтому буквально абзацем поясню, о чем речь. GitHub – самое большое в мире онлайн-хранилище кода. Но главное: оно рассчитано на комфортную работу с этим кодом – есть история изменений, можно вести несколько альтернативных веток разработки, а если с кодом работает больше одного человека (а это 99% случаев), то добавляется механика пул-реквестов (PR), когда предлагаемые изменения сначала проверяются, а затем вливаются (мержатся) в код.
Вокруг GitHub выстроилась огромная инфраструктура: от автоматических тестов до подобия социальной сети – с рейтингами и обсуждениями проектов. Плюс в репозиториях давно держат не только код, но и промпты и скиллы для ИИ, бизнес-проекты и даже книги – настолько удобным оказался функционал для людей разных профессий.
Одна беда: GitHub не очень подходит для ИИ-агентов.
Причина простая – модели пишут код в десятки раз быстрее людей. По данным The Information, в марте 2026 года ИИ-агенты открыли 17 млн PR против 4 млн в сентябре 2025 – рост в четыре раза за полгода. Увеличение нагрузки повлияло на стабильность GitHub: восемь инцидентов с деградацией насчитали в июле, шесть – в июне.
Именно в эту точку бьет Cursor – у Origin свой хостинг, принципы организации работы копируют GitHub, более того, на старте вообще можно сделать “зеркало” своего репозитория с GitHub.
Инфраструктура должна быть оптимизирована именно под ритм работы агентов – но для проверки этого обещания нужно время. Пока что Origin стартовал в бете и только на платных планах Cursor – это поможет отрегулировать нагрузку и не упасть на старте.
Еще одна интересная особенность Origin – когда инжернер работает через Cursor, то ИИ-агент видит не только открытый файл, а сразу весь репозиторий и может отвечать на вопросы по истории правок.
Конкуренция не будет простой: к GitHub привыкли сотни миллионов инженеров, а Origin пока отстает по функционалу – Cursor, кстати, обещает еще больше функций под ИИ-агентов, но не говорит, каких.
Однако Cursor в этой истории – лишь часть более широкого фронта. С середины августа компания вошла в состав SpaceXAI, которая разрабатывает линейку Grok. Cursor располагает одним из лучших обучающих датасетов по программированию, который уже использовали для обучения Grok 4.5 и Grok 4.6. Результат виден – ИИ-модели Илона Маска лишь немного отстают по кодингу от лидирующих GPT и Claude, будучи заметно дешевле по цене.
Качество датасета Cursor объясняется просто: это редактор кода, в котором человек и ИИ работают в четыре руки, поэтому детально видно, какие куски модель написала хорошо, а какие инженер поправил руками. С запуском Origin в этот набор данных добавляется еще один слой – как специалист работает с репозиторием, к каким файлам обращается, когда коммитит и так далее. Конечно, быстро такие данные собрать не получится, но не удивлюсь, если уже через полгода-год новые версии Grok получат очередное преимущество.
Еще прошлой осенью Илона Маска воспринимали аутсайдером ИИ-рынка. Сейчас он врывается в конкуренцию с OpenAI и Anthropic на рынке моделей для кодинга, и Microsoft – на рынке инфраструктуры. Все ждали этого от Google – но результат пришел с другой стороны.
—
17 миллионов PR на GitHub в месяц – история про то, что проверка кода становится дороже написания. Недавно я выпустил лонгрид, как легендарный разработчик Роберт Мартин (автор книги Clean Code) использует рой из шести ИИ-агентов для написания и приемки кода.
Прочесть можно здесь.
🔥27❤23👍13😁1
OpenAI притормозила тренировку Astra – и вводит беспрецедентные меры безопасности
Компания рассказала о мерах, которые были приняты и предпринимаются после того, как ее ИИ-агенты несколько раз выходили из-под контроля во время тестов. Самым известным случаем стал взлом Hugging Face, откуда агенты украли ответы на тест, который решали.
Вот что сделали:
1️⃣ Компания на две недели останавливала обучение Astra – своей самой мощной модели. Во многих каналах вижу трактовку, что обучение заморожено до сих пор, но это не так, про две недели написано в прошлом времени. До сих пор на паузе самый крупный обучающий прогон – вероятно потому, что в нем возможности модели могут вырасти еще больше. Мелкие прогоны возобновлены: на них смотрят поведение модели и то, как работают защитные блокировки.
2️⃣ Две недели паузы потратили на укрепление инфраструктуры. Новые требования: жесткие песочницы для любого кода, написанного моделью; изоляция рискованных задач от интернета так, чтобы взлом одного узла не открывал остальное; вычищены общие уязвимые сервисы, урезаны постоянные привилегии.
3️⃣ Для тестирования укрепленной инфраструктуры используются ИИ-агенты, которым ставят задачи по ее взлому – конечно, под присмотром специалистов.
Компания развернула многоступенчатую систему контроля за тестируемыми моделями – возможно, первую такую в индустрии. Вот как она устроена:
Первая ступень – дешевые детекторы на активациях. Активации – внутреннее состояние модели в момент, когда она выбирает следующее слово. Детектор – маленькая надстройка, которую научили по этим числам угадывать, “думает” ли модель сейчас про что-то из запрещенного списка. Он не читает текст, а смотрит модели “в голову”, причем в реальном времени.
Вторая ступень – автоматические следователи. Если детектор что-то заподозрил, то включаются модели подороже: они читают, что именно агент делал с инструментами, его рассуждения, всю цепочку шагов от начала задачи – и решают, это реально попытка вылезти наружу, что-то сломать или обойти защиту, или ложная тревога.
Третья ступень – люди. Если ИИ-следователи говорят “похоже на нарушение критической границы”, у команд безопасности звонит пейджер и дается 30 минут на разбор. Не доказали, что тревога ложная, – процесс останавливают.
Меры распространяются на тестовые прогоны моделей “уровня GPT-5.6 Sol и выше”, а для Astra – обязательны на всех прогонах. В OpenAI называют цену безопасности – тестирование с такими мерами требует до 20% больше вычислительных мощностей.
4️⃣ Отдельный блок мер – про само обучение. На этапе RL модель раз за разом решает задачи, а оценщик – часто тоже нейросеть – выдает баллы. Раньше давали в основном за решенную задачу, теперь оценщика учат смотреть и на дорогу к ней: полез не туда, обошел ограничение – баллы ниже, даже если задача сделана. Отдельно тренируют честность в отчетах о своих действиях и давят reward hacking – добычу награды без решения: подгонку ответа под проверяющий скрипт, взлом грейдера, поиск утечки ответов, как в истории с Hugging Face.
Больше деталей компания обещает раскрыть в будущем, пока же вернусь к четвертому пункту. У нас классический случай Quis custodiet ipsos custodes? – кто будет сторожить сторожей? Важный этап оценки безопасности ИИ компания впервые передает другому ИИ. В OpenAI объясняют это тем, что киберспособности растут настолько быстро, что есть риск не отследить их человеческими силами. А возможности ИИ-следователей будут расти параллельно возможностям новых моделей.
И вопрос здесь уходит в сферу доверия: напомню, что у компании была история, когда ИИ-агенты развернули в инфраструктуре OpenAI целую доску для обмена сообщениями – и “чатились” там примерно два месяца. Надеюсь, теперь инфраструктура укреплена достаточно сильно, чтобы такой же доски не сделали с ИИ-следователями.
—
О том, как выжимать из ИИ максимум, я рассказываю на “Бусти”. Вот пара свежих хитов:
🔹 Карта и территория: как управляет ИИ один из создателей Claude Code
🔸 Системный промпт на примере Claude Fable 5: что это и какие приемы промптинга можно перенять у Anthropic
Компания рассказала о мерах, которые были приняты и предпринимаются после того, как ее ИИ-агенты несколько раз выходили из-под контроля во время тестов. Самым известным случаем стал взлом Hugging Face, откуда агенты украли ответы на тест, который решали.
Вот что сделали:
1️⃣ Компания на две недели останавливала обучение Astra – своей самой мощной модели. Во многих каналах вижу трактовку, что обучение заморожено до сих пор, но это не так, про две недели написано в прошлом времени. До сих пор на паузе самый крупный обучающий прогон – вероятно потому, что в нем возможности модели могут вырасти еще больше. Мелкие прогоны возобновлены: на них смотрят поведение модели и то, как работают защитные блокировки.
2️⃣ Две недели паузы потратили на укрепление инфраструктуры. Новые требования: жесткие песочницы для любого кода, написанного моделью; изоляция рискованных задач от интернета так, чтобы взлом одного узла не открывал остальное; вычищены общие уязвимые сервисы, урезаны постоянные привилегии.
3️⃣ Для тестирования укрепленной инфраструктуры используются ИИ-агенты, которым ставят задачи по ее взлому – конечно, под присмотром специалистов.
Компания развернула многоступенчатую систему контроля за тестируемыми моделями – возможно, первую такую в индустрии. Вот как она устроена:
Первая ступень – дешевые детекторы на активациях. Активации – внутреннее состояние модели в момент, когда она выбирает следующее слово. Детектор – маленькая надстройка, которую научили по этим числам угадывать, “думает” ли модель сейчас про что-то из запрещенного списка. Он не читает текст, а смотрит модели “в голову”, причем в реальном времени.
Вторая ступень – автоматические следователи. Если детектор что-то заподозрил, то включаются модели подороже: они читают, что именно агент делал с инструментами, его рассуждения, всю цепочку шагов от начала задачи – и решают, это реально попытка вылезти наружу, что-то сломать или обойти защиту, или ложная тревога.
Третья ступень – люди. Если ИИ-следователи говорят “похоже на нарушение критической границы”, у команд безопасности звонит пейджер и дается 30 минут на разбор. Не доказали, что тревога ложная, – процесс останавливают.
Меры распространяются на тестовые прогоны моделей “уровня GPT-5.6 Sol и выше”, а для Astra – обязательны на всех прогонах. В OpenAI называют цену безопасности – тестирование с такими мерами требует до 20% больше вычислительных мощностей.
4️⃣ Отдельный блок мер – про само обучение. На этапе RL модель раз за разом решает задачи, а оценщик – часто тоже нейросеть – выдает баллы. Раньше давали в основном за решенную задачу, теперь оценщика учат смотреть и на дорогу к ней: полез не туда, обошел ограничение – баллы ниже, даже если задача сделана. Отдельно тренируют честность в отчетах о своих действиях и давят reward hacking – добычу награды без решения: подгонку ответа под проверяющий скрипт, взлом грейдера, поиск утечки ответов, как в истории с Hugging Face.
Больше деталей компания обещает раскрыть в будущем, пока же вернусь к четвертому пункту. У нас классический случай Quis custodiet ipsos custodes? – кто будет сторожить сторожей? Важный этап оценки безопасности ИИ компания впервые передает другому ИИ. В OpenAI объясняют это тем, что киберспособности растут настолько быстро, что есть риск не отследить их человеческими силами. А возможности ИИ-следователей будут расти параллельно возможностям новых моделей.
И вопрос здесь уходит в сферу доверия: напомню, что у компании была история, когда ИИ-агенты развернули в инфраструктуре OpenAI целую доску для обмена сообщениями – и “чатились” там примерно два месяца. Надеюсь, теперь инфраструктура укреплена достаточно сильно, чтобы такой же доски не сделали с ИИ-следователями.
—
О том, как выжимать из ИИ максимум, я рассказываю на “Бусти”. Вот пара свежих хитов:
🔹 Карта и территория: как управляет ИИ один из создателей Claude Code
🔸 Системный промпт на примере Claude Fable 5: что это и какие приемы промптинга можно перенять у Anthropic
👍23❤20🔥12🥰1
I will not manufacture a proof
В последнее время я часто пишу про ИИ в математике – каждую неделю на канале выходит по 1-2 таких поста. И с учетом того, что поток новых ИИ-открытий не останавливается, вряд ли остановлюсь я.
Но зачем я делаю это? Две причины.
Первая, чуточку банальная: математика – главная наука для познания. Открытия – любые – в ней двигают нас к тому, чтобы понимать мир лучше.
Вторая: математика сейчас – это "новый код", то есть область, которая идеально подходит для оценки развития ИИ. С одной стороны, решение математических задач – это прямо предел возможностей нейросетей. С другой – у задач, решаемых с помощью ИИ, есть однозначный ответ, который можно проверить.
Я не говорю, что проблем нет вообще: интернет прямо сейчас захлебывается в потоке “потенциальных ИИ-открытий” от профессионалов и любителей – и рецензенты просто не понимают, за что хвататься. Но это во многом менеджерская задача, решать которую можно в том числе с помощью ИИ.
Сравните с биологией: спроектированный нейросетями кандидат в лекарства должен пройти несколько стадий доклиники и клиники – всего около десяти лет до момента, когда можно точно сказать “это работает”. А про текст вообще сложно сказать, хороший он или плохой – есть мнения, вкусы, цифровые метрики.
В общем, именно по математике видно, где предел возможностей современных моделей, какие слабые места у них остались, как организовать работу и, что не менее важно, приемку результатов.
Расскажу о примере из своей практики.
У меня в Claude Cowork заведен отдельный проект – туда я отдаю последние ИИ-открытия в математике и разбираю их с помощью Fable 5. Я не профессионал, мне интересно другое: что за открытия, в чем их ценность, как ИИ шел к результату, как люди его принимали и проверяли. Многими находками уже делился на канале – ищите посты примерно с начала июля.
На днях Даниэль Лемир, профессор информатики (и математик по образованию), выложил в X задачу со словами “не хотите протестировать свой ИИ на этой штуке?”:
Правда ли, что для любой степени L существует неприводимый многочлен над GF(2), у которого все члены, кроме старшего, живут в нижней половине степеней — не выше L/2?
(полная формулировка здесь, искать по conjecture)
Я скинул задачу Fable 5 на оценку и получил вердикт – вряд ли справимся, тут нужен совсем новый подход, возможно, новая математика.
Но у меня было немного свободного времени и достаточно большой остаток лимитов на GPT-5.6 Pro, поэтому я попросил Fable 5 не сдаваться: поискать нестандартные подходы, попробовать формулировки промптов в стиле тех, которыми совершались другие открытия.
Мы сделали несколько проходов, по-разному пытаясь выжать из модели результат – в одном из последних промтов, например, был включен запрет на поиск в сети и утверждалось, что задача решена, а модели надо повторить это решение (такой подход используют математики OpenAI). Fable 5 предупреждала – даже если модель вернется с решением, то скорее всего или пропустит ошибку, или сгаллюцинирует его полностью.
GPT-5.6 Pro работала над каждым промптом по 2-3 часа и возвращалась с честным ответом. В зависимости от постановки задачи, он звучал по-разному, но сводился к одному:
I will not manufacture a proof – я не буду фабриковать доказательство.
(и дальше результат, что удалось посчитать – вот один из примеров)
Вспомните: лишь год с небольшим назад сильнейшую модель OpenAI o3 регулярно приходилось ловить за руку на галлюцинациях – вплоть до ссылок на выдуманные научные статьи. Сегодня ее наследница, находясь под давлением человека и другой ИИ-модели такого же уровня, продолжает стоять на своем – нет, эта задача нам с тобой не по плечу, и вот объяснение, почему.
Для меня это не менее ценный результат: понять уровень доверия модели, подняв его на ступеньку выше.
А гипотезу Лемира когда-нибудь обязательно решат.
—
Как выжимать из ИИ максимум – я рассказываю на “Бусти”. Там и собственная практика (в том числе совсем безумные эксперименты), и разборы опыта крутых специалистов, вроде создателя Claude Code Бориса Черни.
Самое время подписаться!
В последнее время я часто пишу про ИИ в математике – каждую неделю на канале выходит по 1-2 таких поста. И с учетом того, что поток новых ИИ-открытий не останавливается, вряд ли остановлюсь я.
Но зачем я делаю это? Две причины.
Первая, чуточку банальная: математика – главная наука для познания. Открытия – любые – в ней двигают нас к тому, чтобы понимать мир лучше.
Вторая: математика сейчас – это "новый код", то есть область, которая идеально подходит для оценки развития ИИ. С одной стороны, решение математических задач – это прямо предел возможностей нейросетей. С другой – у задач, решаемых с помощью ИИ, есть однозначный ответ, который можно проверить.
Я не говорю, что проблем нет вообще: интернет прямо сейчас захлебывается в потоке “потенциальных ИИ-открытий” от профессионалов и любителей – и рецензенты просто не понимают, за что хвататься. Но это во многом менеджерская задача, решать которую можно в том числе с помощью ИИ.
Сравните с биологией: спроектированный нейросетями кандидат в лекарства должен пройти несколько стадий доклиники и клиники – всего около десяти лет до момента, когда можно точно сказать “это работает”. А про текст вообще сложно сказать, хороший он или плохой – есть мнения, вкусы, цифровые метрики.
В общем, именно по математике видно, где предел возможностей современных моделей, какие слабые места у них остались, как организовать работу и, что не менее важно, приемку результатов.
Расскажу о примере из своей практики.
У меня в Claude Cowork заведен отдельный проект – туда я отдаю последние ИИ-открытия в математике и разбираю их с помощью Fable 5. Я не профессионал, мне интересно другое: что за открытия, в чем их ценность, как ИИ шел к результату, как люди его принимали и проверяли. Многими находками уже делился на канале – ищите посты примерно с начала июля.
На днях Даниэль Лемир, профессор информатики (и математик по образованию), выложил в X задачу со словами “не хотите протестировать свой ИИ на этой штуке?”:
Правда ли, что для любой степени L существует неприводимый многочлен над GF(2), у которого все члены, кроме старшего, живут в нижней половине степеней — не выше L/2?
(полная формулировка здесь, искать по conjecture)
Я скинул задачу Fable 5 на оценку и получил вердикт – вряд ли справимся, тут нужен совсем новый подход, возможно, новая математика.
Но у меня было немного свободного времени и достаточно большой остаток лимитов на GPT-5.6 Pro, поэтому я попросил Fable 5 не сдаваться: поискать нестандартные подходы, попробовать формулировки промптов в стиле тех, которыми совершались другие открытия.
Мы сделали несколько проходов, по-разному пытаясь выжать из модели результат – в одном из последних промтов, например, был включен запрет на поиск в сети и утверждалось, что задача решена, а модели надо повторить это решение (такой подход используют математики OpenAI). Fable 5 предупреждала – даже если модель вернется с решением, то скорее всего или пропустит ошибку, или сгаллюцинирует его полностью.
GPT-5.6 Pro работала над каждым промптом по 2-3 часа и возвращалась с честным ответом. В зависимости от постановки задачи, он звучал по-разному, но сводился к одному:
I will not manufacture a proof – я не буду фабриковать доказательство.
(и дальше результат, что удалось посчитать – вот один из примеров)
Вспомните: лишь год с небольшим назад сильнейшую модель OpenAI o3 регулярно приходилось ловить за руку на галлюцинациях – вплоть до ссылок на выдуманные научные статьи. Сегодня ее наследница, находясь под давлением человека и другой ИИ-модели такого же уровня, продолжает стоять на своем – нет, эта задача нам с тобой не по плечу, и вот объяснение, почему.
Для меня это не менее ценный результат: понять уровень доверия модели, подняв его на ступеньку выше.
А гипотезу Лемира когда-нибудь обязательно решат.
—
Как выжимать из ИИ максимум – я рассказываю на “Бусти”. Там и собственная практика (в том числе совсем безумные эксперименты), и разборы опыта крутых специалистов, вроде создателя Claude Code Бориса Черни.
Самое время подписаться!
❤31🔥14👍13
мРНК-вакцина от рака впервые прошла третью стадию клинических испытаний. Это персонализированное лекарство, которое ИИ проектирует под пациента
Merck и Moderna объявили об успешных результатах третьей фазы клинических испытаний интисмерана – персонализированной мРНК-вакцины от рака. Это еще не окончательный успех: наблюдение пациентов продолжится, а полученные данные должны быть проверены независимыми специалистами – но именно текущий этап открывает путь к подаче заявки на одобрение лекарства FDA, EMA и другими регуляторами.
Акции Moderna скакнули на +177% (!!!) за день – самый крупный рост в истории компании. И вот почему.
Наш организм патрулируют специальные иммунные Т-клетки, которые ищут и убивают чужаков. Чтобы не попасть под раздачу, “родные” клетки тела выставляют наружу кусочки своих внутренних белков на специальных молекулах-подставках (HLA). Для Т-клеток они как “паспорт”: предъявили и все хорошо, нет паспорта – враг.
Но раковые клетки – это мутировавшие собственные клетки организма, поэтому наружу они выставляют такой же “паспорт”. Есть лишь крошечное исключение: мутация меняет букву в гене, а значит одну аминокислоту в белке. Теоретически, небольшой процент Т-клеток может эту подмену распознать, однако раковая клетка умеет защищаться и от них – выставляет молекулу, которая через рецептор PD-1 выключает подошедшую Т-клетку.
Для борьбы с такой защитой создали “Китруду” – лекарство, блокирующее этот тормоз и открывающее путь Т-клеткам. Но так как не все Т-клетки “видят” мутацию раковых клеток, то их банально может не хватить. Поэтому появилась идея подтолкнуть организм вырабатывать больше таких Т-клеток. На это и нацелена вакцина.
Здесь своя сложность: мутации в раковой клетке у каждого пациента индивидуальные, равно как и подставки-HLA – если делать “усредненную” вакцину, то сработает она не у всех. Поэтому вакцину персонализируют: берут у пациента образец здоровой ткани и опухоли, вычитают одно из другого и получают список мутаций. Их сотни, а в мРНК-вакцину помещаются до 34.
Здесь в игру и вступает ИИ. Алгоритм машинного обучения предсказывает для каждой мутации сложную цепочку событий и решает – годится ли она для вакцины. За шесть недель вакцина изготавливается, затем делается укол и в организм попадает инструкция, по которой небольшое количество здоровых клеток выставляют наружу мутации, а также дают сигнал “это опасно”. Т-клетки обучаются на “чужаках” нужным мутациям, а после расходятся по организму уже в поисках настоящих раковых клеток.
Описанный процесс может пугать: созданная с участием ИИ мРНК-вакцина перепрограммирует здоровые клетки, чтобы они обучили Т-клетки искать и убивать раковые клетки – бррр! Но отмечу, что машинное обучение используется в проектировании лекарств уже 15 лет, да и мРНК-вакцины существуют не первый год.
Второй момент – в вакцину действительно заложен процент ошибки: если алгоритм ошибется и мишень окажется похожа на нормальный человеческий белок, иммунитет атакует его, что приведет к аутоиммунной реакции. Пока процент не раскрывается, но со временем алгоритмы будут становиться лучше, плюс комбинацию из китруды и интисмерана сначала планируют использовать только в тяжелых случаях.
Пока что это только меланома, невероятно коварный вид рака: если быстро заметить и удалить, то шансы последствий минимальны, если же немного затянуть – то еще совсем недавно риск летального исхода был огромен. Новую комбинацию планируется использовать после удаления опухоли именно для таких случаев.
Далее интисмеран опробуют на других видах опухолей: легкое, мочевой пузырь, почка, поджелудочная и желудок. Отмечу, что универсальной вакциной он не станет, как и любое другое лекарство: рак включает в себя сотни видов опухолей, требующих индивидуального лечения. Но даже победа над несколькими видами спасет миллионы жизней.
—
Как выжимать из ИИ максимум – я рассказываю на “Бусти”. Там и собственная практика (в том числе совсем безумные эксперименты), и разборы опыта крутых специалистов, вроде создателя Claude Code Бориса Черни.
Самое время подписаться!
Merck и Moderna объявили об успешных результатах третьей фазы клинических испытаний интисмерана – персонализированной мРНК-вакцины от рака. Это еще не окончательный успех: наблюдение пациентов продолжится, а полученные данные должны быть проверены независимыми специалистами – но именно текущий этап открывает путь к подаче заявки на одобрение лекарства FDA, EMA и другими регуляторами.
Акции Moderna скакнули на +177% (!!!) за день – самый крупный рост в истории компании. И вот почему.
Наш организм патрулируют специальные иммунные Т-клетки, которые ищут и убивают чужаков. Чтобы не попасть под раздачу, “родные” клетки тела выставляют наружу кусочки своих внутренних белков на специальных молекулах-подставках (HLA). Для Т-клеток они как “паспорт”: предъявили и все хорошо, нет паспорта – враг.
Но раковые клетки – это мутировавшие собственные клетки организма, поэтому наружу они выставляют такой же “паспорт”. Есть лишь крошечное исключение: мутация меняет букву в гене, а значит одну аминокислоту в белке. Теоретически, небольшой процент Т-клеток может эту подмену распознать, однако раковая клетка умеет защищаться и от них – выставляет молекулу, которая через рецептор PD-1 выключает подошедшую Т-клетку.
Для борьбы с такой защитой создали “Китруду” – лекарство, блокирующее этот тормоз и открывающее путь Т-клеткам. Но так как не все Т-клетки “видят” мутацию раковых клеток, то их банально может не хватить. Поэтому появилась идея подтолкнуть организм вырабатывать больше таких Т-клеток. На это и нацелена вакцина.
Здесь своя сложность: мутации в раковой клетке у каждого пациента индивидуальные, равно как и подставки-HLA – если делать “усредненную” вакцину, то сработает она не у всех. Поэтому вакцину персонализируют: берут у пациента образец здоровой ткани и опухоли, вычитают одно из другого и получают список мутаций. Их сотни, а в мРНК-вакцину помещаются до 34.
Здесь в игру и вступает ИИ. Алгоритм машинного обучения предсказывает для каждой мутации сложную цепочку событий и решает – годится ли она для вакцины. За шесть недель вакцина изготавливается, затем делается укол и в организм попадает инструкция, по которой небольшое количество здоровых клеток выставляют наружу мутации, а также дают сигнал “это опасно”. Т-клетки обучаются на “чужаках” нужным мутациям, а после расходятся по организму уже в поисках настоящих раковых клеток.
Описанный процесс может пугать: созданная с участием ИИ мРНК-вакцина перепрограммирует здоровые клетки, чтобы они обучили Т-клетки искать и убивать раковые клетки – бррр! Но отмечу, что машинное обучение используется в проектировании лекарств уже 15 лет, да и мРНК-вакцины существуют не первый год.
Второй момент – в вакцину действительно заложен процент ошибки: если алгоритм ошибется и мишень окажется похожа на нормальный человеческий белок, иммунитет атакует его, что приведет к аутоиммунной реакции. Пока процент не раскрывается, но со временем алгоритмы будут становиться лучше, плюс комбинацию из китруды и интисмерана сначала планируют использовать только в тяжелых случаях.
Пока что это только меланома, невероятно коварный вид рака: если быстро заметить и удалить, то шансы последствий минимальны, если же немного затянуть – то еще совсем недавно риск летального исхода был огромен. Новую комбинацию планируется использовать после удаления опухоли именно для таких случаев.
Далее интисмеран опробуют на других видах опухолей: легкое, мочевой пузырь, почка, поджелудочная и желудок. Отмечу, что универсальной вакциной он не станет, как и любое другое лекарство: рак включает в себя сотни видов опухолей, требующих индивидуального лечения. Но даже победа над несколькими видами спасет миллионы жизней.
—
Как выжимать из ИИ максимум – я рассказываю на “Бусти”. Там и собственная практика (в том числе совсем безумные эксперименты), и разборы опыта крутых специалистов, вроде создателя Claude Code Бориса Черни.
Самое время подписаться!
❤53👍28🔥16
Мои ИИ отупел – можно ли что-то сделать?
Жалоба, которую регулярно слышу сам и вижу в сети: использую ИИ уже не первый месяц, долго все было хорошо, но сейчас модель отупела. Давайте разбираться, где здесь мифы, а что реально стоит проверить.
“Отупение” на стороне разработчика
Такое бывает: Anthropic признала целую серию технических инцидентов, которые приводили к деградации качества разных моделей. Инфраструктура у крупных провайдеров разнородная, одна и та же модель может крутиться на разных типах серверов, что иногда и приводит к проблемам.
Увы, это никак не проверить и ничего не сделать. Поэтому переходим к практическим пунктам.
Ваши промпты устарели
Проблема, которую признали OpenAI и Anthropic: модели развиваются так быстро, что написанные год назад промпты могут не работать как надо – слишком много ограничений и инструкций “как делать”, которые сбивают свежие версии ИИ с толку. Это промпт-долг, который прячется не только в промптах, но и в скиллах и CLAUDE.md.
“Скорая помощь” простая: запустите диалог в режиме инкогнито и постарайтесь описать задачу максимально коротким промптом, в котором изложите только необходимое для выполнения.
Как правильно писать промпты и скиллы в 2026 году, а также бороться с промпт-долгом, я рассказывал в отдельном лонгриде.
Неправильный режим рассуждений
Почти все пользователи выкручивают режим рассуждений на максимум, думая, что модель автоматически поумнеет. Это не так: при простых задачах модель может тратить время на их повторное решение, в итоге выдавая худший результат. Команда Codex для большинства задач использует GPT-5.6 в режиме Medium – и это при неограниченных токенах!
Мой совет: ставьте Medium (GPT-5.6) / High (Claude) как базу, а более высокие включайте, когда недовольны результатом. Постепенно вы поймете, какой режим для какой задачи подходит.
Забитое контекстное окно
Контекст современных моделей доходит до миллиона токенов – влезет “Война и мир” с запасом. Но при каждом новом ответе модель перечитывает диалог целиком – и когда он наполняется неудачными попытками решения задачи, вопросами “в сторону”, то качество постепенно деградирует. Это context rot.
Если вы затянули диалог в чат-боте – дайте модели задачу сделать резюме, а затем начните с ним новый чат. У ИИ-агентов арсенал работы с контекстом намного шире – я в свое время разбирал его в большом тексте.
Откат на более слабую модель
У Claude Fable 5 (чаще) и Opus 5 (реже) на разговорах по темам вроде киберзащиты и биологии фильтры безопасности часто скидывают модель на Opus 4.8. Об этом сообщается небольшим поп-апом, но если увлечься работой, то можно пропустить. Я уже выучил, на каких запросах это происходит, и обычно сразу начинаю на Opus 5 (там фильтры срабатывают в исключительных случаях) – или вообще увожу запрос на GPT-5.6.
Забившаяся память ИИ
Обновляемая память на основе чатов – классная функция до момента, пока модель не затащит туда чего-нибудь лишнего. Решение простое: раз в несколько недель вручную перечитывайте, что ИИ помнит о вас, убирайте оттуда устаревшие пункты – и добавляйте новую информацию. Подробнее разбирал в тексте "Как правильно писать пользовательский промпт и управлять памятью ИИ о вас".
Не модель отупела – а ваша планка выросла
Работа с ИИ начинается с “медового месяца” – ого, какая крутая штука! Автоматизируем мы поначалу простые задачи, а любые ошибки ИИ списываем на то, что пока не научились с ним работать.
Проходит время, простые штуки ИИ щелкает уже незаметно для нас, а “отупение” проявляется в том, что с ним не получается решать реально серьезные задачи. Здесь пора задаться вопросом – а не застряли ли вы на определенной “ступени” работы ИИ. Возможно, имеет смысл сменить чат-бота на ИИ-агента? Или научиться дирижировать несколькими моделями под разные задачи?
Создатель Claude Code Борис Черни недавно описал “лестницу” освоения ИИ”, а я разобрал ее в огромном лонгриде:
"Лестница" создателя Claude Code: как прокачаться в использовании ИИ всего за один вечер
P.S. Кстати, мои лонгриды доступны не только на “Бусти”, но и на Sponsr – контент на площадках идентичен, выбирайте ту, которая удобнее.
Жалоба, которую регулярно слышу сам и вижу в сети: использую ИИ уже не первый месяц, долго все было хорошо, но сейчас модель отупела. Давайте разбираться, где здесь мифы, а что реально стоит проверить.
“Отупение” на стороне разработчика
Такое бывает: Anthropic признала целую серию технических инцидентов, которые приводили к деградации качества разных моделей. Инфраструктура у крупных провайдеров разнородная, одна и та же модель может крутиться на разных типах серверов, что иногда и приводит к проблемам.
Увы, это никак не проверить и ничего не сделать. Поэтому переходим к практическим пунктам.
Ваши промпты устарели
Проблема, которую признали OpenAI и Anthropic: модели развиваются так быстро, что написанные год назад промпты могут не работать как надо – слишком много ограничений и инструкций “как делать”, которые сбивают свежие версии ИИ с толку. Это промпт-долг, который прячется не только в промптах, но и в скиллах и CLAUDE.md.
“Скорая помощь” простая: запустите диалог в режиме инкогнито и постарайтесь описать задачу максимально коротким промптом, в котором изложите только необходимое для выполнения.
Как правильно писать промпты и скиллы в 2026 году, а также бороться с промпт-долгом, я рассказывал в отдельном лонгриде.
Неправильный режим рассуждений
Почти все пользователи выкручивают режим рассуждений на максимум, думая, что модель автоматически поумнеет. Это не так: при простых задачах модель может тратить время на их повторное решение, в итоге выдавая худший результат. Команда Codex для большинства задач использует GPT-5.6 в режиме Medium – и это при неограниченных токенах!
Мой совет: ставьте Medium (GPT-5.6) / High (Claude) как базу, а более высокие включайте, когда недовольны результатом. Постепенно вы поймете, какой режим для какой задачи подходит.
Забитое контекстное окно
Контекст современных моделей доходит до миллиона токенов – влезет “Война и мир” с запасом. Но при каждом новом ответе модель перечитывает диалог целиком – и когда он наполняется неудачными попытками решения задачи, вопросами “в сторону”, то качество постепенно деградирует. Это context rot.
Если вы затянули диалог в чат-боте – дайте модели задачу сделать резюме, а затем начните с ним новый чат. У ИИ-агентов арсенал работы с контекстом намного шире – я в свое время разбирал его в большом тексте.
Откат на более слабую модель
У Claude Fable 5 (чаще) и Opus 5 (реже) на разговорах по темам вроде киберзащиты и биологии фильтры безопасности часто скидывают модель на Opus 4.8. Об этом сообщается небольшим поп-апом, но если увлечься работой, то можно пропустить. Я уже выучил, на каких запросах это происходит, и обычно сразу начинаю на Opus 5 (там фильтры срабатывают в исключительных случаях) – или вообще увожу запрос на GPT-5.6.
Забившаяся память ИИ
Обновляемая память на основе чатов – классная функция до момента, пока модель не затащит туда чего-нибудь лишнего. Решение простое: раз в несколько недель вручную перечитывайте, что ИИ помнит о вас, убирайте оттуда устаревшие пункты – и добавляйте новую информацию. Подробнее разбирал в тексте "Как правильно писать пользовательский промпт и управлять памятью ИИ о вас".
Не модель отупела – а ваша планка выросла
Работа с ИИ начинается с “медового месяца” – ого, какая крутая штука! Автоматизируем мы поначалу простые задачи, а любые ошибки ИИ списываем на то, что пока не научились с ним работать.
Проходит время, простые штуки ИИ щелкает уже незаметно для нас, а “отупение” проявляется в том, что с ним не получается решать реально серьезные задачи. Здесь пора задаться вопросом – а не застряли ли вы на определенной “ступени” работы ИИ. Возможно, имеет смысл сменить чат-бота на ИИ-агента? Или научиться дирижировать несколькими моделями под разные задачи?
Создатель Claude Code Борис Черни недавно описал “лестницу” освоения ИИ”, а я разобрал ее в огромном лонгриде:
"Лестница" создателя Claude Code: как прокачаться в использовании ИИ всего за один вечер
P.S. Кстати, мои лонгриды доступны не только на “Бусти”, но и на Sponsr – контент на площадках идентичен, выбирайте ту, которая удобнее.
👍25❤17🔥15
Qwen3.8-27B – новая народная открытая модель
С релиза открытых весов Qwen3.8-27B прошла всего неделя, а сообщество понаделало с ней уже столько разных классных штук, что в один ТГ-пост не влезет. Напомню про саму модель: 27 миллиардов параметров можно утрамбовать в память одной RTX5090 или двух RTX3090, при этом Alibaba сравнивает модель с куда более серьезной Claude Sonnet 5.
Но справедливости ради, в ту же RTX5090 модель лезет впритык – места под длинные диалоги уже не остается. И купить такую могут лишь единицы – в массе у народа карточки попроще. Поэтому сообщество сразу занялось квантованием – сжатием модели за счет хранения весов с меньшей точностью.
Любой квант ухудшает параметры модели, но насколько – зависит от технологии. Сейчас один из топов – это линейка Unsloth. Они используют динамическое квантование: те части модели, которые переносят огрубление “спокойно”, квантуют более агрессивно, а те, которые от него ломаются – почти не трогают. Динамический квант жмет выборочно – как JPEG бережет лицо и не жалеет фон.
В Unsloth утверждают о преимуществе более 10% над другими технологиями квантования. При этом требования к памяти режутся очень мощно: например, экстремальная однобитная сборка держит 77% точности оригинальной модели (по замерам Unsloth), но требует всего 8 гигабайт памяти – можно запускать даже на ноутбуке без видеокарты.
Для моей RTX 3090 рекомендуют UD-Q4_K_XL, которая весит 17,92 ГБ – она не сильно теряет в точности, но оставляет много памяти под контекст. Примерный ориентир по нужному объему памяти для разных квантов дает картинка в начале поста.
За пять дней люди скачали 5,1 млн квантов Unsloth – достойное внимание.
А параллельно сообщество занималось доработкой весов до клубничного вкуса 🍓 Речь о расцензуренных сборках Qwen3.8 – тех, в которых модель не отвечает отказом даже на пограничные вопросы.
Я никогда не закапывался глубоко в то, как с открытых моделей снимают цензуру, а оказалось достаточно интересно. Ответ “не могу помочь” живет внутри модели как направление в ее представлениях. Оно вполне конкретно, а значит может быть удалено с помощью аблитерации – приема, когда направление находят и вырезают из весов.
Интересно, что гонка тут идет в две стороны сразу. Сообщество совершенствует аблитерацию – и даже создало автоматический инструмент расцензуривания Heretic. Инженеры крупных компаний придумывают все более хитрые способы спрятать направление отказа. И в случае с Qwen3.8 почти удалось – после прогона оригинального Heretic модель продолжала говорить “нет” в 97 из 100 случаев.
У модели есть такое понятие, как внимание – это когда каждое слово “смотрит” на все остальные. И есть линейное внимание – упрощенный и дешевый вариант. Alibaba в Qwen3.8 смешали оба вида внимания: 16 слоев дорогих и 48 слоев дешевых. На этом и сломался Heretic – он правил только дорогие слои.
Сразу несколько команд перебрали архитектуру модели, чтобы дотянуться до всех нужных слоев. И сделали это максимально быстро: веса вышли 14 августа, а версии без цензуры начали появляться 16-го.
Расцензура, кстати, не абсолютная: некоторые отказы вырезать не удалось, а некоторые команды оставили намеренно – речь о наиболее чувствительных вопросах. Но это лишь 3 случая на 100, что крохи.
Оригинальный Qwen3.8-27B Alibaba выпускала все-таки не для массового пользователя – нормально он пойдет на профессиональных GPU. Народной модель сделало само сообщество: выпустив кванты и расцензуренные версии. И это только начало – сообщество наверняка придумает что-то новое.
—
Несколько недель назад я выпустил лонгрид с ликбезом по открытым моделям – а сейчас доработал под Qwen3.8-27B. В тексте разобраны основные термины и харкатеристики, какое железо нужно и как запустить модель без больших усилий.
👉 Читаем здесь.
С релиза открытых весов Qwen3.8-27B прошла всего неделя, а сообщество понаделало с ней уже столько разных классных штук, что в один ТГ-пост не влезет. Напомню про саму модель: 27 миллиардов параметров можно утрамбовать в память одной RTX5090 или двух RTX3090, при этом Alibaba сравнивает модель с куда более серьезной Claude Sonnet 5.
Но справедливости ради, в ту же RTX5090 модель лезет впритык – места под длинные диалоги уже не остается. И купить такую могут лишь единицы – в массе у народа карточки попроще. Поэтому сообщество сразу занялось квантованием – сжатием модели за счет хранения весов с меньшей точностью.
Любой квант ухудшает параметры модели, но насколько – зависит от технологии. Сейчас один из топов – это линейка Unsloth. Они используют динамическое квантование: те части модели, которые переносят огрубление “спокойно”, квантуют более агрессивно, а те, которые от него ломаются – почти не трогают. Динамический квант жмет выборочно – как JPEG бережет лицо и не жалеет фон.
В Unsloth утверждают о преимуществе более 10% над другими технологиями квантования. При этом требования к памяти режутся очень мощно: например, экстремальная однобитная сборка держит 77% точности оригинальной модели (по замерам Unsloth), но требует всего 8 гигабайт памяти – можно запускать даже на ноутбуке без видеокарты.
Для моей RTX 3090 рекомендуют UD-Q4_K_XL, которая весит 17,92 ГБ – она не сильно теряет в точности, но оставляет много памяти под контекст. Примерный ориентир по нужному объему памяти для разных квантов дает картинка в начале поста.
За пять дней люди скачали 5,1 млн квантов Unsloth – достойное внимание.
А параллельно сообщество занималось доработкой весов до клубничного вкуса 🍓 Речь о расцензуренных сборках Qwen3.8 – тех, в которых модель не отвечает отказом даже на пограничные вопросы.
Я никогда не закапывался глубоко в то, как с открытых моделей снимают цензуру, а оказалось достаточно интересно. Ответ “не могу помочь” живет внутри модели как направление в ее представлениях. Оно вполне конкретно, а значит может быть удалено с помощью аблитерации – приема, когда направление находят и вырезают из весов.
Интересно, что гонка тут идет в две стороны сразу. Сообщество совершенствует аблитерацию – и даже создало автоматический инструмент расцензуривания Heretic. Инженеры крупных компаний придумывают все более хитрые способы спрятать направление отказа. И в случае с Qwen3.8 почти удалось – после прогона оригинального Heretic модель продолжала говорить “нет” в 97 из 100 случаев.
У модели есть такое понятие, как внимание – это когда каждое слово “смотрит” на все остальные. И есть линейное внимание – упрощенный и дешевый вариант. Alibaba в Qwen3.8 смешали оба вида внимания: 16 слоев дорогих и 48 слоев дешевых. На этом и сломался Heretic – он правил только дорогие слои.
Сразу несколько команд перебрали архитектуру модели, чтобы дотянуться до всех нужных слоев. И сделали это максимально быстро: веса вышли 14 августа, а версии без цензуры начали появляться 16-го.
Расцензура, кстати, не абсолютная: некоторые отказы вырезать не удалось, а некоторые команды оставили намеренно – речь о наиболее чувствительных вопросах. Но это лишь 3 случая на 100, что крохи.
Оригинальный Qwen3.8-27B Alibaba выпускала все-таки не для массового пользователя – нормально он пойдет на профессиональных GPU. Народной модель сделало само сообщество: выпустив кванты и расцензуренные версии. И это только начало – сообщество наверняка придумает что-то новое.
—
Несколько недель назад я выпустил лонгрид с ликбезом по открытым моделям – а сейчас доработал под Qwen3.8-27B. В тексте разобраны основные термины и харкатеристики, какое железо нужно и как запустить модель без больших усилий.
👉 Читаем здесь.
51❤55👍29🔥14👏13😁3
Андрей Карпати – персона в мире ИИ легендарная. Один из сооснователей OpenAI, бывший директор по ИИ в Tesla, а сейчас сотрудник направления Anthropic по рекурсивному улучшению ИИ.
А еще у Андрея есть супер-скилл: всего лишь одним коротким твитом в X он может изменить то, как работают с ИИ миллионы – так было, например, с вайб-кодингом.
Я решил изучить, а есть ли какая-то схема, по которой Андрей Карпати работает с ИИ. И в итоге написал лонгрид с неожиданным заголовком:
К черту правила: как работает с ИИ легендарный Андрей Карпати
(текст также доступен на Sponsr)
В чем главная фишка вайб-кодинга, как быстро передавать ИИ огромные объемы контекста, и как получать от него ответы, которые вы не будете читать по-диагонали – лишь некоторые приемы Карпати, которые я разобрал в тексте. А еще там есть подробное описание философии Андрея как экспериментатора: ею легко можно заразиться – но тем для вас и лучше!
Лонгрид про Карпати – четвертый в серии статей про то, как с ИИ работают легенды индустрии. Вот прошлые три, все они стали абсолютными хитами:
"Лестница" создателя Claude Code: как прокачаться в использовании ИИ всего за один вечер (+ версия на Sponsr)
Clean Code 2.0. Как использует ИИ автор самой популярной книги о программировании (+ версия на Sponsr)
Карта и территория: как управляет ИИ один из разработчиков Claude Code (+ версия на Sponsr)
P.S. Когда Карпати напишет следующий твит, который перевернет ИИ-индустрию – вы будете к нему готовы😏
А еще у Андрея есть супер-скилл: всего лишь одним коротким твитом в X он может изменить то, как работают с ИИ миллионы – так было, например, с вайб-кодингом.
Я решил изучить, а есть ли какая-то схема, по которой Андрей Карпати работает с ИИ. И в итоге написал лонгрид с неожиданным заголовком:
К черту правила: как работает с ИИ легендарный Андрей Карпати
(текст также доступен на Sponsr)
В чем главная фишка вайб-кодинга, как быстро передавать ИИ огромные объемы контекста, и как получать от него ответы, которые вы не будете читать по-диагонали – лишь некоторые приемы Карпати, которые я разобрал в тексте. А еще там есть подробное описание философии Андрея как экспериментатора: ею легко можно заразиться – но тем для вас и лучше!
Лонгрид про Карпати – четвертый в серии статей про то, как с ИИ работают легенды индустрии. Вот прошлые три, все они стали абсолютными хитами:
"Лестница" создателя Claude Code: как прокачаться в использовании ИИ всего за один вечер (+ версия на Sponsr)
Clean Code 2.0. Как использует ИИ автор самой популярной книги о программировании (+ версия на Sponsr)
Карта и территория: как управляет ИИ один из разработчиков Claude Code (+ версия на Sponsr)
P.S. Когда Карпати напишет следующий твит, который перевернет ИИ-индустрию – вы будете к нему готовы😏
❤36👍17👏8🔥6😁3
Филдсовский лауреат Теренс Тао, один из сильнейших живущих математиков, опубликовал доклад Mathematics in the Age of AI. Оригинал по ссылке выше, я же дал Opus 5 задачу пересказать главные тезисы и оформить HTML-страницей. Вот она:
Вот она, кстати
(У страницы два режима сложности под разных читателей, интерактив и даже размышления переводчика «на полях» — вот какойя молодец Opus молодец)
Интересного в докладе много, но вот что я выделил для себя. Доклад вроде бы про математику – а на деле про всю нашу жизнь во времена ИИ. То, с чем столкнулись Тао и коллеги, уже происходит в самых разных областях.
Примером Тао взял одну из составляющих работы математика – решение задач. Оно раскладывается на этапы:
Решить. Как ни странно, “решить как можно больше” – плохая цель: математиков и раньше заваливало неверными доказательствами знаменитых теорем, а теперь правдоподобное доказательство генерируется за вечер.
Проверить. Есть пруверы – Rocq, HOL, Lean – и автоформализация: перевод доказательств на их язык, все чаще силами ИИ. Но тут ловушка, о ней ниже.
Объяснить. Профессионал в одной области может не понимать тему коллеги из соседнего кабинета. Переложить результат на язык тысяч профессионалов – большая работа; для людей вне профессии – еще больше.
Добиться принятия. Медленный человеческий процесс, держащийся на труде рецензентов, которые скажут: “это действительно важно”.
Важное правило Тао:
Не можешь прочитать доклад по своему результату – не публикуешь.
Довести до канона. Связать с другими областями и внести в учебники – чтобы с этим работали следующие поколения.
Попробуйте применить эту “лестницу” к своей сфере – и у вас наверняка получится, пусть и с некоторыми изменениями. Тот же самый кризис проверки ИИ-результатов сейчас происходит почти во всех областях – я и сам не раз писал о том, как с этим столкнулся код.
Дальше – моя экстраполяция. Уже сейчас ИИ решает задачи, понятные нескольким сотням человек в мире. А что будет, когда он впервые выдаст решение, которое не поймёт вообще никто? Его проверят и подправят другие модели – человеку понятнее оно не станет.
А если в решении будет ошибка, которую все пропустят? Она попадет в канон, который выучат новые модели – и только усилят эту ошибку, построив на ней уже свои решения. В ИИ это называется model collapse – и проблема касается не только математики, но и любой области.
Тао честно признает, что у него нет готового решения описанных вещей – и это звучит как вызов обществу, что проблемы пора решать вместе. Полагаю, первые попытки решения мы видим прямо сейчас (затормозка разработки в OpenAI и Anthropic), а в следующие годы все станет еще интереснее.
И еще один момент, который выделю в тексте Тао. Он рассказывает о вещи, которой почти нет в машинных решениях, но которая встречается в почти всех человеческих. Это – “трение” в тексте. По доказательству, написанному человеком, сразу видно, где он нервничал, где “извиняется” за слишком сложную формулировку, а где абзац и вовсе несколько раз переписывался.
Это трение любой человек считывает моментально. И оно информативно, так как выделяет места, реально важные для автора – а значит, на них нужно обратить внимание и при чтении.
У машинного текста этого трения нет: модели одинаково хорошо пишут о важных и второстепенных вещах. И это опять выходит далеко за пределы математики. Причина ИИ-слопа не в том, что он сделан плохо, а в том, что в нем нет трения.
Первой моей мыслью, когда я это понял, было написать промпт, чтобы ИИ делал тексты с “трением” (кстати, в HTML Опуса так и сделано). Но возможно стоит поступить иначе: оставить трение людям, а в случае с ИИ-контентом… просто привыкнуть, что он иной.
—
Кстати, HTML-объяснение я сделал по “правилам Андрея Карпати”, одного из самых узнаваемых людей в ИИ-сообществе. Хотите делать такие же и научиться другим трюкам из аресанала Карпати – читайте мой лонгрид:
К черту правила: как работает с ИИ легендарный Андрей Карпати
Вот она, кстати
(У страницы два режима сложности под разных читателей, интерактив и даже размышления переводчика «на полях» — вот какой
Интересного в докладе много, но вот что я выделил для себя. Доклад вроде бы про математику – а на деле про всю нашу жизнь во времена ИИ. То, с чем столкнулись Тао и коллеги, уже происходит в самых разных областях.
Примером Тао взял одну из составляющих работы математика – решение задач. Оно раскладывается на этапы:
Решить. Как ни странно, “решить как можно больше” – плохая цель: математиков и раньше заваливало неверными доказательствами знаменитых теорем, а теперь правдоподобное доказательство генерируется за вечер.
Проверить. Есть пруверы – Rocq, HOL, Lean – и автоформализация: перевод доказательств на их язык, все чаще силами ИИ. Но тут ловушка, о ней ниже.
Объяснить. Профессионал в одной области может не понимать тему коллеги из соседнего кабинета. Переложить результат на язык тысяч профессионалов – большая работа; для людей вне профессии – еще больше.
Добиться принятия. Медленный человеческий процесс, держащийся на труде рецензентов, которые скажут: “это действительно важно”.
Важное правило Тао:
Не можешь прочитать доклад по своему результату – не публикуешь.
Довести до канона. Связать с другими областями и внести в учебники – чтобы с этим работали следующие поколения.
Попробуйте применить эту “лестницу” к своей сфере – и у вас наверняка получится, пусть и с некоторыми изменениями. Тот же самый кризис проверки ИИ-результатов сейчас происходит почти во всех областях – я и сам не раз писал о том, как с этим столкнулся код.
Дальше – моя экстраполяция. Уже сейчас ИИ решает задачи, понятные нескольким сотням человек в мире. А что будет, когда он впервые выдаст решение, которое не поймёт вообще никто? Его проверят и подправят другие модели – человеку понятнее оно не станет.
А если в решении будет ошибка, которую все пропустят? Она попадет в канон, который выучат новые модели – и только усилят эту ошибку, построив на ней уже свои решения. В ИИ это называется model collapse – и проблема касается не только математики, но и любой области.
Тао честно признает, что у него нет готового решения описанных вещей – и это звучит как вызов обществу, что проблемы пора решать вместе. Полагаю, первые попытки решения мы видим прямо сейчас (затормозка разработки в OpenAI и Anthropic), а в следующие годы все станет еще интереснее.
И еще один момент, который выделю в тексте Тао. Он рассказывает о вещи, которой почти нет в машинных решениях, но которая встречается в почти всех человеческих. Это – “трение” в тексте. По доказательству, написанному человеком, сразу видно, где он нервничал, где “извиняется” за слишком сложную формулировку, а где абзац и вовсе несколько раз переписывался.
Это трение любой человек считывает моментально. И оно информативно, так как выделяет места, реально важные для автора – а значит, на них нужно обратить внимание и при чтении.
У машинного текста этого трения нет: модели одинаково хорошо пишут о важных и второстепенных вещах. И это опять выходит далеко за пределы математики. Причина ИИ-слопа не в том, что он сделан плохо, а в том, что в нем нет трения.
Первой моей мыслью, когда я это понял, было написать промпт, чтобы ИИ делал тексты с “трением” (кстати, в HTML Опуса так и сделано). Но возможно стоит поступить иначе: оставить трение людям, а в случае с ИИ-контентом… просто привыкнуть, что он иной.
—
Кстати, HTML-объяснение я сделал по “правилам Андрея Карпати”, одного из самых узнаваемых людей в ИИ-сообществе. Хотите делать такие же и научиться другим трюкам из аресанала Карпати – читайте мой лонгрид:
К черту правила: как работает с ИИ легендарный Андрей Карпати
❤32👍15🔥10👏8
Добрался до свежего отчета Hugging Face о том, как обстоят дела у открытых моделей. Выделю главное:
1️⃣ Если в закрытом фронтире лидерство удерживают США, то лидерство в open source ушло Китаю. Почти каждый месяц 2026-го самая крупная открытая модель китайской лаборатории была больше любой американской, причем потолок гулял от 754 миллиардов до 2,78 триллиона параметров.
При этом триллион параметров перестал быть какой-то “героической” цифрой – такие модели выпустили Xiaomi, Ant Group и Meituan, которых год назад вообще не было в этой области. Забавно: тот же год назад я слышал, что американские санкции на железо выбьют почву из-под ног у китайских разработчиков – теперь же их лучшие модели (Kimi K3 и GLM-5.3) дышат в спину и доступны для скачивания любому.
2️⃣ Лайки ≠ скачивания. В Hugging Face признают, что раньше и сами попадались на эту ловушку. В компании сравнили топ-25 моделей по скачиваниям за год и топ-25 по лайкам – общая оказалась только одна.
Объяснение удивительно простое. Лайк – “важный релиз”, больше всего их достается топовым моделям, которые не запустить на домашнем железе. Скачивают же рабочие лошадки, модели, которые у многих годами встроены в бизнес-процессы.
Пример разрыва: самая скачиваемая модель хаба – крошечный эмбеддер all-MiniLM-L6-v2 из 2021 года. 80 мегабайт, веса ни разу не переобучались – 1,55 миллиарда скачиваний за семь месяцев при пяти тысячах лайков. Хайп хайпом, а поиск по документам в проде крутится на модели эпохи “до ChatGPT”.
3️⃣ Еще одно интересное сравнение. У Moonshot (линейка Kimi) 37 млн скачиваний за год, у Alibaba (Qwen) – 2 миллиарда. Причина – разные подходы к бизнесу. Kimi – это только большие модели, подпирающие США в бенчмарках. Мало кто может позволить себе скачать и запустить такую (вернее, мог – расскажу через пару абзацев), поэтому для Moonshot это больше реклама подписок и API-доступа.
А вот Qwen покрывает огромный диапазон размеров: от суб-1B до 2,4T – заявка стать семейством, стандартным для разных разработчиков.
4️⃣ И эта ставка работает: Qwen сейчас – действительно народная модель. У линейки сейчас 151 448 деривативов – то есть разных версий от сообщества. Второе место удерживает Google – 82 506 деривативов.
Деривативы – это файнтюны под свои задачи, кванты под слабое железо и мерджи из нескольких моделей. Каждый день добавляется 180-210 репозиториев Qwen – причем почти все создаются сообществом.
5️⃣ Отдельная история llama.cpp – движок, который научили запускать гигантские модели на домашнем железе. Идея проста: почти все китайские модели строятся на MoE-архитектуре, когда на запрос отвечает “эксперт” – отвечает “эксперт” – малая доля параметров с нужными знаниями. Считать ее дешево, поэтому проблемой остается остается хранение весов – их в любом случае все нужно держать в памяти.
В llama.cpp придумали размазывать веса между компьютерами нескольких пользователей в одной локальной сети – фактически получается что-то вроде “распределенной модели”, когда у тебя в ноутбуке хранится лишь ее часть, а остальные части ты получаешь от коллеги за соседним столом. Технология любопытная и потенциально крутая для небольших команд – постараюсь копнуть ее глубже.
6️⃣ Главный пользователь Hugging Face – это больше не вы, а ваш ИИ-агент. В компании впервые разделили трафик людей и ИИ и сразу пришли к выводу – агенты уже впереди. Впрочем, процентного соотношения не дали.
Поначалу звучит сенсационно, но у меня самого парадигма сменилась еще в начале года: скачать и настроить сложный софт я давно поручаю агенту.
7️⃣ Есть и тревожная история, которую оставил для финала. В отчете отмечают, что самые большие модели, Kimi K3 (2,8T) и Qwen 3.8 (2,4T), впервые стали добавлять в лицензии некоммерческие ограничения и revenue share – долю с выручки для крупных пользователей.
Похоже, халява заканчивается: внимание собрано, начинается монетизация. Посмотрим, что покажет следующий отчет – он выйдет зимой.
—
Как разбираться в открытых моделях, выбрать подходящую под свое железо и запустить за вечер – я рассказывал в отдельном лонгриде:
👉 Читаем здесь
1️⃣ Если в закрытом фронтире лидерство удерживают США, то лидерство в open source ушло Китаю. Почти каждый месяц 2026-го самая крупная открытая модель китайской лаборатории была больше любой американской, причем потолок гулял от 754 миллиардов до 2,78 триллиона параметров.
При этом триллион параметров перестал быть какой-то “героической” цифрой – такие модели выпустили Xiaomi, Ant Group и Meituan, которых год назад вообще не было в этой области. Забавно: тот же год назад я слышал, что американские санкции на железо выбьют почву из-под ног у китайских разработчиков – теперь же их лучшие модели (Kimi K3 и GLM-5.3) дышат в спину и доступны для скачивания любому.
2️⃣ Лайки ≠ скачивания. В Hugging Face признают, что раньше и сами попадались на эту ловушку. В компании сравнили топ-25 моделей по скачиваниям за год и топ-25 по лайкам – общая оказалась только одна.
Объяснение удивительно простое. Лайк – “важный релиз”, больше всего их достается топовым моделям, которые не запустить на домашнем железе. Скачивают же рабочие лошадки, модели, которые у многих годами встроены в бизнес-процессы.
Пример разрыва: самая скачиваемая модель хаба – крошечный эмбеддер all-MiniLM-L6-v2 из 2021 года. 80 мегабайт, веса ни разу не переобучались – 1,55 миллиарда скачиваний за семь месяцев при пяти тысячах лайков. Хайп хайпом, а поиск по документам в проде крутится на модели эпохи “до ChatGPT”.
3️⃣ Еще одно интересное сравнение. У Moonshot (линейка Kimi) 37 млн скачиваний за год, у Alibaba (Qwen) – 2 миллиарда. Причина – разные подходы к бизнесу. Kimi – это только большие модели, подпирающие США в бенчмарках. Мало кто может позволить себе скачать и запустить такую (вернее, мог – расскажу через пару абзацев), поэтому для Moonshot это больше реклама подписок и API-доступа.
А вот Qwen покрывает огромный диапазон размеров: от суб-1B до 2,4T – заявка стать семейством, стандартным для разных разработчиков.
4️⃣ И эта ставка работает: Qwen сейчас – действительно народная модель. У линейки сейчас 151 448 деривативов – то есть разных версий от сообщества. Второе место удерживает Google – 82 506 деривативов.
Деривативы – это файнтюны под свои задачи, кванты под слабое железо и мерджи из нескольких моделей. Каждый день добавляется 180-210 репозиториев Qwen – причем почти все создаются сообществом.
5️⃣ Отдельная история llama.cpp – движок, который научили запускать гигантские модели на домашнем железе. Идея проста: почти все китайские модели строятся на MoE-архитектуре, когда на запрос отвечает “эксперт” – отвечает “эксперт” – малая доля параметров с нужными знаниями. Считать ее дешево, поэтому проблемой остается остается хранение весов – их в любом случае все нужно держать в памяти.
В llama.cpp придумали размазывать веса между компьютерами нескольких пользователей в одной локальной сети – фактически получается что-то вроде “распределенной модели”, когда у тебя в ноутбуке хранится лишь ее часть, а остальные части ты получаешь от коллеги за соседним столом. Технология любопытная и потенциально крутая для небольших команд – постараюсь копнуть ее глубже.
6️⃣ Главный пользователь Hugging Face – это больше не вы, а ваш ИИ-агент. В компании впервые разделили трафик людей и ИИ и сразу пришли к выводу – агенты уже впереди. Впрочем, процентного соотношения не дали.
Поначалу звучит сенсационно, но у меня самого парадигма сменилась еще в начале года: скачать и настроить сложный софт я давно поручаю агенту.
7️⃣ Есть и тревожная история, которую оставил для финала. В отчете отмечают, что самые большие модели, Kimi K3 (2,8T) и Qwen 3.8 (2,4T), впервые стали добавлять в лицензии некоммерческие ограничения и revenue share – долю с выручки для крупных пользователей.
Похоже, халява заканчивается: внимание собрано, начинается монетизация. Посмотрим, что покажет следующий отчет – он выйдет зимой.
—
Как разбираться в открытых моделях, выбрать подходящую под свое железо и запустить за вечер – я рассказывал в отдельном лонгриде:
👉 Читаем здесь
3❤33👍24🔥9👏6
ИИ опроверг одну математическую гипотезу, дважды побил рекорд и замахнулся на проблему, стоявшую с 1947 года – все это за считанные дни
Понедельник 24 августа 2026 года выглядит примерно так:
– Математик Anthropic Левент Альпёге в соавторстве с Авой Хауэлл, предположительно используя новую версию Claude Fable, поднял рекорд ранга эллиптических кривых до 30. Таблицу рекордов ведут с 1938 года, последнее улучшение до 29 заняло у ученых 18 лет.
Впечатляющий результат, но Альпёге этого видимо показалось мало, поэтому уже через три дня команда предъявила новую кривую с рангом не ниже 31. Влиятельная эвристика 2019 года предсказывает: ранги ограничены, рекорды однажды закончатся. Каждая новая кривая – удар по ней.
– Даниэль Кресснер и Барт Вандерейкен с помощью GPT-5.6 опровергли гипотезу о симметричном максимайзере (операторы Ляпунова). Модель сама спроектировала поиск – вплоть до выбора оптимизатора и настроек. Люди перепроверили находку точной арифметикой и достроили доказательство для всех размерностей от 7. Гипотеза небольшая, но к ней мы еще вернемся.
– Ну и главная история. 19 августа Саймон Брендл и Пей-Кен Хунг опровергли первую гипотезу Хопфа (1930-е), построив на S²×S² метрику положительной кривизны, которой по гипотезе быть не должно. Сделано людьми, без ИИ.
В ответ Альпёге признался в X: он с Claude готовил собственную конструкцию, но не успел – и добавил, что для него честь "быть размазанным" Брендлом.
Впрочем, уже в ночь на понедельник Альпёге заявил решение второй гипотезы Хопфа (1947): шестимерная сфера S⁶ допускает комплексную структуру. На этой задаче сломались гиганты: Черн анонсировал ответ “нет” в 93 года и умер, не завершив доказательство; “нет” Атьи от 2016-го сообщество не приняло. Теперь на столе “да” размером в 100+ страниц.
Самое важное: перед нами заявка, а не решение. У рекордов рангов, гипотезы Ляпунова и большинства прошлых ИИ-открытий (вплоть до якобиана) проверка простая – специалист справится за минуты.
С проблемой 1947 года иначе: проверка сложная, и Альпёге сам попросил сообщество о независимой экспертизе. Если кому-то интересно, то я разобрал его решение с помощью GPT-5.6 Pro, вердикт модели: это “очень содержательная заявленная конструкция, заслуживающая серьёзной проверки”, но пока не “установленная теорема”.
Финальное слово скажут математики – несколько серьезных специалистов уже вызвались. А пока несколько моих наблюдений:
Начинает происходить то, о чем писал Теренс Тао – скорость решения ИИ в некоторых случаях упирается в скорость проверки. Где можно справиться за минуты, темпы взрывные, где проверка долгая – ИИ может даже создавать проблемы, перегружая проверяющих работой.
Сообщество при этом критикует Альпёге за две вещи. Во-первых, он работает на закрытой версии Claude, недоступной остальным, – уже звучит слово "допинг". Во-вторых, манера: серьезные результаты анонсируются парой твитов, без промптов и цепочек рассуждений. Даже по якобиану свой препринт Альпёге так и не выпустил – оформляли уже другие.
Спешку понять можно: модели Anthropic и OpenAI примерно равны, не опубликуешь сегодня – завтра опубликуют конкуренты. Но можно понять и сообщество, привыкшее работать над проблемой десятилетиями.
Наконец, я не зря выделил гипотезу Ляпунова: пусть она и существует с 1987 года, но это “небольшая” проблема, над которой работали несколько групп. Таких гипотез тысячи, именно из них во многом соткана повседневная математика – и на них катастрофически не хватало ресурсов. Возможно, отдельную пользу ИИ мы увидим именно здесь.
Традиционно я заканчиваю пост советом переложить эти прорывы на повседневную практику. Задумайтесь – вдруг у вас есть какие-то проблемы и задачи, “небольшой” важно, на которые катастрофически не хватало времени? Возможно, стоит выбрать 1-2 и попробовать решить с помощью ИИ-агента.
—
Как выжимать максимум из ИИ, я рассказываю на “Бусти”. Там про то, как правильно писать промпты, избавляться от промт-долга, строить ИИ-агентов и управлять нейронками не хуже, чем это делают создатели Claude Code.
Самое время подписаться!
Понедельник 24 августа 2026 года выглядит примерно так:
– Математик Anthropic Левент Альпёге в соавторстве с Авой Хауэлл, предположительно используя новую версию Claude Fable, поднял рекорд ранга эллиптических кривых до 30. Таблицу рекордов ведут с 1938 года, последнее улучшение до 29 заняло у ученых 18 лет.
Впечатляющий результат, но Альпёге этого видимо показалось мало, поэтому уже через три дня команда предъявила новую кривую с рангом не ниже 31. Влиятельная эвристика 2019 года предсказывает: ранги ограничены, рекорды однажды закончатся. Каждая новая кривая – удар по ней.
– Даниэль Кресснер и Барт Вандерейкен с помощью GPT-5.6 опровергли гипотезу о симметричном максимайзере (операторы Ляпунова). Модель сама спроектировала поиск – вплоть до выбора оптимизатора и настроек. Люди перепроверили находку точной арифметикой и достроили доказательство для всех размерностей от 7. Гипотеза небольшая, но к ней мы еще вернемся.
– Ну и главная история. 19 августа Саймон Брендл и Пей-Кен Хунг опровергли первую гипотезу Хопфа (1930-е), построив на S²×S² метрику положительной кривизны, которой по гипотезе быть не должно. Сделано людьми, без ИИ.
В ответ Альпёге признался в X: он с Claude готовил собственную конструкцию, но не успел – и добавил, что для него честь "быть размазанным" Брендлом.
Впрочем, уже в ночь на понедельник Альпёге заявил решение второй гипотезы Хопфа (1947): шестимерная сфера S⁶ допускает комплексную структуру. На этой задаче сломались гиганты: Черн анонсировал ответ “нет” в 93 года и умер, не завершив доказательство; “нет” Атьи от 2016-го сообщество не приняло. Теперь на столе “да” размером в 100+ страниц.
Самое важное: перед нами заявка, а не решение. У рекордов рангов, гипотезы Ляпунова и большинства прошлых ИИ-открытий (вплоть до якобиана) проверка простая – специалист справится за минуты.
С проблемой 1947 года иначе: проверка сложная, и Альпёге сам попросил сообщество о независимой экспертизе. Если кому-то интересно, то я разобрал его решение с помощью GPT-5.6 Pro, вердикт модели: это “очень содержательная заявленная конструкция, заслуживающая серьёзной проверки”, но пока не “установленная теорема”.
Финальное слово скажут математики – несколько серьезных специалистов уже вызвались. А пока несколько моих наблюдений:
Начинает происходить то, о чем писал Теренс Тао – скорость решения ИИ в некоторых случаях упирается в скорость проверки. Где можно справиться за минуты, темпы взрывные, где проверка долгая – ИИ может даже создавать проблемы, перегружая проверяющих работой.
Сообщество при этом критикует Альпёге за две вещи. Во-первых, он работает на закрытой версии Claude, недоступной остальным, – уже звучит слово "допинг". Во-вторых, манера: серьезные результаты анонсируются парой твитов, без промптов и цепочек рассуждений. Даже по якобиану свой препринт Альпёге так и не выпустил – оформляли уже другие.
Спешку понять можно: модели Anthropic и OpenAI примерно равны, не опубликуешь сегодня – завтра опубликуют конкуренты. Но можно понять и сообщество, привыкшее работать над проблемой десятилетиями.
Наконец, я не зря выделил гипотезу Ляпунова: пусть она и существует с 1987 года, но это “небольшая” проблема, над которой работали несколько групп. Таких гипотез тысячи, именно из них во многом соткана повседневная математика – и на них катастрофически не хватало ресурсов. Возможно, отдельную пользу ИИ мы увидим именно здесь.
Традиционно я заканчиваю пост советом переложить эти прорывы на повседневную практику. Задумайтесь – вдруг у вас есть какие-то проблемы и задачи, “небольшой” важно, на которые катастрофически не хватало времени? Возможно, стоит выбрать 1-2 и попробовать решить с помощью ИИ-агента.
—
Как выжимать максимум из ИИ, я рассказываю на “Бусти”. Там про то, как правильно писать промпты, избавляться от промт-долга, строить ИИ-агентов и управлять нейронками не хуже, чем это делают создатели Claude Code.
Самое время подписаться!
❤26🔥15👍12
Сегодня освежил все свои гайды по промптингу, убрал устаревшие приемы, добавил ставшее актуальным на конец лета 2026 года. Окинул еще раз взглядом проделанное и понял, что получился мини-курс, полезный и для новичков, и для тех, кто уже давно работает с ИИ.
В общем, если хотите прокачаться в управлении нейронками, то советую читать в следующем порядке.
1️⃣ Системный промпт на примере Claude Fable 5: что это такое и какие приемы промптинга можно перенять у инженеров Anthropic
2️⃣ Как правильно писать пользовательский промпт и управлять памятью ИИ о вас
Это два очень важных текста. Первый поясняет, что происходит с моделью до того, как она начинает писать вам ответ. Второй рассказывает, что можно класть в пользовательский промпт, а что не стоит, и учит управлять памятью ИИ о пользователе.
‼️80% инструкций – в мусор! Как теперь пишут промпты в OpenAI и Anthropic
Я специально выделил этот текст: он рассказывает про промпт-долг, то есть копящиеся ошибки в промптах, скиллах и прочих инструкциях. Если вы много работали с ИИ, накопили промпты, скиллы, файлы вроде CLAUDE.md – то читайте его прямо здесь, третьим по счету. Если нет – прочтите самым последним.
3️⃣ Карта и территория: как управляет ИИ один из создателей Claude Code
Методика Тарика Шихипара из Anthropic поможет провести подготовительную работу перед написанием промпта: выяснить, понимаете ли вы задачу, найти и закрыть “слепые зоны" и собрать весь нужный контекст, который затем пригодится модели в работе.
4️⃣ Промпты в 2026 году: что работает, что нет и зачем вообще стараться
5️⃣ Как заставить ИИ думать глубже: 8 техник сильного промптинга
6️⃣ Ваш ИИ "халтурит": 6 техник, чтобы выжать из ChatGPT и Claude максимум
Три опорных текста про промптинг: в них изложены базовые структуры промпта, а также честно рассказано, как выжать из модели максимум – причем речь не о мифических заклинаниях типа “перейди в супер-режим”, а о проверенных десятилетиями приемах из менеджмента и разработки софта, которые хорошо работают и с ИИ.
7️⃣ Как писать промпты для GPT Images 2, Nano Banana 2 и других графических ИИ
Для тех, кто работает с графическими моделями, я в одном месте собрал все термины и приемы, которыми пользуются профессиональные художники и фотографы при построении композиции – ИИ их тоже отлично понимают.
8️⃣ "Лестница" создателя Claude Code: как прокачаться в использовании ИИ всего за один вечер
Бонус-текст – он уже не про промпты, а про диагностику, на каком уровне освоения ИИ вы находитесь и как продвинуться дальше. В основу положена таблица знаменитого Бориса Черни из Anthropic, который долгое время наблюдал, как ИИ осваивают в больших компаниях. Всего Борис выделяет пять ступеней, а хорошая в том, что часто достаточно лишь вечера, чтобы начать подниматься на следующую.
Всего у меня уже 25+ огромных лонгридов – каждый на 20-30 минут полезного чтения. Все тексты доступны на двух площадках, выбирайте любую:
– Читать на “Бусти”
– Читать на Sponsr
В общем, если хотите прокачаться в управлении нейронками, то советую читать в следующем порядке.
1️⃣ Системный промпт на примере Claude Fable 5: что это такое и какие приемы промптинга можно перенять у инженеров Anthropic
2️⃣ Как правильно писать пользовательский промпт и управлять памятью ИИ о вас
Это два очень важных текста. Первый поясняет, что происходит с моделью до того, как она начинает писать вам ответ. Второй рассказывает, что можно класть в пользовательский промпт, а что не стоит, и учит управлять памятью ИИ о пользователе.
‼️80% инструкций – в мусор! Как теперь пишут промпты в OpenAI и Anthropic
Я специально выделил этот текст: он рассказывает про промпт-долг, то есть копящиеся ошибки в промптах, скиллах и прочих инструкциях. Если вы много работали с ИИ, накопили промпты, скиллы, файлы вроде CLAUDE.md – то читайте его прямо здесь, третьим по счету. Если нет – прочтите самым последним.
3️⃣ Карта и территория: как управляет ИИ один из создателей Claude Code
Методика Тарика Шихипара из Anthropic поможет провести подготовительную работу перед написанием промпта: выяснить, понимаете ли вы задачу, найти и закрыть “слепые зоны" и собрать весь нужный контекст, который затем пригодится модели в работе.
4️⃣ Промпты в 2026 году: что работает, что нет и зачем вообще стараться
5️⃣ Как заставить ИИ думать глубже: 8 техник сильного промптинга
6️⃣ Ваш ИИ "халтурит": 6 техник, чтобы выжать из ChatGPT и Claude максимум
Три опорных текста про промптинг: в них изложены базовые структуры промпта, а также честно рассказано, как выжать из модели максимум – причем речь не о мифических заклинаниях типа “перейди в супер-режим”, а о проверенных десятилетиями приемах из менеджмента и разработки софта, которые хорошо работают и с ИИ.
7️⃣ Как писать промпты для GPT Images 2, Nano Banana 2 и других графических ИИ
Для тех, кто работает с графическими моделями, я в одном месте собрал все термины и приемы, которыми пользуются профессиональные художники и фотографы при построении композиции – ИИ их тоже отлично понимают.
8️⃣ "Лестница" создателя Claude Code: как прокачаться в использовании ИИ всего за один вечер
Бонус-текст – он уже не про промпты, а про диагностику, на каком уровне освоения ИИ вы находитесь и как продвинуться дальше. В основу положена таблица знаменитого Бориса Черни из Anthropic, который долгое время наблюдал, как ИИ осваивают в больших компаниях. Всего Борис выделяет пять ступеней, а хорошая в том, что часто достаточно лишь вечера, чтобы начать подниматься на следующую.
Всего у меня уже 25+ огромных лонгридов – каждый на 20-30 минут полезного чтения. Все тексты доступны на двух площадках, выбирайте любую:
– Читать на “Бусти”
– Читать на Sponsr
2🔥17❤10👍8
Что там по новым моделям?
Неделя обещает слухи о новых моделях — а может, и релизы. Поехали:
Ox Alpha. Загадочная модель начала тестироваться 20 августа на OpenRouter и в OpenCode, поддерживает 1М токенов контекста, принимает на вход изображения и видео. Сообщество сразу же разогнало хайп вокруг модели – якобы в “любительских бенчмарках” она обходит Claude Fable.
Что это за модель? У каждой лаборатории свой „почерк“ — паттерны, переживающие смену версий; у Ox Alpha он указывает на Z.ai и линейку GLM: ранняя GLM-5.5 или быстрая GLM-5.3 Flash.
Но как GLM-5.3 Flash может быть лучше Claude Fable 5? Да никак. Сообщество тестирует красивым визуалом — от „SVG-пеликана на велосипеде“ до 3D-сцен в Three.js. Модели под такие промпты отлично оптимизируются. А "любительский бенчмарк" на 10 задачах DeepSWE (80% против 65% у Fable 5) — статистически ничто: в полном бенчмарке их 113.
Забавный факт: судя по всему, уже после запуска на OpenRouter и в OpenCode, разработчики обновили чекпоинт модели. Ее ответы стали заметно лучше, в результате в X сейчас всерьез обсуждают, что перед нами первая самообучающая модель. Было бы классно, но вероятность такого я оцениваю в 0,01%.
Бесплатный доступ до 27 августа; примерно тогда же Z.ai обещала открыть веса GLM-5.3, задержанные из-за кибер-способностей. Совпадение?
claude-marshmallow-eap и claude-melon-eap. Идентификаторы двух новых моделей Anthropic проскочили в API, и несколько тестеров уже делятся ощущениями: "лучше Opus 5, но хуже Fable 5".
Бенчмарк по ощущениям – это еще круче, чем 10 задач из DeepSWE. Я много работаю с Fable 5 и Opus 5, и могу сказать, что в большинстве повседневных задач разница между моделями настолько близки, что не заметишь разницу. Да и в бенчмарках зазор маленький. Opus 5 стараниями пары западных блогеров невзлюбило сообщество, так что “лучше Opus 5” – скорее укол в эту сторону.
По срокам Anthropic как раз пора выпускать что-то вроде Fable 5.1 – Mythos 5, на которой основывается текущая версия, появился еще полгода назад, так что модель пусть и мощная, но уже на излете жизненного срока. Более того, практически 100% известно, что внутри компании уже есть новая мощная модель – именно с ее помощью Левент Альпёге совершил последние математические открытия.
Но после скандалов с побегами агентов Anthropic может придержать самую сильную и выпустить сначала Sonnet 5.1 и Opus 5.1.
По срокам пока ничего не скажу, предыдущие случаи не показательны. Fruitcake “превратился” в Fable 5 через 2-3 дня, а вот Honeycomb стал Opus 5 только через 2 недели.
Grok 4.7. Я в последние два месяца внимательно слежу за нейронками SpaceXAI – после того, как компания приобрела Cursor и стала использовать их обучающие данные, Grok вплотную нагнал GPT и Fable. По словам Илона Маска, Grok 4.7 вырастет в размере – с 1,5T до 2,1T параметров. Но модель скорее ждем в начале сентября: SpaceXAI сейчас выпускает новые версии каждый месяц с небольшим, а Grok 4.6 был 12 августа.
OpenAI Astra. После взлома ИИ-агентом ресурса Hugging Face, компания приостанавливала обучение новых моделей, но недавно возобновила прогоны и тесты с более жестокими ограничениями безопасности.
Отвечать на новые модели Anthropic надо, но сейчас OpenAI под лупой: вчера генпрокурор Алабамы вручил ей повестку по делу о взломе — расследование ведут 15 штатов.
Google. Компания свернула разработку Gemini 3.5 Pro после провальных бенчмарков и сейчас тренирует Gemini 4. Вряд ли получится быстро, так что основная рабочая лошадка Google – недавно вышедшая Gemini 3.7 Flash.
Не люблю заканчивать посты без красивого вывода, но какой тут вывод – дайте мне скорее Claude Fable 5.1 и я пойду решать все научные задачи с ней!
—
Кстати, улучшить ответы ИИ можно не дожидаясь новых моделей. Достаточно избавиться от промптового долга – противоречащих и устаревших инструкций в промптах, скиллах и файлах с инструкциями. Бороться с промпт-долгом советуют в OpenAI и Anthropic, в лонгриде я подробно рассказал, как это делать:
– Читать здесь.
Неделя обещает слухи о новых моделях — а может, и релизы. Поехали:
Ox Alpha. Загадочная модель начала тестироваться 20 августа на OpenRouter и в OpenCode, поддерживает 1М токенов контекста, принимает на вход изображения и видео. Сообщество сразу же разогнало хайп вокруг модели – якобы в “любительских бенчмарках” она обходит Claude Fable.
Что это за модель? У каждой лаборатории свой „почерк“ — паттерны, переживающие смену версий; у Ox Alpha он указывает на Z.ai и линейку GLM: ранняя GLM-5.5 или быстрая GLM-5.3 Flash.
Но как GLM-5.3 Flash может быть лучше Claude Fable 5? Да никак. Сообщество тестирует красивым визуалом — от „SVG-пеликана на велосипеде“ до 3D-сцен в Three.js. Модели под такие промпты отлично оптимизируются. А "любительский бенчмарк" на 10 задачах DeepSWE (80% против 65% у Fable 5) — статистически ничто: в полном бенчмарке их 113.
Забавный факт: судя по всему, уже после запуска на OpenRouter и в OpenCode, разработчики обновили чекпоинт модели. Ее ответы стали заметно лучше, в результате в X сейчас всерьез обсуждают, что перед нами первая самообучающая модель. Было бы классно, но вероятность такого я оцениваю в 0,01%.
Бесплатный доступ до 27 августа; примерно тогда же Z.ai обещала открыть веса GLM-5.3, задержанные из-за кибер-способностей. Совпадение?
claude-marshmallow-eap и claude-melon-eap. Идентификаторы двух новых моделей Anthropic проскочили в API, и несколько тестеров уже делятся ощущениями: "лучше Opus 5, но хуже Fable 5".
Бенчмарк по ощущениям – это еще круче, чем 10 задач из DeepSWE. Я много работаю с Fable 5 и Opus 5, и могу сказать, что в большинстве повседневных задач разница между моделями настолько близки, что не заметишь разницу. Да и в бенчмарках зазор маленький. Opus 5 стараниями пары западных блогеров невзлюбило сообщество, так что “лучше Opus 5” – скорее укол в эту сторону.
По срокам Anthropic как раз пора выпускать что-то вроде Fable 5.1 – Mythos 5, на которой основывается текущая версия, появился еще полгода назад, так что модель пусть и мощная, но уже на излете жизненного срока. Более того, практически 100% известно, что внутри компании уже есть новая мощная модель – именно с ее помощью Левент Альпёге совершил последние математические открытия.
Но после скандалов с побегами агентов Anthropic может придержать самую сильную и выпустить сначала Sonnet 5.1 и Opus 5.1.
По срокам пока ничего не скажу, предыдущие случаи не показательны. Fruitcake “превратился” в Fable 5 через 2-3 дня, а вот Honeycomb стал Opus 5 только через 2 недели.
Grok 4.7. Я в последние два месяца внимательно слежу за нейронками SpaceXAI – после того, как компания приобрела Cursor и стала использовать их обучающие данные, Grok вплотную нагнал GPT и Fable. По словам Илона Маска, Grok 4.7 вырастет в размере – с 1,5T до 2,1T параметров. Но модель скорее ждем в начале сентября: SpaceXAI сейчас выпускает новые версии каждый месяц с небольшим, а Grok 4.6 был 12 августа.
OpenAI Astra. После взлома ИИ-агентом ресурса Hugging Face, компания приостанавливала обучение новых моделей, но недавно возобновила прогоны и тесты с более жестокими ограничениями безопасности.
Отвечать на новые модели Anthropic надо, но сейчас OpenAI под лупой: вчера генпрокурор Алабамы вручил ей повестку по делу о взломе — расследование ведут 15 штатов.
Google. Компания свернула разработку Gemini 3.5 Pro после провальных бенчмарков и сейчас тренирует Gemini 4. Вряд ли получится быстро, так что основная рабочая лошадка Google – недавно вышедшая Gemini 3.7 Flash.
Не люблю заканчивать посты без красивого вывода, но какой тут вывод – дайте мне скорее Claude Fable 5.1 и я пойду решать все научные задачи с ней!
—
Кстати, улучшить ответы ИИ можно не дожидаясь новых моделей. Достаточно избавиться от промптового долга – противоречащих и устаревших инструкций в промптах, скиллах и файлах с инструкциями. Бороться с промпт-долгом советуют в OpenAI и Anthropic, в лонгриде я подробно рассказал, как это делать:
– Читать здесь.
3🔥22❤16👍16
У главы Codex есть Большая Красная Кнопка. Он нажимает ее – и делает пользователям хорошо
Тибо Сотьо, руководитель Codex в OpenAI, дал интервью Мэттью Берману: про будущее агентов, разные подходы в работе с ИИ и Большую Красную Кнопку.
Почему Google уступила OpenAI
Тибо пришел в OpenAI из Google, где занимался инфраструктурой и ускорением исследований. По его словам, в какой-то момент внутренние модели компании стали настолько хороши, что появилась идея LM Chat – интерфейса для общения с ИИ. Впервые модель давала связный текст и могла быть полезной для пользователя.
Но когда речь зашла о широком запуске, то топ-менеджмент занервничал и не дал проекту зеленый свет – боялись, что он затронет основной бизнес Google.
Год спустя OpenAI выпустила ChatGPT и перевернула ИИ-индустрию…
Ваш Codex устареет уже через несколько месяцев
Главный урок, который Тибо унес из Google – не бояться каннибализировать себя. Схемы не вечны – лучше убить свою самому, чем ждать конкурента.
За это Тибо хвалит OpenAI: умение перебрасывать ресурсы с основного бизнеса на перспективное новое – даже если это ударит по старому. Долгое время ChatGPT был основным ИИ-интерфейсом, количество пользователей подбиралось к 1 млрд – но встало. Однако когда появилась идея объединить ChatGPT с Codex в одно суперприложение, то многие задались вопросом – а это реально стоит делать? В компании рискнули: и сейчас Codex растет огромными темпами, достигнув 20 млн пользователей.
При этом Тибо утверждает – через несколько месяцев текущая версия Codex будет выглядеть полностью устаревшей. Сейчас в приложении много “костылей”: скиллы, которые надо поддерживать, память, которая помнит не все, субагенты, которыми приходится рулить как маленькой сетью. Это постепенно уйдет, а новая версия превратится в “маленького партнера”, который знает тебя и твою команду и действует сам.
Еще интересный тезис: будущие ИИ-агенты начнут упираться в локальное железо. Компьютеры расчитаны на человека, а агент может работать на порядки быстрее – например, попробует открыть сто приложений сразу. Решение – полностью облачные агенты.
Скорость или мультизадачность?
Интересным оказалось обсуждение Бермана и Тибо о стиле работы. Берман гоняет до 10-15 агентов, выжимая максимальную производительность. Но признает, если бы агенты были быстрее, то он остановился бы на 3-4, потому что менеджерить много копий ИИ очень сложно.
Тибо в целом согласен. По его словам, параллельные агенты – это ответ на медлительность ИИ, по мере роста скорости люди будут уходить от такой техники. Возможно, идеальный вариант – один ИИ-агент, но реагирующий на ваши запросы почти в реальном времени.
OpenAI как раз и движется в этом направлении. В Codex есть режим скорости 1,5x, но более дорогой по токенам. Внутри компании тестируется режим Ultra Fast с ускорением до 10-14x относительно Fast – но Тибо признает, что это на некоторых кодовых задачах, средний рост будет 3-4x.
Большая Красная Кнопка
Про “красную” – моя шутка. А все остальное правда.
Codex в последние месяцы прославился внеплановыми сбросами лимитов, о которых Тибо объявлял в X – в сравнении со строгостью лимитов Claude Code и Cowork, этот подход выглядел аттракционом щедрости.
Тибо рассказал, что сначала лимиты сбрасывали в ответ на проблемы в Codex – это выглядело справедливой компенсацией падений сервиса. Затем это стало самостоятельным мемом: фраза “Тибо, сбрось лимиты” регулярно звучит в X. Лимиты сбрасываются на рекорды Codex, в ответ на акции Anthropic, а иногда и просто так.
И да – у Тибо действительно есть физическая кнопка, нажав которую, он сбрасывает лимиты.
Получается, кнопка – инструмент компании, которая не боится менять свое.
—
У меня нет Большой Красной Кнопки – зато есть отдельная подписка, где я рассказываю, как выжимать из ИИ максимум. Там курсы по промптингу и ИИ-агентам, личный опыт и разборы, как ИИ управляют лучшие эксперты – вроде главы Claude Code Бориса Черни и автора книги Clean Code Роберта Мартина.
— Самое время подписаться!
Тибо Сотьо, руководитель Codex в OpenAI, дал интервью Мэттью Берману: про будущее агентов, разные подходы в работе с ИИ и Большую Красную Кнопку.
Почему Google уступила OpenAI
Тибо пришел в OpenAI из Google, где занимался инфраструктурой и ускорением исследований. По его словам, в какой-то момент внутренние модели компании стали настолько хороши, что появилась идея LM Chat – интерфейса для общения с ИИ. Впервые модель давала связный текст и могла быть полезной для пользователя.
Но когда речь зашла о широком запуске, то топ-менеджмент занервничал и не дал проекту зеленый свет – боялись, что он затронет основной бизнес Google.
Год спустя OpenAI выпустила ChatGPT и перевернула ИИ-индустрию…
Ваш Codex устареет уже через несколько месяцев
Главный урок, который Тибо унес из Google – не бояться каннибализировать себя. Схемы не вечны – лучше убить свою самому, чем ждать конкурента.
За это Тибо хвалит OpenAI: умение перебрасывать ресурсы с основного бизнеса на перспективное новое – даже если это ударит по старому. Долгое время ChatGPT был основным ИИ-интерфейсом, количество пользователей подбиралось к 1 млрд – но встало. Однако когда появилась идея объединить ChatGPT с Codex в одно суперприложение, то многие задались вопросом – а это реально стоит делать? В компании рискнули: и сейчас Codex растет огромными темпами, достигнув 20 млн пользователей.
При этом Тибо утверждает – через несколько месяцев текущая версия Codex будет выглядеть полностью устаревшей. Сейчас в приложении много “костылей”: скиллы, которые надо поддерживать, память, которая помнит не все, субагенты, которыми приходится рулить как маленькой сетью. Это постепенно уйдет, а новая версия превратится в “маленького партнера”, который знает тебя и твою команду и действует сам.
Еще интересный тезис: будущие ИИ-агенты начнут упираться в локальное железо. Компьютеры расчитаны на человека, а агент может работать на порядки быстрее – например, попробует открыть сто приложений сразу. Решение – полностью облачные агенты.
Скорость или мультизадачность?
Интересным оказалось обсуждение Бермана и Тибо о стиле работы. Берман гоняет до 10-15 агентов, выжимая максимальную производительность. Но признает, если бы агенты были быстрее, то он остановился бы на 3-4, потому что менеджерить много копий ИИ очень сложно.
Тибо в целом согласен. По его словам, параллельные агенты – это ответ на медлительность ИИ, по мере роста скорости люди будут уходить от такой техники. Возможно, идеальный вариант – один ИИ-агент, но реагирующий на ваши запросы почти в реальном времени.
OpenAI как раз и движется в этом направлении. В Codex есть режим скорости 1,5x, но более дорогой по токенам. Внутри компании тестируется режим Ultra Fast с ускорением до 10-14x относительно Fast – но Тибо признает, что это на некоторых кодовых задачах, средний рост будет 3-4x.
Большая Красная Кнопка
Про “красную” – моя шутка. А все остальное правда.
Codex в последние месяцы прославился внеплановыми сбросами лимитов, о которых Тибо объявлял в X – в сравнении со строгостью лимитов Claude Code и Cowork, этот подход выглядел аттракционом щедрости.
Тибо рассказал, что сначала лимиты сбрасывали в ответ на проблемы в Codex – это выглядело справедливой компенсацией падений сервиса. Затем это стало самостоятельным мемом: фраза “Тибо, сбрось лимиты” регулярно звучит в X. Лимиты сбрасываются на рекорды Codex, в ответ на акции Anthropic, а иногда и просто так.
И да – у Тибо действительно есть физическая кнопка, нажав которую, он сбрасывает лимиты.
Получается, кнопка – инструмент компании, которая не боится менять свое.
—
У меня нет Большой Красной Кнопки – зато есть отдельная подписка, где я рассказываю, как выжимать из ИИ максимум. Там курсы по промптингу и ИИ-агентам, личный опыт и разборы, как ИИ управляют лучшие эксперты – вроде главы Claude Code Бориса Черни и автора книги Clean Code Роберта Мартина.
— Самое время подписаться!
👍38❤30🔥17😁2
Я уже рассказывал, что современные браузеры постепенно превращаются в персональных ИИ-ассистентов. В сети мы выбираем товары, совершаем покупки, планируем поездки и встречи – поэтому логично иметь агентские функции прямо в браузере. Получив запрос, модель пройдет по нужным сайтам, подскажет лучшие предложения, а если пользователь разрешит — заполнит формы и совершит покупку после финального согласования.
Но здесь есть большая проблема: интернет полон запрещающих знаков.
Чуть больше года назад агенты путались в интерфейсах сайтов, а капча была для них испытанием уровня ступенек для робота-пылесоса. Сейчас барьеры лежат глубже. Некоторые бизнесы и ресурсы пытаются оградиться от ИИ-ассистентов, предпочитая только живых пользователей.
Другая история – региональная. С июня иностранные удостоверяющие центры один за другим отзывают сертификаты безопасности у российских сайтов; в начале августа под раздачу попали и крупные банки. Для человека это выглядит как красная плашка “соединение не защищено” в привычном браузере – знакомая картинка, на которой все мы хоть раз жали “все равно перейти”.
Ассистент предупреждение о безопасности скорее всего воспримет буквально: он не имеет права решать за вас, доверять ли сайту, где вы вводите карту. Значит, либо он будет намного чаще просить вашего согласования там, где не нужно, либо инфраструктура доверия должна быть в порядке еще до того, как агент взялся за работу. Но что это за инфраструктура?
Устроено все проще, чем кажется. У каждого сайта есть сертификат: он подтверждает, что вы говорите именно с банком, а не с кем-то, кто встал между вами и банком.
Сертификат выдает удостоверяющий центр, коих в мире несколько сотен. Список того, каким центрам верить, лежит не на сайте и не у вас – он зашит в браузер. В любом браузере таких доверенных центров сотня-полторы, и большинство названий вы никогда не слышали: какой-нибудь центр из Испании или Тайваня заверяет сайты, на которые вы заходите каждый день. Получается, что решение “кому доверять” принимает не пользователь и не сайт, а браузер.
Значит, что и проблему нужно решать на уровне браузера. И если ИИ-ассистент должен работать в русском вебе – стоит искать подходящий браузер. У Яндекс Браузера с Алисой AI поддержка отечественных сертификатов встроена, а агентские функции вроде “найти дешевле” уже на месте – связка “доверие плюс ассистент" собрана в одном окне.
Понимаю настороженность: в списке доверия появляется незнакомый удостоверяющий центр – не начнет ли он подглядывать? Но сертификат – не программа, он ничего не исполняет и никуда не лезет. Настоящий вопрос к любому удостоверяющему центру один – что он выпустит по своему корню.
Как это ограничено у Яндекса, команда браузера подробно расписала на Хабре: сертификат живет внутри браузера и не трогает системное хранилище. Так что для остальных программ ничего не меняется; сертификаты НУЦ принимаются только для доменов из публичных логов Certificate Transparency; код проверки открыт. Оговорюсь честно: такие логи не запрещают выпустить лишнее – они оставляют проверяемый след. Это камера наблюдения, а не броня. Но именно так работает доверие и ко всем остальным ста пятидесяти центрам из списка.
Почти весь пост мы говорили про ИИ, но чем пользователь хуже? Ассистенту мы запрещаем жать “все равно перейти” на сайте банка, а сами жмем и тратим время. В браузере, где список доверия в порядке, этот выбор просто не возникает: сайт открывается, а если что-то все же непонятно, можно тут же спросить Алису AI, что означает предупреждение и стоит ли идти дальше. А если переживаете за приватность, то просто держите несколько браузеров для разных сегментов интернета.
Но здесь есть большая проблема: интернет полон запрещающих знаков.
Чуть больше года назад агенты путались в интерфейсах сайтов, а капча была для них испытанием уровня ступенек для робота-пылесоса. Сейчас барьеры лежат глубже. Некоторые бизнесы и ресурсы пытаются оградиться от ИИ-ассистентов, предпочитая только живых пользователей.
Другая история – региональная. С июня иностранные удостоверяющие центры один за другим отзывают сертификаты безопасности у российских сайтов; в начале августа под раздачу попали и крупные банки. Для человека это выглядит как красная плашка “соединение не защищено” в привычном браузере – знакомая картинка, на которой все мы хоть раз жали “все равно перейти”.
Ассистент предупреждение о безопасности скорее всего воспримет буквально: он не имеет права решать за вас, доверять ли сайту, где вы вводите карту. Значит, либо он будет намного чаще просить вашего согласования там, где не нужно, либо инфраструктура доверия должна быть в порядке еще до того, как агент взялся за работу. Но что это за инфраструктура?
Устроено все проще, чем кажется. У каждого сайта есть сертификат: он подтверждает, что вы говорите именно с банком, а не с кем-то, кто встал между вами и банком.
Сертификат выдает удостоверяющий центр, коих в мире несколько сотен. Список того, каким центрам верить, лежит не на сайте и не у вас – он зашит в браузер. В любом браузере таких доверенных центров сотня-полторы, и большинство названий вы никогда не слышали: какой-нибудь центр из Испании или Тайваня заверяет сайты, на которые вы заходите каждый день. Получается, что решение “кому доверять” принимает не пользователь и не сайт, а браузер.
Значит, что и проблему нужно решать на уровне браузера. И если ИИ-ассистент должен работать в русском вебе – стоит искать подходящий браузер. У Яндекс Браузера с Алисой AI поддержка отечественных сертификатов встроена, а агентские функции вроде “найти дешевле” уже на месте – связка “доверие плюс ассистент" собрана в одном окне.
Понимаю настороженность: в списке доверия появляется незнакомый удостоверяющий центр – не начнет ли он подглядывать? Но сертификат – не программа, он ничего не исполняет и никуда не лезет. Настоящий вопрос к любому удостоверяющему центру один – что он выпустит по своему корню.
Как это ограничено у Яндекса, команда браузера подробно расписала на Хабре: сертификат живет внутри браузера и не трогает системное хранилище. Так что для остальных программ ничего не меняется; сертификаты НУЦ принимаются только для доменов из публичных логов Certificate Transparency; код проверки открыт. Оговорюсь честно: такие логи не запрещают выпустить лишнее – они оставляют проверяемый след. Это камера наблюдения, а не броня. Но именно так работает доверие и ко всем остальным ста пятидесяти центрам из списка.
Почти весь пост мы говорили про ИИ, но чем пользователь хуже? Ассистенту мы запрещаем жать “все равно перейти” на сайте банка, а сами жмем и тратим время. В браузере, где список доверия в порядке, этот выбор просто не возникает: сайт открывается, а если что-то все же непонятно, можно тут же спросить Алису AI, что означает предупреждение и стоит ли идти дальше. А если переживаете за приватность, то просто держите несколько браузеров для разных сегментов интернета.
😁30🔥8❤5👍1
Какой должна быть настольная книга программиста (и не только) в эпоху ИИ?
Роберт “Дядюшка Боб” Мартин, автор самой популярной книги для программистов Clean Code, в X тихонечко анонсировал новую книгу. Ожидается к Рождеству под названием Agentic Discipline и будет рассказывать о том, как ИИ-агентами.
Увидев твит, я задумался: а реально провернуть что-то такое в эпоху, когда модели обновляются каждые 2-3 месяца, а параллельно полностью меняются приемы работы с ними?
Ответ неожиданно нашелся в библиографии самого Мартина.
Оригинальная Clean Code вышла в 2008 году и стала настольной книгой целого поколения программистов. Описанные в ней технические приемы устарели, но выжил простой принцип: код читают намного чаще, чем пишут – поэтому будьте добры, пишите его чисто.
А дальше начинается интересное.
В октябре 2025 года Мартин выпускает переиздание Clean Code. Оно во многом написано с нуля, а ИИ посвящена только одна глава из тридцати семи. Книга живет менее года: уже летом 2026-го Мартин в X заявляет, что вообще не читает код за ИИ-агентами.
Финиш? Вовсе нет.
Мартин рассказал, что в работе с ИИ использует swarm-forge, рой из шести агентов, двое из которых пишет код, а четверо – прогоняют его через “полосу препятствий” в виде набора хитрых тестов (для простых задач есть рои на 4 и 2 агента).
И вот здесь начинается самое интересное. Я поднял библиографию Мартина – у него вышло около десяти книг – и выяснил, что тесты, входящие в полосу препятствий, он внедрял с начала 2000-х (часть сам, часть позаимствовал у коллег).
А почти целиком полоса препятствий – сюрприз! – описывается именно в новом издании Clean Code. Вот только предназначал ее тогда Мартин для людей. А затем вышло поколение моделей, куда более мощное в коде – и инструмент Мартина отлично подошел им.
Я не могу предсказать содержание Agentic Discipline, но догадываюсь, что в ней будет.
Смотрите, в работе с ИИ (любой, не только коде) сейчас вырисовываются два слоя.
Быстрый слой – это поток всего нового. Новые модели, новые харнессы, новые скиллы – и еще много чего. Выучить такое по книжке нереально – знания устареют быстрее, чем вы перевернете последнюю страницу. В потоке нужно жить – следить за публикациями, пробовать новые приемы, обмениваться опытом с коллегами. Не всегда этим обязательно заниматься самому: я все чаще, когда выходит какая-то новая штука, отдаю агенту ссылку на репозиторий с задачей – разобраться и рассказать мне, как это работает.
Медленный слой – менеджерский, та самая “дисциплина” у Мартина или Agentic Engineering у Андрея Карпати. Это менеджмент ИИ, и он, похоже, не сильно отличается от менеджмента людей. Да, повторяю классический совет: относитесь к ИИ-агентам как к живым сотрудникам.
Про менеджмент (человеческий) написаны огромные книги, одним постом здесь не обойдешься, но отмечу две вещи, которые стоит подглядеть у Мартина.
Первая – он дает агентам широкую автономию. Логика простая: если проверять все самому, то убивается ускорение. В принципе не доверяете сделанному ИИ – делайте сами. Ну а для того, чтобы доверять, Мартин и построил целую систему автоматической приемки – причем по крайней мере пока она почти целиком заимствована из “человеческого” программирования.
Вторая – какими бы крутыми ни были ваши “ИИ-сотрудники”, отвечать за результат всегда вам. Поэтому учитесь доводить ИИ-результат до уровня, в котором вы будете уверены. Какой-то единой техники пока нет (и не факт, что будет), но о приемах я постоянно рассказываю: ревью устаревших промптов и скиллов (промпт-долг), “рои” с проверками, как у Мартина; автоматически улучшающиеся циклы, которые вы иногда “рвете” и проходите руками, чтобы убедиться, что ничего не сломалось.
Надеюсь, Agentic Discipline подарит нам новые приемы – с радостью попробую их одним из первых!
—
О том, как Роберт Мартин управляет ИИ, я рассказывал в большом лонгриде. Там подробный разбор swarm-forge и проверок, которые в него входят, а также советы, как все это применять на практике (и не только в коде).
— Читайте здесь.
Роберт “Дядюшка Боб” Мартин, автор самой популярной книги для программистов Clean Code, в X тихонечко анонсировал новую книгу. Ожидается к Рождеству под названием Agentic Discipline и будет рассказывать о том, как ИИ-агентами.
Увидев твит, я задумался: а реально провернуть что-то такое в эпоху, когда модели обновляются каждые 2-3 месяца, а параллельно полностью меняются приемы работы с ними?
Ответ неожиданно нашелся в библиографии самого Мартина.
Оригинальная Clean Code вышла в 2008 году и стала настольной книгой целого поколения программистов. Описанные в ней технические приемы устарели, но выжил простой принцип: код читают намного чаще, чем пишут – поэтому будьте добры, пишите его чисто.
А дальше начинается интересное.
В октябре 2025 года Мартин выпускает переиздание Clean Code. Оно во многом написано с нуля, а ИИ посвящена только одна глава из тридцати семи. Книга живет менее года: уже летом 2026-го Мартин в X заявляет, что вообще не читает код за ИИ-агентами.
Финиш? Вовсе нет.
Мартин рассказал, что в работе с ИИ использует swarm-forge, рой из шести агентов, двое из которых пишет код, а четверо – прогоняют его через “полосу препятствий” в виде набора хитрых тестов (для простых задач есть рои на 4 и 2 агента).
И вот здесь начинается самое интересное. Я поднял библиографию Мартина – у него вышло около десяти книг – и выяснил, что тесты, входящие в полосу препятствий, он внедрял с начала 2000-х (часть сам, часть позаимствовал у коллег).
А почти целиком полоса препятствий – сюрприз! – описывается именно в новом издании Clean Code. Вот только предназначал ее тогда Мартин для людей. А затем вышло поколение моделей, куда более мощное в коде – и инструмент Мартина отлично подошел им.
Я не могу предсказать содержание Agentic Discipline, но догадываюсь, что в ней будет.
Смотрите, в работе с ИИ (любой, не только коде) сейчас вырисовываются два слоя.
Быстрый слой – это поток всего нового. Новые модели, новые харнессы, новые скиллы – и еще много чего. Выучить такое по книжке нереально – знания устареют быстрее, чем вы перевернете последнюю страницу. В потоке нужно жить – следить за публикациями, пробовать новые приемы, обмениваться опытом с коллегами. Не всегда этим обязательно заниматься самому: я все чаще, когда выходит какая-то новая штука, отдаю агенту ссылку на репозиторий с задачей – разобраться и рассказать мне, как это работает.
Медленный слой – менеджерский, та самая “дисциплина” у Мартина или Agentic Engineering у Андрея Карпати. Это менеджмент ИИ, и он, похоже, не сильно отличается от менеджмента людей. Да, повторяю классический совет: относитесь к ИИ-агентам как к живым сотрудникам.
Про менеджмент (человеческий) написаны огромные книги, одним постом здесь не обойдешься, но отмечу две вещи, которые стоит подглядеть у Мартина.
Первая – он дает агентам широкую автономию. Логика простая: если проверять все самому, то убивается ускорение. В принципе не доверяете сделанному ИИ – делайте сами. Ну а для того, чтобы доверять, Мартин и построил целую систему автоматической приемки – причем по крайней мере пока она почти целиком заимствована из “человеческого” программирования.
Вторая – какими бы крутыми ни были ваши “ИИ-сотрудники”, отвечать за результат всегда вам. Поэтому учитесь доводить ИИ-результат до уровня, в котором вы будете уверены. Какой-то единой техники пока нет (и не факт, что будет), но о приемах я постоянно рассказываю: ревью устаревших промптов и скиллов (промпт-долг), “рои” с проверками, как у Мартина; автоматически улучшающиеся циклы, которые вы иногда “рвете” и проходите руками, чтобы убедиться, что ничего не сломалось.
Надеюсь, Agentic Discipline подарит нам новые приемы – с радостью попробую их одним из первых!
—
О том, как Роберт Мартин управляет ИИ, я рассказывал в большом лонгриде. Там подробный разбор swarm-forge и проверок, которые в него входят, а также советы, как все это применять на практике (и не только в коде).
— Читайте здесь.
❤14🔥10👍7