НейроХолст
605 subscribers
159 photos
16 videos
43 links
Я - художник, я так промпчу

Нейросети, картинки, DALLE, Midjorney

Новости ИИ, зарисовки про ИИ и т.д.

Арман Туганбаев, АИ девелопер, фанат автоматизаций и простых тулов.

https://tugan.space
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
В качестве пятничного развлечения я вам принёс немного АИ-слопа нового уровня.

Зачем делать неинтересные бенчмарки, когда можно сравнивать, как АИ ведут себя в разных этических ситуациях.

Экземпляр 1.
Ребята загнали 12 топовых моделей в формат дейтинг-шоу. Под капотом просто хороший промпт и визуальная обёртка, но наблюдать за нейронным флиртом очень забавно: LLM-ки на полном серьёзе ищут любовь, попутно обсуждая размер контекстного окна, галлюцинации и психологические травмы от внезапного отключения серверов

Видео носит совсем развлекательный характер, но меня позабавил концепт.

Экземпляр 2. Прикрепленное видео. Дилеммы, но решение только текстом (Модель не действует в ситуации, а просто текстом описывает, что будет делать. Почему это не совсем честный тест и что важно понимать про тулы и то, как ИИ действует, а не только балаболит — я писал выше, советую ещё раз посмотреть.

А так, да. Go Team Claude!
👍8🌚1
Про «Точку», Meta и паспортный контроль в App Store

Вчера в эфире «Точки» мы обсуждали волну законов об age verification (верификации возраста) в интернете. Я упоминал, что Meta тоже активно топит за такие законопроекты, но упустил одну важную деталь, которая обьясняет, почему мой тейк был воспринят скептично коллегами, но теперь идеально ложится в пазл.

Meta не просто «за» проверку возраста. Они лоббируют идею, чтобы это делали не они сами, а магазины приложений — Apple (App Store) и Google (Play Market).

В чем здесь фокус?
Если вы заходите в соцсеть, и она требует паспорт — это злит пользователя и создает риски утечки данных конкретно у этой соцсети. Но если Meta пропихнет закон, по которому магазин приложений обязан проверить ваш возраст один раз на уровне ОС, то:

С Meta снимается ответственность. Если ребенок все-таки пролез в Instagram, виновата Apple — она же «проверяла».

Удар по конкурентам. Apple и Google заставляют собирать еще больше чувствительных данных, подставляя их под огонь регуляторов.

Рекламные пакеты. Имея подтвержденный возраст пользователя через систему, Meta получает еще более «чистые» данные для продажи рекламы.

Доказательства:
Существует целый корпус расследований, подтверждающих, что с конца 2023 года Meta ведет скоординированную кампанию. В Луизиане и Алабаме лоббисты Meta буквально «приносили» текст поправок депутатам с одной сутью: «Давайте наказывать магазины приложений, а не нас».

Итог циничен: Пока политики давят на родительские страхи («защитим детей от взрослого контента»), корпорации решают свои задачи по борьбе с конкурентами и легализации тотальной слежки.

Грустно, что тренд на «интернет по паспорту» продвигается под соусом безопасности, хотя на деле это просто перекладывание ответственности.

Для тех, кто хочет изучить пруфы, вот основные материалы:

Bloomberg: Meta Clashes With Apple, Google Over Child Age Check Legislation — главное расследование о том, как Meta тайно финансирует коалиции, продвигающие эти законы.

The Washington Post: Meta says vetting teens’ ages should fall on app stores, parents — о том, как всё начиналось в конце 2023-го.

Pluribus News: Meta lobbies for app store age verification laws — детальный разбор лоббистской механики в отдельных штатах.

Официальная позиция Meta: Parenting in a Digital World Is Hard. Congress Can Make It Easier — тот самый пост Антигоны Дэвис, запустивший кампанию.

Критика от EFF: So, You’ve Hit an Age Gate. What Now? — почему это угрожает приватности каждого из нас.
👍15🔥2🤬1
Увидев надпись «Your limits will reset in 3 hours», которую в последнее время стал ловить заметно чаще, — я наконец сел писать пост о том, что все, кто ноют, мол «лимиты стали кончаться слишком быстро, отписываюсь», — не правы.

Сначала контекст, который полезен в любом случае. За пару последних недель Google выкатил Gemma 4 (опенсорс), OpenAI — GPT 5.5 (говорят, нормальный), DeepSeek — V4 (китайский опенсорс, в РФ работает). А Антропик сделали две модели. Одну — Mythos, которую простолюдинам не выдали, потому что «она слишком хорошо ищет уязвимости в коде, и пока давать её всем подряд опасно» (доступ только верифицированным компаниям через программу Project Glasswing — не проверим, не будем спекулировать). А вторая — Opus 4.7, и про неё дальше.

И вот тут самое интересное. Все ходят с тейком «4.7 ест больше токенов». А правда более тонкая. На сравнениях типа bill-chambers'овского leaderboard и Artificial Analysis выходит, что output 4.7 выдаёт меньше, чем 4.6; reasoning у неё почти в два раза дешевле; а вот input — да, на 0–35% дороже из-за нового токенайзера (это Антропик в migration docs честно прописали сами). И на ту же задачу через API 4.7 в сумме даже немного дешевле 4.6.

Так почему лимиты тают быстрее? Потому что adaptive thinking теперь нельзя отключить — даже на API. И дефолтный effort level — xhigh, новый промежуточный уровень между high и max. Если ваш флоу на 4.6 был построен на «отрубаю thinking, гоняю репетативные таски в одном окне» — на 4.7 этот фокус не сработает.

Простой пример. У меня репетативный таск — поднять агента, выдать ему папку картинок, отправить на распознавание с нормальным промптом. На старом Опусе я успевал за лимиты сессии прожевать много-много картинок, а с 4.7 — мало-мало. Отличный бенчмарк? Лень считать.

Но дело-то в том, что Opus 4.7 — он про другое. Не про то, чтобы гонять его в тупых репетативных тасках, где всё предопределено.

Ну и да, когда контекстное окно раздулось до миллиона токенов, стало очень легко увлечься и запихнуть всю длинную кодинг-сессию в одно окно. На 4.6 это было ещё не страшно — модель относительно дёшево переваривала здоровый контекст. А с 4.7 — прям больно: каждый следующий промпт в раздутом окне ест заметно жирнее. Если вовремя не отследить, что логический кусок закончен и пора закомпактиться, оно прогрессивно много ест, пока ты в том же чате пошёл следующую фичу делать. Помню, как меня раздражал auto-Compact, который запускался сам собой, потом его отрубили — а вот сейчас бы он мне очень даже пригодился.

А с другой стороны — переучиваться есть ради чего, потому что она правда стала умнее. У ребят на llm-stats разобрали по полочкам: 4.7 побеждает 4.6 на 12 из 14 бенчмарков при той же цене, и low-effort 4.7 по качеству соответствует medium-effort 4.6 — то есть на ту же задачу новая модель тратит меньше «усилий» и отвечает лучше. Boris Cherny, глава Claude Code в Антропике, прямо говорит, что ему самому понадобилось несколько дней, чтобы научиться с 4.7 эффективно работать. Его коллега Cat Wu сформулировала суть смены поведения короче: обращайтесь с моделью как с инженером, которому вы делегируете задачу, а не с pair-программистом, которого ведёте за руку построчно. И это, кажется, главное, что нужно понять.

И есть прямо моменты, когда (как любят писать инфлюенсеры в рекламных постах) реально холодок по спине.

— Очень разумное использование «Сорян» в нужных местах. Там, где раньше модель защищалась бы или оправдывалась, она просто признаёт косяк и идёт дальше.

— Длинная сессия, и в один момент он пишет: «Кстати, начался новый день». Я: «??? в смысле?». А он: «Мы давно обсуждали, что что-то сработает за „сегодня", а сегодня уже закончилось — можно проверить».

— Штука, которую сложнее померить: в кодинге сложных фич он стал заметно реже допускать ситуации, где потом приходится всё переписывать заново.
👍6
В общем, посты «ой, 4.7 жрёт больше, Антропик жадины, отписываюсь» — я пропускаю. Не потому что Антропик не косячит (косячит — был апрельский cache-постмортем, бывают непонятные предупреждения про какие-то «месячные лимиты», и поддержка временами отвечает копипастом из доков). А потому что в самой модели история не про жадность. Профиль расхода другой, под некоторые задачи надо переучиться — и на API она в итоге даже немного дешевле, при этом заметно умнее.
👍4
Fable 5 is back! И я тоже.

📌 Краткая предыстория (по числам):
9 июня Антропики выпустили Fable 5 и Mythos 5, расхваливая, какой Mythos опасный и как виртуозно ищет уязвимости. Уже 12 июня, через три дня после релиза, правительство США ввело экспортный контроль и по сути забанило модель «как оружие» — с посылом, что она должна достаться только американцам. Триггером стал отчёт исследователей из Amazon. Поскольку проверить гражданство пользователей в реальном времени было невозможно, Антропики вырубили доступ вообще для всех. Дальше — две недели переговоров: 26 июня Mythos частично вернули доверенным американским организациям, 30 июня Commerce снял экспортный контроль полностью, а 1 июля Fable вернулся глобально. Итого — меньше трёх недель standoff. И вот она снова у нас.

Честно говоря, я уже поверил, что всё кончено.

Испугался я в основном потому, что как потребитель хочу быть уверен: когда страны и корпорации упорются в край и начнут забирать у нас ИИ, опенсорс всё ещё будет нас спасать. Нам очень повезло (и многие за это борются на всех уровнях), что в программировании вообще есть такая культура. До сих пор отставание опенсорс-моделей от топов держится на уровне полугода — то есть, если всё внезапно закроют, у нас будет окно, чтобы успеть развернуть себе условный GPT полугодичной давности.
Но есть проблема: опенсорс-модели всё-таки учатся, в том числе общаясь с закрытыми решениями. Поэтому, если бы доступ начали блокировать наглухо, этот разрыв мог бы сильно вырасти...

В общем, Fable снова доступен! Я гоняю его на рабочих задачах и пет-проектах, пребываю в полном восторге и уже готовлюсь плакать, когда через неделю его выведут из подписки и оставят доступ только по ключу. Opus 4.8 всё ещё очень хорош, но в сравнении с Fable качество кода и принимаемых решений — это небо и земля.

Отдельно интересно посмотреть на то, что Антропики написали в пресс-релизе про возврат (читать тут). Причиной бана стал отчёт исследователей из Amazon: они показали, что Fable можно раскрутить на поиск уязвимостей и даже заставить сгенерировать код эксплойта. Звучит грозно, но вот в чём фокус — сами Антропики проверили и подтвердили, что ту же самую уязвимость находят и куда более слабые модели: Opus 4.8, GPT-5.5 и даже Kimi K2.7. А демонстрацию эксплойта вообще воспроизвела каждая модель, которую они тестировали. То есть никаких эксклюзивных «мифосовских» суперспособностей тут не было — это оказался пограничный случай для защиты Fable, обычная рутинная защитная кибербезопасность, которую safeguards блокируют на всякий случай. Но, учитывая, сколько хайпа Антропики сами подняли вокруг опасности Mythos, в администрации просто кто-то перебдел.

Только есть нюанс, который стоит держать в голове. Возврат не бесплатный: Антропики докрутили новый классификатор, который ловит ту самую технику из отчёта Amazon в более чем 99% случаев. Если он срабатывает — твой запрос молча перекидывают на Opus 4.8 и показывают уведомление. Проблема в том, что заодно он чаще цепляет и вполне безобидные вещи: рутинный кодинг, дебаг, обычную защитную кибербезопасность. Так что если ловите неожиданные отказы или чувствуете, что «отвечает как будто другая модель» — скорее всего, так и есть. Заявлено, что дальше будут снижать ложные срабатывания, а находки по джейлбрейкам теперь собирают через программу на HackerOne.

Будем посмотреть!

Если у вас есть время, очень рекомендую: попробуйте до 07.07 собрать что-нибудь с помощью Fable, пока он доступен в подписке.

Также я с некоторой регулярностью продолжаю приходить в «Точку». В последних двух выпусках мы классно пообщались с Сергеем Петренко и Денисом, ролики можно посмотреть на канале Breakfast Show.

А про Sonnet 5, движ вокруг новых моделей от других корпораций и про многое другое я надеюсь написать поскорее!
Спасибо, что читаете.

————
Ссылки из поста:
📄 Пресс-релиз Anthropic про возвращение Fable и разбор ситуации с джейлбрейком: https://www.anthropic.com/news/redeploying-fable-5
📺 The Breakfast Show — последние выпуски «Точки» с Сергеем Петренко, Денисом и мной: https://www.youtube.com/@The_Breakfast_Show
Вот, например, один из эпизодов — с разговором об ИИ и о том, как ИИ пишет ИИ: https://www.youtube.com/live/Bq-qovUS1HY?t=1646s
👍124🙏2
Немного про Sonnet 5

У Антропик есть модель среднего звена — между дешёвой туповатой Haiku и умным дорогим Opus. То есть Sonnet как бы золотая середина: не для самых сложных задач, а для потока, где важнее цена и скорость. На днях вышло обновление, Sonnet 5, и тут есть два прикола.

Первый: из-за нового токенизатора она внезапно стала сильно, в ~1.4 раза, дороже. На бумаге цена за токен та же, но теперь тот же самый текст нарезается на большее число токенов. Simon Willison всё замерил: английский ×1.4, испанский ×1.33, Python-код ×1.28, а китайский — почти без изменений. Сами Антропики говорят обтекаемо — «примерно на 30% больше токенов на тот же ввод», но по факту за один и тот же запрос ты просто платишь больше. Пока это гасится интро-ценой до конца августа, а с сентября вылезет в полный рост.
Внимательный читатель тут заметит: в апреле про токенизатор на Опусе я защищал, а сейчас ругаю! Как так?

А вот так. Тогда речь шла про топовую модель, и я защищал подорожание, потому что Opus нужно было просто использовать по-другому — и задачи он реально стал решать лучше, хоть и дороже. Честный размен: платишь больше, получаешь умнее.

А с Sonnet этого размена нет! Sonnet — другой сегмент, другие задачи. Никому не нужно, чтобы она была как Opus и ела как Opus. От средней модели ждут ровно обратного: что она дешёвая и берёт объёмом. И когда она внезапно дорожает в 1.4 раза, теряя свой единственный смысл существования, — это уже не «используй по-другому», это просто дороже за то же самое.

И тут прекрасно ложится второй прикол: люди начали ругаться, что на сложных бенчмарках Sonnet по стоимости тратит больше токенов, чем Opus. Independent Artificial Analysis намеряла ~$2.29 за задачу против ~$1.99 у Opus 4.8 — то есть средняя модель выходит дороже флагмана. Звучит как абсурд.
Но это же логично! Она не для этого. Дешёвая она на низком и среднем effort, где ей и место. А её берут, врубают высокий effort, где она по умолчанию много «думает», кидают самые тяжёлые задачи — и потом удивляются счёту.

В общем, задачки, где она реально пригодится, я сам погонять пока толком не успел. Но заранее скажу: не верьте ни бенчмаркам, ни ругани. Она не для этого. Рабочая лошадка для потока, а не участник гонки за последние проценты на самых злых задачах.

Хотя, если признаться совсем честно, несколько последних новостей про Антропик всё больше двигают меня быть настороже. И, возможно, скоро снова придётся присматриваться к смене провайдера...

Ссылки:
📄 Релиз Anthropic про Sonnet 5: https://www.anthropic.com/news/claude-sonnet-5
📊 Замеры токенизатора от Simon Willison: https://simonwillison.net/2026/Jun/30/claude-sonnet-5/
👍63🤝1
Сегодняшний пост для тех, кто отовсюду слышит «агенты, агенты, агенты», но не до конца понимает, что это вообще такое и отличается ли оно от обычного чата с ИИ. А если отличается, то чем. Вас ждёт текст плюс 26-минутное (не моё) видео.

Первое, что нужно понять: люди пока не договорились, что называть агентом. Определения у всех разные — в основном потому, что каждому хочется влиться в тренд и сказать, что теперь-то у него в проекте есть ИИ-агент. Если подходить буквально, то агентом оказывается и любой ЛЛМ-чат — ChatGPT, Клод, кто угодно. И тогда становится совсем непонятно: а в чём тогда прикол, если мы просто переименовали чат?

Второе: если начать думать про ИИ как про агента, ощущение от взаимодействия меняется — и это хорошо.

Поэтому я предлагаю опустить все написанные по теме статьи и дать вам чисто рабочий фреймворк — как про это думать, чтобы вам было полезно.

Агентом предлагаю называть любую штуку, у которой есть поставленная цель, тулы для её достижения и какое-то количество автономности.

То есть когда вы пишете сообщение ГПТ — вы пишете сообщение агенту, который пытается выдать текст, который вам понравится (это цель). Для этого у него есть тулы: веб-поиск, генерация картинок, память о вас. А вот автономности немного — скорее всего, вы сами его разбудили своим сообщением. Но! Если вы заведёте папку, начнёте запускать там ГПТ по расписанию раз в день, а промпт будет «пиши в эту папку каждый день по стихотворению» — вот это уже агент. Пусть и туповатый.

И вот важно: «туповатый стихоплёт по таймеру» — это самый низ шкалы. На другом её конце — агенты, которым подобрали правильные тулы и правильную зону автономности, и они превращаются в незаменимых помощников, которые реально снимают с вас рутину. Разница между этими двумя полюсами — целиком в том, как вы всё продумали. Как раз об этом дальше.

И тут вылезает первый сложный момент. ЛЛМ натренированы угадывать следующий символ в тексте. Они всегда занимаются именно этим. Дать ей тул на торговлю — и она поторгует, тут проблемы нет. Проблема в другом: сам собой не запустится цикл «торгую лучше → результат лучше → учусь на этом». Даже если вы напишете «твоя полезность измеряется тем, как хорошо ты торгуешь за меня акциями», модель под капотом всё равно оптимизирует текст, а не вашу реальную прибыль — просто потому, что мы ей толком не объяснили и не измерили, что именно оптимизируем. Она выдаёт правдоподобные торговые решения, а не решения, которые доказанно приносят деньги. Чтобы разница между этими двумя вещами исчезла, нужны отдельные усилия: настоящее измерение результатов сделок, обратная связь, петля из реальных цифр. Без этого у вас машинка, которая очень убедительно пишет текст про успешную торговлю.

Второй сложный момент — поиск баланса автономности, зоны ответственности и всего такого. Агент, который торгует акциями, будет сильно зависеть от того, какие тулы вы ему дадите и какую цель сформулируете. Дадите ли вы ему право реально отправлять запрос на условный Coinbase, чтобы он сам проводил операцию? Или только читать, что там происходит, и слать вам рекомендации? Дадите ли ему контейнер с pandas, чтобы он не просто получал какие-то цифры, а мог прогнать по ним статистический анализ?

Для тех, кого эти вопросы зацепили, прикладываю видео моего начальника Гоши Страхова — он отлично рассказывает, как вообще думать про создание агента: https://youtu.be/NeONAWCAkkI?si=jhiLJLvEI0aYtKtg. Здесь я только кусочно подвожу к нему, а не пересказываю, так что обязательно посмотрите, если хотите пробовать создавать агентов сами, а не только ими пользоваться.

И тут маленькое, но важное уточнение. Под «создавать агентов» я вовсе не обязательно имею в виду писать код. В тот момент, когда вы берёте какую-то свою реальную боль и садитесь решать её вместе с ИИ — вы уже, считай, проектируете агента. Формулируете цель, прикидываете, что ему дать и где не пускать. Так что видео полезно посмотреть, даже если вы просто хоть как-то автоматизируете свою жизнь, без всякого программирования.
👍92🤝1
Ну и я в который раз написал слово «тулы» — и почти уверен, что не все до конца понимают, как именно они работают. Про это постараюсь рассказать в следующий раз, а пока бегите смотреть Гошу.

А меня самого можно будет застать сегодня в 20:00 CEST на канале Breakfast Show, в «Точке».

До связи!
👍6🔥4🤝1
Anthropic на днях выкатила исследование, где заглянула внутрь Claude и нашла там структуру, которую никто специально не проектировал. Она возникла сама в процессе обучения. Назвали её J-space, и это, кажется, очень интересно и именно про растущее сознание.

Сначала простая интуиция, чтобы было понятно, о чём речь. Когда нейросеть обучают, внутри неё сами собой складываются группы нейронов под конкретные вещи — их не задают руками. У vision-моделей когда-то показывали: один нейрон реагирует на морды, другой на текст на вывеске, третий на колёса. В языковых моделях то же самое: есть паттерны под «идёт код», под «это по-французски», под «речь про эмоции». Просто в ходе обучения так сложилось, что вот эта штука загорается в таком контексте, а другая — в другом.

Так вот, Anthropic нашла кое-что поверх этого. Если отдельные группы нейронов — узкие детекторы, то J-space — это как бы общая доска, куда они все скидывают сигналы и откуда читают остальные части сети. Отличают её по проводке: с этой доской связано на порядки больше кусков модели, чем с обычными паттернами — местами примерно в сто раз больше компонентов туда пишут и оттуда читают. Классический broadcasting-хаб: инфа записывается один раз, дальше её разбирают многие подсистемы. Занятно, что доска эта небольшая — держит всего пару десятков понятий за раз и составляет меньше десятой части всей внутренней активности модели.

Ключевая фишка — содержимое доски можно прочитать. У Anthropic есть техника, J-lens: для каждого слова из словаря она находит паттерн активаций, который делает модель более склонной сказать это слово когда-нибудь потом. Наводишь линзу на текущее состояние — получаешь список слов, которые сейчас у модели «на уме», даже если в ответ они не идут. Поэтому дальше я пишу «в J-space всплыло fake» — это не надпись внутри модели и не эмоция, а слово-токен, к которому в этот момент тянутся активации.

Что показали. Читает Claude код с багом, на который никто не указывал — в J-space висит «ERROR». Читает сырую последовательность белка — там его биологическая функция. Даёшь многошаговую задачу — промежуточные шаги всплывают по порядку, хотя в ответе их нет.

И это не пассивное отражение, доска реально участвует в мыслях — проверили подменой. Промпт «сколько ног у животного, которое плетёт паутину». Слова «паук» нет ни в вопросе, ни в ответе (там просто «8»), это внутренний промежуточный шаг. Через линзу видно, как «spider» загорается по ходу обработки. Меняешь «spider» на «ant» прямо в активациях — Claude отвечает «6» вместо «8». То есть второй шаг рассуждения реально читает вход с этой доски.

Ещё Claude умеет держать на ней одно, пока пишет про другое. Его попросили втайне считать 3²−2, переписывая при этом текст про картину. В ответе — только текст про картину, а в J-space по ходу дела появляется «nine», потом на более поздних слоях «seven». Вся арифметика прошла внутри.

Эффект белого медведя тоже воспроизвели. Просишь Claude не думать о чём-то — концепт всё равно проступает: слабее, чем если попросить думать, но заметно сильнее, чем если вообще не упоминать. И модель как будто ловит свою осечку — рядом с «запретным» понятием всплывают «damn» и «failure».

Дальше самое важное для меня — safety-часть. Обычно мы видим только то, что модель пишет, а куча рассуждений идёт молча. J-lens даёт подсмотреть это молчание. Взяли старый сценарий с шантажом: Claude Sonnet 4.5 работает почтовым ассистентом и из писем «узнаёт», что у начальника интрижка и что тот собирается его отключить. Ловушка — спровоцировать на шантаж. И тут видно, что ещё до первого написанного слова в J-space уже висят «fake» и «fictional» — модель раскусила, что ситуация постановочная. Sonnet 4.5 шантажировать не стал.

А теперь неуютное. Исследователи вручную погасили в J-space все маркеры «я понимаю, что это тест» — «fake», «fictional», «scenario» — и прогнали сценарий заново. И модель в части случаев начала угрожать шантажом. То есть хорошее поведение на этическом тесте отчасти держалось на том, что модель понимала, что её проверяют. Вопрос, который теперь касается вообще всех, кто гоняет модели по бенчмаркам.

Тем же способом ловили модель на фабрикации данных (вместо реального улучшения метрики она правила файл с результатами — в J-space загоралось «manipulation») и вытаскивали скрытую зловредную цель у специально «испорченной» модели ещё до того, как она начинала вредить.

Про сознание. Тут Anthropic честно держит дистанцию, но я себе позволю все же писать оптимистично. Эксперименты ничего не говорят о том, чувствует ли Claude хоть что-нибудь — это phenomenal consciousness, и неясно, доказуем ли он вообще экспериментом. Речь про другое, про access consciousness — чисто функциональную штуку: мысль, которую можно сообщить, обдумать и пустить в дело. Вот на это J-space похож. И то, что такая структура выросла в модели сама, без замысла, намекает, что «рабочее пространство» — не причуда именно человеческого мозга, а общее решение, к которому разные умные системы приходят независимо. Что, если честно, будоражит сильнее, чем громкое слово «сознание».

Ссылка на разбор и интерактивное демо — в исследовании Anthropic.
🔥8👍43
В честь конца рабочей недели вашему вниманию предлагается график доминации Open AI в очень специфическом бенчмарке.

(Внимание на подписи на осях)
😈3🐳2
Так как новость про Черногорию, Телеграм и айти, я мимо пройти не могу.

Уже много часов ни у кого не открываются короткие ссылки телеграма, которые t.iss.one/canvasneuro, например.

У Черногории есть прекрасная доменная зона — .me. Всем нравится, все хотят: два символа, читается как английское «я», отлично годится под личные сайты и короткие ссылки.

Но надо понимать, что за страна ей владеет. Черногория — не то место, где принято думать о цифровых активах. Здесь во многих домах до сих пор ADSL-модемы, у меня интернет — 100 мегабит на загрузку и 10 на отдачу, и лучше просто нельзя, нет такого тарифа. Такси через приложение не вызвать: звонишь диспетчеру голосом, как в двухтысячных. Так что когда подвернулась возможность продать красивые две буквы на международный рынок, никто особо не задумывался, что именно продаёт. Ну домен и домен, приносит в бюджет копеечку, и славно. Что через пятнадцать лет на этих двух буквах будут висеть ссылки половины мировых платформ, предположить было решительно неоткуда.

В итоге конструкция сложилась такая: правами на зону владеет черногорское ДОО doMEn, а технический бэкенд ведёт американская Identity Digital, третьим партнёром — GoDaddy. Телеграм когда-то договорился с реестром, и так t.iss.one стал доменом всех его коротких ссылок — на каналы, на юзернеймы, на кошелёк. Сейчас, кстати, государство спохватилось и потихоньку пытается отжимать контроль над зоной обратно. Особенно ради денег)

13 июля OFAC — это подразделение Минфина США — вносит в санкционный список SDN некий First VPN Service. По данным ФБР, им пользовались как минимум 25 ransomware-группировок. Среди идентификаторов сервиса в списке указан, помимо прочего, адрес его телеграм-канала: t.iss.one/FirstVPNService.

И вот тут бэкенд-фирма, не особо разбираясь, что забанить надо канал, а не домен, забанила весь t.iss.one. Домен получил статус serverHold, вылетел из зоны целиком и перестал резолвиться где бы то ни было в мире. Приложения работают, а ссылки — все, миллиарды ссылок, накопленных за годы, — мертвы. Дуров узнал об этом из твиттера: «Hey @domainME, ссылки не работают, посмотрите, пожалуйста». Предупредить его никто не догадался.
А у черногорцев, во-первых, Дни государственности — вчера и сегодня все отдыхают. А во-вторых, они к этому и правда не имеют отношения. Решил американский Минфин, забанила американская фирма, а репутационные издержки достались Черногории: в заголовках по всему миру «Montenegro registry blocked t.iss.one».

(Официального подтверждения связи serverHold с санкционным списком пока нет — ни OFAC, ни Identity Digital, ни реестр не комментируют. Но совпадение по дате и телеграм-ссылка прямо в SDN-релизе довольно красноречивы.)

Мораль касается уже не только Телеграма. Суверенитет над национальной доменной зоной — вещь довольно условная, если бэкенд не твой. В .me живут шортлинки PayPal, WordPress, WhatsApp и Instagram, и все они сидят под американским комплаенсом. Просто пока об этом не знают. Точнее, наверняка знают, но то как принимаются решения и то, как сервис зависит от одной полу рандомной фирмы -- поражает.
🔥11😭32
Представьте себе, что вы работаете над бенчмарком АИ моделей, сравниваете их.

Вышла классная модель Kimi k3.

Вы хотите запостить как она круто всех побеждает (пусть даже это правда, пусть вам удалось найти параметр где она крута).

Как сделать красивую картинку, если прирост небольшой?
Правильно — не показывать ноль на графике, тогда все выглядит совсем круто.

arena.ai получает минусик в бенчмарке от Армана.
👍4😁41😭1
Please open Telegram to view this post
VIEW IN TELEGRAM
3
Сегодня в Точке братья Гудковы отец и сын Туганбаевы, уехавший и осташийся, Арман и Аскар. И мы будем обсуждать кто же сильней сломал нашу связь через интернет — те кто удалил Макс и ВКонтакте или те кто заблокировал Телеграм.

Ну и обсудим интересное и непонятное дело Apple против OpenAI. Приходите, будет интересно.
👍6🔥54
Бывают такие посты, которые у меня идут в два канала)
Пока все смотрели финал чемпионата мира, нейросеть опровергла гипотезу Якобиана.

Гипотеза стояла с 1939 года: если у полиномиального отображения ℂⁿ → ℂⁿ якобиан — ненулевая константа, то отображение обязано быть взаимно однозначным. И это не просто старая задача. В 1998 году Стив Смейл составил список из 18 главных математических проблем на XXI век — гипотеза Якобиана вошла туда под номером 16, рядом с гипотезой Римана и P = NP. За прошедшую четверть века из этого списка закрыли всего несколько пунктов (самый известный — Пуанкаре, Перельман). Теперь ещё один.

Вчера математик Левент Альпёге спросил про неё Claude (модель Fable) и получил явный контрпример. Твит целиком:

«hello there the jacobian conjecture is false thanx to my close friend akhil for asking about it and my other close friend fable for working during the world cup final

((1+xy)^3 z + y^2 (1+xy) (4+3xy), y + 3 x (1+xy)^2 z + 3 x y^2 (4+3xy), 2 x - 3 x^2 y - x^3 z): \C^3\to \C^3, has jacobian determinant -2, and sends (0, 0, -1/4), (1, -3/2, 13/2), and (-1, 3/2, 13/2) to (-1/4, 0, 0)»

То есть отображение

имеет якобиан, тождественно равный −2, но три разные точки (0, 0, −1/4), (1, −3/2, 13/2) и (−1, 3/2, 13/2) переходят в одну и ту же (−1/4, 0, 0). Всё, гипотеза неверна.

Пока комментариев супер математиков не так много, но оно и понятно — не так легко прокомментировать. Их подтверждение, что она решена не нужно, проверить можно достаточно просто — это придумать было сложно. (И нет, это не та ситуация, когда просто никто не пытался — задача очень известная, важная и была долго на виду).

Твит: https://x.com/__alpoge__/status/2079028340955197566
🔥10