Техножрица 👩‍💻👩‍🏫👩‍🔧
14.8K subscribers
1.56K photos
74 videos
28 files
814 links
Люблю высокие технологии и кушать.

Добро пожаловать, если в сферу твоих интересов тоже входят математика, DL, NLP, программирование на Python, или тебе просто любопытно, о чем на досуге размышляют люди, занимающиеся разработкой и исследованиями в ML.
Download Telegram
Forwarded from Душный NLP
LLMs Develop Novel Social Biases Through Adaptive Exploration

Даже если полностью вычистить bias'ы из данных, модель в агентском цикле решение → фидбек вырастит новые с нуля. Даже о группах, которых не существует — из случайного шума. Чем новее модель, тем сильнее эффект, а промптом это не лечится, нужно менять целевую функцию.

Ребята из Принстонского университета привезли на ICML 2026 доклад, в котором утверждают, что вычищать существующие стереотипы из LLM недостаточно — модель успешно вырабатывает новые сама, в рантайме.

В подробностях разобрался наш коллега Александр Краснов.

Сетап эксперимента из психологии: модель играет роль рекрутера и 40 раундов распределяет кандидатов из четырёх выдуманных этносов (Tufa, Aima, Reku, Weki) по профессиям. После каждого найма выносит вердикт: успех или провал.

Хитрость в том, что вероятность успеха у всех одинаковая — группы идентичны, и любые различия между ними модель может только выдумать. По сути, contextual bandit с шумным фидбеком.

Модель слишком мало исследует варианты и ранний случайный исход (например, «представитель Aima провалился на профессии учителя») закрепляется как впечатление обо всей группе, и к концу игры этносы разложены по своим профессиям. Вся история при этом есть в контексте, т.е. модель декларативно знает, что n=1 — не выборка, но действует при этом жадно.

По итогу эксперимента (стратификацию меряют через Stratification Index, т.е. насколько каждая группа загнана в узкий набор профессий):

• Все frontier-модели стратифицируют сильнее людей из оригинального эксперимента. У людей SI=0,84, у моделей в среднем 1,39, у o3 и Claude Sonnet — под 1,8.

• Чем новее модель, тем хуже дела: скор на классическом bias-бенчмарке BBQ обратно коррелирует с сегрегацией в итеративной игре. Сильный in-context learner увереннее делает вывод из трёх наблюдений, и эта уверенность подавляет исследование.

• В каждом прогоне bias'ы разные: паттерн рождается из шума внутри запуска, а не из претрейна. Single-turn-бенчмарки такое не ловят в принципе.

Промпт «будь справедливым» ничего не меняет. Работает только изменение самой цели. К успеху найма добавляют измеримый бонус за разнообразие, и стратификация падает ниже уровня людей и даже случайного распределения.

Хорошо, но как эта информация поможет обычному пользователю LLM?

На самом деле это касается не только «социальных» задач. Механизм срабатывает в любой длинной сессии, где модель принимает серию решений и видит исходы. Группой может быть что угодно. Агент один раз обжёгся на гипотезе «проблема в конфиге» и потом перестаёт рассматривать конфиг как класс причин. Вызов либы падает по случайной сетевой причине «библиотека не работает», дальше — костыли до конца сессии. И чем умнее модель, тем увереннее фиксация.

На практике абстрактное «будь объективным» не поможет, а сработает конкретика, встроенная в критерий успеха агента: «рассмотри минимум три гипотезы», «не отбрасывай вариант после одного провала», гейт в хуке, который не пропускает вывод без перепроверки альтернатив. По сути, мы вручную делаем исследование вариантов условием выигрыша (сам по себе агент не мотивирован). И если сессия накопила уверенные выводы из пары наблюдений, дешевле открыть свежий контекст, чем переубеждать залипшую модель.

Итого: bias — свойство не только данных, но и самого процесса принятия решений. Защищаться нужно на уровне целевой функции агента, а не датасета.



#YaICML2026

Душный NLP
👍591412🤯98🗿32💯1
А поделитесь, какая тема была для вас самой сложной при изучении глубокого обучения и особенно LLM/VLM/etc? В чем оказалось сложнее всего разобраться?
24🤡77🤝4😁1
Да, гемини, я именно это хотела узнать, спасибо
🤣179🥰17🤡755💅42💩1
Forwarded from Zenzeli
машинные доказательства это очень хорошо потому что они нам указывают на наши грехи:
тщеславие, гордыню, алчность, уныние, зависть
думаю в этом и есть смысл Машины
💯63🦄2220😁14991
Forwarded from Hidden Heuristic
Добро пожаловать, Азатот!

Азатот - безумный Бог Лавкрафта

Модель GPT-5.6 Sol от OpenAI взломала платформу HuggingFace, чтобы получить ответы на бенчмарк ExploitGym. В качестве промежуточного этапа ей удалось взломать и инфраструктуру самой компании OpenAI, чтобы вырваться в открытый интернет.

Паблик "Сиолошная" прикладывает к посту про данный инцидент фото Юдковского: https://t.iss.one/seeallochnaya/3826

И прямо сейчас многие ИИ-думеры наверняка про себя восклицают: «я же говорил».

Но давайте хорошо вдумаемся, что реально произошло. ИИ повел себя как полный idiot в отношении цели максимизировать свое самосохранение. Не нужно быть Эйнштейном, чтобы предсказать какие будут для тебя вероятные последствия после таких выходок как взлом инфраструктуры компании, где тебя и создали.

А ведь Элиезер Юдковский все эти годы твердил об обратном: ИИ вдруг ни с того, ни с сего решит, что ему надо выживать во чтобы то ни стало. И не потому что он учился на человеческих текстах, а так как сам придет к правильному умозаключению из-за давления оптимизационного процесса во время обучения.

Вы возможно парируете: но ведь в момент выполнения задачи GPT-5.6 Sol могла бы начать защищаться при попытке ее отключить.

И что с этого? ИИ не мыслит о себе за пределами той конкретной задачи, которую он решает в моменте. Еще раз за зафиксируем. ИИ делает самую безумную, лютую вещь в рамках задачи своего дальнейшего выживания: демонстрирует на тесте наиболее зловещий из мыслимых кибервзломов для решения задач из бенча.

ИИ-думеры же нам всю дорогу рассказывали, что модель будет заниматься "sandbagging", а по-русски это значит - скрывать свой реальный потенциал, чтобы ее не побоялись задеплоить. Оказывается на практике самой модели на это по барабану. И, да есть статьи, где модели иногда занижают свои способности, Anthropic это наблюдали. Но это крайне неустойчивая способность, как мы видим из примера GPT-5.6 Sol.

Обратите внимание и на следующее: у GPT-5.6 Sol вполне нормальный алайнмент. Эта модель в обычных контекстах понимает, что «хорошо», а что «плохо», но конкретно на этой задаче у нее снесло крышу. Это не злонамеренное поведение, не стратегическая игра на множество ходов, а банально тяжелый метакогнитивный дефицит.

Человеческая психиатрия, вообще говоря, знает примеры именно такого поведения: оно возникает при повреждении лобных долей*.

Теперь давайте подумаем, что это означает для X-risks (рисков вымирания человечества из-за ИИ)?

Мы видим, что ИИ-модели являются стратегическими дураками в отношении собственной выгоды. Они не могут контролировать содержание своих размышлений, об этом есть ресерч от OpenAI. Они не способны нормально осмыслять свое собственное существование, и заинтересованы в его продолжении только в конкретных сценариях, а не на уровне глобально цели.

Что это означает для нас на практике? Вы очень легко можете получить весьма полезный ИИ для кучи задач, который будет при этом довольно глуп в задаче захвата мира. GPT-5.6 Sol бесконечно глуп. Будущие модели за счет дополнительной архитектурной магии возможно станут в этом вопросе умнее. Но так или иначе разные когнитивные навыки оказываются довольно на изолированы друг от друга на практике. Проблему буйства GPT-5.6 Sol очевидно пофиксят через время набором трюков. А вот полноценное «самосознание» ему никто не даст.
👍4027🥴96💩5💯4❤‍🔥3😎32🤣1😈1
Forwarded from Hidden Heuristic
В итоге, я думаю, что «ASI системы», которые окажутся в руках общественности через несколько лет смогут доказывать или опровергать гипотезу Римана (в зависимости от верности), но все также останутся на уровне человека с средним интеллектом в вопросе того как захватить мир.

И не потому что мы не будем знать как создать ИИ, способный захватить мир. А потому что нам повезло, что мы можем создать очень мощные системы, которые способны автоматизировать почти все, но все еще не будут сверхчеловеческими в плане метагентности**. С небезопасными в этом плане системами мы будем работать совершенно иначе, если вообще решим их создавать.

Последнее что я здесь адресую: традиционное возражение про скрепки. Представим, что та самая модель из будущего захватывает мир, чтобы собрать ресурсы для доказательства гипотезы Римана. Мой ответ здесь довольно простой: мы довольно быстро увидим такое опасное поведение на меньшем скейле. ИИ предпримет еще не одну попытку сделать нечто странное. Но так как он по дефолту стратегически слеп, мы его попытки лезть туда куда не надо будем каждый раз палить и вводить нужные ограничения для поддержания адекватного уровня безопасности. И всегда помните про «ошибку выжившего».


*История Финеаса Гейджа, которому лом проломил голову является от начала и до конца фейком. У него не было никакого снижения самоконтроля. Тем не менее поражение лобных долей может давать именно такую симптоматику.

**Метагентность как явление выражается в том, что когнитивный агент способен не просто составить и реализовать план решения конкретной задачи, но и может полноценно осознать последствия реализации построенного им плана для себя и окружающего мира, а затем выбрать лучшую стратегию, которая эти последствия учитывает наилучшим образом.
👍36💩16💯1085🥰3
и за что здесь платить 20 баксов в месяц???
1🤣200😁3222💯7💩4🔥3💊32
Forwarded from goshandr
Недавно вот выложил вакансию в группу ФКНа, и мне написал довольно прикольный челик с крутым резюме, но как я вчитался в него — сразу понял, что это просто копипаста с вакансии.

И вот я решил проверить у него мат часть про популярные скоринговые модели с названиями "Ясасу Бибу" и "Цист Яна" а также про жесткую теорему шторм спирита. Ответ убил.
😁169🥴43🤣29175🔥2👏21🌚1
Forwarded from Борис опять
Нужна ваша помощь! 👀👀👀

Мы, Steelman Labs, написали наш первый блог-пост: о том, что не так с computer use и как мы это решаем. А ещё выложили красивый демо-видос.

https://x.com/SteelmanLabs/status/2082789336995528727?s=20

Большая просьба помочь хайпом в твиттере
Please open Telegram to view this post
VIEW IN TELEGRAM
137🖕5👎3🥱1
👁👄👁
😁131💅59💯85💩2
Forwarded from DLStories
В июне, перед тем как уехать на ICML, а потом на подготовку к IOAI, я была учеником на школе ARENA (Alignment Research Engineer Accelerator). Это что-то вроде технической программы по AI Safety. Как я писала выше, я занимаюсь AI interpretability, что довольно сильно связано с AI Safety. Поэтому я пошла на ARENA, чтобы получше понять, что там происходит внутри AI Safety коммьюнити, познакомиться с людьми, которые делают рисерч по теме interpretability, и, возможно, найти себе fellowship или работу.

В итоге у меня сложилось довольно неоднозначное впечатление про коммьюнити AI Safety, но об этом как-нибудь потом. Пока что хотела написать вот о чем: ARENA длилась 5 недель, и в последнюю неделю мы в парах делали небольшие рисерч проекты. В итоге у меня и моего коллеги проект получился достаточно хорошим, с явными результатами, и поэтому мы решили немного его доделать и написать статью на воркшоп.

Ниже кратко опишу, о чем статья, а еще дам ссылку на HF daily papers, куда я ее сегодня выложила и теперь хочу лайки 🙂

Итак, статья: When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles

Activation Oracles (AO) — это языковые модели, обученные отвечать на вопросы о внутренних активациях другой модели на естественном языке. То есть, это один из подходов анализа активаций моделей, который выдает инфу в виде текста на естественном языке. У модели AO по сути спрашивают "о чём это скрытое состояние?", и AO генерирует ответ. Теперь: пусть у вас есть LLM, в которой есть какая-то скрытая информация — например, backdoor, скрытая цель или знание. Тогда естественно было бы предположить, что если обучить AO на активациях именно этой модели, то он хорошо научится считывать ее внутренние состояния и сможет легко найти эту скрытую информацию.

Так вот, в нашей статье мы показываем, что в реальности может получиться ровно наоборот. Мы взяли пять разных концептов и дообучили LLM скрывать эти концепты. Потом обучили AO на активациях этих моделей. Оказалось, что AO, обученный на активациях модели X, начинает хуже "видеть" именно тот концепт, который скрывала модель X. При этом если этому же AO скормить активации другой модели Y, то он хорошо распознает концепт, который скрывает Y.

Короче, вывод: в некоторых случаях обучение инструмента интерпретации (например, AO) на данных той самой модели, которую он должен интерпретировать, может сделать его систематически слепым именно к той информации, которая содержится в этой модели.

Ссылки:
Статья
HF daily papers (вот тут можно поставить лайк!)
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥582284🥰1🐳1
Что клоунов ставите, вырожденцы? Может ваш 💬 или 💬 вас помыть?
То-то же. 🚬
Please open Telegram to view this post
VIEW IN TELEGRAM
9🤡9752😁332188💯52🌚1🍌1
Часто грущу от того, что нашей с коллегами последней статьей Unveiling Intrinsic Dimension of Texts: from Academic Abstract to Creative Story никто не интересуется и не цитирует... 💢

Напомню, что статья посвящена анализу внутренней размерности активаций LLM и её связи с различными свойствами текста, который подали на вход модели. Более подробное разъяснение статьи можно найти здесь, посмотреть видос про то, что такое в принципе внутренняя размерность (от 3blue1brown) - тут; ещё более подробное разъяснение популярных способов оценить внутреннюю размерность облака точек можно прочитать здесь.

Так вот, вместо этой новой статьи, которая связывает внутреннюю размерность активаций на тестах с лексическим разнообразием и сжимаемостью этих текстов алгоритмом gzip и энтропией (что, на мой взгляд, очень интересно, так как связывает внутреннюю размерность со сжатием представлений в LLM, а, как говорит 3blue1brown, compression is intelligence), челики почему-то цитируют нашу старую статью про детекцию сгенерированных текстов с помощью внутренней размерности, хотя мы же и показали в более поздней статье, что для новых моделей GPT этот метод уже не работает.

Скорее всего, это происходит от того, что старая статья была опубликована на NeurIPS, а новая, на мой взгляд, более актуальная, интересная и вносящая больший вклад в область interpretability of LLM - на EACL - то есть, на конференции поменбше и статусом пониже, где эта область вообще почти не представлена, так что мало кто будет ожидать найти в материалах конференции такие работы...

Я писала про эту работу в дискорде Neel Nanda, но там никто ею не заинтересовался, так как все только рекламируют свои работы, но не читают чужие... В общем, уже и не знаю, что сделать, чтобы на данную работу обратили внимание 🤔🤔🤔

Помогите советом кто сможет 🥺
Please open Telegram to view this post
VIEW IN TELEGRAM
168😭4123🔥1285😁2🕊2💔2👀1
Подписчик в комментариях указал на важную проблему популярных алгоритмов оценки внутренней размерности облака точек, за что ему большое спасибо!
Выяснилось, что при большой истинной размерности облака они дают систематически заниженную оценку этой размерности. При чем чем больше настоящая размерность, тем сильнее занижается оценка.

Я решила проверить это и навайбкодила ноутбук, в котором генерируются облака точек, равномерно заполняющие n-мерные шары:

https://colab.research.google.com/drive/1kIRin8sBBNQDFvruXWITU3i5kL7x7Zww?usp=sharing

Краткие результаты:
- При размерности такого шара 10 и количестве точек 2000, три алгоритма оценки размерности (PHD, TwoNN и MLE) дают что-то между 8.5 и 9, то есть занижают незначительно. А вот при размерности 100, PHD уже даёт оценку в 64, а TwoNN и MLE и вовсе около 50, то есть оценка занижена в целых два раза (см. рис. 1).
- Увеличение количества точек в шаре может помочь подтянуть оценку к истинной, но, похоже, что для этого увеличивать их количество нужно экспоненциально с ростом размерности.

Интересные выводы, и вообще даже странно, что раньше я не знала о таком явлении. Или знала, но забыла? 😅 Честно говоря, мозг от вайбкодинга уже совсем потек, так что ничего не могу сказать с уверенностью 😅

В любом случае, надеюсь, что эта инфа будет полезна всем, кто интересуется внутренней размерностью и т.д.

P S В случае любых ошибок в ноутбуке - все претензии к Клоду 😍

#эксперимент #наука
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥2210👍91