Техножрица 👩‍💻👩‍🏫👩‍🔧
14.8K subscribers
1.56K photos
74 videos
28 files
815 links
Люблю высокие технологии и кушать.

Добро пожаловать, если в сферу твоих интересов тоже входят математика, DL, NLP, программирование на Python, или тебе просто любопытно, о чем на досуге размышляют люди, занимающиеся разработкой и исследованиями в ML.
Download Telegram
Forwarded from goshandr
Недавно вот выложил вакансию в группу ФКНа, и мне написал довольно прикольный челик с крутым резюме, но как я вчитался в него — сразу понял, что это просто копипаста с вакансии.

И вот я решил проверить у него мат часть про популярные скоринговые модели с названиями "Ясасу Бибу" и "Цист Яна" а также про жесткую теорему шторм спирита. Ответ убил.
😁170🥴43🤣29175🔥2👏21🌚1
Forwarded from Борис опять
Нужна ваша помощь! 👀👀👀

Мы, Steelman Labs, написали наш первый блог-пост: о том, что не так с computer use и как мы это решаем. А ещё выложили красивый демо-видос.

https://x.com/SteelmanLabs/status/2082789336995528727?s=20

Большая просьба помочь хайпом в твиттере
Please open Telegram to view this post
VIEW IN TELEGRAM
137🖕5👎3🥱1
👁👄👁
😁133💅61💯85💩2
Forwarded from DLStories
В июне, перед тем как уехать на ICML, а потом на подготовку к IOAI, я была учеником на школе ARENA (Alignment Research Engineer Accelerator). Это что-то вроде технической программы по AI Safety. Как я писала выше, я занимаюсь AI interpretability, что довольно сильно связано с AI Safety. Поэтому я пошла на ARENA, чтобы получше понять, что там происходит внутри AI Safety коммьюнити, познакомиться с людьми, которые делают рисерч по теме interpretability, и, возможно, найти себе fellowship или работу.

В итоге у меня сложилось довольно неоднозначное впечатление про коммьюнити AI Safety, но об этом как-нибудь потом. Пока что хотела написать вот о чем: ARENA длилась 5 недель, и в последнюю неделю мы в парах делали небольшие рисерч проекты. В итоге у меня и моего коллеги проект получился достаточно хорошим, с явными результатами, и поэтому мы решили немного его доделать и написать статью на воркшоп.

Ниже кратко опишу, о чем статья, а еще дам ссылку на HF daily papers, куда я ее сегодня выложила и теперь хочу лайки 🙂

Итак, статья: When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles

Activation Oracles (AO) — это языковые модели, обученные отвечать на вопросы о внутренних активациях другой модели на естественном языке. То есть, это один из подходов анализа активаций моделей, который выдает инфу в виде текста на естественном языке. У модели AO по сути спрашивают "о чём это скрытое состояние?", и AO генерирует ответ. Теперь: пусть у вас есть LLM, в которой есть какая-то скрытая информация — например, backdoor, скрытая цель или знание. Тогда естественно было бы предположить, что если обучить AO на активациях именно этой модели, то он хорошо научится считывать ее внутренние состояния и сможет легко найти эту скрытую информацию.

Так вот, в нашей статье мы показываем, что в реальности может получиться ровно наоборот. Мы взяли пять разных концептов и дообучили LLM скрывать эти концепты. Потом обучили AO на активациях этих моделей. Оказалось, что AO, обученный на активациях модели X, начинает хуже "видеть" именно тот концепт, который скрывала модель X. При этом если этому же AO скормить активации другой модели Y, то он хорошо распознает концепт, который скрывает Y.

Короче, вывод: в некоторых случаях обучение инструмента интерпретации (например, AO) на данных той самой модели, которую он должен интерпретировать, может сделать его систематически слепым именно к той информации, которая содержится в этой модели.

Ссылки:
Статья
HF daily papers (вот тут можно поставить лайк!)
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥582284🥰1🐳1
Что клоунов ставите, вырожденцы? Может ваш 💬 или 💬 вас помыть?
То-то же. 🚬
Please open Telegram to view this post
VIEW IN TELEGRAM
9🤡10254😁402288💯52🌚1🍌1
Часто грущу от того, что нашей с коллегами последней статьей Unveiling Intrinsic Dimension of Texts: from Academic Abstract to Creative Story никто не интересуется и не цитирует... 💢

Напомню, что статья посвящена анализу внутренней размерности активаций LLM и её связи с различными свойствами текста, который подали на вход модели. Более подробное разъяснение статьи можно найти здесь, посмотреть видос про то, что такое в принципе внутренняя размерность (от 3blue1brown) - тут; ещё более подробное разъяснение популярных способов оценить внутреннюю размерность облака точек можно прочитать здесь.

Так вот, вместо этой новой статьи, которая связывает внутреннюю размерность активаций на тестах с лексическим разнообразием и сжимаемостью этих текстов алгоритмом gzip и энтропией (что, на мой взгляд, очень интересно, так как связывает внутреннюю размерность со сжатием представлений в LLM, а, как говорит 3blue1brown, compression is intelligence), челики почему-то цитируют нашу старую статью про детекцию сгенерированных текстов с помощью внутренней размерности, хотя мы же и показали в более поздней статье, что для новых моделей GPT этот метод уже не работает.

Скорее всего, это происходит от того, что старая статья была опубликована на NeurIPS, а новая, на мой взгляд, более актуальная, интересная и вносящая больший вклад в область interpretability of LLM - на EACL - то есть, на конференции поменбше и статусом пониже, где эта область вообще почти не представлена, так что мало кто будет ожидать найти в материалах конференции такие работы...

Я писала про эту работу в дискорде Neel Nanda, но там никто ею не заинтересовался, так как все только рекламируют свои работы, но не читают чужие... В общем, уже и не знаю, что сделать, чтобы на данную работу обратили внимание 🤔🤔🤔

Помогите советом кто сможет 🥺
Please open Telegram to view this post
VIEW IN TELEGRAM
170😭4224🔥1285💔4😁2🕊2👀1
Подписчик в комментариях указал на важную проблему популярных алгоритмов оценки внутренней размерности облака точек, за что ему большое спасибо!
Выяснилось, что при большой истинной размерности облака они дают систематически заниженную оценку этой размерности. При чем чем больше настоящая размерность, тем сильнее занижается оценка.

Я решила проверить это и навайбкодила ноутбук, в котором генерируются облака точек, равномерно заполняющие n-мерные шары:

https://colab.research.google.com/drive/1kIRin8sBBNQDFvruXWITU3i5kL7x7Zww?usp=sharing

Краткие результаты:
- При размерности такого шара 10 и количестве точек 2000, три алгоритма оценки размерности (PHD, TwoNN и MLE) дают что-то между 8.5 и 9, то есть занижают незначительно. А вот при размерности 100, PHD уже даёт оценку в 64, а TwoNN и MLE и вовсе около 50, то есть оценка занижена в целых два раза (см. рис. 1).
- Увеличение количества точек в шаре может помочь подтянуть оценку к истинной, но, похоже, что для этого увеличивать их количество нужно экспоненциально с ростом размерности.

Интересные выводы, и вообще даже странно, что раньше я не знала о таком явлении. Или знала, но забыла? 😅 Честно говоря, мозг от вайбкодинга уже совсем потек, так что ничего не могу сказать с уверенностью 😅

В любом случае, надеюсь, что эта инфа будет полезна всем, кто интересуется внутренней размерностью и т.д.

P S В случае любых ошибок в ноутбуке - все претензии к Клоду 😍

#эксперимент #наука
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥4722👍1232💯11
Почему наблюдение за шебуршанием клод кода перед сном вызывает такое уютное чувство? Как будто ты уже постепенно начинаешь засыпать, и тебя ласково укутывает теплое одеяло нейрослопа, а киберпсихоз тихо и нежно напевает колыбельную на ушко 🥰
3134452810🥱6🥰44😁3