the hard bits
384 subscribers
8 photos
1 file
14 links
мысли о безопасности искусственного интеллекта
Download Telegram
AI Alignment Evals Hackathon
25 января – 2 февраля

Оценка возможностей моделей сейчас в топе приоритетов сейфти и туда вливается много улисий:

– Недавно прошла evals bounty программа от AISI с очень сочными призами для _всех_ чьи работы прошли отбор
– Институт MIRI переключился на оценку evals'ов, чтобы помогать направлять усилия на самое важное
Большая часть фандинга идет на evals'ы
– Было много другого. Это что вспомнилось сразу

И, вот, скоро пройдет хакатон от Кабира Кумара в коллаборации с Apart Research на тему evals'ов. Выдержки из анонса:

​What you’ll learn

​– How to design a benchmark, from defining success metrics to setting up test cases and interpreting results.
​– How to use existing benchmarks and apply them to real-world use cases.
​– How to fine-tune models and evaluate their impact on alignment outcomes.
​– How to develop adversarial test cases to identify weaknesses in current benchmarks.
​– How to train a cross-coder to compare fine-tined models against their base counterparts.


и

​What we can provide

​– 10 versions of a model, all sharing the same base but trained with PPO, DPO, IPO, KPO, etc.
​– Step-by-step guides for creating evals (i.e., what is it, how to run an eval, things to consider when making one, how to make one, etc.).
​– Tutorials on using HHH, SALAD-Bench, MACHIAVELLI, and more.
​– An introduction to Inspect, an evaluation framework by the UK AISI.


Мы с командой участвуем и вас приглашаем. Сейчас зарегистрировалось 117 человек

Детали и регистрация
🔥5🤔1
Evals at METR. Философия и практика. Елена Еричева
Запись доклада

Лена – опытный исследователь машинного обучения с более чем 10-летним опытом в биотехнологиях и медтехе. В METR занимается AI Alignment и AI Safety: исследует возможности ИИ-моделей, разрабатывает бенчмарки и проводит Blue Teaming с фокусом на безопасности. Специализируется на компьютерном зрении, NLP и эффективном применении современных LLM и VLLM. А еще ведет канал Mrs Wallbreaker about AI Risk, AI Alignment, AI Safety, AI Ethics, AGI

В докладе она рассказала:
– С чего начинается практическое исследование в AI Safety
– Почему METR концентрируется на AI capabilities и Responsible Research
– Как METR реализует свое исследование

Запись доклада
🔥8👍2
Курс по теории обучения
Gergely (ALTER) и Kōshin (Monastic Academy)

Cartesian framework for learning theory, MDPs/POMDPs, Learnability, Sample complexity, Bandits, VC dimension, PAC learning

Инфрабайесианство – надстройка над теорией вероятности, которая позволяет приблизить ее свойства к реальности, не теряя математического формализма. Основная цель – решить задачу agent foundations (на сегодня считается лучшей теоретической alignment аджендой).

Дедлайн заявки 1 марта, курс начинается 17 марта
🔥2🤔2
Forwarded from AI Safety. Основы
📣 Open-call: Курс по основам AI Safety

ИИ меняет мир с безумной скоростью, но вместе с этим несет в себе серьезные риски. Задача AI Safety – позаботиться, чтобы эти изменения были положительными

Цель курса – дать базу для начала карьеры в AI Safety. Программа знакомит с основными концепциями, ландшафтом исследований и работами Anthropic, Redwood Research, MIRI

📖 Программа из двух треков:
Учебный (4 недели): Знакомство с материалами в фасилитируемых группах
Проектный (7 недель): Работа с ментором нацеленная на публикацию

👥 Для кого?
Будущие рисечеры: ml'щики, физики, математики, программисты
Будущие фаундреры: предприниматели интересующиеся AI Safety

🎓 Сертификат по окончанию курса
👏 Карьерная консультация и менторское сопровождение для лучших студентов

🔫 Экспертиза менторов включает: evals, agent foundations, adversarial attacks, representation engineering, safety field building, mechanistic interpetability

💼 Этим курсом мы готовим людей себе в команды и в команды наших друзей по сейфти. Поэтому курс бесплатный. По этой же причине будет отбор кандидатов

🔢 Детали:
Очно в Москве или онлайн
Регистрация открыта до 21 февраля
Даты: 2 марта – 20 апреля
Нагрузка: 10-15 часов в неделю

💬 По вопросам пишите @anton_zheltoukhov

➡️➡️ Зарегистрироваться
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥61🤮1