Reliable ML

Оценка неопределенности, как быть?
Пост от читателя канала — Максима Кочурова, партнера PyMC Labs

Для построения надежных ML-систем нам нужно не только построить систему, предсказывающую интересующие нас переменные, но и оценить неопределенность предсказания. Эту проблему решают с помощью conformal prediction. Байесовские модели тоже оценивают неопределенность, но делают это немного иначе - различается сам подход к моделированию.

Conformal prediction позволяет получить оценку неопределенности в виде, например, интервалов, содержащих истинное значение с заданной вероятностью. Это model-agnostic подход, который может быть использован с любой моделью машинного обучения. Но эта оценка дается только для целевой переменной.

В противоположность этому байесовские методы явно описывают неопределенности процесса, которым генерируются данные. Мы получаем не только оценку неопределенности нашей целевой переменной, но и вероятностную оценку параметров модели. Когда это может быть важно?

В целом, можно разделить прикладные задачи датасаентиста по степени их «прозрачности»: white, grey, black. Вы наверняка слышали эти термины, между ними принципиальная разница в том, как вообще обычно формулируется постановка, и что в ней на самом деле важно. Условно, это качественная градация задач на “предсказывать” (black box), “предсказывать и делать интервенции”(causal grey box), “предсказывать, делать интервенции, находить неэффективности” (white box).

Если с black box задачами все понятно, то во многих чувствительных приложениях нам важен не только результат, но и параметры процесса. Когда нам нужно организовать валидацию модели экспертами, перенос знаний экспертов доменной области в модель, а так же валидацию экспертами закономерностей, выявленных моделями, нам нужны прозрачные модели, явно формулирующие предположения о процессе генерации данных.

Байесовские модели — самый очевидный выбор для построения таких white-box моделей.

В статье от нашего читателя Максима Кочурова из PyMC Labs выясняем что, как и зачем. Максим также прочитал прекрасный вводный доклад о байесовских методах в июне на секции Reliable ML на Data Fest 2023.

Ваш @Reliable ML

#tech #reliable_ml #bayes_in_ml

👍12❤4🔥1

6.64K viewsedited 15:51