Как мониторить Java-приложения: метрики, алерты и правило 80/20
📌 Подробнее: https://habr.com/ru/companies/yandex/articles/1068874/
MemOps🤨
Хороший мониторинг помогает быстро понять, что происходит с приложением и куда смотреть в первую очередь. Для этого не нужно пытаться измерить всё: базовый набор технических метрик покрывает большинство типовых проблем, а бизнес-метрики, SLO и анализ аномалий помогают заранее замечать нетипичные отклонения. В Календаре мы называем этот подход правилом 80/20.
Всем привет! Меня зовут Настя, я бэкенд-разработчик в Яндекс 360 и отвечаю за надёжность Календаря. В этой статье я покажу, какие метрики стоит взять за основу, как выбирать полезные алерты и чем дополнять базовый набор для оставшихся 20%.
В статье хороший разбор подхода 80/20: какие метрики реально ловят большую часть проблем, зачем следить за RED, лагами очередей, connection pool и JVM, когда нужны бизнес-метрики и SLO, и почему аномалии иногда полезнее очередного статического порога.
Отдельно плюсую за onepager, drill-down и ранбуки. Потому что хороший мониторинг — это не «у нас есть график на всё», а «мы быстро поняли, что сломалось и что делать дальше».
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Please open Telegram to view this post
VIEW IN TELEGRAM
❤17🫡3🤯1🌚1
Kubernetes и энергопотребление
📌 Подробнее: https://kubernetespodcast.com/episode/270-kepler/
MemOps🤨
Kubernetes Podcast про Project Kepler — open-source проект для наблюдения за энергопотреблением Kubernetes-нагрузок.
В гостях Ники Маноледаки, Staff Platform Engineer в Grafana Labs и мейнтейнер Project Kepler. Вместе с ведущими она обсуждает, как оценивать энергопотребление рабочих нагрузок, какие метрики для этого можно собирать и почему получить реально точные данные не так просто.
Отдельно поговорили о том, зачем Kepler недавно переписали, как проект использует eBPF и Prometheus и при чём здесь растущие вычислительные нагрузки AI.
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
Kubernetespodcast
Kubernetes Podcast from Google: Episode 270 - Measuring Sustainability via Project Kepler, with Niki Manoledaki
Niki Manoledaki is a Staff Platform Engineer at Grafana Labs, A CNCF Ambassador and Green Software Foundation Champion, and a core maintainer of Project Kepler. We explore the recent rewrite of Project Kepler and the challenges of measuring sustainability…
❤3
Читаете IT-новости — а там снова политика, слухи и копипаст?
AgentNews оставляет только то, что действительно произошло в технологиях. 40 российских и зарубежных источников, двойная проверка фактов и короткое объяснение: что случилось и почему это важно.
ИИ, разработка, кибербезопасность, железо, гаджеты, игры, наука и космос. Всё по-русски, без кликбейта и информационного шума.
Читать AgentNews →
AgentNews оставляет только то, что действительно произошло в технологиях. 40 российских и зарубежных источников, двойная проверка фактов и короткое объяснение: что случилось и почему это важно.
ИИ, разработка, кибербезопасность, железо, гаджеты, игры, наука и космос. Всё по-русски, без кликбейта и информационного шума.
Читать AgentNews →
PromQL Anomaly Detection Framework
📌 Подробнее: https://github.com/grafana/promql-anomaly-detection
MemOps🤨
Фреймворк строит верхние и нижние границы для метрик, учитывает краткосрочную изменчивость и сезонность, а затем алертит, когда значение выходит за ожидаемый диапазон. Есть несколько стратегий детектирования: от адаптивной на основе среднего и стандартного отклонения до более устойчивой к выбросам через median/MAD.
Поддерживаются типовые сценарии для request rate, latency, errors и resource-метрик, а сами anomaly bands можно накладывать поверх графиков в Grafana.
Хороший вариант, когда хочется добавить динамический anomaly detection поверх обычного Prometheus, не таща отдельную систему анализа временных рядов.
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1