Весь стек мониторинга внутри одноплатника. Telegraf, InfluxDB и Grafana на процессоре RK3568
📌 Подробнее: https://habr.com/ru/companies/meta-catalog/articles/1078048/
MemOps🤨
Частый кейс в промышленной инженерии — предположим, понадобилось снимать телеметрию с управляемых iPDU в стойке. Стандартный маршрут включает виртуалку под Zabbix, рядом SQL-база, сверху веб-интерфейс, дальше по вкусу облако и оплата за хранение данных. В этом кейсе другой стек — Telegraf, InfluxDB и Grafana — целиком внутри промышленного одноплатника, который сидит в той же стойке, что и опрашиваемое оборудование, потребляет несколько ватт и настраивается из браузера с рабочего места.
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3
Автоматизация платформы не отбирает у вас интересные задачи. Она забирает рутину.
Deckhouse Platform берёт на себя обновление, масштабирование и поддержку инфраструктуры «из коробки». Освободившееся время остаётся вам — на то, что вам действительно нравится.
Обсудите с инженерами Deckhouse, что можно автоматизировать в вашем стеке 👈
Deckhouse Platform берёт на себя обновление, масштабирование и поддержку инфраструктуры «из коробки». Освободившееся время остаётся вам — на то, что вам действительно нравится.
Обсудите с инженерами Deckhouse, что можно автоматизировать в вашем стеке 👈
logporter — легковесная альтернатива cAdvisor для экспорта метрик из контейнеров Docker, сборщик логов для отправки в Lok и поиск новых версий образов в удаленных реестрах на основе семантического анализа тегов или дайджестов в одном контейнере.
📌 Подробнее: https://github.com/Lifailon/logporter
MemOps🤨
Экспортер logporter не использует низкоуровневые вызовы файловой системы, а собирает все метрики непосредственно из сокета Docker.
Проект поддерживает встроенную панель мониторинга, содержащую сводную информацию о состоянии всех контейнеров, образов и томов. Интерфейс основан на go-template и никак не влияет на производительность, поскольку использует кэшированные данные.
В комплекте готовый стек с prometheus, grafana и дашбоардами для легкого запуска одной командой.
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
Когда объявление инцидента становится любимым обходным решением для всех
📌 Подробнее: https://greatcircle.com/blog/2026/08/11/declaring-incidents-for-side-effects
MemOps🤨
Вы видите, как кто-то объявляет инцидент уровня Sev-2, и задаетесь вопросом: подождите, почему это вообще инцидент? Ничего не сломано. Клиенты не пострадали. Но менеджеру нужно было поднять проблему своей команды в приоритете другой команды, и процесс обработки инцидентов был надежным способом добиться этого.
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
Brent Chapman
When declaring an incident becomes everyone’s favorite workaround
When teams start declaring incidents for their side effects (e.g., deployment unfreezes, resource prioritization, or cross-functional coordination), that tells you something important about what's...
👍2
tailcat — ремикс открытых компонентов Tailscale, работающий как netcat, но поверх плоскости данных Tailscale, без плоскости управления Tailscale. Плоскость данных Tailscale (magicsock, внутренне) обеспечивает точечные туннели с шифрованием WireGuard® между двумя машинами, используя DERP в качестве побочного канала связи для пробива NAT и в качестве последнего резервного ретранслятора, если пробив NAT не удался. Вместо использования плоскости управления Tailscale все метаданные соединений tailcat обмениваются внеполосно, любым удобным для вас способом.
📌 Подробнее: https://github.com/tailscale/tailcat
MemOps🤨
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - tailscale/tailcat: like netcat, but over Tailscale's data plane, without Tailscale's control plane
like netcat, but over Tailscale's data plane, without Tailscale's control plane - tailscale/tailcat
👍3
Внутри Cilium CNI: решение загадочных таймаутов при настройке модуля Kubernetes
📌 Подробнее: https://www.adyen.com/knowledge-hub/inside-cilium-cni-solving-kubernetes-pod-setup-timeouts
MemOps🤨
В высокопроизводительных сетях 35 секунд - это целая жизнь. Это была задержка, необходимая для просмотра нашей таблицы отслеживания подключений, содержащей 7 миллионов записей, с максимальной скоростью 200 000 записей в секунду. На нашем пике в 16 миллионов записей этот последовательный поиск может занимать до 80 секунд, что приводит к тайм-аутам Cilium CNI, препятствующим запуску новых модулей на затронутых узлах.
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
Adyen
Solving mysterious Kubernetes pod setup timeouts by tuning conntrack garbage collection - Adyen
How Adyen resolved mysterious Kubernetes pod setup timeouts by optimizing Cilium CNI connection tracking garbage collection configuration.
👍2
aura —open-source платформа для создания SRE-агентов, рассчитанная на работу с реальной инфраструктурой. Она берёт на себя оркестрацию, хранение состояния, обработку ошибок, стриминг, аудит действий и защитные ограничения.
📌 Подробнее: https://github.com/mezmo/aura
MemOps🤨
Что умеет:
— объединять специализированных агентов в команду;
— подключать инструменты через MCP
— работать с OpenAI, Anthropic, Gemini, Bedrock, Ollama и другими моделями
— запрашивать подтверждение человека перед опасными действиями
— экспортировать все решения и вызовы инструментов в OpenTelemetry
— работать внутри собственного контура, включая изолированные среды
Конфигурация агентов, промпты, модели, инструменты и политики доступа описываются в TOML, их можно хранить в Git и проводить через обычный code review.
Из коробки есть интеграции с Kubernetes, Prometheus, Grafana, Datadog, PagerDuty, GitHub, Jira, Slack и другими системами. Запускать AURA можно локально в Docker или Kubernetes.
В общем и целом, это AI-помощник для расследования инцидентов.
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - mezmo/aura: AURA is a production-tested SRE agent platform you can deploy in minutes. AURA handles the guardrails, APIs…
AURA is a production-tested SRE agent platform you can deploy in minutes. AURA handles the guardrails, APIs, state management, streaming, and failure handling required to put AI to work safely on ...
👍2