Observability: Prometheus, Grafana, AlertManager и Jenkins
Курс имеет ярко выраженную практическую направленность и состоит на 75% из лабораторных работ (Hands-on labs). Вы научитесь с нуля разворачивать production-ready стек на базе Prometheus, Grafana и AlertManager, а также интегрировать его с Jenkins для авто-ремедиации
от 48 300₽
Для физ. лиц - 48 300₽
Для организаций - 54 100₽
Ближайшая группа
19.10.2026-22.10.2026
Формат
Гибридный
Длительность
32 часа
Часы занятий
10:00–17:00
Целевая аудитория
DevOps-инженеры
Инженер по надёжности сайтов (SRE)
Системные администраторы
Backend-разработчики
Необходимая предварительная подготовка
- навыки системного администрирования операционных систем семейства Linux
- опыт работы в Docker
- понимание основ CI/CD
- базовое понимание сетей
Получаемые знания и навыки
После курса вы сможете с нуля развернуть production-ready стек observability, настроить алертинг с умной маршрутизацией и реализовать сценарии авто-восстановленияот 48 300₽
Для физ. лиц - 48 300₽
Для организаций - 54 100₽
Программа курса
Лабораторная работа:
- Развернуть стек (K8s Helm / Docker Compose)
- Настроить Service Discovery
- Написать PromQL на реальных метриках
- Дашборды «Self Monitoring» и «Cluster Overview»
- Разбор антипаттернов
Лабораторная работа:
Часть A: Инфраструктурные + K8s‑метрики
- Node Exporter, cAdvisor, Blackbox Exporter
- K8s‑метрики (kube‑state‑metrics, CoreDNS)
- Дашборды «Infrastructure Overview» и «K8s Cluster Health»
Часть B: Журналирование с Loki
- Loki + Promtail, сбор JSON‑логов
- LogQL на практике
- Дашборд «Error Logs» с корреляцией по trace_id
Часть C: Трейсинг с OTel + Tempo
- OTel Collector + Tempo
- Готовое приложение: настройка коллектора
- Сквозная корреляция: алерт → лог → трейс → span
Лабораторная работа:
- Установка AlertManager
- Типовые правила: HighCPU, DiskSpaceLow, ServiceDown
- SLO‑алерт: multi‑window burn‑rate
- Inhibition: DiskFull подавляет DatabaseDown
- Telegram/Slack интеграция + Go Templates
Лабораторная работа:
- Jenkins как webhook receiver: авто‑ресайз/перезапуск, тикет в Jira/YouTrack
- Журналирование авто‑действий в Loki
- Дашборд «Auto‑remediation History»
- Миграция на VictoriaMetrics Single Node + remote_write
- Recording Rules для тяжёлых запросов
Лабораторная работа:
- Структура Git‑репозитория
- Provisioning: datasources.yaml, dashboards.yaml
- promtool check rules + линтер в CI
- Развернуть тестовое приложение (Nginx + Python load-generator)
- Полный стек: Prometheus + AlertManager + Grafana + Loki + Jenkins
- Алерт HighCPU → Webhook → Jenkins → restart
- Имитация сбоя: stress-ng
- Проверка цикла: Firing → Remediation → Resolved → лог в Loki
- Визуализация всего цикла на одном дашборде
Стоимость и условия оплаты
от 48 300₽
Для физ. лиц - 48 300₽
Для организаций - 54 100₽