Практические заметки

Решения по observability из реального production

Я пишу о решениях, от которых зависит надежная telemetry: что проверяю, что меняю и почему это важно во время инцидента.

Рафаэль Фахреев, Observability Expert
Реакция на инциденты7 минут

Мониторинг работает. Почему инциденты все равно начинаются с догадок?

Dashboards могут быть зелеными, alerts могут приходить вовремя, а у инженера все равно нет надежного пути от влияния на пользователя до сломанного компонента.

22 июля 2026Читать статью
OpenTelemetry8 минут

Как я довожу OpenTelemetry Collector от proof of concept до production

Collector, который экспортировал demo trace, еще не стал production pipeline. До rollout я проверяю topology, backpressure, state, routing и его собственную telemetry.

22 июля 2026Читать статью
Alerting и SLO7 минут

Я не лечу alert fatigue настройкой thresholds

Threshold tuning может убрать шум на неделю. Я исправляю operating model: user impact, ownership, severity, действие и осознанная SLO policy.

22 июля 2026Читать статью