Практические заметки
Решения по observability из реального production
Я пишу о решениях, от которых зависит надежная telemetry: что проверяю, что меняю и почему это важно во время инцидента.
Рафаэль Фахреев, Observability ExpertPRODUCTION / INCIDENT 042LIVE
Gateway99.98%
Checkout3.8s
Payments APIOWNER?
Реакция на инциденты7 минут
Мониторинг работает. Почему инциденты все равно начинаются с догадок?
Dashboards могут быть зелеными, alerts могут приходить вовремя, а у инженера все равно нет надежного пути от влияния на пользователя до сломанного компонента.
22 июля 2026Читать статью →
OTEL / PIPELINEHEALTHY
01RECEIVEOTLP
02PROCESSbatch · memory
03EXPORTqueue · retry
QUEUE38 / 100
OpenTelemetry8 минут
Как я довожу OpenTelemetry Collector от proof of concept до production
Collector, который экспортировал demo trace, еще не стал production pipeline. До rollout я проверяю topology, backpressure, state, routing и его собственную telemetry.
22 июля 2026Читать статью →
ON-CALL / DECISION PATHOWNED
SIGNALUser error rate
SEVERITYPage
OWNERCheckout SRE
ACTIONProtect checkout
BURN RATE12.4×
Alerting и SLO7 минут
Я не лечу alert fatigue настройкой thresholds
Threshold tuning может убрать шум на неделю. Я исправляю operating model: user impact, ownership, severity, действие и осознанная SLO policy.
22 июля 2026Читать статью →
