← édition du 2026-09-11
Signal Tech2026-09-11 · Lecture 1 min

Tes alertes monitoring ratent probablement les vrais incidents

Le fait Un support reçoit les mêmes plaintes : le site freeze 30 secondes, plusieurs fois par jour. Tous les graphes sont plats. Deux semaines à soupçonner le réseau client. Le problème : scrape à 60 secondes, rate window de 5 minutes, alert avec for: 5m. Un incident de 30 secondes dans cette chaîne devient un bump de quelques pourcents. Arithmétiquement invisible. (https://dev.to/sergey_shinder_ab2d943365/the-alert-that-never-saw-a-spike-shorter-than-its-own-window-39oa)

Et alors, lundi matin Ta chaîne de monitoring a un plancher : scrape interval × rate window × evaluation interval × for duration. Si ton incident est plus court, il n'existe pas. La solution : alerter sur le comptage de requêtes lentes/échouées, pas sur des moyennes. Une requête a dépassé 2 secondes ou non - ça ne se moyenne pas.

ON ACHÈTE - si tu as du monitoring Prometheus, vérifie tes fenêtres aujourd'hui.

Sourcé Source

Le contexte Ce signal vient de l'édition du 2026-09-11, où il est remis dans la sélection du jour.

Signal Tech - propulsé par Nuvo ReachRecevoir le Brief →