Le fait Le 13 août, un stack d'observabilité auto-hébergé (Prometheus, Grafana, OpenTelemetry) a cessé d'écrire sur disque. Erreur "no space left on device", 60 fois par heure. Pendant des heures. Pourtant : la page de statut publique affichait des chiffres corrects. Les health checks HTTP étaient verts. Grafana dessinait des graphes. Pourquoi : Prometheus répond aux requêtes depuis le head block en mémoire. De l'extérieur, une base qui n'a rien persisté depuis des heures est indistinguable d'une base saine. (https://dev.to/mk023/the-alarm-wasnt-silent-it-was-lying-iam)
Et alors, lundi matin Tes dashboards mesurent ce qui va bien, pas ce qui casse. Un health check HTTP qui répond 200 ne prouve pas que tes données sont écrites. Si ton monitoring ne surveille pas sa propre capacité à persister, tu pilotes à l'aveugle.
ON ACHÈTE - vérifie tes propres sondes.
Sourcé Source
Le contexte Ce signal vient de l'édition du 2026-08-20, où il est remis dans la sélection du jour.