Monitoring
Alarmes de retard et d'absence de données
Les deux défaillances que personne ne remarque depuis l'écran des résultats : un test qui tourne encore au-delà de sa fin, et un test qui a cessé de collecter.
Un test en retard devait se terminer et ne l'a pas fait. Il tourne encore, répartit encore le trafic, et vous coûte encore l'audience qu'il consomme, généralement parce que la décision qu'il a produite n'a jamais été prise. Il est classé comme une décision en attente plutôt que comme un défaut, parce que rien n'est cassé et que quelqu'un doit simplement trancher.
Un test sans données est le plus urgent des deux. Rien d'enregistré pendant une journée entière alors que le test tourne toujours signifie presque toujours qu'une règle de ciblage a cessé de s'appliquer, ou que le script a disparu lors d'un déploiement. Depuis l'écran des résultats, cela ressemble à une semaine calme ; de l'extérieur, c'est un test qui a cessé d'en être un.
Les deux vous atteignent au lieu d'attendre d'être découverts. Les deux sont activés par défaut pour l'e-mail et Slack, avec l'écart de répartition, parce que les signaux de santé méritent une interruption comme les événements de cycle de vie ne le méritent pas.
Une lecture sans données bloque aussi l'arrêt automatisé. Agir sur une conclusion tirée d'un test qui a cessé de collecter est exactement le cas pour lequel les contrôles de fiabilité existent.