Monitoring
Alarmas de retraso y sin datos
Los dos fallos que nadie nota desde dentro de la pantalla de resultados: un test que sigue corriendo pasado su fin, y uno que dejó de recoger datos en silencio.
Un experimento con retraso estaba programado para terminar y no lo hizo. Sigue corriendo, sigue repartiendo tráfico, y le sigue costando la audiencia que consume, normalmente porque la decisión que produjo nunca se tomó. Se clasifica como una decisión pendiente y no como una avería, porque nada está roto y alguien solo necesita decidir.
Un experimento sin datos es el más urgente. Que no se registre nada durante un día entero mientras el test sigue en marcha casi siempre significa que una regla de segmentación dejó de aplicar, o que el script se perdió en un despliegue. Desde dentro de la pantalla de resultados esto parece una semana tranquila; desde fuera es un test que dejó de ser un test.
Las dos alarmas le llegan en lugar de esperar a que las encuentre. Las dos vienen activadas por defecto para correo y Slack, junto con el desajuste en el reparto de la muestra, porque las señales de salud se ganan la interrupción de una forma que los eventos de ciclo de vida no.
Una lectura sin datos también bloquea la parada automatizada. Actuar sobre una conclusión sacada de un experimento que dejó de recoger datos es exactamente el caso para el que existen los controles de confianza.