Monitoring

Arrêt sur significativité

Arrêtez tôt quand la preuve le justifie réellement, jamais quand elle en a seulement l'air.

Deux tests doivent concorderDate de fin requiseSoumis aux contrôles de fiabilité

Arrêter dès qu'un test franchit une valeur p sous 0,05 est un cas d'école d'arrêt optionnel. Regarder à répétition et s'arrêter au premier franchissement gonfle le taux de faux positifs bien au-delà des cinq pour cent nominaux, et un contrôle automatisé regarde toutes les minutes, ce qui en est le pire cas.

La règle est donc prudente. Un arrêt automatisé exige que le test séquentiel et la valeur p corrigée concordent, sur la même variante, dans le même sens. Le test séquentiel est valide sous surveillance continue ; la valeur p corrigée est une aide de lecture pour une personne qui regarde occasionnellement, et n'est pas à elle seule une règle d'arrêt valide.

Cela a une conséquence connue, que la plateforme applique plutôt que de la masquer. Le test séquentiel est calibré pour un objectif de gain fixe, si bien qu'un test à effet réel mais plus petit le laisse lire aucun effet pendant que la valeur p finit par lire significatif. Les deux ne concordent jamais, rien ne se déclenche, et le test va jusqu'à sa fin planifiée. C'est pourquoi une date de fin planifiée est obligatoire avec ce réglage : la significativité ne peut que terminer un test plus tôt, jamais être la seule chose qui le termine.

Trois contrôles de fiabilité se dressent devant tout ce chemin. Une répartition qui ne correspond plus, une journée entière sans trafic, ou une interférence venue d'un autre test en cours bloquent chacun l'arrêt, parce que la lecture sur laquelle il se fonderait n'est pas fiable.

De meilleurs tests, de meilleures conversions

Test on all visitors with the world’s lightest script and make confident decisions powered by real-time reporting.