Monitoring

Stopp ved signifikans

Stopp tidlig når bevisene genuint rettferdiggjør det, og aldri når det bare ser slik ut.

To tester må være enigeSluttdato krevesTillitsstyrt

Å stoppe i det øyeblikket en test krysser p under 0,05, er lærebokeksempelet på valgfri stopping. Å kikke gjentatte ganger og stoppe ved første kryssing blåser opp den falske positive-raten langt forbi de nominelle fem prosentene, og en automatisert sjekk kikker hvert eneste minutt, som er verstefallet av det.

Derfor er regelen konservativ. En automatisert stopp krever at den sekvensielle testen og den korrigerte p-verdien er enige, på samme variant, i samme retning. Den sekvensielle testen er gyldig under kontinuerlig overvåkning; den korrigerte p-verdien er en leshjelp for et menneske som ser på en gang iblant, og er ikke en gyldig stoppregel alene.

Dette har en kjent konsekvens, som plattformen håndhever heller enn skjuler. Den sekvensielle testen er dimensjonert for et fast mål-løft, så et eksperiment med en reell, men mindre effekt lar den lese ingen effekt mens p-verdien til slutt leser signifikant. De blir aldri enige, ingenting utløses, og eksperimentet kjører til sin planlagte slutt. Det er derfor en planlagt sluttdato er obligatorisk sammen med denne innstillingen: signifikans kan bare avslutte et eksperiment tidlig, aldri være det eneste som avslutter det.

Tre tillitsporter står foran hele løpet. En fordeling som sluttet å stemme, et helt døgn uten trafikk, eller interferens fra et annet eksperiment som kjører, blokkerer hver for seg stoppen, fordi avlesningen den ville bygget på, ikke kan stoles på.

Bedre eksperimenter, bedre konvertering

Test on all visitors with the world’s lightest script and make confident decisions powered by real-time reporting.