Statistika, kterou obhájíte
Sekvenční testování
Test, na který se smíte dívat kdykoli. Odpovídá na jinou otázku než p-hodnota a obě se mohou oprávněně rozejít.
Test s pevným horizontem je platný, pokud se na něj podíváte jednou, na konci. Podívejte se každý den a zastavte se u prvního překročení, a míra falešně pozitivních prudce vyskočí vysoko nad pět procent, o kterých si myslíte, že běžíte. Tohle není drobnost, je to nejčastější způsob, jak se programy experimentování oklamou samy.
Sekvenční testování je test navržený přesně pro tohle. Jeho míra chyby je pod kontrolou i při průběžném sledování, takže pohled devátý den je stejně platný jako pohled třicátý den, a na jasný výsledek lze jednat, jakmile přijde, a ne až to řekne kalendář.
Vysloví i druhý výsledek, což test s pevným horizontem nedokáže. Žádný efekt velikosti, kterou měl tento test najít, je skutečný závěr, a jednat podle něj uvolní provoz pro další nápad, místo aby se plochý test nechal běžet jen z naděje.
Ohledně automatizace je záměrně konzervativní. Automatické zastavení vyžaduje, aby se sekvenční test a korigovaná p-hodnota shodly, na stejné variantě, ve stejném směru. Vždycky se neshodnou, a známý případ je skutečný efekt menší, než na jaký je sekvenční test dimenzovaný: vysloví žádný efekt, zatímco p-hodnota nakonec vyjde významná, nic se nespustí a experiment doběhne do svého naplánovaného konce. To je zamýšlený směr, kterým to má selhat.