Estatísticas que você pode defender

Teste sequencial

Um teste que você tem permissão de olhar sempre que quiser. Ele responde uma pergunta diferente da do valor p, e os dois podem legitimamente discordar.

Válido a cada olhadaTambém declara não efeitoExigido na parada automática

Um teste de horizonte fixo é válido se você olhar uma vez, no final. Olhe todo dia e pare no primeiro cruzamento, e a taxa de falso positivo sobe bem além dos cinco por cento que você acha que está correndo. Isso não é um detalhe sutil; é a forma mais comum de um programa de experimentação se enganar.

O teste sequencial é feito para isso. A taxa de erro dele é controlada sob monitoramento contínuo, então uma olhada no dia nove é tão válida quanto uma no dia trinta, e um resultado claro pode ser aproveitado assim que aparece, e não só quando o calendário manda.

Ele também declara o outro desfecho, que um teste de horizonte fixo não consegue. "Nenhum efeito do tamanho que este teste foi construído para achar" é uma conclusão real, e agir sobre ela libera o tráfego para a próxima ideia em vez de deixar um teste parado rodando por esperança.

Ele é deliberadamente conservador quanto à automação. Uma parada automatizada exige que o teste sequencial e o valor p corrigido concordem, na mesma variante e na mesma direção. Eles nem sempre vão concordar, e o caso conhecido é um efeito real menor do que aquele para o qual o teste sequencial foi dimensionado: ele lê nenhum efeito enquanto o valor p eventualmente lê significativo, nada dispara, e o experimento roda até o fim agendado. Essa é a direção pretendida para falhar.

Melhores testes, melhores conversões

Test on all visitors with the world’s lightest script and make confident decisions powered by real-time reporting.