Estatísticas que se defendem

Testes sequenciais

Um teste que pode observar. Responde a uma pergunta diferente da do valor p, e os dois podem legitimamente discordar.

Válido a cada olhadaTambém declara sem efeitoExigido para a paragem automática

Um teste de horizonte fixo é válido se olhar uma vez, no fim. Olhe todos os dias e pare na primeira travessia, e a taxa de falsos positivos sobe bem acima dos cinco por cento que pensa estar a correr. Isto não é uma subtileza; é a forma mais comum de os programas de experimentação se enganarem a si próprios.

O teste sequencial é o teste desenhado para isso. A sua taxa de erro é controlada sob observação contínua, pelo que uma olhada no dia nove é tão válida como uma olhada no dia trinta, e um resultado claro pode ser accionado quando chega e não quando o calendário o permitir.

Também declara o outro resultado, o que um teste de horizonte fixo não consegue. "Sem efeito da dimensão que este teste foi construído para encontrar" é uma conclusão real, e agir sobre ela liberta o tráfego para a próxima ideia em vez de deixar um teste plano a correr à espera de um milagre.

É deliberadamente conservador quanto à automatização. Uma paragem automática exige que o teste sequencial e o valor p corrigido concordem, na mesma variante, na mesma direcção. Nem sempre vão concordar, e o caso conhecido é um efeito real mais pequeno do que aquele para que o teste sequencial está dimensionado: lê sem efeito enquanto o valor p acaba por ler significativo, nada dispara, e o teste corre até à data de fim agendada. É essa a direcção pretendida para falhar.

Melhores testes, melhores conversões

Test on all visitors with the world’s lightest script and make confident decisions powered by real-time reporting.