Estatísticas que você pode defender
Holm-Bonferroni, Benjamini-Hochberg e Šidák
Três correções controlando duas coisas diferentes. A que você precisa depende de quantas variantes está rodando e do que custaria um vencedor falso.
Holm-Bonferroni é a mais rígida das três. Ela ordena as comparações e desce a partir do limite mais apertado, parando na primeira que falha, e controla a chance de fazer qualquer alegação falsa. É o padrão certo quando um vencedor falso seria lançado e mantido no ar.
Benjamini-Hochberg trabalha do outro lado, e controla a proporção de falsos positivos entre os resultados que você chama de vencedores, em vez da chance de qualquer um deles. É uma garantia mais fraca e mais útil quando várias variantes estão no ar: é bem menos provável descartar um efeito real, ao custo de aceitar de vez em quando um resultado ruim.
Šidák aplica um único limite a cada comparação em vez de uma sequência deles. É um pouco menos rígida que uma Bonferroni simples e pressupõe que as comparações são independentes, o que é razoável quando as suas variantes são ideias de fato diferentes, e uma suposição fraca quando são variações do mesmo tema.
Nenhuma correção também é uma opção, e o console é honesto sobre o preço disso: com várias comparações a um limite sem correção, ele declara diretamente quão provável fica pelo menos um vencedor falso. É uma escolha defensável num teste de uma única variante, e raramente defensável fora disso.