Estadísticas que puede defender
Resultados frecuentistas
El valor p, la puntuación z y el intervalo, calculados como los calcularía alguien que quisiera llevarle la contraria.
La mitad frecuentista responde a una sola pregunta: con qué frecuencia aparecería por azar una diferencia al menos así de grande, si la variante no cambiara nada en absoluto. Cuanto más bajo, más difícil de explicar por azar, y por debajo de 0,05 es el listón habitual.
La comparación es una prueba z de dos proporciones entre cada variante y el control, agrupada de la forma habitual. La puntuación z lleva el signo en la dirección de la variante, así que una variante que va por delante se lee positiva y coincide con el intervalo de mejora calculado a su lado. Eso suena trivial y no lo es: un convenio de signo que no coincide entre dos columnas de una misma tabla es como se acaba enviando una variante perdedora.
El veredicto de significancia es el valor p después de la corrección por comparaciones múltiples, no antes. Con una sola variante la corrección no tiene efecto y el listón es simplemente 0,05; con varias se endurece, y la consola indica el umbral en lugar de dejar que usted lo calcule.
Una variante desplegada queda excluida de la comparación. No recibe tráfico aleatorizado, así que tratarla como un brazo del test la compararía contra un control con el que ya no compite, e inflaría el número de comparaciones por el que se corrige todo lo demás.