Des statistiques défendables

Résultats fréquentistes

La valeur p, le score z et l’intervalle, calculés comme les calculerait quelqu’un qui veut vous contredire.

Test z à deux proportionsCorrigéSigné selon la variante

Le volet fréquentiste répond à une seule question : à quelle fréquence un écart au moins aussi grand apparaîtrait par hasard, si la variante ne changeait rien du tout. Plus c’est bas, plus c’est difficile à balayer d’un revers de main, et en dessous de 0,05 est la barre habituelle.

La comparaison est un test z à deux proportions entre chaque variante et le contrôle, mis en commun de façon standard. Le score z est signé dans le sens de la variante, si bien qu’une variante en tête se lit positive et s’accorde avec l’intervalle de gain calculé à côté. Cela paraît trivial et ne l’est pas : une convention de signe qui se contredit entre deux colonnes d’un même tableau, c’est ainsi qu’une variante perdante part en production.

Le verdict de significativité est la valeur p après correction pour comparaisons multiples, pas avant. Avec une seule variante, la correction n’a aucun effet et la barre est simplement 0,05 ; avec plusieurs, elle se resserre, et la console énonce le seuil au lieu de vous laisser le calculer vous-même.

Une variante déployée est exclue de la comparaison. Elle ne reçoit plus de trafic randomisé, si bien que la traiter comme une branche de test la comparerait à un contrôle avec lequel elle ne rivalise plus, et gonflerait le nombre de comparaisons pour lequel tout le reste est corrigé.

De meilleurs tests, de meilleures conversions

Test on all visitors with the world’s lightest script and make confident decisions powered by real-time reporting.