Des statistiques défendables
Correction pour comparaisons multiples
Testez quatre variantes à 0,05 chacune et vous avez à peu près une chance sur cinq d’obtenir un faux gagnant. Une correction est ce qui empêche cela.
Chaque variante supplémentaire est une chance de plus pour que le bruit ressemble à un gagnant. Avec quatre comparaisons jugées à 0,05 chacune, la chance qu’au moins une franchisse la barre par chance approche les vingt pour cent, et le gagnant que vous mettez en production a autant de chances d’être un artefact qu’une amélioration.
Une correction resserre la barre pour compenser. Pertento en propose trois, plus aucune, et en appliquer une ne change que le verdict de significativité. La valeur p, le score z et les intervalles restent intacts, si bien que changer de méthode ne modifie jamais la preuve, seulement le niveau d’exigence auquel vous la soumettez.
Avec une seule variante, les quatre se ramènent au même seuil. Plutôt que de vous laisser le découvrir en essayant chaque option, la console le dit directement, et énonce le seuil réel que la méthode choisie applique pour votre nombre de comparaisons.
Une correction est fixée plutôt que choisie partout où la plateforme agit de son propre chef. La file d’attention, la file d’implémentation et la règle d’arrêt automatisé lisent toutes la même méthode, car une file ne peut pas proposer un menu déroulant, et deux écrans en désaccord sur qui a gagné est précisément le bug que cela évite.