Monitoring
Rapport de programme
Un regard en arrière sur le programme de tests : à quelle fréquence les tests gagnent, à quelle vitesse ils sont lancés, si les gagnants sont mis en production, et quelles idées fonctionnent le plus souvent.
Le rapport de programme est la moitié rétrospective de la supervision. Le moniteur de santé montre ce qui a besoin d’une personne maintenant ; celui-ci montre comment le programme s’est comporté. Il ne lit que les tests terminés, si bien que les chiffres provisoires d’un test en cours ne côtoient jamais un résultat définitif, et l’ouvrir ne modifie rien.
Chaque test terminé reçoit un seul résultat. Gagné signifie qu’au moins une variante a battu le contrôle avec confiance et qu’aucune n’a fait nettement pire ; perdu est l’inverse ; mitigé, c’est un de chaque, ce que quelqu’un doit examiner ; non concluant, ni l’un ni l’autre. Les résultats sont tranchés sur les conversions avec une correction de Holm-Bonferroni entre les variantes, et avec confiance signifie significatif avec l’intervalle entier d’un seul côté de zéro.
Un test déployé compte comme une victoire même quand les statistiques n’étaient pas concluantes, car déployer, c’est une personne qui décide qu’il a gagné. Cette décision est tenue à l’écart des chiffres qu’elle pourrait gonfler : les gagnants mis en production sont comptés sur les seuls gagnants statistiques, et les tableaux par mécanisme attendu et par importance PXL utilisent le résultat statistique, si bien que les idées que l’on aime déployer n’en paraissent pas meilleures.
Le graphique de vélocité place les lancements par mois au-dessus des résultats de ce qui s’est conclu. Si la courbe monte alors que la part des victoires reste stable, le programme mène davantage de tests sans en apprendre davantage, ce qu’un simple décompte des lancements ne peut pas montrer.