Monitoring
Programmbericht
Ein Rückblick auf das Testprogramm: wie oft Experimente gewinnen, wie schnell sie starten, ob Gewinner ausgeliefert werden und welche Ideen meist funktionieren.
Der Programmbericht ist die rückblickende Hälfte der Überwachung. Der Zustandsmonitor zeigt, was jetzt einen Menschen braucht; dieser zeigt, wie sich das Programm entwickelt hat. Er liest nur Experimente, die abgeschlossen sind, sodass die frühen Zahlen eines laufenden Experiments nie neben einem endgültigen Ergebnis stehen, und ihn zu öffnen ändert nichts.
Jedes abgeschlossene Experiment erhält genau ein Ergebnis. Gewonnen heißt, dass mindestens eine Variante die Kontrolle belastbar geschlagen hat und keine belastbar schlechter war; verloren ist das Gegenteil; gemischt ist je eines davon, was sich jemand ansehen muss; ergebnislos ist keines von beiden. Ergebnisse werden anhand von Conversions mit Holm-Bonferroni-Korrektur über die Varianten entschieden, und belastbar heißt signifikant, mit dem ganzen Intervall auf einer Seite der Null.
Ein ausgerolltes Experiment zählt als Gewinn, auch wenn die Statistik ergebnislos war, denn Ausrollen ist ein Mensch, der entscheidet, dass es gewonnen hat. Diese Entscheidung wird aus den Zahlen herausgehalten, die sie aufblähen könnte: Ausgelieferte Gewinner zählen nur statistische Gewinner, und die Tabellen nach erwartetem Mechanismus und nach PXL-Wichtigkeit nutzen das statistische Ergebnis, sodass die Ideen, die man gern ausrollt, dadurch nicht besser aussehen.
Das Durchsatzdiagramm legt die Starts je Monat über die Ergebnisse dessen, was abgeschlossen wurde. Steigt die Linie, während der Anteil der Gewinne flach bleibt, führt das Programm mehr Experimente durch, ohne mehr aus ihnen zu lernen, was eine bloße Zahl der Starts allein nicht zeigen kann.