Statistik, die Sie vertreten können

Frequentistische Ergebnisse

Der p-Wert, der z-Wert und das Intervall, berechnet so, wie jemand rechnen würde, der mit Ihnen streiten will.

Zwei-Anteile-z-TestKorrigiertZur Variante signiert

Die frequentistische Hälfte beantwortet eine Frage: Wie oft würde ein mindestens so großer Unterschied durch Zufall erscheinen, wenn die Variante nichts geändert hätte. Niedriger ist schwerer wegzuerklären, und unter 0,05 ist die übliche Schwelle.

Der Vergleich ist ein Zwei-Anteile-z-Test zwischen jeder Variante und der Kontrolle, gepoolt auf die übliche Weise. Der z-Wert ist in Richtung der Variante signiert, eine vorne liegende Variante liest sich also positiv und stimmt mit dem daneben berechneten Uplift-Intervall überein. Das klingt trivial und ist es nicht: Eine Vorzeichenkonvention, die zwischen zwei Spalten derselben Tabelle nicht übereinstimmt, ist, wie eine verlierende Variante ausgeliefert wird.

Das signifikante Urteil ist der p-Wert nach der Mehrfachvergleichskorrektur, nicht davor. Bei einer Variante hat die Korrektur keine Wirkung und die Schwelle ist einfach 0,05; bei mehreren verschärft sie sich, und die Konsole nennt die Schwelle, statt Sie sie ausrechnen zu lassen.

Eine ausgerollte Variante wird vom Vergleich ausgeschlossen. Sie erhält keinen randomisierten Traffic, sie als Testarm zu behandeln würde sie also gegen eine Kontrolle vergleichen, mit der sie nicht mehr konkurriert, und die Zahl der Vergleiche aufblähen, für die alles andere korrigiert wird.

Bessere Experimente, bessere Conversion

Test on all visitors with the world’s lightest script and make confident decisions powered by real-time reporting.