Monitoring
Raport programu
Spojrzenie wstecz na program testów: jak często testy wygrywają, jak szybko są uruchamiane, czy zwycięzcy trafiają do wdrożenia i jakie pomysły zwykle działają.
Raport programu to retrospektywna połowa monitoringu. Monitor zdrowia pokazuje, co teraz potrzebuje człowieka; ten pokazuje, jak radził sobie program. Czyta tylko testy, które się zakończyły, więc wczesne liczby działającego testu nigdy nie stoją obok ostatecznego wyniku, a jego otwarcie niczego nie zmienia.
Każdy zakończony test dostaje jeden wynik. Wygrana oznacza, że co najmniej jeden wariant pokonał kontrolę z pewnością i żaden nie wypadł z pewnością gorzej; przegrana to odwrotność; wynik mieszany to po jednym z każdego, na co ktoś musi spojrzeć; nierozstrzygnięty to ani jedno, ani drugie. Wyniki rozstrzygane są na konwersjach z poprawką Holm-Bonferroni między wariantami, a z pewnością oznacza istotnie, z całym przedziałem po jednej stronie zera.
Wdrożony test liczy się jako wygrana, nawet gdy statystyka była nierozstrzygnięta, bo wdrożenie to decyzja człowieka, że test wygrał. Ta decyzja jest trzymana z dala od liczb, które mogłaby zawyżyć: wdrożeni zwycięzcy liczeni są tylko ze statystycznych zwycięzców, a tabele według oczekiwanego mechanizmu i według wagi PXL używają wyniku statystycznego, więc pomysły, które ludzie lubią wypuszczać, nie wyglądają przez to lepiej.
Wykres tempa zestawia uruchomienia w każdym miesiącu z wynikami tego, co się zakończyło. Jeśli linia rośnie, a udział wygranych stoi w miejscu, program prowadzi więcej testów, nie ucząc się z nich więcej, czego sama liczba uruchomień nie jest w stanie pokazać.