Platforma · Statystyka, której da się obronić

Wyniki frekwentystyczne i bayesowskie obok siebie

Wzrost, przedziały ufności, prawdopodobieństwo bycia najlepszym wariantem i oczekiwana strata, w jednym widoku, aktualizowanym w czasie rzeczywistym.

Czytanie wyniku

Co mówią liczby, a czego nie mówią

Patrzenie wcześnie bez oszukiwania, alarm, który włącza się, zanim zaczniecie działać, i przychód na wariant w walucie konta.

  • Testowanie sekwencyjne, które może zasadnie ogłosić zwycięzcę wcześnie, z poprawką na wielokrotne porównania
  • Alarmy niezgodności proporcji próby, które oznaczają niegodne zaufania wyniki, zanim zaczniecie na nich działać
  • Przychód i średnia wartość zamówienia na wariant, ze świadomością wielu walut
  • Próg wykrywalnego efektu, więc nierozstrzygalny test mówi to wprost, zamiast działać bez końca
  • Wyjaśnienia prostym językiem przy każdej statystyce: doktorat niepotrzebny
Czas rzeczywistyWiele walutAnaliza mocy statystycznej
Ekran statystyki jednego testu: wzrost 12,4% przy wartości p 0,0184, współczynnik konwersji w czasie dla kontroli i dwóch wariantów, oraz tabela istotności, której werdykt prostym językiem mówi, że wynik można bezpiecznie wdrożyć.

Testowanie sekwencyjne

Patrzcie wcześnie, bez oszukiwania

Test o stałym horyzoncie jest ważny tylko wtedy, kiedy patrzycie raz, na końcu. Testowanie sekwencyjne pozwala sprawdzać codziennie i zatrzymać się w chwili, kiedy dowody przekroczą próg.

  • Ważny wniosek przy każdym spojrzeniu, nie tylko przy ostatnim
  • Poprawka na wielokrotne porównania, kiedy działa kilka wariantów naraz
  • Rekomendacja słowami, nie tylko liczbą
  • Holm-Bonferroni, Benjamini-Hochberg albo Šidák, albo żadna, podane wprost tak czy inaczej
Wykres testowania sekwencyjnego: dowody rosnące dzień po dniu między dolną i górną przerywaną granicą, przekraczające górną w dniu dziewiętnastym, z poprawką Holm-Bonferroni dla dwudziestu jeden spojrzeń.

Zaufanie

Alarm, który włącza się, zanim zaczniecie działać

Niezgodność proporcji próby znaczy, że podział nie stał się tak, jak skonfigurowano, i wyniku nie da się odczytać. Pertento sprawdza to ciągle i blokuje automatyzację, kiedy alarm się uruchomi.

  • Ciągłe sprawdzanie niezgodności proporcji próby dla każdego wariantu
  • Automatyzacja odmawia działania na oznaczonych danych
  • Powód podany prostymi słowami
  • Trzy bramki: niezgodność proporcji próby, dzień bez ruchu, albo interakcja z innym działającym testem
Ekran zaufania: w jednym teście podział ruchu odpowiada konfiguracji, drugi jest oznaczony za niezgodność proporcji próby, 54/46 wobec skonfigurowanego równego podziału.

Pieniądze

Przychód na wariant, w walucie konta

Współczynnik konwersji to tylko przybliżenie. Pertento raportuje przychód i średnią wartość zamówienia na wariant, żeby wygrana, która sprzedaje tańsze produkty, nie wyglądała jak wygrana.

  • Przychód i średnia wartość zamówienia na wariant, w jednej wybranej walucie
  • Konwersje liczone we wszystkich walutach, bo konwersja to konwersja
  • Przychód czytany jako drugi cel dla kolejki wdrożeń, więc wygrana tylko w przychodzie i tak zostaje wdrożona
  • Istotność i przedziały na przychodzie, tak samo jak na konwersjach
Widok przychodu jednego testu: dodatni wpływ na przychód i średnią wartość zamówienia, z przychodem i liczbą zamówień rozbitymi na warianty.

Liczby

Co naprawdę mówi wam tabela wyników

Sześć liczb wykonuje większość pracy na tym ekranie, a dwie z nich to te, które ludzie najczęściej czytają błędnie. Konsola wyjaśnia każdą z nich na miejscu, do tego właśnie służą.

Dwa przedziały, nie jeden

Przedział Wilsona dla własnego współczynnika każdego wariantu, który nawet przy małych próbach zostaje między zerem a stu procentami, oraz przedział wzrostu dla różnicy wobec kontroli. Ten drugi rozstrzyga spór: jeśli mija zero, wariant naprawdę prowadzi.

Prawdopodobieństwo, że wariant jest najlepszy

Połowa bayesowska podaje szansę, że dany wariant jest najlepszy z testowanych. W przeciwieństwie do wartości p odpowiada na pytanie, które naprawdę zadaliście, i dlatego zwykle jest tą liczbą, którą ludzie czytają pierwszą.

Oczekiwana strata

To, z czego byście zrezygnowali, wdrażając ten wariant, gdyby okazało się, że nie jest najlepszy. Mała oczekiwana strata znaczy, że decyzja jest tania nawet wtedy, gdy jest błędna, i często to właśnie ona rozstrzyga sprawę, a nie istotność.

Progowy efekt, który da się rozstrzygnąć

Najmniejsza zmiana, którą taki ruch potrafi wiarygodnie wykryć. Różnica poniżej tego progu nie stanie się istotna przez czekanie na obecnym poziomie ruchu, jak długo byście testu nie zostawili włączonego. To ten rodzaj porażki, który wygląda jak "brak wyniku", a naprawdę znaczy "za mało ruchu, by kiedykolwiek to stwierdzić".

Pozostałe dni, uczciwie

Prognozowane z tempa ruchu w okresie, w którym test faktycznie działał, i wyliczone wobec mierzonej różnicy, a nie wobec ustalonego z góry celu. Kiedy cel jest dalej niż rok, konsola mówi to wprost, zamiast wypisywać czterocyfrową liczbę dni.

Objaśnienia zwykłą polszczyzną

Każda liczba nosi własną definicję, napisaną po to, by powiedzieć, co wam mówi, a nie po to, by zdefiniować termin. Tam, gdzie liczbę łatwo źle odczytać, objaśnienie mówi to wprost.

Pod spodem

Nad czym właściwie liczone są te liczby

Wynik jest tak dobry, jak to, z czego został policzony: które zdarzenie liczy się jako cel, w jakiej walucie są pieniądze, i czy ten sam rachunek stoi za alarmem i za ekranem.

Trzy nazwane poprawki

Holm-Bonferroni, Benjamini-Hochberg i Šidák, albo żadna. Poprawka zmienia tylko orzeczenie o istotności, nigdy wartości p, przedziału ani wyniku z, a przy jednym wariancie wszystkie cztery sprowadzają się do tego samego progu. Konsola mówi to wprost, zamiast zostawiać wam sprawdzanie każdej po kolei.

Cele główne i dodatkowe

Witryna zaznacza, które ze swoich zdarzeń mogą służyć jako cel; każdy test wybiera z tej puli cel główny, a pozostałe wypisuje jako metryki wspierające. Zdarzenie zdegradowane później dalej raportuje w testach, które już je wybrały, więc zakończony wynik nigdy nie zmienia się wstecz.

Szeregi czasowe dla każdego wariantu

Dzienne sesje, konwersje i przychód dla każdego wariantu, jako surowe liczby, a nie wstępnie policzone współczynniki. Każda inna liczba na tej stronie jest jedną wartością narastającą i żadna z nich nie pokaże, czy wynik się uspokaja, czy jeszcze błądzi.

Raport kombinacji

Kiedy kilka testów działa jednocześnie, raport kombinacji pyta, czy dwie zmiany wchodzą w interakcję i czy wartości zamówień różnią się między kombinacjami. Liczony jest wyłącznie z konwersji, co dokładnie wystarcza na to pytanie i nie wystarcza na "która kombinacja konwertuje najlepiej".

Wiele walut, uczciwie policzonych

Konwersje liczone są we wszystkich walutach, bo konwersja jest konwersją niezależnie od tego, w czym zapłacono. Przychód nie: dodanie SEK do EUR daje sumę bez znaczenia, więc przychód wymaga wybrania jednej waluty i konsola każe wam ją wybrać.

Jedna implementacja matematyki

Alarm, który wysyła wam e-mail, i ekran, na który wchodzicie, wykonują to samo sprawdzenie proporcji próby, a silnik zatrzymywania czyta jego orzeczenie tym samym kodem, którym rysowany jest pulpit. Powiadomienie sprzeczne z ekranem, do którego prowadzi, jest gorsze niż brak powiadomienia.

Pytania

Zanim zaufacie liczbom

Czy z tymi liczbami można pójść do dyrektora finansowego?

Po to jest druga połowa tej strony. Wynik przychodzi z wielkością różnicy, przedziałem wokół niej i tym, jak prawdopodobne jest, że to przypadek, policzonym dwiema niezależnymi metodami i pokazanym obok siebie. Przychód jest mierzony dla każdego wariantu, a nie wnioskowany ze współczynnika konwersji, więc wariant, który konwertuje częściej i sprzedaje taniej, nie czyta się jako zwycięstwo. Platforma podaje też własną niepewność, zamiast ją ukrywać, i to jest ta część, która wytrzymuje kontrolę: wynik jeszcze nierozstrzygnięty mówi to słowami, zamiast być przedstawiany jako rozstrzygnięty.

Czy potrzebujemy analityka danych, żeby to przeczytać?

Nie, a projekt zakłada, że go nie macie. Każda liczba nosi na miejscu własne objaśnienie, napisane po to, by powiedzieć, co ta liczba wam mówi, a nie po to, by zdefiniować termin, i kilka z nich istnieje właśnie po to, by uprzedzić błędne odczytanie: kolumna różnicy mówi wprost, że sama z siebie nie mówi nic o tym, czy przewaga jest prawdziwa. Obok liczb jest wniosek podany zwykłymi słowami. Czego nie robi, to nie upraszcza przez ukrywanie, więc kto chce wartości p i przedziału, znajdzie jedno i drugie.

Skąd wiemy, że zwycięzca jest prawdziwy, a nie dziełem przypadku?

Trzy zabezpieczenia, i warto je porównać z tym, czego używacie dziś. Testowanie kilku wariantów naraz podnosi szansę, że jeden będzie wyglądał na zwycięzcę przez przypadek, więc poprzeczka jest zaostrzana dla wyrównania, a konsola podaje próg, który stosuje, zamiast zostawiać wam jego wyliczenie. Zaglądanie do wyniku codziennie zawyża odsetek fałszywych alarmów, więc test, który wolno czytać na bieżąco, jest oddzielony od tego, którego czytać na bieżąco nie wolno, i platforma nie zatrzyma testu wcześniej, dopóki oba się nie zgodzą. A przed tym wszystkim sprawdza, czy ruch faktycznie podzielił się tak, jak to skonfigurowaliście, bo jeśli nie, to nic policzonego z niego się nie trzyma.

Nasz ruch nie jest ogromny. Czy to się u nas sprawdzi?

Czasem tak, a czasem naprawdę nie, i tu platforma jest najbardziej przydatna, zanim spędzicie trzy miesiące na odkrywaniu tego. Każdy test podaje najmniejszą różnicę, którą wasz ruch potrafi wiarygodnie wykryć. Jeśli efekt, którego szukacie, leży poniżej tego progu, żadna cierpliwość go nie rozstrzygnie, a konsola mówi to wprost, zamiast trzymać test na "nieistotne" bez końca. Wiedza o tym, które z waszych stron potrafią odpowiedzieć na pytanie, a które nie, jest warta więcej na skromnej witrynie niż na dużej.

Czy musimy z góry wybrać podejście frekwentystyczne albo bayesowskie?

Nie. Oba są liczone dla każdego testu i pokazywane razem, więc to preferencja czytania, a nie decyzja konfiguracyjna, którą można pomylić. Połowa frekwentystyczna podaje, jak nieprawdopodobny byłby wynik, gdyby zmiana nie robiła nic. Połowa bayesowska podaje prawdopodobieństwo, że dany wariant jest najlepszy, i to, ile kosztowałby was zły wybór. Zespoły zwykle uznają drugą za łatwiejszą do działania, a pierwszą za łatwiejszą do obrony, i właśnie dlatego żadnej nie porzucono.

Wszystko, co jest w pakiecie

Pełny zestaw funkcji

Pertento to platforma do optymalizacji współczynnika konwersji dla stron i sklepów internetowych, zbudowana zarówno dla zespołów wewnętrznych, jak i dla agencji CRO prowadzących programy eksperymentowania w całym portfolio klientów.

Integracje

Działa ze stosem, który już prowadzicie

Jeden fragment kodu wchodzi na każdą witrynę, albo idźcie w pełni po stronie serwera. Nic do przebudowy.

Fragment w jednej linii

Wklejcie w head jeden tag o wadze 0,9 KB i już działacie. Bez kroku budowania, bez zależności.

Google Tag Manager

Wdrażajcie testy i zarządzajcie nimi prosto przez GTM. Czas programistów niepotrzebny.

API po stronie serwera

Uruchamiajcie testy poza przeglądarką: ceny, wyszukiwanie i routing, bez migotania.

  • Shopify
  • BigCommerce
  • Shopware
  • Centra
  • Geins
  • Saleor
  • WordPress
  • Optimizely CMS
  • Storyblok
  • Next.js
  • Vue
  • Astro
  • Matomo
  • Amplitude
  • RudderStack
  • Slack
  • WooCommerce
  • Salesforce
  • Wix
  • Litium
  • commercetools
  • Medusa
  • Drupal
  • Contentful
  • Webflow
  • Nuxt
  • Angular
  • Remix
  • Piwik PRO
  • Mixpanel
  • Tag Manager
  • Webhooks
  • Adobe Commerce
  • PrestaShop
  • Squarespace
  • Norce
  • Shopify Hydrogen
  • Vendure
  • Umbraco
  • Sanity
  • Framer
  • React
  • SvelteKit
  • GA4
  • Adobe Analytics
  • Segment
  • Klaviyo

Nie ma na liście? Jeśli to renderuje HTML, Pertento może to przetestować:przeczytajcie, jak łączy się każda z nich.

Lepsze testy, lepsze konwersje

Test on all visitors with the world’s lightest script and make confident decisions powered by real-time reporting.