Platforma · Statistika, kterou obhájíte

Frekventistický a bayesovský přístup vedle sebe

Nárůst, intervaly spolehlivosti, pravděpodobnost, že je varianta nejlepší, a očekávaná ztráta, v jednom pohledu, aktualizovaném v reálném čase.

Čtení výsledku

Co čísla říkají, a co ne

Dívání se brzy bez podvádění, alarm, který se spustí dřív, než začnete jednat, a výnos podle varianty v měně účtu.

  • Sekvenční testování, které smí vítěze vyhlásit brzy oprávněně, s korekcí na vícenásobné porovnání
  • Alarmy neshody v podílu vzorku, které označí nedůvěryhodné výsledky dřív, než podle nich začnete jednat
  • Výnos a průměrná hodnota objednávky podle varianty, s podporou více měn
  • Dolní hranice rozlišitelného účinku, takže nezodpověditelný test to řekne, místo aby běžel donekonečna
  • Vysvětlivky obyčejnou češtinou u každé statistiky: doktorát není potřeba
Reálný časVíce měnAnalýza síly
Statistická obrazovka jednoho experimentu: nárůst 12,4 % při hodnotě p 0,0184, konverzní poměr v čase pro kontrolní variantu a dvě varianty, a tabulka významnosti, jejíž verdikt obyčejnými slovy říká, že výsledek je bezpečné vydat.

Sekvenční testování

Dívejte se brzy, bez podvádění

Test s pevným horizontem je platný, jen když se podíváte jednou, na konci. Sekvenční testování vám dovolí kontrolovat každý den a zastavit ve chvíli, kdy důkazy překročí hranici.

  • Platný závěr při každém pohledu, ne jen při posledním
  • Korekce na vícenásobné porovnání, když běží víc variant najednou
  • Doporučení slovy, ne jen číslem
  • Holm-Bonferroni, Benjamini-Hochberg nebo Šidák, nebo žádná, řečeno tak či tak
Graf sekvenčního testování: důkazy den po dni stoupají mezi dolní a horní přerušovanou hranicí a devatenáctý den tu horní překročí, s korekcí Holm-Bonferroni přes dvacet jedna pohledů.

Důvěra

Alarm, který se spustí dřív, než začnete jednat

Neshoda v podílu vzorku znamená, že se rozdělení nestalo tak, jak jste ho nastavili, a výsledek se nedá číst. Pertento to kontroluje průběžně a blokuje automatizaci, když se to spustí.

  • Průběžné kontroly neshody v podílu vzorku podle varianty
  • Automatizace odmítne jednat na označených datech
  • Důvod vyjádřený obyčejnými slovy
  • Tři brány: neshoda v podílu vzorku, den bez provozu, nebo interakce s jiným běžícím testem
Obrazovka důvěryhodnosti: u jednoho experimentu odpovídá rozdělení provozu jeho nastavení, druhý je označený za neshodu v podílu vzorku, 54/46 proti nastavenému rovnému rozdělení.

Peníze

Výnos podle varianty, v měně účtu

Konverzní poměr je jen zástupná hodnota. Pertento reportuje výnos a průměrnou hodnotu objednávky podle varianty, aby výhra, která prodává levnější produkty, nevypadala jako výhra.

  • Výnos a průměrná hodnota objednávky podle varianty, v jedné zvolené měně
  • Konverze počítané napříč všemi měnami, protože konverze je konverze
  • Výnos čtený jako druhý cíl pro implementační frontu, takže výhra jen ve výnosu se přesto vydá
  • Významnost a intervaly na výnosu stejně jako na konverzích
Pohled na výnos u jednoho experimentu: pozitivní dopad na výnos a průměrnou hodnotu objednávky, s výnosem a počty objednávek rozepsanými podle varianty.

Čísla

Co vám tabulka výsledků skutečně říká

Šest čísel dělá na této obrazovce většinu práce a dvě z nich jsou ta, která lidé nejčastěji čtou špatně. Konzole každé vysvětlí přímo na místě; k tomuhle jsou.

Dva intervaly, ne jeden

Wilsonův interval pro vlastní poměr každé varianty, který zůstává mezi nulou a sto procenty i u malých vzorků, a interval nárůstu pro rozdíl proti kontrolní variantě. Ten druhý je ten, který ukončí spor: pokud celý leží nad nulou, varianta je skutečně vepředu.

Pravděpodobnost, že je varianta nejlepší

Bayesovská polovina uvádí, jaká je u každé varianty šance, že je z testovaných nejlepší. Na rozdíl od p-hodnoty odpovídá na otázku, kterou jste skutečně položili, a proto je to obvykle číslo, které lidé čtou první.

Očekávaná ztráta

O co byste přišli, kdybyste tuto variantu vydali a ukázalo by se, že není nejlepší. Malá očekávaná ztráta znamená, že rozhodnutí je levné i tehdy, když je špatné, a právě to o něm často rozhodne spíš než významnost.

Dolní hranice rozlišitelného účinku

Nejmenší změna, kterou tento objem provozu umí spolehlivě zjistit. Rozdíl pod ní se čekáním při současné výši provozu významným nestane, ať jej necháte běžet jak dlouho chcete. Tohle je způsob selhání, který vypadá jako "žádný výsledek" a ve skutečnosti znamená "nikdy nebude dost provozu, aby to šlo poznat".

Zbývající dny, poctivě

Odhad z tempa provozu za období, kdy test skutečně běžel, dimenzovaný na rozdíl, který se právě měří, a ne na pevný cíl. Když je cíl dál než rok, řekne to, místo aby vypsala čtyřciferný počet dní.

Vysvětlivky obyčejnou češtinou

Každé číslo s sebou nese vlastní definici, napsanou tak, aby řekla, co vám číslo říká, a ne aby definovala pojem. Tam, kde se číslo dá snadno přečíst špatně, to vysvětlení řekne naplno.

Pod povrchem

Nad čím se čísla vlastně počítají

Výsledek je jen tak dobrý jako to, z čeho byl spočítán: která událost se počítá jako cíl, v jaké měně jsou peníze a jestli stejná matematika stojí za alarmem i za obrazovkou.

Tři pojmenované korekce

Holm-Bonferroni, Benjamini-Hochberg a Šidák, nebo žádná. Korekce mění jen verdikt o významnosti, nikdy p-hodnotu, interval ani z-skóre, a u jediné varianty se všechny čtyři scvrknou na stejnou hranici. Konzole to řekne, místo aby vás nechala každou vyzkoušet.

Primární a sekundární cíle

Web označí, které ze svých událostí se smějí použít jako cíl; každý experiment si z té zásoby vybere svůj primární a ostatní uvede jako doplňkové metriky. Událost později degradovaná dál reportuje u experimentů, které si ji už vybraly, takže hotový výsledek se nikdy nemění zpětně.

Časové řady po variantách

Denní sessions, konverze a výnos po variantách, jako hrubé počty, a ne jako předpočítané poměry. Každé jiné číslo na stránce je jeden kumulativní údaj a žádné z nich neumí ukázat, jestli se výsledek usazuje, nebo se pořád ještě potácí.

Reporting kombinací

Když běží několik experimentů zároveň, report kombinací se ptá, jestli dvě změny interagují a jestli se hodnoty objednávek mezi kombinacemi liší. Počítá se jen z konverzí, což na tuhle otázku přesně stačí a na otázku "která kombinace konvertuje nejlépe" nestačí.

Více měn, poctivě

Konverze se počítají přes všechny měny, protože konverze je konverze, ať byla zaplacena čímkoli. Výnos ne: přičtení SEK k EUR dává nesmyslný součet, takže výnos potřebuje vybranou jednu měnu a konzole vás nechá ji vybrat.

Jedna implementace té matematiky

Alarm, který vám pošle e-mail, i obrazovka, na kterou dojdete, používají stejnou kontrolu podílu vzorku, a motor zastavování čte její verdikt tím samým kódem, který vykresluje dashboard. Upozornění, které odporuje obrazovce, na niž odkazuje, je horší než žádné.

Otázky

Než čísla začnete brát vážně

Můžeme s těmito čísly jít za finančním ředitelem?

Právě k tomu je druhá polovina této stránky. Výsledek přichází s velikostí rozdílu, s intervalem okolo něj a s tím, jak pravděpodobně je dílem náhody, spočítáno dvěma nezávislými způsoby a zobrazeno vedle sebe. Výnos se měří po variantách, a ne odvozuje z konverzního poměru, takže varianta, která konvertuje častěji a prodává levněji, se nečte jako výhra. A platforma svou nejistotu vyslovuje, místo aby ji skrývala, což je ta část, která obstojí při zkoumání: výsledek, který ještě není průkazný, to řekne slovy, místo aby byl předložen jako průkazný.

Potřebujeme na jejich čtení datového vědce?

Ne, a návrh předpokládá, že žádného nemáte. Každé číslo s sebou nese vlastní vysvětlení na místě, napsané tak, aby řeklo, co vám to číslo říká, a ne aby definovalo pojem, a několik z nich existuje právě proto, aby předešlo špatnému čtení: sloupec s rozdílem naplno říká, že sám o sobě nevypovídá nic o tom, jestli je ta mezera skutečná. Vedle čísel je doporučení obyčejnými slovy. Co ale neudělá, je zjednodušovat zamlčováním, takže kdo p-hodnotu a interval chce, najde obojí.

Jak poznáme, že je vítěz skutečný a ne štěstí?

Tři obrany, a vyplatí se je srovnat s tím, co používáte dnes. Testování několika variant zároveň zvyšuje šanci, že jedna bude vypadat jako vítěz náhodou, takže se hranice na kompenzaci zpřísní a konzole tu hranici, kterou uplatňuje, vysloví, místo aby vás nechala ji dopočítat. Každodenní nahlížení do výsledku nadhodnocuje míru falešně pozitivních zjištění, takže test, který je platné číst průběžně, je oddělený od toho, který platné číst není, a platforma experiment dřív nezastaví, dokud se oba neshodnou. A ještě před tím vším kontroluje, že se provoz skutečně rozdělil tak, jak jste ho nastavili, protože pokud ne, neplatí nic, co je z toho spočítané.

Náš provoz není obrovský. Bude to u nás fungovat?

Někdy ano a někdy skutečně ne, a právě tady je platforma nejužitečnější, dokud jste tím ještě nestrávili tři měsíce. Každý experiment hlásí nejmenší rozdíl, který provoz, jejž máte, umí spolehlivě zjistit. Pokud účinek, za kterým jdete, leží pod touto hranicí, nevyřeší ho žádná trpělivost, a konzole to řekne, místo aby test nechala donekonečna ležet na "není významné". Vědět, které z vašich stránek na otázku odpovědět umí a které ne, má na skromném webu větší cenu než na velkém.

Musíme si dopředu vybrat frekventistický, nebo bayesovský přístup?

Ne. Oba se počítají u každého experimentu a zobrazují se spolu, takže je to spíš otázka toho, co čtete radši, než nastavení, které lze pokazit. Frekventistická polovina uvádí, jak nepravděpodobný by výsledek byl, kdyby změna nedělala nic. Bayesovská polovina uvádí pravděpodobnost, že je každá varianta nejlepší, a kolik by vás stálo vybrat špatně. Týmy obvykle zjistí, že podle druhé se snáz jedná a první se snáz hájí, což je přesně důvod, proč ani jedna nebyla vypuštěna.

Všechno, co je v balení

Celý výčet funkcí

Pertento je platforma pro optimalizaci konverzního poměru pro weby a e-shopy, postavená jak pro interní týmy, tak pro CRO agentury, které vedou programy experimentování napříč seznamem klientů.

Integrace

Funguje se stackem, který už provozujete

Jeden úryvek se vloží do jakéhokoli webu, nebo jděte celí na stranu serveru. Nic se nemusí předělávat.

Úryvek na jeden řádek

Vložte do head jediný skript o 0,9 KB a jste naživo. Žádný build, žádné závislosti.

Google Tag Manager

Nasazujte a spravujte experimenty přímo přes GTM. Čas vývojářů není potřeba.

API na straně serveru

Spouštějte testy i mimo prohlížeč: ceny, vyhledávání a směrování, bez probliknutí.

  • Shopify
  • BigCommerce
  • Shopware
  • Centra
  • Geins
  • Saleor
  • WordPress
  • Optimizely CMS
  • Storyblok
  • Next.js
  • Vue
  • Astro
  • Matomo
  • Amplitude
  • RudderStack
  • Slack
  • WooCommerce
  • Salesforce
  • Wix
  • Litium
  • commercetools
  • Medusa
  • Drupal
  • Contentful
  • Webflow
  • Nuxt
  • Angular
  • Remix
  • Piwik PRO
  • Mixpanel
  • Tag Manager
  • Webhooks
  • Adobe Commerce
  • PrestaShop
  • Squarespace
  • Norce
  • Shopify Hydrogen
  • Vendure
  • Umbraco
  • Sanity
  • Framer
  • React
  • SvelteKit
  • GA4
  • Adobe Analytics
  • Segment
  • Klaviyo

Není na seznamu? Pokud to vykresluje HTML, Pertento to umí otestovat:přečtěte si, jak se každá z nich připojuje.

Lepší testy, lepší konverze

Test on all visitors with the world’s lightest script and make confident decisions powered by real-time reporting.