Platform · Statistik du kan stå på mål for

Frekventistisk og bayesiansk, side om side

Løft, konfidensintervaller, sandsynligheden for at denne variant er bedst, og forventet tab, i én visning, opdateret i realtid.

At læse et resultat

Hvad tallene siger, og hvad de ikke siger

At se tidligt uden at snyde, alarmen der lyder før I handler, og omsætning pr. variant i kontoens valuta.

  • Sekventiel test, der legitimt kan kåre en vinder tidligt, med korrektion for multiple sammenligninger
  • Alarmer for skæv fordeling, der flager upålidelige resultater, før I handler på dem
  • Omsætning og gennemsnitlig ordreværdi pr. variant, med understøttelse af flere valutaer
  • Et gulv for målbar effekt, så en test, der ikke kan besvares, siger det i stedet for at køre i det uendelige
  • Forklaringer på almindeligt dansk til hver statistik: ingen ph.d. krævet
RealtidFlere valutaerStyrkeberegning
Statistikskærmen for et eksperiment: et løft på 12,4 % ved en p-værdi på 0,0184, konverteringsrate over tid for kontrollen og to varianter, og en signifikanstabel, hvis konklusion i almindeligt sprog lyder, at resultatet er trygt at sende.

Sekventiel test

Se tidligt uden at snyde

En test med fast horisont er kun gyldig, hvis I ser én gang, til sidst. Sekventiel test lader jer tjekke hver dag og stoppe i det øjeblik, beviset krydser grænsen.

  • Gyldig inferens ved hvert kig, ikke kun det sidste
  • Korrektion for multiple sammenligninger, når flere varianter kører samtidig
  • En anbefaling i ord, ikke kun et tal
  • Holm-Bonferroni, Benjamini-Hochberg eller Šidák, eller ingen, angivet uanset hvad
Et diagram for sekventiel test: beviset stiger dag for dag mellem en nedre og en øvre stiplet grænse og krydser den øvre på dag nitten, med Holm-Bonferroni-korrektion over enogtyve kig.

Tillid

Alarmen der lyder før I handler

En skæv fordeling betyder, at delingen ikke skete, som I konfigurerede den, og resultatet kan ikke læses. Pertento tjekker løbende og blokerer automatisering, når den udløses.

  • Løbende kontrol af skæv fordeling pr. variant
  • Automatiseringen nægter at handle på flaget data
  • Årsagen angivet i almindeligt sprog
  • Tre porte: en skæv fordeling, en dag uden trafik, eller en interaktion med en anden kørende test
Tillidsskærmen: trafikfordelingen i ét eksperiment passer med konfigurationen, et andet er flaget for skæv fordeling med 54/46 mod en konfigureret jævn deling.

Penge

Omsætning pr. variant, i kontoens valuta

Konverteringsrate er en tilnærmelse. Pertento rapporterer omsætning og gennemsnitlig ordreværdi pr. variant, så en gevinst, der sælger billigere produkter, ikke ligner en gevinst.

  • Omsætning og gennemsnitlig ordreværdi pr. variant, i én valgt valuta
  • Konverteringer talt på tværs af alle valutaer, fordi en konvertering er en konvertering
  • Omsætning læst som et sekundært mål for implementeringskøen, så en gevinst kun på omsætning stadig sendes
  • Signifikans og intervaller på omsætning såvel som på konverteringer
Omsætningsvisningen for et eksperiment: en positiv effekt på omsætning og gennemsnitlig ordreværdi, med omsætning og antal ordrer brudt ned pr. variant.

Tallene

Hvad resultattabellen faktisk fortæller jer

Seks tal gør det meste af arbejdet på denne skærm, og to af dem er dem, folk oftest læser forkert. Konsollen forklarer hvert tal, hvor det står; det er det, de er til for.

To intervaller, ikke ét

Et Wilson-interval for hver variants egen andel, som holder sig mellem nul og hundrede procent selv ved små stikprøver, og et løfteinterval for forskellen mod kontrollen. Det andet er det, der afgør en diskussion: passerer det nul, ligger varianten reelt foran.

Sandsynligheden for at en variant er bedst

Den bayesianske halvdel rapporterer chancen for, at hver variant er den bedste af de testede. I modsætning til en p-værdi svarer den på det spørgsmål, I faktisk stillede, og derfor er det oftest det tal, folk læser først.

Forventet tab

Hvad I ville give afkald på ved at udrulle denne variant, hvis den viser sig ikke at være den bedste. Et lille forventet tab betyder, at beslutningen er billig, selv når den er forkert, og det er ofte det, der afgør den frem for signifikans.

Gulvet for målbar effekt

Den mindste ændring, som denne mængde trafik pålideligt kan opdage. En forskel under gulvet bliver ikke signifikant af, at I venter på det nuværende trafikniveau, uanset hvor længe I lader testen køre. Det er den fejltilstand, der ser ud som "intet resultat" og reelt er "ikke nok trafik til nogensinde at kunne afgøre".

Dage tilbage, ærligt

Fremskrevet fra trafikraten i det vindue, testen faktisk var live, og dimensioneret mod den forskel, der måles, frem for mod et fast mål. Når målet ligger længere væk end et år, siger den det i stedet for at skrive et firecifret antal dage.

Forklaringer på almindeligt dansk

Hvert tal bærer sin egen definition, skrevet for at sige, hvad det fortæller, frem for at definere begrebet. Hvor et tal er nemt at læse forkert, siger forklaringen det lige ud.

Under overfladen

Hvad tallene er målt over

Et resultat er kun så godt som det, det blev beregnet ud fra: hvilken hændelse der tæller som målet, hvilken valuta pengene er i, og om den samme matematik lå bag både alarmen og skærmen.

Tre navngivne korrektioner

Holm-Bonferroni, Benjamini-Hochberg og Šidák, eller ingen. En korrektion ændrer kun udfaldet signifikant, aldrig p-værdien, intervallet eller z-værdien, og med en enkelt variant falder alle fire sammen i samme tærskel. Konsollen siger det frem for at lade jer prøve hver af dem.

Primære og sekundære mål

Et website markerer, hvilke af sine hændelser der må bruges som målsætning; hvert eksperiment vælger sit primære mål fra den pulje og lister resten som støttemål. En hændelse, der senere nedgraderes, bliver ved med at rapportere på eksperimenter, der allerede valgte den, så et afsluttet resultat ændres aldrig bagefter.

Tidsserie pr. variant

Daglige sessioner, konverteringer og omsætning pr. variant, som rå tal frem for forudberegnede andele. Hvert andet tal på siden er ét kumulativt tal, og ingen af dem kan vise, om et resultat er ved at falde til ro eller stadig vandrer.

Kombinationsrapportering

Når flere eksperimenter kører samtidig, spørger kombinationsrapporten, om to ændringer spiller sammen, og om ordreværdien er forskellig mellem kombinationer. Den beregnes udelukkende ud fra konverteringer, hvilket er præcis nok til det spørgsmål og ikke nok til "hvilken kombination konverterer bedst".

Flere valutaer, holdt ærligt

Konverteringer tælles på tværs af alle valutaer, fordi en konvertering er en konvertering, uanset hvad der blev betalt i. Omsætning er det ikke: at lægge SEK til EUR giver en meningsløs sum, så omsætning kræver, at én valuta vælges, og konsollen tvinger jer til at vælge den.

Én implementering af matematikken

Alarmen, der mailer jer, og den skærm, I lander på, kører den samme kontrol af stikprøvefordelingen, og stopmotoren læser dens udfald gennem den samme kode, som dashboardet renderer. En alarm, der modsiger den skærm, den linker til, er værre end ingen alarm.

Spørgsmål

Før I stoler på tallene

Kan vi tage disse tal med til en økonomidirektør?

Det er, hvad den anden halvdel af denne side er til. Et resultat kommer med størrelsen af forskellen, intervallet omkring den, og hvor sandsynligt det er, at det er tilfældigt, beregnet på to uafhængige måder og vist side om side. Omsætning måles pr. variant frem for at udledes af konverteringsrate, så en variant, der konverterer oftere og sælger billigere, læses ikke som en sejr. Og platformen oplyser sin egen usikkerhed i stedet for at skjule den, og det er den del, der holder ved nærlæsning: et resultat, der endnu ikke er entydigt, siger det, med ord, frem for at blive fremstillet som entydigt.

Skal vi have en dataanalytiker til at læse det?

Nej, og designet går ud fra, at I ikke har en. Hvert tal bærer sin forklaring på stedet, skrevet for at sige, hvad tallet fortæller, frem for at definere begrebet, og flere findes netop for at forebygge en fejllæsning: differencekolonnen siger lige ud, at den i sig selv intet siger om, hvorvidt forskellen er reel. Ved siden af tallene står en anbefaling i almindelige ord. Hvad den ikke gør, er at forenkle ved at skjule, så den, der gerne vil se p-værdien og intervallet, finder begge.

Hvordan ved vi, at en vinder er reel og ikke held?

Tre forsvar, og de er værd at holde op mod det, I bruger i dag. At teste flere varianter samtidig øger chancen for, at én ser ud som en vinder ved held, så barren strammes for at kompensere, og konsollen oplyser den tærskel, den anvender, frem for at lade jer regne den ud. At se på et resultat hver dag puster andelen af falske positive op, så den test, der er gyldig at læse løbende, er adskilt fra den, der ikke er, og platformen stopper ikke et eksperiment tidligt, medmindre begge er enige. Og før alt det tjekker den, at trafikken faktisk blev delt, som I konfigurerede, for hvis den ikke blev, holder intet, der er regnet ud fra den.

Vores trafik er ikke enorm. Fungerer dette for os?

Nogle gange ja og nogle gange reelt nej, og det er her, platformen er mest nyttig, før I har brugt tre måneder på at finde ud af det. Hvert eksperiment rapporterer den mindste forskel, den trafik I har, pålideligt kan opdage. Ligger effekten, I jagter, under det gulv, løser ingen mængde tålmodighed den, og konsollen siger det frem for at lade en test ligge på "ikke signifikant" i det uendelige. At vide hvilke af jeres sider der kan svare på et spørgsmål, og hvilke der ikke kan, er værd mere på et beskedent website end på et stort.

Skal vi vælge frekventistisk eller bayesiansk på forhånd?

Nej. Begge beregnes for hvert eksperiment og vises sammen, så det er en læsepræference frem for en konfigurationsbeslutning, I kan tage forkert. Den frekventistiske halvdel rapporterer, hvor usandsynligt resultatet ville være, hvis ændringen intet gjorde. Den bayesianske halvdel rapporterer sandsynligheden for, at hver variant er bedst, og hvad det ville koste jer at vælge forkert. Team synes gerne, den anden er lettere at handle på og den første lettere at forsvare, og det er præcis derfor, ingen af dem blev droppet.

Alt hvad der er med

Hele funktionssættet

Pertento er en platform til konverteringsoptimering til websites og webshops, bygget både til interne team og til CRO-bureauer, der driver eksperimentprogrammer på tværs af en kundeliste.

Integrationer

Fungerer med den stack, I allerede kører

Én kodestump lægges ind på et vilkårligt website, eller kør helt på serversiden. Intet at bygge om.

Kodestump på én linje

Indsæt et enkelt tag på 0,9 KB i jeres head, og I er live. Intet byggetrin, ingen afhængigheder.

Google Tag Manager

Udrul og håndter eksperimenter direkte gennem GTM. Ingen udviklertid krævet.

API til serversiden

Kør test uden for browseren: priser, søgning og routing, uden flimmer.

  • Shopify
  • BigCommerce
  • Shopware
  • Centra
  • Geins
  • Saleor
  • WordPress
  • Optimizely CMS
  • Storyblok
  • Next.js
  • Vue
  • Astro
  • Matomo
  • Amplitude
  • RudderStack
  • Slack
  • WooCommerce
  • Salesforce
  • Wix
  • Litium
  • commercetools
  • Medusa
  • Drupal
  • Contentful
  • Webflow
  • Nuxt
  • Angular
  • Remix
  • Piwik PRO
  • Mixpanel
  • Tag Manager
  • Webhooks
  • Adobe Commerce
  • PrestaShop
  • Squarespace
  • Norce
  • Shopify Hydrogen
  • Vendure
  • Umbraco
  • Sanity
  • Framer
  • React
  • SvelteKit
  • GA4
  • Adobe Analytics
  • Segment
  • Klaviyo

Ikke på listen? Hvis det renderer HTML, kan Pertento teste det:læs hvordan hver enkelt forbindes.

Bedre eksperimenter, bedre konvertering

Test on all visitors with the world’s lightest script and make confident decisions powered by real-time reporting.