Plattform · Statistikk du kan stå for

Frekventistisk og bayesiansk, side om side

Løft, konfidensintervaller, sannsynligheten for at denne varianten er best, og forventet tap, i én visning, oppdatert i sanntid.

Å lese et resultat

Hva tallene sier, og hva de ikke sier

Å se tidlig uten å jukse, alarmen som går før dere handler, og omsetning per variant i kontoens valuta.

  • Sekvensiell testing som legitimt kan kåre en vinner tidlig, med korreksjon for flere sammenligninger
  • Alarmer for utvalgsforhold-avvik som flagger upålitelige resultater før dere handler på dem
  • Omsetning og gjennomsnittlig ordreverdi per variant, med støtte for flere valutaer
  • Et gulv for målbar effekt, så en test som ikke kan besvares sier det i stedet for å kjøre i det uendelige
  • Forklaringer på klart norsk for hver statistikk: ingen doktorgrad kreves
SanntidFlere valutaerStyrkeanalyse
Statistikkskjermen til et eksperiment: et løft på 12,4 % ved en p-verdi på 0,0184, konverteringsrate over tid for kontrollen og to varianter, og en signifikanstabell hvis konklusjon i klart språk sier at resultatet er trygt å sende.

Sekvensiell testing

Se tidlig uten å jukse

En test med fast horisont er bare gyldig hvis dere ser én gang, på slutten. Sekvensiell testing lar dere sjekke hver dag og stoppe i det øyeblikket beviset krysser grensen.

  • Gyldig inferens ved hver titt, ikke bare den siste
  • Korreksjon for flere sammenligninger når flere varianter kjører samtidig
  • En anbefaling i ord, ikke bare et tall
  • Holm-Bonferroni, Benjamini-Hochberg eller Šidák, eller ingen, oppgitt uansett
Et diagram for sekvensiell testing: beviset klatrer dag for dag mellom en nedre og en øvre stiplet grense og krysser den øvre på dag nitten, med Holm-Bonferroni-korreksjon over tjueen titter.

Tillit

Alarmen som går før dere handler

Et utvalgsforhold-avvik betyr at fordelingen ikke skjedde slik dere konfigurerte den, og resultatet kan ikke leses. Pertento sjekker kontinuerlig og blokkerer automatisering når det utløses.

  • Løpende sjekker av utvalgsforhold-avvik per variant
  • Automatiseringen nekter å handle på flagget data
  • Årsaken oppgitt i klart språk
  • Tre tillitsporter: et utvalgsforhold-avvik, en dag uten trafikk, eller en interferens med en annen kjørende test
Tillitsskjermen: trafikkfordelingen til ett eksperiment stemmer med konfigurasjonen, et annet er flagget for utvalgsforhold-avvik med 54/46 mot en konfigurert jevn fordeling.

Penger

Omsetning per variant, i kontoens valuta

Konverteringsrate er en tilnærming. Pertento rapporterer omsetning og gjennomsnittlig ordreverdi per variant, slik at en seier som selger billigere produkter ikke ser ut som en seier.

  • Omsetning og gjennomsnittlig ordreverdi per variant, i én valgt valuta
  • Konverteringer telt på tvers av alle valutaer, fordi en konvertering er en konvertering
  • Omsetning lest som et sekundært mål for implementeringskøen, slik at en seier bare på omsetning fortsatt sendes
  • Signifikans og intervaller på omsetning så vel som på konverteringer
Omsetningsvisningen for et eksperiment: en positiv effekt på omsetning og gjennomsnittlig ordreverdi, med omsetning og antall ordrer brutt ned per variant.

Tallene

Hva resultattabellen faktisk forteller dere

Seks tall gjør det meste av jobben på denne skjermen, og to av dem er de som oftest mistolkes. Konsollen forklarer hvert tall der det står; dette er hva de er til for.

To intervaller, ikke ett

Et Wilson-intervall for hver variants egen andel, som holder seg mellom null og hundre prosent selv ved små utvalg, og et løftintervall for forskjellen mot kontrollen. Det andre er det som avgjør en diskusjon: passerer det null, ligger varianten virkelig foran.

Sannsynligheten for at en variant er best

Den bayesianske halvdelen rapporterer sjansen for at hver variant er den beste av dem som er testet. I motsetning til en p-verdi svarer den på spørsmålet dere faktisk stilte, og derfor er det oftest tallet folk leser først.

Forventet tap

Hva dere ville gi opp ved å rulle ut denne varianten hvis den viser seg ikke å være den beste. Et lite forventet tap betyr at beslutningen er billig selv når den er feil, og det er ofte det som avgjør heller enn signifikans.

Gulvet for målbar effekt

Den minste endringen denne mengden trafikk pålitelig kan oppdage. En forskjell under gulvet blir ikke signifikant av at dere venter på dagens trafikknivå, uansett hvor lenge dere lar testen løpe. Dette er feilmodusen som ser ut som "ingen resultat" og egentlig er "ikke nok trafikk til å noen gang kunne avgjøre".

Dager igjen, ærlig

Framskrevet fra trafikkraten i det vinduet testen faktisk var live, og dimensjonert mot forskjellen som måles heller enn mot et fast mål. Når målet ligger lenger unna enn et år, sier den det i stedet for å skrive ut et firesifret antall dager.

Forklaringer på vanlig norsk

Hvert tall bærer sin egen definisjon, skrevet for å si hva det forteller heller enn for å definere begrepet. Der et tall er lett å lese feil, sier forklaringen det rett ut.

Under overflaten

Hva tallene er målt over

Et resultat er bare så godt som det det ble regnet ut fra: hvilken hendelse som teller som målet, hvilken valuta pengene er i, og om den samme matematikken lå bak både alarmen og skjermen.

Tre navngitte korreksjoner

Holm-Bonferroni, Benjamini-Hochberg og Šidák, eller ingen. En korreksjon endrer bare utfallet signifikant, aldri p-verdien, intervallet eller z-verdien, og med én enkelt variant faller alle fire sammen i samme terskel. Konsollen sier det i stedet for å la dere prøve hver av dem.

Primære og sekundære mål

Et nettsted markerer hvilke av hendelsene sine som kan brukes som målsetting; hvert eksperiment velger sitt primære mål fra den samlingen og lister resten som støttemål. En hendelse som senere nedgraderes fortsetter å rapportere på eksperimenter som allerede valgte den, så et avsluttet resultat endres aldri i etterkant.

Tidsserie per variant

Daglige sesjoner, konverteringer og inntekt per variant, som rå tall heller enn forhåndsregnede andeler. Hvert annet tall på siden er ett kumulativt tall, og ingen av dem kan vise om et resultat legger seg til ro eller fortsatt vandrer.

Kombinasjonsrapportering

Når flere eksperimenter kjører samtidig, spør kombinasjonsrapporten om to endringer virker sammen og om ordreverdien skiller seg mellom kombinasjoner. Den regnes utelukkende fra konverteringer, som er nøyaktig nok for det spørsmålet og ikke nok for "hvilken kombinasjon konverterer best".

Flere valutaer, holdt ærlig

Konverteringer telles på tvers av alle valutaer, fordi en konvertering er en konvertering uansett hva den ble betalt i. Inntekt er det ikke: å legge SEK til EUR gir en meningsløs sum, så inntekt krever at én valuta velges, og konsollen tvinger dere til å velge den.

Én implementasjon av matematikken

Alarmen som sender dere e-post og skjermen dere lander på kjører den samme sjekken av utvalgsfordelingen, og stoppmotoren leser utfallet gjennom den samme koden dashbordet rendrer. En varsling som motsier skjermen den lenker til, er verre enn ingen varsling.

Spørsmål

Før dere stoler på tallene

Kan vi ta disse tallene til en økonomidirektør?

Det er hva den andre halvdelen av denne siden er til for. Et resultat kommer med størrelsen på forskjellen, intervallet rundt den, og hvor sannsynlig det er at det er tilfeldig, regnet ut på to uavhengige måter og vist side om side. Inntekt måles per variant heller enn utledes fra konverteringsrate, så en variant som konverterer oftere og selger billigere leses ikke som en seier. Og plattformen oppgir sin egen usikkerhet i stedet for å skjule den, og det er den delen som holder under gransking: et resultat som ennå ikke er avgjørende sier det, i ord, heller enn å bli framstilt som avgjort.

Trenger vi en dataanalytiker for å lese det?

Nei, og designen går ut fra at dere ikke har en. Hvert tall bærer forklaringen sin på stedet, skrevet for å si hva tallet forteller heller enn for å definere begrepet, og flere finnes nettopp for å forebygge en feillesning: differansekolonnen sier rett ut at den i seg selv ikke sier noe om hvorvidt gapet er reelt. Ved siden av tallene står en anbefaling i vanlige ord. Hva den ikke gjør er å forenkle ved å skjule, så den som vil se p-verdien og intervallet finner begge.

Hvordan vet vi at en vinner er reell og ikke flaks?

Tre forsvar, og de er verdt å måle mot det dere bruker i dag. Å teste flere varianter samtidig øker sjansen for at én ser ut som en vinner ved flaks, så listen strammes for å kompensere, og konsollen oppgir terskelen den bruker i stedet for å la dere regne den ut. Å se på et resultat hver dag blåser opp andelen falske positive, så testen som er gyldig å lese fortløpende er skilt fra den som ikke er det, og plattformen stopper ikke et eksperiment tidlig med mindre begge er enige. Og før alt det sjekker den at trafikken faktisk ble delt som dere konfigurerte, for hvis den ikke ble det, holder ingenting som er regnet ut fra den.

Trafikken vår er ikke enorm. Fungerer dette for oss?

Iblant ja og iblant faktisk nei, og det er her plattformen er mest nyttig før dere har brukt tre måneder på å finne det ut. Hvert eksperiment rapporterer den minste forskjellen trafikken dere har pålitelig kan oppdage. Ligger effekten dere jakter under det gulvet, løser ingen mengde tålmodighet den opp, og konsollen sier det i stedet for å la en test ligge på "ikke signifikant" i det uendelige. Å vite hvilke av sidene deres som kan svare på et spørsmål og hvilke som ikke kan, er verdt mer på et beskjedent nettsted enn på et stort.

Må vi velge frekventistisk eller bayesiansk på forhånd?

Nei. Begge regnes ut for hvert eksperiment og vises sammen, så dette er en lesepreferanse heller enn en konfigurasjonsbeslutning dere kan ta feil. Den frekventistiske halvdelen rapporterer hvor usannsynlig resultatet ville være om endringen ikke gjorde noe. Den bayesianske halvdelen rapporterer sannsynligheten for at hver variant er best, og hva det ville koste dere å velge feil. Team synes gjerne den andre er lettere å handle på og den første lettere å forsvare, og det er nettopp derfor ingen av dem ble droppet.

Alt som er med

Hele funksjonssettet

Pertento er en plattform for konverteringsoptimalisering for nettsteder og nettbutikker, bygget både for interne team og for CRO-byråer som driver eksperimenteringsprogrammer på tvers av en kundeliste.

Integrasjoner

Fungerer med stacken dere allerede kjører

Én kodesnutt legges inn på hvilket som helst nettsted, eller kjør helt på serversiden. Ingenting å bygge om.

Kodesnutt på én linje

Lim inn én tagg på 0,9 KB i head, og dere er live. Ingen byggesteg, ingen avhengigheter.

Google Tag Manager

Rull ut og håndter eksperimenter rett gjennom GTM. Ingen utviklertid kreves.

API for serversiden

Kjør tester utenfor nettleseren: priser, søk og ruting, uten flimmer.

  • Shopify
  • BigCommerce
  • Shopware
  • Centra
  • Geins
  • Saleor
  • WordPress
  • Optimizely CMS
  • Storyblok
  • Next.js
  • Vue
  • Astro
  • Matomo
  • Amplitude
  • RudderStack
  • Slack
  • WooCommerce
  • Salesforce
  • Wix
  • Litium
  • commercetools
  • Medusa
  • Drupal
  • Contentful
  • Webflow
  • Nuxt
  • Angular
  • Remix
  • Piwik PRO
  • Mixpanel
  • Tag Manager
  • Webhooks
  • Adobe Commerce
  • PrestaShop
  • Squarespace
  • Norce
  • Shopify Hydrogen
  • Vendure
  • Umbraco
  • Sanity
  • Framer
  • React
  • SvelteKit
  • GA4
  • Adobe Analytics
  • Segment
  • Klaviyo

Ikke på listen? Hvis det rendrer HTML, kan Pertento teste det:les hvordan hver enkelt kobles til.

Bedre eksperimenter, bedre konvertering

Test on all visitors with the world’s lightest script and make confident decisions powered by real-time reporting.