Platform · Statistiek die u kunt verantwoorden

Frequentistisch en bayesiaans, naast elkaar

Lift, betrouwbaarheidsintervallen, kans dat deze variant de beste is, en verwacht verlies: in één weergave, realtime bijgewerkt.

Een resultaat lezen

Wat de cijfers zeggen, en wat niet

Vroeg kijken zonder te sjoemelen, het alarm dat afgaat voordat u handelt, en omzet per variant in de valuta van het account.

  • Sequentieel toetsen dat legitiem vroeg een winnaar kan aanwijzen, met correctie voor meervoudig vergelijken
  • Alarmen bij een scheve steekproefverhouding die onbetrouwbare resultaten markeren voordat u ernaar handelt
  • Omzet en gemiddelde orderwaarde per variant, met ondersteuning voor meerdere valuta
  • Een ondergrens voor het detecteerbare effect, zodat een onbeantwoordbare test dat zegt in plaats van eindeloos door te draaien
  • Uitleg in gewone taal bij elke statistiek: geen doctoraat vereist
RealtimeMeerdere valutaPower-analyse
Het statistiekscherm van een experiment: een uplift van 12,4% bij een p-waarde van 0,0184, het conversiepercentage over tijd voor de controle en twee varianten, en een significantietabel waarvan het oordeel in gewone taal luidt dat het resultaat veilig is om uit te leveren.

Sequentieel toetsen

Vroeg kijken zonder te sjoemelen

Een test met een vaste horizon is alleen geldig als u eenmaal kijkt, aan het einde. Sequentieel toetsen laat u elke dag controleren en stoppen op het moment dat het bewijs de grens overschrijdt.

  • Geldige inferentie bij elke blik, niet alleen de laatste
  • Correctie voor meervoudig vergelijken wanneer meerdere varianten tegelijk draaien
  • Een aanbeveling in woorden, niet alleen een getal
  • Holm-Bonferroni, Benjamini-Hochberg of Šidák, of geen, in beide gevallen vermeld
Een grafiek van sequentieel toetsen: het bewijs klimt dag na dag tussen een onderste en een bovenste stippellijn, en overschrijdt de bovenste op dag negentien, met Holm-Bonferroni-correctie over eenentwintig blikken.

Vertrouwen

Het alarm dat afgaat voordat u handelt

Een scheve steekproefverhouding betekent dat de verdeling niet is gebeurd zoals u die instelde, en dat het resultaat niet valt af te lezen. Pertento controleert voortdurend en blokkeert automatisering wanneer het alarm afgaat.

  • Doorlopende controle op een scheve steekproefverhouding per variant
  • Automatisering weigert te handelen op gemarkeerde data
  • De reden vermeld in gewone taal
  • Drie poorten: een scheve steekproefverhouding, een dag zonder verkeer, of een wisselwerking met een andere lopende test
Het vertrouwensscherm: bij één experiment komt de verkeersverdeling overeen met de configuratie, een ander is gemarkeerd voor een scheve steekproefverhouding van 54/46 tegen een ingestelde gelijke verdeling.

Geld

Omzet per variant, in de valuta van het account

Conversiepercentage is een indirecte maatstaf. Pertento rapporteert omzet en gemiddelde orderwaarde per variant, zodat een winst die goedkopere producten verkoopt niet als winst oogt.

  • Omzet en gemiddelde orderwaarde per variant, in één gekozen valuta
  • Conversies geteld over alle valuta heen, want een conversie is een conversie
  • Omzet gelezen als tweede doel voor de implementatiewachtrij, zodat een winst op alleen omzet toch wordt uitgeleverd
  • Significantie en intervallen op omzet net als op conversies
De omzetweergave van een experiment: een positief omzeteffect en een gemiddelde orderwaarde, met omzet en aantallen orders uitgesplitst per variant.

De cijfers

Wat de resultatentabel u werkelijk vertelt

Zes cijfers doen het meeste werk op dit scherm, en twee daarvan worden het vaakst verkeerd gelezen. De console legt elk cijfer ter plekke uit; daarvoor zijn ze er.

Twee intervallen, niet één

Een Wilson-interval voor het eigen percentage van elke variant, dat ook bij kleine steekproeven tussen nul en honderd procent blijft, en een liftinterval voor het verschil ten opzichte van de controle. Het tweede is het interval dat een discussie beslecht: valt nul erbuiten, dan ligt de variant er echt voor.

Kans dat een variant de beste is

De bayesiaanse helft rapporteert de kans dat elke variant de beste is van de geteste varianten. Anders dan een p-waarde beantwoordt dit de vraag die u werkelijk stelde, en daarom is het meestal het getal dat mensen als eerste lezen.

Verwacht verlies

Wat u opgeeft door deze variant uit te rollen als hij toch niet de beste blijkt. Een klein verwacht verlies betekent dat het besluit goedkoop is, ook als het fout is, en dat is vaak wat de doorslag geeft in plaats van significantie.

De ondergrens van het aantoonbare effect

De kleinste verandering die dit verkeersvolume betrouwbaar kan aantonen. Een verschil daaronder wordt bij het huidige verkeersniveau niet significant door te wachten, hoe lang u het ook laat lopen. Dit is de faalmodus die eruitziet als "geen resultaat" en in werkelijkheid "nooit genoeg verkeer om het te zien" is.

Resterende dagen, eerlijk berekend

Geprojecteerd op basis van het verkeerstempo over de periode dat de test daadwerkelijk live stond, en afgestemd op het verschil dat wordt gemeten in plaats van op een vast doel. Ligt het doel verder weg dan een jaar, dan zegt de console dat, in plaats van een dagenaantal van vier cijfers af te drukken.

Uitleg in gewone taal

Elk getal draagt zijn eigen definitie, geschreven om te zeggen wat het u vertelt en niet om de term te definiëren. Waar een getal makkelijk verkeerd te lezen is, zegt de uitleg dat ronduit.

Eronder

Waarover de cijfers worden gemeten

Een resultaat is maar zo goed als waaruit het is berekend: welk event als doel telt, in welke valuta het geld staat, en of dezelfde wiskunde het alarm en het scherm heeft geproduceerd.

Drie correcties met naam

Holm-Bonferroni, Benjamini-Hochberg en Šidák, of geen. Een correctie verandert alleen het significantieoordeel, nooit de p-waarde, het interval of de z-score, en bij één variant komen alle vier op dezelfde drempel neer. De console zegt dat, in plaats van u ze allemaal te laten uitproberen.

Primaire en secundaire doelen

Een website markeert welke van zijn events als doelstelling gebruikt mogen worden; elk experiment kiest daaruit zijn primaire doel en toont de rest als ondersteunende metrics. Een event dat later wordt gedegradeerd blijft rapporteren op experimenten die het al gekozen hadden, zodat een afgerond resultaat nooit met terugwerkende kracht verandert.

Tijdreeksen per variant

Dagelijkse sessies, conversies en omzet per variant, als ruwe aantallen in plaats van vooraf berekende percentages. Elk ander getal op de pagina is één cumulatief cijfer, en geen daarvan kan laten zien of een resultaat tot rust komt of nog alle kanten op beweegt.

Rapportage over combinaties

Wanneer meerdere experimenten tegelijk draaien, vraagt het combinatierapport of twee wijzigingen op elkaar inwerken en of de orderwaarden per combinatie verschillen. Het wordt alleen uit conversies berekend, wat precies genoeg is voor die vraag en niet genoeg voor "welke combinatie converteert het best".

Meerdere valuta, eerlijk gehouden

Conversies worden over elke valuta geteld, want een conversie is een conversie, in welke munt er ook is betaald. Bij omzet ligt dat anders: SEK bij EUR optellen geeft een betekenisloos totaal, dus voor omzet moet er één valuta gekozen worden en de console dwingt u die keuze te maken.

Eén implementatie van de wiskunde

Het alarm dat u e-mailt en het scherm waarop u belandt draaien dezelfde controle op de steekproefverhouding, en de stopmotor leest zijn oordeel via dezelfde code die het dashboard rendert. Een melding die het scherm tegenspreekt waarnaar hij linkt, is erger dan geen melding.

Vragen

Voor u de cijfers vertrouwt

Kunnen we deze cijfers meenemen naar een financieel directeur?

Daarvoor is de tweede helft van deze pagina bedoeld. Een resultaat komt binnen met de grootte van het verschil, het interval eromheen en hoe waarschijnlijk het is dat het toeval is, op twee onafhankelijke manieren berekend en naast elkaar getoond. Omzet wordt per variant gemeten in plaats van afgeleid uit het conversiepercentage, zodat een variant die vaker converteert en goedkoper verkoopt niet als winst wordt gelezen. En het platform benoemt zijn eigen onzekerheid in plaats van die te verbergen, en dat is het deel dat kritische toetsing doorstaat: een resultaat dat nog niet doorslaggevend is, zegt dat met zoveel woorden en wordt niet gepresenteerd als een resultaat dat het wel is.

Hebben we een datawetenschapper nodig om het te lezen?

Nee, en het ontwerp gaat ervan uit dat u er geen heeft. Elk getal draagt zijn eigen uitleg ter plekke, geschreven om te zeggen wat dat getal u vertelt en niet om de term te definiëren, en een aantal ervan bestaat juist om een verkeerde lezing voor te zijn: de verschilkolom zegt ronduit dat hij op zichzelf niets zegt over de vraag of het gat echt is. Naast de cijfers staat een aanbeveling in gewone woorden. Wat het niet doet, is vereenvoudigen door te verbergen, dus wie de p-waarde en het interval wel wil zien, vindt ze allebei.

Hoe weten we dat een winnaar echt is en geen toeval?

Drie verdedigingslinies, en het loont om ze te vergelijken met wat u nu gebruikt. Meerdere varianten tegelijk testen vergroot de kans dat er één door toeval als winnaar oogt, dus de lat gaat omhoog om dat te compenseren, en de console noemt de drempel die hij toepast in plaats van u die zelf te laten uitrekenen. Elke dag naar een resultaat kijken verhoogt het percentage vals-positieven, dus de toets die doorlopend gelezen mag worden staat los van de toets die dat niet verdraagt, en het platform stopt een experiment niet vroegtijdig tenzij beide het eens zijn. En vóór dat alles controleert het of het verkeer werkelijk is verdeeld zoals u het had ingesteld, want als dat niet zo is, houdt niets stand wat eruit is berekend.

Ons verkeer is niet enorm. Werkt dit voor ons?

Soms wel en soms echt niet, en juist hier is het platform het nuttigst, voordat u er drie maanden aan heeft besteed om daarachter te komen. Elk experiment rapporteert het kleinste verschil dat het verkeer dat u heeft betrouwbaar kan aantonen. Ligt het effect dat u zoekt onder die ondergrens, dan lost geen enkele hoeveelheid geduld het op, en de console zegt dat, in plaats van een test eindeloos op "niet significant" te laten staan. Weten welke van uw pagina's een vraag kunnen beantwoorden en welke niet, is op een bescheiden site meer waard dan op een grote.

Moeten we vooraf kiezen tussen frequentistisch en bayesiaans?

Nee. Beide worden voor elk experiment berekend en samen getoond, dus dit is een leesvoorkeur en geen configuratiekeuze die u fout kunt maken. De frequentistische helft rapporteert hoe onwaarschijnlijk het resultaat zou zijn als de wijziging niets deed. De bayesiaanse helft rapporteert de kans dat elke variant de beste is, en wat een verkeerde keuze u zou kosten. Teams vinden de tweede doorgaans makkelijker om naar te handelen en de eerste makkelijker te verdedigen, en precies daarom is geen van beide geschrapt.

Alles in het pakket

Het volledige functieoverzicht

Pertento is een platform voor conversieoptimalisatie voor websites en webshops, gebouwd voor zowel interne teams als CRO-bureaus die experimenteerprogramma’s over een hele klantenlijst draaien.

Integraties

Werkt met de stack die u al draait

Eén snippet valt in elke site, of ga volledig serverside. Niets om opnieuw te bouwen.

Snippet van één regel

Plak één tag van 0,9 KB in uw head en u bent live. Geen buildstap, geen afhankelijkheden.

Google Tag Manager

Rol experimenten uit en beheer ze rechtstreeks via GTM. Geen ontwikkeltijd nodig.

Serverside API

Test voorbij de browser: prijzen, zoeken en routering, zonder geflikker.

  • Shopify
  • BigCommerce
  • Shopware
  • Centra
  • Geins
  • Saleor
  • WordPress
  • Optimizely CMS
  • Storyblok
  • Next.js
  • Vue
  • Astro
  • Matomo
  • Amplitude
  • RudderStack
  • Slack
  • WooCommerce
  • Salesforce
  • Wix
  • Litium
  • commercetools
  • Medusa
  • Drupal
  • Contentful
  • Webflow
  • Nuxt
  • Angular
  • Remix
  • Piwik PRO
  • Mixpanel
  • Tag Manager
  • Webhooks
  • Adobe Commerce
  • PrestaShop
  • Squarespace
  • Norce
  • Shopify Hydrogen
  • Vendure
  • Umbraco
  • Sanity
  • Framer
  • React
  • SvelteKit
  • GA4
  • Adobe Analytics
  • Segment
  • Klaviyo

Niet op de lijst? Als het HTML rendert, kan Pertento het testen:lees hoe elk platform aansluit.

Betere experimenten, betere conversie

Test on all visitors with the world’s lightest script and make confident decisions powered by real-time reporting.