Piattaforma · Statistiche difendibili

Frequentista e bayesiano, fianco a fianco

Incremento, intervalli di confidenza, probabilità che questa variante sia la migliore e perdita attesa: in un'unica vista, aggiornata in tempo reale.

Leggere un risultato

Cosa dicono i numeri, e cosa non dicono

Guardare presto senza barare, l'allarme che scatta prima che agiate, e i ricavi per variante nella valuta dell'account.

  • Test sequenziale che può legittimamente dichiarare un vincitore in anticipo, con correzione per confronti multipli
  • Allarmi di ripartizione anomala del campione che segnalano risultati inaffidabili prima che agiate su di essi
  • Ricavi e valore medio dell'ordine per variante, con supporto multivaluta
  • Una soglia minima dell'effetto rilevabile, così un test senza risposta possibile lo dice invece di girare all'infinito
  • Spiegazioni in linguaggio semplice per ogni statistica: nessun dottorato richiesto
Tempo realeMultivalutaAnalisi della potenza
La schermata delle statistiche di un test: un incremento del 12,4% con un valore p di 0,0184, il tasso di conversione nel tempo per il controllo e due varianti, e una tabella di significatività il cui verdetto in parole semplici dice che il risultato si può pubblicare senza rischi.

Test sequenziale

Guardate presto senza barare

Un test a orizzonte fisso è valido solo se guardate una volta, alla fine. Il test sequenziale vi permette di controllare ogni giorno e fermarvi nel momento in cui l'evidenza supera il confine.

  • Inferenza valida a ogni sguardo, non solo all'ultimo
  • Correzione per confronti multipli quando più varianti girano insieme
  • Una raccomandazione a parole, non solo un numero
  • Holm-Bonferroni, Benjamini-Hochberg o Šidák, oppure nessuna, dichiarato in entrambi i casi
Un grafico del test sequenziale: l’evidenza che sale giorno per giorno fra un confine tratteggiato inferiore e uno superiore, superando quello superiore al diciannovesimo giorno, con correzione Holm-Bonferroni su ventuno sguardi.

Affidabilità

L'allarme che scatta prima che agiate

Una ripartizione anomala del campione significa che la suddivisione non è avvenuta come l'avevate configurata, e il risultato non può essere letto. Pertento controlla di continuo e blocca l'automazione quando l'allarme scatta.

  • Controllo continuo della ripartizione anomala del campione per variante
  • L'automazione rifiuta di agire su dati segnalati
  • Il motivo dichiarato in parole semplici
  • Tre controlli: una ripartizione anomala del campione, un giorno senza traffico, o un'interazione con un altro test in corso
La schermata di affidabilità: la ripartizione del traffico di un test corrisponde alla sua configurazione, un altro è segnalato per una ripartizione anomala del campione a 54/46 contro una divisione paritaria configurata.

Denaro

Ricavi per variante, nella valuta dell'account

Il tasso di conversione è un indicatore indiretto. Pertento riferisce i ricavi e il valore medio dell'ordine per variante, così una vittoria che vende prodotti più economici non sembra una vittoria.

  • Ricavi e valore medio dell'ordine per variante, in una valuta scelta
  • Conversioni contate su tutte le valute, perché una conversione è una conversione
  • I ricavi sono letti come secondo obiettivo per la coda di implementazione, così un vincitore solo sui ricavi viene comunque pubblicato
  • Significatività e intervalli sui ricavi come sulle conversioni
La vista dei ricavi di un test: un effetto positivo su ricavi e valore medio dell’ordine, con ricavi e numero di ordini dettagliati per variante.

I numeri

Cosa vi dice davvero la tabella dei risultati

Sei numeri fanno gran parte del lavoro su questo schermo, e due di essi sono quelli letti più spesso in modo sbagliato. La console spiega ciascuno sul posto; è a questo che servono.

Due intervalli, non uno

Un intervallo di Wilson per il tasso proprio di ogni variante, che resta compreso fra zero e cento per cento anche su campioni piccoli, e un intervallo dell’incremento per la differenza rispetto al controllo. È il secondo quello che chiude una discussione: se non contiene lo zero, la variante è davvero in vantaggio.

Probabilità che una variante sia la migliore

La parte bayesiana riferisce la probabilità che ciascuna variante sia la migliore fra quelle testate. A differenza di un valore p, risponde alla domanda che avete posto davvero, ed è per questo che di solito è il primo numero che si legge.

Perdita attesa

Ciò a cui rinuncereste pubblicando questa variante se si rivelasse non essere la migliore. Una perdita attesa piccola significa che la decisione costa poco anche quando è sbagliata, ed è spesso questo a chiudere la questione più della significatività.

La soglia dell’effetto rilevabile

La differenza più piccola che questo volume di traffico riesce a rilevare in modo affidabile. Una differenza al di sotto non diventerà significativa aspettando, al livello di traffico attuale, per quanto tempo la lasciate in corso. È il modo di fallire che sembra "nessun risultato" e in realtà è "traffico insufficiente per poterlo mai dire".

Giorni rimanenti, onestamente

Proiettati dal ritmo del traffico sulla finestra in cui il test è stato davvero attivo, e dimensionati sulla differenza che si sta misurando anziché su un obiettivo fisso. Quando il traguardo è più lontano di un anno, lo dice invece di stampare un conteggio di giorni a quattro cifre.

Spiegazioni in italiano semplice

Ogni numero porta la propria definizione, scritta per dire cosa vi sta dicendo e non per definire il termine. Dove un numero è facile da fraintendere, la spiegazione lo dichiara apertamente.

Sotto

Su cosa vengono misurati i numeri

Un risultato vale quanto ciò da cui è stato calcolato: quale evento conta come obiettivo, in quale valuta è espresso il denaro, e se la stessa matematica ha prodotto l'allarme e lo schermo.

Tre correzioni con un nome

Holm-Bonferroni, Benjamini-Hochberg e Šidák, oppure nessuna. Una correzione cambia solo il verdetto di significatività, mai il valore p, l’intervallo o il punteggio z, e con una sola variante tutte e quattro si riducono alla stessa soglia. La console lo dice, invece di lasciarvi provare una per una.

Obiettivi primari e secondari

Un sito indica quali dei suoi eventi possono essere usati come obiettivo; ogni test scegle il proprio primario da quell’insieme ed elenca gli altri come metriche di supporto. Un evento retrocesso più tardi continua a riferire sui test che lo avevano già scelto, così un risultato concluso non cambia mai a posteriori.

Serie storiche per variante

Sessioni, conversioni e ricavi giornalieri per variante, come conteggi grezzi anziché tassi precalcolati. Ogni altro numero della pagina è un solo dato cumulato, e nessuno di essi può mostrare se un risultato si sta stabilizzando o sta ancora oscillando.

Reportistica sulle combinazioni

Quando più test sono attivi insieme, il report sulle combinazioni chiede se due modifiche interagiscono e se il valore degli ordini cambia fra le combinazioni. È calcolato dalle sole conversioni, che è esattamente quanto serve per quella domanda e non abbastanza per "quale combinazione converte meglio".

Multivaluta, tenuta onesta

Le conversioni sono contate su ogni valuta, perché una conversione è una conversione qualunque sia la moneta in cui è stata pagata. I ricavi no: sommare corone svedesi a euro dà un totale privo di senso, quindi i ricavi richiedono la scelta di una valuta e la console vi obbliga a scegliere.

Una sola implementazione della matematica

L’allarme che vi arriva per e-mail e lo schermo su cui atterrate eseguono lo stesso controllo sulla ripartizione del campione, e il motore di arresto legge il suo verdetto attraverso lo stesso codice che la dashboard mostra. Un avviso che contraddice lo schermo a cui rimanda è peggio di nessun avviso.

Domande

Prima di fidarvi dei numeri

Possiamo portare questi numeri a un direttore finanziario?

È a questo che serve la seconda metà di questa pagina. Un risultato arriva con l’ampiezza della differenza, l’intervallo attorno a essa e quanto è probabile che sia casuale, calcolato in due modi indipendenti e mostrato affiancato. I ricavi sono misurati per variante anziché dedotti dal tasso di conversione, così una variante che converte più spesso e vende a meno non si legge come una vittoria. E la piattaforma dichiara la propria incertezza invece di nasconderla, che è la parte che regge a un esame: un risultato non ancora conclusivo lo dice, a parole, invece di essere presentato come conclusivo.

Serve un data scientist per leggerlo?

No, e il progetto presuppone che non ne abbiate uno. Ogni numero porta con sé la propria spiegazione, sul posto, scritta per dire cosa vi sta dicendo quel numero e non per definire il termine, e diversi di essi esistono proprio per prevenire un fraintendimento: la colonna della differenza dichiara apertamente che da sola non dice nulla su quanto lo scarto sia reale. Accanto ai numeri c’è una raccomandazione a parole. Ciò che non fa è semplificare nascondendo, quindi chi vuole il valore p e l’intervallo li trova entrambi.

Come sappiamo che un vincitore è reale e non fortuna?

Tre difese, e vale la pena confrontarle con quello che usate oggi. Testare più varianti insieme aumenta la probabilità che una sembri vincente per caso, quindi l’asticella viene alzata per compensare, e la console dichiara la soglia che sta applicando invece di lasciarvela calcolare. Guardare un risultato ogni giorno gonfia il tasso di falsi positivi, quindi il test che è valido da leggere in continuo è distinto da quello che non lo è, e la piattaforma non ferma un test in anticipo se i due non concordano. E prima di tutto questo verifica che il traffico si sia ripartito davvero come lo avete configurato, perché se non è così nulla di ciò che ne deriva regge.

Il nostro traffico non è enorme. Funzionerà per noi?

A volte sì e a volte davvero no, ed è qui che la piattaforma è più utile prima che abbiate speso tre mesi per scoprirlo. Ogni test riferisce la differenza più piccola che il traffico che avete riesce a rilevare in modo affidabile. Se l’effetto che cercate sta sotto quella soglia, nessuna dose di pazienza lo risolverà, e la console lo dice invece di lasciare un test su "non significativo" a tempo indeterminato. Sapere quali delle vostre pagine possono rispondere a una domanda e quali no vale di più su un sito modesto che su uno grande.

Dobbiamo scegliere fra frequentista e bayesiano in partenza?

No. Entrambi sono calcolati per ogni test e mostrati insieme, quindi è una preferenza di lettura e non una scelta di configurazione che si può sbagliare. La parte frequentista riferisce quanto sarebbe improbabile il risultato se la modifica non avesse alcun effetto. La parte bayesiana riferisce la probabilità che ciascuna variante sia la migliore, e quanto vi costerebbe scegliere male. I team tendono a trovare la seconda più facile da usare e la prima più facile da difendere, ed è esattamente per questo che nessuna delle due è stata scartata.

Tutto ciò che c’è nella scatola

L’insieme completo delle funzionalità

Pertento è una piattaforma di ottimizzazione del tasso di conversione per siti web e negozi online, costruita sia per i team interni sia per le agenzie CRO che conducono programmi di sperimentazione su un portafoglio clienti.

Integrazioni

Funziona con lo stack che già usa

Uno snippet entra in qualsiasi sito, oppure passi completamente al server. Niente da riprogettare.

Snippet di una riga

Incolli un unico tag da 0,9 KB nel suo head ed è attivo. Nessuno step di build, nessuna dipendenza.

Google Tag Manager

Pubblichi e gestisca i test direttamente da GTM. Nessun tempo di sviluppo richiesto.

API server-side

Faccia test oltre il browser: prezzi, ricerca e routing, senza flicker.

  • Shopify
  • BigCommerce
  • Shopware
  • Centra
  • Geins
  • Saleor
  • WordPress
  • Optimizely CMS
  • Storyblok
  • Next.js
  • Vue
  • Astro
  • Matomo
  • Amplitude
  • RudderStack
  • Slack
  • WooCommerce
  • Salesforce
  • Wix
  • Litium
  • commercetools
  • Medusa
  • Drupal
  • Contentful
  • Webflow
  • Nuxt
  • Angular
  • Remix
  • Piwik PRO
  • Mixpanel
  • Tag Manager
  • Webhooks
  • Adobe Commerce
  • PrestaShop
  • Squarespace
  • Norce
  • Shopify Hydrogen
  • Vendure
  • Umbraco
  • Sanity
  • Framer
  • React
  • SvelteKit
  • GA4
  • Adobe Analytics
  • Segment
  • Klaviyo

Non è nell’elenco? Se genera HTML, Pertento può testarlo:legga come si collega ciascuno.

Test migliori, conversioni migliori

Test on all visitors with the world’s lightest script and make confident decisions powered by real-time reporting.