Plataforma · Estatísticas que se defendem

Frequentista e bayesiano, lado a lado

Ganho, intervalos de confiança, probabilidade de esta variante ser a melhor e perda esperada, tudo numa só vista, actualizada em tempo real.

A ler um resultado

O que os números dizem, e o que não dizem

Olhar cedo sem fazer batota, o alarme que dispara antes de agir, e a receita por variante na moeda da conta.

  • Teste sequencial que pode legitimamente declarar um vencedor antecipadamente, com correcção para comparações múltiplas
  • Alarmes de desajuste no rácio de amostragem que sinalizam resultados não fiáveis antes de agir sobre eles
  • Receita e valor médio de encomenda por variante, com suporte multimoeda
  • Um limiar de efeito detectável, para que um teste sem resposta possível o diga em vez de correr para sempre
  • Explicações em português simples em cada estatística: sem necessidade de doutoramento
Tempo realMultimoedaAnálise de potência
O ecrã de estatísticas de um teste: um ganho de 12,4% com um valor p de 0,0184, a taxa de conversão ao longo do tempo para o controlo e duas variantes, e uma tabela de significância cujo veredicto em palavras simples diz que o resultado é seguro para publicar.

Teste sequencial

Olhe cedo sem fazer batota

Um teste de horizonte fixo só é válido se olhar uma vez, no fim. O teste sequencial deixa-o verificar todos os dias e parar no momento em que a evidência ultrapassa o limiar.

  • Inferência válida em cada olhar, não apenas no último
  • Correcção para comparações múltiplas quando várias variantes correm ao mesmo tempo
  • Uma recomendação por palavras, não apenas um número
  • Holm-Bonferroni, Benjamini-Hochberg ou Šidák, ou nenhuma, indicado de qualquer das formas
Um gráfico de teste sequencial: a evidência a subir dia após dia entre um limite tracejado inferior e um superior, a cruzar o superior no dia dezanove, com correcção de Holm-Bonferroni ao longo de vinte e uma observações.

Confiança

O alarme que dispara antes de agir

Um desajuste no rácio de amostragem significa que a divisão não aconteceu como a configurou, e o resultado não pode ser lido. O Pertento verifica continuamente e bloqueia a automatização quando dispara.

  • Verificações contínuas de desajuste no rácio de amostragem por variante
  • A automatização recusa-se a agir sobre dados sinalizados
  • O motivo indicado em palavras simples
  • Três barreiras: um desajuste no rácio de amostragem, um dia sem tráfego, ou uma interacção com outro teste em curso
O ecrã de confiança: a divisão de tráfego de um teste corresponde à sua configuração, outro está sinalizado por desajuste no rácio de amostragem, com 54/46 face a uma divisão configurada em partes iguais.

Dinheiro

Receita por variante, na moeda da conta

A taxa de conversão é um indicador indirecto. O Pertento reporta a receita e o valor médio de encomenda por variante, para que uma vitória que vende produtos mais baratos não pareça uma vitória.

  • Receita e valor médio de encomenda por variante, numa moeda escolhida
  • Conversões contadas em todas as moedas, porque uma conversão é uma conversão
  • A receita é lida como um segundo objectivo para a fila de implementação, para que uma vitória só em receita seja igualmente publicada
  • Significância e intervalos sobre a receita tal como sobre as conversões
A vista de receita de um teste: um efeito positivo na receita e no valor médio de encomenda, com a receita e a contagem de encomendas discriminadas por variante.

Os números

O que a tabela de resultados está realmente a dizer-lhe

Seis números fazem a maior parte do trabalho neste ecrã, e dois deles são os que as pessoas costumam ler mal. A consola explica cada um no lugar; isto é para que servem.

Dois intervalos, não um

Um intervalo de Wilson para a taxa própria de cada variante, que se mantém entre zero e cem por cento mesmo com amostras pequenas, e um intervalo de ganho para a diferença face ao controlo. O segundo é o que resolve uma discussão: se ultrapassa o zero, a variante está genuinamente à frente.

Probabilidade de uma variante ser a melhor

A metade bayesiana reporta a probabilidade de cada variante ser a melhor das testadas. Ao contrário de um valor p, responde à pergunta que realmente fez, e é por isso que costuma ser o número que as pessoas leem primeiro.

Perda esperada

Aquilo de que abdicaria ao publicar esta variante se ela vier a não ser a melhor. Uma perda esperada pequena significa que a decisão é barata mesmo quando está errada, e é isso que muitas vezes a resolve, mais do que a significância.

O limiar do efeito detectável

A alteração mais pequena que este volume de tráfego consegue detectar de forma fiável. Uma diferença abaixo dele não se tornará significativa por esperar ao nível de tráfego actual, por muito tempo que a deixe a correr. É o modo de falha que parece “sem resultado” e é na verdade “tráfego insuficiente para algum dia se saber”.

Dias restantes, com honestidade

Projectados a partir do ritmo de tráfego na janela em que o teste esteve realmente no ar, e dimensionados face à diferença que está a ser medida em vez de a um objectivo fixo. Quando o objectivo está a mais de um ano de distância, di-lo em vez de imprimir uma contagem de dias com quatro dígitos.

Explicações em português simples

Cada número leva consigo a sua própria definição, escrita para dizer o que lhe está a dizer e não para definir o termo. Onde um número é fácil de ler mal, a explicação di-lo sem rodeios.

Por baixo

Sobre o que os números são medidos

Um resultado só é tão bom quanto aquilo a partir do qual foi calculado: que evento conta como objectivo, em que moeda está o dinheiro, e se foi a mesma matemática a produzir o alerta e o ecrã.

Três correcções com nome

Holm-Bonferroni, Benjamini-Hochberg e Šidák, ou nenhuma. Uma correcção altera apenas o veredicto de significância, nunca o valor p, o intervalo ou o valor z, e com uma única variante as quatro reduzem-se ao mesmo limiar. A consola di-lo em vez de o deixar a testar cada uma.

Objectivos primários e secundários

Um site marca quais dos seus eventos podem ser usados como objectivo; cada teste escolhe o seu primário desse conjunto e lista os restantes como métricas de apoio. Um evento despromovido mais tarde continua a reportar nos testes que já o escolheram, pelo que um resultado terminado nunca muda retroactivamente.

Séries temporais por variante

Sessões, conversões e receita diárias por variante, como contagens brutas em vez de taxas pré-calculadas. Todos os outros números da página são um único valor acumulado, e nenhum deles consegue mostrar se um resultado está a estabilizar ou ainda a oscilar.

Relatório de combinações

Quando vários testes correm ao mesmo tempo, o relatório de combinações pergunta se duas alterações interagem e se os valores de encomenda diferem entre combinações. É calculado apenas a partir das conversões, o que é exactamente suficiente para essa pergunta e insuficiente para “qual a combinação que converte melhor”.

Multimoeda, mantida honesta

As conversões são contadas em todas as moedas, porque uma conversão é uma conversão qualquer que tenha sido a moeda em que foi paga. A receita não: somar SEK a EUR dá um total sem sentido, pelo que a receita exige a escolha de uma moeda e a consola obriga-o a escolhê-la.

Uma só implementação da matemática

O alarme que lhe envia um e-mail e o ecrã em que aterra correm a mesma verificação de repartição da amostra, e o motor de paragem lê o seu veredicto através do mesmo código que o painel desenha. Um alerta que contradiz o ecrã para o qual aponta é pior do que nenhum alerta.

Perguntas

Antes de confiar nos números

Podemos levar estes números a um director financeiro?

É para isso que serve a segunda metade desta página. Um resultado chega com a dimensão da diferença, o intervalo em seu redor, e a probabilidade de ser obra do acaso, calculada por duas vias independentes e mostrada lado a lado. A receita é medida por variante em vez de inferida da taxa de conversão, pelo que uma variante que converte mais vezes e vende mais barato não é lida como uma vitória. E a plataforma declara a sua própria incerteza em vez de a esconder, que é a parte que resiste ao escrutínio: um resultado que ainda não é conclusivo di-lo, por palavras, em vez de ser apresentado como um que já o é.

É preciso um cientista de dados para o ler?

Não, e o desenho parte do princípio de que não têm um. Cada número leva consigo a sua explicação no lugar, escrita para dizer o que esse número lhe está a dizer e não para definir o termo, e vários deles existem precisamente para evitar uma leitura errada: a coluna da diferença afirma sem rodeios que, por si só, nada diz sobre se a diferença é real. Ao lado dos números há uma recomendação em palavras simples. O que não fará é simplificar escondendo, pelo que quem quiser o valor p e o intervalo encontra os dois.

Como sabemos que um vencedor é real e não sorte?

Três defesas, e vale a pena compará-las com o que usam hoje. Testar várias variantes ao mesmo tempo aumenta a probabilidade de uma parecer vencedora por sorte, pelo que a fasquia é apertada para compensar, e a consola declara o limiar que está a aplicar em vez de o deixar a calculá-lo. Olhar para um resultado todos os dias inflaciona a taxa de falsos positivos, pelo que o teste que é válido ler continuamente está separado do que não é, e a plataforma não para um teste antecipadamente sem que ambos concordem. E antes de tudo isso, verifica se o tráfego se repartiu efectivamente como o configurou, porque se não se repartiu, nada calculado a partir dele se sustenta.

O nosso tráfego não é enorme. Isto funciona para nós?

Às vezes sim e às vezes genuinamente não, e é aqui que a plataforma é mais útil, antes de terem passado três meses a descobri-lo. Cada teste reporta a diferença mais pequena que o tráfego que têm consegue detectar de forma fiável. Se o efeito que perseguem fica abaixo desse limiar, nenhuma dose de paciência o resolverá, e a consola di-lo em vez de deixar um teste em “não significativo” indefinidamente. Saber quais das suas páginas conseguem responder a uma pergunta e quais não conseguem vale mais num site modesto do que num grande.

Temos de escolher frequentista ou bayesiano à partida?

Não. Ambos são calculados para cada teste e mostrados em conjunto, pelo que se trata de uma preferência de leitura e não de uma decisão de configuração que se possa errar. A metade frequentista reporta quão improvável seria o resultado se a alteração não tivesse feito nada. A metade bayesiana reporta a probabilidade de cada variante ser a melhor, e o que lhe custaria escolher mal. As equipas tendem a achar a segunda mais fácil de accionar e a primeira mais fácil de defender, e é exactamente por isso que nenhuma delas foi abandonada.

Tudo o que vem incluído

O conjunto completo de funcionalidades

O Pertento é uma plataforma de optimização da taxa de conversão para sites e lojas online, feita tanto para equipas internas como para agências de CRO que conduzem programas de experimentação numa carteira de clientes.

Integrações

Funciona com a stack que já tem

Um snippet entra em qualquer site, ou vá totalmente para o servidor. Nada para rearquitectar.

Um snippet de uma linha

Cole uma única etiqueta de 0,9 KB no seu head e está ao vivo. Sem passo de compilação, sem dependências.

Google Tag Manager

Publique e gere os testes directamente através do GTM. Sem necessidade de tempo de programador.

API do lado do servidor

Corra testes para além do navegador: preços, pesquisa e encaminhamento, sem piscar.

  • Shopify
  • BigCommerce
  • Shopware
  • Centra
  • Geins
  • Saleor
  • WordPress
  • Optimizely CMS
  • Storyblok
  • Next.js
  • Vue
  • Astro
  • Matomo
  • Amplitude
  • RudderStack
  • Slack
  • WooCommerce
  • Salesforce
  • Wix
  • Litium
  • commercetools
  • Medusa
  • Drupal
  • Contentful
  • Webflow
  • Nuxt
  • Angular
  • Remix
  • Piwik PRO
  • Mixpanel
  • Tag Manager
  • Webhooks
  • Adobe Commerce
  • PrestaShop
  • Squarespace
  • Norce
  • Shopify Hydrogen
  • Vendure
  • Umbraco
  • Sanity
  • Framer
  • React
  • SvelteKit
  • GA4
  • Adobe Analytics
  • Segment
  • Klaviyo

Não está na lista? Se gera HTML, o Pertento consegue testá-lo:leia como cada uma se liga.

Melhores testes, melhores conversões

Test on all visitors with the world’s lightest script and make confident decisions powered by real-time reporting.