Plataforma · Estatísticas que você pode defender

Frequentista e bayesiano, lado a lado

Ganho, intervalos de confiança, probabilidade de esta variante ser a melhor e perda esperada, tudo em uma única visão, atualizando em tempo real.

Lendo um resultado

O que os números dizem, e o que eles não dizem

Olhar cedo sem trapacear, o alarme que dispara antes de você agir, e receita por variante na moeda da conta.

  • Teste sequencial que pode legitimamente declarar um vencedor antes da hora, com correção para comparações múltiplas
  • Alarmes de discrepância na proporção da amostra que sinalizam resultados não confiáveis antes de você agir sobre eles
  • Receita e ticket médio por variante, com suporte a várias moedas
  • Um piso de efeito detectável, para que um teste sem resposta possível avise em vez de rodar para sempre
  • Explicações em português claro em cada estatística: sem precisar de doutorado
Tempo realVárias moedasAnálise de poder
A tela de estatísticas de um experimento: um ganho de 12,4% com um valor p de 0,0184, a taxa de conversão ao longo do tempo para o controle e duas variantes, e uma tabela de significância cujo veredicto em português claro diz que o resultado é seguro para implantar.

Teste sequencial

Olhe cedo sem trapacear

Um teste de horizonte fixo só é válido se você olhar uma vez, no final. O teste sequencial deixa você checar todo dia e parar no momento em que a evidência cruza o limite.

  • Inferência válida em cada olhada, não só na última
  • Correção para comparações múltiplas quando várias variantes rodam ao mesmo tempo
  • Uma recomendação em palavras, não só um número
  • Holm-Bonferroni, Benjamini-Hochberg ou Šidák, ou nenhuma, indicado de um jeito ou de outro
Um gráfico de teste sequencial: a evidência subindo dia a dia entre um limite tracejado inferior e um superior, cruzando o superior no dia dezenove, com correção de Holm-Bonferroni ao longo de vinte e uma olhadas.

Confiança

O alarme que dispara antes de você agir

Uma discrepância na proporção da amostra significa que a divisão não aconteceu do jeito que você configurou, e o resultado não pode ser lido. O Pertento verifica continuamente e bloqueia a automação quando ele dispara.

  • Checagens contínuas de discrepância na proporção da amostra por variante
  • A automação se recusa a agir sobre dados sinalizados
  • O motivo indicado em palavras simples
  • Três portões: uma discrepância na proporção da amostra, um dia sem tráfego, ou uma interação com outro teste rodando
A tela de confiança: a divisão de tráfego de um experimento corresponde à configuração dele, outro está sinalizado por discrepância na proporção da amostra, com 54/46 contra uma divisão configurada em partes iguais.

Dinheiro

Receita por variante, na moeda da conta

A taxa de conversão é um proxy. O Pertento reporta receita e ticket médio por variante, para que uma vitória que vende produtos mais baratos não pareça uma vitória.

  • Receita e ticket médio por variante, em uma moeda escolhida
  • Conversões contadas em todas as moedas, porque uma conversão é uma conversão
  • A receita é lida como uma segunda meta para a fila de implementação, para que uma vitória só em receita ainda seja implantada
  • Significância e intervalos sobre a receita, assim como sobre as conversões
A visão de receita de um experimento: um efeito positivo na receita e no ticket médio, com a receita e a contagem de pedidos abertas por variante.

Os números

O que a tabela de resultados está realmente te dizendo

Seis números fazem a maior parte do trabalho nessa tela, e dois deles são os que as pessoas costumam ler errado. O console explica cada um no lugar; é para isso que eles servem.

Dois intervalos, não um

Um intervalo de Wilson para a taxa de cada variante, que permanece entre zero e cem por cento mesmo em amostras pequenas, e um intervalo de ganho para a diferença contra o controle. O segundo é o que encerra uma discussão: se ele passa do zero, a variante está realmente à frente.

Probabilidade de uma variante ser a melhor

A metade bayesiana informa a chance de cada variante ser a melhor entre as testadas. Diferente de um valor p, ela responde à pergunta que você realmente fez, e é por isso que costuma ser o número que as pessoas leem primeiro.

Perda esperada

O que você deixaria de ganhar ao publicar esta variante caso ela não seja a melhor. Uma perda esperada pequena significa que a decisão é barata mesmo quando está errada, e muitas vezes é isso que resolve a questão, e não a significância.

O piso de efeito detectável

A menor mudança que esse volume de tráfego consegue detectar de forma confiável. Uma diferença abaixo dele não vai se tornar significativa esperando no nível de tráfego atual, por mais tempo que você deixe rodando. É o tipo de falha que parece "nenhum resultado" e na verdade é "tráfego insuficiente para saber algum dia".

Dias restantes, com honestidade

Projetado a partir do ritmo de tráfego na janela em que o teste esteve de fato no ar, e dimensionado pela diferença que está sendo medida em vez de por uma meta fixa. Quando a meta está a mais de um ano de distância, ele diz isso em vez de imprimir uma contagem de dias com quatro dígitos.

Explicações em português claro

Cada número carrega a própria definição, escrita para dizer o que ele está te contando e não para definir o termo. Onde um número é fácil de ler errado, a explicação avisa isso abertamente.

Por baixo

Sobre o que os números são medidos

Um resultado só é tão bom quanto aquilo de onde ele foi calculado: qual evento conta como meta, em qual moeda está o dinheiro, e se foi a mesma matemática que produziu o alerta e a tela.

Três correções com nome

Holm-Bonferroni, Benjamini-Hochberg e Šidák, ou nenhuma. Uma correção muda apenas o veredicto de significância, nunca o valor p, o intervalo ou o escore z, e com uma única variante todas as quatro se reduzem ao mesmo limite. O console diz isso em vez de deixar você testar uma por uma.

Metas primárias e secundárias

Um site marca quais dos seus eventos podem ser usados como objetivo; cada teste escolhe a meta primária dentro desse conjunto e lista o restante como métricas de apoio. Um evento rebaixado depois continua reportando nos testes que já o escolheram, então um resultado concluído nunca muda retroativamente.

Séries temporais por variante

Sessões, conversões e receita diárias por variante, como contagens brutas em vez de taxas pré-calculadas. Todo outro número da página é um único valor acumulado, e nenhum deles consegue mostrar se um resultado está se estabilizando ou ainda oscilando.

Relatório de combinações

Quando vários testes rodam ao mesmo tempo, o relatório de combinações pergunta se duas mudanças interagem e se os valores de pedido diferem entre as combinações. Ele é calculado só a partir das conversões, o que é exatamente suficiente para essa pergunta e insuficiente para "qual combinação converte melhor".

Várias moedas, com honestidade

As conversões são contadas em todas as moedas, porque uma conversão é uma conversão em qualquer moeda que tenha sido paga. A receita não: somar SEK com EUR dá um total sem sentido, então a receita exige que uma moeda seja escolhida, e o console obriga você a escolher.

Uma só implementação da matemática

O alerta que chega no seu e-mail e a tela em que você cai rodam a mesma checagem de proporção da amostra, e o motor de parada lê o veredicto pelo mesmo código que o painel renderiza. Um alerta que contradiz a tela para a qual ele aponta é pior que nenhum alerta.

Perguntas

Antes de confiar nos números

Podemos levar esses números para um diretor financeiro?

É para isso que serve a segunda metade desta página. Um resultado chega com o tamanho da diferença, o intervalo em volta dela e o quanto é provável que seja acaso, calculado de duas formas independentes e mostrado lado a lado. A receita é medida por variante em vez de inferida da taxa de conversão, então uma variante que converte mais vezes e vende mais barato não aparece como vitória. E a plataforma declara a própria incerteza em vez de esconder, que é a parte que sobrevive ao escrutínio: um resultado que ainda não é conclusivo diz isso, com palavras, em vez de ser apresentado como se fosse.

Precisamos de um cientista de dados para ler isso?

Não, e o design parte do princípio de que você não tem um. Cada número carrega a própria explicação ali mesmo, escrita para dizer o que aquele número está te contando e não para definir o termo, e várias delas existem justamente para evitar uma leitura errada: a coluna de diferença afirma abertamente que, por si só, ela não diz nada sobre a diferença ser real. Ao lado dos números há uma recomendação em palavras simples. O que ele não faz é simplificar escondendo, então quem quiser o valor p e o intervalo de confiança vai encontrar os dois.

Como sabemos que um vencedor é real e não sorte?

Três defesas, e vale comparar cada uma com o que você usa hoje. Testar várias variantes ao mesmo tempo aumenta a chance de uma parecer vencedora por sorte, então o critério é apertado para compensar, e o console informa o limite que está aplicando em vez de deixar você deduzir. Olhar um resultado todos os dias infla a taxa de falso positivo, então o teste estatístico válido para leitura contínua é separado do que não é, e a plataforma não encerra um teste antes da hora a menos que os dois concordem. E antes de tudo isso, ela confere se o tráfego se dividiu do jeito que você configurou, porque se não se dividiu, nada calculado a partir dele se sustenta.

O nosso tráfego não é enorme. Isso vai funcionar para nós?

Às vezes sim e às vezes realmente não, e é aqui que a plataforma é mais útil, antes de você gastar três meses descobrindo. Cada teste reporta a menor diferença que o tráfego que você tem consegue detectar de forma confiável. Se o efeito que você persegue fica abaixo desse piso, nenhuma dose de paciência vai resolver, e o console diz isso em vez de deixar um teste em "não significativo" indefinidamente. Saber quais das suas páginas conseguem responder a uma pergunta e quais não conseguem vale mais em um site modesto que em um grande.

Precisamos escolher frequentista ou bayesiano de antemão?

Não. Os dois são calculados para cada teste e mostrados juntos, então isso é uma preferência de leitura e não uma decisão de configuração que você pode errar. A metade frequentista informa quão improvável seria o resultado se a mudança não tivesse efeito nenhum. A metade bayesiana informa a probabilidade de cada variante ser a melhor, e quanto custaria a você escolher errado. Os times costumam achar a segunda mais fácil de agir e a primeira mais fácil de defender, e é exatamente por isso que nenhuma das duas foi descartada.

Tudo o que vem na caixa

A lista completa de funcionalidades

O Pertento é uma plataforma de otimização da taxa de conversão para sites e lojas online, feita tanto para times internos quanto para agências de CRO que rodam programas de experimentação em uma carteira de clientes.

Integrações

Funciona com o stack que você já roda

Um snippet entra em qualquer site, ou vá totalmente para o servidor. Nada para rearquitetar.

Snippet de uma linha

Cole uma única tag de 0,9 KB no seu head e você está no ar. Sem etapa de build, sem dependências.

Google Tag Manager

Implante e gerencie experimentos direto pelo GTM. Sem precisar de tempo de desenvolvedor.

API no servidor

Rode testes além do navegador: preços, busca e roteamento, sem piscar.

  • Shopify
  • BigCommerce
  • Shopware
  • Centra
  • Geins
  • Saleor
  • WordPress
  • Optimizely CMS
  • Storyblok
  • Next.js
  • Vue
  • Astro
  • Matomo
  • Amplitude
  • RudderStack
  • Slack
  • WooCommerce
  • Salesforce
  • Wix
  • Litium
  • commercetools
  • Medusa
  • Drupal
  • Contentful
  • Webflow
  • Nuxt
  • Angular
  • Remix
  • Piwik PRO
  • Mixpanel
  • Tag Manager
  • Webhooks
  • Adobe Commerce
  • PrestaShop
  • Squarespace
  • Norce
  • Shopify Hydrogen
  • Vendure
  • Umbraco
  • Sanity
  • Framer
  • React
  • SvelteKit
  • GA4
  • Adobe Analytics
  • Segment
  • Klaviyo

Não está na lista? Se renderiza HTML, o Pertento consegue testar:leia como cada uma se conecta.

Melhores testes, melhores conversões

Test on all visitors with the world’s lightest script and make confident decisions powered by real-time reporting.