Plataforma · Estadísticas que puede defender

Frecuentista y bayesiano, lado a lado

Mejora, intervalos de confianza, probabilidad de que esta variante sea la mejor y pérdida esperada: en una sola vista, actualizada en tiempo real.

Leer un resultado

Lo que dicen los números, y lo que no dicen

Mirar pronto sin hacer trampa, la alarma que salta antes de que usted actúe, y los ingresos por variante en la moneda de la cuenta.

  • Pruebas secuenciales que pueden declarar legítimamente un ganador pronto, con corrección por comparaciones múltiples
  • Alarmas de desajuste en el reparto de la muestra que marcan resultados poco fiables antes de que actúe sobre ellos
  • Ingresos y valor medio del pedido por variante, con soporte para varias monedas
  • Un umbral de efecto detectable, para que un test sin respuesta posible lo diga en lugar de ejecutarse para siempre
  • Explicaciones en lenguaje llano sobre cada estadística: no hace falta doctorado
Tiempo realVarias monedasAnálisis de potencia
La pantalla de estadísticas de un experimento: una mejora del 12,4 % con un valor p de 0,0184, la tasa de conversión a lo largo del tiempo para el control y dos variantes, y una tabla de significancia cuyo veredicto en lenguaje llano dice que el resultado se puede publicar sin riesgo.

Pruebas secuenciales

Mire pronto sin hacer trampa

Un test de horizonte fijo solo es válido si mira una vez, al final. Las pruebas secuenciales le permiten comprobar cada día y detenerse en el momento en que la evidencia cruza el límite.

  • Inferencia válida en cada mirada, no solo en la última
  • Corrección por comparaciones múltiples cuando varias variantes se ejecutan a la vez
  • Una recomendación en palabras, no solo un número
  • Holm-Bonferroni, Benjamini-Hochberg o Šidák, o ninguna, indicado en cualquier caso
Un gráfico de pruebas secuenciales: la evidencia subiendo día a día entre un límite discontinuo inferior y otro superior, cruzando el superior el día diecinueve, con corrección de Holm-Bonferroni sobre veintiuna miradas.

Confianza

La alarma que salta antes de que usted actúe

Un desajuste en el reparto de la muestra significa que la división no ocurrió como la configuró, y el resultado no se puede leer. Pertento comprueba de forma continua y bloquea la automatización cuando la alarma salta.

  • Comprobación continua del reparto de la muestra por variante
  • La automatización se niega a actuar sobre datos marcados
  • El motivo indicado en palabras claras
  • Tres controles: un desajuste en el reparto de la muestra, un día sin tráfico, o una interacción con otro test en curso
La pantalla de confianza: el reparto de tráfico de un experimento coincide con su configuración, otro está marcado por un desajuste en el reparto de la muestra a 54/46 frente a un reparto par configurado.

Dinero

Ingresos por variante, en la moneda de la cuenta

La tasa de conversión es un indicador indirecto. Pertento informa de los ingresos y el valor medio del pedido por variante, para que una victoria que vende productos más baratos no parezca una victoria.

  • Ingresos y valor medio del pedido por variante, en una moneda elegida
  • Conversiones contadas en todas las monedas, porque una conversión es una conversión
  • Los ingresos se leen como un segundo objetivo para la cola de implementación, de modo que un ganador solo por ingresos se publica igualmente
  • Significancia e intervalos sobre los ingresos igual que sobre las conversiones
La vista de ingresos de un experimento: un efecto positivo en los ingresos y en el valor medio del pedido, con los ingresos y el número de pedidos desglosados por variante.

Las cifras

Lo que la tabla de resultados le dice de verdad

Seis números hacen la mayor parte del trabajo en esta pantalla, y dos de ellos son los que más se malinterpretan. La consola explica cada uno en su sitio; para eso están.

Dos intervalos, no uno

Un intervalo de Wilson para la tasa propia de cada variante, que se mantiene entre el cero y el cien por cien incluso con muestras pequeñas, y un intervalo de la mejora para la diferencia frente al control. El segundo es el que zanja una discusión: si deja el cero fuera, la variante va realmente por delante.

Probabilidad de que una variante sea la mejor

La mitad bayesiana informa de la probabilidad de que cada variante sea la mejor de las probadas. A diferencia de un valor p, responde a la pregunta que usted hizo de verdad, y por eso suele ser el número que la gente lee primero.

Pérdida esperada

Lo que dejaría de ganar al publicar esta variante si resulta que no es la mejor. Una pérdida esperada pequeña significa que la decisión sale barata incluso cuando es equivocada, y eso es a menudo lo que la zanja, más que la significancia.

El umbral de efecto detectable

El cambio más pequeño que este volumen de tráfico puede detectar de forma fiable. Una diferencia por debajo de él no se volverá significativa por esperar con el tráfico actual, por mucho tiempo que lo deje en marcha. Este es el fallo que parece «sin resultado» y en realidad es «nunca habrá tráfico suficiente para saberlo».

Días restantes, con honestidad

Se proyectan a partir del ritmo de tráfico durante la ventana en la que el test estuvo realmente activo, y se dimensionan según la diferencia que se está midiendo y no según un objetivo fijo. Cuando el objetivo queda a más de un año, lo dice en lugar de imprimir un recuento de días de cuatro cifras.

Explicaciones en lenguaje claro

Cada cifra lleva su propia definición, escrita para decir qué le está contando y no para definir el término. Donde un número se malinterpreta con facilidad, la explicación lo advierte sin rodeos.

Por debajo

Sobre qué se miden los números

Un resultado vale solo lo que valga aquello a partir de lo que se calculó: qué evento cuenta como objetivo, en qué moneda está el dinero, y si el mismo cálculo produjo la alerta y la pantalla.

Tres correcciones con nombre propio

Holm-Bonferroni, Benjamini-Hochberg y Šidák, o ninguna. Una corrección cambia solo el veredicto de significancia, nunca el valor p, el intervalo ni la puntuación z, y con una sola variante las cuatro se reducen al mismo umbral. La consola lo dice en lugar de dejar que usted las pruebe una a una.

Objetivos primarios y secundarios

Cada sitio web marca cuáles de sus eventos pueden usarse como objetivo; cada test elige su objetivo primario de ese conjunto y enumera el resto como métricas de apoyo. Un evento degradado más tarde sigue informando en los test que ya lo eligieron, así que un resultado terminado nunca cambia de forma retroactiva.

Series temporales por variante

Sesiones, conversiones e ingresos diarios por variante, como recuentos brutos y no como tasas ya calculadas. Todas las demás cifras de la página son un único número acumulado, y ninguna puede mostrar si un resultado se está asentando o sigue oscilando.

Informe de combinaciones

Cuando varios test corren a la vez, el informe de combinaciones pregunta si dos cambios interactúan y si los valores de pedido difieren entre combinaciones. Se calcula solo a partir de las conversiones, que es justo lo suficiente para esa pregunta y no lo suficiente para «qué combinación convierte mejor».

Varias monedas, sin trampas

Las conversiones se cuentan en todas las monedas, porque una conversión es una conversión se pague en lo que se pague. Los ingresos no: sumar SEK y EUR da un total sin sentido, así que los ingresos necesitan una moneda elegida y la consola le obliga a elegirla.

Una sola implementación de las matemáticas

La alarma que le llega por correo y la pantalla en la que aterriza ejecutan la misma comprobación del reparto de la muestra, y el motor de parada lee su veredicto a través del mismo código con el que se dibuja el panel. Un aviso que contradice la pantalla a la que enlaza es peor que ningún aviso.

Preguntas

Antes de fiarse de los números

¿Podemos llevar estos números a una dirección financiera?

Para eso está la segunda mitad de esta página. Un resultado llega con el tamaño de la diferencia, el intervalo que la rodea y la probabilidad de que sea azar, calculado de dos maneras independientes y mostrado en paralelo. Los ingresos se miden por variante en lugar de deducirse de la tasa de conversión, así que una variante que convierte más a menudo y vende más barato no se lee como una victoria. Y la plataforma declara su propia incertidumbre en vez de esconderla, que es la parte que aguanta el escrutinio: un resultado que todavía no es concluyente lo dice, con palabras, en lugar de presentarse como si lo fuera.

¿Hace falta un científico de datos para leerlo?

No, y el diseño da por supuesto que no lo tienen. Cada cifra lleva su explicación al lado, escrita para decir qué le está contando ese número y no para definir el término, y varias existen justamente para evitar una mala lectura: la columna de la diferencia afirma sin rodeos que por sí sola no dice nada sobre si la distancia es real. Junto a las cifras hay una recomendación en palabras llanas. Lo que no hará es simplificar escondiendo, así que quien sí quiera el valor p y el intervalo encontrará los dos.

¿Cómo sabemos que un ganador es real y no suerte?

Tres defensas, y merece la pena compararlas con lo que usen ahora. Probar varias variantes a la vez aumenta la probabilidad de que una parezca ganadora por suerte, así que el listón se ajusta para compensarlo, y la consola indica el umbral que está aplicando en lugar de dejar que usted lo deduzca. Mirar un resultado cada día infla la tasa de falsos positivos, así que la prueba estadística que es válido leer de forma continua está separada de la que no lo es, y la plataforma no detendrá un test antes de tiempo salvo que ambas coincidan. Y antes que nada, comprueba que el tráfico se repartió como usted lo configuró, porque si no fue así nada de lo calculado a partir de ahí se sostiene.

Nuestro tráfico no es enorme. ¿Nos servirá?

A veces sí y a veces sinceramente no, y aquí es donde la plataforma resulta más útil antes de que hayan gastado tres meses en averiguarlo. Cada test informa de la diferencia más pequeña que el tráfico que tienen puede detectar de forma fiable. Si el efecto que persiguen queda por debajo de ese umbral, ninguna dosis de paciencia lo resolverá, y la consola lo dice en lugar de dejar un test en «no significativo» indefinidamente. Saber qué páginas suyas pueden responder a una pregunta y cuáles no vale más en un sitio modesto que en uno grande.

¿Hay que elegir entre frecuentista y bayesiano de antemano?

No. Se calculan los dos para cada test y se muestran juntos, así que esto es una preferencia de lectura y no una decisión de configuración que se pueda equivocar. La mitad frecuentista informa de lo improbable que sería el resultado si el cambio no hiciera nada. La mitad bayesiana informa de la probabilidad de que cada variante sea la mejor, y de lo que costaría elegir mal. Los equipos suelen encontrar la segunda más fácil de aplicar y la primera más fácil de defender, que es exactamente por lo que no se descartó ninguna.

Todo lo que va en la caja

El conjunto completo de funciones

Pertento es una plataforma de optimización de la tasa de conversión para sitios web y tiendas online, construida tanto para equipos internos como para agencias de CRO que llevan programas de experimentación en toda una cartera de clientes.

Integraciones

Funciona con el stack que ya usa

Un fragmento entra en cualquier sitio, o pásese por completo al servidor. Nada que rediseñar.

Fragmento de una línea

Pegue una sola etiqueta de 0,9 KB en su head y ya está activo. Sin paso de build, sin dependencias.

Google Tag Manager

Publique y gestione experimentos directamente desde GTM. Sin necesidad de tiempo de desarrollo.

API en el servidor

Haga test más allá del navegador: precios, búsqueda y enrutado, sin parpadeo.

  • Shopify
  • BigCommerce
  • Shopware
  • Centra
  • Geins
  • Saleor
  • WordPress
  • Optimizely CMS
  • Storyblok
  • Next.js
  • Vue
  • Astro
  • Matomo
  • Amplitude
  • RudderStack
  • Slack
  • WooCommerce
  • Salesforce
  • Wix
  • Litium
  • commercetools
  • Medusa
  • Drupal
  • Contentful
  • Webflow
  • Nuxt
  • Angular
  • Remix
  • Piwik PRO
  • Mixpanel
  • Tag Manager
  • Webhooks
  • Adobe Commerce
  • PrestaShop
  • Squarespace
  • Norce
  • Shopify Hydrogen
  • Vendure
  • Umbraco
  • Sanity
  • Framer
  • React
  • SvelteKit
  • GA4
  • Adobe Analytics
  • Segment
  • Klaviyo

¿No está en la lista? Si genera HTML, Pertento puede probarlo:lea cómo se conecta cada uno.

Mejores test, mejores conversiones

Test on all visitors with the world’s lightest script and make confident decisions powered by real-time reporting.