Plateforme · Des statistiques défendables

Fréquentiste et bayésien, côte à côte

Gain, intervalles de confiance, probabilité que cette variante soit la meilleure et perte attendue : dans une seule vue, mise à jour en temps réel.

Lire un résultat

Ce que les chiffres disent, et ce qu'ils ne disent pas

Regarder tôt sans tricher, l'alarme qui se déclenche avant que vous agissiez, et le revenu par variante dans la devise du compte.

  • Test séquentiel pouvant légitimement déclarer un gagnant tôt, avec correction pour comparaisons multiples
  • Alarmes de ratio d'échantillonnage qui signalent les résultats non fiables avant que vous n'agissiez dessus
  • Revenu et panier moyen par variante, avec prise en charge multidevise
  • Un seuil d'effet détectable, pour qu'un test sans réponse possible le dise au lieu de tourner indéfiniment
  • Des explications en langage clair sur chaque statistique : aucun doctorat requis
Temps réelMultideviseAnalyse de puissance
L’écran de statistiques d’un test : un gain de 12,4 % pour une valeur p de 0,0184, le taux de conversion dans le temps pour le contrôle et deux variantes, et un tableau de significativité dont le verdict en langage clair indique que le résultat peut être livré sans risque.

Test séquentiel

Regardez tôt sans tricher

Un test à horizon fixe n'est valide que si vous regardez une fois, à la fin. Le test séquentiel vous permet de vérifier chaque jour et de vous arrêter au moment où la preuve franchit la limite.

  • Inférence valide à chaque regard, pas seulement au dernier
  • Correction pour comparaisons multiples quand plusieurs variantes tournent à la fois
  • Une recommandation en mots, pas juste un chiffre
  • Holm-Bonferroni, Benjamini-Hochberg ou Šidák, ou aucune, précisé dans tous les cas
Un graphique de test séquentiel : la preuve qui monte jour après jour entre une limite inférieure et une limite supérieure en pointillés, franchissant la supérieure au dix-neuvième jour, avec correction de Holm-Bonferroni sur vingt-et-un regards.

Fiabilité

L'alarme qui se déclenche avant que vous agissiez

Un écart de ratio d'échantillonnage signifie que la répartition ne s'est pas produite comme vous l'aviez configurée, et que le résultat ne peut pas être lu. Pertento vérifie en continu et bloque l'automatisation quand l'alarme se déclenche.

  • Vérification continue du ratio d'échantillonnage par variante
  • L'automatisation refuse d'agir sur des données signalées
  • La raison indiquée en mots clairs
  • Trois contrôles : un écart de ratio d'échantillonnage, une journée sans trafic, ou une interaction avec un autre test en cours
L’écran de fiabilité : la répartition du trafic d’un test correspond à sa configuration, un autre est signalé pour un écart de ratio d’échantillonnage à 54/46 face à une répartition égale configurée.

Argent

Revenu par variante, dans la devise du compte

Le taux de conversion est un indicateur indirect. Pertento indique le revenu et le panier moyen par variante, pour qu'une victoire qui vend des produits moins chers ne ressemble pas à une victoire.

  • Revenu et panier moyen par variante, dans une devise choisie
  • Conversions comptées sur toutes les devises, car une conversion est une conversion
  • Le revenu est lu comme un second objectif pour la file d'implémentation, si bien qu'un gagnant sur le revenu seul est quand même livré
  • Signification et intervalles sur le revenu comme sur les conversions
La vue du revenu d’un test : un effet positif sur le revenu et sur le panier moyen, avec le revenu et le nombre de commandes détaillés par variante.

Les chiffres

Ce que le tableau de résultats vous dit vraiment

Six chiffres font l'essentiel du travail sur cet écran, et deux d'entre eux sont ceux que l'on interprète le plus souvent mal. La console explique chacun sur place ; c'est à cela qu'ils servent.

Deux intervalles, pas un

Un intervalle de Wilson pour le taux propre à chaque variante, qui reste entre zéro et cent pour cent même sur de petits échantillons, et un intervalle de gain pour l’écart avec la version de contrôle. C’est le second qui tranche un débat : s’il ne contient pas zéro, la variante est réellement devant.

Probabilité qu’une variante soit la meilleure

Le volet bayésien indique la probabilité que chaque variante soit la meilleure de celles testées. Contrairement à une valeur p, il répond à la question que vous avez réellement posée, et c’est pourquoi c’est en général le premier chiffre que l’on lit.

Perte espérée

Ce que vous abandonneriez en déployant cette variante si elle se révélait ne pas être la meilleure. Une perte espérée faible signifie que la décision coûte peu même lorsqu’elle est mauvaise, et c’est souvent cela qui tranche plutôt que la significativité.

Le seuil d’effet détectable

Le plus petit écart que ce volume de trafic peut détecter de façon fiable. Une différence inférieure ne deviendra pas significative en attendant au niveau de trafic actuel, quelle que soit la durée pendant laquelle vous la laissez tourner. C’est le mode d’échec qui ressemble à « aucun résultat » et qui est en réalité « jamais assez de trafic pour le savoir ».

Jours restants, honnêtement

Projetés à partir du rythme de trafic sur la période où le test a réellement tourné, et calibrés sur l’écart mesuré plutôt que sur un objectif fixe. Quand l’objectif est à plus d’un an, la console le dit au lieu d’afficher un nombre de jours à quatre chiffres.

Des explications en français clair

Chaque chiffre porte sa propre définition, écrite pour dire ce qu’il vous apprend plutôt que pour définir le terme. Lorsqu’un nombre est facile à mal interpréter, l’explication le dit franchement.

En dessous

Sur quoi les chiffres sont mesurés

Un résultat ne vaut que ce à partir de quoi il a été calculé : quel événement compte comme objectif, dans quelle devise l'argent est exprimé, et si le même calcul a produit l'alerte et l'écran.

Trois corrections nommées

Holm-Bonferroni, Benjamini-Hochberg et Šidák, ou aucune. Une correction ne modifie que le verdict de significativité, jamais la valeur p, l’intervalle ou le score z, et avec une seule variante les quatre se ramènent au même seuil. La console le dit au lieu de vous laisser les essayer une par une.

Objectifs principaux et secondaires

Un site indique lesquels de ses événements peuvent servir d’objectif ; chaque test choisit son objectif principal dans cet ensemble et retient les autres comme indicateurs d’appui. Un événement rétrogradé plus tard continue de rendre compte sur les tests qui l’avaient déjà retenu, si bien qu’un résultat terminé ne change jamais rétroactivement.

Séries temporelles par variante

Sessions, conversions et revenu quotidiens par variante, en effectifs bruts plutôt qu’en taux précalculés. Tous les autres chiffres de la page sont un unique nombre cumulé, et aucun d’eux ne peut montrer si un résultat se stabilise ou continue d’osciller.

Rapport de combinaisons

Quand plusieurs tests tournent en même temps, le rapport de combinaisons examine si deux modifications interagissent et si la valeur des commandes diffère d’une combinaison à l’autre. Il est calculé à partir des seules conversions, ce qui suffit exactement pour cette question et ne suffit pas pour « quelle combinaison convertit le mieux ».

Multidevise, sans tricher

Les conversions sont comptées toutes devises confondues, parce qu’une conversion reste une conversion quelle que soit la monnaie du paiement. Le revenu, non : additionner des SEK et des EUR donne un total dénué de sens, donc le revenu exige de choisir une devise et la console vous oblige à la choisir.

Une seule implémentation des calculs

L’alarme qui vous envoie un e-mail et l’écran sur lequel vous arrivez exécutent le même contrôle de ratio d’échantillonnage, et le moteur d’arrêt lit son verdict par le code même qu’affiche le tableau de bord. Une alerte qui contredit l’écran vers lequel elle pointe est pire que pas d’alerte du tout.

Questions

Avant de faire confiance aux chiffres

Peut-on présenter ces chiffres à un directeur financier ?

C’est à cela que sert la seconde moitié de cette page. Un résultat arrive avec l’ampleur de l’écart, l’intervalle qui l’entoure et la probabilité qu’il soit dû au hasard, calculée de deux façons indépendantes et présentée côte à côte. Le revenu est mesuré par variante plutôt que déduit du taux de conversion, si bien qu’une variante qui convertit plus souvent en vendant moins cher ne passe pas pour un gain. Et la plateforme énonce sa propre incertitude au lieu de la masquer, ce qui est la partie qui résiste à l’examen : un résultat qui n’est pas encore concluant le dit, en toutes lettres, au lieu d’être présenté comme s’il l’était.

Faut-il un data scientist pour le lire ?

Non, et la conception part du principe que vous n’en avez pas. Chaque chiffre porte son explication sur place, écrite pour dire ce que ce nombre vous apprend plutôt que pour définir le terme, et plusieurs d’entre elles existent précisément pour éviter un contresens : la colonne de l’écart énonce franchement qu’elle ne dit rien à elle seule sur la réalité de cet écart. À côté des chiffres figure une recommandation en mots simples. Ce qu’elle ne fera pas, c’est simplifier en cachant, si bien que celui qui veut la valeur p et l’intervalle les trouvera tous les deux.

Comment savoir qu’un gagnant est réel et non un coup de chance ?

Trois défenses, et elles valent la comparaison avec ce que vous utilisez aujourd’hui. Tester plusieurs variantes à la fois augmente le risque que l’une d’elles paraisse gagnante par chance, donc le seuil est resserré pour compenser, et la console indique le seuil qu’elle applique au lieu de vous laisser le calculer. Consulter un résultat tous les jours gonfle le taux de faux positifs, donc le test que l’on peut lire en continu est distinct de celui qui ne le permet pas, et la plateforme n’arrêtera pas un test par anticipation sans que les deux concordent. Et avant tout cela, elle vérifie que le trafic s’est bien réparti comme vous l’aviez configuré, car si ce n’est pas le cas, rien de ce qui en est calculé ne tient.

Notre trafic n’est pas énorme. Est-ce que cela fonctionnera pour nous ?

Parfois oui et parfois franchement non, et c’est là que la plateforme est la plus utile, avant que vous n’ayez passé trois mois à le découvrir. Chaque test indique le plus petit écart que le trafic dont vous disposez peut détecter de façon fiable. Si l’effet que vous cherchez se situe sous ce seuil, aucune patience ne le résoudra, et la console le dit au lieu de laisser un test sur « non significatif » indéfiniment. Savoir lesquelles de vos pages peuvent répondre à une question et lesquelles ne le peuvent pas vaut davantage sur un site modeste que sur un grand.

Faut-il choisir entre fréquentiste et bayésien dès le départ ?

Non. Les deux sont calculés pour chaque test et présentés ensemble, si bien qu’il s’agit d’une préférence de lecture et non d’un réglage que l’on peut rater. Le volet fréquentiste indique à quel point le résultat serait improbable si la modification n’avait aucun effet. Le volet bayésien indique la probabilité que chaque variante soit la meilleure, et ce qu’un mauvais choix vous coûterait. Les équipes trouvent en général le second plus facile à mettre en action et le premier plus facile à défendre, et c’est exactement pourquoi aucun des deux n’a été abandonné.

Tout ce qu’il y a dans la boîte

L’ensemble complet des fonctionnalités

Pertento est une plateforme d’optimisation du taux de conversion pour les sites et les boutiques en ligne, conçue à la fois pour les équipes internes et pour les agences CRO qui mènent des programmes d’expérimentation sur tout un portefeuille de clients.

Intégrations

Fonctionne avec la stack que vous utilisez déjà

Un seul extrait s’insère dans n’importe quel site, ou passez entièrement côté serveur. Rien à réarchitecturer.

Un extrait d’une ligne

Collez une seule balise de 0,9 Ko dans votre head et vous êtes en ligne. Aucune étape de build, aucune dépendance.

Google Tag Manager

Déployez et gérez les tests directement via GTM. Aucun temps de développement requis.

API côté serveur

Faites tourner des tests au-delà du navigateur : tarification, recherche et routage, sans scintillement.

  • Shopify
  • BigCommerce
  • Shopware
  • Centra
  • Geins
  • Saleor
  • WordPress
  • Optimizely CMS
  • Storyblok
  • Next.js
  • Vue
  • Astro
  • Matomo
  • Amplitude
  • RudderStack
  • Slack
  • WooCommerce
  • Salesforce
  • Wix
  • Litium
  • commercetools
  • Medusa
  • Drupal
  • Contentful
  • Webflow
  • Nuxt
  • Angular
  • Remix
  • Piwik PRO
  • Mixpanel
  • Tag Manager
  • Webhooks
  • Adobe Commerce
  • PrestaShop
  • Squarespace
  • Norce
  • Shopify Hydrogen
  • Vendure
  • Umbraco
  • Sanity
  • Framer
  • React
  • SvelteKit
  • GA4
  • Adobe Analytics
  • Segment
  • Klaviyo

Pas dans la liste ? Si ça rend du HTML, Pertento peut le tester :lisez comment chacune se connecte.

De meilleurs tests, de meilleures conversions

Test on all visitors with the world’s lightest script and make confident decisions powered by real-time reporting.