Sample Ratio Mismatch pri A/B testoch: ako odhaliť pokazený experiment

A/B test môže na prvý pohľad vyzerať úspešne. Variant B má vyšší konverzný pomer, viac objednávok alebo vyššiu priemernú hodnotu nákupu. Štatistická významnosť vyzerá presvedčivo a tím už premýšľa nad nasadením víťaznej verzie.

Existuje však kontrola, ktorú by ste mali urobiť ešte pred vyhodnotením samotného výsledku: Sample Ratio Mismatch – SRM.

Ak mal experiment rozdeliť používateľov medzi variant A a variant B v pomere 50 : 50, ale v dátach skončilo výrazne viac používateľov v jednej skupine, nemusí ísť o náhodu. Môže to byť signál, že sa pokazilo priraďovanie používateľov, meranie, filtrovanie dát, implementácia variantu alebo samotná logika experimentu.

A v takom prípade môže byť štatisticky významný výsledok úplne nespoľahlivý.

SRM preto nevnímame ako ďalšiu metriku A/B testu. Je to kontrola dôveryhodnosti experimentu.

Microsoft Experimentation Platform opisuje SRM ako jednu zo základných kontrol kvality dát. Zároveň upozorňuje, že nestačí vizuálne porovnať pomer používateľov medzi variantmi – potrebné je zohľadniť aj veľkosť vzorky a vykonať štatistický test.

Čo je Sample Ratio Mismatch?

Sample Ratio Mismatch znamená, že skutočné rozdelenie používateľov medzi variantmi experimentu sa štatisticky významne líši od plánovaného rozdelenia.

Predstavme si jednoduchý A/B test.

Nastavenie experimentu:

  • variant A: 50 % návštevnosti,
  • variant B: 50 % návštevnosti.

Po skončení experimentu však získate:

  • variant A: 5 400 používateľov,
  • variant B: 4 600 používateľov.

Celková vzorka je 10 000 používateľov.

Očakávali by sme približne 5 000 používateľov v každej skupine. Rozdelenie 5 400 : 4 600 preto už vyvoláva otázku:

Prečo sa do variantu A dostalo o 800 používateľov viac?

Nemusí to automaticky znamenať problém. Rozdelenie používateľov nikdy nebude dokonale 50 : 50. Pri náhodnom priraďovaní vznikajú prirodzené odchýlky.

Rozhodujúce je, či je rozdiel ešte vysvetliteľný náhodou.

Na to slúži SRM test.

Prečo nestačí pozrieť sa na percentá

Predstavte si dva experimenty.

Experiment 1

  • A: 505 používateľov,
  • B: 495 používateľov.

Pomer je približne 50,5 : 49,5.

Experiment 2

  • A: 505 000 používateľov,
  • B: 495 000 používateľov.

Percentuálny rozdiel je prakticky rovnaký.

Z pohľadu štatistiky však nejde o rovnakú situáciu.

Pri veľkej vzorke môže aj relatívne malá percentuálna odchýlka predstavovať mimoriadne nepravdepodobný výsledok, ak mal byť traffic rozdelený náhodne.

Preto nestačí povedať:

„Je to približne 50 : 50, takže experiment je v poriadku.“

SRM musí zohľadniť očakávané rozdelenie aj veľkosť vzorky. Microsoft preto odporúča používať štatistický test, napríklad chí-kvadrát test, namiesto obyčajného vizuálneho porovnania percent.

Ako sa Sample Ratio Mismatch počíta

Najčastejším princípom je porovnanie:

očakávaného počtu používateľov

versus

skutočne nameraného počtu používateľov.

Pri teste 50 : 50 a 20 000 používateľoch by bolo očakávanie:

  • A = 10 000,
  • B = 10 000.

Ak získate:

  • A = 10 050,
  • B = 9 950,

malá odchýlka môže byť úplne prirodzená.

Ak však získate:

  • A = 10 800,
  • B = 9 200,

je potrebné preveriť, čo sa stalo.

Na posúdenie rozdielu sa môže použiť chí-kvadrát test, ktorý vypočíta p-value.

Zjednodušene:

čím nižšia je p-value, tým menej pravdepodobné je, že pozorovaný rozdiel vznikol iba náhodou.

Neexistuje jeden univerzálny prah vhodný pre každú experimentačnú platformu. Microsoft napríklad vo svojej experimentačnej platforme používa konzervatívny SRM prah p < 0,0005, aby obmedzil počet falošných alarmov.

Dôležitejší než samotné číslo je však princíp:

ak SRM test upozorní na problém, nemali by ste automaticky pokračovať k vyhodnocovaniu víťazného variantu. Najprv treba zistiť príčinu.

Prečo môže SRM úplne znehodnotiť A/B test

Najväčším problémom nie je samotný rozdiel v počte používateľov.

Problémom je otázka:

Prečo tento rozdiel vznikol?

Ak sa používateľ dostal do variantu A alebo B skutočne náhodne, skupiny by mali pochádzať z porovnateľnej populácie.

Ak však niektorý mechanizmus spôsobí, že sa určité typy používateľov častejšie dostávajú do jednej skupiny, vzniká selection bias.

A potom už nemusíte porovnávať dve verzie stránky.

Môžete porovnávať dve rozdielne skupiny ľudí.

Predstavte si, že variant B má technickú chybu iba v Safari. Časť návštevníkov používajúcich Safari sa preto vôbec nezaznamená.

V dátach potom môže variant B vyzerať napríklad takto:

  • nižšia návštevnosť,
  • vyšší konverzný pomer,
  • vyššia hodnota návštevníka.

Nie preto, že je variant lepší.

Ale preto, že v dátach chýba časť jeho používateľov.

Výsledok môže byť štatisticky významný a zároveň obchodne nesprávny.

Microsoft upozorňuje, že SRM môže vzniknúť v rôznych fázach experimentu – pri priraďovaní používateľov, vykonávaní experimentu, spracovaní logov alebo samotnej analýze dát.

Najčastejšie príčiny Sample Ratio Mismatch

1. Chyba pri priraďovaní používateľov

Experiment má používateľa náhodne zaradiť do konkrétneho variantu.

Problém môže vzniknúť, ak sa používa nespoľahlivý identifikátor, mení sa cookie, používateľ prechádza medzi zariadeniami alebo experiment nesprávne pracuje s prihlásenými a neprihlásenými návštevníkmi.

Jeden človek sa potom môže objaviť viackrát alebo dokonca v rôznych variantoch.

2. Variant spôsobuje technickú chybu

Variant B môže obsahovať nový skript, formulár, checkout alebo komponent, ktorý nefunguje na určitom zariadení či prehliadači.

Používateľ bol síce správne priradený, ale jeho návšteva sa nemusí dostať do analytiky.

Preto pri SRM kontrolujte výsledky napríklad podľa:

  • desktopu a mobilu,
  • operačného systému,
  • prehliadača,
  • krajiny,
  • zdroja návštevnosti,
  • nových a vracajúcich sa používateľov.

Segmentácia je jedným z praktických spôsobov diagnostiky SRM. Ak je problém výrazný napríklad iba pri konkrétnom prehliadači, výrazne sa tým zužuje okruh možných príčin.

3. Rozdielne meranie medzi variantmi

Veľmi častým problémom nemusí byť experiment samotný, ale analytika.

V jednom variante sa GA4 event odošle správne, v druhom nie.

Alebo sa môže líšiť:

  • načítanie Google Tag Managera,
  • Consent Mode,
  • trigger konverzie,
  • označenie formulára,
  • purchase event,
  • atribúcia zdroja návštevnosti.

Pri A/B testovaní preto nestačí kontrolovať len experimentačný nástroj.

Potrebujete vedieť, či sú spoľahlivé aj dáta, na ktorých rozhodnutie stojí.

Ak potrebujete preveriť GA4, GTM, konverzie alebo ďalšie dátové zdroje, pozrite si službu webová analytika ROI index. ROI index sa pri analytike zameriava práve na správnosť merania, konverzií a dát používaných pri obchodnom rozhodovaní.

4. Chybné filtrovanie dát

SRM nemusí vzniknúť pri samotnom rozdelení návštevnosti.

Môžete ho vytvoriť až neskôr v analýze.

Príklad:

Variant A a B boli rozdelené správne 50 : 50.

Vy však následne vyhodnocujete iba používateľov, ktorí klikli na nový prvok dostupný výhradne vo variante B.

Vznikne silne skreslená podvzorka.

Pri „triggered experiments“ preto musí byť podmienka výberu používateľov definovaná tak, aby sama nebola ovplyvnená experimentálnym variantom. Microsoft upozorňuje, že nesprávne nastavená podmienka pre výber analyzovanej populácie môže byť priamou príčinou SRM.

5. Zmena traffic splitu počas experimentu

Experiment začnete:

50 % A / 50 % B.

Po niekoľkých dňoch ho zmeníte:

20 % A / 80 % B.

Následne analyzujete celý experiment ako jeden súbor bez zohľadnenia zmeny.

Výsledné počty používateľov potom prirodzene nezodpovedajú pôvodne očakávanému pomeru.

Preto musí byť pri každej zmene traffic allocation jasné:

  • kedy nastala,
  • aký bol nový pomer,
  • ktoré dáta patria do ktorého obdobia.

6. Boti a automatické filtrovanie

Predstavte si, že jedna verzia stránky mení správanie používateľov alebo počet requestov.

Bezpečnostný alebo analytický systém môže časť návštev následne vyhodnotiť ako bot traffic a odstrániť ich z dát.

Výsledkom môže byť nerovnomerné filtrovanie variantov.

Práve preto SRM často neukazuje priamo príčinu problému.

Ukazuje symptóm, ktorý treba diagnostikovať.

SRM môže vzniknúť aj pri teste 90 : 10

Sample Ratio Mismatch sa netýka iba experimentov rozdelených 50 : 50.

Ak máte nastavené:

  • kontrolný variant A: 90 %,
  • experimentálny variant B: 10 %,

SRM test musí porovnávať skutočné výsledky práve s pomerom 90 : 10.

Pri 100 000 používateľoch teda očakávate približne:

  • A = 90 000,
  • B = 10 000.

Nie 50 000 : 50 000.

Rovnako môžete kontrolovať experiment s tromi variantmi:

  • A = 50 %,
  • B = 25 %,
  • C = 25 %.

Dôležité je vždy porovnávať výslednú distribúciu s konfiguráciou experimentu.

Kedy SRM kontrolovať

Nie až v deň, keď chcete vyhlásiť víťaza.

Rozumnejší proces je kontrolovať kvalitu experimentu priebežne.

Pred spustením

Overte:

  • správne priraďovanie variantov,
  • GA4 a GTM,
  • experimentálne eventy,
  • konverzné udalosti,
  • cookies a identifikátory,
  • Consent Mode,
  • funkčnosť oboch variantov.

Krátko po spustení

Sledujte:

  • počty používateľov,
  • traffic split,
  • technické chyby,
  • výrazné rozdiely medzi zariadeniami a prehliadačmi.

Počas experimentu

Kontrolujte vývoj SRM v čase.

Ak sa prvých päť dní pomer správa normálne a problém vznikne šiesty deň, máte veľmi cennú informáciu.

Čo sa vtedy zmenilo?

Nasadenie webu? Consent banner? Tracking? Experiment? Marketingová kampaň?

Pred vyhodnotením

Až keď experiment prejde kontrolou kvality dát, má zmysel analyzovať:

  • conversion rate,
  • revenue,
  • priemernú hodnotu objednávky,
  • lead rate,
  • CTR,
  • engagement,
  • štatistickú významnosť,
  • praktický obchodný dopad.

SRM nie je dôkaz, že variant B je zlý

Toto je dôležité.

Ak nájdete Sample Ratio Mismatch, neznamená to:

„Variant B prehral.“

Znamená to:

„V tejto chvíli nemáme dostatočnú istotu, že výsledku experimentu môžeme veriť.“

Niekedy sa po diagnostike ukáže, že chyba bola iba v exporte dát.

Inokedy je problém v analytike.

Ale môže sa ukázať aj oveľa závažnejšia chyba v randomizácii experimentu.

SRM preto nie je výsledok testu.

Je to varovný signál kvality experimentu.

Praktický SRM checklist

Predtým, než podľa A/B testu zmeníte web, landing page, checkout alebo marketingovú stratégiu, skontrolujte:

  1. Aký traffic split bol pôvodne nastavený?
  2. Koľko používateľov skutočne skončilo v jednotlivých variantoch?
  3. Prešiel experiment SRM testom?
  4. Kedy sa prípadná odchýlka začala objavovať?
  5. Je problém rovnaký na mobile aj desktope?
  6. Vyskytuje sa pri všetkých prehliadačoch?
  7. Je rozdelenie rovnaké podľa krajín a zdrojov návštevnosti?
  8. Posielajú oba varianty rovnaké analytické eventy?
  9. Funguje GA4 a GTM v oboch variantoch rovnako?
  10. Nemá jeden variant odlišné správanie Consent Mode?
  11. Nezmenil sa traffic split počas experimentu?
  12. Neobsahuje analýza filter ovplyvnený samotným variantom?
  13. Nie sú niektorí používatelia duplicitne započítaní?
  14. Nestrácajú sa používatelia pri presmerovaní?
  15. Neovplyvnil výsledok deployment alebo technická chyba počas testu?

Až následne riešte otázku:

Ktorý variant vyhral?

GA4 samo osebe problém nevyrieši

Google Analytics 4 vám môže poskytnúť množstvo dát.

To však ešte neznamená, že dáta sú automaticky správne.

Pri experimentoch treba rozlišovať medzi:

zberom dát

a

dôveryhodnosťou dát.

Ak sa purchase event v jednom variante spustí dvakrát, môžete vidieť vyššie tržby.

Ak sa vo variante B časť konverzií vôbec neodošle, môžete vidieť horší conversion rate.

Ak Consent Mode alebo cookie banner ovplyvní varianty rozdielne, môžete robiť obchodné rozhodnutia na základe neporovnateľných dát.

Pre e-shopy preto odporúčame riešiť analytiku ako súčasť celého meracieho systému. Viac nájdete na stránke GA4 meranie pre e-shop, kde sa venujeme e-commerce udalostiam, nákupnému procesu, hodnote objednávok a súvisiacemu meraniu.

A/B testovanie bez kvalitného merania môže optimalizovať nesprávnym smerom

V praxi sa často venuje veľa pozornosti samotnému experimentu:

  • farbe tlačidla,
  • headline,
  • formuláru,
  • landing page,
  • checkoutu,
  • cenovej ponuke.

Menej pozornosti dostáva otázka:

Sú dáta, podľa ktorých experiment vyhodnocujeme, správne?

Pritom práve meranie rozhoduje o tom, čo následne označíte za úspešnú verziu.

Predstavte si, že variant B podľa výsledkov zvýši conversion rate o 12 %.

Firma ho nasadí na celý web.

O tri mesiace však zistí, že reálne tržby nerastú.

Problém nemusí byť v tom, že A/B testovanie nefunguje.

Problém mohol byť v tom, že test od začiatku porovnával nekvalitné alebo nekompletné dáta.

Aj preto pri správe Google Ads riešime podľa potreby nielen reklamné kampane, ale aj konverzie, GA4, Google Tag Manager a ďalšie súvisiace meranie. Bez kvalitných dát totiž nemožno dlhodobo optimalizovať reklamu podľa skutočného obchodného výsledku.

Experimentovanie by malo mať vlastný „quality gate“

Pri každom A/B teste odporúčame rozdeliť vyhodnotenie na dve fázy.

Fáza 1: Môžeme dátam veriť?

Skontrolujte:

  • SRM,
  • tracking,
  • technické chyby,
  • experiment exposure,
  • dátové výpadky,
  • duplicity,
  • zmeny implementácie.

Fáza 2: Čo nám experiment ukázal?

Až následne riešte:

  • rozdiel konverzií,
  • štatistickú významnosť,
  • intervaly spoľahlivosti,
  • revenue,
  • profit,
  • dlhodobý obchodný význam.

Tento postup môže na prvý pohľad pôsobiť pomalšie.

V skutočnosti však dokáže zabrániť oveľa drahšej chybe: nasadeniu nesprávneho variantu na 100 % používateľov.

Nestačí mať viac dát. Potrebujete správne dáta.

Moderný marketing produkuje obrovské množstvo dát.

Google Ads, Meta Ads, GA4, CRM, e-shop, call tracking, A/B testovacie platformy a ďalšie systémy vytvárajú desiatky až stovky metrík.

Veľké množstvo dát však automaticky neznamená kvalitnejšie rozhodovanie.

Ak je chyba už pri:

  • meraní,
  • atribúcii,
  • rozdelení používateľov,
  • identifikácii návštevníka,
  • konverznej udalosti,

ďalšie reporty problém iba znásobia.

V ROI index preto pri analytike nepozeráme iba na to, koľko dát máte, ale predovšetkým na to, či sa podľa nich dá bezpečne rozhodovať.

Ak si chcete GA4, konverzie alebo reporty riešiť interne, možnosťou je aj individuálny kurz Google Analytics 4, zameraný na praktickú prácu s vlastným meraním, konverziami a reportmi.

Má váš A/B test skutočného víťaza?

Víťaz A/B testu nie je variant s najvyšším zeleným percentom v reporte.

Víťazom môže byť až variant, pri ktorom máte istotu, že:

  • používatelia boli správne randomizovaní,
  • experiment nemá nevysvetlený Sample Ratio Mismatch,
  • oba varianty sa merali porovnateľne,
  • konverzie sa zaznamenávali správne,
  • výsledok nie je dôsledkom technickej alebo analytickej chyby.

Najdrahší pokazený experiment nie je ten, ktorý neukáže žiadny výsledok. Je to experiment, ktorý ukáže presvedčivý, ale nesprávny výsledok.

Ak potrebujete preveriť GA4, Google Tag Manager, meranie konverzií alebo kvalitu dát používaných pri optimalizácii marketingu, ROI index vám pomôže s webovou analytikou.

Pretože rozhodovať podľa dát má význam iba vtedy, keď môžete týmto dátam veriť.

Miloš Vargic
Miloš Vargic
V marketingu sa pohybujem viac ako 22 rokov. Som zakladateľ agentúry ROI index a špecializujeme sa na výkonnostný marketing, ktorý firmám reálne prináša výsledky. Pomáhame značkám rásť vďaka efektívnej reklame na Google, Bingu a Facebooku, výkonnému SEO a GEO, precízne nastaveným marketingovým stratégiám pre B2B aj B2C segment. Pracoval som ako marketingový riaditeľ a spúšťal som reklamy v 23 krajinách a 14 jazykoch, kde sme dosahovali vysokú návratnosť investícií z rozpočtov nad 14 300 € mesačne.