Index bloat a fazetová navigácia: prečo Google indexuje tisíce nepotrebných URL

E-shop má 3 000 produktov, 80 kategórií a niekoľko desiatok informačných stránok. Logicky by ste očakávali, že Google bude pracovať s niekoľkými tisíckami relevantných URL.

V Google Search Console však môžete naraziť na úplne iný obraz: Google pozná 30 000, 100 000 alebo dokonca stovky tisíc URL.

Odkiaľ sa vzali?

Veľmi často ich nevytvoril nový obsah, ale filtre, parametre, zoradenie produktov, kombinácie faciet, interné vyhľadávanie alebo technická architektúra e-shopu.

Jedna produktová kategória sa tak môže Googlu javiť ako stovky alebo tisíce rôznych stránok.

Výsledkom môže byť index bloat – nadmerné množstvo URL, ktoré Google prehľadáva, vyhodnocuje alebo indexuje, hoci pre organické vyhľadávanie nemajú praktickú hodnotu.

A to už nie je iba technický detail.

Google môže míňať čas a zdroje na stránky, ktoré vám neprinesú jedinú objednávku, zatiaľ čo nové produkty a dôležité kategórie čakajú na objavenie.

Čo je index bloat?

Pojmom index bloat sa v SEO označuje situácia, keď vyhľadávač pozná alebo indexuje výrazne viac URL, než má web skutočne hodnotných stránok.

Predstavte si e-shop s kategóriou:

/panske-topanky/

Používateľ môže následne filtrovať:

  • značku,
  • farbu,
  • veľkosť,
  • materiál,
  • cenu,
  • dostupnosť,
  • hodnotenie,
  • typ produktu.

Technicky môžu vzniknúť napríklad URL:

/panske-topanky/?farba=cierna

/panske-topanky/?velkost=44

/panske-topanky/?znacka=nike&farba=cierna

/panske-topanky/?znacka=nike&farba=cierna&velkost=44

/panske-topanky/?znacka=nike&farba=cierna&velkost=44&skladom=ano

Ak je možné kombinovať desiatky filtrov, počet URL nerastie lineárne. Rastie násobne.

Google upozorňuje, že fazetová navigácia založená na URL parametroch môže vytvárať prakticky neobmedzený priestor URL. Crawler pritom často nevie dopredu posúdiť, či bude konkrétna kombinácia užitočná, kým ju neprejde. Výsledkom môže byť nadmerné prehľadávanie a pomalšie objavovanie užitočných stránok.

Fazetová navigácia nie je problém. Problém je jej SEO nastavenie

Filtre sú pre používateľov e-shopu veľmi užitočné.

Ak predávate notebooky, zákazník prirodzene potrebuje filtrovať podľa:

  • výrobcu,
  • veľkosti displeja,
  • RAM,
  • procesora,
  • ceny,
  • dostupnosti.

Odstrániť filtrovanie len preto, aby bolo SEO jednoduchšie, preto väčšinou nie je správna cesta.

Potrebujete však rozhodnúť, ktoré kombinácie filtrov majú existovať pre zákazníka a ktoré zároveň majú existovať aj pre Google.

To sú dve rozdielne veci.

URL môže byť veľmi užitočná pre používateľa a zároveň úplne nepotrebná ako samostatný výsledok vyhľadávania.

Práve preto je SEO pre e-shopy výrazne technickejšie než optimalizácia jednoduchého firemného webu. E-shopy prirodzene pracujú s produktmi, kategóriami, parametrami, filtrovaním, stránkovaním, variantmi a meniacou sa skladovou dostupnosťou.

Ako môže jeden filter vytvoriť tisíce URL

Predstavme si relatívne jednoduchú kategóriu s:

  • 10 značkami,
  • 8 farbami,
  • 12 veľkosťami,
  • 5 materiálmi,
  • 5 cenovými pásmami.

Už samotné kombinácie môžu vytvoriť obrovské množstvo URL.

K tomu pridajte:

?sort=price

?sort=rating

?order=asc

?order=desc

?availability=1

?page=2

a rôzne poradie parametrov.

Môžu vzniknúť napríklad:

?farba=cierna&znacka=x

a

?znacka=x&farba=cierna

Ak platforma obe adresy generuje, pre používateľa zobrazujú prakticky rovnakú stránku, ale crawler môže objaviť dve samostatné URL.

Google medzi typické zdroje duplicít zaraďuje práve funkcie webu, ako sú filtrovanie a zoradenie.

Prečo je index bloat problém

Častá reakcia býva:

„Ak Google tie stránky nechce, jednoducho ich nebude zobrazovať.“

Čiastočne áno. Google dokáže identifikovať duplicity a vybrať kanonickú URL. To však ešte neznamená, že je technická situácia optimálna.

Google musí URL najskôr objaviť

Ak interné odkazy neustále generujú nové kombinácie filtrov, Googlebot ich môže nachádzať stále viac.

Google priamo uvádza, že pri fazetovej navigácii môže crawler pristupovať k veľkému množstvu URL ešte predtým, než jeho systémy zistia, že sú nepotrebné.

Zbytočné URL spotrebúvajú crawl zdroje

Čím viac času crawler venuje filtrom bez SEO hodnoty, tým menej efektívne môže objavovať nové alebo zmenené dôležité stránky.

Téma úzko súvisí s crawl budgetom najmä pri rozsiahlejších e-shopoch.

Vznikajú duplicity a takmer duplicity

Stránky:

/sedacky/

/sedacky/?sort=price

/sedacky/?sort=name

môžu obsahovať rovnaké produkty iba v inom poradí.

Pre samostatné indexovanie obvykle neprinášajú novú hodnotu.

Google môže dostávať protichodné signály

Predstavte si desiatky URL s prakticky rovnakým:

  • H1,
  • title,
  • textom,
  • produktmi,
  • internými odkazmi.

Namiesto jednej jasnej stránky vytvárate rozsiahly súbor veľmi podobných URL.

Search Console sa zapĺňa technickým šumom

Pri analýze potom vidíte tisíce URL v stavoch ako:

  • Crawled – currently not indexed,
  • Discovered – currently not indexed,
  • Duplicate,
  • Alternate page with proper canonical tag,
  • Excluded by noindex.

Samotný výskyt týchto stavov nemusí znamenať katastrofu. Pri extrémnom množstve však treba zistiť, prečo Google vôbec všetky tieto URL objavuje.

Nie každá filtrovaná URL je nepotrebná

Tu vzniká jedna z najčastejších SEO chýb.

Niekto objaví tisíce filtrov a rozhodne:

„Zakážeme Googlu všetky filtre.“

Tým sa však môžete pripraviť o hodnotné organické vstupné stránky.

Predstavte si kategóriu:

Dámske šaty

Filtre môžu vytvoriť:

  • červené dámske šaty,
  • spoločenské dámske šaty,
  • letné dámske šaty,
  • dlhé dámske šaty,
  • čierne spoločenské šaty.

Ak ľudia tieto kombinácie reálne vyhľadávajú a e-shop má dostatočný sortiment, niektoré z nich môžu mať vysoký SEO aj obchodný potenciál.

Rozhodnutie preto nemá byť:

indexovať filtre – áno alebo nie?

Správna otázka je:

Ktoré facety predstavujú skutočný vyhľadávací zámer zákazníka a ktoré sú len používateľským nástrojom?

SEO hodnotná faceta verzus technická faceta

Prakticky si môžeme filtre rozdeliť do dvoch skupín.

1. Filtre s potenciálom organickej návštevnosti

Napríklad:

/notebooky/lenovo/

alebo:

/bezdrôtové-slúchadlá/do-100-eur/

Ak existuje relevantná hľadanosť a obchodný potenciál, takáto stránka môže byť vytvorená ako plnohodnotná landing page.

Mala by mať:

  • stabilnú URL,
  • vlastný SEO title,
  • relevantný H1,
  • primerane unikátny obsah,
  • vhodné produkty,
  • interné odkazy,
  • indexovateľnosť,
  • správnu kanonickú URL.

2. Filtre bez samostatného SEO potenciálu

Napríklad:

?sort=price_desc

?view=grid

?items=96

?availability=true

alebo extrémne kombinácie šiestich filtrov.

Takéto URL môžu byť užitočné pre používateľa, ale neznamená to, že ich musí Google prehľadávať a indexovať.

Canonical nie je univerzálna záchrana

Jednou z najčastejších reakcií na duplicity je:

„Dáme na všetky filtre canonical na hlavnú kategóriu.“

Canonical je dôležitý nástroj, ale treba rozumieť jeho funkcii.

Google používa canonical ako signál, ktorá URL má reprezentovať skupinu duplicitných alebo veľmi podobných stránok. Google však môže zvoliť aj inú kanonickú URL, než akú uvediete vy.

Pri fazetovej navigácii môže správne nastavený canonical postupne pomôcť obmedziť crawl nekanonických variantov, Google ho však označuje za menej efektívny spôsob riadenia crawlovania než priame obmedzenie nepotrebných faciet.

A hlavne:

canonical nerieši príčinu, prečo váš web generuje obrovské množstvo URL.

Ak interná navigácia stále vytvára desaťtisíce kombinácií, samotný canonical nemusí byť dostatočné riešenie.

Robots.txt verzus noindex: nie je to to isté

Ďalší častý problém je nesprávna kombinácia:

Disallow v robots.txt

noindex

na tej istej URL.

Ak crawler nemôže stránku prejsť, nemusí sa dostať k meta robots značke, ktorá obsahuje noindex. Google výslovne uvádza, že pravidlá meta robots môže prečítať iba vtedy, ak má crawler prístup k danej stránke.

Preto treba vedieť, čo chcete dosiahnuť.

Ak nechcete URL indexovať, ale Google ju môže prechádzať, môže byť vhodný noindex.

Ak nechcete, aby Google obrovské množstvo nepotrebných faciet vôbec prehľadával, môže byť vhodné obmedzenie cez robots.txt.

Google pri nepotrebnej fazetovej navigácii priamo odporúča zvážiť blokovanie príslušných URL cez robots.txt.

Konkrétna implementácia však musí vychádzať zo štruktúry daného e-shopu. Jedno univerzálne pravidlo pre všetky weby neexistuje.

Čo s kombináciami filtrov, ktoré nevracajú žiadne produkty?

Toto je malý detail, ktorý dokáže vytvoriť obrovský technický problém.

Predstavte si URL:

/tricka/?farba=fialova&velkost=XXXXXXL&material=zlato

Ak takáto kombinácia neexistuje, stránka by nemala donekonečna vracať úspešný stav 200 OK s textom „Nenašli sa žiadne produkty“.

Google pri fazetovej navigácii odporúča pri kombináciách bez výsledkov vrátiť HTTP stav 404. Rovnaká logika sa môže uplatniť pri nezmyselných alebo duplicitných kombináciách filtrov.

Tak zabránite tomu, aby technicky neplatné URL vytvárali ďalší priestor na crawling.

Zoradenie produktov nepotrebuje vlastnú SEO stránku

Parametre meniace iba poradie produktov sú typickým kandidátom na technickú optimalizáciu.

Napríklad:

?sort=lowest-price

?sort=highest-price

?sort=newest

?sort=popular

Používateľovi pomáhajú.

Google však väčšinou nepotrebuje indexovať päť samostatných verzií rovnakej kategórie iba preto, že produkty sú zoradené inak.

Podobne treba kontrolovať:

  • počet položiek na stránke,
  • prepnutie grid/list,
  • tracking parametre,
  • session ID,
  • interné vyhľadávanie,
  • parametre skladovej dostupnosti,
  • duplicitné poradie filtrov.

Sitemap nesmie byť skladom všetkých URL, ktoré systém pozná

XML sitemap má Googlu pomáhať nájsť stránky, ktoré považujete za dôležité.

Preto do nej spravidla patria predovšetkým:

  • indexovateľné URL,
  • kanonické URL,
  • dôležité kategórie,
  • produkty,
  • články,
  • landing pages.

Ak zároveň Googlu poviete:

„Toto je naša preferovaná URL“

a do sitemap mu posielate množstvo alternatívnych alebo neindexovateľných variantov, vytvárate zbytočne nečistú SEO architektúru.

Kvalitné technické SEO preto nekontroluje iba title a meta description. Zahŕňa tiež indexáciu, URL štruktúru, sitemapu, robots.txt, presmerovania, interné prelinkovanie a ďalšie technické signály.

Ako zistiť, či váš e-shop trpí index bloatom

Pri audite nestačí pozrieť číslo v Google.

Potrebujete porovnať viac zdrojov.

Google Search Console

Skontrolujte najmä:

Indexing → Pages

Pozrite sa, aké typy URL sa objavujú medzi indexovanými aj neindexovanými stránkami.

Hľadajte vzory ako:

?filter=

?sort=

?color=

?size=

?price=

?brand=

alebo parametre konkrétnej e-shopovej platformy.

Crawl webu

SEO crawler vám ukáže:

  • koľko URL dokáže objaviť,
  • ktoré sú indexovateľné,
  • canonical,
  • meta robots,
  • HTTP status,
  • interné odkazy,
  • hĺbku URL,
  • parametre.

Server logy

Pri väčšom e-shope sú veľmi cenné logy servera.

Ukážu vám, kam Googlebot reálne chodí.

Môžete tak zistiť, že značná časť aktivity smeruje na URL, ktoré pre SEO nemajú žiadnu hodnotu.

Porovnanie s reálnym počtom SEO stránok

Ak máte:

  • 4 000 produktov,
  • 300 kategórií,
  • 500 článkov,

ale Google pravidelne objavuje státisíce URL, je potrebné preskúmať, odkiaľ rozdiel vzniká.

Práve preto začíname technické problémy SEO analýzou a auditom. Audit má odhaliť problémy s indexáciou, štruktúrou, technickými chybami a určiť priority pre realizáciu.

Ako by mala vyzerať zdravá stratégia fazetovej navigácie

Neexistuje jedno pravidlo použiteľné pre každý e-shop, ale dobrá stratégia zvyčajne vychádza z nasledujúcej logiky.

1. Identifikujte všetky filtre a parametre.

Najskôr potrebujete vedieť, čo systém vôbec generuje.

2. Rozdeľte facety podľa SEO hodnoty.

Ktoré kombinácie ľudia vyhľadávajú?

Ktoré môžu generovať objednávky?

3. Hodnotné kombinácie premeňte na stabilné landing pages.

Ak sa oplatí cieliť napríklad na „čierne pánske tenisky“, vytvorte stránku, ktorá má jasný SEO účel.

4. Nepotrebné kombinácie nedovoľte neobmedzene crawlovať.

Najmä pri veľkých e-shopoch môže byť nutné nastaviť pravidlá pre konkrétne parametre.

5. Nastavte canonical konzistentne.

Dôležité indexovateľné stránky by mali vysielať jednoznačné signály.

6. Prázdne a nezmyselné kombinácie správne ošetrite.

Google odporúča pri filtroch bez výsledkov vracať 404.

7. Vyčistite XML sitemapu.

Do sitemap neposielajte technický odpad.

8. Skontrolujte interné prelinkovanie.

Google objavuje URL predovšetkým prostredníctvom odkazov. Ak každý produkt a každá kategória odkazujú na stovky ďalších kombinácií, problém sa môže neustále obnovovať.

9. Priebežne sledujte Search Console a crawling.

Technická oprava sa nemusí v indexácii prejaviť zo dňa na deň.

Menej indexovaných stránok môže znamenať lepšie SEO

Majitelia webov sa niekedy zľaknú, keď po technickej optimalizácii počet indexovaných URL klesne.

„Predtým sme mali 50 000 indexovaných stránok a teraz iba 8 000.“

Samotné číslo však nehovorí, či je výsledok lepší alebo horší.

Ak ste odstránili:

  • duplicity,
  • zoradenia,
  • nepoužiteľné filtre,
  • interné vyhľadávanie,
  • technické parametre,
  • prázdne stránky,

môže byť pokles počtu indexovaných URL presne tým, čo ste chceli dosiahnuť.

Dôležitejšie je sledovať:

  • indexáciu obchodne hodnotných stránok,
  • organické kliknutia,
  • impresie,
  • pozície,
  • organické objednávky a dopyty,
  • tržby,
  • konverzný pomer.

SEO nie je súťaž o najväčší počet URL v Google.

Cieľom je dostať do vyhľadávania správne stránky pre správne dopyty.

Index bloat môže brzdiť aj kvalitný e-shop

Môžete mať:

  • kvalitné produkty,
  • dobré ceny,
  • výborne napísané kategórie,
  • rýchly web,
  • kvalitný obsah.

Ak je však technická architektúra neprehľadná a Google musí spracovávať desaťtisíce nepotrebných URL, časť SEO potenciálu zostáva nevyužitá.

Pri SEO pre e-shopy preto v ROI index nepozeráme iba na kľúčové slová a texty. Dôležitá je indexácia, štruktúra kategórií, filtre, duplicity, URL, interné odkazy aj to, ktoré stránky majú pre firmu reálnu obchodnú hodnotu.

SEO totiž nemá produkovať čo najväčší počet návštev.

Má pomáhať privádzať ľudí, ktorí majú potenciál nakúpiť.

Ak chcete marketing e-shopu riešiť komplexnejšie, pozrite si aj marketing pre e-shopy, kde prepájame SEO s Google Ads, Meta reklamou, analytikou a obchodným pohľadom na výkon.

Má Google indexovať vaše filtre? Najskôr to zmerajme

Pri fazetovej navigácii neexistuje rozumná odpoveď typu:

„všetko indexovať“

ani

„všetko zakázať“.

Správne riešenie závisí od:

  • veľkosti e-shopu,
  • technológie,
  • množstva produktov,
  • spôsobu generovania URL,
  • vyhľadávanosti jednotlivých faciet,
  • sortimentu,
  • konkurencie,
  • súčasného stavu indexácie.

Preto má zmysel najskôr urobiť SEO audit a až potom meniť robots.txt, canonical, indexáciu alebo štruktúru filtrov.

V ROI index riešime SEO ako kombináciu techniky, obsahu, analytiky a obchodného výsledku. Technické SEO má zmysel vtedy, keď pomôže Googlu sústrediť sa na stránky, ktoré majú šancu priniesť relevantnú návštevnosť, objednávky a zákazníkov.

Má váš e-shop tisíce alebo desaťtisíce URL a neviete, ktoré z nich Google skutočne potrebuje?

Začnime analýzou indexácie, filtrov, parametrov, canonicalov, sitemap a interného prelinkovania.

Pozrite si SEO analýzu a audit webu a zistite, či Google venuje pozornosť vašim najdôležitejším stránkam – alebo ju míňa na URL, ktoré vám nikdy neprinesú zákazníka.

Miloš Vargic
Miloš Vargic
V marketingu sa pohybujem viac ako 22 rokov. Som zakladateľ agentúry ROI index a špecializujeme sa na výkonnostný marketing, ktorý firmám reálne prináša výsledky. Pomáhame značkám rásť vďaka efektívnej reklame na Google, Bingu a Facebooku, výkonnému SEO a GEO, precízne nastaveným marketingovým stratégiám pre B2B aj B2C segment. Pracoval som ako marketingový riaditeľ a spúšťal som reklamy v 23 krajinách a 14 jazykoch, kde sme dosahovali vysokú návratnosť investícií z rozpočtov nad 14 300 € mesačne.