Indexace
Také známé jako: zaindexování, index vyhledávače, indexování stránek
Indexace je zařazení stránky do databáze vyhledávače, ze které se pak sestavují výsledky hledání. Stránka, která není v indexu, se ve výsledcích nemůže objevit — a to i tehdy, když je běžně dostupná a robot ji už navštívil.
Kdy indexaci řešit
Když v Search Console vidíš výrazný rozdíl mezi počtem stránek v sitemapě a počtem zaindexovaných, nebo když nová kategorie po několika týdnech pořád není ve výsledcích. Druhý typický moment je po migraci e-shopu, kdy se index musí přestavět na nové adresy.
Jak indexace probíhá
Robot stránku najde — přes interní odkaz, sitemapu nebo zpětný odkaz. Stáhne ji, vyrenderuje, přečte obsah a signály (canonical, meta robots) a teprve pak se rozhodne, jestli ji do indexu zařadí.
Mezi „robot stránku stáhl" a „stránka je v indexu" je proto prostor, kde se stránky ztrácejí. Nejčastěji na tom, že obsah je příliš podobný jiné stránce, nebo je ho příliš málo na to, aby dával samostatnou hodnotu.
Nejčastější chyby
- Zaměňování crawlingu a indexace. „Robot tam byl" a „je to v indexu" jsou dvě různá tvrzení a v Search Console jsou to dva různé stavy.
- Blokace v robots.txt jako nástroj na odstranění z indexu. Zablokovaná stránka může v indexu zůstat, jen bez popisku — protože robot nesmí přijít a přečíst si noindex.
- Nasměrování všeho do sitemapy. Sitemapa s tisíci adres, z nichž polovina má noindex nebo canonical jinam, posílá protichůdné signály.
- Čekání na indexaci u obsahu, který na ni nemá nárok. Stránka bez samostatné hodnoty se nezaindexuje ani po měsíci — problém není v technice, ale v obsahu.
Shoptet a Upgates
Časté otázky
Jak zjistím, jestli je stránka v indexu?
Nejspolehlivěji přes nástroj pro kontrolu URL v Google Search Console, který ukáže i důvod, proč stránka v indexu není. Operátor site: dává jen orientační obrázek.
Jak dlouho indexace trvá?
Nemá pevnou lhůtu — u zavedeného webu jde o dny, u nového i o týdny. Pokud stránka není v indexu po několika týdnech, problém obvykle není v rychlosti, ale v signálech nebo v obsahu.
Jak stránku z indexu odstranit?
Přes noindex v meta robots nebo v HTTP hlavičce, a robota k ní musíš pustit, aby si ten pokyn přečetl. Blokace v robots.txt na odstranění z indexu nestačí.
Související pojmy
- Crawl budget – Crawl budget je množství stránek, které robot vyhledávače na daném webu za určitý čas stáhne. Určuje ho jednak technická kapacita serveru, jednak to, jak hodnotný web pro vyhledávač je — a u velkých e-shopů rozhoduje, jak rychle se změny v katalogu promítnou do výsledků.
- Robots.txt – Robots.txt je textový soubor v kořeni domény, kterým web říká robotům, které části webu nemají procházet. Řídí stahování, nikoli indexaci — a je to veřejně čitelný pokyn, který slušné roboty respektují a ostatní ignorují.
- Meta robots (noindex, nofollow) – Meta robots je značka v hlavičce stránky, kterou web říká vyhledávači, jestli má stránku zařadit do indexu a jestli má následovat odkazy na ní. Na rozdíl od robots.txt se týká konkrétní stránky a robot ji musí načíst, aby se pokyn dozvěděl.
- Sitemap.xml – Sitemap.xml je strojově čitelný seznam adres, které má vyhledávač na webu znát. Pomáhá mu obsah objevit rychleji, hlavně u velkých webů a u stránek, na které nevede dost interních odkazů — zařazení do indexu ale negarantuje.
- Canonical URL – Canonical URL je odkaz v hlavičce stránky, kterým web vyhledávačům oznamuje, která adresa je hlavní verze obsahu. Používá se všude tam, kde je stejný nebo velmi podobný obsah dostupný pod více URL — v e-shopu typicky při filtrování, řazení a stránkování kategorií.
Další pojmy ze skupiny SEO & AEO
- Canonical URLCanonical URL je odkaz v hlavičce stránky, kterým web vyhledávačům oznamuje, která adresa je hlavní verze obsahu. Používá se všude tam, kde je stejný nebo velmi podobný obsah dostupný pod více URL — v e-shopu typicky při filtrování, řazení a stránkování kategorií.
- Crawl budgetCrawl budget je množství stránek, které robot vyhledávače na daném webu za určitý čas stáhne. Určuje ho jednak technická kapacita serveru, jednak to, jak hodnotný web pro vyhledávač je — a u velkých e-shopů rozhoduje, jak rychle se změny v katalogu promítnou do výsledků.
- Duplicitní obsahDuplicitní obsah je stejný nebo velmi podobný text dostupný na více adresách, ať už v rámci jednoho webu, nebo napříč weby. Vyhledávač musí vybrat jednu verzi k indexaci a zbytek potlačí, takže se hodnota obsahu tříští místo aby se sčítala.
- Facetová navigaceFacetová navigace je filtrování produktů podle vlastností — velikosti, barvy, značky, ceny. Pro zákazníka je to nejrychlejší cesta k produktu, pro vyhledávač zdroj obrovského množství adres s téměř stejným obsahem, protože každá kombinace filtrů může vytvořit vlastní URL.
- HreflangHreflang je značka, kterou web vyhledávači sděluje, že určitá stránka má jazykové nebo regionální varianty, a která z nich patří které skupině uživatelů. Používá se u vícejazyčných e-shopů a u variant pro různé země, i když je jazyk stejný.
- JavaScript SEOJavaScript SEO je zajištění toho, aby obsah generovaný na straně prohlížeče byl dostupný i vyhledávačům a AI asistentům. Zásadní je, že obsah, který v HTML není a doplní ho až JavaScript, část robotů nikdy neuvidí.