Meta robots (noindex, nofollow)
Také známé jako: noindex, nofollow, meta robots tag, X-Robots-Tag
Meta robots je značka v hlavičce stránky, kterou web říká vyhledávači, jestli má stránku zařadit do indexu a jestli má následovat odkazy na ní. Na rozdíl od robots.txt se týká konkrétní stránky a robot ji musí načíst, aby se pokyn dozvěděl.
Kdy noindex v e-shopu použít
Na stránky, které mají existovat pro uživatele, ale nemají co dělat ve výsledcích hledání. Typicky výsledky interního vyhledávání, košík a checkout, uživatelský účet, děkovací stránky a tenké filtrační kombinace, které nemají vlastní hledanost.
Opačný případ je stránka, která má být v indexu a ty se jen bojíš duplicity — tam patří canonical, ne noindex. Zaměňování těchto dvou nástrojů je nejčastější zdroj ztraceného obsahu.
Jak to vypadá v praxi
Do <head> stránky patří <meta name="robots" content="noindex, follow">. Znamená to „tuhle stránku do indexu nedávej, ale odkazy na ní projdi". U souborů, kde žádná HTML hlavička není, se totéž pošle jako HTTP hlavička X-Robots-Tag: noindex.
Cílit se dá i na konkrétního robota — <meta name="googlebot" content="noindex"> platí jen pro Google a ostatní roboty nechává být.
Nejčastější chyby
- Kombinace noindex s blokací v robots.txt. Robot na stránku nesmí, pokyn si nepřečte a stránka v indexu zůstane. Pokyn a přístup se vylučují.
- Zapomenutý noindex z testovacího prostředí. Po spuštění vyřadí z indexu celý web. Stojí za to mít to v kontrolním seznamu před nasazením.
noindex, nofollowtam, kde stačínoindex, follow. Zbytečně přeruší tok odkazové síly přes stránku dál do webu.- Noindex na stránkování. Druhá a další strana kategorie má zůstat průchozí; noindex tam odřízne produkty od objevení.
Shoptet a Upgates
Časté otázky
Jaký je rozdíl mezi noindex a robots.txt?
Robots.txt řídí, jestli robot stránku smí stáhnout. Noindex řídí, jestli ji zařadí do indexu. Aby noindex fungoval, robot stránku stáhnout musí.
Přenáší se přes stránku s noindex odkazová síla?
Pokud je nastavená jako noindex, follow, robot odkazy na ní projde. U noindex, nofollow ne.
Jak dám noindex na PDF nebo obrázek?
HTTP hlavičkou X-Robots-Tag, protože soubory nemají HTML hlavičku, kam by se meta značka dala vložit.
Související pojmy
- Indexace – Indexace je zařazení stránky do databáze vyhledávače, ze které se pak sestavují výsledky hledání. Stránka, která není v indexu, se ve výsledcích nemůže objevit — a to i tehdy, když je běžně dostupná a robot ji už navštívil.
- Robots.txt – Robots.txt je textový soubor v kořeni domény, kterým web říká robotům, které části webu nemají procházet. Řídí stahování, nikoli indexaci — a je to veřejně čitelný pokyn, který slušné roboty respektují a ostatní ignorují.
- Canonical URL – Canonical URL je odkaz v hlavičce stránky, kterým web vyhledávačům oznamuje, která adresa je hlavní verze obsahu. Používá se všude tam, kde je stejný nebo velmi podobný obsah dostupný pod více URL — v e-shopu typicky při filtrování, řazení a stránkování kategorií.
- Paginace – Paginace je rozdělení dlouhého výpisu produktů nebo článků na číslované strany. Pro vyhledávač je to řetěz stránek s podobným obsahem a rozdílnými produkty — a způsob, jakým se řeší, rozhoduje o tom, jestli se produkty z dalších stran vůbec dostanou do indexu.
- Duplicitní obsah – Duplicitní obsah je stejný nebo velmi podobný text dostupný na více adresách, ať už v rámci jednoho webu, nebo napříč weby. Vyhledávač musí vybrat jednu verzi k indexaci a zbytek potlačí, takže se hodnota obsahu tříští místo aby se sčítala.
Další pojmy ze skupiny SEO & AEO
- Canonical URLCanonical URL je odkaz v hlavičce stránky, kterým web vyhledávačům oznamuje, která adresa je hlavní verze obsahu. Používá se všude tam, kde je stejný nebo velmi podobný obsah dostupný pod více URL — v e-shopu typicky při filtrování, řazení a stránkování kategorií.
- Crawl budgetCrawl budget je množství stránek, které robot vyhledávače na daném webu za určitý čas stáhne. Určuje ho jednak technická kapacita serveru, jednak to, jak hodnotný web pro vyhledávač je — a u velkých e-shopů rozhoduje, jak rychle se změny v katalogu promítnou do výsledků.
- Duplicitní obsahDuplicitní obsah je stejný nebo velmi podobný text dostupný na více adresách, ať už v rámci jednoho webu, nebo napříč weby. Vyhledávač musí vybrat jednu verzi k indexaci a zbytek potlačí, takže se hodnota obsahu tříští místo aby se sčítala.
- Facetová navigaceFacetová navigace je filtrování produktů podle vlastností — velikosti, barvy, značky, ceny. Pro zákazníka je to nejrychlejší cesta k produktu, pro vyhledávač zdroj obrovského množství adres s téměř stejným obsahem, protože každá kombinace filtrů může vytvořit vlastní URL.
- HreflangHreflang je značka, kterou web vyhledávači sděluje, že určitá stránka má jazykové nebo regionální varianty, a která z nich patří které skupině uživatelů. Používá se u vícejazyčných e-shopů a u variant pro různé země, i když je jazyk stejný.
- IndexaceIndexace je zařazení stránky do databáze vyhledávače, ze které se pak sestavují výsledky hledání. Stránka, která není v indexu, se ve výsledcích nemůže objevit — a to i tehdy, když je běžně dostupná a robot ji už navštívil.