Sitemap.xml
Také známé jako: XML sitemap, mapa webu, sitemapa
Sitemap.xml je strojově čitelný seznam adres, které má vyhledávač na webu znát. Pomáhá mu obsah objevit rychleji, hlavně u velkých webů a u stránek, na které nevede dost interních odkazů — zařazení do indexu ale negarantuje.
Kdy sitemapu řešit
Vždy — je to základní vybavení webu. Reálný rozdíl ale udělá u velkého katalogu, u nového webu bez zpětných odkazů a po migraci, kdy potřebuješ, aby robot rychle objevil nové adresy.
U malého, dobře prolinkovaného webu je sitemapa spíš hygiena než výkonný nástroj. Interní prolinkování je pro objevování obsahu silnější signál.
Co do sitemapy patří a co ne
Patří: kategorie, produkty, články, statické stránky — všechno, co má být v indexu, vrací stav 200 a odkazuje canonicalem samo na sebe.
Nepatří: stránky s noindexem, přesměrovávané adresy, adresy zakázané v robots.txt, filtrační kombinace a stránky, jejichž canonical míří jinam. Každá taková adresa je protichůdný signál.
Element lastmod má smysl jen tehdy, když opravdu odpovídá poslední věcné změně obsahu. Sitemapa, kde má každá adresa dnešní datum, ztrácí důvěryhodnost a přestává být užitečná.
Nejčastější chyby
- Sitemapa jako výpis všeho, co v databázi je. Smíchané noindexy, přesměrování a duplicity si navzájem odporují se zbytkem signálů.
- Relativní adresy nebo jiná doména (typicky pozůstatek z vývoje) — sitemapa je pak nepoužitelná.
lastmodgenerovaný z data poslední změny šablony, nikoli obsahu. Robot to prohlédne a přestane na hodnotu spoléhat.- Sitemapa se po migraci neaktualizuje. Nejrychlejší způsob, jak robota poslat na několik tisíc přesměrování.
Shoptet a Upgates
Časté otázky
Zaručí sitemapa, že se stránka zaindexuje?
Nezaručí. Pomůže vyhledávači adresu objevit, o zařazení do indexu se ale rozhoduje podle obsahu a signálů.
Má být v sitemapě i stránkování kategorií?
Obvykle ne. Do sitemapy patří první strana kategorie; další strany zůstávají průchozí přes odkazy, ale nemusí být v seznamu.
Kolik adres se vejde do jedné sitemapy?
Jeden soubor má limit na počet adres i na velikost. Větší katalog se rozdělí do více souborů, které zastřeší index sitemap.
Související pojmy
- Indexace – Indexace je zařazení stránky do databáze vyhledávače, ze které se pak sestavují výsledky hledání. Stránka, která není v indexu, se ve výsledcích nemůže objevit — a to i tehdy, když je běžně dostupná a robot ji už navštívil.
- Robots.txt – Robots.txt je textový soubor v kořeni domény, kterým web říká robotům, které části webu nemají procházet. Řídí stahování, nikoli indexaci — a je to veřejně čitelný pokyn, který slušné roboty respektují a ostatní ignorují.
- Canonical URL – Canonical URL je odkaz v hlavičce stránky, kterým web vyhledávačům oznamuje, která adresa je hlavní verze obsahu. Používá se všude tam, kde je stejný nebo velmi podobný obsah dostupný pod více URL — v e-shopu typicky při filtrování, řazení a stránkování kategorií.
- Meta robots (noindex, nofollow) – Meta robots je značka v hlavičce stránky, kterou web říká vyhledávači, jestli má stránku zařadit do indexu a jestli má následovat odkazy na ní. Na rozdíl od robots.txt se týká konkrétní stránky a robot ji musí načíst, aby se pokyn dozvěděl.
Další pojmy ze skupiny SEO & AEO
- Canonical URLCanonical URL je odkaz v hlavičce stránky, kterým web vyhledávačům oznamuje, která adresa je hlavní verze obsahu. Používá se všude tam, kde je stejný nebo velmi podobný obsah dostupný pod více URL — v e-shopu typicky při filtrování, řazení a stránkování kategorií.
- Crawl budgetCrawl budget je množství stránek, které robot vyhledávače na daném webu za určitý čas stáhne. Určuje ho jednak technická kapacita serveru, jednak to, jak hodnotný web pro vyhledávač je — a u velkých e-shopů rozhoduje, jak rychle se změny v katalogu promítnou do výsledků.
- Duplicitní obsahDuplicitní obsah je stejný nebo velmi podobný text dostupný na více adresách, ať už v rámci jednoho webu, nebo napříč weby. Vyhledávač musí vybrat jednu verzi k indexaci a zbytek potlačí, takže se hodnota obsahu tříští místo aby se sčítala.
- Facetová navigaceFacetová navigace je filtrování produktů podle vlastností — velikosti, barvy, značky, ceny. Pro zákazníka je to nejrychlejší cesta k produktu, pro vyhledávač zdroj obrovského množství adres s téměř stejným obsahem, protože každá kombinace filtrů může vytvořit vlastní URL.
- HreflangHreflang je značka, kterou web vyhledávači sděluje, že určitá stránka má jazykové nebo regionální varianty, a která z nich patří které skupině uživatelů. Používá se u vícejazyčných e-shopů a u variant pro různé země, i když je jazyk stejný.
- IndexaceIndexace je zařazení stránky do databáze vyhledávače, ze které se pak sestavují výsledky hledání. Stránka, která není v indexu, se ve výsledcích nemůže objevit — a to i tehdy, když je běžně dostupná a robot ji už navštívil.