Robots.txt
Také známé jako: soubor robots.txt, robots
Robots.txt je textový soubor v kořeni domény, kterým web říká robotům, které části webu nemají procházet. Řídí stahování, nikoli indexaci — a je to veřejně čitelný pokyn, který slušné roboty respektují a ostatní ignorují.
Kdy robots.txt řešit
Při spuštění webu, po migraci a vždy, když se v indexu objeví adresy, které tam nemají být. Nejčastější reálná potřeba u e-shopu je omezit procházení kombinací filtrů, interního vyhledávání a košíku, aby crawl budget šel na produkty a kategorie.
Druhý moment, který je nový, je rozhodnutí o AI crawlerech — jestli chceš, aby tvůj obsah používaly modely a odpovědní vyhledávače. To se řeší právě tady.
Jak vypadá funkční robots.txt
Soubor leží vždy na https://domena.cz/robots.txt, nikde jinde. Obsahuje bloky pravidel pro jednotlivé roboty a odkaz na sitemapu:
User-agent: *
Disallow: /kosik/
Disallow: /vyhledavani/
Sitemap: https://domena.cz/sitemap.xml
Zákaz platí na prefix cesty, takže Disallow: /kosik/ pokryje i všechno pod ním. Odkaz na sitemapu musí být absolutní adresa.
Nejčastější chyby
- Použití robots.txt k odstranění stránky z indexu. Robot k ní nesmí, takže si nemůže přečíst noindex — a stránka v indexu zůstane bez popisku.
- Zablokování CSS a JavaScriptu. Vyhledávač pak stránku nevyrenderuje správně a může ji vyhodnotit jako rozbitou nebo nepoužitelnou na mobilu.
- Zapomenutý
Disallow: /z vývoje. Po spuštění zablokuje celý web. Patří to na začátek každého povypouštěcího checklistu. - Blokace adres, které jsou v sitemapě. Protichůdný signál — jednou robota zveš, podruhé ho vyhazuješ.
Shoptet a Upgates
Časté otázky
Odstraní robots.txt stránku z výsledků hledání?
Ne. Zablokovaná stránka se může ve výsledcích objevit bez popisku. Na odstranění slouží noindex, ke kterému ale musí mít robot přístup.
Jak zakážu AI crawlerům používat můj obsah?
Pravidly pro konkrétní user-agenty, například GPTBot, ClaudeBot, PerplexityBot nebo Google-Extended. Respektování je dobrovolné — roboti, kteří se pravidly neřídí, je ignorují.
Kam patří robots.txt na subdoméně?
Každá subdoména má vlastní robots.txt ve svém kořeni. Soubor na hlavní doméně pro subdoménu neplatí.
Související pojmy
- Crawl budget – Crawl budget je množství stránek, které robot vyhledávače na daném webu za určitý čas stáhne. Určuje ho jednak technická kapacita serveru, jednak to, jak hodnotný web pro vyhledávač je — a u velkých e-shopů rozhoduje, jak rychle se změny v katalogu promítnou do výsledků.
- Indexace – Indexace je zařazení stránky do databáze vyhledávače, ze které se pak sestavují výsledky hledání. Stránka, která není v indexu, se ve výsledcích nemůže objevit — a to i tehdy, když je běžně dostupná a robot ji už navštívil.
- Meta robots (noindex, nofollow) – Meta robots je značka v hlavičce stránky, kterou web říká vyhledávači, jestli má stránku zařadit do indexu a jestli má následovat odkazy na ní. Na rozdíl od robots.txt se týká konkrétní stránky a robot ji musí načíst, aby se pokyn dozvěděl.
- Sitemap.xml – Sitemap.xml je strojově čitelný seznam adres, které má vyhledávač na webu znát. Pomáhá mu obsah objevit rychleji, hlavně u velkých webů a u stránek, na které nevede dost interních odkazů — zařazení do indexu ale negarantuje.
Další pojmy ze skupiny SEO & AEO
- Canonical URLCanonical URL je odkaz v hlavičce stránky, kterým web vyhledávačům oznamuje, která adresa je hlavní verze obsahu. Používá se všude tam, kde je stejný nebo velmi podobný obsah dostupný pod více URL — v e-shopu typicky při filtrování, řazení a stránkování kategorií.
- Crawl budgetCrawl budget je množství stránek, které robot vyhledávače na daném webu za určitý čas stáhne. Určuje ho jednak technická kapacita serveru, jednak to, jak hodnotný web pro vyhledávač je — a u velkých e-shopů rozhoduje, jak rychle se změny v katalogu promítnou do výsledků.
- Duplicitní obsahDuplicitní obsah je stejný nebo velmi podobný text dostupný na více adresách, ať už v rámci jednoho webu, nebo napříč weby. Vyhledávač musí vybrat jednu verzi k indexaci a zbytek potlačí, takže se hodnota obsahu tříští místo aby se sčítala.
- Facetová navigaceFacetová navigace je filtrování produktů podle vlastností — velikosti, barvy, značky, ceny. Pro zákazníka je to nejrychlejší cesta k produktu, pro vyhledávač zdroj obrovského množství adres s téměř stejným obsahem, protože každá kombinace filtrů může vytvořit vlastní URL.
- HreflangHreflang je značka, kterou web vyhledávači sděluje, že určitá stránka má jazykové nebo regionální varianty, a která z nich patří které skupině uživatelů. Používá se u vícejazyčných e-shopů a u variant pro různé země, i když je jazyk stejný.
- IndexaceIndexace je zařazení stránky do databáze vyhledávače, ze které se pak sestavují výsledky hledání. Stránka, která není v indexu, se ve výsledcích nemůže objevit — a to i tehdy, když je běžně dostupná a robot ji už navštívil.