Crawl budget
Také známé jako: rozpočet procházení, crawl rate, limit procházení
Crawl budget je množství stránek, které robot vyhledávače na daném webu za určitý čas stáhne. Určuje ho jednak technická kapacita serveru, jednak to, jak hodnotný web pro vyhledávač je — a u velkých e-shopů rozhoduje, jak rychle se změny v katalogu promítnou do výsledků.
Kdy crawl budget řešit
Až tehdy, když má web řádově desetitisíce a víc adres a v logu vidíš, že robot tráví většinu času na adresách, které nemají být v indexu. U e-shopu s několika stovkami produktů je crawl budget téma, které odvádí pozornost od důležitějších věcí.
Reálné spouštěče jsou tři: facetová navigace generující kombinace filtrů, velký katalog s pomalou odezvou serveru, a situace po migraci, kdy potřebuješ, aby robot co nejrychleji objevil nové adresy.
Jak se pozná plýtvání
Podíváš se do logů serveru na to, které adresy robot stahuje. Když většinu požadavků tvoří adresy s parametry filtrů, řazení a stránkování, zatímco na nové produkty se dostane jednou za několik týdnů, rozpočet se utrácí na obsahu, který nemá být v indexu.
Druhý signál je odezva serveru. Když se doba odpovědi zhoršuje, robot sám zpomalí, aby web nezatížil — a stáhne toho méně.
Nejčastější chyby
- Řešení crawl budgetu na webu, který ho nemá. U malého katalogu jde o optimalizaci bez měřitelného dopadu.
- Blokace filtrů v robots.txt až poté, co se dostaly do indexu. Zablokované adresy zůstanou v indexu jako záznamy bez obsahu, protože robot k nim už nesmí.
- Spoléhání na canonical. Canonical řeší indexaci, ne stahování — robot každou variantu stejně navštíví.
- Pomalá odezva serveru bez povšimnutí. Zrychlení odpovědi zvedne crawl budget často víc než jakékoli nastavení robots.txt.
Shoptet a Upgates
Časté otázky
Od jaké velikosti webu má crawl budget smysl řešit?
Orientačně od desítek tisíc adres, nebo dřív, pokud filtrace generuje řádově víc adres než máš produktů. U menších webů je efekt zanedbatelný.
Šetří canonical crawl budget?
Ne. Robot musí stránku stáhnout, aby se canonical dozvěděl. Na omezení stahování slouží robots.txt nebo úprava toho, jak se filtrační odkazy generují.
Pomůže zvýšit crawl budget rychlejší hosting?
Často ano. Robot přizpůsobuje tempo odezvě serveru — čím rychleji web odpovídá, tím víc stránek za stejný čas stáhne.
Související pojmy
- Indexace – Indexace je zařazení stránky do databáze vyhledávače, ze které se pak sestavují výsledky hledání. Stránka, která není v indexu, se ve výsledcích nemůže objevit — a to i tehdy, když je běžně dostupná a robot ji už navštívil.
- Robots.txt – Robots.txt je textový soubor v kořeni domény, kterým web říká robotům, které části webu nemají procházet. Řídí stahování, nikoli indexaci — a je to veřejně čitelný pokyn, který slušné roboty respektují a ostatní ignorují.
- Facetová navigace – Facetová navigace je filtrování produktů podle vlastností — velikosti, barvy, značky, ceny. Pro zákazníka je to nejrychlejší cesta k produktu, pro vyhledávač zdroj obrovského množství adres s téměř stejným obsahem, protože každá kombinace filtrů může vytvořit vlastní URL.
Další pojmy ze skupiny SEO & AEO
- Canonical URLCanonical URL je odkaz v hlavičce stránky, kterým web vyhledávačům oznamuje, která adresa je hlavní verze obsahu. Používá se všude tam, kde je stejný nebo velmi podobný obsah dostupný pod více URL — v e-shopu typicky při filtrování, řazení a stránkování kategorií.
- Duplicitní obsahDuplicitní obsah je stejný nebo velmi podobný text dostupný na více adresách, ať už v rámci jednoho webu, nebo napříč weby. Vyhledávač musí vybrat jednu verzi k indexaci a zbytek potlačí, takže se hodnota obsahu tříští místo aby se sčítala.
- Facetová navigaceFacetová navigace je filtrování produktů podle vlastností — velikosti, barvy, značky, ceny. Pro zákazníka je to nejrychlejší cesta k produktu, pro vyhledávač zdroj obrovského množství adres s téměř stejným obsahem, protože každá kombinace filtrů může vytvořit vlastní URL.
- HreflangHreflang je značka, kterou web vyhledávači sděluje, že určitá stránka má jazykové nebo regionální varianty, a která z nich patří které skupině uživatelů. Používá se u vícejazyčných e-shopů a u variant pro různé země, i když je jazyk stejný.
- IndexaceIndexace je zařazení stránky do databáze vyhledávače, ze které se pak sestavují výsledky hledání. Stránka, která není v indexu, se ve výsledcích nemůže objevit — a to i tehdy, když je běžně dostupná a robot ji už navštívil.
- JavaScript SEOJavaScript SEO je zajištění toho, aby obsah generovaný na straně prohlížeče byl dostupný i vyhledávačům a AI asistentům. Zásadní je, že obsah, který v HTML není a doplní ho až JavaScript, část robotů nikdy neuvidí.