Než začneme – Crawl budget
Crawl budget je důležitý pojem a je dobré ho chápat, protože hodně promlouvá do toho, jakým způsobem a jak rychle Google projde a zaindexuje váš web, když mu ho dáte k indexaci (nebo ho najde on sám).
Crawl budget je klíčovým faktorem pro indexaci a zobrazení vašich stránek ve výsledcích vyhledávání. Pokud zajistíte efektivní správu crawl budgetu, umožníte Googlu procházet a indexovat více relevantních stránek z vašeho webu, což může mít přímý dopad na vaše organické výsledky.
Crawl budget určuje, kolik stránek z vašeho webu Google denně navštíví a prozkoumá.
Je naivní si myslet, že dáte do Google Console sitemap webu a Google ji okamžitě celou projde a zpracuje. Nikoli. Google si vytvoří jakou si frontu požadavků (=stránek) a ty jednu po druhé postupně zpracuje.
Co do rychlosti zpracování promlouvá?
- Crawl rate limit (limit rychlosti procházení)
Kdyby se Google okamžitě vrhnul na procházení všech stránek ze sitemap webu, znamenalo by to takový malý DDOS na celý server a ten by nemusel takový nápor zátěže unést. Sleduje tedy, kolik stránek je možné za hodinu/den načíst, aniž by zpomalil web jako takový.- Další důvod, proč dělat weby rychlé a malé.
- Crawl demand (poptávka po obsahu)
Jsou weby, které Google navštěvuje rád a častěji. Zpravidla jsou to weby, které se např.- se často mění (např. zpravodajské weby),
- mají vysokou autoritu (domain authority, DA) – důvěryhodnost a síla webu (kvalita obsahu, kvalitní on-page i off-page SEO, délka existence domény, atd…) – Google takovému webu víc věří, jeho zpětné odkazy mají větší váhu apod.
- číslo není veřejné, ale existují určité porovnávače, např. https://ahrefs.com/website-authority-checker/
- přivádějí návštěvnost z vyhledávání.
Proč vás má Crawl budget zajímat?
- Pokud má váš web stovky nebo tisíce stránek, nečekejte, že je Google všechny projde hned.
- Ty, které zpracované a indexované nejsou, se ve výsledcích vyhledávání neobjeví.
Jak Crawl budget šetřit?
- Nedávejte do sitemapy zbytečné stránky,
- např. filtrování, duplicitní stránky, stránkování, feedy a další.
- Blokujte stránky, které indexovat nechcete
- k tomu slouží
robots.txt, které většinou vytváří na webech pluginy pro SEO.
- k tomu slouží
- Důsledně na webu opravujte a přesměrovávejte neexistující stránky (skončí s chybou 404).
- Nemějte v sitemapě stránky s přesměrováním
- Udržujte web rychlý a malý (s ohledem na množství zdrojů, které se musí ze serveru stáhnout)
- rychlý web = vyšší rychlost procházení.
Pozn. Mám osobně vysledováno na několika webech, kde se měnily technologie (a obsah +- zůstaly), že se opravdu indexování zrychlilo – díky zrychlení načítání a zmenšení velikosti stránek.
Nejčastější chyby v Google Search Console
Teď už chápeme, že nám Google většinou nezaindexuje web okamžitě. A teď se podíváme na nejčastější chyby, které tam na nás můžou skočit:
Alternativní stránka se správnou značkou kanonické stránky
- Problém: Google našel více podobných stránek a správně si vybral kanonickou.
- Řešení: Nastavte kanonickou (“hlavní”) URL pro stránky, o kterých si Google myslí, že jsou duplikované.
- Příklad: Zažila jsem web, kde byl příspěvek. Jenže měl dvě kategorie a problém byl, že se propisovaly do URL, např:
- /google-nastroje/googl-search-console
- /seo/googl-search-console
Google takovou stránku samozřejmě nechce indexovat 2x a podle obsahu pozná, že je to ta samá. Proto je potřeba říci, která URL bude ta hlavní a tu indexovat.
Duplicitní stránka bez kanonické verze vybrané uživatelem
Ten samý případ, jen kanonická URL nebyla nikde zadaná a Google neví/nechce rozhodnout, která to má být.
Google zvolil jinou kanonickou stránku než uživatel
Opět to samé, jen by Google zvolil k indexování jinou stránku než tu, která je označená jako kanonická.
- Řešení: je třeba stránku zkontrolovat, je možné, že je lépe strukturovaná, odkazovaná, aj.)
Nenalezeno (404)
- Problém: Snažíte se indexovat stránku, která není na webu
- Řešení: Ujistěte se, že stránka na webu je, je funkční a dostupná. Případně ji přesměrujte.
Page with redirect
- Problém: snažíte se indexovat stránku, která se přesměrovává jinam.
- Řešení: přesměrování ze sitemap vyhoďte a dejte k indexaci cílovou stránku. Snažte se také zamezit tranzitivním přesměrováním (A -> B -> C -> D….).
Vyloučeno tagem „noindex“
- Problém: Stránka je označena jako no index (neindexovat)
- Řešení: Zkontrolujte, že má být stránka skutečně indexována a nemá v hlavičkách/nastavení SEO pluginu no index.
Případně zkontrolujte, že je povoleno indexování celého webu (Nastavení – Zobrazování – Zabránit indexování webu)
Procházeno – momentálně neindexováno
- Problém: Google už stránku prošel, ale ji zatím nezařadil do indexu. To může mít několik důvodů:
- stránka není dostatečně zajímavá obsahem
- pomalé načítání stránky
- špatná struktura
- duplicitní stránky
- aj.
- Řešení: Ujistěte se, že je stránka dostupná, načítá se rychle, má smysluplný a hodnotný obsah. A zkuste poslat požadavek na ruční indexaci stránky.
Objeveno – momentálně neindexováno
- Problém: Google o stránce ví, ale ještě ji neprošel. To může mít několik důvodů:
- vyčerpaný crawl budget
- slabé odkazy z jiných stránek (i stejného webu)
- blokování (robots, no-index, aj.)
- Řešení: Zkuste stránku zkontrolovat, několik dní vyčkat, případně ručně poslat k indexaci/opravě.
Chyba typu 5xx
- Problém: V době, kdy Google na stránku šel, nebyla dostupná kvůli serverové chybě (ty začínají http stavem 5xx)
- Řešení: Stránku zkontrolujte, opravte a dejte znovu k indexaci.
Blokován přístup (chyba 403)
- Problém: V době, kdy Google na stránku šel, nebyl byl na stránku zakázán přístup (možná kvůli přihlášení – chyba 403 říká, že návštěvník není autorizován k tomu na stránku přistoupit).
- Řešení: Stránku zkontrolujte, opravte a dejte znovu k indexaci.
Pravidelně kontrolujte
Nezapomeňte čas od času kontrolovat váš web v Google Search Console, abyste zajistili, že jsou indexovány všechny stránky, které potřebujete a není s indexováním nebo procházením webu nějaký problém.
Chcete se Google nástroje naučit lépe používat?

