Procházení webu

Procházení webu (crawling) je způsob, jakým vyhledávače (Google, Seznam nebo Bing) objevují obsah vašich stránek. Robot přijde na jednu adresu, přečte si ji, projde odkazy, které na ní najde, a pokračuje dál. Co nenajde, to nezaindexuje. A co není v indexu, se ve výsledcích vyhledávání objevit nemůže.

robots.txt: co umí a co ne

Soubor robots.txt leží v kořeni webu (na adrese vasedomena.cz/robots.txt) a funguje jako vzkaz na dveřích. Říká robotům, kam smí a kam ne. Typicky se jím vyřazuje administrace, výsledky interního vyhledávání, filtrované a řadicí adresy výpisů a duplicitní varianty stránek s parametry v URL. Tedy místa, kde robot jen utrácí čas.

Co robots.txt neumí: zákaz procházení není zákaz indexace. Pokud na zakázanou stránku vedou odkazy, Google ji může do výsledků zařadit i bez toho, že by si ji přečetl. Když chcete stránku z výsledků skutečně dostat, nechte robota projít a použijte v hlavičce stránky meta značku noindex. Obsah, který nemá vidět nikdo, patří za přihlášení, za heslo nebo za omezení na konkrétní IP adresy.

Kde zjistíte, co robot na webu prochází

V Google Search Console otevřete Nastavení a v něm Statistiky procházení. Uvidíte, kolik požadavků robot za jednotlivé dny udělal, jak rychle mu server odpovídal a s jakými stavovými kódy požadavky skončily. Rozpad podle typu souboru a podle účelu (nová stránka versus obnovení už známé) ukáže, kam robot chodí nejčastěji.

Na co se v té zprávě dívat: náhlý propad počtu požadavků, nárůst chyb 5xx a prodlužující se doba odpovědi serveru. Všechny tři znamenají, že se robot na váš web dostává hůř než dřív.

Ještě podrobnější pohled dávají serverové logy. Zaznamenává se v nich zpravidla každý přístup, takže z nich vyčtete, na kterých adresách robot tráví čas i kam se vůbec nedostal.

Rozpočet procházení

Každý web má strop, kolik stránek na něm robot za danou dobu projde. U webu o pár desítkách stránek to řešit nemusíte — Google je zvládne všechny. Problém začíná u velkých e-shopů, kde filtry, řazení a stránkování generují tisíce adres a robot se k novým produktům dostane až po nich.

Co s tím:

  • Vyřaďte z procházení filtrované, řadicí a vyhledávací adresy, které nemají být ve výsledcích.
  • Odstraňte řetězy přesměrování a interní odkazy končící chybou 404 — každý takový požadavek je spotřebovaný rozpočet bez užitku.
  • Zrychlete odpovědi serveru. Čím rychleji odpovídá, tím víc stránek robot za stejnou dobu projde.
  • Udržujte aktuální sitemap.xml a na důležité stránky odkazujte z navigace a z ostatních stránek webu. Co je hluboko a bez odkazů, robot navštíví zřídka.

Robot se vrací tím častěji, čím častěji na webu nachází změny. Pravidelně doplňovaný obsah a čistá struktura odkazů udělají pro frekvenci návštěv víc než jakékoli nastavení v souboru.

Vaše data. Vaše AI. Vaše pravidla.

AI, kterou vlastníte. Ne AI, která vlastní vás.

Pojďme to rozjet