Technické SEO
Čo je Robots.txt?
Robots.txt je textový súbor v koreni webu, ktorý robotom vyhľadávačov hovorí, ktoré časti webu môžu prehľadávať a ktoré nie.
Robots.txt je jednoduchý textový súbor umiestnený v koreňovom adresári webu, napríklad vasweb.sk/robots.txt. Obsahuje pravidlá pre robotov (crawlerov), teda automatické programy vyhľadávačov, ktoré prechádzajú web. Pomocou príkazov User-agent, Disallow a Allow určíte, kam roboty smú a kam nie.
Prečo na tom záleží
Správne nastavený robots.txt usmerní roboty na dôležitý obsah a odkloní ich od administrácie, košíka či nekonečných kombinácií filtrov. Jediná chybná lomka však môže zablokovať celý web. Dôležité je vedieť aj to, čo robots.txt nedokáže: nie je to nástroj na ochranu súkromných dát a spoľahlivo nevylúči stránku z výsledkov vyhľadávania. Pravidlá navyše rešpektujú len slušné roboty veľkých vyhľadávačov, rôzne škodlivé nástroje ich môžu ignorovať.
Ako na to v praxi
- Blokujte iba sekcie bez hodnoty pre vyhľadávanie, napríklad
/admin/,/kosik/alebo interné vyhľadávanie. - Neblokujte súbory CSS a JavaScript – Google ich potrebuje na správne vykreslenie stránky.
- Pridajte riadok
Sitemap:s úplnou adresou XML sitemap. - Ak chcete stránku z výsledkov odstrániť, použite
noindexa v robots.txt ju neblokujte, inak robot značku neuvidí. - Po každej zmene skontrolujte prehľad robots.txt v Google Search Console.
Najčastejšie chyby
- Riadok
Disallow: /prenesený z testovacieho prostredia na ostrý web. - Ukrývanie citlivých dát cez robots.txt – súbor je verejný a ktokoľvek si ho prečíta.
- Zablokovanie stránok, ktoré majú
noindex, čím sa značka stane pre robota neviditeľnou.
Príklad z praxe
Súbor eshop.sk/robots.txt obsahuje Disallow: /kosik/ a Disallow: /hladat, aby roboty nemrhali časom na košíku a výsledkoch interného vyhľadávania.
Mýtus
Keď stránku zablokujem v robots.txt, zmizne z výsledkov Google.
Fakt
Robots.txt bráni len prehľadávaniu. Ak na stránku vedú odkazy, Google ju môže zaindexovať aj bez prečítania obsahu.