robots.txt er en tekstfil, der serveres fra roden af et domæne (f.eks. https://example.com/robots.txt), og som fortæller webcrawlere, hvilke URL-stier de har lov til at hente. Den bruger simple direktiver — User-agent, Allow, Disallow og Sitemap — og er defineret af RFC 9309. Filen er rådgivende: den bygger på samarbejdsvillige bots og er ikke en adgangskontrolmekanisme.
Hvorfor det er vigtigt
En velfungerende robots.txt holder crawlere fokuseret på URL'er, der bør indekseres, og hjælper med crawl budget på store sites. Den forhindrer staging- eller admin-stier i at dukke op i søgeresultater. En fejlagtig eller for aggressiv fil kan afindeksere et helt site natten over — en Disallow: / ved en fejl er en af de mest almindelige SEO-regressioner under en lancering.
Sådan tjekker du
- Hent
/robots.txtog bekræft, at den returnerer200medContent-Type: text/plain. - Validér filen i Google Search Console eller Bing Webmaster Tools.
- Brug
Disallow:til at blokere crawl-stier, men brugnoindextil at holde sider ude af indekset. - Tilføj en
Sitemap:-linje, der peger på dit sitemap.xml. - Læg aldrig hemmeligheder bag
robots.txt; beskyt dem med autentificering.