Robots.txt is een onderdeel van het Robots Exclusion Protocol, een standaard die in 1994 werd voorgesteld en door zoekmachines zoals Google, Bing en DuckDuckGo wordt gevolgd. Het bestand staat altijd op één vaste locatie: https://jouwdomein.be/robots.txt. Crawlers vragen dat bestand op vóór ze andere pagina’s bezoeken. Wat erin staat, bepaalt waar Googlebot, Bingbot en andere bots wel of niet naar binnen mogen.
Robots.txt regelt geen indexatie en geen toegang. Het is een instructie, geen slot op de deur. Bots die zich aan de standaard houden volgen de regels. Bots die je content willen scrapen negeren het bestand vaak gewoon.
Waarom is robots.txt belangrijk voor SEO?
Robots.txt bepaalt hoe efficiënt zoekmachines jouw site crawlen. Elke website krijgt van Google een crawlbudget, een aantal verzoeken per dag dat Googlebot wil besteden. Als Googlebot tijd verspilt aan filterpagina’s, interne zoekresultaten of admin-URL’s, dan blijft er minder budget over voor de pagina’s die wél moeten ranken.
Voor kleine sites met 50 pagina’s is dit nauwelijks een probleem. Voor een webshop met 8.000 producten en duizenden filtercombinaties is het cruciaal. Een verkeerd ingestelde regel kan ook hele secties van je site uit Google halen. Dat is geen theoretisch risico: ik kom dit regelmatig tegen bij sites die niet meer vindbaar zijn in Google en waarbij de oorzaak ligt in één foute regel in robots.txt.
Hoe werkt robots.txt?
Robots.txt is een platte tekstfile zonder HTML, die je via FTP of een SEO plugin in de root van je domein plaatst. De structuur bestaat uit groepen regels. Elke groep begint met een User-agent die aangeeft voor welke crawler de regels gelden, gevolgd door één of meerdere Disallow en Allow instructies. Googlebot leest het bestand bij elk bezoek en past de eerste passende regel toe.
Een typisch robots.txt bestand voor een WordPress site ziet er zo uit:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://jouwdomein.be/sitemap_index.xml
De belangrijkste directives op een rij:
- User-agent — Welke bot de regels moet volgen. Een sterretje (
*) betekent alle bots.User-agent: Googlebotricht zich enkel op Google. - Disallow — Pad dat de bot niet mag crawlen.
Disallow: /private/blokkeert alles onder die map. - Allow — Uitzondering op een Disallow regel. Handig om binnen een geblokkeerde map één URL alsnog vrij te geven.
- Sitemap — Verwijzing naar je XML sitemap. Dit is geen blokkeer-instructie, maar een hint over waar je sitemap staat.
Het bestand wordt regel per regel gelezen, is hoofdlettergevoelig voor paden en moet exact robots.txt heten. Een spelfout zoals robot.txt wordt genegeerd.
Hoe test je robots.txt?
Google Search Console heeft een robots.txt-rapport waarmee je per URL kan checken of die geblokkeerd wordt. Voor je een nieuwe regel publiceert, test je hem daar eerst. Een verkeerd geplaatste Disallow: / haalt namelijk je volledige site uit Google binnen één crawl-cyclus.
Wat is het verschil tussen robots.txt en noindex?
Robots.txt blokkeert het crawlen van een pagina. De noindex meta tag blokkeert het indexeren ervan. Het is een subtiel verschil met grote gevolgen voor je zichtbaarheid in Google, en het is de meest gemaakte fout in technische SEO. Wie de twee verwart, blokkeert vaak per ongeluk de pagina’s die hij juist verborgen wilde houden.
| Robots.txt Disallow | Noindex meta tag | |
|---|---|---|
| Functie | Verbiedt crawlen | Verbiedt indexatie |
| Plaats | Tekstbestand in root | HTML <meta> tag in de pagina |
| Effect op crawlbudget | Bespaart budget | Verbruikt budget (pagina wordt nog gelezen) |
| Pagina kan in Google verschijnen? | Ja, als URL bekend is via links | Nee, na hercrawl verdwijnt hij |
| Gebruikt voor | Filterpagina’s, admin URL’s, dubbele content | Bedankt-pagina’s, tags, dunne content |
De val zit hier: als je een pagina in robots.txt blokkeert om hem uit Google te houden, kan Googlebot de pagina niet meer crawlen. Daardoor ziet hij ook je noindex-tag niet en blijft de URL eventueel als titel-loze listing in de zoekresultaten staan. Wil je een pagina écht uit Google, gebruik dan een noindex via meta tags en laat robots.txt de pagina toe.
Gerelateerde termen
Veelgestelde vragen
Heeft elke website een robots.txt nodig?
Nee, robots.txt is optioneel. Als er geen bestand staat, mogen crawlers standaard alles bezoeken. Kleine brochuresites zonder admin-zones of dubbele URL’s hebben er weinig profijt van. Webshops, WordPress-sites en sites met filtersystemen winnen er wel mee, omdat ze crawlbudget kunnen sturen.
Waar vind ik het robots.txt bestand van mijn website?
Het bestand staat altijd op https://jouwdomein.be/robots.txt. Typ die URL in je browser en je ziet de inhoud direct. Bij een WordPress-site met Rank Math of Yoast wordt het bestand vaak virtueel gegenereerd door de SEO plugin. Je past het dan aan via de plugin-instellingen, niet via een fysiek bestand in je root.
Kan robots.txt een website uit Google halen?
Ja, één regel Disallow: / blokkeert je hele site. Googlebot stopt dan met crawlen, wat na verloop van tijd leidt tot dalende rankings en uiteindelijk verdwijnen uit de zoekresultaten. Dit is de meest schadelijke configuratiefout in technische SEO en gebeurt vaak per ongeluk bij een site-migratie of staging-omgeving.
Wat is het verschil tussen robots.txt en sitemap.xml?
Robots.txt vertelt crawlers wat ze niet mogen bezoeken. Een XML sitemap vertelt ze welke URL’s juist wél belangrijk zijn. Het zijn complementaire bestanden: robots.txt sluit deuren, sitemap.xml wijst de juiste weg. Beide horen aanwezig te zijn op een goed geoptimaliseerde site.
Werkt robots.txt voor afbeeldingen en PDF’s?
Ja, je kan ook media-URL’s blokkeren. Disallow: /wp-content/uploads/private/ houdt afbeeldingen in die map uit Google Afbeeldingen. Voor PDF’s werkt hetzelfde principe. Let op: een PDF die via een externe link wordt gedeeld kan alsnog in Google verschijnen als URL, omdat robots.txt indexatie niet blokkeert.
Hoe groot mag een robots.txt bestand zijn?
Google leest maximaal 500 kibibyte aan robots.txt-inhoud. Alles boven die limiet wordt genegeerd. In de praktijk haal je dat plafond zelden, want zelfs een uitgebreid bestand voor een grote webshop blijft meestal onder de 10 KB. Houd je regels bondig en groepeer ze per user-agent. Dat maakt het bestand sneller leesbaar voor mensen én voor crawlers.
Twijfel je of jouw robots.txt correct staat ingesteld? Bij een technische SEO-audit kijk ik dat samen met je crawl-rapport, sitemap en indexatie na. Stuur me een berichtje als je een second opinion wil.