GRP Digital

Wat is robots.txt en wat doet het?

SEO Basics

Een robots.txt-bestand dat de crawler stuurt naar Google
Een robots.txt-bestand dat de crawler stuurt naar Google
Robots.txt stuurt de crawler: dit wel bezoeken, dat niet.

Robots.txt is een klein tekstbestand op je website dat crawlers vertelt welke delen ze wel en niet mogen ophalen. Het staat vast op één plek, in de root van je domein, en werkt als een bordje bij de ingang: het geeft aanwijzingen, maar het is geen slot op de deur. Zoekmachines lezen het voordat ze je site bezoeken.

Robots.txt in het kort

Robots.txt is een simpel tekstbestand waarmee je het crawlgedrag van bots stuurt. Je geeft aan welke bots (user-agents) welke paden mogen ophalen. Meer is het niet. Het regelt verkeer, geen toegang.

  • Het bestand heet altijd robots.txt en staat in de root van je domein.
  • Je stuurt crawlen (ophalen), niet indexeren (opnemen in de zoekresultaten).
  • Het is een openbaar bestand, dus nooit geschikt om iets geheim te houden.
  • Nette bots houden zich aan de regels, kwaadwillende bots negeren ze gewoon.
  • Voor kleine sites is een standaardbestand vaak al genoeg.

Waar staat robots.txt en hoe leest een crawler het bestand?

Een crawler is een programma dat pagina’s ophaalt om ze te kunnen verwerken. Voordat een nette crawler je site bezoekt, kijkt hij eerst of er een robots.txt is en wat daarin staat. Pas daarna begint hij met ophalen. Zie het als een bezoeker die eerst het bordje bij de ingang leest voordat hij naar binnen loopt.

De vaste plek van robots.txt

Het bestand moet in de root van je domein staan en exact robots.txt heten. Voor je hoofddomein is dat dus https://jouwsite.nl/robots.txt. Een crawler zoekt het bestand alleen daar. Zet je het in een submap, dan wordt het niet gevonden en gelden er simpelweg geen regels.

Regels gelden niet automatisch voor alles

De reikwijdte van robots.txt is beperkt tot precies dat host en dat protocol. Een bestand op https://jouwsite.nl/ geldt niet voor https://shop.jouwsite.nl/ en ook niet voor de http-variant. Elk subdomein en elk protocol heeft dus zijn eigen robots.txt nodig. Vergeet je die op je shop-subdomein, dan staat dat deel technisch gezien zonder regels open.

  • https://jouwsite.nl/robots.txt geldt voor het hoofddomein op https.
  • https://blog.jouwsite.nl/robots.txt is een apart bestand voor het subdomein.
  • http en https worden als verschillende bronnen behandeld.

Wat kun je met robots.txt sturen?

Met robots.txt bepaal je welke bots welke delen van je site mogen ophalen. Je werkt met een paar simpele regels die je onder elkaar zet. Elke regel doet één ding, en samen vormen ze de instructie voor de crawler.

User-agent, Disallow en Allow uitgelegd

De drie belangrijkste regels zijn User-agent, Disallow en Allow. Daarmee bepaal je voor welke bot een regel geldt en welke paden hij wel of niet mag ophalen.

  • User-agent: voor welke bot de regels gelden. Een sterretje (*) betekent alle bots.
  • Disallow: welk pad de bot niet mag ophalen. Disallow: /prive/ sluit die hele map uit.
  • Allow: een uitzondering binnen een geblokkeerd pad, zodat je toch één onderdeel vrijgeeft.

Een leeg Disallow: betekent dat er niets geblokkeerd is en dat de bot alles mag ophalen. Zo geef je duidelijke signalen af in plaats van halve. Je wilt dat de zoekmachine precies weet waar hij aan toe is.

Je wilt serieus genomen worden door de zoekmachine; geef je gemengde signalen, dan haakt hij af.

Giacomo Perticara, oprichter en SEO-strateeg bij GRP Digital

Robots.txt en sitemap

In robots.txt kun je ook verwijzen naar je sitemap. Daarmee wijs je crawlers naar de lijst met pagina’s die je belangrijk vindt. Dat is een van de weinige positieve signalen die je in dit bestand kwijt kunt: je blokkeert niet iets, je wijst juist de weg. Zet de volledige URL van je sitemap erin.

User-agent: *
Disallow: /prive/

Sitemap: https://jouwsite.nl/sitemap.xml

Wat robots.txt niet doet

Robots.txt wordt vaak overschat. Het regelt of een bot een pagina ophaalt, en verder niets. Het zegt niets over indexering en het beschermt niets. Dat verschil is precies waar de meeste misverstanden ontstaan.

Crawlen is niet hetzelfde als indexeren

Crawlen is het ophalen van een pagina. Indexeren is het opnemen ervan in de zoekresultaten. Dat zijn twee losse stappen. Als je een pagina blokkeert in robots.txt, mag Google hem niet ophalen, maar hij kan alsnog in de zoekresultaten belanden als er links naar wijzen. Google toont dan een kale vermelding zonder omschrijving, omdat hij de inhoud niet mocht lezen. Wil je een pagina echt uit de resultaten houden, dan heb je een ander middel nodig.

Noindex, wachtwoordbeveiliging en andere alternatieven

Wil je dat een pagina niet in de zoekresultaten komt, gebruik dan een noindex-instructie in plaats van robots.txt. Let op: die instructie werkt alleen als de pagina wél gecrawld mag worden, want anders leest Google hem nooit. Moet iets echt afgeschermd zijn, zet er dan een wachtwoord op of regel het via de server. Dat zijn de enige manieren om content daadwerkelijk dicht te zetten.

  • Pagina uit zoekresultaten houden: noindex, niet robots.txt.
  • Content echt afschermen: wachtwoordbeveiliging of toegang via de server.
  • Crawlbudget sturen op grote sites: robots.txt is hier wel op zijn plek.

Veelgemaakte fouten met robots.txt

Een fout in robots.txt is snel gemaakt en soms lang onopgemerkt. Omdat één regel al veel effect heeft, kan een klein foutje grote gevolgen hebben voor je vindbaarheid. Dit zijn de drie die we het vaakst tegenkomen.

Per ongeluk de hele site blokkeren

De klassieker is Disallow: /. Die ene schuine streep sluit je hele site af voor crawlers. Dit gebeurt vaak per ongeluk als een testomgeving live gaat en de blokkade uit die omgeving meeverhuist. Controleer daarom altijd na een livegang wat er in je robots.txt staat.

CSS, JavaScript of belangrijke resources blokkeren

Google wil je pagina’s renderen zoals een bezoeker ze ziet. Blokkeer je de CSS- of JavaScript-bestanden, dan ziet Google een kapotte versie van je pagina en kan hij die minder goed beoordelen. Laat dit soort resources vrij, ook al lijken het bijzaken.

Robots.txt gebruiken voor geheime content

Robots.txt is een openbaar bestand dat iedereen kan opvragen via /robots.txt. Zet je daar een pad in als Disallow: /geheim-project/, dan wijs je nieuwsgierige bezoekers juist de weg naar precies dat wat je wilde verbergen. Gebruik het nooit om iets af te schermen. Dat is als een bordje “niet naar binnen kijken” op een raam zonder gordijn.

Robots.txt voorbeelden voor veelvoorkomende situaties

De beste manier om robots.txt te begrijpen is door voorbeelden te bekijken. Hieronder een uitgebreider bestand en een lijst met paden die je in de praktijk soms blokkeert.

Eenvoudig robots.txt voorbeeld

Dit bestand geldt voor alle bots, blokkeert een paar interne mappen, houdt de rest open en verwijst naar de sitemap. Voor veel sites is zoiets prima als basis.

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /winkelwagen/
Disallow: /bedankt/

Sitemap: https://jouwsite.nl/sitemap.xml

Voorbeelden van paden die je soms blokkeert

Er is geen vaste lijst die voor elke site klopt. Wat je blokkeert hangt af van je platform en je situatie. Deze paden komen vaak voorbij:

  • Interne beheer- of inlogpagina’s die niets te zoeken hebben in Google.
  • Winkelwagen-, afreken- en bedankpagina’s van een webshop.
  • Interne zoekresultaatpagina’s die eindeloos veel dunne URL’s opleveren.
  • Filter- of sorteer-URL’s met veel parameters die dezelfde inhoud herhalen.

Blokkeer nooit zomaar iets omdat het in een lijstje staat. Kijk eerst of het pad echt overbodig is voor de zoekmachine voordat je het uitsluit.

Robots.txt in SEO: wanneer wel, wanneer niet?

Robots.txt is een nuttig onderdeel van technische SEO, maar het is geen knop waarmee je hoger komt. Het helpt je vooral om te voorkomen dat crawlers tijd verspillen aan pagina’s die er niet toe doen. Hoeveel je ermee wint, hangt af van de omvang van je site.

Voor kleine sites

Heb je een kleine site met een paar tientallen pagina’s, dan hoef je robots.txt nauwelijks aan te raken. Google heeft geen moeite om alles te crawlen. Een simpel standaardbestand dat de boel openzet en naar je sitemap verwijst is dan meestal genoeg. Ga hier niet onnodig zitten sleutelen.

Voor grotere of complexere sites

Bij grote webshops of sites met duizenden URL’s wordt robots.txt interessanter. Zoekmachines besteden een beperkte hoeveelheid aandacht aan je site, het zogenoemde crawlbudget. Door onnodige pagina’s zoals filtercombinaties en interne zoekresultaten uit te sluiten, stuur je die aandacht naar de pagina’s die je wél in Google wilt hebben. Hier levert een doordacht robots.txt echt iets op.

AI-bots en robots.txt

Naast zoekmachines zijn er bots die content ophalen om AI-modellen te trainen of om AI-antwoorden te voeden. Ook die bots kun je in robots.txt aanspreken via hun eigen user-agent, en zo aangeven of ze je content mogen ophalen.

Wat je hiermee wel en niet oplost

Je kunt een bekende AI-bot netjes buiten de deur houden door zijn user-agent op Disallow te zetten. Bots die zich aan de regels houden, respecteren dat. Maar robots.txt blijft een verzoek, geen slot. Een bot die de afspraken negeert, haalt je content alsnog op. Wil je echt voorkomen dat iets wordt opgehaald, dan is een blokkade op serverniveau een sterker middel. Zie robots.txt hier als een beleefd verzoek aan de voordeur, niet als een beveiliging.

User-agent: GPTBot
Disallow: /

User-agent: *
Disallow: /wp-admin/

Sitemap: https://jouwsite.nl/sitemap.xml

Veelgestelde vragen over robots.txt

Waar dient robots.txt voor?

Robots.txt vertelt crawlers welke delen van je site ze wel en niet mogen ophalen. Zo stuur je hun gedrag en voorkom je dat ze tijd verspillen aan onbelangrijke pagina’s.

Wat betekent “geblokkeerd door robots.txt”?

Die melding betekent dat een pagina niet gecrawld mocht worden vanwege een regel in je robots.txt. Vaak is dat bewust, maar controleer of je die pagina echt wilde uitsluiten.

Werkt robots.txt echt?

Bij nette bots zoals Google werkt het prima. Kwaadwillende bots kunnen de regels negeren, dus reken er niet op voor beveiliging.

Heeft elke site een robots.txt nodig?

Strikt genomen niet: zonder robots.txt mag een crawler simpelweg alles ophalen. Toch is een klein standaardbestand met een verwijzing naar je sitemap altijd netjes.

Houdt robots.txt een pagina uit Google?

Nee. Robots.txt regelt crawlen, niet indexeren. Een geblokkeerde pagina kan alsnog in de resultaten verschijnen; gebruik daarvoor een noindex-instructie.

Kan iedereen mijn robots.txt zien?

Ja. Het bestand is openbaar en op te vragen via jouwsite.nl/robots.txt. Zet er dus nooit paden in die je liever verborgen houdt.

Conclusie: zie robots.txt als verkeersregel, niet als slot

Robots.txt is een eenvoudig maar krachtig bestand dat het verkeer van crawlers regelt. Het bepaalt wat bots mogen ophalen, niet wat er geïndexeerd wordt en zeker niet wat afgeschermd is. Behandel het als een bordje bij de ingang: het wijst de weg voor wie zich aan de regels houdt, maar het houdt niemand tegen die dat niet doet. Wil je een pagina uit Google weren, gebruik dan noindex. Wil je iets echt beschermen, zet er een wachtwoord op. Houd het bestand simpel, controleer het na elke livegang en geef de zoekmachine heldere signalen. Dan doet robots.txt precies waar het voor bedoeld is.

Author :

More to explorer

Ready to get started?

Want monthly updates on digital growth, SEO trends, and strategic marketing insights?