
Robots.txt is een klein tekstbestand op je website dat crawlers vertelt welke delen ze wel en niet mogen ophalen. Het staat vast op één plek, in de root van je domein, en werkt als een bordje bij de ingang: het geeft aanwijzingen, maar het is geen slot op de deur. Zoekmachines lezen het voordat ze je site bezoeken.
Robots.txt in het kort
Robots.txt is een simpel tekstbestand waarmee je het crawlgedrag van bots stuurt. Je geeft aan welke bots (user-agents) welke paden mogen ophalen. Meer is het niet. Het regelt verkeer, geen toegang.
- Het bestand heet altijd
robots.txten staat in de root van je domein. - Je stuurt crawlen (ophalen), niet indexeren (opnemen in de zoekresultaten).
- Het is een openbaar bestand, dus nooit geschikt om iets geheim te houden.
- Nette bots houden zich aan de regels, kwaadwillende bots negeren ze gewoon.
- Voor kleine sites is een standaardbestand vaak al genoeg.
Waar staat robots.txt en hoe leest een crawler het bestand?
Een crawler is een programma dat pagina’s ophaalt om ze te kunnen verwerken. Voordat een nette crawler je site bezoekt, kijkt hij eerst of er een robots.txt is en wat daarin staat. Pas daarna begint hij met ophalen. Zie het als een bezoeker die eerst het bordje bij de ingang leest voordat hij naar binnen loopt.
De vaste plek van robots.txt
Het bestand moet in de root van je domein staan en exact robots.txt heten. Voor je hoofddomein is dat dus https://jouwsite.nl/robots.txt. Een crawler zoekt het bestand alleen daar. Zet je het in een submap, dan wordt het niet gevonden en gelden er simpelweg geen regels.
Regels gelden niet automatisch voor alles
De reikwijdte van robots.txt is beperkt tot precies dat host en dat protocol. Een bestand op https://jouwsite.nl/ geldt niet voor https://shop.jouwsite.nl/ en ook niet voor de http-variant. Elk subdomein en elk protocol heeft dus zijn eigen robots.txt nodig. Vergeet je die op je shop-subdomein, dan staat dat deel technisch gezien zonder regels open.
https://jouwsite.nl/robots.txtgeldt voor het hoofddomein op https.https://blog.jouwsite.nl/robots.txtis een apart bestand voor het subdomein.- http en https worden als verschillende bronnen behandeld.
Wat kun je met robots.txt sturen?
Met robots.txt bepaal je welke bots welke delen van je site mogen ophalen. Je werkt met een paar simpele regels die je onder elkaar zet. Elke regel doet één ding, en samen vormen ze de instructie voor de crawler.
User-agent, Disallow en Allow uitgelegd
De drie belangrijkste regels zijn User-agent, Disallow en Allow. Daarmee bepaal je voor welke bot een regel geldt en welke paden hij wel of niet mag ophalen.
User-agent: voor welke bot de regels gelden. Een sterretje (*) betekent alle bots.Disallow: welk pad de bot niet mag ophalen.Disallow: /prive/sluit die hele map uit.Allow: een uitzondering binnen een geblokkeerd pad, zodat je toch één onderdeel vrijgeeft.
Een leeg Disallow: betekent dat er niets geblokkeerd is en dat de bot alles mag ophalen. Zo geef je duidelijke signalen af in plaats van halve. Je wilt dat de zoekmachine precies weet waar hij aan toe is.
Je wilt serieus genomen worden door de zoekmachine; geef je gemengde signalen, dan haakt hij af.
Giacomo Perticara, oprichter en SEO-strateeg bij GRP Digital
Robots.txt en sitemap
In robots.txt kun je ook verwijzen naar je sitemap. Daarmee wijs je crawlers naar de lijst met pagina’s die je belangrijk vindt. Dat is een van de weinige positieve signalen die je in dit bestand kwijt kunt: je blokkeert niet iets, je wijst juist de weg. Zet de volledige URL van je sitemap erin.
User-agent: *
Disallow: /prive/
Sitemap: https://jouwsite.nl/sitemap.xml
Wat robots.txt niet doet
Robots.txt wordt vaak overschat. Het regelt of een bot een pagina ophaalt, en verder niets. Het zegt niets over indexering en het beschermt niets. Dat verschil is precies waar de meeste misverstanden ontstaan.
Crawlen is niet hetzelfde als indexeren
Crawlen is het ophalen van een pagina. Indexeren is het opnemen ervan in de zoekresultaten. Dat zijn twee losse stappen. Als je een pagina blokkeert in robots.txt, mag Google hem niet ophalen, maar hij kan alsnog in de zoekresultaten belanden als er links naar wijzen. Google toont dan een kale vermelding zonder omschrijving, omdat hij de inhoud niet mocht lezen. Wil je een pagina echt uit de resultaten houden, dan heb je een ander middel nodig.
Noindex, wachtwoordbeveiliging en andere alternatieven
Wil je dat een pagina niet in de zoekresultaten komt, gebruik dan een noindex-instructie in plaats van robots.txt. Let op: die instructie werkt alleen als de pagina wél gecrawld mag worden, want anders leest Google hem nooit. Moet iets echt afgeschermd zijn, zet er dan een wachtwoord op of regel het via de server. Dat zijn de enige manieren om content daadwerkelijk dicht te zetten.
- Pagina uit zoekresultaten houden: noindex, niet robots.txt.
- Content echt afschermen: wachtwoordbeveiliging of toegang via de server.
- Crawlbudget sturen op grote sites: robots.txt is hier wel op zijn plek.
Veelgemaakte fouten met robots.txt
Een fout in robots.txt is snel gemaakt en soms lang onopgemerkt. Omdat één regel al veel effect heeft, kan een klein foutje grote gevolgen hebben voor je vindbaarheid. Dit zijn de drie die we het vaakst tegenkomen.
Per ongeluk de hele site blokkeren
De klassieker is Disallow: /. Die ene schuine streep sluit je hele site af voor crawlers. Dit gebeurt vaak per ongeluk als een testomgeving live gaat en de blokkade uit die omgeving meeverhuist. Controleer daarom altijd na een livegang wat er in je robots.txt staat.
CSS, JavaScript of belangrijke resources blokkeren
Google wil je pagina’s renderen zoals een bezoeker ze ziet. Blokkeer je de CSS- of JavaScript-bestanden, dan ziet Google een kapotte versie van je pagina en kan hij die minder goed beoordelen. Laat dit soort resources vrij, ook al lijken het bijzaken.
Robots.txt gebruiken voor geheime content
Robots.txt is een openbaar bestand dat iedereen kan opvragen via /robots.txt. Zet je daar een pad in als Disallow: /geheim-project/, dan wijs je nieuwsgierige bezoekers juist de weg naar precies dat wat je wilde verbergen. Gebruik het nooit om iets af te schermen. Dat is als een bordje “niet naar binnen kijken” op een raam zonder gordijn.
Robots.txt voorbeelden voor veelvoorkomende situaties
De beste manier om robots.txt te begrijpen is door voorbeelden te bekijken. Hieronder een uitgebreider bestand en een lijst met paden die je in de praktijk soms blokkeert.
Eenvoudig robots.txt voorbeeld
Dit bestand geldt voor alle bots, blokkeert een paar interne mappen, houdt de rest open en verwijst naar de sitemap. Voor veel sites is zoiets prima als basis.
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /winkelwagen/
Disallow: /bedankt/
Sitemap: https://jouwsite.nl/sitemap.xml
Voorbeelden van paden die je soms blokkeert
Er is geen vaste lijst die voor elke site klopt. Wat je blokkeert hangt af van je platform en je situatie. Deze paden komen vaak voorbij:
- Interne beheer- of inlogpagina’s die niets te zoeken hebben in Google.
- Winkelwagen-, afreken- en bedankpagina’s van een webshop.
- Interne zoekresultaatpagina’s die eindeloos veel dunne URL’s opleveren.
- Filter- of sorteer-URL’s met veel parameters die dezelfde inhoud herhalen.
Blokkeer nooit zomaar iets omdat het in een lijstje staat. Kijk eerst of het pad echt overbodig is voor de zoekmachine voordat je het uitsluit.
Robots.txt in SEO: wanneer wel, wanneer niet?
Robots.txt is een nuttig onderdeel van technische SEO, maar het is geen knop waarmee je hoger komt. Het helpt je vooral om te voorkomen dat crawlers tijd verspillen aan pagina’s die er niet toe doen. Hoeveel je ermee wint, hangt af van de omvang van je site.
Voor kleine sites
Heb je een kleine site met een paar tientallen pagina’s, dan hoef je robots.txt nauwelijks aan te raken. Google heeft geen moeite om alles te crawlen. Een simpel standaardbestand dat de boel openzet en naar je sitemap verwijst is dan meestal genoeg. Ga hier niet onnodig zitten sleutelen.
Voor grotere of complexere sites
Bij grote webshops of sites met duizenden URL’s wordt robots.txt interessanter. Zoekmachines besteden een beperkte hoeveelheid aandacht aan je site, het zogenoemde crawlbudget. Door onnodige pagina’s zoals filtercombinaties en interne zoekresultaten uit te sluiten, stuur je die aandacht naar de pagina’s die je wél in Google wilt hebben. Hier levert een doordacht robots.txt echt iets op.
AI-bots en robots.txt
Naast zoekmachines zijn er bots die content ophalen om AI-modellen te trainen of om AI-antwoorden te voeden. Ook die bots kun je in robots.txt aanspreken via hun eigen user-agent, en zo aangeven of ze je content mogen ophalen.
Wat je hiermee wel en niet oplost
Je kunt een bekende AI-bot netjes buiten de deur houden door zijn user-agent op Disallow te zetten. Bots die zich aan de regels houden, respecteren dat. Maar robots.txt blijft een verzoek, geen slot. Een bot die de afspraken negeert, haalt je content alsnog op. Wil je echt voorkomen dat iets wordt opgehaald, dan is een blokkade op serverniveau een sterker middel. Zie robots.txt hier als een beleefd verzoek aan de voordeur, niet als een beveiliging.
User-agent: GPTBot
Disallow: /
User-agent: *
Disallow: /wp-admin/
Sitemap: https://jouwsite.nl/sitemap.xml
Veelgestelde vragen over robots.txt
Waar dient robots.txt voor?
Robots.txt vertelt crawlers welke delen van je site ze wel en niet mogen ophalen. Zo stuur je hun gedrag en voorkom je dat ze tijd verspillen aan onbelangrijke pagina’s.
Wat betekent “geblokkeerd door robots.txt”?
Die melding betekent dat een pagina niet gecrawld mocht worden vanwege een regel in je robots.txt. Vaak is dat bewust, maar controleer of je die pagina echt wilde uitsluiten.
Werkt robots.txt echt?
Bij nette bots zoals Google werkt het prima. Kwaadwillende bots kunnen de regels negeren, dus reken er niet op voor beveiliging.
Heeft elke site een robots.txt nodig?
Strikt genomen niet: zonder robots.txt mag een crawler simpelweg alles ophalen. Toch is een klein standaardbestand met een verwijzing naar je sitemap altijd netjes.
Houdt robots.txt een pagina uit Google?
Nee. Robots.txt regelt crawlen, niet indexeren. Een geblokkeerde pagina kan alsnog in de resultaten verschijnen; gebruik daarvoor een noindex-instructie.
Kan iedereen mijn robots.txt zien?
Ja. Het bestand is openbaar en op te vragen via jouwsite.nl/robots.txt. Zet er dus nooit paden in die je liever verborgen houdt.
Conclusie: zie robots.txt als verkeersregel, niet als slot
Robots.txt is een eenvoudig maar krachtig bestand dat het verkeer van crawlers regelt. Het bepaalt wat bots mogen ophalen, niet wat er geïndexeerd wordt en zeker niet wat afgeschermd is. Behandel het als een bordje bij de ingang: het wijst de weg voor wie zich aan de regels houdt, maar het houdt niemand tegen die dat niet doet. Wil je een pagina uit Google weren, gebruik dan noindex. Wil je iets echt beschermen, zet er een wachtwoord op. Houd het bestand simpel, controleer het na elke livegang en geef de zoekmachine heldere signalen. Dan doet robots.txt precies waar het voor bedoeld is.





