Robots.txt instellen: complete gids voor SEO en WordPress

Met robots.txt bepaal je welke delen van je website crawlers mogen bezoeken. Volg dit praktische stappenplan om het bestand veilig te maken, op de juiste locatie te plaatsen en te testen.

Robots.txt instellen doe je door een tekstbestand met crawlregels te plaatsen op de root van je domein, bijvoorbeeld https://jouwdomein.nl/robots.txt. Gebruik het om crawlers weg te houden van niet-relevante technische URL’s, niet om pagina’s uit Google te verwijderen. Controleer elke regel na publicatie, want een verkeerde Disallow-regel kan belangrijke pagina’s en bestanden onbedoeld blokkeren.

Wat is robots.txt?

Een robots.txt-bestand geeft crawlers, waaronder Googlebot, instructies over welke URL-paden ze wel of niet mogen crawlen. Crawlen is het ophalen en bekijken van pagina’s door een zoekmachine. Het is iets anders dan indexeren: opgenomen worden in de zoekresultaten.

Robots.txt is vooral nuttig wanneer je technische of tijdelijke delen van je website niet wilt laten crawlen. Denk aan een beheeromgeving, een interne zoekfunctie of testomgeving. Voor een gewone zakelijke website is een beperkt bestand meestal veiliger dan een lange lijst met regels.

Het bestand werkt per combinatie van protocol, host en poort. Een robots.txt op https://www.jouwdomein.nl/robots.txt geldt dus niet automatisch voor https://jouwdomein.nl/robots.txt. Controleer daarom altijd de variant waarop je website bereikbaar en geïndexeerd is.

Robots.txt instellen in 7 stappen

  1. Inventariseer wat je wilt beschermen tegen crawling. Maak onderscheid tussen nuttige pagina’s voor bezoekers en zoekmachines, en technische URL’s zonder SEO-waarde. Blokkeer niet zomaar categorieën, dienstenpagina’s, afbeeldingen, CSS of JavaScript.
  2. Controleer of er al een bestand bestaat. Open https://jouwdomein.nl/robots.txt in je browser. Bewaar een kopie voordat je iets wijzigt. Bestaat er geen bestand, dan krijg je doorgaans een foutmelding of lege respons.
  3. Maak een UTF-8-tekstbestand met de juiste regels. Begin met een duidelijke user-agent-groep. Gebruik regels alleen wanneer je een concreet doel hebt.
  4. Voeg de sitemap-locatie toe. Vermeld de volledige URL van je XML-sitemap, zodat crawlers die eenvoudig kunnen vinden. Controleer eerst welke sitemap jouw CMS daadwerkelijk publiceert.
  5. Plaats het bestand op de root. De bestandsnaam moet exact robots.txt zijn en het bestand moet rechtstreeks bereikbaar zijn via /robots.txt, niet in een submap zoals /wp-content/robots.txt.
  6. Open en controleer het live bestand. Bekijk de live URL in een browser. Let op typefouten, ongewenste regels en een eventueel door het CMS gegenereerd bestand dat jouw upload overschrijft.
  7. Test belangrijke URL’s in Google Search Console. Controleer met URL-inspectie of cruciale pagina’s bereikbaar zijn voor Google. Bekijk ook meldingen over robots.txt in Search Console.

Veilig basisvoorbeeld voor een zakelijke website

Gebruik dit alleen als uitgangspunt. Pas paden aan op jouw website en voeg geen regel toe waarvan je de gevolgen niet kunt beoordelen.

User-agent: *
Disallow:

Sitemap: https://jouwdomein.nl/sitemap.xml

De lege Disallow:-regel betekent dat crawlers niet worden beperkt door dit bestand. De sitemapregel is optioneel voor crawltoegang, maar praktisch als verwijzing naar je sitemap.

Regels die je echt moet begrijpen

OnderdeelVoorbeeldPraktisch effectWanneer gebruiken?
User-agentUser-agent: *De volgende regels gelden voor alle crawlers die deze groep gebruiken.Als je één algemene set crawlregels wilt hanteren.
DisallowDisallow: /zoeken/Vraagt crawlers URL’s onder dit pad niet te crawlen.Bij interne zoekresultaten of afgebakende technische secties zonder zoekwaarde.
AllowAllow: /wp-admin/admin-ajax.phpGeeft een specifieke uitzondering binnen een breder geblokkeerd pad.Alleen wanneer een noodzakelijke URL binnen een geblokkeerde map bereikbaar moet blijven.
SitemapSitemap: https://jouwdomein.nl/sitemap.xmlVerwijst crawlers naar de XML-sitemap.Als aanvulling op het indienen van de sitemap in Search Console.

Google ondersteunt onder meer user-agent, disallow, allow en sitemap. Andere, niet-standaard directives zijn geen betrouwbare manier om Googlebot te sturen. Houd het bestand bovendien klein en overzichtelijk. Google documenteert een maximale bestandsgrootte van 500 KiB voor verwerking.

Robots.txt voor WordPress instellen

Bij WordPress kan robots.txt fysiek op de server staan of door WordPress, je hosting of een SEO-oplossing dynamisch worden gegenereerd. Bepaal eerst welke variant actief is door de live URL in je browser te openen. Wijzig vervolgens op één plek, niet tegelijk via meerdere systemen.

Een veelgebruikt technisch pad is /wp-admin/. Blokkeer je dit pad, controleer dan zorgvuldig of noodzakelijke front-endfunctionaliteit bereikbaar blijft. Het is niet verstandig om zonder analyse hele WordPress-mappen, CSS-bestanden, JavaScript-bestanden of de map met uploads te blokkeren. Google moet pagina’s kunnen renderen om ze goed te begrijpen.

Staat je website tijdelijk in ontwikkeling? Gebruik robots.txt niet als enige afscherming. Wie een testomgeving echt privé wil houden, kiest toegangsbeveiliging. Robots.txt is openbaar: iedereen kan de regels en vaak ook de genoemde paden bekijken.

Robots.txt testen: deze controles voer je uit

  • Browsercontrole: open de exacte URL van het bestand op je voorkeursdomein en controleer of de inhoud leesbaar is.
  • Controle van belangrijke pagina’s: test je homepage, dienstenpagina’s, blogartikelen en XML-sitemap. Zij mogen niet per ongeluk onder een geblokkeerd pad vallen.
  • Google Search Console: kijk naar meldingen over robots.txt en gebruik URL-inspectie voor URL’s waarvan je wilt weten of Google ze kan ophalen en indexeren.
  • Hercontrole na releases: controleer robots.txt na een migratie, CMS-wijziging, nieuwe hostingomgeving of aanpassing van URL-structuren.

Besteed extra aandacht aan foutpagina’s. Een blokkade in robots.txt lost een kapotte URL of onjuiste serverreactie niet op. Lees daarom ook onze gids over 404- en soft-404-fouten oplossen wanneer Search Console crawl- of indexeringsproblemen signaleert.

Robots.txt versus noindex, canonical en wachtwoordbeveiliging

Gebruik robots.txt niet om een pagina betrouwbaar uit de zoekresultaten te houden. Als een URL via andere plekken bekend is, kan deze soms nog als URL in zoekresultaten verschijnen zonder dat Google de inhoud heeft gecrawld. Wil je indexering voorkomen van een publiek bereikbare pagina, gebruik dan een passende noindex-instructie en voorkom dat de pagina door robots.txt wordt geblokkeerd voordat Google die instructie kan zien.

  • Robots.txt: stuurt crawltoegang voor URL-paden.
  • Noindex: is bedoeld om zoekmachines te vragen een crawlbare pagina niet te indexeren.
  • Canonical: helpt zoekmachines een voorkeursversie te begrijpen bij vergelijkbare of dubbele pagina’s.
  • Wachtwoordbeveiliging: is geschikt voor inhoud die niet publiek toegankelijk mag zijn, zoals een testomgeving of klantportaal.

Veelgemaakte fouten bij robots.txt

  • De hele site blokkeren: Disallow: / bij User-agent: * sluit in principe de volledige website uit van crawling. Gebruik dit niet op een live website die organisch verkeer moet aantrekken.
  • Belangrijke middelen blokkeren: het blokkeren van CSS, JavaScript of afbeeldingen kan Google hinderen bij het renderen en begrijpen van pagina’s.
  • Robots.txt verwarren met noindex: crawlblokkade is geen verwijderingsmethode voor zoekresultaten.
  • Bestand op de verkeerde plek zetten: alleen het bestand op de root van de juiste host is geldig.
  • Verouderde paden laten staan: na een redesign of migratie kunnen regels verwijzen naar paden die niet meer bestaan, of juist nieuwe belangrijke secties raken.

Onderhoudsscorecard voor websitebeheerders

ControlepuntWat controleer je?Actie bij afwijkingMoment
Bereikbaarheid/robots.txt opent op het voorkeursdomein via HTTPS.Corrigeer de plaatsing of serverconfiguratie.Na publicatie en na een migratie.
SEO-pagina’sHomepage, diensten en artikelen vallen niet onder een ongewenste Disallow-regel.Verwijder of versmal de blokkade en test opnieuw.Na elke wijziging.
SitemapDe genoemde sitemap-URL opent en bevat actuele, indexeerbare URL’s.Werk de sitemapverwijzing of sitemapconfiguratie bij.Na wijziging in CMS of URL-structuur.
Technische padenAlleen paden met een duidelijk crawl-doel zijn geblokkeerd.Schrap overbodige of onverklaarbare regels.Periodiek en na nieuwe functionaliteit.
Search ConsoleEr zijn geen onverwachte robots.txt-meldingen en belangrijke URL’s zijn controleerbaar.Onderzoek bereikbaarheid, serverreactie en regels.Periodiek en bij indexeringsdaling.

Wanneer schakel je hulp in?

Pas robots.txt met extra zorg aan bij internationale subdomeinen, aparte mobiele of app-omgevingen, omvangrijke filters, JavaScript-websites of migraties. De gevolgen raken dan vaak meer dan één URL. LYNX Media combineert technische keuzes met zichtbaarheid en conversie binnen conversie- en SEO-optimalisatie. Bekijk ook het overzicht van onze diensten als je technische SEO structureel wilt aanpakken.

Veelgestelde vragen

Heb ik altijd een robots.txt-bestand nodig?

Nee. Als je geen crawlregels nodig hebt, hoeft een website niet per se een robots.txt-bestand te hebben. Een eenvoudig bestand met een sitemapverwijzing kan wel overzicht bieden, mits je het zorgvuldig beheert.

Waar staat robots.txt in WordPress?

Het bestand moet voor bezoekers en crawlers bereikbaar zijn op de root van je domein: https://jouwdomein.nl/robots.txt. De manier waarop die URL technisch wordt aangemaakt verschilt per WordPress-installatie, hostingomgeving en gebruikte configuratie.

Kan ik een pagina uit Google verwijderen met robots.txt?

Nee. Robots.txt regelt crawltoegang en is geen betrouwbare noindex-oplossing. Gebruik voor publieke pagina’s die niet in zoekresultaten horen een passende noindex-instructie; scherm niet-publieke inhoud af met toegangsbeveiliging.

Bronnen

Bespreek je website of online groeikansen met LYNX Media

Heb je een vraag over dit onderwerp, of wil je weten wat er voor jouw site nodig is? Neem contact op.

Neem contact op

Klaar om te groeien?

Laten we samenwerken en jouw online succes bouwen!

LYNX Media, gratis consult