Crawl traps herkennen: complete gids voor technische SEO

Crawl traps zijn URL-patronen die zoekmachines vrijwel eindeloos nieuwe, vaak onwaardevolle pagina’s laten crawlen. Ontdek hoe je ze herkent en per situatie de juiste technische oplossing kiest.

Crawl traps herken je aan URL-patronen die steeds nieuwe, inhoudelijk vergelijkbare of onbruikbare pagina’s opleveren. Denk aan filtercombinaties, interne zoekresultaten, agenda’s, sessie-ID’s en parameters voor sortering. Ze kunnen Google afleiden van belangrijke pagina’s, onnodige indexatieproblemen veroorzaken en technisch onderhoud complexer maken. Breng daarom eerst het URL-patroon en de interne links in kaart, en kies daarna gericht voor het beperken van URL-generatie, canonicalisatie, noindex of crawlblokkering.

Wat is een crawl trap?

Een crawl trap, ook crawler trap genoemd, is een technische situatie waarin een crawler via interne links steeds meer URL’s kan ontdekken zonder dat daar evenveel unieke, waardevolle inhoud tegenover staat. De URL-ruimte kan in theorie oneindig zijn, of in de praktijk zo groot worden dat crawlers veel tijd besteden aan pagina’s die geen zoekwaarde hebben.

Een webshop met kleuren, maten, merken, prijzen en sorteervolgordes is een bekend voorbeeld. Als elke combinatie een eigen crawlbare URL maakt, ontstaan er veel varianten van dezelfde productselectie. Maar ook zakelijke websites kunnen crawl traps hebben, bijvoorbeeld door een interne zoekfunctie, een kalender met oneindige datumnavigatie of verkeerd opgebouwde relatieve links.

Crawl trap, crawlbudget, indexering en 404-fout: het verschil

Deze begrippen hangen samen, maar vragen niet automatisch om dezelfde oplossing.

  • Crawl trap: een patroon dat onnodig veel crawlbare URL’s produceert.
  • Crawlbudget: de aandacht die Google aan het crawlen van een website besteedt. Voor veel kleinere websites is dit niet het belangrijkste knelpunt. De kwaliteit en beheersbaarheid van URL’s blijven wel belangrijk.
  • Indexering: de vraag of een URL in de zoekindex kan of mag verschijnen. Een crawlbare URL hoeft niet geïndexeerd te worden.
  • Duplicate content: sterk vergelijkbare inhoud op meerdere URL’s. Dit kan een gevolg zijn van een crawl trap, maar niet elke crawl trap draait uitsluitend om duplicatie.
  • 404- en soft-404-fouten: URL’s die niet beschikbaar zijn of als inhoudsloos worden beoordeeld. Dat is een ander probleem dan een systeem dat steeds nieuwe URL’s genereert. Lees ook onze gids over 404- en soft-404-fouten.

Een canonical-tag kan vergelijkbare URL’s helpen consolideren voor indexering, maar stopt crawlen niet per definitie. Een noindex-instructie voorkomt indexatie wanneer Google de pagina kan crawlen en verwerken. Robots.txt is bedoeld om crawling te sturen, maar is geen algemene oplossing om ongewenste URL’s netjes uit de index te houden. Kies dus op basis van het doel, niet op basis van een standaardrecept.

Veelvoorkomende crawl traps

Faceted navigation en filters

Faceted navigation laat bezoekers filteren op eigenschappen, zoals branche, locatie, materiaal, prijs of beschikbaarheid. Dat is nuttig voor gebruikers. Het wordt een SEO-risico wanneer iedere combinatie van filters en sorteervolgordes intern gelinkt en crawlbaar is, zonder zelfstandige zoekvraag of unieke inhoud.

Voorbeeld: /diensten?regio=utrecht&type=advies&sortering=prijs. Voeg daarna extra filters toe en het aantal mogelijke URL’s groeit snel.

URL-parameters voor sortering, tracking en weergave

Parameters zoals ?sort=, ?view=, ?utm_ en technische sessieparameters kunnen alternatieve versies van dezelfde pagina maken. Trackingparameters horen doorgaans niet in interne links thuis. Sorteer- en weergaveparameters vragen om een bewuste keuze: zijn ze nuttig voor zoekmachines, of alleen voor bezoekers?

Interne zoekresultaten

Een interne zoekpagina kan via zoekopdrachten, filters en paginering een grote hoeveelheid URL’s produceren. Deze pagina’s zijn zelden een goede landingspagina voor organisch verkeer. Zorg er vooral voor dat ze niet automatisch via crawlbare interne links blijven uitbreiden.

Kalenders en datumarchieven

Agenda’s kunnen links aanbieden naar vorige en volgende periodes zonder logisch eindpunt. Ook datumarchieven van nieuws- of blogmodules kunnen veel dunne archiefpagina’s genereren als de structuur onvoldoende wordt begrensd.

Paginering en oneindig laden

Paginering is niet automatisch een crawl trap. Het wordt problematisch als pagina’s elkaar blijven voortbrengen, als parameters willekeurige variaties toelaten of als oneindig laden geen duidelijke, stabiele URL-structuur heeft. Houd de route naar belangrijke categorie- en detailpagina’s overzichtelijk.

Sessie-ID’s en foutieve relatieve links

Een sessie-ID in de URL kan voor dezelfde inhoud telkens een nieuwe variant creëren. Foutieve relatieve links kunnen eveneens onverwachte URL-paden opleveren, bijvoorbeeld doordat een link vanaf meerdere niveaus anders wordt geïnterpreteerd. Dit soort fouten vraagt meestal om een technische correctie in templates, middleware of het CMS.

Signalen dat je een crawl trap moet onderzoeken

  • Een crawltool vindt grote groepen URL’s met dezelfde titel, vergelijkbare content of bijna identieke parameters.
  • In Google Search Console zie je crawlactiviteit op filter-, zoek-, kalender- of parameter-URL’s die geen organische landingspagina hoeven te zijn.
  • Serverlogs tonen veel verzoeken aan varianten die geen zakelijke of SEO-functie hebben.
  • Nieuwe URL’s verschijnen doordat interne links automatisch filter- en sorteercombinaties toevoegen.
  • Belangrijke pagina’s zijn moeilijk bereikbaar in de interne linkstructuur, terwijl onbelangrijke varianten veel navigatielinks ontvangen.

Crawl traps herkennen: stappenplan

  1. Maak een volledige crawl van je website. Gebruik een crawler zoals Screaming Frog of een vergelijkbaar hulpmiddel. Exporteer URL’s, titels, canonicals, robots-instructies, statuscodes en interne links.
  2. Groepeer URL’s op patroon. Kijk naar vraagtekens, parameters, mapstructuren, datumsegmenten en herhalende delen in de URL. Groepeer bijvoorbeeld alle URL’s met ?filter=, ?sort= of /zoeken/.
  3. Beoordeel de functie van elk patroon. Vraag per groep: helpt deze URL een bezoeker? Heeft hij een duidelijke, zelfstandige zoekintentie? Bevat hij wezenlijk andere inhoud? Moet Google hem kunnen vinden?
  4. Controleer de bron van interne links. Zoek uit welk template, filter, menu, zoekformulier of script de URL’s maakt. Een probleem oplossen bij de bron is meestal duurzamer dan alleen de symptomen afschermen.
  5. Vergelijk met Crawl Stats in Search Console. Bekijk crawlverzoeken, responsecodes, crawl-doelen en voorbeeld-URL’s. Gebruik dit om patronen uit je crawl te toetsen aan het gedrag van Googlebot.
  6. Onderzoek serverlogs wanneer die beschikbaar zijn. Logs laten zien welke URL’s daadwerkelijk worden opgevraagd en door welke user agents. Filter daarbij zorgvuldig op geverifieerde Googlebot-verzoeken als je conclusies over Google wilt trekken.
  7. Prioriteer op risico. Pak patronen eerst aan wanneer ze veel URL’s creëren, prominent intern gelinkt zijn, technisch instabiel zijn of bots naar pagina’s sturen zonder SEO- of gebruikerswaarde.
  8. Voer één passende maatregel per patroon door. Test na de wijziging opnieuw met een crawl, Search Console en waar mogelijk serverlogs. Combineer maatregelen alleen als ze ieder een eigen doel hebben.

Beslismatrix: welke oplossing past bij welk URL-patroon?

URL-patroonWaarde voor bezoekerSEO-keuzeConcrete actie
Filtercombinaties zonder eigen zoekvraagAlleen tijdelijk tijdens navigerenURL-generatie en interne crawlbaarheid beperkenMaak niet elke filtercombinatie crawlbaar vanuit links en beperk onnodige combinaties in het filtersysteem.
Geselecteerde filterpagina met duidelijke zoekintentieHoogBewust als landingspagina beherenGebruik een vaste, schone URL, unieke inhoud en interne links vanuit relevante categorie- of contentpagina’s.
Sorteerparameters zoals prijs of naamHandig voor gebruik, geen zelfstandige bestemmingConsolideren voor indexering en intern terughoudend linkenWijs een voorkeursversie aan en voorkom dat sorteerlinks overal als crawlbare navigatieroute worden aangeboden.
Interne zoekresultatenFunctioneel voor de zoeker op de siteNiet als organische landingspagina behandelenVoorkom indexatie en beperk routes die onbeperkt nieuwe zoek-URL’s creëren.
Agenda met vorige- en volgende-linksBeperkt buiten de actuele periodeURL-ruimte begrenzenBeperk onnodige datumroutes en zorg dat belangrijke actuele of vaste pagina’s rechtstreeks bereikbaar zijn.
Sessie-ID in URLGeen SEO-waardeTechnisch verwijderenPas sessiebeheer aan zodat dezelfde pagina een stabiele URL houdt en corrigeer waar nodig interne links.
Foutieve relatieve linksGeen waardeTechnisch herstellenCorrigeer de linkopbouw in template of CMS en controleer daarna op nieuwe foutieve URL-varianten.

Veelgemaakte fouten bij crawl traps oplossen

Alles blokkeren in robots.txt

Een robots.txt-regel kan nuttig zijn om crawling van een duidelijk ongewenst patroon te beperken. Maar als een URL al bekend is via andere bronnen, is robots.txt geen vervanging voor een indexatiebeleid. Bovendien kan een geblokkeerde pagina niet door Google worden gecrawld om een noindex-instructie te verwerken.

Op iedere variant alleen een canonical plaatsen

Canonicals helpen zoekmachines een voorkeursversie te begrijpen. Ze zijn geen garantie dat crawlers de alternatieven nooit bezoeken. Wanneer een systeem onbeperkt URL’s blijft produceren, moet je ook de URL-generatie en interne linking aanpakken.

Waardevolle filterpagina’s per ongeluk uitsluiten

Sommige gefilterde pagina’s sluiten wel aan op een concrete zoekvraag. Verwijder of blokkeer ze niet blindelings. Bepaal eerst welke selecties een duurzame landingspagina verdienen en welke alleen navigatievarianten zijn.

Alleen naar indexatie kijken

Een URL die niet in Google staat, kan nog steeds crawlactiviteit en technische complexiteit veroorzaken. Controleer daarom zowel de indexatie als de manier waarop URL’s intern worden gemaakt en ontdekt.

Praktische controlelijst voor websitebeheerders

  • Crawl je website periodiek en vergelijk nieuwe URL-patronen met eerdere crawls.
  • Controleer na een CMS-, filter- of templatewijziging welke interne links erbij komen.
  • Houd trackingparameters buiten interne navigatie waar dat kan.
  • Leg per parameter vast wat de functie is: filtering, sortering, tracking, weergave of sessiebeheer.
  • Bepaal per URL-groep of deze moet bestaan, crawlbaar moet zijn en indexeerbaar mag zijn.
  • Controleer Crawl Stats en serverlogs wanneer je een onverwacht patroon vermoedt.
  • Test technische wijzigingen eerst in een veilige omgeving en controleer daarna statuscodes, canonicals, robots-instructies en interne links.

Wanneer schakel je technische SEO-hulp in?

Schakel hulp in wanneer URL’s door templates of scripts worden gegenereerd, wanneer filters essentieel zijn voor je aanbod of wanneer je niet kunt vaststellen welke combinatie van canonical, noindex en crawlsturing passend is. Een verkeerde maatregel kan waardevolle pagina’s minder vindbaar maken of het onderliggende URL-probleem laten voortbestaan.

LYNX Media helpt bedrijven met technische analyse, informatiearchitectuur en verbeteringen die vindbaarheid én conversie ondersteunen. Bekijk onze dienst voor conversie- en SEO-optimalisatie of ontdek alle diensten van LYNX Media. Wil je jouw URL-structuur of crawlpatronen bespreken? Bespreek je website of online groeikansen met LYNX Media.

Bronnen

Bespreek je website of online groeikansen met LYNX Media

Heb je een vraag over dit onderwerp, of wil je weten wat er voor jouw site nodig is? Neem contact op.

Neem contact op

Klaar om te groeien?

Laten we samenwerken en jouw online succes bouwen!

LYNX Media, gratis consult