Dit artikel biedt een overzicht van alle bots die door AI Scrape Protect worden herkend, onderverdeeld in de vier categorieën die ook in de plugin worden gebruikt. Per bot staat uitgelegd wat deze doet en waarom je hem wel of niet zou willen blokkeren. Voor meer informatie over de plugin, bezoek de AI Scrape Protect Plugin-pagina.
Versie: 5.1
Publicatie: 18 september 2026
Zoekmachines
Deze bots zijn standaard toegestaan. Ze zijn verantwoordelijk voor de reguliere indexering in zoekmachines. Je kunt ze individueel uitschakelen, maar dat heeft direct gevolgen voor je vindbaarheid.
Bingbot
De primaire webcrawler van Microsoft voor Bing Zoeken. Blokkeren betekent dat je site uit Bing verdwijnt.
Google-PageSpeed
Wordt gebruikt door Google PageSpeed Insights voor prestatieanalyse van je site.
Google-Site-Verification
Gebruikt door Google Search Console om eigendom van je site te verifiëren.
Googlebot
De primaire webcrawler van Google, verantwoordelijk voor de indexering van je site in Google Zoeken. Blokkeren betekent dat je site uit de zoekresultaten verdwijnt.
Googlebot-Image
Crawlt afbeeldingen voor Google Afbeeldingen. Blokkeren verwijdert je afbeeldingen uit Google Afbeeldingen.
Googlebot-News
Indexeert nieuwsartikelen voor Google Nieuws.
Lighthouse
Google’s geautomatiseerde tool voor het analyseren van prestaties, toegankelijkheid en SEO.
AI-training
Deze bots verzamelen webcontent om AI-modellen te trainen. Ze zijn standaard geblokkeerd. Blokkeren via robots.txt is voor de meeste van deze bots effectief, al zijn er uitzonderingen die robots.txt mogelijk negeren.
AI2Bot
Ontwikkeld door het Allen Institute for AI voor academisch onderzoek en AI-modelontwikkeling.
Ai2Bot-Dolma
Een variant van AI2Bot die specifiek data verzamelt voor de Dolma open dataset, gebruikt voor het trainen van open-source taalmodellen.
AIMatrixCrawler
Crawlt webcontent voor AI-matrix en machine learning trainingsdoeleinden.
Amazon-AI
Amazon’s AI-specifieke crawler voor het verzamelen van webcontent ter ondersteuning van diensten zoals Alexa en aanbevelingssystemen.
Amazonbot
Amazon’s crawler voor indexering en AI-modeltraining, waaronder Amazon Nova en Alexa. Respecteert robots.txt.
AnthropicBot
Een crawler van Anthropic voor dataverzameling ten behoeve van modeltraining. Er zijn meldingen dat deze bot robots.txt mogelijk niet altijd respecteert.
Applebot-Extended
Apple’s opt-out token voor AI-training. Blokkeren voorkomt dat je content wordt gebruikt voor het trainen van Apple Intelligence en andere generatieve AI-modellen van Apple. De activiteit van deze bot is sterk toegenomen sinds de introductie van Apple Intelligence in 2026.
BorderxBot
AI-crawler van Borderxlab voor AI-zoekondersteuning, assistant retrieval en e-commerce productcrawling.
CCBot
De crawler van Common Crawl. Bouwt een publiek beschikbare open dataset die als trainingsdata wordt gebruikt door de meeste grote taalmodellen. Respecteert robots.txt.
ChatGLM-Spider
Crawler van Zhipu AI voor het verzamelen van trainingsdata voor ChatGLM, hun grote taalmodel.
ClaudeBot
De primaire trainingscrawler van Anthropic. Verzamelt webcontent voor het trainen van Claude. Respecteert robots.txt.
ClaudeResearchBot
Ingezet door het onderzoeksteam van Anthropic voor het verzamelen van datasets specifiek gericht op veilige en verantwoorde AI-systemen.
cohere-ai
De crawler van Cohere, gebruikt voor het verzamelen van trainingsdata voor hun taalmodellen.
cohere-training-data-crawler
Een afzonderlijke Cohere-crawler die specifiek gericht is op het opbouwen van trainingsdatasets.
DataForSeoBot
Crawlt websites voor het opbouwen van grote datasets voor SEO-analyse, dataverkoop en AI-modeltraining.
DeepseekBot
Crawler van DeepSeek voor het verzamelen van webdata ten behoeve van hun AI-taalmodellen.
Diffbot
Een AI-gestuurde webscraper die webdata structureert voor kennisgraafopbouw en diverse AI-toepassingen.
ErnieBot
Baidu’s AI-modelcrawler, ingezet voor het verzamelen van trainingsdata voor Ernie Bot, Baidu’s grote taalmodel.
FirecrawlAgent
Een scraper-as-a-service platform dat door uiteenlopende klanten en AI-toepassingen wordt ingezet om gestructureerde webcontent te extraheren. Respecteert robots.txt, maar is multi-tenant: veel verschillende partijen sturen dezelfde crawler aan.
FishBot
Crawler van Fish Audio voor open source AI-datacollectie. Respecteert robots.txt niet.
Google-CloudVertexBot
Google’s crawler gekoppeld aan het Vertex AI-platform. Gebruikt voor het verzamelen van webcontent ter ondersteuning van Google’s enterprise AI-diensten en modeltraining.
GPTBot
De primaire trainingscrawler van OpenAI. Verzamelt webcontent voor het trainen van GPT-modellen zoals ChatGPT. Respecteert robots.txt.
GPTBot-Preview
Een experimentele pre-releasevariant van GPTBot waarmee OpenAI nieuwe dataverzamelingsmethoden test voor toekomstige modellen.
iAskAI-Crawler
Verzamelt webcontent voor het genereren van antwoorden op het iAsk.ai zoek- en vraagbeantwoordingsplatform.
ImagesiftBot
Gespecialiseerd in het crawlen van afbeeldingen, mogelijk voor AI-training of visuele contentanalyse.
img2dataset
Een tool voor het downloaden en verwerken van grote afbeeldingsdatasets voor AI-training.
KimiBot
Crawler van Moonshot AI, het Chinese bedrijf achter het Kimi grote taalmodel. Gebruikt voor het verzamelen van trainingsdata.
KomoBot
Gebruikt door Komo Search voor het verzamelen van data voor AI-verbeterde zoekopdrachten en trainingsdoeleinden.
magpie-crawler
Gericht op contentaggregatie en het opbouwen van trainingsdatasets, voornamelijk voor social listening en AI.
Meta-ExternalAgent
Meta’s AI-trainingscrawler voor producten zoals Facebook, Instagram en WhatsApp. Niet te verwarren met facebookexternalhit, de linkpreview-fetcher van Meta die je niet wilt blokkeren.
Meta-ExternalFetcher
Wordt door Meta gebruikt voor het ophalen van externe content voor AI-indexering. Ook hier geldt: niet verwarren met facebookexternalhit.
MistralAI-Training
De dedicated trainingscrawler van Mistral AI, gebruikt voor het verzamelen van webcontent voor het trainen van hun open en commerciële taalmodellen.
NavuBot
Crawlt websites op verzoek van klanten om AI-modellen voor hen te trainen. Respecteert robots.txt niet.
Omgilibot / Omgili
Scrapet content van forums en discussieplatforms, voornamelijk voor marktonderzoek en AI-trainingsdatasets.
PanguBot
Gekoppeld aan Huawei’s Pangu AI-modellen. Verzamelt webdata voor de training van grote taalmodellen.
PiplBot
Verzamelt informatie voor Pipl’s personenzoekopdrachten en identiteitsverificatiediensten.
sentibot
Waarschijnlijk ingezet voor het verzamelen van data voor sentimentanalyse en AI-modeltraining.
StableDiffusionBot
Crawlt webcontent, met name afbeeldingen, voor het trainen van Stable Diffusion en andere generatieve AI-beeldmodellen.
Timpibot
Indexeert en haalt data op voor zoek- en AI-toepassingen.
TurnitinBot
Ingezet door Turnitin voor het verzamelen van content ten behoeve van plagiaatdetectie en AI-training. Blokkeren voorkomt dat je teksten in hun detectiedatabases terechtkomen.
WARDBot
Een AI-datascraper die webcontent verzamelt voor AI-training en monitoringdoeleinden.
webzio / Webzio-Extended
Crawlers van Webz.io voor het verzamelen van webdata voor contentanalyse en AI-trainingsdatasets.
YouBot
Crawler van You.com voor het verzamelen van content voor AI-gestuurde zoekopdrachten en modeltraining.
AI-zoekresultaten
Deze bots halen content op voor AI-gestuurde zoekresultaten of directe antwoorden aan gebruikers. Ze zijn standaard geblokkeerd, maar het toestaan ervan kan ervoor zorgen dat je site verschijnt in AI-zoekmachines zoals ChatGPT Search of Perplexity.
ChatGPT-User
Haalt pagina’s in realtime op wanneer een ChatGPT-gebruiker actuele informatie opvraagt. Blokkeren voorkomt dat je content wordt opgehaald voor live ChatGPT-antwoorden.
Claude-SearchBot
De indexeringscrawler van Anthropic voor de zoekfunctionaliteit van Claude. Afzonderlijk van ClaudeBot, die voor training wordt ingezet.
Claude-User
Haalt pagina’s in realtime op wanneer een Claude-gebruiker actuele informatie opvraagt. Blokkeren voorkomt dat je content wordt opgehaald voor live Claude-antwoorden. Heeft geen invloed op zoekmachine-indexering.
DuckAssistBot
De bot van DuckDuckGo voor DuckAssist, hun AI-gestuurde antwoord- en samenvattingsfunctie.
Google-Agent
Google’s user-triggered fetcher, ingezet wanneer een gebruiker Gemini of Google AI Overviews om actuele informatie vraagt. Let op: deze bot respecteert robots.txt niet. Blokkeren via robots.txt is daarom niet effectief.
Google-Extended
Google’s opt-out token voor AI-training en Gemini-producten. Blokkeren voorkomt dat je content wordt gebruikt voor Google’s AI-modellen en AI-gegenereerde samenvattingen, zonder invloed op je reguliere Google Zoeken-ranking.
GoogleOther
Een Google-crawler voor interne doeleinden zoals AI-onderzoek en training, niet voor reguliere zoekindexering. Blokkeren heeft geen invloed op je Google Zoeken-positie.
OAI-SearchBot
De indexeringscrawler van OpenAI voor ChatGPT Zoeken. Afzonderlijk van GPTBot. Door OAI-SearchBot toe te staan terwijl je GPTBot blokkeert, kun je in ChatGPT Zoeken verschijnen zonder bij te dragen aan modeltraining.
OpenAIContentCrawler
Verzamelt data specifiek voor OpenAI’s contentgerelateerde tools en retrieval-augmented generation.
Perplexity-User
Haalt pagina’s in realtime op wanneer een gebruiker een zoekopdracht indient bij Perplexity AI. Blokkeren voorkomt dat je content in Perplexity-antwoorden verschijnt.
PerplexityBot
De primaire crawler van Perplexity AI voor het opbouwen van een index voor AI-gegenereerde zoekantwoorden. Bekend om zijn hoge crawlfrequentie en focus op nieuws en gezaghebbende content. Levert geen verwijzingsverkeer naar je site.
Algemene indexering
Deze bots worden primair gebruikt voor zoekmachine-indexering of dataverzameling, maar zijn standaard toegestaan. Je kunt ze individueel blokkeren als je dat wenselijk vindt.
360Spider
Webcrawler van de zoekmachine van Qihoo 360 in China. Ook ingezet voor AI-gerelateerde dataverzameling.
AwarioRssBot
Awario’s RSS-gerichte crawler voor het monitoren van RSS-feeds op merkvermeldingen en contentupdates.
AwarioSmartBot
Awario’s primaire crawler voor brand monitoring en social listening. Verzamelt publiek beschikbare content om merkvermeldingen en online gesprekken bij te houden.
Baiduspider
De primaire webcrawler van Baidu voor indexering in Baidu Zoeken, de dominante zoekmachine in China. Voedt ook Baidu’s AI-producten. Blokkeren verwijdert je site uit Baidu Zoeken.
Bytespider
Gekoppeld aan ByteDance, het moederbedrijf van TikTok. Mogelijk ingezet voor AI- en contentgeneratietools. ByteDance heeft geen officiële documentatiepagina voor deze crawler.
FacebookBot
Gebruikt door Meta voor het indexeren van publieke content voor sociale media zoek- en ontdekkingsfuncties. Niet te verwarren met facebookexternalhit, de linkpreview-fetcher die je niet wilt blokkeren.
Grok / GrokAI / XAI / XBot
Verschillende user agent varianten gekoppeld aan xAI, het AI-bedrijf achter Grok. Worden ingezet voor dataverzameling en AI-onderzoek. xAI heeft geen officiële documentatiepagina voor deze crawlers.
PetalBot
Huawei’s webcrawler gekoppeld aan Petal Search. Gebruikt voor zoekindexering met mogelijke AI-datatoepassingen.
QualifiedBot
Crawler van Qualified, een B2B sales intelligence platform. Verzamelt webcontent voor AI-gestuurde sales- en marketingtools.
SemrushBot-SWA
Semrush’s site-auditcrawler. Gebruikt door Semrush-klanten en bureaus om websites te auditen op SEO-problemen. Blokkeren voorkomt dat derden je site via Semrush-tools kunnen auditen.
Sogou
De webcrawler van Sogou Search, een grote zoekmachine in China die nu door Tencent wordt beheerd. Ook ingezet voor AI-dataverzameling.
YandexBot
De primaire webcrawler van Yandex voor zoekindexering. Ook ingezet voor AI-toepassingen binnen Yandex-diensten. Blokkeren verwijdert je site uit Yandex Zoeken.
Voor meer informatie over hoe AI Scrape Protect werkt, bezoek de AI Scrape Protect Plugin-pagina.
“`

