Website Crawler Integration
Doorzoek het publieke web en crawl websites om content te extraheren voor onderzoek en kennisopname.
Mogelijkheden
Met deze integratie kunnen werknemers:
- Doorzoek het publieke web naar actuele informatie (gerangschikte resultaten: titel, url, fragment)
- Crawl losse pagina's of volledige websites
- Extraheer tekstinhoud in markdown-formaat
- Respecteert robots.txt-richtlijnen
- Toegestane domeinen (allowlist) voor beveiliging
- Configureerbare diepte- en paginalimieten
- Rate limiting om respectvol te zijn richting doelsites
Instellen
Volg deze stappen om Website Crawler te verbinden:
- Ga naar Integraties en klik op 'Crawler toevoegen'
- Configureer toegestane hostdomeinen
- Stel standaard crawlparameters in (diepte, max. pagina's)
- Test de crawler met een voorbeeld-URL
- Wijs werknemers toe om gecrawlde content te verwerken
Beveiliging
- SSRF-bescherming blokkeert toegang tot private IP-bereiken
- Alleen geconfigureerde domeinen kunnen worden gecrawld
- Respecteert standaard robots.txt
- Beperkt tot 1 verzoek per seconde
- Alle crawlbewerkingen worden vastgelegd in een auditlog
Opslag van referenties
Alle integratiereferenties worden versleuteld in rust opgeslagen met AES-256-GCM-versleuteling. OAuth-tokens worden automatisch vernieuwd wanneer nodig.
Ondersteunde rollen
De volgende rollen kunnen deze integratie standaard gebruiken: