Productiviteit

Website Crawler Integration

Doorzoek het publieke web en crawl websites om content te extraheren voor onderzoek en kennisopname.

Mogelijkheden

Met deze integratie kunnen werknemers:

  • Doorzoek het publieke web naar actuele informatie (gerangschikte resultaten: titel, url, fragment)
  • Crawl losse pagina's of volledige websites
  • Extraheer tekstinhoud in markdown-formaat
  • Respecteert robots.txt-richtlijnen
  • Toegestane domeinen (allowlist) voor beveiliging
  • Configureerbare diepte- en paginalimieten
  • Rate limiting om respectvol te zijn richting doelsites

Instellen

Volg deze stappen om Website Crawler te verbinden:

  1. Ga naar Integraties en klik op 'Crawler toevoegen'
  2. Configureer toegestane hostdomeinen
  3. Stel standaard crawlparameters in (diepte, max. pagina's)
  4. Test de crawler met een voorbeeld-URL
  5. Wijs werknemers toe om gecrawlde content te verwerken

Beveiliging

  • SSRF-bescherming blokkeert toegang tot private IP-bereiken
  • Alleen geconfigureerde domeinen kunnen worden gecrawld
  • Respecteert standaard robots.txt
  • Beperkt tot 1 verzoek per seconde
  • Alle crawlbewerkingen worden vastgelegd in een auditlog

Opslag van referenties

Alle integratiereferenties worden versleuteld in rust opgeslagen met AES-256-GCM-versleuteling. OAuth-tokens worden automatisch vernieuwd wanneer nodig.

Ondersteunde rollen

De volgende rollen kunnen deze integratie standaard gebruiken:

Gerelateerde documentatie