Productividad

Website Crawler Integration

Busca en la web pública y rastrea sitios web para extraer contenido para investigación e ingestión de conocimiento.

Funciones

Esta integración permite a los trabajadores:

  • Busca en la web pública información actual (resultados clasificados: título, url, fragmento)
  • Rastrea páginas individuales o sitios web completos
  • Extrae contenido de texto en formato markdown
  • Respeta las directivas de robots.txt
  • Lista de dominios permitidos por seguridad
  • Profundidad y límites de páginas configurables
  • Limitación de frecuencia para ser respetuoso con los sitios de destino

Configuración

Sigue estos pasos para conectar Website Crawler:

  1. Ve a Integraciones y haz clic en 'Agregar rastreador'
  2. Configura los dominios de host permitidos
  3. Establece los parámetros de rastreo predeterminados (profundidad, páginas máximas)
  4. Prueba el rastreador con una URL de ejemplo
  5. Asigna trabajadores para procesar el contenido rastreado

Seguridad

  • La protección SSRF bloquea el acceso a rangos de IP privados
  • Solo se pueden rastrear los dominios configurados
  • Respeta robots.txt de forma predeterminada
  • Limitado a 1 solicitud por segundo
  • Todas las operaciones de rastreo quedan registradas en auditoría

Almacenamiento de credenciales

Todas las credenciales de integración se cifran en reposo mediante cifrado AES-256-GCM. Los tokens de OAuth se renuevan automáticamente cuando es necesario.

Roles compatibles

Los siguientes roles pueden usar esta integración de forma predeterminada:

Documentación relacionada