Website Crawler Integration
Busca en la web pública y rastrea sitios web para extraer contenido para investigación e ingestión de conocimiento.
Funciones
Esta integración permite a los trabajadores:
- Busca en la web pública información actual (resultados clasificados: título, url, fragmento)
- Rastrea páginas individuales o sitios web completos
- Extrae contenido de texto en formato markdown
- Respeta las directivas de robots.txt
- Lista de dominios permitidos por seguridad
- Profundidad y límites de páginas configurables
- Limitación de frecuencia para ser respetuoso con los sitios de destino
Configuración
Sigue estos pasos para conectar Website Crawler:
- Ve a Integraciones y haz clic en 'Agregar rastreador'
- Configura los dominios de host permitidos
- Establece los parámetros de rastreo predeterminados (profundidad, páginas máximas)
- Prueba el rastreador con una URL de ejemplo
- Asigna trabajadores para procesar el contenido rastreado
Seguridad
- La protección SSRF bloquea el acceso a rangos de IP privados
- Solo se pueden rastrear los dominios configurados
- Respeta robots.txt de forma predeterminada
- Limitado a 1 solicitud por segundo
- Todas las operaciones de rastreo quedan registradas en auditoría
Almacenamiento de credenciales
Todas las credenciales de integración se cifran en reposo mediante cifrado AES-256-GCM. Los tokens de OAuth se renuevan automáticamente cuando es necesario.
Roles compatibles
Los siguientes roles pueden usar esta integración de forma predeterminada: