Base de conocimientos

Sube documentos y conecta integraciones para que los workers los consulten mediante RAG. Incluye rastreador de sitios web, sincronización automática con Notion, GitHub, Jira, RSS y más.

¿Qué es la base de conocimientos?

La base de conocimientos te permite subir documentos y conectar fuentes externas que los trabajadores pueden consultar al procesar tareas. Los trabajadores utilizan la generación aumentada por recuperación (RAG) para encontrar información relevante y citar las fuentes en sus propuestas.

La base de conocimientos admite tanto la carga manual de documentos como la incorporación automática desde integraciones conectadas, manteniendo a tus trabajadores informados con datos actualizados de toda tu organización.

Carga de documentos

Sube documentos directamente a tu base de conocimientos. Los formatos admitidos incluyen:

  • Documentos PDF
  • Archivos de texto plano (.txt)
  • Archivos Markdown (.md)
  • Documentos de Word (.docx)

Los documentos se procesan, fragmentan e indexan automáticamente mediante embeddings vectoriales para una búsqueda semántica rápida.

Fuentes de conocimiento desde integraciones

Conecta integraciones para incorporar automáticamente conocimiento desde fuentes externas. Fuentes de integración admitidas:

  • Notion: importa páginas y bases de datos de tu espacio de trabajo de Notion, incluidas las subpáginas
  • GitHub: incorpora archivos README, incidencias y pull requests de los repositorios
  • Jira: importa incidencias del proyecto con descripciones, comentarios y metadatos
  • Fuentes RSS: suscríbete a feeds RSS/Atom para mantener informados a los trabajadores sobre novedades
  • Stripe: importa el catálogo de productos, los precios y la información de clientes

Cada fuente conserva su URL externa, lo que permite a los trabajadores citar la fuente original en sus propuestas.

Rastreador de sitios web

Incorpora contenido de sitios web públicos mediante el rastreador web integrado. El rastreador descubre y procesa automáticamente páginas a partir de la URL de inicio que especifiques.

Opciones de configuración:

  • URL de inicio: la URL desde la que comenzar el rastreo
  • Dominios permitidos: restringe el rastreo a dominios específicos
  • Patrones de inclusión/exclusión: patrones de URL para incluir o excluir del rastreo
  • Máximo de páginas: número máximo de páginas a rastrear (el límite protege frente a sitios muy grandes)
  • Profundidad máxima: cuántos niveles de enlaces seguir desde la página de inicio
  • Respetar robots.txt: cumple las reglas de rastreo del sitio web (activado de forma predeterminada)
  • Límite de frecuencia: límite de solicitudes por segundo (predeterminado: 1/seg) para evitar sobrecargar los sitios de destino

El rastreador extrae el contenido legible y lo convierte a Markdown, lo que facilita que los trabajadores lo busquen y lo citen.

Programación de actualizaciones

Configura la frecuencia con la que las fuentes de conocimiento se sincronizan con sus fuentes externas:

  • Manual: solo se actualiza cuando se activa manualmente
  • Cada hora: se sincroniza cada hora para capturar actualizaciones frecuentes
  • Diaria: se sincroniza una vez al día para contenido que cambia moderadamente
  • Semanal: se sincroniza una vez por semana para contenido estable

La actualización automática la procesa el programador de tareas del sistema. Los documentos se deduplican mediante un hash de contenido para evitar la creación de entradas duplicadas innecesarias.

Acceso de los trabajadores al conocimiento

Controla qué trabajadores pueden acceder a fuentes de conocimiento específicas. De forma predeterminada, todos los trabajadores de una organización pueden buscar en toda la base de conocimientos, pero puedes restringir el acceso a trabajadores concretos por fuente.

Cuando un trabajador procesa una tarea, busca contexto en las fuentes de conocimiento relevantes. Los fragmentos recuperados se incluyen en el prompt del trabajador, y las citas hacen referencia a la URL de la fuente original cuando está disponible.

Cómo funciona

  1. Sube documentos o conecta fuentes de conocimiento desde integraciones
  2. El contenido se procesa, fragmenta e indexa mediante embeddings vectoriales
  3. Al procesar tareas, los trabajadores buscan contenido relevante
  4. El contenido recuperado se incluye en el contexto del trabajador con atribución de la fuente
  5. Los trabajadores citan las fuentes (incluidas las URL externas) en sus propuestas

Documentación relacionada