Smart Document Crawler
Dentro de Smart Document Access, es posible configurar el crawler para la indexación de los contenidos de un sitio web.
El crawler opera en dos fases distintas: una primera fase de navegación de enlaces, que mapea la estructura del sitio sin extraer contenidos, y una segunda fase de extracción de contenidos, que genera los documentos PDF indexados.
Activación y creación de la estructura
Dentro de una subcarpeta ya creada, seleccione la opción Configurar Smart Crawler.

Active la casilla Habilitar en subcarpeta.

Seleccione Añadir configuración.

Asigne un nombre a la configuración y seleccione Guardar.

En esta fase es posible importar configuraciones previamente descargadas o descargar las ya existentes.
Configurar el Crawler
Seleccionando Editar campos se accede a la configuración del Crawler.

General
Introduzca la URL de inicio del sitio en el campo Dirección.

Introduzca otras URLs en Páginas adicionales si es necesario.
Navegación
Active la opción Excluir sitios fuera del dominio para limitar la navegación solo a los enlaces internos del dominio principal.
Active la opción Incluir documentos PDF, doc, docx si también desea navegar por los documentos adjuntos a las páginas web.
En el campo Direcciones a incluir, introduzca la lista de páginas del sitio a navegar.
En el campo Direcciones a excluir, introduzca la lista de páginas del sitio a no navegar.
Es posible utilizar expresiones regulares (regex) para indicar múltiples páginas.

Establezca la profundidad máxima y el número máximo de páginas a navegar.

Extracción
En la sección Extracción se configuran las reglas que el Crawler seguirá para transformar las páginas web en documentación.
En el campo Filtro de direcciones a incluir, introduzca la lista de páginas a extraer y convertir en documentación.
Las páginas a extraer podrían coincidir con las páginas a navegar.
En el campo Filtro de direcciones a excluir, introduzca la lista de páginas a no extraer.

Añada los selectores predefinidos en el campo Eliminar elementos.
Los elementos a eliminar antes de la extracción también pueden indicarse manualmente, especificando un selector CSS, XPATH o compatible con Puppeteer.

Planificación
Seleccione Habilitar planificación y establezca la frecuencia de ejecución del Crawler (semanal o mensual), configure el día y la hora de inicio; es posible establecer múltiples días de la semana o del mes para la ejecución repetida.

Visualización de documentos
Para verificar los documentos PDF generados por el crawler, vuelva a la subcarpeta en Smart Document Access.
La lista de documentos indexados estará disponible en la sección dedicada a la subcarpeta configurada.
Cada documento tiene asociado como Archivo fuente la URL desde la cual se generó el documento.
