Saltar al contenido principal

Smart Document Crawler

Dentro de Smart Document Access, es posible configurar el crawler para la indexación de los contenidos de un sitio web.

El crawler opera en dos fases distintas: una primera fase de navegación de enlaces, que mapea la estructura del sitio sin extraer contenidos, y una segunda fase de extracción de contenidos, que genera los documentos PDF indexados.

Activación y creación de la estructura

Dentro de una subcarpeta ya creada, seleccione la opción Configurar Smart Crawler.

Opzione Configura Smart Crawler nella sottocartella

Active la casilla Habilitar en subcarpeta.

Spunta Abilita su sottocartella

Seleccione Añadir configuración.

Pulsante Aggiungi configurazione

Asigne un nombre a la configuración y seleccione Guardar.

Finestra di creazione configurazione crawler

información

En esta fase es posible importar configuraciones previamente descargadas o descargar las ya existentes.

Configurar el Crawler

Seleccionando Editar campos se accede a la configuración del Crawler.

Pulsante Modifica campi per accedere alla configurazione

General

Introduzca la URL de inicio del sitio en el campo Dirección.

Campo Indirizzo URL di partenza del sito

Introduzca otras URLs en Páginas adicionales si es necesario.

Active la opción Excluir sitios fuera del dominio para limitar la navegación solo a los enlaces internos del dominio principal.

Active la opción Incluir documentos PDF, doc, docx si también desea navegar por los documentos adjuntos a las páginas web.

En el campo Direcciones a incluir, introduzca la lista de páginas del sitio a navegar.

En el campo Direcciones a excluir, introduzca la lista de páginas del sitio a no navegar.

información

Es posible utilizar expresiones regulares (regex) para indicar múltiples páginas.

Campi indirizzi da includere ed escludere nella navigazione

Establezca la profundidad máxima y el número máximo de páginas a navegar.

Impostazioni profondità massima e numero massimo di pagine

Extracción

En la sección Extracción se configuran las reglas que el Crawler seguirá para transformar las páginas web en documentación.

En el campo Filtro de direcciones a incluir, introduzca la lista de páginas a extraer y convertir en documentación.

información

Las páginas a extraer podrían coincidir con las páginas a navegar.

En el campo Filtro de direcciones a excluir, introduzca la lista de páginas a no extraer.

Campi filtro indirizzi da includere ed escludere nell'estrazione

Añada los selectores predefinidos en el campo Eliminar elementos.

información

Los elementos a eliminar antes de la extracción también pueden indicarse manualmente, especificando un selector CSS, XPATH o compatible con Puppeteer.

Selettori preimpostati nel campo Rimuovi elementi

Planificación

Seleccione Habilitar planificación y establezca la frecuencia de ejecución del Crawler (semanal o mensual), configure el día y la hora de inicio; es posible establecer múltiples días de la semana o del mes para la ejecución repetida.

Impostazioni pianificazione del Crawler

Visualización de documentos

Para verificar los documentos PDF generados por el crawler, vuelva a la subcarpeta en Smart Document Access.

La lista de documentos indexados estará disponible en la sección dedicada a la subcarpeta configurada.

Cada documento tiene asociado como Archivo fuente la URL desde la cual se generó el documento.

Documenti PDF generati dal crawler nella sottocartella