Smart Document Crawler
Dans Smart Document Access, vous pouvez configurer le crawler pour indexer le contenu d'un site web.
Le crawler fonctionne en deux phases distinctes : une première phase de navigation des liens, qui cartographie la structure du site sans extraire le contenu, et une seconde phase d'extraction du contenu, qui génère des documents PDF indexés.
Activation et création de la structure
Dans un sous-dossier déjà créé, sélectionnez l'option Configurer Smart Crawler.

Activez l'option Activer sur le sous-dossier.

Sélectionnez Ajouter une configuration.

Attribuez un nom à la configuration et sélectionnez Enregistrer.

À ce stade, vous pouvez importer des configurations téléchargées précédemment ou télécharger celles déjà existantes.
Configuration du Crawler
Sélectionnez Modifier les champs pour accéder à la configuration du Crawler.

Général
Saisissez l'URL de départ du site dans le champ Adresse.

Ajoutez d'autres URL dans Pages supplémentaires si nécessaire.
Navigation
Activez l'option Exclure les sites hors domaine pour limiter la navigation aux seuls liens internes au domaine principal.
Activez l'option Inclure les documents PDF, doc, docx pour naviguer également dans les documents attachés aux pages web.
Dans le champ Adresses à inclure, saisissez la liste des pages à naviguer.
Dans le champ Adresses à exclure, saisissez la liste des pages à éviter.
Vous pouvez utiliser des expressions régulières (regex) pour spécifier plusieurs pages.

Définissez la profondeur maximale et le nombre maximum de pages à naviguer.

Extraction
Dans la section Extraction, vous configurez les règles que le Crawler suivra pour transformer les pages web en documentation.
Dans le champ Filtrer les adresses à inclure, saisissez la liste des pages à extraire et à convertir en documentation.
Les pages à extraire peuvent coïncider avec les pages à naviguer.
Dans le champ Filtrer les adresses à exclure, saisissez la liste des pages à ne pas extraire.

Ajoutez des sélecteurs prédéfinis dans le champ Supprimer les éléments.
Les éléments à supprimer avant l'extraction peuvent également être spécifiés manuellement, en fournissant un sélecteur CSS, XPATH ou compatible avec Puppeteer.

Planification
Sélectionnez Activer la planification et définissez la fréquence d'exécution du Crawler (hebdomadaire ou mensuelle), puis configurez le jour et l'heure de démarrage ; vous pouvez définir plusieurs jours de la semaine ou du mois pour une exécution répétée.

Visualisation des documents
Pour vérifier les documents PDF générés par le crawler, revenez au sous-dossier dans Smart Document Access.
La liste des documents indexés sera disponible dans la section dédiée au sous-dossier configuré.
Chaque document a comme Fichier source l'URL à partir de laquelle il a été généré.
