Aller au contenu principal

Smart Document Crawler

Dans Smart Document Access, vous pouvez configurer le crawler pour indexer le contenu d'un site web.

Le crawler fonctionne en deux phases distinctes : une première phase de navigation des liens, qui cartographie la structure du site sans extraire le contenu, et une seconde phase d'extraction du contenu, qui génère des documents PDF indexés.

Activation et création de la structure

Dans un sous-dossier déjà créé, sélectionnez l'option Configurer Smart Crawler.

Opzione Configura Smart Crawler nella sottocartella

Activez l'option Activer sur le sous-dossier.

Spunta Abilita su sottocartella

Sélectionnez Ajouter une configuration.

Pulsante Aggiungi configurazione

Attribuez un nom à la configuration et sélectionnez Enregistrer.

Finestra di creazione configurazione crawler

info

À ce stade, vous pouvez importer des configurations téléchargées précédemment ou télécharger celles déjà existantes.

Configuration du Crawler

Sélectionnez Modifier les champs pour accéder à la configuration du Crawler.

Pulsante Modifica campi per accedere alla configurazione

Général

Saisissez l'URL de départ du site dans le champ Adresse.

Campo Indirizzo URL di partenza del sito

Ajoutez d'autres URL dans Pages supplémentaires si nécessaire.

Activez l'option Exclure les sites hors domaine pour limiter la navigation aux seuls liens internes au domaine principal.

Activez l'option Inclure les documents PDF, doc, docx pour naviguer également dans les documents attachés aux pages web.

Dans le champ Adresses à inclure, saisissez la liste des pages à naviguer.

Dans le champ Adresses à exclure, saisissez la liste des pages à éviter.

info

Vous pouvez utiliser des expressions régulières (regex) pour spécifier plusieurs pages.

Campi indirizzi da includere ed escludere nella navigazione

Définissez la profondeur maximale et le nombre maximum de pages à naviguer.

Impostazioni profondità massima e numero massimo di pagine

Extraction

Dans la section Extraction, vous configurez les règles que le Crawler suivra pour transformer les pages web en documentation.

Dans le champ Filtrer les adresses à inclure, saisissez la liste des pages à extraire et à convertir en documentation.

info

Les pages à extraire peuvent coïncider avec les pages à naviguer.

Dans le champ Filtrer les adresses à exclure, saisissez la liste des pages à ne pas extraire.

Campi filtro indirizzi da includere ed escludere nell'estrazione

Ajoutez des sélecteurs prédéfinis dans le champ Supprimer les éléments.

info

Les éléments à supprimer avant l'extraction peuvent également être spécifiés manuellement, en fournissant un sélecteur CSS, XPATH ou compatible avec Puppeteer.

Selettori preimpostati nel campo Rimuovi elementi

Planification

Sélectionnez Activer la planification et définissez la fréquence d'exécution du Crawler (hebdomadaire ou mensuelle), puis configurez le jour et l'heure de démarrage ; vous pouvez définir plusieurs jours de la semaine ou du mois pour une exécution répétée.

Impostazioni pianificazione del Crawler

Visualisation des documents

Pour vérifier les documents PDF générés par le crawler, revenez au sous-dossier dans Smart Document Access.

La liste des documents indexés sera disponible dans la section dédiée au sous-dossier configuré.

Chaque document a comme Fichier source l'URL à partir de laquelle il a été généré.

Documenti PDF generati dal crawler nella sottocartella