Smart Document Crawler
Innerhalb von Smart Document Access können Sie den Crawler konfigurieren, um den Inhalt einer Website zu indexieren.
Der Crawler arbeitet in zwei getrennten Phasen: einer ersten Link-Navigations-Phase, die die Seitenstruktur kartiert ohne Inhalt zu extrahieren, und einer zweiten Inhaltsextraktions-Phase, die indexierte PDF-Dokumente generiert.
Aktivierung und Strukturerstellung
Wählen Sie in einem bereits erstellten Unterordner die Option Smart Crawler konfigurieren.

Aktivieren Sie den Schalter Im Unterordner aktivieren.

Wählen Sie Konfiguration hinzufügen.

Weisen Sie der Konfiguration einen Namen zu und wählen Sie Speichern.

In dieser Phase können Sie zuvor heruntergeladene Konfigurationen importieren oder vorhandene herunterladen.
Einrichten des Crawlers
Durch Auswahl von Felder bearbeiten wird die Crawler-Konfiguration geöffnet.

Allgemein
Geben Sie die Start-URL der Website im Feld Adresse ein.

Fügen Sie bei Bedarf weitere URLs unter Zusätzliche Seiten hinzu.
Navigation
Aktivieren Sie die Option Off-Site-Domains ausschließen, um die Navigation auf Links innerhalb der Hauptdomain zu beschränken.
Aktivieren Sie die Option PDF-, Doc-, Docx-Dokumente einschließen, um auch Dokumente zu navigieren, die an Webseiten angehängt sind.
Geben Sie im Feld Einzuschließende Adressen die Liste der zu navigierenden Seiten ein.
Geben Sie im Feld Auszuschließende Adressen die Liste der zu vermeidenden Seiten ein.
Sie können reguläre Ausdrücke (Regex) verwenden, um mehrere Seiten anzugeben.

Legen Sie die maximale Tiefe und die maximale Anzahl von Seiten für die Navigation fest.

Extraktion
Im Bereich Extraktion konfigurieren Sie die Regeln, die der Crawler befolgt, um Webseiten in Dokumentation umzuwandeln.
Geben Sie im Feld Filteradressen zum Einschließen die Liste der Seiten ein, die extrahiert und in Dokumentation umgewandelt werden sollen.
Die zu extrahierenden Seiten können mit den zu navigierenden Seiten übereinstimmen.
Geben Sie im Feld Filteradressen zum Ausschließen die Liste der Seiten ein, die nicht extrahiert werden sollen.

Fügen Sie voreingestellte Selektoren im Feld Elemente entfernen hinzu.
Elemente, die vor der Extraktion entfernt werden sollen, können auch manuell angegeben werden, indem ein CSS-, XPATH- oder Puppeteer-kompatibler Selektor bereitgestellt wird.

Zeitplanung
Wählen Sie Zeitplanung aktivieren und legen Sie die Crawler-Ausführungshäufigkeit fest (wöchentlich oder monatlich), konfigurieren Sie dann den Tag und die Startzeit; Sie können mehrere Wochentage oder Monatstage für die wiederholte Ausführung festlegen.

Dokumente anzeigen
Um die vom Crawler generierten PDF-Dokumente zu überprüfen, gehen Sie zurück zum Unterordner in Smart Document Access.
Die Liste der indexierten Dokumente wird im Abschnitt für den konfigurierten Unterordner verfügbar sein.
Jedes Dokument hat die URL, von der es generiert wurde, als Quelldatei zugeordnet.
