Zum Hauptinhalt springen

Smart Document Crawler

Innerhalb von Smart Document Access können Sie den Crawler konfigurieren, um den Inhalt einer Website zu indexieren.

Der Crawler arbeitet in zwei getrennten Phasen: einer ersten Link-Navigations-Phase, die die Seitenstruktur kartiert ohne Inhalt zu extrahieren, und einer zweiten Inhaltsextraktions-Phase, die indexierte PDF-Dokumente generiert.

Aktivierung und Strukturerstellung

Wählen Sie in einem bereits erstellten Unterordner die Option Smart Crawler konfigurieren.

Opzione Configura Smart Crawler nella sottocartella

Aktivieren Sie den Schalter Im Unterordner aktivieren.

Spunta Abilita su sottocartella

Wählen Sie Konfiguration hinzufügen.

Pulsante Aggiungi configurazione

Weisen Sie der Konfiguration einen Namen zu und wählen Sie Speichern.

Finestra di creazione configurazione crawler

Info

In dieser Phase können Sie zuvor heruntergeladene Konfigurationen importieren oder vorhandene herunterladen.

Einrichten des Crawlers

Durch Auswahl von Felder bearbeiten wird die Crawler-Konfiguration geöffnet.

Pulsante Modifica campi per accedere alla configurazione

Allgemein

Geben Sie die Start-URL der Website im Feld Adresse ein.

Campo Indirizzo URL di partenza del sito

Fügen Sie bei Bedarf weitere URLs unter Zusätzliche Seiten hinzu.

Aktivieren Sie die Option Off-Site-Domains ausschließen, um die Navigation auf Links innerhalb der Hauptdomain zu beschränken.

Aktivieren Sie die Option PDF-, Doc-, Docx-Dokumente einschließen, um auch Dokumente zu navigieren, die an Webseiten angehängt sind.

Geben Sie im Feld Einzuschließende Adressen die Liste der zu navigierenden Seiten ein.

Geben Sie im Feld Auszuschließende Adressen die Liste der zu vermeidenden Seiten ein.

Info

Sie können reguläre Ausdrücke (Regex) verwenden, um mehrere Seiten anzugeben.

Campi indirizzi da includere ed escludere nella navigazione

Legen Sie die maximale Tiefe und die maximale Anzahl von Seiten für die Navigation fest.

Impostazioni profondità massima e numero massimo di pagine

Extraktion

Im Bereich Extraktion konfigurieren Sie die Regeln, die der Crawler befolgt, um Webseiten in Dokumentation umzuwandeln.

Geben Sie im Feld Filteradressen zum Einschließen die Liste der Seiten ein, die extrahiert und in Dokumentation umgewandelt werden sollen.

Info

Die zu extrahierenden Seiten können mit den zu navigierenden Seiten übereinstimmen.

Geben Sie im Feld Filteradressen zum Ausschließen die Liste der Seiten ein, die nicht extrahiert werden sollen.

Campi filtro indirizzi da includere ed escludere nell'estrazione

Fügen Sie voreingestellte Selektoren im Feld Elemente entfernen hinzu.

Info

Elemente, die vor der Extraktion entfernt werden sollen, können auch manuell angegeben werden, indem ein CSS-, XPATH- oder Puppeteer-kompatibler Selektor bereitgestellt wird.

Selettori preimpostati nel campo Rimuovi elementi

Zeitplanung

Wählen Sie Zeitplanung aktivieren und legen Sie die Crawler-Ausführungshäufigkeit fest (wöchentlich oder monatlich), konfigurieren Sie dann den Tag und die Startzeit; Sie können mehrere Wochentage oder Monatstage für die wiederholte Ausführung festlegen.

Impostazioni pianificazione del Crawler

Dokumente anzeigen

Um die vom Crawler generierten PDF-Dokumente zu überprüfen, gehen Sie zurück zum Unterordner in Smart Document Access.

Die Liste der indexierten Dokumente wird im Abschnitt für den konfigurierten Unterordner verfügbar sein.

Jedes Dokument hat die URL, von der es generiert wurde, als Quelldatei zugeordnet.

Documenti PDF generati dal crawler nella sottocartella