Site-Crawling

Seiten Crawler:  Downloaden aller Webseiten von einer gegebenen Domain oder Basis URL.

Site-Crawl starten
Start-URL (muss beginnen mit
http:// https:// ftp:// smb:// file://)

leer
Link Liste der URL
Sitemap-URL

Lade alle Dateien in der Domäne
Lade nur Dateien in einem Unterpfad der angegebenen URL
nicht mehr als Dokumente

Hinweise

  • Crawl-Geschwindigkeitsbegrenzung

    Um die Last auf dem Zielserver zu begrenzen, werden nicht mehr als vier Seiten vom selben Host in einer Sekunde geladen (nicht mehr als 120 Dokumente pro Minute).
  • Ziel-Balancer

    Ein zweiter Crawl für einen anderen Host erhöht den Durchsatz auf ein Maximum von 240 Dokumenten pro Minute weil der der Crawler Balancer die Last über alle Hosts verteilt.
  • Hochgeschwindigkeits-Crawling

    Ein 'oberflächlicher Crawl' der nicht auf einen einzelnen Host (oder eine Seite) limitiert ist kann die Anzahl der Seiten pro Minute (ppm) auf unendlich viele Dokumente pro Minute erweitern wenn die Anzahl der Ziel Hosts hoch ist. This can be done using the Expert Crawl Start servlet.
  • Scheduler-Steuerung

    The scheduler on crawls can be changed or removed using Automation.