API Klicken Sie auf diesen API-Button, um eine Dokumentation der POST-Request-Parameter für Crawl-Starts zu sehen.

Experten Crawl Start

Starte Crawling Job:  Sie können hier URLs angeben, die gecrawlt werden sollen und dann das Crawling starten. "Crawling" bedeutet, dass YaCy die angegebene Webseite runterlädt, alle Links extrahiert und dann den Inhalt hinter diesen Links lädt. Dies wird solange wiederholt wie unter "Crawling Tiefe" angegeben. A crawl can also be started using wget and the post arguments for this web page.

Crawl-Job

Ein Crawl-Job besteht aus einem oder mehreren Startpunkten, Crawl Limitierungen und einer Dokumenten Frischheits-Regel.

Startpunkt
Eine Start URL oder eine Liste von URLs:
(muss mit http:// https:// ftp:// smb:// file:// beginnen)
InfoDefiniere die Start-URL(s) hier. Die können mehr als eine URL angeben und diese bitte mit einer URL pro Zeile. Jede dieser URLs ist die Wurzel für einen Crawl Start. Existierende Start URLs werden immer neu geladen. Andere bereits besuchte Seiten werden als 'doppelt' aussortiert, wenn diese nicht ausdrücklich per Re-crawl Option zugelassen wurden.  
leer
Von Linkliste der URL

Von Sitemap
Von Datei (Verwende Pfad einer Datei
auf dem lokalen Dateisystem)
Indexattribute
Info Ein Crawl Ergebnis kann mit Namen getagged werden die Kandidaten für eine Kollektion Anfrage sind. These tags can be selected with the GSA interface using the 'site' operator. To use this option, the 'collection_sxt'-field must be switched on in the Solr Schema
Verwenden Sie keinen Unterstrich '_' im Collection-Namen, sondern '-' . Wenn sinnvoll, fügen Sie einen Sprachcode hinzu, z.B. 'top-100-en'.
Info Die Zeitzone ist erforderlich, wenn der Parser ein Datum in der gecrawlten Webseite erkennt. Inhalte können mit dem Modifikator on: durchsucht werden, der erfordert auch eine Zeitzone, wenn eine Abfrage gestellt wird. Um alle angegebenen Daten zu normalisieren, wird das Datum in UTC gespeichert. Um den richtigen Offset zu erhalten Daten ohne Zeitzonen nach UTC umrechnet; dieser Offset muss hier angegeben werden. Der Offset wird in Minuten angegeben; Zeitzonen-Offsets für Orte östlich von UTC müssen negativ sein; Offsets für Zonen westlich von UTC müssen positiv sein.
Crawler-Filter

Das sind Limitierungen auf den Crawl-Stacker. Die Filter werden angewandt bevor eine Webseite geladen wurde.

Indexierung
Info Dies aktiviert die Indexierung von Webseiten, die der Crawler runterlädt. Dies sollte standardmässig aktiviert sein, ausser Sie wollen den Dokumenten Cache ohne Indexierung füllen. :     :
Info Wenn aktiviert, wird der Crawler mit anderen Peers Kontakt aufnehmen und diese als Remote Indexierer für Ihren Crawl benutzen. Wenn Sie die Crawling Ergebnisse lokal benötigen, sollten Sie diese Funktion deaktivieren. Nur Senior und Principal Peers können einen remote Crawl initiieren oder erhalten. Eine YaCyNews-Nachricht wird erstellt, um alle Peers über einen globalen Crawl zu informieren, damit sie es vermeiden können, einen Crawl vom selben Startpunkt zu starten.
:

Diese Nachricht wird bei anderen Peers in der 'Anderer Peer Crawl Start' Tabelle angezeigt.
Crawling-Tiefe
Info Dies definiert, wie oft der Crawler eingebetteten Links (von Links ...) in Webseiten folgen wird. 0 bedeutet, dass nur die Seite unter "Startpunkt" dem Index zugefügt wird. 2-4 ist gut für normales Indexieren. Werte über 8 sind nicht nützlich, denn eine Suche mit Suchtiefe 8 würde ungefähr 25.600.000.000 Seiten indexieren, vielleicht sogar das ganze WWW.     auch alle verlinkten und nicht-parsbaren Dokumente
Unlimitierte Crawl Tiefe für URLs auf die folgendes zutrifft
Maximale Seiten per Domain
Info Sie können die maximale Anzahl an Seiten, die von einer einzelnen Domain gefunden und indexiert werden, mit dieser Option begrenzen. Sie können diese Option auch mit dem 'Auto-Dom-Filter' kombinieren, so dass das Limit für alle Domains mit der angegebenen Tiefe gilt. Domains ausserhalb der angegebenen Tiefe werden einfach aussortiert. :    :
Info Ein Fragezeichen ist normalerweise ein Hinweis auf eine dynamische Seite. URLs mit dynamischem Inhalt sollten normalerweise nicht gecrawlt werden. Wie auch immer, manchmal gibt es Seiten mit festem Inhalt, die nur von URLs zu erreichen sind, die ein Fragezeichen enthalten. Wenn Sie unsicher sind, aktivieren Sie diese Funktion nicht, um Crawl Schleifen zu vermeiden. Gxxg1e folgt Frames NICHT aber wir machen das in den Standardeinstellungen, um reicheren Kontant zu bekommen. 'nofollow' in den robots Metadaten kann ausser Kraft gesetzt werden. Das wirkt sich jedoch nicht auf die Einhaltung der robots.txt aus welche nie ignoriert wird. Akzeptiere URLs mit Fragezeichen ('?') im Abfrage Part:
Beachte noindex in der HTML robots Datei:
html-robots-nofollow beachten:
Medientyp-Erkennung
Info zur Medientyp-Prüfung URLs mit nicht unterstützter Dateierweiterung nicht zu laden ist schneller, aber weniger genau. Tatsächlich stimmt bei manchen Webressourcen der tatsächliche Medientyp nicht mit der Dateierweiterung der URL überein. Hier sind einige Beispiele:
Load Filter auf URLs
Info The filter is a regular expression. Beispiel: Um nur URLs zuzulassen, die das Wort 'science' enthalten, setzen Sie den Must-Match-Filter auf '.*science.*'. Sie können aber auch eine automatische Domain-Beschränkung benutzen, um eine einzelne Domain komplett zu crawlen. Attention: you can test the functionality of your regular expressions using the Regular Expression Tester within YaCy.
muss zutreffen
Auf Startdomain(s) beschränken
Auf Sub-Pfad(e) beschränken
Filter nutzen (darf nicht leer sein)
darf nicht zutreffen
Ladefilter auf URL-Ursprung von Links
Info The filter is a regular expression. Beispiel: Um nur Links von Seiten der Domain example.org zu laden, setzen Sie den Must-Match-Filter auf '.*example.org.*'. Attention: you can test the functionality of your regular expressions using the Regular Expression Tester within YaCy.
muss zutreffen (darf nicht leer sein)
darf nicht zutreffen
Ladefilter auf IPs
muss zutreffen (darf nicht leer sein)
darf nicht zutreffen
Info Crawls können auf bestimmte Länder beschränkt werden. Dafür wird der Ländercode verwendet, der aus der IP des Servers berechnet wird welcher die Seite hostet. Der Filter ist kein regulärer Ausdruck aber eine Liste mit Ländercodes und Komma als Trennzeichen. keine Einschränkung anhand von Ländercodes
Filter nutzen  
Dokument-Filter

Das sind Limitierungen auf den Index-Feeder. Die Filter werden angewandt wenn eine Webseite geladen wurde.

Filter auf URLs
Info The filter is a regular expression der auf die URLs nicht zutreffen darf, damit der Inhalt der URL indexiert werden darf. Attention: you can test the functionality of your regular expressions using the Regular Expression Tester within YaCy.
muss zutreffen (darf nicht leer sein)
darf nicht zutreffen
No Indexierung when Canonical present and Canonical != URL
Filter auf Dokumentinhalt
(gesamter sichtbarer Text, einschließlich Camel-Case-tokenisierter URL und Titel)
muss zutreffen (darf nicht leer sein)
darf nicht zutreffen
Filter auf Dokument-Medientyp (auch MIME-Type)
Info zum Medientyp-Filter The filter is a regular expression der mit dem Dokument-Medientyp (auch MIME-Type) übereinstimmen muss, damit die URL indexiert werden darf. Standard Media Types are described at the IANA registry. Attention: you can test the functionality of your regular expressions using the Regular Expression Tester within YaCy.
muss zutreffen
darf nicht zutreffen
Solr query filter on any active indexed field(s)
Info zum Solr-Abfragefilter Jedes geparste Dokument wird gegen die angegebene Solr-Abfrage geprüft, bevor es dem Index hinzugefügt wird. The query must be written in respect to the standard Solr query syntax.
muss zutreffen
darf nicht zutreffen
Inhaltsfilter

Das sind Einschränkungen für Teile eines Dokuments. Der Filter wird angewendet, nachdem eine Webseite geladen wurde. Sie können wählen:

Standardmäßig auswerten
Verwenden all words in document by default until a CSS class as listed below appears; then ignore all
Standardmäßig ignorieren
Standardmäßig alle Wörter im Dokument ignorieren, bis eine unten aufgeführte CSS-Klasse erscheint; dann alle auswerten
div- oder nav-Klassennamen filtern
Kommagetrennte Liste von <div>- oder <nav>-Klassennamen, die entsprechend dem obigen Schalter heraus- oder hineingefiltert werden sollen.
Aufräumen vor dem Crawl Start
Cache der Suchereignisse aufräumen info Aktivieren Sie diese Option, um frische Suchergebnisse einschließlich neu gecrawlter Dokumente zu erhalten. Beachten Sie, dass dadurch auch eine aktuell vom Browser angeforderte Aktualisierung oder Neusortierung der Suchergebnisse unterbrochen wird.
Kein Löschen
Info Nachdem ein Crawl abgeschlossen wurde, werden Dokumenten ebenfalls überfällig und eventuell werden diese auch auf dem Ziel-Host gelöscht. Um diese alten Dateien aus dem Suchindex zu entfernen ist es nicht ausreichend sie für einen erneutes Laden vorzusehen - aber es kann notwending sein diese ebenfalls zu Löschen weil sie ganz einfach nicht mehr existieren. Verwendung in Kombination mit Re-Crawl während diese Zeit länger sein sollte. Lösche keine Dokumente bevor der Crawl gestartet wird.
Unterpfad löschen
Lösche alle Dokumente (im angegebenen Unterpfad) für jeden Host in der URL Startliste von diesem Host.
Nur alte löschen
Behandle Dokumente die zuvor geladen wurden als veraltet behandeln und vor dem Start des Crawls löschen.
Dubletten Check Regeln
Keine Dubletten
Info Ein Web-Crawl führt für alle im Internet gefundenen Links eine Dublettenprüfung gegen die interne Datenbank durch. Wenn dieselbe URL erneut gefunden wird, wird die URL als Dublette behandelt wenn die 'Keine Doubletten' Option ausgewählt wurde. Eine URL kann noch einmal geladen werden wenn sie ein bestimmtes Alter erreicht hat. Um diese Option zu verwenden bitte die Option "Neu Laden" markieren. Lade nie eine Seite die schon bekannt ist. Nur die Start-URL kann erneut geladen werden.
Neu laden
Behandle Dokumente die zuvor geladen wurden als veraltet behandeln und erneut laden. Wenn sie jünger sind, werden sie ignoriert.
Dokumenten-Cache
Info Diese Option ist standardmäßig beim Proxy aktiviert, wird aber zum reinen Crawlen nicht gebraucht.
Info Die Caching Regeln legen fest wann der Cache während des Crawlen verwendet wird: kein Cache: never use the cache, all content from fresh internet source; bei frischem Cache Hit: use the cache if the cache exists and is fresh using the proxy-fresh rules; bei Cache Hit: use the cache if the cache exist. Do no check freshness. Otherwise use online source; nur Cache: never go online, use all content from cache. If no cache exist, treat content as unavailable kein Cache    bei frischem Cache Hit    bei Cache Hit    nur Cache
Robot Verhalten
Info Da YaCy als Ersatz für kommerzielle Search Appliances verwendet werden kann (wie z.B. die GSA) der Benutzer muss alle Webseiten die solchen kommerziellen Platformen verfügbar sind crawlen können. Diese Option nicht zu haben könnte ein starkes Handicap für die professionelle Nutzung dieser Software darstellen. Darum können Sie hier alternative User-Agents auswählen, die verschiedene Crawl-Timings haben, sich mit einem anderen User-Agent ausweisen und die jeweiligen robots-Regeln anwenden.