Kostenlose Tools
Sieben kostenlose Prüfungen, ohne Anmeldung
In einem Satz
Die Seite mit den kostenlosen Tools beantwortet zwei Fragen in Sekunden und ohne Konto: Stammt eine Anfrage in Ihren Zugriffsprotokollen, die sich als GPTBot, ClaudeBot, Googlebot oder ein anderer benannter Crawler ausgibt, wirklich von diesem Betreiber (geprüft gegen die IP-Bereiche, die der Betreiber veröffentlicht — verifiziert, gefälscht oder nicht prüfbar, nie nur zwei Ergebnisse), und kann eine Maschine Ihre robots.txt, Sitemap und llms.txt mit dem richtigen Inhaltstyp lesen, oder liefert ein Cache etwas aus, das Ihr Server nicht mehr erzeugt.
Geben Sie eine Domain ein. Ohne Anmeldung, nichts installiert. Kann eine Maschine Ihre Dateien lesen, ist der Crawler in Ihren Logs echt, was erlaubt Ihre robots.txt jedem KI-Agenten tatsächlich, ein erster Entwurf Ihrer llms.txt aus den Seiten, die Sie bereits veröffentlichen, wie Sie im Vergleich zu einem Wettbewerber abschneiden, woran Google in einem YouTube-Video ansetzen kann, und ob eine signierte Bot-Anfrage wirklich von dem Bot kommt, den sie nennt.
Ist Ihre Website eine davon? Kostenlos prüfen → Alle 52 Raten →
Kann eine Maschine Ihre Dateien lesen?
Vier Anfragen an die Domain, die Sie nennen: robots.txt, Sitemap, llms.txt und die Startseite, gelesen nach Inhaltstyp und Cache-Alter.
Ist der Crawler in Ihren Logs echt?
Fügen Sie rohe Zeilen aus dem Zugriffsprotokoll ein. Jede, die einen bekannten Crawler nennt, wird gegen die Adressbereiche geprüft, die dieser Betreiber tatsächlich veröffentlicht.
Diese Prüfung macht fast niemand, und sie kehrt Schlussfolgerungen um. Ein Log voller GPTBot 403-Antworten sieht aus, als würde Ihr Host OpenAI blockieren — bis Sie feststellen, dass jede davon von einer einzigen Adresse kam, die sieben verschiedene Crawler-Namen trug. Genau das haben wir auf echten Websites gemessen. Gruppieren Sie nach Adresse, bevor Sie Schlüsse ziehen.
Was erlaubt Ihre robots.txt jedem KI-Crawler?
Ein Abruf der Datei, dann wird jede benannte Antwortmaschine, jeder Suchindex und jeder Trainings-Crawler so dagegen aufgelöst, wie ein Crawler es tut: nur die eigene Gruppe, längste Übereinstimmung, bei Gleichstand gewinnt allow.
Die Regel, die alle falsch verstehen: Ein Disallow unter User-agent: * gilt nie für einen Agenten, der eine eigene Gruppe hat. Nennen Sie GPTBot irgendwo in der Datei ein einziges Mal, und jede Regel mit * gilt für ihn nicht mehr. Dies zeigt, was pro Agent auf dem gewählten Pfad tatsächlich gilt.
Eine llms.txt aus dem entwerfen, was Sie bereits veröffentlichen
Liest Ihre Startseite und bis zu 25 angegebene Seiten mit ihren eigenen Titeln und Beschreibungen und schreibt einen ersten Entwurf in der üblichen Form.
Es ist absichtlich ein Entwurf. Eine generierte Datei ist eine Linksammlung mit Titeln als Beschreibungen; der Wert der Datei liegt in der Auswahl. Kürzen Sie sie auf die Seiten, nach denen jemand einen Assistenten fragen würde, schreiben Sie die Beschreibungen selbst und liefern Sie sie dann als text/plain aus und prüfen Sie die nackte URL — die Prüfung oben zeigt Ihnen, ob sie angekommen ist.
Wie schneiden Sie im Vergleich zu einem Wettbewerber ab?
Zwei Startseiten, derselbe Scan auf beiden: jeder Abschnitt, den eine Antwortmaschine braucht, nebeneinander, mit den Befunden, die nur einer von Ihnen hat.
Ist diese signierte Bot-Anfrage echt?
Mit Web Bot Auth signiert ein Bot jede Anfrage mit einem Schlüssel, den er veröffentlicht. Geben Sie den Host des Bots ein oder fügen Sie die Header einer signierten Anfrage ein, und jeder Schritt der Prüfung wird gezeigt: das Schlüsselverzeichnis, die Signaturen darauf, der Fingerabdruck jedes Schlüssels, die abgedeckten Komponenten und das Zeitfenster.
Einen User-Agent kann jeder eintippen; eine Signatur über Ihren eigenen Hostnamen nicht. Ein Schlüssel zählt nur, wenn er das Verzeichnis signiert hat, in dem er steht, sodass eine kopierte oder bearbeitete Schlüsselliste nichts beweist. Es funktioniert für jeden signierenden Agenten, nicht nur für unseren.
Woran kann Google in Ihrem Video ansetzen?
Fügen Sie eine YouTube-URL ein: Kapitel, Art der Untertitel, Beschreibung, Sprache und Themen, jede Zeile gegen das, woran ein Suchergebnis ansetzen kann. Ganze Kanäle und die Anbindung an die Website gibt es in Watch.
Drei Ergebnisse, nie zwei
Verifiziert
Die Adresse liegt im Bereich, den der Betreiber veröffentlicht. Die Anfrage ist, was sie vorgibt zu sein.
Gefälscht
Der Betreiber veröffentlicht Bereiche, und diese Adresse liegt außerhalb aller. Jemand anderes trägt den Namen.
Nicht prüfbar
Der Betreiber veröffentlicht überhaupt keinen Feed, daher kann die Angabe weder bestätigt noch als gefälscht eingestuft werden. Amazonbot und Meta-ExternalAgent stehen dauerhaft hier.
Die nicht prüfbaren als gefälscht zu zählen, würde die Rate aufblähen; sie als echt zu zählen, würde sie unterschätzen. Deshalb teilt die Fälschungsrate nur durch verifiziert plus gefälscht, und die Antwort nennt diesen Nenner, statt Sie einen annehmen zu lassen.
Was die beiden Prüfungen finden
Die Maschinendatei-Prüfung ruft Ihre robots.txt, llms.txt und die Sitemap so ab, wie ein Crawler es tut, und liest Inhaltstyp und Inhalt, nicht nur den Status. Der Fehler, für den sie existiert: eine Bot-Sperre oder Prüfseite, die mit HTTP 200 und HTML antwortet, wo eine Textdatei stehen sollte. Jeder Uptime-Monitor nennt das gesund. Ein Validator liest es als „keine Direktiven“, was als alles erlaubt gilt — das genaue Gegenteil dessen, was Ihre Datei sagt. Wir haben erlebt, wie so jedem Crawler einschließlich Googlebot stundenlang eine Prüfseite als robots.txt geliefert wurde, am Edge zwischengespeichert. Die Prüfung braucht eine Anfrage pro Datei und meldet, was eine Maschine tatsächlich parsen würde.
Die Purge-Prüfung beantwortet eine Frage, die Ihr CDN-Dashboard nicht beantwortet: Hat der Purge, den Sie gerade ausgeführt haben, tatsächlich etwas entfernt? Sie ruft die URL vorher und nachher ohne Cache-Busting ab, vergleicht die Bytes und liest die Header age und Cache-Status. Der Fehler, für den sie existiert: eine Purge-API, die auf einer Cache-Ebene 200 zurückgibt, während eine andere Ebene — Varnish vor einem Origin oder eine Edge-Regel mit festgelegter TTL — weiter die alten Bytes liefert. Ein 200 von einem Purge-Endpunkt ist eine Aussage über den API-Aufruf, nicht über den Cache. Wir haben eine Änderung ausgeliefert, gepurgt, ein 200 bekommen, und die anonyme URL lieferte noch eine Stunde lang die alte Datei; diese Stunde ist der Grund für dieses Skript.
Wann Sie sie ausführen: nach jeder Änderung an einer Maschinendatei, nach jeder Cache- oder CDN-Konfigurationsänderung und immer dann, wenn eine Korrektur für Crawler „eigentlich“ live sein sollte. Die eine Gewohnheit, die zählt: Prüfen Sie die nackte URL von außerhalb Ihrer eigenen Sitzung, denn Ihr angemeldeter Browser ist der am wenigsten repräsentative Client Ihrer Website.
Die Skripte mitnehmen
Dieselben zwei Prüfungen für das Terminal. Es sind die, die wir selbst ausführen.
Keines davon ist ein Produkt. Es sind die Prüfungen, die in diesem Projekt echte Fehler gefunden haben, veröffentlicht, weil ein Beitrag über ein Tool, das man nicht haben kann, Werbung ist.
cachecheck.sh
Fragt, ob ein Cache ein Dokument ausliefert, das Ihr Origin nicht mehr erzeugt. Statuscodes ignoriert es völlig: Ein PURGE, der 200 zurückgibt, beweist, dass etwas geantwortet hat, nicht, dass etwas entfernt wurde. Es ruft die nackte URL und eine mit Cache-Busting ab, vergleicht sie und urteilt nicht, wenn eine der beiden Messungen eine Prüfseite ist.
Ansehen oder herunterladen → · curl -sO https://crawlcheck.io/tools/cachecheck.sh
verify.sh
Prüft, ob eine Änderung, die Sie ausgeliefert haben, tatsächlich auf der Seite ankommt, die ein Fremder erhält. Es zählt Ihr Markup außerhalb von style- und script-Tags, damit ein Klassenname in einem Stylesheet nicht als Element auf der Seite durchgeht; es ruft dreimal ab, damit alles Bedingte auffällt; und es sagt, dass es die anonyme Ansicht misst.
Ansehen oder herunterladen → · curl -sO https://crawlcheck.io/tools/verify.sh
Nutzen Sie sie, ändern Sie sie, keine Namensnennung nötig. Sie stellen keine Netzwerkanfrage außer an die URL, die Sie ihnen geben.
Soll die Prüfung zweimal täglich für Sie laufen?
Diese beiden laufen, wenn Sie daran denken. Dieselben Prüfungen nach Plan, mit einer Nachricht, sobald sich ein Ergebnis ändert, sind Monitoring. Hinterlassen Sie eine Adresse, und wir sagen Ihnen, wenn es fertig ist — kein Konto, und bis dahin wird nichts gesendet.
Eine Adresse, ein Zweck. Die Skripte oben bleiben kostenlos und brauchen nichts davon.