Zum Inhalt springen
ceeme

Dürfen KI-Crawler meine Website lesen?

Diese Prüfung ruft Ihre robots.txt ab und liest sie wie ein Crawler: Je KI-Crawler sagt sie, ob er ausdrücklich erlaubt, nicht gesperrt oder von einer pauschalen Sperre erfasst ist. Letzteres ist das häufigste Ergebnis und zugleich das überraschendste — eine Regel, die einst für einen unerwünschten Besucher geschrieben wurde, sperrt heute die Assistenten aus, in denen Sie gefunden werden wollen.

Von Njusja Orban, Gründerin von ceeme3 Min. Lesezeit

Messen Sie Ihr Unternehmen → Lieber erst sprechen

Crawler Von wem Stand

Vereinfachte Lesung Ihrer robots.txt auf Wurzelebene. Tiefer geltende Regeln sind nicht enthalten.

Kurz gefasst

Was gelesen wird
Ihre robots.txt auf Wurzelebene, plus ob daneben eine llms.txt liegt. Sonst wird nichts abgerufen.
Die drei Ergebnisse
Ausdrücklich erlaubt, nicht gesperrt oder gesperrt. Das mittlere ist kein Halbzustand, sondern der Normalfall.
Was sie nicht sagt
Ob Sie genannt werden. Zugang ist eine Voraussetzung, kein Ergebnis — das ist eine andere Messung.

Was bedeuten die drei Ergebnisse?

Ausdrücklich erlaubt heißt, dass Ihre robots.txt diesen Crawler beim Namen nennt und hereinlässt. Nicht gesperrt heißt, dass er nirgends genannt wird und daher darf — der Normalzustand einer Website, die nie etwas eingestellt hat, und daran ist nichts falsch.

Durch eine allgemeine Regel gesperrt ist das Ergebnis, das am häufigsten überrascht: Es gibt keine Regel zu diesem Crawler, aber eine, die alles aussperrt, was nicht namentlich genannt ist. Ohne Kontext gelesen, wirkt das wie eine bewusste Entscheidung.

Wie fällt eine Website versehentlich zu?

Fast immer über einen von drei Wegen: eine Sicherheitserweiterung, die alles Unbekannte sperrt, eine robots.txt, die beim Umbau geschlossen und nie wieder geöffnet wurde, oder eine Hosting-Einstellung, die nie jemand angesehen hat.

Alle drei sind in Minuten zu beheben und alle drei kosten Monate, wenn niemand hinschaut. Deshalb ist diese Prüfung kostenlos: Sie findet das billigste Problem dieses Fachs.

Was sagt diese Prüfung nicht über meine Sichtbarkeit?

Alles, was nach dem Zugang kommt. Eine Website, die völlig offen steht und in keiner Antwort vorkommt, gibt es — und dann liegt es an dem, was außerhalb über Sie zu finden ist, nicht an dieser Datei.

Was dieses Tool tutWas es nicht tut
Liest Ihre robots.txt wie ein CrawlerSieht nur die Wurzelebene — tiefer geltende Regeln fehlen
Sagt, ob eine llms.txt auf Ihrer Domain liegtBewertet den Inhalt dieser Datei nicht
Zeigt je Crawler den aktuellen StandMisst nicht, ob dieser Crawler wirklich vorbeikommt — und erst recht nicht, ob Sie genannt werden

Häufige Fragen

Ich habe keine robots.txt. Ist das schlimm?

Nein. Keine Datei heißt, dass alles herein darf, und für Sichtbarkeit ist das der günstigste Zustand. Eine anzulegen lohnt nur, wenn Sie etwas ausschließen oder ausdrücklich festhalten wollen, was erlaubt ist — Letzteres ist sauberer und ändert praktisch nichts.

Warum muss ich hier eine E-Mail-Adresse angeben?

Weil diese Prüfung auf unserem Server läuft und nicht in Ihrem Browser: Es wird eine Adresse abgerufen, und das kostet etwas. Die E-Mail verknüpft das Ergebnis mit Ihnen, und es ist das einzige Werkzeug hier, bei dem danach gefragt wird, weil etwas außerhalb Ihres Browsers geschieht. Der robots-Generator und der Selbsttest fragen nichts, denn dort gibt es nichts abzurufen.

Weiterlesen

Kostenlos, ohne Konto und ohne Karte.