Zum Inhalt
GlobalNet
Strategies

KI-Governance · LOG / 733

Cloudflare Disallow AI Training: Suche behalten, KI-Training ablehnen

Cloudflare trennt Suchindexierung, KI-Training und Agenten. Was Unternehmen jetzt konfigurieren, dokumentieren und bei Applebot, Googlebot und Bingbot gesondert prüfen sollten.

Cloudflare löst einen echten Zielkonflikt

Unternehmen wollen mit ihren Websites in Suchmaschinen auffindbar bleiben, aber Inhalte nicht automatisch für das Training von KI-Modellen freigeben. Bei gemischt genutzten Crawlern war beides schwer zu trennen: Derselbe Bot konnte Seiten sowohl für die Suche als auch für Trainingszwecke abrufen. Wer ihn vollständig blockierte, riskierte deshalb auch Reichweite in klassischen Suchergebnissen.

Cloudflare führt dafür die Einstellung „Disallow AI Training“ ein. Sie veröffentlicht über Bot Preference Sync eine passende No-Training-Präferenz in der robots.txt. Als „Accountable“ eingestufte gemischt genutzte Crawler dürfen weiterhin für die Suche zugreifen. Andere Trainingscrawler, darunter getrennte Training-Crawler von Amazon, Anthropic, Meta und OpenAI, werden laut Cloudflare blockiert, ohne deren separate Suchcrawler zu treffen.

Was sich seit dem 15. September geändert hat

Cloudflare ordnet Bot-Aktivitäten nun drei Verhaltensklassen zu: Search für den Aufbau eines Suchindex, Training für Training oder Fine-Tuning eines Modells und Agent für nutzergesteuerte Abrufe, etwa durch Chat- oder Browser-Agenten. Ein einzelner Bot kann mehr als einer Klasse angehören. Die neue Trennung ist deshalb nicht nur eine neue Schaltfläche, sondern eine Änderung der bisherigen Regelwirkung.

„Block“ und „Block on pages with ads“ gelten nun auch für gemischt genutzte Crawler wie Applebot, Bingbot und Googlebot. Wer diese Optionen im Training-Bereich auswählt, kann damit Suchzugriffe beeinträchtigen. Cloudflare empfiehlt für das Ziel „Training ablehnen, Suche behalten“ ausdrücklich „Disallow AI Training“. Bestehende Einstellungen werden grundsätzlich migriert; trotzdem sollte jedes Unternehmen das Ergebnis für seine Domains kontrollieren.

Zugleich werden „Block AI Bots“ zugunsten der granularen Kontrollen sowie Managed Robots.txt zugunsten von Bot Preference Sync abgelöst. Für neue werbefinanzierte Domains empfiehlt Cloudflare in seiner Voreinstellung Search auf Allow, Training auf Disallow AI Training und Agent auf Block on pages with ads. Das ist eine Anbieterempfehlung, keine universelle Vorgabe: Ein Online-Shop, ein Fachverlag und eine Support-Dokumentation können unterschiedliche Geschäftsziele haben.

Konfigurationsmatrix für Website-Verantwortliche

  • Suche wichtig, Training unerwünscht: Search auf Allow und Training auf Disallow AI Training setzen; Agent separat nach Geschäftsmodell entscheiden.
  • Alle gemischt genutzten Crawler vollständig ausschließen: Block wählen und den möglichen Verlust von Suchindexierung bewusst akzeptieren.
  • Werbefinanzierte Seiten schützen: Block on pages with ads kann Crawler nur auf erkannten Anzeigenseiten sperren; eine entsprechende Disallow-Präferenz lässt sich laut Cloudflare nicht sinnvoll in robots.txt abbilden.
  • Agentenzugriffe steuern: nicht aus der Training-Einstellung ableiten. Für Agenten gibt es derzeit keine gleichartige Disallow-Option, weil ein etablierter Standard fehlt.
  • KI-Zusammenfassungen steuern: als eigenen Governance-Bereich behandeln; ein Trainings-Opt-out verhindert nicht automatisch, dass Inhalte in generativen Suchzusammenfassungen erscheinen.

Die wirtschaftliche Entscheidung sollte dem Wertstrom folgen. Publisher mit Werbe- oder Abo-Modell schützen eher Reichweite, Originalinhalte und direkte Besuche. Händler oder B2B-Anbieter können dagegen weniger, aber kaufbereitere Besucher akzeptieren. Daraus folgt: Der richtige Schalter ist kein rein technisches Detail, sondern Teil der Content-, Vertriebs- und Datenstrategie.

Apple, Google und Microsoft nicht gleich behandeln

Cloudflare bezeichnet Applebot, Googlebot und Bingbot als Accountable. Das Label umfasst nach Cloudflares Definition sowohl bereits vorhandene Funktionen als auch zeitgebundene Zusagen. Deshalb darf es nicht als Beleg verstanden werden, dass jeder Mechanismus bei allen drei Anbietern heute identisch funktioniert.

Für Apple nennt Cloudflare Applebot-Extended als robots.txt-Kennung für den Trainingsausschluss. Bei Google erfüllt Google-Extended diese Rolle; Cloudflare verweist außerdem auf Anbieterfunktionen für generative Suchergebnisse und Reporting. Beide Anbieter hätten erklärt, dass der Trainingsausschluss das klassische Suchranking nicht beeinflusst.

Bei Microsoft besteht eine wichtige Übergangslücke. Bing unterstützt laut Cloudflare derzeit NOARCHIVE und Werkzeuge in den Bing Webmaster Tools. Die Unterstützung einer domainweiten No-Training-Präferenz über robots.txt ist für Anfang 2027 angekündigt. Bis dahin übermittelt „Disallow AI Training“ den Wunsch an Bing nicht automatisch. Wer Bing-Training heute ablehnen will, muss die von Microsoft angebotenen Zusatzkontrollen gesondert prüfen und dokumentieren.

Rollout-Checkliste ohne SEO-Blindflug

  1. Ziele festlegen: für Search, Training, Agent und KI-Zusammenfassungen jeweils erlaubte und unerwünschte Nutzung definieren.
  2. Ist-Zustand sichern: aktuelle Cloudflare-Regeln, robots.txt, Meta-Tags, WAF-Regeln und Anbieterportale pro Domain dokumentieren.
  3. Migration prüfen: kontrollieren, welche alten Block-AI- oder granularen Einstellungen Cloudflare tatsächlich übernommen hat.
  4. Test-Domain verwenden: neue Regeln zuerst auf einer weniger kritischen Zone oder begrenzten Domain aktivieren.
  5. Crawler-Ergebnis verifizieren: robots.txt-Ausgabe, Cloudflare-Protokolle, Search-Console- und Webmaster-Berichte sowie Crawl-Fehler beobachten.
  6. Bing separat behandeln: NOARCHIVE und die passenden Webmaster-Werkzeuge prüfen, bis die angekündigte robots.txt-Unterstützung verfügbar ist.
  7. Rollback definieren: Verantwortliche, vorherige Konfiguration und Schwellenwerte für Sichtbarkeits- oder Indexierungsverluste festhalten.

Für den Betrieb reichen einmalige Screenshots nicht aus. Sinnvolle Kennzahlen sind indexierte Seiten, organische Impressionen, Crawl-Fehler, blockierte Trainingsanfragen und Änderungen beim Referral-Traffic. Abweichungen sollten nicht vorschnell einer einzelnen Einstellung zugeschrieben werden; Suchindizes reagieren zeitversetzt und parallel können Inhalte, technische Fehler oder Algorithmusänderungen wirken.

Was noch nicht gelöst ist

Eine robots.txt-Präferenz ist kein universeller technischer Zwang. Cloudflare ergänzt sie deshalb nach eigener Darstellung um Identifikation, Klassifizierung und Blockierung nicht konformer Trainingscrawler auf Netzwerkebene. Trotzdem bleiben Erkennung, korrekte Bot-Identität und die Zusagen externer Betreiber Abhängigkeiten. Die Maßnahme reduziert ein Governance-Risiko, beseitigt es aber nicht vollständig.

Auch KI-Zusammenfassungen bleiben getrennt. Cloudflare plant für Anfang 2027 granularere Kontrollen darüber, wie viel Inhalt in solchen Zusammenfassungen verwendet werden darf. Bis diese Funktionen verfügbar und überprüfbar sind, sollten Unternehmen vorhandene Anbieteroptionen, Meta-Tags und eigene Traffic-Auswertungen nutzen. Angekündigte Funktionen gehören in eine Roadmap, nicht in eine heutige Kontrollbehauptung.

Fazit: vier Nutzungszwecke, vier bewusste Entscheidungen

Cloudflare Disallow AI Training ist für viele Unternehmen der sinnvollste Mittelweg: klassische Suche bleibt erreichbar, während Training abgelehnt oder nicht konforme Trainingscrawler blockiert werden. Der entscheidende Mehrwert liegt in der Trennung der Zwecke. Wer Search, Training, Agenten und KI-Zusammenfassungen einzeln bewertet, schützt Inhalte, ohne versehentlich Reichweite zu opfern. Vor dem Rollout gehören jedoch Migration, Bing-Sonderfall, Monitoring und Rollback sauber in den Betriebsprozess.

Quelle

  1. Have it both ways: stay discoverable in search while disallowing AI training