# robots.txt — www.sensaru.com # # Grundsatzentscheidung (Matthias, 12.08.2026): KI-Crawler sind ausdruecklich # willkommen. Sichtbarkeit in KI-Antworten geht vor Zurueckhaltung beim # Trainingsdatenzugriff. # # Die Bots unten waeren durch "User-agent: * Allow: /" ohnehin schon erlaubt. # Sie stehen trotzdem einzeln da, weil ein stilles Schweigen nicht erkennen # laesst, ob wir sie gewollt hereinlassen oder nur nicht daran gedacht haben. # So ist die Absicht dokumentiert — und wer hier spaeter etwas aendert, sieht, # dass er eine Entscheidung umkehrt. # # Beim Ergaenzen neuer KI-Crawler: der User-Agent-Name muss exakt stimmen, # robots.txt kennt bei Agent-Namen keine Wildcards. # # ----------------------------------------------------------------------------- # WARUM /admin/ HIER NICHT GESPERRT IST (Entscheidung, kein Vergessen) # # Die Redaktionsmaske liegt unter /admin/ und darf nicht in den Index. Der # Ausschluss steht als in # public/admin/index.html — NICHT als Disallow-Zeile hier. Drei Gruende: # # 1. Eine robots.txt-Sperre verhindert das ABRUFEN, nicht das Indexieren. Ein # gesperrter Crawler sieht das noindex nie und kann die nackte URL trotzdem # listen. Genau diese Kombination verbietet sich dieses Projekt schon in # deploy/apache-preview.conf: "Entweder sperren oder crawlen lassen und per # noindex ausschliessen — niemals beides als einzigen Schutz." # 2. Eine Disallow-Zeile in der Gruppe "User-agent: *" wirkt NICHT fuer die 21 # namentlich gefuehrten Bots weiter unten. Nach RFC 9309 gilt je Crawler # genau die spezifischste Gruppe; wer nur oben sperrt, sperrt fuer GPTBot, # ClaudeBot, bingbot und Applebot gar nichts. Wirksam waere die Zeile erst # 22-mal wiederholt. # 3. /admin/ ist ohnehin nicht auffindbar: kein Link im gesamten Build zeigt # darauf (gemessen, 0 Treffer in 64 Seiten), und in keiner der drei # Sitemaps steht ein Eintrag dafuer. Ohne Inhalt und ohne eingehenden Link # gibt es nichts zu indexieren — hinter der Adresse liegt eine # Anmeldeschranke gegen gitit.de. # # Wer /admin/ zusaetzlich absichern will, nimmt einen X-Robots-Tag-Header im # vHost. Der wirkt fuer jede Antwort und kann in keiner Vorlage vergessen # werden — anders als ein -Tag. # ----------------------------------------------------------------------------- User-agent: * Allow: / # --- OpenAI --------------------------------------------------------------- # GPTBot indexiert und trainiert, OAI-SearchBot fuellt die ChatGPT-Suche, # ChatGPT-User holt eine Seite, wenn ein Nutzer im Chat danach fragt. User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: ChatGPT-User Allow: / # --- Anthropic ------------------------------------------------------------ User-agent: ClaudeBot Allow: / User-agent: Claude-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: anthropic-ai Allow: / # --- Google --------------------------------------------------------------- # Google-Extended ist kein Crawler, sondern der Schalter dafuer, ob die von # Googlebot geholten Inhalte fuer Gemini und die KI-Uebersichten verwendet # werden duerfen. Genau der Schalter, den diese Entscheidung meint. User-agent: Google-Extended Allow: / User-agent: Google-CloudVertexBot Allow: / # --- Perplexity ----------------------------------------------------------- User-agent: PerplexityBot Allow: / User-agent: Perplexity-User Allow: / # --- Microsoft / Bing ----------------------------------------------------- User-agent: bingbot Allow: / # --- Apple ---------------------------------------------------------------- User-agent: Applebot Allow: / User-agent: Applebot-Extended Allow: / # --- Meta ----------------------------------------------------------------- User-agent: meta-externalagent Allow: / User-agent: meta-externalfetcher Allow: / # --- Weitere -------------------------------------------------------------- User-agent: CCBot Allow: / User-agent: Amazonbot Allow: / User-agent: Bytespider Allow: / User-agent: MistralAI-User Allow: / User-agent: cohere-ai Allow: / User-agent: DuckAssistBot Allow: / Sitemap: https://www.sensaru.com/sitemap.xml # Kurzfassung der Website fuer KI-Agents: https://www.sensaru.com/llms.txt