# robots.txt fuer nexoria-systems.de # # Aufbau: zuerst die allgemeine Regel, danach je KI-Crawler ein eigener Block. # Warum ausdruecklich statt pauschal: Ein Bot wertet immer nur die eine Gruppe # aus, deren User-agent am genauesten auf ihn passt. Eine eigene Gruppe je Bot # ist damit eine unmissverstaendliche Erlaubnis und bleibt bestehen, auch wenn # ein Betreiber seine Voreinstellung fuer "User-agent: *" spaeter aendert. # Wichtig: Weil die genauere Gruppe die allgemeine vollstaendig ersetzt, muss # jeder Block das Disallow fuer /api/ wiederholen. Sonst waere /api/ fuer genau # die Bots offen, die hier ausdruecklich begruesst werden. User-agent: * Allow: / Disallow: /api/ # ── OpenAI ── # GPTBot sammelt Trainingsdaten, OAI-SearchBot indexiert fuer ChatGPT Search, # ChatGPT-User ruft auf Zuruf eines Nutzers einzelne Seiten ab. User-agent: GPTBot Allow: / Disallow: /api/ User-agent: OAI-SearchBot Allow: / Disallow: /api/ User-agent: ChatGPT-User Allow: / Disallow: /api/ # ── Anthropic ── User-agent: ClaudeBot Allow: / Disallow: /api/ User-agent: Claude-Web Allow: / Disallow: /api/ User-agent: anthropic-ai Allow: / Disallow: /api/ # ── Perplexity ── User-agent: PerplexityBot Allow: / Disallow: /api/ # ── Google ── # Google-Extended ist kein eigener Crawler. Einen HTTP-User-Agent dieses Namens # gibt es nicht, geholt wird mit den bestehenden Google-User-Agents. Der Token # hier wirkt ausschliesslich steuernd, und zwar ueber genau zwei Dinge: das # Training kuenftiger Gemini-Modelle und das Grounding, jeweils fuer Gemini Apps # und die Vertex AI API for Gemini. # # Was Google-Extended NICHT steuert, und das ist der verbreitete Irrtum: die # KI-Uebersichten und den KI-Modus in der Google-Suche. Beide sind Teil der # Suche und arbeiten auf dem normalen Suchindex, gesteuert werden sie ueber die # Googlebot-Anweisungen. Wer Google-Extended sperrt, verschwindet also NICHT aus # den KI-Uebersichten, sondern verliert nur die Verwendung in Gemini Apps und # Vertex AI. Google schreibt dazu ausdruecklich, dass Google-Extended weder die # Aufnahme in die Google-Suche beeinflusst noch ein Ranking-Signal ist. # # Fundstellen, geprueft am 25.08.2026: # Google-Extended, Abschnitt "Affected products": # https://developers.google.com/crawling/docs/crawlers-fetchers/google-common-crawlers#google-extended # Dort woertlich: "Google-Extended does not impact a site's inclusion in # Google Search nor is it used as a ranking signal in Google Search." # # KI-Funktionen der Suche: # https://developers.google.com/search/docs/appearance/ai-features # Dort woertlich: "AI is built into Search and integral to how Search # functions, which is why robots.txt directives for Googlebot is the control # for site owners to manage access to how their sites are crawled for Search." User-agent: Google-Extended Allow: / Disallow: /api/ # ── Apple ── # Applebot-Extended steuert die Verwendung in Apple Intelligence. User-agent: Applebot-Extended Allow: / Disallow: /api/ # ── Common Crawl ── # Grundlage vieler offener Datensaetze und damit indirekt vieler Modelle. User-agent: CCBot Allow: / Disallow: /api/ # ── Weitere Antwortmaschinen und Sammler ── User-agent: Bytespider Allow: / Disallow: /api/ User-agent: cohere-ai Allow: / Disallow: /api/ User-agent: Amazonbot Allow: / Disallow: /api/ User-agent: Meta-ExternalAgent Allow: / Disallow: /api/ User-agent: Diffbot Allow: / Disallow: /api/ User-agent: YouBot Allow: / Disallow: /api/ User-agent: Timpibot Allow: / Disallow: /api/ Sitemap: https://nexoria-systems.de/sitemap.xml # ── Weitere maschinenlesbare Einstiege ── # Bewusst als Kommentar. robots.txt kennt genau vier Anweisungen: User-agent, # Allow, Disallow und Sitemap (RFC 9309). Eine frei erfundene Zeile wie # "Llms: ..." wuerde von keinem Crawler ausgewertet, aber in Pruefwerkzeugen # als unbekannte Anweisung auffallen. Die Verweisung gehoert in den head der # Seiten, nicht hierher. Die vollstaendigen URLs stehen trotzdem hier, weil # robots.txt die erste Datei ist, die ein Mensch oder ein Agent aufruft. # # llms.txt: https://nexoria-systems.de/llms.txt # llms-full.txt: https://nexoria-systems.de/llms-full.txt # Atom-Feed: https://nexoria-systems.de/feed.xml