# robots.txt für Ceramics Explorer # # Kategorie-Modell (Sparring 2026-07-10 — Task #125): # # 1) Klassische Such-Bots (Google/Bing/DDG/Applebot): erlaubt. # 2) Zitierende AI-Such-Bots (Perplexity/ChatGPT-Search/ # OAI-Search/Claude-User/Meta-ExternalFetcher): erlaubt. # → holen bei User-Anfrage Live-Content und verlinken uns als # Quelle in ihrer Antwort. Echter Discovery-Kanal wie Google. # 3) Reine Trainings-Crawler (GPTBot/Google-Extended/CCBot/ # Applebot-Extended/Meta-ExternalAgent/FacebookBot/ # ClaudeBot/anthropic-ai/Bytespider/…): blockiert. # → nehmen Content, geben nichts zurück (kein Traffic, kein Link), # füttern Konkurrenz-Modelle mit unserer Kuration. # # ── (1) Klassische Such-Bots: voll erlaubt ───────────────────────────── User-Agent: Googlebot Allow: / User-Agent: Bingbot Allow: / User-Agent: DuckDuckBot Allow: / User-Agent: Slurp Allow: / User-Agent: Applebot Allow: / # ── (2) Zitierende AI-Such-Bots: erlaubt (Discovery-Kanal) ───────────── User-Agent: PerplexityBot Allow: / User-Agent: ChatGPT-User Allow: / User-Agent: OAI-SearchBot Allow: / User-Agent: Claude-User Allow: / User-Agent: Claude-SearchBot Allow: / User-Agent: Meta-ExternalFetcher Allow: / # ── (3) Reine Trainings-Crawler: blockiert ───────────────────────────── User-Agent: GPTBot Disallow: / User-Agent: Google-Extended Disallow: / User-Agent: CCBot Disallow: / User-Agent: Applebot-Extended Disallow: / User-Agent: Meta-ExternalAgent Disallow: / User-Agent: FacebookBot Disallow: / User-Agent: ClaudeBot Disallow: / User-Agent: anthropic-ai Disallow: / User-Agent: Claude-Web Disallow: / User-Agent: cohere-ai Disallow: / User-Agent: Bytespider Disallow: / User-Agent: Amazonbot Disallow: / User-Agent: ImagesiftBot Disallow: / User-Agent: Diffbot Disallow: / User-Agent: Omgilibot Disallow: / User-Agent: Omgili Disallow: / # ── Default für alle anderen: Crawl-Delay + Duplicate-Prevention ─────── # /dist/ leakt aus Plesk-Vhost-Konfig — Duplicate-Content-Bug (Task #121). # Bis Server-Rewrite steht, hier ausschließen damit Google die URLs nicht # weiter crawlt. archive/*/page-N ist Thin-Content (Task #123). User-Agent: * Crawl-Delay: 10 Disallow: /archive/*/page= Disallow: /archive/*/page- Disallow: /pagefind/ Disallow: /dist/ Sitemap: https://www.ceramicsexplorer.de/sitemap.xml