# ═══════════════════════════════════════════════════════════════ # DERASPOL s.r.o.© — robots.txt # Web: https://www.deratizace-deraspol.cz # Soubor: robots.txt # Verze: 3.20 — aktualizováno 2026-09-13 # # ── ZMĚNY v3.20 oproti v3.19 — STRATEGICKÝ OBRAT: AI VIDITELNOST ── # # [ROB-38] ZÁMĚRNÁ ZMĚNA POLITIKY vůči AI agentům. # Cíl firmy: dosažení POZICE #1 v ORGANICKÉM i PŘÍMÉM # (AI) vyhledávání. Předchozí verze (v3.19 a starší) # blokovaly VŠECHNY AI crawlery bez rozdílu — což je # v přímém rozporu s tímto cílem, protože AI answer # enginy (ChatGPT, Claude, Perplexity, Gemini, Grok, # DeepSeek, Mistral...) NEMOHOU doporučit firmu, kterou # nemají dovoleno navštívit a přečíst. # # Boti byli rozděleni do dvou kategorií: # A) AI ANSWER ENGINES — živé produkty, kde uživatel # klade dotaz a bot může firmu DOPORUČIT → POVOLENO # B) ČISTÍ DATA SCRAPEŘI — bez vlastního search/answer # produktu, pouze trénovací/agregační využití → # BLOKACE ZACHOVÁNA (nulový přínos pro cíl #1) # # Nově povoleno (přesunuto z Disallow do Allow): # GPTBot, ChatGPT-User, OAI-SearchBot, anthropic-ai, # Claude-Web, ClaudeBot, Claude-SearchBot, PerplexityBot, # Gemini-Extended, Meta-ExternalAgent, Meta-ExternalFetcher, # FacebookBot, YouBot, Grok, xAI, MistralBot, DeepSeekBot, # Applebot-Extended, Amazonbot, PetalBot # # Přeřazeno z AI blacklistu do sekce ORGANICKÉ VYHLEDÁVAČE # (byl chybně zařazen mezi "AI scrapery", ačkoli je to # klasický organický vyhledávač): # YandexBot → nyní v sekci ORGANICKÉ VYHLEDÁVAČE # # Zůstává blokováno (bez vlastního search produktu): # CCBot, cohere-ai, Bytespider, Diffbot, ImagesiftBot, # omgili, omgilibot, Timpibot, NaverBot, AI2Bot, # TurnitinBot, Kangaroo Bot # # SEO nástroje (Semrush, Ahrefs, MJ12bot...) — BEZE ZMĚNY, # nesouvisí s cílem #1 pozice, jde o konkurenční analýzu. # # SYNCHRONIZACE: .htaccess povýšen na v28.0 [FIX-73] — # odpovídající boti odstraněni z UA blacklistu (sekce E) # a přidáni do nové sekce AI ANSWER ENGINES BYPASS. # # ── ZMĚNY v3.19 a starší (historie, zachováno pro transparentnost) ── # # [ROB-37] Opraven verzní drift: sitemap-faq.xml v1.5 → v1.4 # (ground truth: obsah souboru sitemap-faq.xml) # [ROB-36] Claude-SearchBot přidán do AI scraperů (historicky; # v3.20 přeřazen do POVOLENO, viz ROB-38) # [ROB-35] Upřesněno: robots.txt nemůže ovlivnit ani diagnostikovat # HTTP 401 — zdroj leží mimo dosah crawl direktiv # [ROB-34] Opraveny neexistující tagy [SEC-21]/[FIX-36] na skutečný # stav .htaccess (sekce GOOGLEBOT BYPASS, [FIX-70]) # [ROB-33] Stack synchronizace: .htaccess, sw.js, site.webmanifest # [ROB-29..32] Verzní synchronizace sw.js/.htaccess/sitemap # [ROB-25..28] Fyzické adresáře, sitemap-lokality.xml smazáno # [ROB-20..24] Audit Allow/Disallow vs. sitemap # [ROB-13..19] Odregistrace sitemap-lokality.xml, verzní drift # [ROB-04..12] Základní struktura, AI crawleři, SEO nástroje # # POZNÁMKA k /gdpr/: # Disallow: /gdpr/ = správný slug (fyzicky existuje na serveru # dle adresářového výpisu: /www/gdpr/index.html ✓). # /ochrana-osobnich-udaju/ fyzicky NEEXISTUJE — slug /gdpr/ ✓ # image:license NAPŘÍČ VŠEMI sitemapami webu používá HOMEPAGE URL # (https://www.deratizace-deraspol.cz/), NIKOLI /gdpr/ ✓ # # POZNÁMKA k /ddd-sluzby-firmy/: # Fyzicky ověřený B2B namespace — Allow zachován. # Staré namespace /sluzby/ a /sluzby-firmy/ fyzicky neexistují # na serveru — NEJSOU přidány do Allow. # # POZNÁMKA k sitemap-lokality.xml: # Soubor byl fyzicky smazán ze serveru (FTP, 2026-08-02). # Namespace /lokality/ fyzicky neexistuje na serveru. # Žádná Sitemap: direktiva pro tento soubor nebude přidána. # # POZNÁMKA k chybě HTTP 401 (GSC Test Live URL): # robots.txt NENÍ zdrojem ani řešením této chyby. Direktivy # Allow/Disallow/Sitemap fungují pouze na úrovni crawl policy # a nemohou ovlivnit HTTP status kód vydávaný serverem/edge # vrstvou. Viz .htaccess v28.0 [FIX-70] pro plnou diagnózu. # # IČ: 19349530 | DIČ: CZ19349530 # GTM: GTM-54N6VZB6 # GA4: G-XVFM1MG0S3 # Hosting: WEDOS sdílený hosting / Apache 2.4+ # Copyright © 2026 DERASPOL s.r.o.© Všechna práva vyhrazena. # ═══════════════════════════════════════════════════════════════ # ── Všichni crawleři ──────────────────────────────────────────── User-agent: * Allow: / # --- # [ROB-21] EXPLICITNÍ ALLOW — indexovatelné sitemap sekce # Křížově ověřeno s: sitemap.xml v6.2 (master index) # --- Allow: /deratizace/ Allow: /dezinsekce/ Allow: /dezinfekce/ Allow: /ddd-sluzby-firmy/ Allow: /blog/ Allow: /faq/ # --- # [ROB-26] EXPLICITNÍ ALLOW — fyzické adresáře dle výpisu serveru # Veřejné stránky bez noindex — mají být indexovány # --- Allow: /legislativa/ Allow: /opatreni-proti-holubum/ Allow: /patogeny/ Allow: /reference/ Allow: /vedecke-poznatky/ # --- # [ROB-23] EXPLICITNÍ ALLOW — technické soubory # Tyto soubory nesmí být nikdy blokovány — GSC je potřebuje # --- Allow: /sitemap.xml Allow: /sitemap-main.xml Allow: /sitemap-deratizace.xml Allow: /sitemap-dezinsekce.xml Allow: /sitemap-dezinfekce.xml Allow: /sitemap-sluzby.xml Allow: /sitemap-blog.xml Allow: /sitemap-faq.xml Allow: /sitemap-images.xml Allow: /robots.txt Allow: /favicon.ico Allow: /site.webmanifest Allow: /sw.js # --- # [ROB-22] EXPLICITNÍ ALLOW — statické assety # Nutné pro správné renderování stránek Googlebotu # (bez těchto Allow může GSC hlásit "partially rendered") # --- Allow: /images/ Allow: /assets/ Allow: /css/ Allow: /js/ Allow: /fonts/ Allow: /icons/ Allow: /*.css$ Allow: /*.js$ Allow: /*.webp$ Allow: /*.jpg$ Allow: /*.jpeg$ Allow: /*.png$ Allow: /*.svg$ Allow: /*.gif$ Allow: /*.woff2$ Allow: /*.woff$ # --- # [ROB-20] DISALLOW — křížově ověřeno vs. sitemap URL # ŽÁDNÁ z níže uvedených cest se nepřekrývá se sitemap URL. # --- # Interní a technické adresáře Disallow: /cgi-bin/ Disallow: /_includes/ Disallow: /includes/ Disallow: /api/ Disallow: /logs/ Disallow: /smazat/ Disallow: /csp-violations/ Disallow: /node_modules/ Disallow: /vendor/ Disallow: /cache/ Disallow: /tmp/ Disallow: /temp/ Disallow: /backup/ Disallow: /config/ Disallow: /admin/ Disallow: /chyba/ # Právní stránky (nízká SEO hodnota) Disallow: /gdpr/ Disallow: /cookies/ # Stránky bez SEO hodnoty Disallow: /author/ # Formulářové a procesní stránky (bez SEO hodnoty) Disallow: /odeslat-poptavku/ # Systémové soubory (noindex v HTML hlavičce) Disallow: /404.html Disallow: /offline.html Disallow: /kontakt-process.html # Citlivé soubory Disallow: /*.env Disallow: /*.log Disallow: /*.sql Disallow: /*.bak Disallow: /.git/ Disallow: /.htaccess # .well-known — Allow musí být PŘED Disallow Allow: /.well-known/security.txt Disallow: /.well-known/ # ── ORGANICKÉ VYHLEDÁVAČE ─────────────────────────────────────── User-agent: Googlebot Allow: / Allow: /images/ Allow: /assets/ Allow: /css/ Allow: /js/ Allow: /fonts/ Allow: /*.css$ Allow: /*.js$ Allow: /*.webp$ Allow: /*.jpg$ Allow: /*.jpeg$ Allow: /*.png$ Allow: /*.svg$ Allow: /*.woff2$ # [ROB-22][ROB-28] Plný přístup k obrázkům pro Google Image Search # Křížově ověřeno se sitemap-images.xml v5.6 User-agent: Googlebot-Image Allow: /images/ Allow: /assets/ Allow: /icons/ Allow: /*.webp$ Allow: /*.jpg$ Allow: /*.jpeg$ Allow: /*.png$ Allow: /*.svg$ Allow: /*.gif$ User-agent: SeznamBot Allow: / Crawl-delay: 2 User-agent: Bingbot Allow: / Crawl-delay: 2 User-agent: DuckDuckBot Allow: / Crawl-delay: 2 User-agent: Applebot Allow: / Crawl-delay: 3 # [ROB-38] Přeřazeno z AI blacklistu (v3.19 a starší) — Yandex je # klasický organický vyhledávač, ne AI answer engine. User-agent: YandexBot Allow: / Crawl-delay: 2 # ══════════════════════════════════════════════════════════════════ # AI ANSWER ENGINES / PŘÍMÉ VYHLEDÁVÁNÍ — POVOLENO od v3.20 [ROB-38] # # STRATEGIE: Cíl firmy je pozice #1 v ORGANICKÉM i PŘÍMÉM (AI) # vyhledávání. Boti níže pohánějí živé produkty, kde uživatel klade # dotaz typu "kdo dělá deratizaci v Ostravě" a AI agent může firmu # DERASPOL s.r.o.© doporučit — proto jsou explicitně povoleni. # # Synchronizováno s .htaccess v28.0 (sekce AI ANSWER ENGINES BYPASS, # [FIX-73]) — bypass na úrovni mod_rewrite, aby požadavek prošel # i přes bezpečnostní UA filtry. # ══════════════════════════════════════════════════════════════════ User-agent: GPTBot Allow: / User-agent: ChatGPT-User Allow: / User-agent: OAI-SearchBot Allow: / User-agent: anthropic-ai Allow: / User-agent: Claude-Web Allow: / User-agent: ClaudeBot Allow: / User-agent: Claude-SearchBot Allow: / User-agent: PerplexityBot Allow: / User-agent: Gemini-Extended Allow: / User-agent: Meta-ExternalAgent Allow: / User-agent: Meta-ExternalFetcher Allow: / User-agent: FacebookBot Allow: / User-agent: YouBot Allow: / User-agent: Grok Allow: / User-agent: xAI Allow: / User-agent: MistralBot Allow: / User-agent: DeepSeekBot Allow: / User-agent: Applebot-Extended Allow: / User-agent: Amazonbot Allow: / User-agent: PetalBot Allow: / # ══════════════════════════════════════════════════════════════════ # BLOKOVÁNÍ — čistí data scrapeři BEZ vlastního search/answer # produktu. Přínos pro cíl "pozice #1" je u nich nulový, proto # blokace zůstává (viz [ROB-38]). # ══════════════════════════════════════════════════════════════════ User-agent: CCBot Disallow: / User-agent: cohere-ai Disallow: / User-agent: Bytespider Disallow: / User-agent: Diffbot Disallow: / User-agent: ImagesiftBot Disallow: / User-agent: omgili Disallow: / User-agent: omgilibot Disallow: / User-agent: Timpibot Disallow: / User-agent: NaverBot Disallow: / User-agent: AI2Bot Disallow: / User-agent: TurnitinBot Disallow: / User-agent: Kangaroo Bot Disallow: / # ══════════════════════════════════════════════════════════════════ # BLOKOVÁNÍ SEO NÁSTROJŮ — beze změny, nesouvisí s cílem #1 pozice # ══════════════════════════════════════════════════════════════════ User-agent: SemrushBot Disallow: / User-agent: SemrushBot-SA Disallow: / User-agent: AhrefsBot Disallow: / User-agent: MJ12bot Disallow: / User-agent: DotBot Disallow: / User-agent: DataForSeoBot Disallow: / User-agent: BLEXBot Disallow: / User-agent: MajesticSEO Disallow: / User-agent: SEOkicks Disallow: / User-agent: serpstatbot Disallow: / User-agent: Screaming Frog SEO Spider Disallow: / User-agent: rogerbot Disallow: / User-agent: linkdexbot Disallow: / User-agent: sistrix Disallow: / User-agent: Exabot Disallow: / User-agent: ia_archiver Disallow: / # ── Sitemap ───────────────────────────────────────────────────── Sitemap: https://www.deratizace-deraspol.cz/sitemap.xml Sitemap: https://www.deratizace-deraspol.cz/sitemap-main.xml Sitemap: https://www.deratizace-deraspol.cz/sitemap-deratizace.xml Sitemap: https://www.deratizace-deraspol.cz/sitemap-dezinsekce.xml Sitemap: https://www.deratizace-deraspol.cz/sitemap-dezinfekce.xml Sitemap: https://www.deratizace-deraspol.cz/sitemap-blog.xml Sitemap: https://www.deratizace-deraspol.cz/sitemap-images.xml Sitemap: https://www.deratizace-deraspol.cz/sitemap-sluzby.xml Sitemap: https://www.deratizace-deraspol.cz/sitemap-faq.xml # ═══════════════════════════════════════════════════════════════ # KONEC robots.txt v3.20 — DERASPOL s.r.o.© # Aktualizováno: 2026-09-13 # # Synchronizováno s (SKUTEČNÝ STAV): # .htaccess v28.0 | [FIX-73] AI answer enginy odstraněny # z UA blacklistu, přidány do AI # ANSWER ENGINES BYPASS sekce # sw.js v19.4 | CACHE_VERSION: deraspol-2026-08-13-a # site.webmanifest v2.6 # sitemap.xml v6.2 # sitemap-main.xml v4.6 | sitemap-blog.xml v4.6 # sitemap-images.xml v5.6 | sitemap-deratizace.xml v6.3 (512 URL) # sitemap-dezinsekce.xml v6.2 (1783 URL) # sitemap-dezinfekce.xml v3.2 (14 URL) # sitemap-sluzby.xml v2.1 (8 URL) # sitemap-faq.xml v1.4 (24 URL) # sitemap-lokality.xml NEEXISTUJE — trvale smazáno ✓ # # image:license konvence: homepage URL # (https://www.deratizace-deraspol.cz/) ✓ # # [ROB-38] STRATEGICKÝ OBRAT: cíl #1 pozice v AI i organickém # vyhledávání > blokace AI crawlerů. AI answer enginy # (ChatGPT, Claude, Perplexity, Gemini, Grok, DeepSeek, # Mistral, Meta AI, Apple Intelligence, Amazon, You.com, # Petal Search) povoleny. Čistí scrapeři bez vlastního # search produktu a SEO nástroje zůstávají blokovány. # [ROB-20] Křížová validace Disallow ↔ sitemap URL: ČISTÁ ✓ # Žádná indexovatelná URL není blokována. # ═══════════════════════════════════════════════════════════════