# PKA Smart, wiki e database do PokeAlliance # https://smartdex.wiki.br # # Buscador entra. Rastreador de treinamento de IA nao entra. # # A lista abaixo e pedido, e nao barreira: quem respeita robots.txt para, quem # nao respeita continua entrando. A barreira de verdade e a regra de bot do # Cloudflare, ver HANDOFF, AI CRAWLERS. Esta lista existe por dois motivos: o # rastreador que obedece para de raspar, e a intencao fica registrada com data, # o que conta se um dia houver disputa sobre uso indevido do conteudo. # # Nenhum agente de busca esta bloqueado. Google-Extended e Applebot-Extended # sao os agentes de treinamento do Google e da Apple, separados do Googlebot e # do Applebot: bloquear os dois nao mexe em indexacao nem em posicao. # # 15/09/2026: entraram AI2Bot, Ai2Bot-Dolma, Webzio-Extended, img2dataset, # meta-externalfetcher e Google-CloudVertexBot. Todos sao agentes de coleta # para dataset ou para modelo, documentados por quem os opera, e nenhum deles e # o rastreador de busca da mesma empresa: Google-CloudVertexBot e o buscador do # Vertex AI, separado do Googlebot, e meta-externalfetcher e o par do # Meta-ExternalAgent. Nao entraram os agentes de BUSCA nem os de RESPOSTA # (OAI-SearchBot, ChatGPT-User, Claude-SearchBot, DuckAssistBot), para nao # contrariar a decisao de dono registrada no HANDOFF, secao AI CRAWLERS: # categoria Pesquisa e categoria Agente ficam permitidas, Treinamento nao. User-agent: GPTBot User-agent: ClaudeBot User-agent: Claude-Web User-agent: anthropic-ai User-agent: CCBot User-agent: Google-Extended User-agent: Applebot-Extended User-agent: Bytespider User-agent: Amazonbot User-agent: Meta-ExternalAgent User-agent: FacebookBot User-agent: PerplexityBot User-agent: Perplexity-User User-agent: cohere-ai User-agent: Diffbot User-agent: ImagesiftBot User-agent: Omgilibot User-agent: Omgili User-agent: Timpibot User-agent: YouBot User-agent: Kangaroo Bot User-agent: PanguBot User-agent: Scrapy User-agent: AI2Bot User-agent: Ai2Bot-Dolma User-agent: Webzio-Extended User-agent: img2dataset User-agent: meta-externalfetcher User-agent: Google-CloudVertexBot Disallow: / # Rastreador comercial de SEO e de backlink. Nao entra na lista de cima porque # nao coleta para treinar modelo, e porque bloquear tiraria do dono a chance de # auditar o proprio site com essas ferramentas. O que eles fazem de ruim aqui e # volume: varrem o site inteiro de uma vez, e o site inteiro sao 1.100 fichas. # # Crawl-delay nao e padrao e o Google ignora, o que aqui nao custa nada: nenhum # agente deste grupo e buscador que traga trafego relevante para o projeto. Os # seis honram o campo, e dez segundos transformam uma varredura de minutos numa # de horas, sem barrar nada. User-agent: AhrefsBot User-agent: SemrushBot User-agent: MJ12bot User-agent: DotBot User-agent: BLEXBot User-agent: DataForSeoBot Crawl-delay: 10 # Rastreadores de anuncio do Google, liberados explicitamente em 15/09/2026. # # NAO E REDUNDANTE com o "User-agent: *" abaixo, e este e o ponto: os tres # IGNORAM o grupo curinga, por documentacao do proprio Google em # developers.google.com/search/docs/crawling-indexing/google-special-case-crawlers. # Hoje eles entram porque robots.txt sem regra que case e permissao, mas isso # e permissao por omissao: bastaria alguem acrescentar um Disallow generico # para o AdSense parar de ver o site, e a falha apareceria como "conteudo # insuficiente" na analise, sem nenhuma pista do motivo. # # Mediapartners-Google o rastreador do AdSense, que le a pagina para # escolher o anuncio. Sem ele nao ha monetizacao. # AdsBot-Google qualidade da pagina de destino no Google Ads. # AdsBot-Google-Mobile o mesmo, na versao de celular. # # Eles nao coletam para treinar modelo, entao nao contrariam a decisao de dono # registrada no HANDOFF, secao AI CRAWLERS. User-agent: Mediapartners-Google Allow: / User-agent: AdsBot-Google Allow: / User-agent: AdsBot-Google-Mobile Allow: / User-agent: * Allow: / Sitemap: https://smartdex.wiki.br/sitemap.xml