Firewall e inicio de sesión

Crawlers validados automáticamente

Cómo Security Ninja valida buscadores y crawlers de IA (OpenAI, Perplexity, Claude) para que los bots legítimos tengan menos probabilidad de quedar bloqueados.

Security Ninja puede reconocer crawlers legítimos para que buscadores, herramientas de monitorización y bots de IA publicados tengan menos probabilidad de quedar bloqueados por error. La validación forma parte de las comprobaciones de visitantes del firewall.

Cómo funciona la validación

El proceso depende del tipo de crawler:

Crawlers clásicos de búsqueda y SEO

Para User-Agents que parecen un crawler conocido (Googlebot, Bingbot, Ahrefs y similares), Security Ninja puede hacer un reverse-DNS de la IP del visitante y confirmar que el hostname coincide con un sufijo de confianza (por ejemplo .googlebot.com o .search.msn.com).

El tráfico normal de navegador no dispara esta consulta DNS. La comprobación solo se ejecuta cuando el User-Agent parece un crawler.

Si la IP y el hostname coinciden, la IP se recuerda para que las visitas siguientes se salten el trabajo extra. La lista recordada tiene un tope de 200 entradas.

Crawlers de IA (OpenAI, Perplexity, Anthropic)

Cuando el User-Agent coincide con bots publicados como GPTBot, PerplexityBot o ClaudeBot, Security Ninja comprueba la IP del visitante frente a rangos de IP oficiales publicados de cada proveedor (feeds JSON), no por coincidencia de hostname.

Ejemplos compatibles:

  • OpenAI: GPTBot, ChatGPT-User, OAI-SearchBot
  • Perplexity: PerplexityBot, Perplexity-User
  • Anthropic: ClaudeBot, Claude-User, Claude-SearchBot

Sufijos de hostname de crawlers clásicos

Estos patrones de hostname se usan cuando corre la confirmación por reverse-DNS:

.crawl.baidu.com
Crawler de búsqueda de Baidu.
.crawl.baidu.jp
Crawler de Baidu Japón.
.search.msn.com
Crawler de Microsoft Bing.
.google.com
Crawlers de Google.
.googlebot.com
Googlebot.
.crawl.yahoo.net
Crawler de Yahoo.
.yandex.ru, .yandex.net, .yandex.com
Crawlers de Yandex.
.petalsearch.com
Petal Search (Huawei).
applebot.apple.com
Applebot.
.ahrefs.com
Crawler SEO de Ahrefs.
.semrush.com
Crawler de SEMrush.
.duckduckgo.com
Crawler de DuckDuckGo.
facebookexternalhit.com
Fetcher de vista previa de enlaces de Facebook.
.commoncrawl.org
Common Crawl.
.googleother.com
Otros crawlers de Google.
.google-inspectiontool.com
Herramientas de inspección de Google.
.swiftype.com
Crawler de Swiftype.
.sogou.com
Crawler de Sogou.
.yahoo.com
Crawlers internacionales de Yahoo.
.bing.com
Crawlers de Bing.

Si un crawler legítimo sigue bloqueado

  1. Actualiza Security Ninja a la última versión.
  2. Comprueba que la IP del crawler resuelve a un hostname conocido (bots clásicos) o cae en el rango publicado del proveedor (bots de IA).
  3. Añade la IP a la lista de permitidos de forma manual si hace falta.
  4. Contacta con soporte si operas un crawler con un método de validación estándar que aún no cubrimos.

Relacionado

¿Sigues atascado? Obtener ayuda o contáctanos .

Larger screenshot

Enlarged image