Security Ninja puede reconocer crawlers legítimos para que buscadores, herramientas de monitorización y bots de IA publicados tengan menos probabilidad de quedar bloqueados por error. La validación forma parte de las comprobaciones de visitantes del firewall.
Cómo funciona la validación
El proceso depende del tipo de crawler:
Crawlers clásicos de búsqueda y SEO
Para User-Agents que parecen un crawler conocido (Googlebot, Bingbot, Ahrefs y similares), Security Ninja puede hacer un reverse-DNS de la IP del visitante y confirmar que el hostname coincide con un sufijo de confianza (por ejemplo .googlebot.com o .search.msn.com).
El tráfico normal de navegador no dispara esta consulta DNS. La comprobación solo se ejecuta cuando el User-Agent parece un crawler.
Si la IP y el hostname coinciden, la IP se recuerda para que las visitas siguientes se salten el trabajo extra. La lista recordada tiene un tope de 200 entradas.
Crawlers de IA (OpenAI, Perplexity, Anthropic)
Cuando el User-Agent coincide con bots publicados como GPTBot, PerplexityBot o ClaudeBot, Security Ninja comprueba la IP del visitante frente a rangos de IP oficiales publicados de cada proveedor (feeds JSON), no por coincidencia de hostname.
Ejemplos compatibles:
- OpenAI: GPTBot, ChatGPT-User, OAI-SearchBot
- Perplexity: PerplexityBot, Perplexity-User
- Anthropic: ClaudeBot, Claude-User, Claude-SearchBot
Sufijos de hostname de crawlers clásicos
Estos patrones de hostname se usan cuando corre la confirmación por reverse-DNS:
.crawl.baidu.com- Crawler de búsqueda de Baidu.
.crawl.baidu.jp- Crawler de Baidu Japón.
.search.msn.com- Crawler de Microsoft Bing.
.google.com- Crawlers de Google.
.googlebot.com- Googlebot.
.crawl.yahoo.net- Crawler de Yahoo.
.yandex.ru,.yandex.net,.yandex.com- Crawlers de Yandex.
.petalsearch.com- Petal Search (Huawei).
applebot.apple.com- Applebot.
.ahrefs.com- Crawler SEO de Ahrefs.
.semrush.com- Crawler de SEMrush.
.duckduckgo.com- Crawler de DuckDuckGo.
facebookexternalhit.com- Fetcher de vista previa de enlaces de Facebook.
.commoncrawl.org- Common Crawl.
.googleother.com- Otros crawlers de Google.
.google-inspectiontool.com- Herramientas de inspección de Google.
.swiftype.com- Crawler de Swiftype.
.sogou.com- Crawler de Sogou.
.yahoo.com- Crawlers internacionales de Yahoo.
.bing.com- Crawlers de Bing.
Si un crawler legítimo sigue bloqueado
- Actualiza Security Ninja a la última versión.
- Comprueba que la IP del crawler resuelve a un hostname conocido (bots clásicos) o cae en el rango publicado del proveedor (bots de IA).
- Añade la IP a la lista de permitidos de forma manual si hace falta.
- Contacta con soporte si operas un crawler con un método de validación estándar que aún no cubrimos.