Ver todas las comprobaciones
Guía

Por qué los bots de IA no pueden rastrear tu sitio (y cómo solucionarlo)

Actualizado el 29 de agosto de 2026 · 9 min de lectura

Si las respuestas de IA de ChatGPT, Perplexity o Google nunca mencionan tu sitio, la causa suele ser invisible: un hosting, CDN o firewall devuelve en silencio un 403 a los rastreadores de IA para ahorrar ancho de banda — mientras tu robots.txt dice que son bienvenidos. Así ocurre ese bloqueo, así lo encuentras y así abres la puerta a los rastreadores que realmente quieres.

Qué significa realmente “bloqueado” para las respuestas de IA

Los motores de respuesta — ChatGPT, Perplexity, Google AI Overviews, Claude — no inventan datos sobre tu negocio. Recuperan tus páginas, las leen y las citan. Si su rastreador no puede alcanzar tus páginas, simplemente no existes en la respuesta. No se te muestra ningún error; la cita se va a un competidor cuyas páginas sí cargaron.

Ese es el núcleo del AEO (Answer Engine Optimization): que te rastreen los bots que impulsan las respuestas de IA. Y la razón más común por la que un sitio falla no es un llms.txt ausente o datos estructurados pobres — es que al rastreador lo rechazaron en la puerta, antes de ver siquiera el HTML.

robots.txt es una petición; el servidor es el muro

Hay dos lugares completamente distintos donde se puede bloquear a un bot de IA, y se comportan de forma muy diferente.

robots.txt es una petición educada. Es un archivo de texto que dice “por favor no rastrees estas rutas”. Los rastreadores bien educados — GPTBot, PerplexityBot, ClaudeBot, Google-Extended — lo leen y obedecen. Pero es voluntario: técnicamente no bloquea nada y depende de la buena voluntad del rastreador.

Un bloqueo a nivel de servidor o WAF es un muro. Tu hosting, CDN o firewall inspecciona el user-agent de la petición entrante y devuelve un 403 Forbidden, un 429 o una página de desafío antes de que tu sitio siquiera se ejecute. El rastreador no obtiene nada. Y lo clave: esto puede ocurrir mientras robots.txt dice alegremente “permitido” — los dos sistemas no se conocen entre sí.

En esa brecha vive la mayoría de la invisibilidad silenciosa ante la IA: tú (o un plugin, o un tutorial) permitiste a los bots en robots.txt, pero el servidor los bloquea igual — y nada te avisa.

Por qué los hostings y WAF bloquean bots de IA en primer lugar

Bloquear rastreadores de IA rara vez es una decisión que tomaste conscientemente. Suele llegar como un valor por defecto:

Ancho de banda y CPU. Los rastreadores de IA pueden ser agresivos — un rastreador de entrenamiento puede pedir miles de URLs al día. Los proveedores económicos y de hosting compartido incluyen cada vez más listas de bloqueo por user-agent que rechazan bots de IA para proteger su infraestructura, y no siempre te lo dicen.

Interruptores de CDN de un clic. El ajuste gestionado “Bloquear bots de IA” de Cloudflare es un solo interruptor. Es fácil activarlo creyendo que solo frenas scrapers de entrenamiento — pero la misma regla bloquea GPTBot, ClaudeBot, Amazonbot, CCBot, Bytespider y más, incluidos los rastreadores que de otro modo te citarían.

Plugins de seguridad y reglas de firewall. Los plugins de seguridad de WordPress y los conjuntos de reglas WAF suelen incluir listas de “bots malos” que barren rastreadores de IA junto a scrapers reales. Una regla escrita para frenar el robo de contenido también frena las citas en silencio.

El resultado es el mismo: un bloqueo que nunca pretendiste, que ahorra algo de ancho de banda a costa de cada futura cita de IA.

Cómo saber si tu sitio bloquea bots de IA

Puedes probarlo tú mismo con una petición por rastreador — pide tu página de inicio presentando el user-agent del bot y observa el código de estado.

Desde una terminal: curl -sI -A "Mozilla/5.0 (compatible; GPTBot/1.1; +https://openai.com/gptbot)" https://tusitio.com/ — un 200 OK significa que el bot entra; un 403, 429, 451 o 503, o un desafío de Cloudflare (“Just a moment…”), significa que está bloqueado.

Ejecútalo para cada rastreador que te importe (GPTBot, PerplexityBot, ClaudeBot, OAI-SearchBot). Si un user-agent de navegador normal recibe 200 pero los de los bots reciben 403, el bloqueo es por user-agent — el tipo común y barato, y el más fácil de arreglar. Si incluso Googlebot está bloqueado, tu hosting rechaza rastreadores en bloque, lo que también daña el SEO clásico.

Una advertencia: esto prueba el bloqueo por cadena de user-agent. Los bloqueos sofisticados que verifican a un rastreador por sus rangos de IP publicados no se pueden reproducir desde tu portátil — pero son más raros, y un bloqueo por user-agent es lo que encontrarás la gran mayoría de las veces.

Cómo desbloquear los rastreadores que quieres

Arreglar esto va del muro, no de robots.txt — editar robots.txt no hace nada si el servidor devuelve un 403. Ve a la capa que esté bloqueando:

Cloudflare / CDN. Desactiva la regla gestionada “Bloquear bots de IA”, o reemplázala por una regla personalizada que permita los rastreadores de citación (GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot) y siga desafiando al resto. Cloudflare también permite limitar la tasa en lugar de bloquear, lo que acota el ancho de banda sin quedarte a oscuras.

Firewall del hosting / ModSecurity. Pide a tu hosting (o revisa las reglas del firewall) una lista de bloqueo por user-agent que incluya GPTBot, ClaudeBot o PerplexityBot, y pon en la lista de permitidos los que quieras que te citen.

Plugin de seguridad. En la sección de bloqueo de bots malos o de user-agents de tu plugin de seguridad de WordPress, quita los rastreadores de citación de IA de la lista de bloqueo.

Luego decide a quién quieres de verdad. Bloquear es una opción legítima para los rastreadores de entrenamiento — permitirlos aporta tu contenido al entrenamiento de modelos. Pero los rastreadores de citación son distintos: bloquear GPTBot, OAI-SearchBot, PerplexityBot o ClaudeBot te saca de las respuestas de IA en vivo sin ninguna ventaja. Una postura común y defendible: permitir los rastreadores de citación y búsqueda, y bloquear o limitar los de entrenamiento puro. OpenAI y Anthropic admiten esta división, así que puedes permitir OAI-SearchBot para búsqueda y prohibir GPTBot para entrenamiento.

Elijas lo que elijas, vuelve a probar después con el comando curl anterior para confirmar que el servidor sí sirve a los bots — no des por hecho que el interruptor funcionó.

Cómo Relvato monitorea el acceso de rastreadores de IA por ti

Probar una vez a mano está bien; el problema es que este bloqueo vuelve. Un cambio de plan de CDN, una actualización de un plugin de seguridad, un nuevo valor por defecto del firewall del hosting, o un compañero que activa el interruptor de Cloudflare pueden volver a bloquear rastreadores de IA meses después — en silencio, igual que la primera vez.

La comprobación de preparación AEO de Relvato ejecuta esta prueba en cada chequeo. Pide tu página de inicio como cada rastreador de motores de respuesta (GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot) y confirma que el servidor sí los sirve — no solo que robots.txt los permite. Un control con user-agent de navegador evita falsas alarmas, y un control con Googlebot distingue el bloqueo específico de IA del bloqueo de bots en bloque.

Como se ejecuta de forma continua y vuelve a comprobar tras las actualizaciones del sitio, te enteras en el momento en que un despliegue o un cambio de ajuste empieza a rechazar rastreadores de IA — con una alerta, antes de que pasen semanas de citas perdidas. Junto a ello, la misma comprobación verifica la política de robots.txt, llms.txt, los datos estructurados, un sitemap, los metadatos de snippet y el contenido renderizado en servidor — así “¿puede la IA encontrarme y citarme?” queda respondido de principio a fin. Funciona en cualquier sitio con un dominio verificado, sin plugin.

Qué rastreadores de IA permitir — y qué cuesta bloquear cada uno

RastreadorOperado por / usado paraSi lo bloqueasRecomendación común
GPTBotOpenAI — navegación de ChatGPT y entrenamientoChatGPT no te lee ni te citaPermitir para AEO
OAI-SearchBotOpenAI — resultados de ChatGPT SearchExcluido de ChatGPT SearchPermitir para AEO
PerplexityBotPerplexity — respuestas en tiempo real (no entrenamiento)Sin citas en PerplexityPermitir para AEO
ClaudeBotAnthropic — indexación de Claude y entrenamientoClaude no te citaPermitir para AEO
Google-ExtendedGoogle — base para Gemini y AI OverviewsFuera de las respuestas de IA de Google (Búsqueda intacta)Permitir salvo que optes por salir
CCBotCommon Crawl — dataset abierto usado por muchos modelosMenos presencia en modelos entrenados con élOpcional
BytespiderByteDance — rastreador de entrenamiento, a menudo agresivoSolo datos de entrenamientoA menudo limitado o bloqueado

Preguntas frecuentes sobre el bloqueo de rastreadores de IA

¿Es malo bloquear bots de IA?

Depende de qué bots y de si lo hiciste a propósito. Bloquear rastreadores solo de entrenamiento (CCBot, Bytespider) es una opción legítima de privacidad y ancho de banda. Bloquear rastreadores de citación (GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot) te saca de las respuestas de ChatGPT, Perplexity y Claude — normalmente por accidente, y casi siempre vale la pena revertirlo.

¿Añadir bots de IA a robots.txt los bloquea?

No a nivel de servidor. robots.txt es una petición voluntaria que los rastreadores conformes obedecen, pero técnicamente no detiene nada. Un bloqueo de servidor o WAF se impone y es independiente — por eso un sitio puede “permitir” un bot en robots.txt mientras su hosting sigue devolviendo un 403 a ese mismo bot.

¿Cómo compruebo si mi hosting bloquea bots de IA?

Pide tu página de inicio con el user-agent del bot y lee el código de estado — curl -sI -A "…GPTBot…" https://tusitio.com/. Un 403, 429 o 503, o una página de desafío, significa bloqueado. Relvato ejecuta esta prueba de forma continua para GPTBot, PerplexityBot, ClaudeBot y OAI-SearchBot y te alerta si aparece un bloqueo.

¿Permitir rastreadores de IA sobrecargará mi servidor?

Puede añadir carga, sobre todo los rastreadores de entrenamiento. Si el ancho de banda es la preocupación, limita la tasa en vez de bloquear — la mayoría de CDNs y hostings te dejan regular la tasa de rastreo de un user-agent, y Anthropic y otros respetan una directiva Crawl-delay. Así las respuestas de IA te siguen citando sin que un rastreador machaque el sitio.

¿Puedo permitir bots de citación y bloquear bots de entrenamiento?

Sí, y es una postura común. OpenAI te deja permitir OAI-SearchBot (búsqueda) y prohibir GPTBot (entrenamiento); Anthropic separa ClaudeBot, Claude-User y Claude-SearchBot. Permite los agentes de búsqueda y citación para aparecer en respuestas, y bloquea o limita los rastreadores de entrenamiento puro si prefieres no alimentar el entrenamiento de modelos.

Fuentes

Guía

Entérate en el momento en que se bloquean los rastreadores de IA

La comprobación de preparación AEO de Relvato prueba si GPTBot, PerplexityBot y ClaudeBot pueden alcanzar realmente tu sitio — en cada chequeo, en cualquier dominio verificado — y te alerta cuando un cambio de hosting o WAF los deja fuera.