En 2025, los bots representaban el 53 % de todo el tráfico web; era la primera vez que el tráfico automatizado superaba al humano en un año natural. En junio de 2026, Cloudflare Radar situaba esa cifra en el 57,5 %, un punto de inflexión que, según el propio director general de Cloudflare, se produjo años antes de lo que él había previsto.

Para la mayoría de los que usan WordPress, esto no se nota. Sus paneles de control parecen normales. Las visitas van en aumento. Pero cada vez, una parte mayor de esas visitas no viene de un cliente, un lector o un cliente potencial, sino de un rastreador de IA que extrae contenido para alimentar un modelo de lenguaje, y lo hace a un ritmo y con un volumen que los bots de los motores de búsqueda nunca alcanzaron.

En este artículo te explicamos por qué afecta a las webs de WordPress de forma diferente al rastreo tradicional, y cómo detectarlo y gestionarlo directamente desde MyKinsta.

¿Qué es un rastreador de IA?

Los rastreadores de IA son bots automatizados que leen páginas web de acceso público y recopilan su contenido para utilizarlo en sistemas de IA. A simple vista, parecen un rastreador de motor de búsqueda tradicional, pero su objetivo es diferente.

Un rastreador de búsqueda, como Googlebot, lee una página para indexarla y clasificarla, lo que permite a los visitantes encontrarte. Sin embargo, un rastreador de IA lee la misma página para alimentar un modelo de lenguaje o de entrenamiento. Esto ocurre de varias formas:

  • Los rastreadores de entrenamiento (como GPTBot y ClaudeBot) recopilan texto para entrenar grandes modelos de lenguaje.
  • Los rastreadores de recuperación recogen páginas en tiempo real cuando alguien le hace una pregunta a una herramienta de IA que requiere información actualizada.
  • Los rastreadores de indexación crean la propia base de datos de búsqueda de un proveedor para reducir su dependencia de terceros.

Lo que tienen en común es que nada de esto te devuelve un visitante. La identificación hace que las cosas sean impredecibles. Algunos rastreadores de IA usan agentes de usuario con nombre y se mantienen dentro de los rangos de IP publicados. Otros toman prestado el agente de usuario de un navegador legítimo, rotan las direcciones de origen o no ofrecen ninguna identificación fiable.

En resumen, el tráfico es más difícil de atribuir y está creciendo rápidamente: el informe 2025 Radar Year in Review de Cloudflare sitúa a los rastreadores de IA que no son de Googlebot en una media del 4,2 % de las solicitudes HTML, una cifra que osciló entre el 2,4 % en abril y el 6,4 % en junio. Si le sumas a Googlebot, que ahora rastrea tanto para la indexación de búsquedas como para el entrenamiento de IA, el rastreo total relacionado con la IA alcanzó alrededor del 8,7 % de las solicitudes HTML en 2025.

Las normas de rastreo que establecieron los rastreadores de los motores de búsqueda

Para entender este cambio, conviene ver en qué consistía realmente la antigua normativa. El rastreo de búsqueda se basaba en una serie de convenciones compartidas que permitían a los propietarios de los sitios web planificar en función de ellas. El Protocolo de Exclusión de Robots apareció en 1994 y se formalizó como estándar de Internet en 2022. En torno a él surgieron cuatro comportamientos que hicieron que los rastreadores tradicionales se convirtieran en algo para lo que se podía crear una infraestructura:

  • Respeto por el archivo robots.txt. Un rastreador leía el archivo, veía qué rutas estaban prohibidas y se no entraba en ellas.
  • Limitación automática del tráfico. Los rastreadores más importantes reducían su velocidad cuando un servidor daba señales de estar sobrecargado, así que un sitio con problemas recibía menos solicitudes en lugar de más.
  • Identificación coherente. Un agente de usuario estable permitía verificar un rastreador y decidir cómo tratarlo.
  • Trabajar dentro de un «presupuesto de rastreo». Google define el presupuesto de rastreo de un sitio web como el conjunto de URLs que Googlebot puede y quiere rastrear. Esto evita que se rastree un sitio web sin ningún límite.

Relacionado con esto está el «retardo de rastreo»: el tiempo que espera un rastreador entre cada solicitud de página. Sin embargo, se trata de una directiva no oficial, por lo que Google nunca la ha soportado y la ha dejado fuera del estándar oficial. En su lugar, Googlebot ajusta su propia frecuencia de rastreo de forma dinámica en función de la rapidez con la que responde tu servidor. Se espera que el rastreador se adapte a la situación y se modere por sí mismo.

Esas convenciones están integradas en el funcionamiento del alojamiento web. Por ejemplo, las capas de caché existen porque los rastreadores que se comportan correctamente solicitan las mismas páginas con la suficiente previsibilidad como para poder servirlas desde la caché. Todo el modelo se basa en la suposición de que los rastreadores siguen las reglas.

En qué aspectos los rastreadores de IA rompen esas normas

Los rastreadores de IA siguen reglas diferentes en tres aspectos:

  • robots.txt se considera opcional. Los informes de TollBit revelan un aumento drástico en el número de bots que ignoran las directivas de robots.txt. Esos mismos informes describen cómo Cloudflare detectó que un importante proveedor de búsqueda basado en IA accedía a contenido de sitios que lo habían prohibido explícitamente.
  • No hay limitación de tráfico. Muchas implementaciones de rastreadores de IA envían solicitudes a un ritmo fijo y elevado, independientemente de cómo responda tu servidor. En algunos casos, ni siquiera es algo intencionado, ya que hay gente que «programa un bot con vibe coding … y lo suelta» sin comprobar nunca el archivo robots.txt.
  • Los rastreadores se quedan atascados en bucles. Se trata de un patrón que consume muchos recursos, pero que es más estructural que malicioso. La mayoría de los rastreadores siguen todos los enlaces que encuentran y registran cada URL única como una página aparte. Los rastreadores de IA siguen una variante, que genera otra, a la que vuelven a seguir, sin darse cuenta de que están dando vueltas en círculo.

Lo peor es que la mayoría de los rastreadores de IA se utilizan para entrenar modelos, en lugar de para búsquedas o consultas de usuarios, lo que significa que no envían tráfico de referencia a tu sitio web.

Por qué esto afecta a tu servidor como un problema de rendimiento

En realidad, el volumen no es el problema aquí. Por ejemplo, una página estática que se sirve desde la caché no te cuesta casi nada, así que mil visitas en caché apenas se notan. El problema empieza cuando el tráfico se salta la caché, y los rastreadores que dan vueltas sin parar son muy buenos encontrando estas rutas.

En una web de WordPress que use WooCommerce, las solicitudes de búsqueda o filtrado suponen una gran parte de las peticiones que llegan a los endpoints dinámicos, en lugar de a las páginas. Normalmente se trata de acciones del carrito, variantes del parámetro ?add-to-cart=, páginas de productos filtradas, consultas de búsqueda e interacciones con AJAX que pasan por admin-ajax.php. Ninguna de estas se puede almacenar en caché como se hace con una entrada de blog, así que cada solicitud obliga al servidor a trabajar:

  • Ejecución de PHP. Se reserva un hilo de PHP durante todo el tiempo que dura cada solicitud. Cuando hay una carga constante de bots, se agotan los hilos y los visitantes reales tienen que esperar en la cola detrás de los bots.
  • Consultas a la base de datos. Las páginas dinámicas acceden a la base de datos cada vez que se cargan porque no hay una capa de caché que absorba la consulta.
  • Gestión de sesiones. Las páginas del carrito y de pago crean o validan una sesión en cada solicitud, lo que añade una carga adicional incluso para los bots que nunca van a comprar nada.

Según los datos de infraestructura de Kinsta, un solo bot generó 3,75 millones de solicitudes a las URLs de add-to-cart en 24 horas. Esto supone, más o menos, una solicitud cada 23 milisegundos sin parar. Los síntomas se parecen a anomalías de uso, exceso de ancho de banda, procesos PHP agotados y tiempos de respuesta más lentos para los usuarios reales. Por eso, parece más un rastreo normal que un ataque, y es fácil pasarlo por alto.

Cómo identificar la actividad de los rastreadores de IA en MyKinsta

Antes de empezar a cambiar la configuración, tienes que asegurarte de que el problema lo causan los rastreadores. MyKinsta te ofrece tres vistas que, si las analizas en conjunto, te permiten convertir una corazonada en un diagnóstico.

Primero, ve a Sitios > nombre del sitio > Protección contra bots en MyKinsta. Aquí, el gráfico Desglose de solicitudes muestra todas las solicitudes realizadas a tu sitio en las últimas 24 horas y cómo las clasifica Kinsta.

El gráfico de desglose de solicitudes de MyKinsta muestra las solicitudes recibidas por un sitio web en las últimas 24 horas, clasificadas según el tipo de tráfico. Una leyenda identifica cada categoría por un color, y el gráfico muestra la proporción relativa de cada una a lo largo del tiempo.
El gráfico de desglose de solicitudes que muestra las solicitudes recibidas en un sitio web durante las últimas 24 horas.

La categoría de rastreadores de IA con tasa excesiva identifica a los bots que generan un volumen de solicitudes tan alto que pone en peligro el rendimiento. Cuando una gran parte del gráfico se sitúa en esa franja, lo que estás viendo es una carga de rastreadores y no un aumento real del número de visitantes.

El gráfico de resultados de la protección contra bots te muestra qué ha pasado con el tráfico, dividiéndolo en solicitudes permitidas, sometidas a verificación o bloqueadas. Así puedes ver cuánto tráfico automatizado llega actualmente a tu sitio web y cuánto se filtra antes de llegar. Al compararlos, estos gráficos te permiten saber si la carga ya se está gestionando o si llega directamente a tu servidor.

Para relacionar el tráfico con la ralentización, echa un vistazo a la lista de IPs de los principales clientes en la sección Analíticas de MyKinsta:

El panel de las principales direcciones IP de clientes muestra las direcciones IP junto con el número de solicitudes, y cada dirección aparece como un enlace en el que puedes hacer clic para acceder a un servicio de búsqueda de IP.
El panel de las principales direcciones IP de clientes muestra las direcciones IP junto con su recuento de solicitudes.

Aquí se muestran las direcciones que envían más solicitudes; cada IP tiene un enlace a un servicio de búsqueda para comprobar su origen. Por último, abre la pestaña Rendimiento y compara los picos de tiempo de respuesta con los periodos de rastreo intenso. Si los picos de recursos y el volumen de bots suben y bajan al mismo tiempo, ya sabes que el siguiente paso es controlar el tráfico entrante.

Cómo gestionar los rastreadores de IA con la protección contra bots de Kinsta

Una vez que hayas confirmado la fuente, la Protección contra Bots de Kinsta te permite controlar cada categoría de tráfico. Se suma a las defensas de la plataforma, que ya filtran el tráfico claramente malicioso, y está incluida en todos los planes.

El panel Nivel de protección contra bots de MyKinsta muestra cuatro opciones entre las que elegir, cada una con una breve descripción y un selector de botones de opción, junto con un botón que dice Cambiar nivel de protección.
El panel de nivel de protección contra bots muestra cuatro opciones seleccionables.

El panel de nivel de protección de la pantalla de protección contra bots en MyKinsta te ofrece cuatro configuraciones entre las que elegir:

  • Bloquear el tráfico malicioso es la configuración predeterminada. Se encarga de mitigar los ataques DDoS y bloquea las direcciones IP y los endpoints vinculados a fuentes de ataque conocidas.
  • Bloqueo de automatizaciones añade un filtro que bloquea el tráfico automatizado confirmado, pero deja pasar a los bots verificados y a los visitantes reales.
  • Desafiar a los bots añade un paso de verificación para los posibles bots. Si un visitante supera la prueba, no se le volverá a pedir que la repita durante diez días si utiliza el mismo navegador y la misma dirección IP.
  • Desafiar a todos es la configuración más estricta y solo deja pasar a los bots verificados. Es una herramienta para usar a corto plazo durante un pico de tráfico intenso.

En la configuración Desafiar a los bots o superior, cualquier herramienta que se conecte a tu sitio de forma programada y que no figure en el directorio de bots verificados de Cloudflare será desafiada o bloqueada. Por eso, asegúrate de que tus herramientas críticas para el negocio aparecen en esa lista antes de subir el nivel.

Kinsta aplica sus propias reglas sobre la lista de bots verificados de Cloudflare. Esto significa que reclasifica los bots de IA verificados que generan un gran volumen de solicitudes en una categoría aparte: Rastreadores de IA con tasa excesiva.

La idea es evaluar a un rastreador por su comportamiento en lugar de por sus credenciales, de modo que un bot verificado que empiece a saturar tu sitio web se trate como el problema en que se ha convertido. Cuando configuras la protección en Desafiar a los bots o un nivel superior, permites que un servicio legítimo de gran volumen demuestre su legitimidad, al tiempo que se filtran los rastreadores que se quedan atascados en un bucle.

Otras funciones de protección contra bots de MyKinsta

El botón Bloquear rastreadores de IA es un control independiente del nivel de protección y está pensado específicamente para los rastreadores de IA, incluidos los verificados, como GPTBot. Googlebot y Bingbot siguen indexando tu sitio web de todas formas, así que esto elimina la carga de los rastreadores de IA sin afectar a tu visibilidad en los buscadores.

El botón Bloquear rastreadores de IA en MyKinsta en posición activada, con su texto explicativo.
El botón Bloquear rastreadores de IA en MyKinsta en posición activada, con su texto explicativo.

Es una opción más limpia que editar manualmente robots.txt o mantener reglas para cada bot, pero vale la pena sopesar las ventajas e inconvenientes antes de activarla.

Bloquear los rastreadores de IA reduce la frecuencia con la que tu contenido aparece en respuestas y resúmenes generados por IA, y dado que las herramientas de IA se están convirtiendo en un canal de descubrimiento cada vez más importante para algunos públicos, desactivarlas por completo tiene implicaciones que van más allá de la carga del servidor.

En el caso de sitios web en los que prima el rendimiento, como las tiendas de WooCommerce, los sitios con mucho tráfico o las plataformas de membresía, el coste en recursos del rastreo por IA es elevado y el beneficio es bajo, así que bloquearlos puede ser la opción más clara si detectas problemas. En los sitios donde prima el contenido y la visibilidad en la IA es una prioridad estratégica, mantener los filtros Bloquear automatizaciones o Desafiar a los bots te permite filtrar los comportamientos más problemáticos sin impedir que las plataformas de IA indexen tu contenido.

No hay una respuesta correcta universal. El botón de activación está ahí para que elijas tú mismo.

Una protección más estricta puede bloquear el tráfico automatizado del que dependes, así que hay dos ajustes para que todo siga fluyendo. La sección Permitir siempre te permite añadir hasta 50 excepciones por dirección IP, ruta o agente de usuario. Ahí es donde indicas lo que nunca debe ser bloqueado, como un servicio de monitorización, un webhook de pago o una IP de confianza de la oficina o de un cliente.

El cuadro de diálogo Añadir nueva excepción de MyKinsta, donde puedes introducir una nueva ruta URL, junto con pestañas para elegir direcciones IP y agentes de usuario.
La pantalla Añadir nueva excepción muestra opciones para introducir una nueva ruta URL.

Permitir automatizaciones típicas de WordPress activa una «lista blanca» gestionada de endpoints y servicios habituales de WordPress, como la API REST y las tareas en segundo plano. Puedes activarla junto con una protección más estricta cuando tu sitio dependa de plugins, integraciones o tareas programadas que realicen solicitudes automáticas, para que reforzar tus defensas no interrumpa sin que te des cuenta un flujo de trabajo.

Las nuevas reglas del rastreo web requieren una gestión más minuciosa por tu parte

Aunque el comportamiento en Internet ha cambiado, es probable que tu alojamiento no lo haya hecho. Los rastreadores de IA no responden a las mismas reglas que los motores de búsqueda tardaron dos décadas en escribir. robots.txt es opcional, y el rastreo se mantiene a un ritmo elevado constante. Es más, no obtienes nada a cambio de los recursos utilizados. Esto te plantea un problema de rendimiento y de costes que parece más propio de un sitio con problemas que de la actividad de los rastreadores.

La solución es sencilla y la tienes bajo tu control. Primero, comprueba la causa en las estadísticas de MyKinsta. A continuación, configura el nivel de protección adecuado en MyKinsta y activa la opción Bloquear rastreadores de IA para reducir la carga de estos rastreadores sin perder visibilidad en los buscadores. Después, protege lo que te importa con la opción Permitir Siempre, para que una configuración más estricta no afecte a una integración de confianza. Cada cambio se aplica sin tiempo de inactividad, así que puedes ir ajustándolo a medida que cambien los patrones.

Si gestionas muchos sitios web de clientes, el Programa para Socios de Agencias de Kinsta incluye estos controles junto con soporte dedicado. Echa un vistazo al alojamiento administrado para WordPress de Kinsta para poner ese control en práctica.

Joel Olawanle Kinsta

Joel es un desarrollador Frontend que trabaja en Kinsta como Editor Técnico. Es un formador apasionado enamorado del código abierto y ha escrito más de 200 artículos técnicos, principalmente sobre JavaScript y sus frameworks.