Un AI crawler puede visitar tu sitio decenas de miles de veces y enviarte de vuelta un solo visitante. WIRED documentó cómo un crawler recorrió propiedades de Condé Nast miles de veces sin generar tráfico de vuelta proporcional — crawl masivo, retorno mínimo. Para un portal que vive de pageviews e ingresos por publicidad, eso es sangrado silencioso: infraestructura consumida, contenido extraído, ninguna conversión generada.
El contrato que sostuvo la web durante treinta años era simple: dejabas que crawlearan, recibías tráfico de vuelta. Ese contrato terminó. Lo que lo reemplazó todavía no tiene reglas consolidadas, y la mayoría de los equipos de ingeniería y seguridad siguen tratando a los bots de AI como si fueran todos iguales.
No lo son.
Los tres tipos de AI bots que necesitas conocer
La distinción entre AI bots es una distinción de intención. Intenciones diferentes requieren respuestas diferentes.
Search bots: indexación para responder después
Los Search bots recopilan e indexan contenido para responder preguntas más tarde. No actúan en tiempo real: construyen una base de datos de tu sitio que se consultará cuando un usuario haga una pregunta en un asistente o buscador.
El mecanismo es el mismo que el de los crawlers tradicionales, pero el destino del contenido cambió. En vez de aparecer como enlace en una página de resultados, tu texto aparece como respuesta directa en un chat — sin clic, sin visita, sin impresión de anuncio.
Los Search bots todavía pueden generar tráfico de vuelta. Son los más ambiguos: bloquearlos indiscriminadamente puede costarte visibilidad. La decisión correcta es monitorear, no bloquear por defecto.
Agent bots: acción en tiempo real por un humano
Los Agent bots actúan en el momento, en nombre de un usuario humano que está esperando al otro lado. Un agent puede estar leyendo una página de producto para comparar precios, llenando un formulario o extrayendo información para responder una pregunta ahora. Hay una persona en algún lugar esperando el resultado de esa automatización.
Los agents consumen recursos como un usuario real (bandwidth, procesamiento, conexiones de base de datos), pero no generan ingresos. No hacen clic en anuncios. No compran. En API y endpoints de autenticación, el riesgo es más directo: agents sofisticados pueden saturar rate limits, probar credenciales a escala y generar costos de infraestructura sin ninguna contrapartida.
Más información: Seguridad de API para AI Agents: rate limits y auth — cómo adaptar rate limits, autenticación y observabilidad para tráfico de agents sin afectar integraciones legítimas.
Training bots: captura permanente para entrenar modelos
Los Training bots capturan contenido para entrenar o hacer fine-tuning de modelos de lenguaje. El dato extraído no se consulta después: se incorpora permanentemente a la arquitectura del modelo. Moldea cómo el modelo responde preguntas, sin atribución y sin compensación.
Sin un acuerdo comercial explícito, no hay justificación para permitir el acceso. Para los e-commerce el riesgo es concreto: catálogos de productos, descripciones y reseñas de clientes pueden convertirse en datasets de entrenamiento gratis para competidores.
Diferencias entre Search bots, Agent bots y Training bots
| Tipo | Qué hace | ¿Hay un usuario humano esperando? | ¿Puede generar tráfico de vuelta? | Riesgo principal |
|---|---|---|---|---|
| Search | Indexa para responder después | No | Sí (a veces) | Respuesta sin clic, sin visita |
| Agent | Actúa en tiempo real | Sí | No | Consumo de infraestructura sin ingresos |
| Training | Captura para entrenar modelo | No | No | Extracción de propiedad intelectual sin compensación |
Cuando un mismo AI bot tiene múltiples propósitos
Algunos bots hacen más de una cosa al mismo tiempo. Un crawler puede indexar contenido para search y usar ese mismo contenido para training. Una regla de “bloquear Training” aplicada de forma amplia puede bloquear inadvertidamente la indexación legítima, dependiendo de cómo esté configurado el bot y cómo lo identifique tu sistema de protección.
“Bloquear AI bots: sí o no” no es una política. Una política real necesita considerar tres capas:
- Lo que el bot declara que hace (a través del User-Agent y la documentación pública del operador)
- Lo que el bot realmente hace (patrones de comportamiento, frecuencia de acceso, endpoints visitados, volumen por período)
- Tu postura para cada finalidad, porque Search, Agent y Training pueden y deben tener respuestas distintas
El problema no es bloquear bots claramente maliciosos. El problema es tomar decisiones precisas sobre bots con comportamiento mixto, User-Agent legítimo y operadores que combinan finalidades sin transparencia.
Por qué el User-Agent no es suficiente
La protección basada en listas de User-Agents conocidos solo funciona contra bots que se identifican honestamente.
Los bots sofisticados falsifican el User-Agent. Un bot de training puede presentarse como un navegador común. Un agent puede simular tráfico orgánico. La lista necesita actualizaciones continuas, y los bots evasivos simplemente no aparecen en ella hasta que alguien los identifica y documenta.
El tráfico automatizado no se revela por el string declarado en el encabezado de la solicitud. Se revela por el comportamiento a lo largo de una sesión completa. Los humanos se equivocan, regresan, dudan, abren pestañas. Los bots siguen rutas optimizadas sin desviación. Entre la carga de una página y la siguiente acción, los humanos tienen variación natural; la automatización tiene una precisión que ningún usuario real reproduciría. El scroll de página, el foco en campos de formulario y la variación en la velocidad de lectura son señales difíciles de simular a escala. Los training bots tienden a recorrer URLs en secuencia lógica — sitemap, categorías, productos en orden — un patrón que ningún usuario orgánico generaría.
Cada señal por separado puede parecer plausible. Evaluadas en conjunto, a lo largo de una sesión completa, forman un patrón costoso de falsificar de forma consistente.
Por eso las plataformas de protección modernas, como el Bot Manager de Azion, trabajan con una puntuación de riesgo por solicitud: combinan fingerprint de dispositivo, firma de navegador, patrones de comportamiento y reputación de red. El score se actualiza con cada nueva acción en la sesión, no solo en la primera solicitud.
Más información: Defensa Contra Automatización Maliciosa con AI Inference — cómo combinar Bot Manager, AI Inference y observabilidad para clasificar y responder a la automatización maliciosa en tiempo real.
Cómo controlar los Search bots, Agent bots y Training bots
La estructura a continuación no es un tutorial de herramienta. Es un framework de decisión que puedes aplicar independientemente de la solución que estés usando.
¿El bot está declarando su identidad?│├── No → Tratar como sospechoso.│ Bloquear o aplicar un desafío de verificación.│└── Sí → ¿Cuál es la finalidad declarada? │ ├── Training │ ├── Sin acuerdo comercial → Bloquear │ └── Con acuerdo → Permitir + monitorear volumen y patrón │ ├── Agent │ ├── API pública → Rate limiting granular por endpoint │ ├── Sitio de contenido → Verificar si tus términos de uso │ │ permiten acceso automatizado │ └── E-commerce → Proteger páginas de producto, │ catálogo y checkout │ └── Search → Monitorear crawl-to-referral ratio ├── Ratio razonable → Permitir └── Ratio abusivo (ej: >1,000:1) → Throttle o negociar compensaciónBloquear todo es simple pero costoso: puedes perder indexación legítima y visibilidad en asistentes de AI que generan referral. Permitir todo es riesgoso: subsidias el entrenamiento de modelos de la competencia y consumes infraestructura sin ingresos.
Una buena solución de protección va más allá del bloqueo. Ofrece acciones granulares: rate limiting, redirect, respuestas personalizadas, retraso aleatorio para elevar el costo operacional del bot sin revelar que fue detectado, hold de conexión. Cada acción tiene un contexto donde es más adecuada que un bloqueo directo.
Cómo monitorear el tráfico de AI bots
Pocos equipos revisan esto con suficiente detalle, y tener una política sin medirla es lo mismo que no tenerla.
Las métricas para la gestión de AI bots no son las mismas que usas para el tráfico humano. Un número destaca: el crawl-to-referral ratio por operador. Por cada empresa cuyos bots visitan tu sitio, ¿cuántas visitas recibes de vuelta por cada crawl? Un ratio de 2:1 es el estándar histórico de los search engines tradicionales. Ratios en cientos o miles indican extracción sin retorno.
Monitorea también la distribución de scores de riesgo a lo largo del tiempo. ¿Qué porcentaje de las solicitudes se clasifica como alta sospecha? ¿Ese número sube en ciertos horarios o regiones? Los Search bots típicamente acceden a sitemaps y páginas de contenido. Los Training bots recorren de forma más amplia. Los Agent bots concentran el acceso en endpoints específicos. Un bot que se desvía de esos patrones merece revisión.
Azion Web Platform brinda visibilidad en tiempo real sobre este perfil de tráfico a través de Real-Time Metrics y Data Stream: distribución de bots por tipo, principales orígenes de ataque, scores de riesgo y exportación a SIEM.
¿robots.txt todavía funciona?
Sí, como señal de preferencia. No como control activo. robots.txt le comunica al bot lo que quiere el propietario del sitio. Los bots bien comportados lo respetan. Los bots evasivos o malintencionados lo ignoran por completo. La instrucción en el archivo no ejecuta ninguna regla: depende de la buena fe de quien la lee.
Algunos operadores y grupos de estándares están discutiendo extensiones a robots.txt que señalarían el uso intencional del contenido. La idea es que el archivo declare no solo “puede o no puede crawlear”, sino lo que el operador está autorizado a hacer: indexar para search, resumir y reproducir, o solo interactuar sin almacenar. Todavía está en discusión.
robots.txt es necesario e insuficiente. Es el equivalente a poner un letrero de “propiedad privada” en un terreno sin barda. El control real ocurre en la capa de infraestructura, con la capacidad de evaluar comportamiento real, no solo declaraciones de intención.
Cómo crear una política para AI bots
La industria todavía no cerró las reglas para este problema. La taxonomía Search/Agent/Training es un comienzo, pero los bots siguen cambiando: combinan finalidades, falsifican identidad y se vuelven más difíciles de clasificar solo por lo que declaran.
Los sitios sin una política activa están tomando una decisión por omisión. Las consecuencias aparecen en el reporte de ingresos antes de aparecer en los logs de acceso.
Habla con el equipo de Azion para entender cómo el tráfico de AI bots está afectando tu sitio.
Preguntas frecuentes
¿Cuál es la diferencia entre un AI Search bot, un AI Agent bot y un AI Training bot? Los Search bots indexan contenido para responder preguntas después, construyendo una base de datos de tu sitio. Los Agent bots actúan en tiempo real por un usuario humano, navegando y extrayendo información en ese momento. Los Training bots capturan contenido para entrenar o ajustar modelos de lenguaje, y el dato extraído se incorpora permanentemente al modelo.
¿Debo bloquear todos los AI bots de mi sitio? No necesariamente. Bloquear los Search bots indiscriminadamente puede reducir tu visibilidad en buscadores y asistentes de AI que generan referral. La estrategia correcta es tener políticas distintas para cada tipo: monitorear Search con atención al crawl-to-referral ratio, controlar los Agent bots con rate limiting por endpoint, y bloquear Training salvo acuerdo comercial explícito.
Si bloqueo los Training bots, ¿afectaré mi indexación en Google? Posiblemente sí, dependiendo de cómo estén configuradas las regras. Algunos crawlers combinan Search y Training en el mismo bot, y una regla de bloqueo amplia puede afectar la indexación. El control eficaz requiere identificación granular por comportamiento, no una regla única aplicada a toda una categoría.
¿Qué es el crawl-to-referral ratio y por qué importa? Es la proporción entre cuántas veces un bot crawleó tu sitio y cuántos visitantes reales envió de vuelta. Los crawlers de search tradicionales tenían ratios cercanos a 2:1. WIRED documentó casos de AI crawlers recorriendo propiedades de Condé Nast miles de veces sin generar tráfico de vuelta proporcional. Para sitios que dependen del tráfico y la publicidad, ese dato determina si un operador de bot está contribuyendo o solo consumiendo.
¿robots.txt es suficiente para bloquear AI bots? No. robots.txt señala una preferencia: los bots bien comportados la respetan, los bots evasivos la ignoran. El control eficaz requiere reglas activas en la capa de infraestructura, con la capacidad de detectar comportamiento sospechoso más allá de lo que el bot declara en el encabezado de la solicitud.
¿Cómo identificar AI bots que falsifican el User-Agent? Por patrones de comportamiento de sesión. Los bots evasivos se revelan por navegación lineal sin desviación, timing milimétrico entre acciones, ausencia de señales de interacción humana como variación de scroll y foco en campos, y patrones sistemáticos de acceso a URLs que ningún usuario real generaría. Una plataforma de protección que trabaja con score de riesgo por solicitud — combinando fingerprint de dispositivo, reputación de red y análisis de comportamiento — detecta esos patrones incluso cuando el User-Agent parece legítimo.










