La latencia es el retraso de tiempo entre enviar una solicitud y recibir una respuesta. Se mide en milisegundos y afecta cada interacción del usuario en internet.
Resumen La latencia es el tiempo que tardan los datos en viajar de un emisor a un receptor y de vuelta, medido en milisegundos (ms). En redes, la latencia se expresa frecuentemente como RTT (Round-Trip Time / Tiempo de ida y vuelta). La latencia típica de banda ancha es de 10–50 ms a servidores cercanos y de 100–300 ms a servidores en otros continentes. Una latencia superior a 100 ms es perceptible para los usuarios en aplicaciones interactivas. Una latencia superior a 300 ms se considera deficiente. Las cuatro causas principales de latencia son: retraso de propagación (distancia física), retraso de transmisión (ancho de banda), retraso de procesamiento (hardware/software) y retraso de colas (congestión). El edge computing reduce la latencia procesando las solicitudes más cerca de los usuarios en lugar de enrutarlas hacia centros de datos centralizados.
¿Qué es la latencia?
La latencia es el tiempo transcurrido entre el envío de una solicitud y la recepción de una respuesta. En redes, se mide más comúnmente como RTT (Round-Trip Time) — el tiempo que tarda un paquete en viajar del cliente al servidor y de vuelta.
La latencia se mide en milisegundos (ms). Menor latencia significa respuestas más rápidas.
La latencia no es lo mismo que el ancho de banda. El ancho de banda es la cantidad de datos que se pueden transferir por segundo. La latencia es el retraso antes de que comience esa transferencia. Una conexión de alto ancho de banda puede tener alta latencia.
Los 4 componentes de la latencia de red
La latencia de red es la suma de cuatro retrasos distintos:
| Componente | Definición | ¿Controlable? |
|---|---|---|
| Retraso de propagación | Tiempo para que una señal viaje la distancia física entre emisor y receptor. La luz viaja por fibra a ~200.000 km/s. | No — limitado por la física |
| Retraso de transmisión | Tiempo para enviar todos los bits del paquete al cable, dependiente del ancho de banda del enlace. | Parcialmente — mejorar el ancho de banda |
| Retraso de procesamiento | Tiempo para que routers, switches y servidores inspeccionen y procesen las cabeceras de los paquetes. | Sí — optimización de hardware y software |
| Retraso de colas | Tiempo que los paquetes esperan en buffers bajo congestión de red. | Sí — gestión de tráfico, planificación de capacidad |
El retraso de colas es el componente más variable — puede dispararse de casi cero a cientos de milisegundos bajo congestión.
Valores típicos de latencia por escenario
| Escenario | Latencia típica |
|---|---|
| Mismo centro de datos (red local) | < 1 ms |
| Ciudad a ciudad, mismo país | 5–20 ms |
| Cruce continental (p. ej., US Este a US Oeste) | 60–80 ms |
| Transoceánico (US a Europa) | 80–120 ms |
| Transpacífico (US a Asia) | 150–300 ms |
| Red móvil 4G | 30–100 ms |
| Red móvil 5G | 1–10 ms |
| Internet satelital (LEO, p. ej., Starlink) | 20–60 ms |
| Internet satelital (GEO) | 500–700 ms |
| LAN con cable (Ethernet) | < 1 ms |
Un servidor en Ciudad de México entrega respuestas en ~15 ms a usuarios en Ciudad de México y en ~170 ms a usuarios en Tokio — no por la velocidad del servidor, sino por la distancia física.
Latencia vs ancho de banda
| Latencia | Ancho de banda | |
|---|---|---|
| Definición | Retraso antes de que comience la transferencia de datos | Rendimiento máximo de datos por segundo |
| Medido en | Milisegundos (ms) | Megabits por segundo (Mbps) o Gbps |
| Analogía | Cuánto tarda en salir el primer camión | Cuántos camiones pueden viajar por hora |
| Afectado por | Distancia, enrutamiento, congestión, procesamiento | Capacidad del enlace, hardware, protocolo |
| Mejora con | Edge computing, enrutamiento optimizado, caché | Actualizar los enlaces de red |
Un alto ancho de banda no soluciona la alta latencia. Una conexión de 10 Gbps con 300 ms de latencia seguirá sintiéndose lenta para aplicaciones interactivas.
Impacto de la latencia por tipo de aplicación
| Aplicación | Latencia aceptable | Umbral de latencia deficiente | Por qué importa |
|---|---|---|---|
| Carga de página web (TTFB) | < 200 ms | > 500 ms | Google: el 53% de los usuarios móviles abandonan páginas que tardan más de 3 segundos |
| Llamadas a APIs | < 50 ms | > 200 ms | A 1.000 llamadas/seg, 1 ms extra de latencia = 1 s de sobrecarga añadida |
| Streaming de video | < 150 ms | > 500 ms | Causa buffering e interrupciones de reproducción |
| Videojuegos en línea | < 50 ms | > 100 ms | ”Lag” perceptible que afecta el juego |
| VoIP / videollamadas | < 150 ms | > 300 ms | Causa ecos, interrupciones mutuas, mala calidad de llamada |
| Trading de alta frecuencia | < 1 ms | > 5 ms | Diferencias de microsegundos determinan ganancias y pérdidas |
| Inferencia de IA en tiempo real | < 100 ms | > 500 ms | Determina si las interfaces con IA se sienten responsivas |
Cómo reducir la latencia
Las estrategias más efectivas para reducir la latencia, ordenadas por impacto:
- Acercar el cómputo a los usuarios — Procesar solicitudes en servidores cercanos al usuario elimina los viajes transatlánticos. Un usuario en Ciudad de México servido desde un nodo distribuido cercano obtiene entre 5 y 15 ms de latencia en lugar de 150 ms desde un origen en EE.UU.
- Cachear contenido en la red distribuida — Servir contenido estático y semi-estático desde nodos de caché distribuidos, eliminando por completo los viajes al origen para los assets en caché.
- Usar HTTP/3 y QUIC — QUIC elimina la sobrecarga de la configuración de conexión TCP y maneja la pérdida de paquetes sin bloqueo de cabeza de línea, reduciendo la latencia entre un 10 y 30% en redes móviles.
- Terminar TLS cerca de los usuarios — Los handshakes TLS requieren 1–2 viajes de ida y vuelta. Terminar TLS en un nodo distribuido cerca del usuario reduce la latencia del handshake de 200 ms (a un origen lejano) a menos de 10 ms.
- Minimizar el tiempo de búsqueda DNS — Usar DNS anycast con puntos de presencia globales. Un DNS lento añade entre 50 y 200 ms a cada nueva conexión.
- Reducir el tamaño del payload — Comprimir respuestas con Brotli o gzip. Los payloads más pequeños se transmiten más rápido por el mismo enlace.
- Reutilizar conexiones (keep-alive) — Reutilizar conexiones TCP y TLS establecidas elimina la latencia del handshake para solicitudes posteriores al mismo servidor.
Preguntas frecuentes
¿Qué es la latencia en redes? La latencia en redes es el tiempo que tarda un paquete de datos en viajar de un punto a otro y de vuelta, medido en milisegundos. Se expresa comúnmente como RTT (Round-Trip Time). Menor latencia significa tiempos de respuesta más rápidos.
¿Cuál es la diferencia entre latencia y ancho de banda? La latencia es el retraso antes de que comience la transferencia de datos — cuánto tiempo esperas antes de que llegue algo. El ancho de banda es la cantidad de datos que se pueden transferir por segundo — cuánto obtienes una vez que comienza. Una conexión de alto ancho de banda puede tener alta latencia. Ambos importan para el rendimiento pero son independientes entre sí.
¿Qué es el RTT? RTT (Round-Trip Time) es el tiempo que tarda una señal en viajar de un emisor a un receptor y de vuelta. El RTT es la forma más común de medir la latencia de red. El comando ping mide el RTT.
¿Qué causa la alta latencia? Las causas más comunes de alta latencia son: (1) distancia física entre el cliente y el servidor, (2) congestión de red que causa retrasos de colas, (3) demasiados saltos de red entre el origen y el destino, y (4) tiempos de procesamiento lentos del servidor.
¿Qué es una buena latencia para un sitio web? Un Time to First Byte (TTFB) inferior a 200 ms se considera bueno. Un TTFB superior a 500 ms es deficiente. Los Core Web Vitals de Google recomiendan un TTFB inferior a 800 ms para una puntuación aprobatoria, pero inferior a 200 ms para una experiencia de usuario óptima.
¿Cuál es la diferencia entre latencia y ping? El ping es una herramienta de línea de comandos que mide el RTT enviando paquetes ICMP echo a un destino y cronometrando la respuesta. La latencia es el concepto que se mide. El ping es una forma de medirla.
¿Qué es la latencia p95 o p99? La latencia P95 (percentil 95) significa que el 95% de las solicitudes se completan en menos de este tiempo. P99 significa que el 99% se completan más rápido. La latencia mediana (p50) puede verse excelente mientras que p95/p99 son terribles — esas latencias de cola representan usuarios reales con malas experiencias. En sistemas productivos, monitorea p95 y p99, no solo los promedios.
¿El edge computing reduce la latencia? Sí. El edge computing reduce la latencia procesando solicitudes en servidores geográficamente cercanos a los usuarios en lugar de enrutar todo el tráfico a centros de datos centralizados. Un usuario en Ciudad de México servido desde un nodo distribuido en Ciudad de México experimenta entre 5 y 15 ms de latencia en lugar de los 150–300 ms hacia un servidor de origen lejano.