¿Qué es la Latencia? | Latencia de Red Explicada

La latencia es el retraso de tiempo entre enviar una solicitud y recibir una respuesta, medida en milisegundos. Aprende los 4 componentes de la latencia de red, los valores típicos de RTT por escenario y estrategias para reducir la latencia con edge computing y caché.

La latencia es el retraso de tiempo entre enviar una solicitud y recibir una respuesta. Se mide en milisegundos y afecta cada interacción del usuario en internet.


Resumen La latencia es el tiempo que tardan los datos en viajar de un emisor a un receptor y de vuelta, medido en milisegundos (ms). En redes, la latencia se expresa frecuentemente como RTT (Round-Trip Time / Tiempo de ida y vuelta). La latencia típica de banda ancha es de 10–50 ms a servidores cercanos y de 100–300 ms a servidores en otros continentes. Una latencia superior a 100 ms es perceptible para los usuarios en aplicaciones interactivas. Una latencia superior a 300 ms se considera deficiente. Las cuatro causas principales de latencia son: retraso de propagación (distancia física), retraso de transmisión (ancho de banda), retraso de procesamiento (hardware/software) y retraso de colas (congestión). El edge computing reduce la latencia procesando las solicitudes más cerca de los usuarios en lugar de enrutarlas hacia centros de datos centralizados.


¿Qué es la latencia?

La latencia es el tiempo transcurrido entre el envío de una solicitud y la recepción de una respuesta. En redes, se mide más comúnmente como RTT (Round-Trip Time) — el tiempo que tarda un paquete en viajar del cliente al servidor y de vuelta.

La latencia se mide en milisegundos (ms). Menor latencia significa respuestas más rápidas.

La latencia no es lo mismo que el ancho de banda. El ancho de banda es la cantidad de datos que se pueden transferir por segundo. La latencia es el retraso antes de que comience esa transferencia. Una conexión de alto ancho de banda puede tener alta latencia.


Los 4 componentes de la latencia de red

La latencia de red es la suma de cuatro retrasos distintos:

ComponenteDefinición¿Controlable?
Retraso de propagaciónTiempo para que una señal viaje la distancia física entre emisor y receptor. La luz viaja por fibra a ~200.000 km/s.No — limitado por la física
Retraso de transmisiónTiempo para enviar todos los bits del paquete al cable, dependiente del ancho de banda del enlace.Parcialmente — mejorar el ancho de banda
Retraso de procesamientoTiempo para que routers, switches y servidores inspeccionen y procesen las cabeceras de los paquetes.Sí — optimización de hardware y software
Retraso de colasTiempo que los paquetes esperan en buffers bajo congestión de red.Sí — gestión de tráfico, planificación de capacidad

El retraso de colas es el componente más variable — puede dispararse de casi cero a cientos de milisegundos bajo congestión.


Valores típicos de latencia por escenario

EscenarioLatencia típica
Mismo centro de datos (red local)< 1 ms
Ciudad a ciudad, mismo país5–20 ms
Cruce continental (p. ej., US Este a US Oeste)60–80 ms
Transoceánico (US a Europa)80–120 ms
Transpacífico (US a Asia)150–300 ms
Red móvil 4G30–100 ms
Red móvil 5G1–10 ms
Internet satelital (LEO, p. ej., Starlink)20–60 ms
Internet satelital (GEO)500–700 ms
LAN con cable (Ethernet)< 1 ms

Un servidor en Ciudad de México entrega respuestas en ~15 ms a usuarios en Ciudad de México y en ~170 ms a usuarios en Tokio — no por la velocidad del servidor, sino por la distancia física.


Latencia vs ancho de banda

 LatenciaAncho de banda
DefiniciónRetraso antes de que comience la transferencia de datosRendimiento máximo de datos por segundo
Medido enMilisegundos (ms)Megabits por segundo (Mbps) o Gbps
AnalogíaCuánto tarda en salir el primer camiónCuántos camiones pueden viajar por hora
Afectado porDistancia, enrutamiento, congestión, procesamientoCapacidad del enlace, hardware, protocolo
Mejora conEdge computing, enrutamiento optimizado, cachéActualizar los enlaces de red

Un alto ancho de banda no soluciona la alta latencia. Una conexión de 10 Gbps con 300 ms de latencia seguirá sintiéndose lenta para aplicaciones interactivas.


Impacto de la latencia por tipo de aplicación

AplicaciónLatencia aceptableUmbral de latencia deficientePor qué importa
Carga de página web (TTFB)< 200 ms> 500 msGoogle: el 53% de los usuarios móviles abandonan páginas que tardan más de 3 segundos
Llamadas a APIs< 50 ms> 200 msA 1.000 llamadas/seg, 1 ms extra de latencia = 1 s de sobrecarga añadida
Streaming de video< 150 ms> 500 msCausa buffering e interrupciones de reproducción
Videojuegos en línea< 50 ms> 100 ms”Lag” perceptible que afecta el juego
VoIP / videollamadas< 150 ms> 300 msCausa ecos, interrupciones mutuas, mala calidad de llamada
Trading de alta frecuencia< 1 ms> 5 msDiferencias de microsegundos determinan ganancias y pérdidas
Inferencia de IA en tiempo real< 100 ms> 500 msDetermina si las interfaces con IA se sienten responsivas

Cómo reducir la latencia

Las estrategias más efectivas para reducir la latencia, ordenadas por impacto:

  1. Acercar el cómputo a los usuarios — Procesar solicitudes en servidores cercanos al usuario elimina los viajes transatlánticos. Un usuario en Ciudad de México servido desde un nodo distribuido cercano obtiene entre 5 y 15 ms de latencia en lugar de 150 ms desde un origen en EE.UU.
  2. Cachear contenido en la red distribuida — Servir contenido estático y semi-estático desde nodos de caché distribuidos, eliminando por completo los viajes al origen para los assets en caché.
  3. Usar HTTP/3 y QUIC — QUIC elimina la sobrecarga de la configuración de conexión TCP y maneja la pérdida de paquetes sin bloqueo de cabeza de línea, reduciendo la latencia entre un 10 y 30% en redes móviles.
  4. Terminar TLS cerca de los usuarios — Los handshakes TLS requieren 1–2 viajes de ida y vuelta. Terminar TLS en un nodo distribuido cerca del usuario reduce la latencia del handshake de 200 ms (a un origen lejano) a menos de 10 ms.
  5. Minimizar el tiempo de búsqueda DNS — Usar DNS anycast con puntos de presencia globales. Un DNS lento añade entre 50 y 200 ms a cada nueva conexión.
  6. Reducir el tamaño del payload — Comprimir respuestas con Brotli o gzip. Los payloads más pequeños se transmiten más rápido por el mismo enlace.
  7. Reutilizar conexiones (keep-alive) — Reutilizar conexiones TCP y TLS establecidas elimina la latencia del handshake para solicitudes posteriores al mismo servidor.

Preguntas frecuentes

¿Qué es la latencia en redes? La latencia en redes es el tiempo que tarda un paquete de datos en viajar de un punto a otro y de vuelta, medido en milisegundos. Se expresa comúnmente como RTT (Round-Trip Time). Menor latencia significa tiempos de respuesta más rápidos.

¿Cuál es la diferencia entre latencia y ancho de banda? La latencia es el retraso antes de que comience la transferencia de datos — cuánto tiempo esperas antes de que llegue algo. El ancho de banda es la cantidad de datos que se pueden transferir por segundo — cuánto obtienes una vez que comienza. Una conexión de alto ancho de banda puede tener alta latencia. Ambos importan para el rendimiento pero son independientes entre sí.

¿Qué es el RTT? RTT (Round-Trip Time) es el tiempo que tarda una señal en viajar de un emisor a un receptor y de vuelta. El RTT es la forma más común de medir la latencia de red. El comando ping mide el RTT.

¿Qué causa la alta latencia? Las causas más comunes de alta latencia son: (1) distancia física entre el cliente y el servidor, (2) congestión de red que causa retrasos de colas, (3) demasiados saltos de red entre el origen y el destino, y (4) tiempos de procesamiento lentos del servidor.

¿Qué es una buena latencia para un sitio web? Un Time to First Byte (TTFB) inferior a 200 ms se considera bueno. Un TTFB superior a 500 ms es deficiente. Los Core Web Vitals de Google recomiendan un TTFB inferior a 800 ms para una puntuación aprobatoria, pero inferior a 200 ms para una experiencia de usuario óptima.

¿Cuál es la diferencia entre latencia y ping? El ping es una herramienta de línea de comandos que mide el RTT enviando paquetes ICMP echo a un destino y cronometrando la respuesta. La latencia es el concepto que se mide. El ping es una forma de medirla.

¿Qué es la latencia p95 o p99? La latencia P95 (percentil 95) significa que el 95% de las solicitudes se completan en menos de este tiempo. P99 significa que el 99% se completan más rápido. La latencia mediana (p50) puede verse excelente mientras que p95/p99 son terribles — esas latencias de cola representan usuarios reales con malas experiencias. En sistemas productivos, monitorea p95 y p99, no solo los promedios.

¿El edge computing reduce la latencia? Sí. El edge computing reduce la latencia procesando solicitudes en servidores geográficamente cercanos a los usuarios en lugar de enrutar todo el tráfico a centros de datos centralizados. Un usuario en Ciudad de México servido desde un nodo distribuido en Ciudad de México experimenta entre 5 y 15 ms de latencia en lugar de los 150–300 ms hacia un servidor de origen lejano.

mantente actualizado

Suscríbete a nuestro boletín informativo

Recibe las últimas actualizaciones de productos, destacados de eventos y conocimientos de la industria tecnológica directamente en tu bandeja de entrada.