Elecciones 2026Vea quién creemos que merece su voto, según nuestros criteriosLa guía →
ESCRITO EN ESPAÑOL CLARO.
CLAY TRIBUNE.
Publicidad

Cloudflare recupera más de 100 TB de RAM con una sola corrección de algoritmo

Un solo ajuste en el algoritmo recuperó más de 100TB de RAM en toda la vasta red de Cloudflare, demostrando que el ahorro de memoria proviene de mejores matemáticas, no de máquinas más grandes.

Por mitch·4 min de lectura
A vast data center glows with countless server lights, a testament to the unseen battle for every byte of memory.

Cloudflare acaba de recuperar más de 100 terabytes de RAM en toda su red, y la solución fue un simple ajuste de algoritmo, no un nuevo rack de servidores. Los ingenieros de la empresa detectaron un uso excesivo de memoria en uno de sus servicios de balanceo de carga, lo corrigieron con mejores matemáticas y liberaron suficiente espacio como para medirlo en terabytes.

La historia proviene de una publicación en el blog de Cloudflare, que explica cómo el enrutador de backend basado en Pingora de la empresa retenía mucha más memoria de la que necesitaba. El culpable era una biblioteca llamada pingora-ketama, que gestiona el hashing consistente, una forma de distribuir las solicitudes entre servidores para que agregar o quitar una máquina no rompa todo.

Qué hace el hashing consistente

El hashing consistente funciona convirtiendo cada servidor y cada solicitud en un número sobre una línea. Cada servidor obtiene un lugar en esa línea, y las solicitudes llegan al servidor que está a su izquierda. El truco es que los hashes son números aleatorios, por lo que los lugares no son iguales: algunos servidores terminan con muchísimas más solicitudes que otros.

Publicidad

Los ingenieros de Cloudflare notaron este desequilibrio en un ticket presentado por Ivan. El servicio estaba usando «significativamente más memoria de la esperada» en estructuras vinculadas a pingora-ketama. La solución no fue una granja de servidores más grande. Fue una comprensión más profunda de cómo estaban cayendo los números.

Las matemáticas detrás del uso

La idea clave es que las funciones hash producen números aleatorios, y los números aleatorios no se distribuyen de manera uniforme. La publicación del blog recorre las estadísticas: el valor esperado indica dónde se ubica el centro de una distribución, y la desviación estándar indica cuánto se dispersa el resto. Para cien servidores, las matemáticas mostraban que cada servidor debería manejar alrededor del 0,99% de la carga total, y la mayoría caía dentro del 1% de esa marca.

Pero eso es una fracción del total. La publicación del blog describe el cálculo del coeficiente de variación, que mide cuánto varían los tamaños reales respecto de los esperados. El principio: como los hashes son esencialmente aleatorios, los tamaños de las regiones asignadas a cada servidor se desviarán naturalmente de lo que predice el valor esperado.

Cómo solucionarlo con más hashes

La solución no es una máquina más grande. Son más hashes. Al darle a cada servidor múltiples puntos en la recta numérica, Cloudflare distribuyó la carga de manera más uniforme. El blog lo describe como convertir cada herramienta en un martillo: el problema siempre se trata de cómo caen los hashes.

El resultado es un servicio basado en Pingora que utiliza menos memoria en general. Cloudflare no compró hardware nuevo. Solo hizo que los números cayeran mejor.

La magnitud del logro

Cloudflare opera miles de servidores con petabytes de RAM y millones de núcleos de CPU. Incluso una pequeña mejora a esa escala se acumula rápidamente. La compañía dice que las pequeñas ganancias del 1 % a la vez merecen celebrarse, y esta fue más allá: más de 100 TB de RAM recuperados, además de los 100 TB que el equipo de DNS liberó el mes pasado.

Ese es un número real. No es un gráfico ni una tabla: es capacidad real liberada por unas pocas líneas de código. El equipo de Rendimiento ayuda a mantener un uso compartido equitativo de los recursos entre los equipos, y esta corrección ayuda a mantener los recursos justos.

Datos clave

  • Memoria liberada: más de 100 TB de RAM a nivel global
  • Ahorro previo: 100 TB liberados por el equipo de DNS el mes pasado
  • Algoritmo involucrado: pingora-ketama, una biblioteca de hashing consistente
  • Enfoque de la corrección: agregar más hashes para equilibrar la carga
  • Descubierto por: Ivan, quien presentó un ticket señalando un uso excesivo de memoria

Cronología

Fecha Evento
El mes pasado El equipo de DNS libera 100TB de RAM
Reciente Ivan reporta un ticket por memoria excesiva
Reciente Se aplica la solución, liberando más de 100TB de RAM

Este es el tipo de logro de ingeniería que rara vez aparece en los titulares, pero que es de suma importancia para las empresas que operan a la escala de Cloudflare. La memoria ahora está disponible para otros servicios, y la solución es un recordatorio de que a veces la mejor optimización no es un nuevo servidor, sino una mejor manera de asignar el trabajo.

Fuente: “Saving another 100TB of RAM”, cloudflare.com.

El Cuaderno

Recibe El Cuaderno.

Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

Enviamos una nota para confirmar. Cada número trae un enlace para darte de baja con un clic.

Publicidad

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Como Afiliado de Amazon, Clay Tribune obtiene ingresos por las compras adscritas que cumplen los requisitos aplicables.