Se mire por donde se mire (cantidad, metros cuadrados, porcentaje del sector), Amazon Web Services (AWS) tiene una de las mayores huellas de centros de datos del mundo.

En total, la nube de AWS abarca 114 zonas de disponibilidad en 36 regiones, y cada zona de disponibilidad puede ser atendida por uno o varios centros de datos. Este número crece constantemente.

Cada centro de datos cuenta con innumerables conexiones internas y externas, y con ello viene un sistema de redes tremendamente complejo, diseñado y desarrollado en su mayor parte por AWS.

"Empezamos a desarrollar nuestro propio hardware hace unos 15 años", nos contó Matt Rehder, vicepresidente de redes centrales de AWS.

La razón de esta decisión, que queda clara cuando Rehder detalla las redes de los centros de datos de AWS, es la necesidad de simplicidad y escalabilidad.

"Las empresas utilizan hardware ligeramente diferente en cada una de esas funciones: conectar los servidores o conectar diferentes centros de datos", afirma Rehder. "AWS es un poco diferente en ese sentido porque, hace muchos años, decidimos tener básicamente lo mismo en todas partes para hacernos la vida más fácil"

Por supuesto, "más sencillo" es un término relativo. Conectar centros de datos masivos con cientos o miles de servidores nunca puede considerarse "sencillo"

Pero, en un intento por hacernos la vida más fácil, AWS ha desarrollado lo que denomina "Brick", un rack de conmutadores de red AWS.

"Es un bloque de construcción, y podemos utilizar Bricks donde necesitemos, y luego hacemos que algunos de ellos sean funcionalmente únicos con algunos cambios de software", explica Rehder.

Cada centro de datos de AWS tiene muchos Bricks, que pueden "conectar un grupo de servidores a la red, conectar otros centros de datos de AWS en la región local, conectarse a redes de terceros o incluso conectar regiones de AWS a través de largas distancias."

Se carga un software ligeramente diferente en un Brick dependiendo de la tarea, pero "bajo las cubiertas, parecen casi idénticos", dice Rehder. Esto se aplica incluso a las zonas locales de AWS o, hasta cierto punto, a los puestos avanzados.

Las zonas locales son una de las ofertas "Edge" de AWS y acercan la nube de AWS a los usuarios finales en un centro de datos donde la empresa no tiene una región de nube.

En algunos casos, se trata de centros de datos de terceros, pero según Rehder, cada vez son más las instalaciones propiedad de Amazon que no forman parte de una región geográfica de nube.

"Si entras en una instalación de Local Zones, se parece mucho a uno de nuestros otros centros de datos", dice. "Hay algunas variaciones menores, por ejemplo, añadimos algunas capas adicionales de seguridad y resistencia porque está más cerca de la propia región"

Los Outposts, por otro lado, son la oferta local de AWS en la que el hardware de AWS va al centro de datos de un cliente.

Aunque Rehder afirma que los Outposts son "diferentes" por su naturaleza, dice que: "Intentamos que sea lo más parecido posible a una experiencia AWS pura, por lo que son los mismos servidores que utilizamos y los mismos conceptos de red efectivos, pero suele haber algunas capas adicionales por encima para integrarse en la red del cliente en el edificio."

Brick a brick

Los Bricks de AWS son de diseño propio, y dentro del propio brick, la compañía también proporciona hardware de red y conmutadores.

"El hardware", señala Rehder, "tiene un único ASIC de conmutación en su interior, una estrategia que difiere de la mayoría de los proveedores, que tendrán múltiples chips para esta tarea."

"Esto está muy bien para determinados lugares, pero como hay muchos chips conectados dentro del sistema, hay mucha complejidad interna en el conmutador, en el router, y eso es difícil de ver o gestionar", argumenta Rehder. "Es mucho más fácil si lo divides en unidades primitivas, como la unidad atómica, y me das un solo chip en un dispositivo."

AWS no fabrica realmente el ASIC (ni especifica qué empresa lo hace) que va en los conmutadores de red, pero sí establece las especificaciones para los componentes y el comportamiento del conmutador, además de buscar iterativamente mejorar su diseño de software y hardware.

"Seguimos teniendo dispositivos de proveedores y, según nuestra experiencia, nuestros conmutadores son mucho mejores que los suyos"

Otra área del hardware en la que AWS "ha profundizado mucho" es la de los transceptores ópticos, que hacen pasar el láser por la fibra de los cables.

Rehder explica que los conmutadores de red de AWS pueden tener 32 o 64 puertos, lo que crea una "complejidad realmente fascinante."

"En la época de los 10G o 25G, los transceptores ópticos eran fiables en general, pero cada vez es más complicado hacer pasar más velocidad por la fibra, y a medida que hemos llegado, por ejemplo, a los 400G u 800G, la fiabilidad ha disminuido", afirma.

AWS Networking 2
– AWS

"Empezamos a hacer inversiones materiales y a profundizar en la especificación del funcionamiento de estos diseños de módulos ópticos, y a tratar de entender por qué fallaban los enlaces.

"Eso nos llevó a invertir mucho en nuestra planta de fibra y en cómo rediseñamos los módulos para hacerlos más sencillos y fiables"

"La mayor inversión", dice Rehder, "fue en el software que se ejecuta en estos módulos".

"Hace dos o tres años, decidimos empezar a invertir en ello, y ahora somos propietarios de todo el software que se ejecuta en esos modelos, y los parcheamos activamente todo el tiempo", explica. "Ahora, nuestra generación de 400G es más fiable que la de 100G. Es una gran ventaja para nosotros, especialmente con GenAI, donde hay más enlaces y las cargas de trabajo en general son más sensibles a los fallos."

Mucho cableado

Conectar todo este hardware es, por decirlo educadamente, mucho cableado.

Los conmutadores de red se apilan y conectan entre sí en el bastidor, y luego se conectan a los bastidores de servidores de AWS mediante cables de fibra óptica. Según Rehder, los cables dentro de los bastidores utilizan cobre (y señala que el cobre es "mucho más elegante" que antes), pero esto no es posible fuera del bastidor debido a las limitaciones de distancia.

Cuando se le pregunta cuánto cableado tiene AWS, Rehder se ríe. "Tenemos muchos, muchos, muchos kilómetros de cables. No sé la cifra exacta, pero sin duda es una de las partes más difíciles de las redes de los centros de datos".

"El mayor centro de datos de IA que tenemos tiene más de 100.000 enlaces o conexiones de fibra dentro de un edificio"

Rehder estima que, dada la "enorme densidad de conexiones de fibra en todos los centros de datos de AWS", un solo centro de datos podría tener cientos o miles de kilómetros de cables de fibra en su interior, y todos ellos tienen que estar organizados con mucho cuidado. Esto, al parecer, no es tan sencillo como un simple método de coordinación por colores.

"En el último año de mi trabajo, probablemente he dedicado más tiempo a los cables de fibra que a cualquier otra parte de la pila tecnológica", subraya Rehder.

Cuando se establece un nuevo centro de datos, Rehder dice que la empresa quiere aumentar la capacidad lo antes posible, y esto significa traer todos los bastidores y cables de red y enchufarlos. "Es un trabajo muy real, físico, y el volumen de cables es muy alto. Cuantas más conexiones tengas que instalar, más tiempo tendrás"

También reitera que no es como enchufar una toma de corriente: cuando se trabaja con fibra, cualquier perturbación puede provocar una degradación de la señal.

Para ello, AWS utiliza el "cableado estructurado", que Rehder ilustra con una analogía vial.

"Puedes enrutar o agrupar montones de pequeños pares o hilos de vidrio en estructuras físicas creativas. Básicamente tienes una autopista de estos cables, y pueden ser densos - con cientos o miles de las fibras liadas en ellos, que van entre habitaciones o filas, y luego se rompen en salidas más pequeñas y rampas de salida en "calles" más pequeñas que fluyen a los bastidores."

Por lo tanto, al utilizar conectores de mayor densidad, AWS puede reducir el número de cosas que hay que instalar o tocar con el tiempo.

Esto ahorra tiempo en el despliegue real, pero añade franjas de complejidad durante la fase de planificación.

Aprendizaje automático

La compañía aplica una estrategia que denomina "sobre suscripción" a sus redes en los centros de datos.

Rehder lo explica como tener "más capacidad de cara a los servidores de la que podrían tener para hablar con Internet o para hablar entre centros de datos" La empresa puede equilibrar esto "dinámicamente" cuando despliega capacidad, de modo que puede "subir o bajar el dial en función de las cargas de trabajo de los servidores que tenemos", añade.

Esto, sin embargo, no se aplica con la misma eficacia al hardware de IA o aprendizaje automático. Aunque el modelo de sobresuscripción permite a AWS "marcar" más capacidad, Rehder señala que un servidor de aprendizaje automático o IA generativa a menudo necesitará "dos o tres veces el ancho de banda que tendrían otros servidores."

"Muchas de las redes de ML no están sobresuscritas, lo que significa que construyes la capacidad para que todos los servidores puedan efectivamente hablar entre sí a la vez, pero es algo que nuestra arquitectura fundamental y nuestros bricks nos permiten hacer con relativa facilidad", dice. "Es el mismo hardware, los mismos switches, el mismo concepto, el mismo sistema operativo"

En todo el sector, el hardware de IA se renueva a gran velocidad, y Nvidia ha pasado a una hoja de ruta con actualizaciones anuales para sus GPU. No ocurre lo mismo con las redes, ya que Rehder señala que surgen nuevas generaciones cada tres o cuatro años.

"Depende de hacia dónde se dirija el hardware de la industria", afirma Rehder. "Al permanecer en las generaciones un poco más, se llega a un nivel de madurez en el que es más fácil y más fiable para los clientes si no se están haciendo cambios todo el tiempo."

"Se está yendo un poco más rápido en este momento, pero todavía es pronto en términos de demanda de IA generativa. Todavía no hemos introducido nuestros ciclos de actualización de hardware, estamos más pendientes de cuándo llegará la próxima generación y de si queremos hacerlo cuando lo haríamos normalmente o intentar adelantarnos un poco."

Un cambio tecnológico que Rehder considera potencialmente interesante en el contexto de la ML es la óptica coempaquetada. Se trata de una integración avanzada de óptica y silicio en un único sustrato empaquetado, y su objetivo es ayudar a aumentar el ancho de banda al tiempo que se reduce el consumo de energía. Sin embargo, la tecnología sigue obstinadamente en el horizonte, perpetuamente lista para ver la luz "el año que viene".

AWS logos
– Sebastian Moss

"Hay ventajas en el menor consumo de energía y en las distancias cortas que recorren las cosas. Pero si incorporas toda la óptica al conmutador, ya tienes todos los costes asociados, y si no vas a utilizar todos los puertos del conmutador para conectar algo, hay un coste extra asociado."

AWS también está estudiando otras tecnologías emergentes, pero aún no se han implantado.

Sin embargo, es más optimista sobre el potencial de la fibra hueca, aunque señala que es probable que desempeñe un papel más importante fuera del centro de datos que dentro.

AWS puso la fibra de núcleo hueco en producción por primera vez en 2024. Aunque puede reducir la latencia, dentro de un centro de datos propiamente dicho, la reducción es insignificante.

"La latencia dentro del centro de datos ya es relativamente baja desde la fibra en el edificio - son todos tramos cortos, y hay una ventaja marginal para reducirla aún más".

"De las pruebas realizadas y de las conversaciones mantenidas con los clientes se desprende que un par de puntos porcentuales de reducción de la latencia no suponen un gran avance en términos de rendimiento", se encoge de hombros Rehder.

La fiabilidad manda

Aunque la tecnología nueva y experimental siempre es emocionante, para una empresa del tamaño de AWS, la fiabilidad y el tiempo de actividad son lo más importante para los clientes.

Mientras AWS estudia nuevas soluciones, Rehder explica que siempre existe la pregunta de si podrán hacer algo fundamentalmente diferente con el nuevo hardware; y si la respuesta es que no, entonces "no vemos ninguna ventaja en ello", afirma.

Y añade: cambiar a un nuevo hardware conlleva otros riesgos, y no es nada en contra de ninguno de los proveedores; siempre hay más problemas y fallos cuando se está aprendiendo".

Las nuevas generaciones siempre van a ser más complejas, y cuando se trata de hacer las cosas más rápido, más grandes y mejor, y de superar muchos límites en muchos procesos diferentes, el salto al siguiente nivel de complejidad va a ser aún más difícil que el anterior".

"Va a haber mucho que aprender, por ejemplo, en los procesos de fabricación y diseño. Intentamos que nuestros clientes no pasen por eso. Preferimos haber resuelto ya los problemas y saber que va a funcionar a gran escala"

Con este telón de fondo, las interrupciones a gran escala causadas por las redes son muy raras, pero parte de prevenirlas consiste en estar siempre preparado.

Como dice Rehder: "Todo falla. Todo fallará más de lo que te esperas, y fallará de formas únicas, emocionantes y creativas."

Al optar por una solución de red "más sencilla", Rehder y AWS esperan evitar demasiadas emociones de este tipo en el futuro.


Este reportaje ha sido traducido y editado al español por Gabriel Carrillo M-Feduchi