Deje que Soni Jiandani hable y contará historias de los primeros días de Internet.

“Fui testigo de la revolución de Internet; duró aproximadamente una década y media y fue increíble”, recuerda. Ahora, mientras desarrolla el grupo de infraestructura de redes de AMD y aumenta la competencia contra Nvidia, ve ecos de esa época transformadora.

"Estoy emocionadísima", dice. "Con la edad, es más difícil entusiasmarse, pero este es un momento emocionante para nuestra industria".

Unirse a AMD

Después de casi dos décadas en Cisco, entre períodos en varias empresas de redes, Jiandani cofundó Pensando Systems en 2017.

La empresa desarrolla unidades de procesamiento de datos (DPU), también conocidas como SmartNIC, que desplazan el procesamiento de redes de la CPU y la GPU, liberándolas para que se concentren en sus cargas de trabajo reales.

Tras la adquisición por parte de Nvidia de su mayor rival en redes, Mellanox, AMD adquirió Pensando en 2022 por 1.900 millones de dólares, un año antes de que el momento ChatGPT demostrara la necesidad de contar con sistemas estrechamente conectados en red.

O4B7MonhZ4cHMlEF.width-358
– AMD Pensando

"Ha sido una experiencia realmente emocionante para nosotros", dice Jiandani. "En general, el camino ha sido positivo. Hemos tenido clientes que nos han visto como una startup y nos han dicho: 'No estoy muy seguro de querer trabajar con una startup, porque no sé en qué manos estará'. Así que, al formar parte de la familia AMD, saben que AMD se toma en serio el desarrollo de sistemas de IA".

"Sistemas" es una palabra que Jiandani repite durante nuestra conversación. "Lo que hace único a este equipo es que trabajamos a nivel de sistemas", dice. "No solo pensamos en software, dispositivos o componentes, pensamos en sistemas".

“Al construir un sistema distribuido, que es lo que es una red, no se puede pensar en él de forma aislada. Hay que pensar en '¿Cómo se comunicarán entre sí? ¿Cómo interoperarán? ¿Qué hago en caso de fallo? ¿Cómo me recupero de un fallo? ¿Cómo lo hago funcional? ¿Cómo les doy observabilidad? ¿Cómo configuro un bucle de retroalimentación para poder añadir más inteligencia?'. Es una habilidad única que tenemos en nuestra organización. AMD ha sido excepcional al combinar su experiencia en CPU y GPU con nuestra experiencia en DPU”, continua.

Los esfuerzos de redes de Pensando y AMD

Pensando es ahora clave para las iniciativas de redes de AMD, pero sigue siendo un equipo pequeño. "Creo que es muy importante que seamos un equipo más pequeño para poder adaptarnos", dice Jiandani. "Somos más ágiles. No somos miles de personas intentando integrarse en decenas de miles. Somos cientos de personas que se están incorporando, lo que nos permite ser más ágiles".

"Está sucediendo a una velocidad tan alta que necesito ser ágil".

Por supuesto, mientras hablamos, AMD se prepara para integrar un negocio significativamente mayor. En agosto pasado, la compañía anunció sus planes de adquirir ZT Systems por 4.900 millones de dólares, acuerdo que se cerrará en marzo.

El fabricante de servidores a gran escala tiene varios miles de empleados, pero AMD dijo que se separará y venderá los activos de fabricación de ZT, centrándose, en cambio, en las capacidades de diseño de sistemas.

"ZT Systems nos va a ayudar a nivel de empresa a pensar en implementar el sistema a nivel de rack", afirma Jiandani.

Ese es el equipo que integra todo: nuestros sistemas de GPU, recursos de red, CPU y todos los sistemas de refrigeración líquida y por aire, en una arquitectura de diseño de referencia. Todos forman parte del grupo del centro de datos.

Como división, el negocio de centros de datos de AMD ha sido una rareza. La compañía ha registrado un crecimiento récord de ingresos, casi duplicándolos solo en 2024, pero aún se considera un competidor mediocre en comparación con las impresionantes ganancias de su rival Nvidia.

Pero, al igual que busca reducir el liderazgo de Nvidia en GPU impulsando un enfoque más abierto, AMD espera impulsar un enfoque de sistemas más abierto para captar clientes. "Solo para mencionar las diferencias con Mellanox", añade su colega Eddie Tan, "cuando el mercado dice 'Necesito una opción', no necesito decir 'Este es el rack, lo tomas o lo dejas'. No voy a decir 'Tienes que comprarme todos los componentes'".

Nvidia ha favorecido principalmente InfiniBand, el estándar de red informática de alto rendimiento del que Mellanox es el único proveedor restante, mientras que AMD ha apostado todo por Ethernet.

“Ethernet ha demostrado ser una solución escalable”, afirma Jiandani. “Algunos clientes están abandonando la tecnología propietaria simplemente porque no es escalable. Ethernet, dado su alto consumo, tiene un coste completamente diferente al de InfiniBand. Así que, como mínimo, sí, se obtiene una ventaja en cuanto a costes”.

Productos de IA postgenerativa

La compañía es uno de los miembros más activos del Consorcio Ultra Ethernet (UEC). Y, si bien el UEC ha retrasado el lanzamiento de la versión 1.0 de la especificación, AMD ya ha presentado la tarjeta de red Pollara 400 AI, compatible con el UEC. Cabe destacar que Nvidia también ofrece productos Ethernet y se unió discretamente al UEC el año pasado. Dado que InfiniBand le otorga mayor control y mayores márgenes, no anunció públicamente la decisión.

“Si eres una empresa o un proveedor de nube de nivel 2, buscas una experiencia inmediata al construir redes escalables”, afirma Jiandani. “Por lo tanto, dado que Pollara 400 cumple con la normativa UEC desde el primer día, no tienes que preocuparte de si tus desarrolladores tienen que construir una implementación escalable de una red back-end. En cambio, si eres un cliente de hiperescala de nivel 1, tienes tu propio transporte único y quieres que el sistema de IA se conecte a él y a tu proveedor de conmutadores Ethernet preferido. Podemos satisfacer ambas necesidades”.

Pollara 400 para backend y Salina 400 DPU para redes frontend son los primeros productos de IA verdaderamente posgenerativos de Pensando. «Llevamos distribuyendo Elba [predecesor de Salina] desde 2022; está en producción en Oracle Cloud, Microsoft Azure e IBM Cloud», afirma Jiandani.

La mayor parte de estas implementaciones se han implementado a gran escala durante los últimos 18 meses y, en algunos casos, prevemos que la DPU estará en producción con implementación continua hasta el año 2027, es decir, cinco años. En otros casos, el cliente se migrará a Salina en los próximos 12 meses, por lo que la transición podría tener una duración de tres años.

En el caso de Microsoft, no está claro cuánto tiempo usará Elba y Salina. La compañía lleva mucho tiempo desarrollando su propio sistema FPGA: «No es ningún secreto que Microsoft cuenta con un FPGA SmartNIC interno», afirma Tan. «El problema con el FPGA es que no es tan flexible ni rápido, y no permite soportar servicios concurrentes a gran escala. Por eso, incluso a pesar de que ya cuentan con el FPGA SmartNIC, siguen recurriendo a nosotros para solucionar algunos de los desafíos que enfrentan».

Sin embargo, poco después de nuestra conversación, Microsoft anunció que implementaría su propia DPU interna, tras adquirir el fabricante de DPU Fungible hace unos dos años. Es demasiado pronto para saber si adoptará completamente el silicio personalizado o si lo utilizará para mantener la presión sobre los precios, ya que las empresas de la nube han usado sus propios chips de IA para obtener concesiones de los fabricantes de GPU.

Lo que sí está claro, sin embargo, es que Microsoft y otros rivales en la nube y la IA están dispuestos a implementar clústeres a una escala inimaginable. "Sabemos que el clúster de 100.000 GPU está bastante bien documentado", afirma Jiandani. "Y cuando hablamos con algunos de los hyperscalers más grandes, nos hablan de cifras que apuntan a alcanzar hasta un millón de GPU, basándose en el crecimiento de los grandes modelos de lenguaje".

Tan añade: «Y muy pronto descubrirán que el clúster se va a gastar incluso en todo el campus del centro de datos. ¿Cómo se puede siquiera soportar eso? Redes Ethernet ubicuas».

Lograr un crecimiento tan rápido, argumenta Jiandani, requiere pensarlo a nivel de ecosistema, no solo con la visión de una empresa. "Creo que, con el crecimiento de los modelos, nuestra capacidad para construir un sistema más equilibrado es fundamental", argumenta. "Ninguna empresa podrá lograrlo sola. Por eso, las alianzas, el ecosistema y las estrechas relaciones de trabajo que tenemos colectivamente como industria son clave".