Por Charlotte Trueman, Editora de computación, almacenamiento y redes en DCD
"Rechazamos rotundamente la idea de que una empresa pueda tener el monopolio de la IA o de la innovación en IA", afirmó la semana pasada Forrest Norrod, vicepresidente ejecutivo y director general del grupo de soluciones de centros de datos de AMD.
Esa empresa es, por supuesto, Nvidia, actualmente valuada en 3,5 billones de dólares y la segunda organización más valiosa del mundo en el momento de esta publicación.
Si bien AMD no está exactamente en apuros (está valuada en 197 mil millones de dólares), la compañía parece haberse dado cuenta de que tratar de superar a Nvidia no es un plan comercial viable, por lo que decidió apostar todo por promover un enfoque de estándares abiertos para la innovación en IA y ganarse a los clientes que pueden haberse cansado del jardín amurallado de Nvidia.
Durante su discurso de apertura en la conferencia Advancing AI de la compañía en San José, California, la semana pasada, la directora ejecutiva, Dra. Lisa Su, dijo que AMD es "la única compañía comprometida con la apertura en hardware, software y soluciones", y agregó que tanto para el fabricante de chips como para la industria en general, "la apertura no debería ser solo una palabra de moda".
AMD cerró recientemente la adquisición del fabricante de servidores a hiperescala ZT Systems, además de adquirir la startup de fotónica de silicio Enosemi, la empresa de optimización de software de IA Brium, y traerá a la empresa a los ingenieros de hardware y software de Untether AI, recientemente clausurada.
“En los últimos años, durante el último año, hemos realizado más de 25 inversiones estratégicas que han sido una excelente manera de construir nuevas relaciones y también apoyar a los líderes de IA, software y hardware del mañana”, dijo Su durante su discurso.
Unión
La red es una de esas áreas en las que AMD se ha comprometido plenamente con un enfoque de ecosistema abierto, principalmente a través de su trabajo con Ultra Ethernet Consortium (UEC) y Ultra Accelerator Link (UALink), el primero del cual AMD es miembro fundador.
Tal y como explica Soni Jiandani, vicepresidente del grupo de soluciones tecnológicas y de redes de AMD, cuando se trata de redes de IA, "las únicas dos opciones... que los clientes tienen a su disposición hoy en día son InfiniBand, que no escala, o Ethernet, que escala, pero no fue diseñado para ejecutar redes de IA".
Con respecto a las redes de escalamiento horizontal, Jiandani dice que, a través del trabajo realizado por la UEC, los involucrados en el proyecto de estándar abierto ahora pueden escalar su red 20 veces más, en comparación con InfiniBand, y 10 veces más en comparación con Ethernet clásico.
La UEC lanzó su especificación 1.0 la semana pasada, y AMD anunció que Oracle Cloud Infrastructure implementaría lo que afirma ser la primera NIC compatible con Ultra Ethernet, la Pensando Pollara 400. Diseñada para soportar entornos de escalamiento que contengan hasta un millón de GPU, AMD dice que su tarjeta de red Pollara 400 ofrece un rendimiento RDMA un 10 por ciento mayor en comparación con la CX7 de Nvidia y puede mejorar el rendimiento RDMA en un 25 por ciento en comparación con RoCEv2 tradicional.
Además, Jiandani dijo que el trabajo que está realizando el consorcio UALink también promete ofrecer redes con el doble de escala que NVLink de Nvidia.
“A diferencia de NVLink de Nvidia, la total apertura de UALink significa que nuestros clientes pueden usar cualquier GPU, CPU y switch para su arquitectura de escalado vertical”, afirmó. “Desde una perspectiva de escala, UALink 1.0 permite conectar hasta 1000 GPU, lo que duplica la escalabilidad de NVLink de Nvidia”.
Sin embargo, vale la pena señalar que, si bien las limitaciones de InfiniBand y NVLink se discutieron varias veces durante la semana, no se hizo mención de la propia oferta de Ethernet de Nvidia, Spectrum-X Ethernet, que actualmente se utiliza para respaldar la supercomputadora Colossus de xAI en Memphis, Tennessee.
La colaboración es el rey
La colaboración fue sin duda la palabra del día en Advancing AI, donde la empresa utilizó la conferencia para destacar su ecosistema de socios, con Meta, xAI, Oracle, Microsoft, Cohere, Humain, Red Hat, Astera Labs, Marvell y el invitado de honor sorpresa, el CEO de OpenAI, Sam Altman, todos desfilando por el escenario durante la conferencia principal de tres horas para discutir cómo están implementando hardware AMD para soportar cargas de trabajo de IA.
Además, en una sesión informativa después de la conferencia principal, Norrod dijo que el nuevo rack Helios de doble ancho anunciado por AMD comenzó como un diseño específico para dos clientes de hiperescala, influenciado directamente por sus requisitos.
Sin embargo, AMD no tiene el monopolio de las adquisiciones o asociaciones, y sería difícil encontrar una empresa que colabore con AMD que no esté también trabajando e implementando GPU Nvidia para respaldar sus cargas de trabajo de IA; aunque, cuando todos son socios preferidos de Nvidia, ¿alguien es realmente un socio preferido?
Por ejemplo, Humain, la empresa de inteligencia artificial de Arabia Saudita, habló en el escenario con Su sobre el acuerdo de computación de 500 MW con AMD que firmó el mes pasado, pero la compañía recién formada también está esperando actualmente 18.000 Nvidia GB300 para respaldar un acuerdo separado de centro de datos de 500 MW.
Oracle anunció planes para implementar un clúster de IA con hasta 131.072 de las nuevas GPU MI355X de AMD, pero también esta semana puso a disposición del público general su superclúster Nvidia GB200 NVL72 OCI con 131.072 GPU Blackwell.
OpenAI afirmó que implementará los próximos aceleradores MI350 de AMD como parte de su creciente cartera de cómputo, pero que al mismo tiempo es uno de los mayores usuarios de las GPU de Nvidia, compradas principalmente por sus proveedores de cómputo Microsoft, Oracle y CoreWeave.
Además, la mayoría de los hyperscalers ya están desarrollando sus propios chips, en gran medida para reducir su dependencia de las GPU Nvidia, y a pesar del compromiso de AMD con la apertura, es poco probable que el fabricante de chips comparta secretos comerciales con sus clientes en el corto plazo.
Si bien el hecho de que tantos grandes nombres apoyen a AMD y sus ofertas de hardware obviamente beneficia al fabricante de chips, sin intentar menospreciar demasiado a una empresa claramente exitosa que fabrica productos que tienen demanda entre los clientes, la pregunta sigue siendo cuánto de eso se debe a que AMD es el mejor en su clase y cuánto se debe simplemente a que no son Nvidia.
Se sabe que las empresas a veces implementan GPU AMD en un esfuerzo por obtener más influencia en las negociaciones con Nvidia, mientras que AMD también está planeando rebajar significativamente el precio de Nvidia en un esfuerzo por ganar participación de mercado sobre su rival.
Mientras tanto, la dificultad de conseguir GPU de Nvidia (a pesar de que la compañía ha prometido entregar grupos en decenas y cientos de miles) ha obligado a los clientes a recurrir a otros fabricantes o esperar enormes plazos de entrega hasta que la oferta pueda alcanzar la demanda.
Si bien las tendencias macroeconómicas actuales pueden hacernos pensar que realmente cualquier cosa podría suceder, Nvidia no está dispuesta a ser derrocada.
AMD lo sabe y en lugar de intentar superar al gigante de los chips en su propio terreno, ha decidido seguir el camino recorrido por muchos políticos que intentan derrocar a un titular, ofreciendo lo que cree que es una alternativa creíble que resultará en un progreso real.
Y claro, el electorado es voluble, pero no cabe duda de que la mayor demanda de hardware de IA solo puede beneficiar a AMD. Si bien Jensen Huang, de Nvidia, puede seguir siendo el favorito del circuito de conferencias tecnológicas, prometiendo GPUs, al estilo de Oprah, a cualquiera que las desee, a juzgar por el evento de la semana pasada, esos mismos clientes también desearían muchos aceleradores AMD.
Comments