Chips y hardware
Amazon aumenta la producción de chips de IA personalizados para OpenAI y Anthropic
Amazon está aumentando la producción de chips Trainium para OpenAI y Anthropic, con el objetivo de reducir los costos de inferencia y potencialmente afectar el casi monopolio de Nvidia.
Amazon ha asegurado un acuerdo de inversión de USD 50.000 millones con OpenAI, posicionando a AWS para suministrar 2 gigavatios de capacidad de computación Trainium. Bajo el acuerdo, AWS es el proveedor exclusivo para el nuevo generador de agentes de IA de OpenAI. Sin embargo, la asociación enfrenta una posible bruma legal. El Financial Times reportó que Microsoft podría creer que el acuerdo de OpenAI con Amazon viola su propio acuerdo con OpenAI.
Para respaldar esta capacidad, Amazon está aprovechando sus chips Trainium. Según el equipo de chips de AWS, Trainium ahora es compatible con PyTorch, un marco de trabajo de código abierto. Mark Carroll, director de ingeniería, declaró que la transición requiere solo un cambio simple de una línea y una recompilación para ejecutarse en Trainium. Para la inferencia (el proceso de ejecutar un modelo de IA para generar respuestas), Amazon afirma que los chips Trainium que funcionan en sus Trn3 UltraServers cuestan hasta un 50% menos de operar con un rendimiento comparable que los servidores en la nube clásicos. La configuración de hardware utiliza componentes de red personalizados llamados Neuron switches y bandejas que alojan los chips de IA, conocidos como sleds.
Esta estrategia de silicio tiene sus raíces en la adquisición por parte de Amazon en enero de 2015 de la unidad de diseño de chips Annapurna Labs por alrededor de USD 350 millones. Expertos de la industria sugieren que los chips Trainium podrían potencialmente afectar el casi monopolio de Nvidia en hardware de IA. El último Trainium3 es un chip de 3 nanómetros fabricado por TSMC, mientras que otros chips son producidos por Marvell. El trabajo del equipo ha ganado validación externa; Apple elogió al equipo de chips de Amazon en 2024. Además, AWS se asoció recientemente con Cerebras Systems para integrar sus chips de inferencia con servidores impulsados por Trainium.
En el laboratorio de diseño de chips de Amazon en Austin —una zona a veces llamada el Silicon Valley de Austin—, los ingenieros gestionan el silicon bring-up, que es el proceso de activar un chip nuevo por primera vez para verificar su diseño. Kristopher King, director del laboratorio, describió el proceso: “Un silicon bring-up es cuando recibes el chip por primera vez, y es como una gran fiesta nocturna. Te quedas aquí, como en un encierro”. Estas pruebas 24/7 respaldan un despliegue masivo en toda la infraestructura de AWS:
- 1,4 millones de chips Trainium están desplegados actualmente en todas las generaciones.
- Más de 1 millón de chips Trainium2 están ejecutando el modelo Claude de Anthropic.
- 500.000 chips están activos en Project Rainier, un clúster de computación masivo que entró en funcionamiento a finales de 2025 para respaldar a Anthropic.
Por qué importa
Amazon está escalando su producción de chips personalizados Trainium para apoyar a socios importantes de IA como Anthropic y OpenAI, con el objetivo de reducir la dependencia de Nvidia y disminuir los costos de inferencia de IA.