Microsoft ha presentado el Maia 200, su chip de inteligencia artificial interno de segunda generación, a medida que aumenta la competencia en torno a los costos operativos de los modelos grandes.
A diferencia de las prensas de hardware anteriores centradas en la capacitación, el nuevo chip está orientado a la inferencia, el suministro continuo de respuestas de IA a los usuarios.
La conclusión se ha convertido en un costo creciente para las empresas de IA. Debido a que los chatbots y copilotos abarcan millones de usuarios, los modelos deben funcionar sin parar. Según Microsoft, el Maia 200 está diseñado para este cambio.
El chip aparecerá esta semana en el centro de datos de Microsoft en Iowa. El segundo despliegue está previsto para Arizona.
Diseñado para escala de inferencia
Maia 200 se basa en Maia 100 de Microsoft, lanzado en 2023. La nueva versión permite un salto de rendimiento significativo. Según Microsoft, el chip contiene más de 100 mil millones de transistores y produce más de 10 petaflops de potencia informática con una precisión de 4 bits. Alcanza aproximadamente 5 petaflops con una precisión de 8 bits.
Estas cifras se refieren a cargas de trabajo del mundo real, no a puntos de referencia de capacitación. La conclusión requiere velocidad, estabilidad y eficiencia energética. Según Microsoft, un solo nodo Maia 200 puede ejecutar los modelos de IA más grandes de la actualidad y, al mismo tiempo, dejar espacio para el crecimiento futuro.
El diseño del chip refleja el funcionamiento de los servicios modernos de IA. Los chatbots también deben responder rápidamente cuando aumenta el tráfico de usuarios.
Para cubrir esta necesidad, el Maia 200 incluye una gran cantidad de SRAM, un tipo de memoria rápida que reduce la latencia de consultas repetidas.
Muchos reproductores de hardware de IA más nuevos se basan en diseños que requieren mucha memoria. Microsoft parece haber adoptado este enfoque para mejorar la capacidad de respuesta en todos los ámbitos.
Maia 200 también tiene un propósito estratégico. Se dice que los grandes proveedores de la nube buscan reducir su dependencia de NVIDIA, cuyas GPU dominan la infraestructura de IA. Si bien NVIDIA sigue siendo líder en rendimiento, su paquete de hardware y software fija los precios y la disponibilidad en toda la industria.
Google ya ofrece sus unidades de procesamiento de tensores a través de su nube. Amazon Web Services promociona sus chips Trainium e Inferentia. Microsoft ahora se une a ese grupo con Maia.
La empresa hizo comparaciones directas. Según Microsoft, el Maia 200 ofrece tres veces el rendimiento FP4 de los chips Trainium de tercera generación de Amazon.
También afirma que el rendimiento del FP8 es más fuerte que el del último TPU de Google.
Al igual que los próximos procesadores Vera Rubin de NVIDIA, el Maia 200 es fabricado por Taiwan Semiconductor Manufacturing Co utilizando tecnología de 3 nanómetros.
También utiliza memoria de gran ancho de banda, aunque es de una generación anterior a la de los siguientes chips de NVIDIA.
El software cierra la brecha
Microsoft combinó la introducción del chip con nuevas herramientas de desarrollo. La compañía pretende cerrar la brecha que durante mucho tiempo ha favorecido al software de NVIDIA.
Una herramienta clave es Triton, un marco de código abierto que ayuda a los desarrolladores a escribir código de IA potente. OpenAI contribuyó significativamente al proyecto.
Microsoft está posicionando a Triton como una alternativa a CUDA, la plataforma de programación dominante de NVIDIA.
Maia 200 ya se ejecuta dentro de los propios servicios de inteligencia artificial de Microsoft. La empresa afirma apoyar a los modelos del equipo de superinteligencia y ayudar al copiloto.
Microsoft también invitó a desarrolladores, académicos y laboratorios de inteligencia artificial de vanguardia a probar el kit de desarrollo de software Maia 200.
Con Maia 200, Microsoft está señalando un cambio más amplio en la infraestructura de IA. Los chips más rápidos siguen siendo importantes. La comprobación del software y la puesta en marcha son ahora igualmente importantes.

