La energía es la restricción inevitable de la infraestructura de IA. La cantidad de tokens que una AI factory puede generar dentro de un presupuesto de energía fijo determina sus ingresos y rentabilidad. Por ello, la performance por watt, una métrica que no puede manipularse y solo se gana con resultados reales, es la base de las AI factories.
A medida que la IA agéntica impulsa la demanda de tokens, las decisiones de infraestructura que las organizaciones tomen hoy determinarán quién puede escalar y quién no en un mundo con restricciones de energía.
Prácticamente todos los modelos de IA de frontera hoy en día funcionan con una arquitectura mixture-of-experts (MoE). Servir estos modelos a gran escala con eficiencia significa que el tamaño del dominio de GPU, el número de GPUs conectadas mediante un interconect ultrarrápido de scale-up, importa: a mayor escala, mejor.
Mientras que la generación NVIDIA Hopper estableció el estándar con un dominio de ocho GPUs, la escala de la IA de frontera actual lo ha superado. Servir MoE con un dominio de 72 GPUs exige codesign full-stack y la profundidad operativa ganada al ejecutar estos modelos bajo carga real de producción.
Con la plataforma NVIDIA Blackwell NVL72, esa base ya está construida y comprobada, ofreciendo la mayor performance por watt para maximizar los ingresos y el menor costo por token para maximizar los márgenes de ganancia. Es sobre esta base que la plataforma NVIDIA Vera Rubin se desarrolla para elevar aún más la eficiencia energética a escala de rack.
Maximizando la performance por watt para la IA de frontera
Cada nueva generación de modelos de frontera trae cambios arquitectónicos que desbloquean mayor inteligencia mientras demandan nuevas optimizaciones para operar con eficiencia a escala.
Entre la más reciente generación de los principales modelos abiertos, el NVIDIA GB300 NVL72 ofrece hasta 25x de performance por watt en comparación con la generación NVIDIA Hopper, lo que demuestra que la performance de MoE mejora al pasar de un dominio de 8 GPUs a 72 GPUs. Estos números reflejan el estado actual de Blackwell, un punto de partida que sigue mejorando.
Un único número solo cuenta parte de la historia. Diferentes cargas de trabajo requieren diferentes puntos de operación: algunas optimizan para latencia, otras para throughput y costo, y la mayoría necesita moverse entre ambas.
Para representar mejor estos puntos de operación, NVIDIA presenta curvas de Pareto para cada modelo en lugar de un solo punto y proporciona herramientas como DynoSim para ayudar a los equipos a encontrar su punto óptimo en la frontera de Pareto antes de invertir una sola GPU-hora en validación.

Los sistemas NVIDIA GB300 NVL72 ofrecen hasta 25x de performance por watt sobre NVIDIA Hopper en DeepSeek V4 Pro. Fuente: SemiAnalysis InferenceX

En GLM5.1, los sistemas NVIDIA GB300 NVL72 ofrecen hasta 20x de performance por watt sobre NVIDIA Hopper. Fuente: SemiAnalysis InferenceX

Los sistemas NVIDIA GB300 NVL72 ofrecen hasta 10x de performance por watt sobre NVIDIA Hopper para Kimi K2.6, un modelo diseñado específicamente para tareas agénticas de largo horizonte. Fuente: SemiAnalysis InferenceX
La performance por watt que entrega NVIDIA Blackwell es resultado de un codesign extremo: cada componente del sistema a escala de rack, desde el silicio hasta el software, diseñado en conjunto para maximizar el throughput de tokens en workloads de inferencia de IA. Ese codesign alcanza cada capa del stack.
Por ejemplo, el NVIDIA NVLink Switch, esencial para la performance a escala de rack, fue desarrollado específicamente para desbloquear dominios masivos de scale-up de GPU, no adaptado de redes de propósito general. Ahora en su sexta generación con la plataforma Vera Rubin, sus capacidades están diseñadas específicamente para workloads de IA como SHARP, que realiza computación en red directamente en el switch, descargando trabajo de las propias GPUs.
El stack de software de inferencia de NVIDIA, que incluye NVIDIA Dynamo y TensorRT LLM, así como SGLang y vLLM, está diseñado para ejecutar el espectro completo de optimizaciones: cuantización NVFP4, serving disaggregado, paralelismo de expertos a gran escala, enrutamiento KV-aware, offloading de caché KV y más. Estas se combinan para multiplicar la performance que ofrece cada GPU. Además, el software sigue mejorando la performance con el tiempo: en DeepSeek V4, la performance por watt mejoró hasta 5x en un solo mes.
En las AI factories, la energía perdida por el enfriamiento y las ineficiencias a nivel de rack puede significar que solo alrededor del 60% de la electricidad tomada de la red se convierte en trabajo útil de IA. NVIDIA DSX MaxLPS, el software de energía y eficiencia en la plataforma NVIDIA DSX, cierra esa brecha al redistribuir la energía entre GPUs y racks en tiempo real, con soporte para enfriamiento líquido con agua tibia y técnicas como power steering para obtener más performance. Esto permite a los operadores ejecutar hasta 40% más GPUs dentro del mismo presupuesto de energía.
La producción es donde importa
La confiabilidad a escala de rack en una AI factory se gana con esfuerzo. Los sistemas a escala de rack introducen modos de falla que las implementaciones de un solo nodo nunca enfrentan, y manejarlos requiere rigor de ingeniería y tiempo en producción.
Los sistemas NVIDIA Blackwell NVL72 continúan estableciendo el estándar en una amplia gama de modelos y casos de uso en producción, entregando performance sostenida, confiabilidad a nivel de rack y economía que se mantienen bajo tráfico real día tras día.
Por eso los principales laboratorios de IA, como Anthropic, OpenAI y SpaceXAI, usan sistemas NVIDIA Blackwell NVL72 para ejecutar inferencia.
Además, una variedad de proveedores de servicios de inferencia y empresas nativas de IA utilizan la plataforma Blackwell para implementar modelos abiertos en producción.
CoreWeave implementó Kimi K2.6 en NVIDIA GB300 NVL72, combinando cuantización NVFP4 y decodificación especulativa EAGLE3 para maximizar la performance de inferencia.
Perplexity ejecuta Qwen3 235B y el Qwen3.5-397B-A17B post-entrenado en NVIDIA GB200 NVL72 para su plataforma de AI agent, atendiendo millones de consultas diarias con la latencia y la confiabilidad que los usuarios necesitan.
Fireworks AI implementa GLM 5.2 en la plataforma NVIDIA Blackwell, habilitando implementaciones en producción para clientes como Cursor y Factory AI.
Esta experiencia acumulada en producción, construida a través de generaciones de modelos de frontera e implementaciones reales, es lo que le da a NVIDIA Vera Rubin su ventaja inicial.
Conoce más sobre la plataforma NVIDIA Vera Rubin en este blog técnico y encuentra detalles sobre la plataforma NVIDIA DSX a escala de AI factory y DSX MaxLPS.
