A medida que la IA evoluciona de chatbots a agentes autónomos, los modelos de código abierto satisfacen las demandas del mercado de control total sobre dónde se ejecuta la IA y cómo se implementa y evoluciona.
Hoy, NVIDIA amplía su familia de modelos Nemotron 3 con Nemotron 3.5 Lightning, el modelo de mayor eficiencia en su clase para cargas de trabajo de IA basada en agentes de larga duración. Este lanzamiento sigue a Nemotron 3 Nano y refleja el compromiso de NVIDIA de mejorar continuamente los modelos de código abierto para lograr mayor precisión y velocidad.
Diseñado para tareas especializadas dentro de sistemas multiagente más grandes, Nemotron 3.5 Lightning, un modelo de mezcla de expertos con 30 mil millones de parámetros, ayuda a crear aplicaciones agénticas más inteligentes y eficientes.
Asimismo, NVIDIA lanza NeMo Switchyard, una biblioteca de código abierto para el enrutamiento inteligente dentro de las herramientas de agentes más populares. Las empresas pueden usarla para construir un enrutador según sus necesidades específicas. Una vez implementado, NeMo Switchyard puede dirigir de forma inteligente cada solicitud al modelo más capaz y adecuado para la tarea, en una combinación propia de modelos abiertos, propietarios y de NVIDIA, sin necesidad de que los desarrolladores reescriban sus aplicaciones.
Juntos, Nemotron 3.5 Lightning y NeMo Switchyard ofrecen mayor control sobre cómo se implementa la IA, dónde se ejecuta y con qué eficiencia opera, en PCs, workstations, data centers y la nube.

Nemotron 3.5 Lightning ofrece inteligencia de nivel frontier en un modelo de código abierto pequeño y personalizable, diseñado para workflows agénticos de alto volumen.
Los Agentes Siempre Activos Necesitan un Sistema de Modelos
Los sistemas agénticos modernos —agentes siempre activos— operan cada vez más como sistemas de modelos, o conjuntos de modelos, con diferentes modelos especializados para diferentes tareas.
Los modelos de código abierto NVIDIA Nemotron están diseñados para esta arquitectura. Un modelo de razonamiento frontier como Nemotron 3 Ultra o GPT-5.6 puede planificar y orquestar un workflow, mientras que modelos especializados más pequeños como Nemotron 3.5 Lightning pueden realizar tareas específicas, como revisión de código, uso de herramientas, monitoreo de alertas de seguridad y respuesta a preguntas de facturación.
Potenciando Tareas Especializadas de Alto Volumen con Nemotron 3.5 Lightning
El NVIDIA Nemotron 3.5 Lightning es un modelo de código abierto totalmente personalizable, diseñado para tareas de alto volumen que impulsan a los agentes siempre activos. Fue desarrollado con contribuciones de la Nemotron Coalition, cuyos miembros aportaron metodologías de evaluación, software de inferencia y datasets para ayudar a avanzar el modelo.
El modelo ofrece hasta 4 veces más velocidad de salida, lo que resulta en una finalización de tareas agénticas un 30% más rápida en comparación con otros modelos de su clase. Y al ser abierto y personalizable, Nemotron 3.5 Lightning puede ser fácilmente post-entrenado con NVIDIA NeMo usando los datos de dominio, herramientas y workflows propios de la organización para mejorar la precisión en tareas especializadas.

Los benchmarks de PinchBench demuestran que Nemotron 3.5 Lightning ofrece una finalización de tareas agénticas más rápida con precisión de nivel frontier en comparación con otros modelos de su clase.
Líderes de IA en diversas industrias están personalizando Nemotron 3.5 Lightning para sus cargas de trabajo, incluyendo CrowdStrike para ciberseguridad, Harvey con Trajectory para servicios legales y CodeRabbit con Baseten para revisión de código, ayudando a mejorar la precisión en tareas agénticas específicas del dominio. Además, Lila Sciences está contribuyendo a mejorar las capacidades de razonamiento para tareas agénticas en las ciencias físicas y de la vida, y Fastino Labs personalizó el modelo y está obteniendo precisiones líderes para cargas de trabajo de desarrollo de software, finanzas y atención médica.

Las empresas han personalizado Nemotron 3.5 Lightning para lograr una precisión líder en sus tareas especializadas dentro de sus workflows agénticos.
Nemotron 3.5 Lightning también brinda a las organizaciones control sobre la privacidad y la implementación. Puede ejecutarse en sistemas de IA locales, incluidos NVIDIA RTX PCs, NVIDIA DGX Spark, NVIDIA DGX Station y NVIDIA Jetson, para ayudar a los usuarios a maximizar las inversiones en infraestructura existente, o escalar en dispositivos de IA edge, workstations NVIDIA RTX PRO, data centers y entornos de nube para casos de uso empresariales. Y Nemotron 3.5 Lightning puede ejecutarse localmente o en las instalaciones para tareas especializadas de alto volumen que requieren respuestas rápidas.
Además, como en cada lanzamiento de Nemotron, NVIDIA publica la mayor cantidad posible de datos de entrenamiento y técnicas según lo permita la licencia, lo que permite la trazabilidad, la auditoría y el entrenamiento de otros modelos. Junto con Lightning, NVIDIA lanza Nemotron-RL-Agentic-Terminal-Pivot, un dataset de aprendizaje por refuerzo agéntico utilizado para post-entrenarlo en capacidades de agentes de codificación.
F
Aplicaciones de IA Más Eficientes con Enrutamiento de Modelos
Algunos modelos son mejores para codificación, otros para razonamiento, algunos para tareas ligeras y otros están optimizados para ejecutarse localmente con mayor privacidad y eficiencia. Si los clientes dependen de un modelo predeterminado único, pueden gastar de más o perder calidad; si gestionan el enrutamiento manualmente, se convierte en trabajo de integración que puede ralentizar una implementación.
El NVIDIA NeMo Switchyard es una biblioteca de enrutamiento de modelos de código abierto para agentes de IA. La tecnología dirige los prompts al modelo más capaz y eficiente para cada paso de un workflow de agente de forma automática, según necesidades específicas. Los desarrolladores de aplicaciones de agentes pueden ajustar o modificar el enrutador con diferentes algoritmos de enrutamiento para adaptarse a sus prioridades, como requisitos de calidad, latencia y costo. En un sistema de modelos, las empresas pueden crear poderosos agentes de IA con tokenomics mejorada.
Los benchmarks internos muestran que NeMo Switchyard mantiene precisión de nivel frontier mientras reduce el costo de finalización de tareas a casi un tercio del de Opus 4.8 solo.

Los benchmarks internos de NVIDIA muestran que NeMo Switchyard mantiene precisión de nivel frontier mientras reduce el costo de finalización de tareas a casi un tercio del de Opus 4.8 solo.
NVIDIA está trabajando con socios en todo el ecosistema de IA para incorporar el enrutamiento inteligente de modelos en las herramientas y plataformas que los desarrolladores ya utilizan.
- Boomi: Evaluó Switchyard en cinco capacidades de enrutamiento, alcanzando un 100% de precisión en el enrutamiento de dominio, enviando el 59% del tráfico a un modelo ajustado 5 veces más rápido y reduciendo la latencia en turnos posteriores en un 21%.
- Cadence: Mejoró la eficiencia en un 9,9% usando el ChipStack AI Super Agent para un caso de uso de verificación formal.
- Classmethod: Está ejecutando cargas de trabajo de opencode y Fireworks con NeMo Switchyard internamente, con pruebas iniciales que muestran una reducción de costos del 27% manteniendo la calidad.
- Cognition: Integró el enrutador por etapas de NVIDIA NeMo Switchyard en Devin Desktop para uso interno de NVIDIA, logrando un rendimiento cercano al frontier en FrontierCode Main mientras reducía el costo promedio en un 28% respecto al enrutamiento de todas las solicitudes a un único modelo frontier subyacente.
- Kong: Ofrece enrutamiento con NeMo Switchyard de forma nativa a través de Kong AI Gateway.
- LangChain: Con NeMo Switchyard, logró un 74% de reducción de costos en 145 tareas de Deep Agents de múltiples turnos enrutando solo el 7% de las llamadas a un modelo frontier, con un intercambio de precisión del 6%.
- LiteLLM: Está agregando NeMo Switchyard como un plug-in en su capa de proxy para que los desarrolladores puedan acceder a estos beneficios sin cambiar su stack existente.
- Nous Research: Integró NeMo Switchyard en Hermes para proporcionar a los desarrolladores un sistema de enrutamiento fácil de configurar para mejorar la eficiencia de los agentes.
- Ramp: Usó NeMo Switchyard para igualar el rendimiento de un modelo frontier mientras reducía los costos en un 58% y el tiempo de ejecución en un 33% en Ramp SWE-Bench.
- Siemens: Está realizando benchmarks para mejorar la eficiencia en su Fuse EDA AI Agent.
Nemotron 3.5 Lightning está disponible en Hugging Face, ModelScope, OpenRouter y build.nvidia.com como un microservicio NVIDIA NIM, así como a través de un amplio ecosistema de socios de nube de NVIDIA, plataformas de post-entrenamiento, plataformas de inferencia y proveedores de servicios en la nube. NeMo Switchyard está disponible en GitHub y próximamente en plataformas de socios.
