El ecosistema de código abierto está facilitando a los entusiastas y desarrolladores de IA la creación, personalización y ejecución de agentes cada vez más capaces a nivel local.
A lo largo del mes de agosto, NVIDIA rinde homenaje a los socios y a las comunidades de código abierto que impulsan el avance de la IA local, así como a los modelos, aplicaciones y herramientas que están surgiendo en todo el ecosistema. Esto incluye los últimos modelos abiertos, el software y las herramientas para desarrolladores de NVIDIA, además de la computación acelerada, las bibliotecas y los recursos educativos que ayudan a los usuarios a dar sus primeros pasos.
Se perfila como un gran mes para los agentes. Sigue de cerca las últimas novedades en esta serie especial del blog de NVIDIA sobre IA local, con nuevas actualizaciones que se irán agregando en las próximas semanas.
Sigue a NVIDIA RTX Spark en X, Instagram, TikTok y Facebook, y mantente informado suscribiéndote al boletín de RTX AI PC. Sigue a NVIDIA Workstation en LinkedIn y X.
Martes, 11 de agosto, 10:00 a. m. PT
#ICYMI: Nuevos modelos abiertos y más novedades disponibles desde hoy, acelerados por las GPUs de NVIDIA
NVIDIA ha lanzado recientemente Cosmos 3 Edge, un modelo de mundo abierto con 4,000 millones de parámetros para robótica, vehículos autónomos e IA de visión. Con un tamaño cuatro veces menor que el de Cosmos 3 Nano, se ejecuta en el propio dispositivo en NVIDIA DGX Spark y NVIDIA Jetson.
MiniMax-H3 es un modelo de pesos abiertos con 33,000 millones de parámetros que genera video y audio estéreo sincronizado de forma nativa a partir de texto, imágenes, video, audio o una combinación de los cuatro. Los creadores pueden acceder a él a través de ComfyUI y ejecutarlo localmente con puntos de control optimizados para las GPUs de NVIDIA.
Poolside AI ha lanzado Laguna S 2.1, un modelo de codificación agencial de pesos abiertos con 118,000 millones de parámetros capaz de realizar tareas que duran horas. Un punto de control NVFP4 permite a los desarrolladores ejecutar el modelo localmente en un único NVIDIA DGX Spark con menores requisitos de computación y memoria, sin sacrificar la precisión.
DeepSeek ha actualizado recientemente DeepSeek-V4-Flash, un modelo MoE de 284 000 millones de parámetros con 13,000 millones de parámetros activos y una ventana de contexto de 1 millón de tokens. Los desarrolladores pueden ejecutarlo localmente en una NVIDIA DGX Station utilizando las versiones GGUF creadas por la comunidad que ya están disponibles.
Inkling-Small, de Thinking Machines Lab, es un modelo multimodal de peso abierto y de vanguardia con razonamiento nativo en texto, imágenes y audio, además de un esfuerzo de razonamiento ajustable. Entrenado en una NVIDIA GB300 NVL72, este modelo de 276,000 millones de parámetros activa tan solo 12,000 millones de parámetros por token y se ejecuta en una sola DGX Station o en dos sistemas DGX Spark. En Hugging Face está disponible un punto de control de NVFP4 optimizado para NVIDIA Blackwell.
Unsloth lanzará Unsloth Desktop este lunes. El producto reúne la inferencia local de modelos, la difusión de imágenes y videos, el ajuste fino, las integraciones de agentes, la búsqueda en la web y la ejecución de código en una única aplicación de desktop totalmente de código abierto. Los materiales de lanzamiento la posicionan como la primera aplicación de desktop que entrena y ejecuta modelos de IA de forma local.
Unsloth Desktop reúne el entrenamiento y la inferencia de IA locales en una única aplicación de desktop totalmente de código abierto. Es la primera aplicación de desktop que entrena y ejecuta modelos de IA de forma local.
Alibaba ha lanzado recientemente Wan-Animate-2, un modelo de peso abierto con 14,000 millones de parámetros que transfiere el movimiento y las expresiones faciales de un video en movimiento a una imagen estática de un personaje ya sea humano, de dibujos animados, un robot o un animal. Gracias a la compatibilidad desde el primer día con ComfyUI, genera resultados hasta 16 veces más rápido en una NVIDIA RTX PRO 5000 Blackwell (48 GB) y 26 veces más rápido en una NVIDIA RTX 5090 en comparación con el Apple M3 Ultra.
Martes, 11 de agosto, 9:00 a. m. PT
LTX presenta LTX 2.5
LTX-2.5 es el último modelo de vanguardia para la generación de video en mundo abierto del equipo de investigación líder de LTX, que sienta las bases para casos de uso en los sectores de los medios de comunicación y el entretenimiento, la robótica y la generación en tiempo real, y ofrece video de mayor calidad, un mayor cumplimiento de las instrucciones y personajes, escenas y voces más coherentes en todas las generaciones.
La nueva compatibilidad con multishot permite a los creadores generar secuencias que abarcan múltiples cortes manteniendo la continuidad, mientras que un decodificador de video por difusión mejorado aumenta la fidelidad visual y reduce los artefactos. Los creadores también pueden perfeccionar el material existente con ediciones generativas, lo que facilita corregir detalles y mantener un aspecto pulido sin tener que empezar de cero.
El nuevo potenciador de indicaciones, que incorpora Gemma4 E2B y un codificador de texto Gemma4 12B personalizado, ofrece una adherencia a las indicaciones extraordinaria, lo que proporciona un control mucho mayor sobre el resultado.
Un nuevo decodificador de video por difusión complementa al decodificador de video con autocodificador variacional, mejorando la calidad del video al proporcionar una segunda ruta de decodificación para obtener renderizados finales de mayor calidad.
LTX-2.5 está optimizado para las GPUs NVIDIA RTX y los sistemas DGX Spark y DGX Station. En una GPU NVIDIA RTX 6000 PRO, LTX-2.5 ofrece un rendimiento hasta un 20% más rápido y un ahorro de memoria del 40%. Los creadores pueden utilizar estas mejoras de NVFP4, FastVideo y ComfyUI de forma local a través de un flujo de trabajo de ComfyUI listo para usar para la generación de texto, imágenes y video a video.
Obtén más información sobre LTX-2.5 para descubrir cómo empezar a generar video local de alta calidad en hardware de NVIDIA.
Martes, 11 de agosto, a las 9:00 a. m. (hora del Pacífico)
NVIDIA acelera Muse Glimmer de Meta para una IA agente local siempre activa
Hoy, Meta ha lanzado Muse Glimmer, un modelo denso de peso abierto con 30,000 millones de parámetros y una ventana de contexto de más de 120,000. Está diseñado específicamente para la programación y la IA agencial local.
Optimizado para PC con NVIDIA GeForce RTX, NVIDIA DGX Spark, DGX Station y NVIDIA Jetson, Muse Glimmer ofrece más de 200 tokens por segundo en la RTX 5090, lo que permite a los agentes siempre activos procesar datos de forma local y realizar tareas complejas de varios pasos en un único sistema.
Su arquitectura densa y su atención híbrida ayudan a mantener bajo control las exigencias de procesamiento y memoria, a medida que los agentes asumen tareas más largas, utilizan herramientas y mantienen el contexto a lo largo de múltiples pasos.
Muse Glimmer es un modelo de 30,000 millones de parámetros optimizado para flujos de trabajo de agentes locales siempre activos. Es lo suficientemente pequeño como para ejecutarse en un PC con una sola GPU de consumo, lo que permite casos de uso que van desde agentes locales y llamadas a funciones hasta la programación local y la evaluación de LLM como juez.
Los entusiastas de la IA y los desarrolladores pueden crear agentes utilizando NemoClaw y ajustar Muse Glimmer localmente con NVIDIA NeMo Automodel, utilizando datos privados o especializados y manteniéndolos en el propio sistema. Muse Glimmer está diseñado para:
- Agentes personalizados: adaptar el modelo a tareas, herramientas, datos y áreas de especialización específicas.
- Procesamiento de datos privados: leer, resumir y actuar sobre archivos, documentos, correos electrónicos y mensajes locales.
- Gestión de credenciales: utilizar claves de interfaces de programación de aplicaciones, tokens de autenticación y otra información confidencial, manteniendo la inferencia en el dispositivo.
- Tareas de varios pasos: Realizar numerosas llamadas secuenciales a herramientas y recuperarse de errores o resultados inesperados.
- Flujos de trabajo de larga duración: dividir proyectos más grandes en pasos, realizar un seguimiento del progreso y reanudar sesiones interrumpidas conservando el contexto intacto.
Los desarrolladores pueden ejecutar Muse Glimmer con marcos de inferencia populares, como vLLM para la generación de texto, imágenes, razonamiento y uso de herramientas, o llama.cpp para cargas de trabajo de texto e imágenes utilizando BF16 y puntos de control GGUF cuantificados. llama.cpp también admite la decodificación especulativa DFlash para acelerar la generación.
Al ejecutarse en una sola tarjeta NVIDIA RTX 5090, Muse Glimmer permite que los agentes siempre activos trabajen con archivos privados, aplicaciones y comunicaciones, al tiempo que reduce la dependencia de la inferencia basada en la nube.

Obtén más información sobre Muse Glimmer de Meta y echa un vistazo al blog técnico de NVIDIA para descubrir cómo dar tus primeros pasos con la IA local y el ajuste fino en hardware de NVIDIA.
Martes, 11 de agosto, 8:00 a. m. PT
Multiplica el rendimiento de DGX Spark con NVIDIA Sync Cluster Assistant

Los nuevos modelos abiertos, como GLM 5.2 y DeepSeek V4 Flash, están aportando inteligencia al nivel de la nube a los sistemas locales, lo que permite cargas de trabajo avanzadas como agentes de programación e investigación. Sin embargo, la ejecución de estos modelos de mayor tamaño puede requerir que varias GPUs o sistemas DGX Spark trabajen conjuntamente.
Las actualizaciones de la aplicación NVIDIA Sync facilitan la agrupación en clúster de varios sistemas DGX Spark, proporcionando la capacidad de memoria, el rendimiento de inferencia y el rendimiento de entrenamiento necesarios para ejecutar modelos más grandes con mayor rapidez.
Disponible para Windows y macOS, NVIDIA Sync detecta automáticamente los sistemas conectados, proporciona acceso remoto privado y seguro a través de Tailscale y permite a los desarrolladores ejecutar aplicaciones en uno o más sistemas DGX Spark sin necesidad de configurar manualmente la red ni copiar comandos de terminal.
El Cluster Assistant de NVIDIA Sync automatiza la configuración de dos o más sistemas DGX Spark como un clúster de alta velocidad. Los desarrolladores conectan los sistemas a través de sus puertos NVIDIA ConnectX-7, y NVIDIA Sync configura la red, distribuye las cargas de trabajo entre los nodos y supervisa el estado del sistema.
Para empezar a utilizar la IA basada en agentes en DGX Spark, consulta las guías prácticas sobre NemoClaw , OpenClaw, Hermes Agent y OpenShell .
Consulta el aviso sobre la información de los productos de software.
Martes, 11 de agosto, 8:00 a. m. (hora del Pacífico)
Actualizaciones adicionales de DGX Spark
A finales de agosto llegarán dos nuevas y emocionantes funciones para los desarrolladores.
DGX Spark contará con Google Chrome como una versión nativa para ARM64 en Linux, que se instalará con un solo clic desde el panel de control de DGX. Esto significa que la sincronización con la cuenta de Google, el ecosistema completo de extensiones, la continuidad entre dispositivos y todas las funciones que vienen de serie en cualquier otra plataforma ahora estarán disponibles en tu DGX Spark. Inicia sesión una sola vez y el entorno del navegador se sincronizará desde tu laptop hasta el Spark.
El nuevo NVIDIA Sync Resource Monitor ofrecerá vistas en tiempo real e históricas del uso de la CPU y la GPU, tanto en un DGX Spark individual como en todo un clúster, sin necesidad de software de monitorización adicional ni de configuración. Las visualizaciones de un solo vistazo ayudan a los usuarios a realizar un seguimiento del progreso de las cargas de trabajo, comprobar la capacidad disponible antes de agregar trabajos o modelos, e identificar rápidamente cuellos de botella o comportamientos inesperados. El zoom de marquesina permite a los usuarios pasar de una visión general a momentos específicos de una carga de trabajo, lo que les ayuda a resolver problemas más rápidamente y a sacar más partido a sus sistemas.
Martes, 11 de agosto, a las 6:00 a. m. (hora del Pacífico)
NVIDIA presenta Nemotron 3.5 Lightning para tareas de agentes rápidas y especializadas
Hoy, NVIDIA ha ampliado su familia de modelos Nemotron 3 con Nemotron 3.5 Lightning , un modelo abierto y personalizable de 30,000 millones de parámetros basado en una mezcla de expertos (MoE) para agentes siempre activos.
Nemotron 3.5 Lightning ofrece una generación de tokens hasta cuatro veces más rápida y un tiempo de finalización un 30 % más rápido en comparación con los modelos abiertos de su clase.
Además, dado que Nemotron 3.5 Lightning tiene pesos abiertos, los entusiastas de la IA y los desarrolladores pueden ajustarlo con sus propios ejemplos para adaptarlo mejor a tareas, intereses y flujos de trabajo específicos. Por ejemplo, podrían entrenar el modelo para:
- Escribir con un estilo preferido: seguir los tonos, formatos y terminología establecidos al redactar correos electrónicos, informes u otros documentos.
- Aprenda una especialidad: comprender mejor el lenguaje y las tareas habituales asociadas a ámbitos como la fotografía, los videojuegos o el diseño 3D.
- Programar de una forma determinada: seguir las convenciones de programación, los marcos de trabajo y los enfoques de pruebas preferidos al escribir, revisar o refactorizar código.
Junto con el acceso a aplicaciones, archivos y otras herramientas, estos modelos ajustados pueden impulsar experiencias de IA local más personalizadas: desde un asistente que ayuda a gestionar el correo electrónico y los calendarios, hasta un agente de hogar inteligente que se encarga de las rutinas diarias, pasando por un compañero de programación que trabaja junto a los desarrolladores en una base de código local.
NVIDIA ha colaborado con vLLM, Ollama, llama.cpp y LM Studio para ofrecer la mejor experiencia de implementación local de los modelos Nemotron 3.5 Lightning, dando a los desarrolladores la opción de elegir entre los formatos NVFP4 y GGUF para los modelos. Unsloth también ofrece soporte desde el primer día con modelos optimizados y cuantificados para una implementación local eficiente a través de Unsloth Studio .
Nemotron 3.5 Lightning se ejecuta localmente en PC con NVIDIA RTX, sistemas NVIDIA DGX Spark y GB10 de fabricantes de equipos originales (OEM), así como en NVIDIA Jetson, y se puede ampliar a estaciones de trabajo RTX PRO, sistemas deskside NVIDIA DGX Station y GB300, centros de datos y entornos en la nube. Con los sistemas NVIDIA Blackwell disponibles a través de Acer, ASUS, Dell Technologies, Exxact, GIGABYTE, HP, Lenovo, MSI y Supermicro, los usuarios pueden elegir entre una amplia gama de dispositivos y formatos que se adapten a sus necesidades.
A medida que crece la adopción de la IA generativa, las empresas buscan formas de controlar los crecientes costes de los tokens sin sacrificar el acceso a la inteligencia de vanguardia. NVIDIA NeMo Switchyard, una biblioteca de enrutamiento de código abierto dirige automáticamente cada paso del flujo de trabajo de un agente hacia el modelo más adecuado en función de la precisión, la velocidad y el coste. También ofrece a los desarrolladores la flexibilidad de trabajar con distintos modelos y proveedores para diferentes tareas.
Las pruebas internas muestran que NeMo Switchyard, al enrutar cada paso a través de un sistema de modelos, ayudó a mantener un nivel de vanguardia en la realización de tareas, al tiempo que redujo el coste de realización de las pruebas a aproximadamente un tercio del de Opus 4.8 por sí solo. NeMo Switchyard está disponible en GitHub.
Visita los blogs técnicos de, 3.5 Lightning, NeMo Switchyard y Jetson AI para empezar. Y para desarrollar en el borde, empieza con los tutoriales de Jetson AI Lab y descubre proyectos reales de Jetson en . Nemotron 3.5 Lightning también está disponible a través de OpenRouter, en build.nvidia.com como un microservicio NVIDIA NIM, a través de un amplio ecosistema de socios de NVIDIA Cloud, plataformas de post-entrenamiento, plataformas de inferencia y proveedores de servicios en la nube. NeMo Switchyard está disponible en GitHub.
