La inteligencia de frontera se está volviendo local. En IFA 2026, NVIDIA, Microsoft y sus socios se unieron para ofrecer inferencia más rápida y nuevas herramientas que facilitan configurar y ejecutar agentes localmente en hardware NVIDIA. También llegan en octubre nuevas PC compactas con Windows NVIDIA RTX Spark, que dan a entusiastas de la IA, desarrolladores y creadores más formas de ejecutar agentes capaces de manera local y segura.
Los anuncios de hoy incluyen:
- Soporte simplificado de IA local para GPU NVIDIA que llega a Hermes Agent, OpenClaw y Perplexity Portable Computer.
- Inferencia local hasta 1.9 veces más rápida: nuevas optimizaciones de llama.cpp y vLLM ya disponibles directamente y a través de LM Studio y Ollama.
- NVIDIA PAIR, una herramienta de enrutamiento personal de IA que distribuye de forma inteligente la inferencia entre las PC de la red local del usuario.
- NVIDIA RTX Spark llega en octubre, con nuevas PC con Windows de Lenovo y Acer. Electronic Arts, Embark y Ubisoft están entre las editoras y desarrolladoras que llevan sus títulos a NVIDIA RTX Spark.
Agosto también fue un mes movido para la IA local:
- Nemotron 3.5 Lightning, que se ejecuta en NVIDIA RTX PC, workstations RTX PRO, DGX Spark y Jetson, es un modelo de 30 mil millones de parámetros ya lanzado.
- GLM-5.3-Flash, de Z.ai, es un modelo multimodal de mezcla de expertos (MoE) que lleva IA basada en agentes a DGX Station.
- Qwen lanzó Qwen3.8-Flash-Next, un modelo multimodal MoE de pesos abiertos que corre localmente en DGX Spark y DGX Station, junto con Qwen3.8-27B, un modelo abierto de 27 mil millones de parámetros optimizado para cargas locales de agentes y de codificación en GPU NVIDIA.
- LTX 2.5, de LTX, es un modelo abierto de generación de video optimizado para GPU NVIDIA RTX, DGX Spark y DGX Station, con nuevas mejoras de NVFP4, FastVideo y ComfyUI para una generación local más rápida y eficiente en memoria.
- MiniMax-H3 es un modelo de pesos abiertos para generación de video con audio sincronizado que corre localmente en GPU NVIDIA a través de ComfyUI. FastVideo trabajó con investigadores de NVIDIA para mejorarlo aún más con FastH3, una versión destilada de pesos abiertos en cuatro pasos que mejora el rendimiento 7 veces.
- Muse Glimmer, de Meta, es un modelo de pesos abiertos con 30 mil millones de parámetros para codificación y cargas con agentes que corre localmente en PC GeForce RTX, DGX Spark, DGX Station y Jetson. NVIDIA también liberó la cuantización NVFP4 con soporte para DGX Spark, para un despliegue local más eficiente en memoria.
- DeepSeek v4 Flash es un modelo MoE de 284 mil millones de parámetros con 13 mil millones de parámetros activos que corre localmente en un clúster de 2 DGX Spark y en DGX Station.
Un inicio más simple para los agentes locales
Poner a funcionar un agente local con modelos locales exigía cierto esfuerzo: elegir un modelo, encontrar un servidor de inferencia compatible, ajustar la configuración de cuantización y mantener todo actualizado. Esa fricción está desapareciendo en sistemas RTX y DGX.
Tres de las aplicaciones de agentes más usadas ofrecerán configuración simplificada de modelos locales en Windows, cada una construida sobre llama.cpp e incorporando las optimizaciones de inferencia más recientes de NVIDIA. Las nuevas experiencias de configuración fueron diseñadas para reducir el ajuste manual y facilitar la puesta en marcha de agentes locales.
El mes pasado, Perplexity presentó su agente Portable Computer, que da a los usuarios una forma simple de ejecutar Perplexity localmente en sistemas Linux como NVIDIA DGX Spark, con los modelos, la orquestación y las herramientas empaquetados en una sola experiencia de aplicación.
Perplexity Portable Computer está disponible en GPU NVIDIA RTX con al menos 24 GB de VRAM en Linux, y el soporte en Windows llegará pronto, lo que llevará esa misma configuración simplificada a un grupo más amplio de usuarios de PC. Se pueden ejecutar flujos de trabajo completos de forma local sin consumir créditos, y escalar selectivamente partes de una tarea a uno de más de 15 modelos de frontera en la nube cuando se necesita más investigación o razonamiento. Portable Computer pide permiso antes de enviar contenido a la nube, lo que ayuda a mantener la información sensible en el dispositivo. Algunos ejemplos de uso:
- Ingeniería: revisar los PR abiertos en un repositorio conectado de GitHub y clasificarlos en listos, bloqueados, detenidos y por revisar, cada uno con el siguiente paso marcado. La documentación que quedó desfasada respecto al último merge se detecta y se corrige, con un PR abierto para los cambios.
- Finanzas: apuntar el agente a dos años de estados de cuenta de casa de bolsa, informes consolidados y declaraciones de impuestos y pedirle que rastree las posiciones recurrentes que generan más comisiones y pérdidas fiscales evitables, con cada cifra citando el archivo y la página exactos, sin que ningún documento llegue a un chatbot.
- Startups: preguntar por qué se estancó la activación, y el agente analiza localmente la exportación del embudo para encontrar dónde abandonan los nuevos registros entre la instalación y la primera tarea completada, y luego publica los principales hallazgos directamente en el canal de Slack del equipo.
Hermes Agent, desarrollado por Nous Research, es un agente de propósito general usado por millones de personas, que destaca en confiabilidad y automejora. Agnóstico de modelo y de proveedor, Hermes está hecho para funcionar todo el día en sistemas locales, lo que hace de las PC RTX, las workstations RTX PRO y DGX Spark una combinación natural.
Configurar un modelo local en Hermes ofrecerá una instalación de un clic en sistemas RTX y DGX en Windows. El agente detecta automáticamente la GPU NVIDIA, elige un modelo y una configuración adecuados y lo ejecuta mediante llama.cpp integrado, ya con las optimizaciones de inferencia de NVIDIA, lo que elimina descargas y ajustes manuales. El soporte para Linux llegará pronto.
Una vez en marcha, Hermes funciona igual que en cualquier otro lugar. Usa herramientas, mantiene el contexto entre tareas, recuerda información entre sesiones y crea skills reutilizables con el tiempo, lo que permite que el agente sea más capaz con el uso continuo. Ejecutar el modelo localmente en una GPU mantiene alto el rendimiento y los datos en el sistema.
La configuración de modelo local en un clic ya está disponible en Windows, y el soporte para Linux llegará pronto.
OpenClaw se convirtió en uno de los proyectos que definen el movimiento de agentes abiertos: es el mayor proyecto de IA en GitHub, con más de 380 mil estrellas y una comunidad en rápido crecimiento que construye herramientas y skills en investigación, ingeniería, gestión de proyectos y productividad cotidiana.
NVIDIA, Microsoft y OpenClaw han trabajado en conjunto para hacer esa experiencia más fácil de configurar en PC con Windows. Para reducir la fricción de onboarding, la app de OpenClaw para Windows simplifica el proceso de configurar un modelo local optimizado en cualquier GPU RTX con al menos 24 GB de VRAM.
Inferencia más rápida impulsa a los agentes locales
El rendimiento de inferencia es crítico para mantener a los agentes locales con buena capacidad de respuesta. NVIDIA sigue colaborando con las comunidades open source de llama.cpp y vLLM para acelerar cargas de trabajo con agentes en las plataformas NVIDIA locales.

llama.cpp entrega un throughput hasta 1.9 veces mayor mediante optimizaciones de kernel en una GeForce RTX 5090, técnicas mejoradas de decodificación especulativa y un prefill más rápido.
vLLM entrega 1.2 veces en la RTX PRO 6000 Blackwell Workstation Edition y hasta 1.4 veces en dos clústeres DGX Spark. Los nuevos kernels de atención XQA en FlashInfer y las optimizaciones de backend ayudan a acelerar la inferencia en ambas plataformas.
Estas ganancias están disponibles en los backends de inferencia llama.cpp y vLLM. Los usuarios también pueden acceder a ellas mediante las aplicaciones LM Studio y Ollama.
Aproveche las PC ociosas para tener más cómputo local con NVIDIA PAIR
Más de la mitad de los hogares en Estados Unidos tiene dos o más PC, y buena parte de ese poder de cómputo permanece ocioso a lo largo del día. NVIDIA Personal AI Router (PAIR) es una herramienta de software gratuita y de código abierto que pone esos sistemas a trabajar juntos en IA local.
Los flujos de trabajo con agentes suelen dividir tareas complejas en trabajos más pequeños que pueden correr en paralelo, pero el rendimiento cae cuando todas las solicitudes compiten por la misma GPU. PAIR descubre automáticamente las PC compatibles en la red local y enruta las solicitudes independientes de inferencia al sistema que tenga capacidad. Funciona con Ollama y LM Studio y se adapta conforme los dispositivos entran o salen de la red.
Por ejemplo, el usuario puede pedirle a Hermes que arme un plan de organización del domingo, filtrando una bandeja de entrada saturada y priorizando lo que necesita atención ahora, lo que puede esperar y lo que se puede omitir. Hermes divide ese trabajo entre varios subagentes, mientras PAIR distribuye esas tareas entre las PC disponibles en lugar de dejarlas todas esperando por una sola GPU.
El resultado es más cómputo para agentes locales, con más tareas corriendo en paralelo y la flexibilidad de mover cargas de IA a otra PC mientras el sistema principal se usa para jugar, crear o trabajar.
La beta de NVIDIA PAIR está disponible para Windows, macOS y Linux, con interfaz gráfica y de terminal, y soporta GPU NVIDIA GeForce RTX serie 20 y posteriores, GPU NVIDIA RTX PRO para workstation (arquitectura Turing y posteriores), NVIDIA DGX Spark y chips Apple M4 o posteriores.
Edición de fotos en el dispositivo con PhotoDirector AI PC Mode de CyberLink en RTX Spark
Los modelos abiertos de imagen y video permiten que los artistas experimenten con modelos de IA creativa en PC, iterando y explorando conceptos sin la ansiedad de gastar tokens y manteniendo más de su trabajo creativo privado y en el dispositivo.
El nuevo PhotoDirector AI PC Mode, de CyberLink, es una de las primeras aplicaciones en integrar estos modelos de difusión directamente en un software creativo. Llegará a PhotoDirector 365 y estará optimizado para NVIDIA RTX Spark en su lanzamiento. AI PC Mode trae herramientas de edición con IA para edición generativa, mejora de imagen, eliminación de objetos y distracciones, eliminación y reemplazo de fondo, refinamiento de retratos y creación de imágenes completamente nuevas, con la flexibilidad de elegir entre procesamiento local o en la nube según la tarea.
En GPU NVIDIA, PhotoDirector usa TensorRT-RTX y FP8 para acelerar la IA local.
Las PC con Windows NVIDIA RTX Spark llegan en octubre de 2026
NVIDIA RTX Spark llega en octubre, y en IFA 2026 los socios mostraron sus equipos. Los nuevos diseños anunciados se suman a las seis OEM que empiezan a vender en octubre. Acer mostró su concepto de escritorio compacto RTX Spark, y Lenovo anunció la Yoga Pro 9n y la Yoga 9n 2 en 1.
RTX Spark es un nuevo comienzo para las PC con Windows. Una PC hecha para creadores, gamers y agentes de IA. Con una GPU RTX Blackwell de 1 petaflop, hasta 128 GB de memoria unificada y una CPU Grace de 20 cores altamente eficiente, RTX Spark entrega rendimiento y eficiencia. Este superchip hace posibles laptops delgadas de alto rendimiento con batería para todo el día y equipos de escritorio compactos para sostener agentes siempre activos. Combinado con el nuevo Windows Agent framework, permite agentes que corren de forma segura en segundo plano bajo control del sistema operativo.
La semana pasada, en Gamescom, Electronic Arts, Embark y Ubisoft estuvieron entre las editoras y desarrolladoras que llevaron sus títulos a las PC con Windows NVIDIA RTX Spark. Se suman a las editoras que anunciaron soporte para RTX Spark en COMPUTEX, en mayo, incluidas KRAFTON, NetEase, Riot Games y XBOX.
Más novedades de la IA local de NVIDIA
🎮 NVIDIA lleva nuevas tecnologías RTX y juegos a Gamescom. NVIDIA lanzó DLSS 4.5 Ray Reconstruction, con un nuevo modelo transformer de segunda generación para mejorar la calidad de imagen en juegos con ray tracing y path tracing.
🐋 Llega DeepSeek Harness. El nuevo harness de código abierto de DeepSeek se combina con DeepSeek-V4-Flash para sostener flujos de trabajo locales de codificación con agentes en NVIDIA DGX Station y en configuraciones con múltiples DGX Spark.
📊 MLPerf Client v2.0 amplía el benchmarking de AI PC. MLCommons lanzó MLPerf Client v2.0, desarrollado en colaboración con NVIDIA y otros líderes de la industria. La actualización agrega nuevos benchmarks para IA basada en agentes y generación de imágenes, además de pruebas ampliadas de LLM para cargas locales del mundo real.
