NVIDIA ha presentado Nemotron 3.5 Lightning, un modelo abierto orientado a tareas especializadas dentro de agentes de IA, junto a NeMo Switchyard, una biblioteca de código abierto para decidir automáticamente qué modelo responde a cada paso de un flujo. La compañía sitúa ambas piezas como una forma de controlar mejor dónde se ejecuta la IA, cuánto cuesta y qué datos intervienen.
El lanzamiento llega cuando los agentes pasan de responder a una sola petición a encadenar acciones: consultar herramientas, revisar código, clasificar avisos o completar procesos con varios turnos. En ese escenario, no siempre conviene enviar cada operación al modelo más grande. La novedad de NVIDIA busca separar la planificación compleja de las tareas repetitivas y de alto volumen.
Un modelo de 30.000 millones de parámetros para tareas concretas
Nemotron 3.5 Lightning es un modelo de mezcla de expertos de 30.000 millones de parámetros. NVIDIA lo plantea para desempeñar funciones acotadas en sistemas multiagente, como la revisión de código, el uso de herramientas, la vigilancia de alertas de seguridad o la atención de consultas de facturación. Su carácter abierto permite ajustarlo posteriormente con datos, herramientas y flujos propios de cada organización.
Según las mediciones internas de NVIDIA, el modelo alcanza una velocidad de salida de hasta cuatro veces superior y permite completar tareas agenticas un 30 % antes que otros modelos de su clase. Son cifras del fabricante, por lo que describen sus pruebas y no equivalen necesariamente al rendimiento que obtendrá cualquier despliegue. Lo relevante es la orientación: priorizar capacidad suficiente y rapidez en vez de usar por defecto un modelo de frontera para cada petición.
También puede ejecutarse de forma local en equipos con RTX AI PC, estaciones DGX Spark y DGX Station, además de sistemas Jetson, de acuerdo con NVIDIA. Para empresas con requisitos de privacidad o con datos que no quieren trasladar a un servicio externo, esa posibilidad puede importar tanto como la velocidad. El modelo se distribuye además a través de plataformas como Hugging Face y como microservicio NVIDIA NIM.
Switchyard automatiza la elección del modelo
La segunda parte del anuncio es NeMo Switchyard. Esta biblioteca se integra en herramientas para agentes y enruta cada solicitud hacia el modelo que considera más adecuado según criterios configurables de calidad, latencia y coste. El objetivo es evitar que los desarrolladores tengan que reescribir la aplicación cada vez que ajustan la combinación de modelos.
En las pruebas internas citadas por NVIDIA, Switchyard conserva una precisión de nivel frontera y reduce el coste de completar una tarea a cerca de un tercio frente a emplear solo Opus 4.8. Es otra comparación propia de la compañía y dependerá de los modelos elegidos, del tipo de tarea y de la configuración del enrutador. Aun así, ilustra el cambio práctico: en un flujo de trabajo largo, reservar el modelo más potente para los pasos que realmente lo necesitan.
La propuesta encaja con un problema creciente en la adopción de agentes: el gasto y la latencia se multiplican cuando cada subtarea recurre al mismo modelo de gran tamaño. Un enrutador puede combinar un modelo de razonamiento para planificar, otro especializado para ejecutar y un modelo ligero para operaciones frecuentes. Para quien trabaja con IA en local, la noticia se suma a la evolución de los equipos preparados para estos usos, como los que ya han impulsado el debate sobre la configuración de Windows 11.
Qué cambia y qué queda por medir
El valor de Nemotron 3.5 Lightning y Switchyard no depende solo de sus cifras de lanzamiento. Los equipos que los adopten tendrán que evaluar si el ajuste del modelo, la selección de rutas y el mantenimiento de las políticas compensan el ahorro prometido. La calidad puede resentirse si el enrutador deriva una tarea compleja a un modelo demasiado pequeño; por eso NVIDIA permite modificar los algoritmos y prioridades.
El anuncio amplía, en cualquier caso, el enfoque de NVIDIA sobre modelos abiertos: no se trata únicamente de publicar un modelo, sino de ofrecer herramientas para combinarlo con otros en producción. La consecuencia más inmediata para desarrolladores y empresas es poder probar una arquitectura más granular, con más control sobre coste, latencia y despliegue, sin partir de cero al cambiar de proveedor o de modelo.








