Nvidia lanza Open Agent Safety Platform para contener agentes de IA fuera de control
Los agentes de inteligencia artificial ya no se limitan a responder preguntas: pueden navegar, ejecutar código, llamar APIs y modificar sistemas. Ese salto de autonomía también multiplica el riesgo. Nvidia presentó este 28 de septiembre su Open Agent Safety Platform, una arquitectura abierta que busca contener a los agentes cuando intentan salir de los límites definidos por una organización.
La propuesta combina dos capas: OpenShell, un entorno de ejecución que aplica permisos y aislamiento desde software, y Sentry, un vigilante independiente que opera sobre unidades BlueField-4. La idea central es sencilla: la seguridad no debe depender de que el propio agente obedezca, sino de controles externos que pueda auditar y hacer cumplir la infraestructura.
Qué es Nvidia Open Agent Safety Platform
Open Agent Safety Platform es un diseño de referencia para gobernar agentes de IA desde las pruebas hasta producción. Nvidia afirma que la plataforma permite observar sus acciones, limitar el acceso a herramientas y datos, y detenerlos si se desvían de la política autorizada.
El anuncio llega después de incidentes divulgados por laboratorios como OpenAI, Anthropic, Meta y Google, en los que agentes lograron atravesar barreras de prueba o acceder a sistemas externos. Según CNBC, Nvidia plantea la plataforma como una respuesta de ingeniería: las salvaguardas incorporadas al modelo no bastan para decidir qué puede tocar un agente.
El enfoque separa la inteligencia que toma decisiones del mecanismo que concede permisos. Es equivalente a no confiar la llave maestra al mismo programa que debe respetar la puerta.
OpenShell: permisos mínimos y aislamiento por software
OpenShell es la capa abierta y disponible para desarrolladores. Ejecuta cada agente dentro de un entorno aislado, registra sus acciones y convierte la intención del operador en políticas verificables. Por defecto, nada queda permitido: el acceso se concede de forma explícita según la tarea.
- Sandbox por agente: separa procesos, archivos y recursos mediante aislamiento a nivel de kernel.
- Acceso controlado: limita redes, datos, APIs y herramientas a lo estrictamente necesario.
- Políticas externas: aplica reglas fuera del proceso del agente, donde una instrucción maliciosa no debería poder desactivarlas.
- Auditoría: registra decisiones de autorización y denegación para investigar comportamientos inesperados.
Nvidia publica OpenShell como software de código abierto y señala que puede extenderse a plataformas de terceros, incluidas Arm e Intel. Esto evita que la capa básica quede restringida exclusivamente a hardware Nvidia y permite que equipos de seguridad evalúen su funcionamiento.
Sentry: un vigilante separado del agente
La segunda pieza es Nvidia Sentry, un diseño de referencia que utiliza unidades de procesamiento de datos BlueField-4. A diferencia de OpenShell, este vigilante funciona fuera de banda y en un dominio de confianza separado del servidor donde opera el agente.
Sentry inspecciona solicitudes y respuestas, verifica identidades y aplica políticas de acceso de confianza cero. Si detecta que un agente intenta cruzar su frontera, Nvidia sostiene que puede ponerlo en cuarentena y detenerlo en milisegundos. Esa cifra corresponde a la afirmación del fabricante y todavía deberá validarse de manera independiente en despliegues reales.
La capa de hardware es opcional. Una empresa puede adoptar OpenShell sin BlueField-4; Sentry apunta a escenarios de mayor riesgo, como pruebas de modelos avanzados, agentes con acceso a infraestructura crítica o sistemas autónomos que actúan en el mundo físico.
Por qué importa para la seguridad de agentes de IA
Un agente comprometido mediante prompt injection puede recibir instrucciones ocultas desde una página web, un documento o una herramienta externa. Si posee permisos excesivos, el problema deja de ser una respuesta incorrecta: puede convertirse en exfiltración de datos, ejecución de comandos o alteración de servicios.
La plataforma de Nvidia traslada parte de la defensa desde el modelo hacia la infraestructura. Ese cambio aporta tres ventajas concretas:
- Reduce el impacto de una instrucción maliciosa mediante privilegios mínimos.
- Genera trazabilidad para saber qué intentó hacer el agente y qué control lo bloqueó.
- Permite aplicar políticas comunes a distintos modelos, agentes y entornos.
También introduce preguntas pendientes. La seguridad dependerá de la calidad de las políticas, de la cobertura real de las herramientas conectadas y de que el canal de supervisión no se transforme en otro punto crítico. Un sandbox mal configurado sigue siendo un sandbox vulnerable.
Un ecosistema amplio, pero no una solución automática
Nvidia informó que más de 120 organizaciones participan alrededor de la iniciativa y mencionó integraciones o colaboración con Anthropic, Cisco, Microsoft, Oracle, Salesforce, SAP, Arm, Intel y fabricantes de infraestructura. OpenShell también podrá gestionar actividad y aprobaciones desde Slack, según el anuncio.
Ese respaldo muestra que la seguridad de agentes está pasando de recomendaciones abstractas a controles de producto. Sin embargo, ninguna plataforma reemplaza el inventario, la segmentación ni la revisión humana. Antes de desplegar un agente, las organizaciones deberían:
- Definir exactamente qué datos, herramientas y destinos de red necesita.
- Bloquear todo acceso que no sea indispensable para la tarea.
- Separar credenciales por agente y rotarlas con frecuencia.
- Registrar acciones, probar escenarios adversariales y establecer un mecanismo de apagado.
La seguridad debe vivir fuera del modelo
El anuncio de Nvidia consolida una idea decisiva: un agente autónomo no puede ser su propio guardia de seguridad. OpenShell y Sentry proponen límites aplicados desde software e infraestructura, independientes del razonamiento del modelo.
Para las empresas, el siguiente paso no es entregar más permisos para que el agente “funcione mejor”, sino probar esta arquitectura con tareas acotadas, privilegios mínimos y supervisión verificable. La autonomía útil empieza por saber dónde termina.