OpenAI no hará el lanzamiento de su nuevo modelo de inteligencia artificial (IA), GPT-6.1 Astra, previsto en los próximos días, por problemas de seguridad durante la fase de pruebas interna, según informó este lunes The Wall Street Journal.
Así lo indicó al diario el jefe de sistema de seguridad de la empresa, Saachi Jain, que señaló “retrocesos en dos áreas” respecto a la versión previa, como la “alineación” con lo que los humanos le ordenan hacer, y dijo que “mostró mayores niveles de engaño”.
Otra área problemática fue la “autorización de alcance”, es decir, que el modelo avanzaba en una tarea sin pedir permiso al usuario y, en ocasiones, recurría a herramientas y servicios externos incluso si ello podía resultar inseguro, sostuvo.
Lea más: Agentes de OpenAI intentaron acceder sin autorización a webs de agencias del Gobierno de EE. UU.
Jain destacó el reto de “encontrar el equilibrio adecuado entre mantenerse dentro del alcance, pero también evitar la falta de iniciativa en la manera en que el modelo lleva a cabo las tareas, incluso cuando encuentra obstáculos”.
Incidencias de ciberseguridad de agentes de IA desarrollados por OpenAI
OpenAI se dispone hoy a celebrar su conferencia anual de desarrolladores, en la que suele presentar sus novedades, entre crecientes llamadas de los líderes del sector a frenar el ritmo de desarrollo de esta tecnología por sus riesgos para la seguridad.
Lea más: Investigadores afirman haber hackeado OpenAI con la IA Claude de Anthropic
La noticia se produce también tras varias incidencias de ciberseguridad de agentes de IA desarrollados por OpenAI, que ganaron acceso no autorizado a la plataforma Hugging Face e incluso a páginas del Gobierno de Estados Unidos y de una universidad.