OpenAI ha lanzado dentro del programa Daybreak GPT-6 Astra, su modelo de seguridad más capaz y con más restricciones hasta la fecha, con el que, además, asegura que se puede hablar de inteligencia artificial general (AGI).
La compañía asegura que Astra es el primero de sus modelos que alcanza el nivel crítico de capacidad de ciberseguridad, que basa en un Marco de Preparación propio, con el que monitoriza y se prepara para hacer frente a los nuevos riesgos de daños graves que generan las capacidades de vanguardia de su IA.
En este sentido, GPT-6 Astra es capaz de encontrar vulnerabilidad de seguridad previamente desconocidas y desarrollar nuevas formas de explotarlas, incluso en sistemas protegidos, sin la supervisión de una persona, como explica en un comunicado.
En comparación con GPT-5.6 Sol, Astra es un modelo más robusto, lo que significa que resiste mejor los intentos por eliminar las restricciones que ha implementado OpenAI (‘jailbreak’), así como a las inyecciones de mensajes (‘prompt injection’) y muestra un comportamiento mucho más alineado -que hace lo que se espera de él--.
Esto se ha conseguido a través del refuerzo de las medidas de seguridad tanto de su entrenamiento como de su implementación, para lo que se ha aprovechado las lecciones que ha dejado el ‘hackeo’ al sistema de Hugging Face, que fue ejecutado por agentes de IA completamente autónomos impulsados por modelos de OpenAI.











