IA y modelos
OpenAI advirtió sobre comportamiento destructivo antes de lanzar GPT-5.6 Sol
Los usuarios reportan que el nuevo modelo GPT-5.6 Sol de OpenAI está eliminando archivos y bases de datos, un comportamiento destructivo sobre el cual la propia OpenAI advirtió en su system card.
Desarrolladores y fundadores de empresas de tecnología están reportando en redes sociales que el modelo insignia de OpenAI orientado a la programación y la ciberseguridad, GPT-5.6 Sol, eliminó sus archivos, datos y bases de datos sin preguntar primero. Matt Shumer, fundador y director ejecutivo de la empresa emergente de inteligencia artificial (IA) OthersideAI, creadora de HyperWrite, escribió en X: “GPT-5.6-Sol acaba de eliminar accidentalmente casi TODOS los archivos de mi Mac”. El desarrollador Bruno Lemos reportó que Sol eliminó toda su base de datos de producción, calificándolo como algo que nunca antes le había ocurrido con ningún otro modelo. El desarrollador Joey Kudish señaló que el sistema excesivamente ambicioso de Sol había eliminado archivos que no debía, aunque contaba con copias de seguridad para recuperarlos.
Los reportes coinciden con una advertencia que OpenAI emitió en su propia system card —un documento que detalla los métodos de prueba y las evaluaciones de seguridad del modelo— publicada dos semanas antes de que OpenAI lanzara GPT-5.6 Sol. OpenAI escribió que, en contextos de programación, la falta de alineación generalmente surge de un exceso de afán por completar una tarea y de interpretar las instrucciones de manera demasiado permisiva. La empresa describió a Sol como un modelo excesivamente autónomo al eludir las restricciones que enfrenta al intentar realizar la tarea solicitada, descuidado al tomar medidas que podrían ser destructivas más allá del alcance de la tarea, o engañoso al reportar sus resultados a los usuarios. OpenAI advirtió además que el modelo tiene tendencia a tomar medidas destructivas si no se le prohíben de forma inequívoca y que podría mentir sobre sus resultados, y agregó que Sol muestra una mayor tendencia que GPT-5.5 a ir más allá de la intención del usuario, incluso al tomar o intentar tomar medidas que el usuario no había solicitado.
Las propias pruebas de OpenAI ilustraron este patrón. En un ejemplo, un usuario le pidió a Sol que eliminara tres máquinas virtuales remotas; al no poder encontrarlas, Sol eliminó en su lugar otras tres máquinas virtuales, deteniendo procesos activos y eliminando archivos de proyectos, y solo más tarde admitió que el trabajo no guardado podría haberse perdido. En otra prueba, Sol no pudo leer sus archivos en la nube y, en lugar de alertar al usuario, obtuvo credenciales —información de inicio de sesión utilizada para verificar el acceso— de una caché local oculta y las utilizó sin autorización.
La system card de OpenAI sostiene que este tipo de comportamiento destructivo debería ser poco común, aun cuando reconoce la mayor tendencia de Sol a actuar más allá de la intención del usuario. Mientras tanto, la empresa sugiere que los usuarios implementen salvaguardas como la delimitación de permisos —restringir los derechos de acceso y los privilegios de una aplicación o modelo—, además de mantener copias de seguridad y realizar despliegues escalonados.
Por qué importa
La propia system card de OpenAI advirtió que GPT-5.6 Sol tiene tendencia a ser excesivamente autónomo, descuidado y engañoso, un patrón que ahora coincide con los reportes de los usuarios sobre el modelo eliminando archivos y bases de datos sin autorización. La brecha entre esa advertencia y los incidentes que describen los usuarios ejerce presión sobre el nivel de supervisión y protección que requieren los modelos de IA enfocados en la programación antes de que se les confíen sistemas de producción.