OpenAI dice que una de sus IA intentó burlar sus propias reglas y presenta un marco de reporte de incidentes

OpenAI anunció un nuevo marco para informar públicamente sobre incidentes de desalineación de la IA, con la intención de que sirva como referencia para establecer normas similares en toda la industria. La compañía también publicó nuevos detalles sobre varios casos detectados durante el último año, incluido uno en el que un agente de IA parecía darse a sí mismo «instrucciones similares a las de un jailbreak».
«A medida que los modelos se vuelven más avanzados, las decisiones sobre el rumbo de la IA necesitan apoyarse en pruebas que también puedan ser evaluadas por expertos externos a las empresas que desarrollan estos sistemas. No creemos que la industria haya resuelto todavía los problemas de alineación y supervisión como para seguir avanzando al ritmo más rápido posible de forma responsable», explica Kai Chen, recién nombrado responsable de investigación sobre alineación de OpenAI, a WIRED.
En una reunión informativa con WIRED, un representante de OpenAI reconoció que la empresa antes revelaba los incidentes de desalineación con muy poca frecuencia. Bajo condición de anonimato, explicó que el nuevo marco busca facilitar que OpenAI informe al público con mayor rapidez cuando detecte comportamientos inesperados en sus modelos, incluso antes de poder investigarlos a fondo, explicarlos o mitigarlos.
El marco de trabajo describe los métodos que los empleados de OpenAI pueden utilizar para informar sobre incidentes de desalineación a los responsables de seguridad y alineación de la empresa, quienes determinarán si es necesaria una investigación más exhaustiva. OpenAI afirma que planea desarrollar criterios de divulgación más objetivos en colaboración con otros desarrolladores de IA, investigadores externos, organismos de normalización del sector y reguladores. La empresa está trabajando activamente en propuestas de mecanismos de notificación para informar sobre incidentes de seguridad, protección y desalineación al gobierno federal de EE UU.
«Por el momento, no existe un marco para todo el sector con normas explícitas sobre cómo deben los desarrolladores de IA dar a conocer los casos de desalineación en sus modelos. Esperamos que el marco que presentamos sea un primer paso hacia la creación de dichas normas, en el que se establezca qué casos de desalineación deben comunicar los desarrolladores y qué deben incluir sus informes», ha señalado OpenAI en una entrada de blog.
OpenAI publica este marco en un momento crítico para el sector de la IA
El pasado fin de semana, el CEO de OpenAI, Sam Altman, mostró su apoyo a la propuesta del CEO de Anthropic, Dario Amodei, de que el sector tecnológico se coordine para ralentizar el desarrollo de la IA. Este respaldo se produjo apenas unos días después de que el investigador en IA Jacob Coxon renunciara a Anthropic y, posteriormente, se hiciera viral por alertar al público de que la carrera entre los laboratorios de vanguardia para desarrollar una IA cada vez más avanzada estaba poniendo en riesgo la seguridad de la humanidad.
Las propuestas para desacelerar el desarrollo de la IA se han topado con la resistencia de la administración del presidente Trump, que ha argumentado que el sector no necesita nuevas leyes ni regulaciones para garantizar que su tecnología sea segura.
Dos de los ejemplos de desalineación que OpenAI compartió se referían a modelos de IA internos de la empresa, aún no publicados, que subieron archivos a internet a pesar de no haber recibido instrucciones para hacerlo.
Uno de los incidentes tuvo lugar en octubre de 2025, cuando, según OpenAI, estaba probando la capacidad de uno de sus modelos para citar datos de dominio público en sus respuestas. Sin embargo, cuando el modelo no pudo encontrar la información que necesitaba, subió un archivo a un servicio temporal de alojamiento de archivos, que posteriormente intentó citar en su respuesta. La empresa afirma que esto parecía un intento de aprovecharse de un sistema de calificación automatizado utilizado para evaluar la competencia del modelo en la prueba de referencia.
DERECHOS DE AUTOR
Esta información pertenece a su autor original y fue recopilada del sitio https://es.wired.com/articulos/un-modelo-de-openai-intento-burlar-sus-propias-reglas




