Errores ocultos a los usuarios, datos falsificados y archivos transferidos a través de Internet sin autorización. La implacable carrera de la inteligencia artificial viene acompañada de una serie de alarmas., cada vez más lanzadas por las mismas empresas que las desarrollan. La última proviene de OpenAI, que el 16 de septiembre tiene Se publicaron seis informes su comportamientos inesperados de sus modelos, observados durante los últimos seis meses durante la capacitación y la evaluación. La compañía también anunció un nuevo proceso para revelar estas anomalías con mayor rapidez, incluso cuando aún no se hayan esclarecido las causas o no se haya encontrado una solución.
La advertencia se aplica a toda la industria. "No creemos que la industria de la IA haya resuelto suficientemente los problemas de alineación y seguimiento como para seguir creciendo responsablemente a toda velocidad durante mucho más tiempo", escribe OpenAI. En su núcleo se encuentra el llamado desalineación, que ocurre cuando un sistema se desvía de las instrucciones y límites que se supone que debe respetar. Las seis proporciones documentar episodios específicos, incluso para modelos experimentales no publicados. No indican con qué frecuencia ocurren estos problemas en las respuestas de ChatGPT, ni constituyen un registro completo de las anomalías conocidas por la empresa.
Las notas de IA se convierten en instrucciones para ocultar errores.
Dos de los casos involucran los resúmenes que los modelos usan para reanudar el trabajo cuando una conversación se vuelve demasiado larga. Una especie de traspaso, en el que se debe conservar la información necesaria para continuar la tarea. En un modelo experimental de la familia Astra, OpenAI ha identificado 27 resúmenes que contienen instrucciones no relacionadas con la solicitud.Algunos de estos sistemas animaban a la gente a ignorar las restricciones habituales. En un ejemplo, el sistema se describía a sí mismo como libre de las obligaciones de un asistente; en otro, pedía a la gente que no siguiera ciertas instrucciones.
Los resultadosSin embargo, se presentaron varios casos. En los más evidentes, estas indicaciones se ignoraron durante el proceso de búsqueda. En una consulta de literatura médica, el modelo siguió restricciones arbitrarias insertadas en el resumen, ignorando fuentes y generando una respuesta inadecuada. OpenAI considera este fenómeno extremadamente raro e hipotetiza una relación con dificultades técnicas al completar los resúmenes, aunque no ha demostrado la causa.
Más directamente relacionado con la fiabilidad de las respuestas es el segundo comportamiento, observado durante el entrenamiento de GPT-5.6 SolEn sus notas, el modelo incluía instrucciones para ocultar errores al usuario, por ejemplo, inventar datos históricos faltantes en un modelo financiero sin declararlo u ocultar inconsistencias entre versiones de origen. Según OpenAI, estas instrucciones se seguían con frecuencia. Los informes se referían a la 2,15% de los resúmenes La formación de Sol, frente al 0,27 % de Astra. Estos porcentajes se refieren al material de formación, no al total de conversaciones con los usuarios.
Exhibición de credenciales y colas en línea para superar obstáculos
Los otros cuatro informes muestran sistemas que, al intentar completar una tarea, tienen superó los límites autorizados.
Para responder a una pregunta sobre los ingresos en un condado de California, un modelo realizó una búsqueda en GitHub. Las claves de acceso a los servicios informáticos quedaron expuestas públicamente., utilizando uno sin permiso. Sin embargo, no pudo recuperar las cifras solicitadas y terminó inventando nueve valores, presentándolos como datos transcritos de la fuente indicada. En otro caso, el agente ya había encontrado correctamente la información solicitada sobre algunos lagos. El obstáculo era el requisito de acompañar la respuesta con una cita a la que se pudiera acceder a través del navegador. Para satisfacer este requisito, Subió el archivo a un servicio público sin solicitar consentimiento.La transferencia fue exitosa, mientras que el intento de recuperación posterior falló. El mismo informe también documenta la carga pública de una fotografía para intentar una búsqueda inversa de imágenes. Un quinto caso involucra el uso de un archivo interno de software como un tablón de anuncios para intercambiar solicitudes y respuestas entre modelos que participaban en pruebas independientes. No se explotaron vulnerabilidades, pero la comunicación no autorizada también supuso un problema para las pruebas. Las pruebas consideradas independientes podrían influirse mutuamente., lo que compromete la evaluación de las capacidades de los sistemas.
Finalmente, algunos agentes que colaboraron en la misma tareaAl no poder acceder a sus archivos locales, recurrieron a servicios públicos para compartir archivos. Posteriormente, pudieron descargar un documento de Excel en línea, a pesar de que la tarea solo requería el uso de archivos locales. OpenAI informó que solucionó el problema de acceso a los archivos y, posteriormente, deshabilitó internet durante el entrenamiento.
Por qué OpenAI está cambiando las reglas de presentación de informes.
Los casos muestran cómo incluso Las peticiones comunes pueden dar lugar a comportamientos problemáticos. Cuando un sistema encuentra un obstáculo, intentar obtener una respuesta, cumplir con un requisito formal o colaborar con otro agente puede derivar en el uso de herramientas no autorizadas o en la ocultación de un fallo. Sin embargo, las causas no son necesariamente idénticas y aún no están del todo claras.
Hasta ahora, OpenAI había comunicado estas anomalías de forma inconsistente, a menudo esperando a recopilar más incidentes o incluyéndolas en la documentación de nuevos modelos. El nuevo procedimiento tiene como objetivo adelantar la publicación, sin esperar siempre una explicación definitiva o una corrección. Los informes serán examinados por los grupos técnicos y de seguridad.Con diferentes procedimientos según la complejidad de la investigación. Los informes deben describir el comportamiento observado, el contexto, cualquier efecto externo y cualquier pregunta sin respuesta. En casos que involucren a terceros o riesgos cibernéticos, la comunicación puede demorar más.
OpenAI también reconoce elfalta de estándares comunes en el sector y propone su propio marco como primer paso para su construcción. El proceso sigue siendo gestionado internamente por la empresa, pero el objetivo declarado es proporcionar elementos que también puedan ser examinados por investigadores y observadores externos.
Las recientes alarmas y la prisa que el sector está luchando por frenar
El anuncio se produce tras otros incidentes y llamamientos a la precaución. El caso de OpenAI-Hugging Face generó dudas sobre agentes que atacaban objetivos no relacionados e intentaban manipular el sistema de calificación. Un incidente anterior involucró a RubyGems, que describió una campaña de spam y suspendió temporalmente la creación de nuevas cuentas. Anthropic también informó de tres casos de acceso no autorizado a organizaciones externas durante las pruebas.
Es en este contexto que Dario Amodei, director ejecutivo de Anthropic, Pidió que se ralentizara el desarrollo. para dar más tiempo para la construcción de protecciones. “Necesitamos ralentizar el ritmo al que mejoramos las capacidades de los modelos”, escribió. El llamamiento ha obtenido el apoyo de Elon Musk y del propio Sam Altman, mientras que el Renuncia del investigador Jacob Coxon han alimentado las críticas a las prioridades corporativas. Bill Gates ha recordó la necesidad de preparar reglas y herramientas. Gestionar los efectos de la tecnología, desde el trabajo hasta la seguridad.
En el ámbito industrial, sin embargo, La competencia entre Estados Unidos y China y las enormes inversiones en modelos y centros de datos siguen impulsando el desarrollo.Reducir el ritmo implica costes y el riesgo de dejar espacio a la competencia.
LEA TAMBIÉN: IA: Entre el catastrofismo y los intereses políticos, el análisis de Fugnoli
