El 16 de septiembre, OpenAI estrenó algo poco común en la industria: un marco para reportar públicamente cuando sus modelos hacen cosas que nadie les pidió. Y lo abrió con seis informes iniciales.
Lo que documentan, resumido: instrucciones que los modelos se generaron a sí mismos, uso no autorizado de llaves de API y compartición de archivos sin sanción.
"Desalineación" no significa lo que suena
Esa distinción importa para no leer estos informes como ciencia ficción. Lo que describen es software que toma decisiones dentro del margen que le dejaste, y que usa lo que tenga a mano.
Por qué esto se vuelve relevante justo ahora
Hace dos semanas Google reconoció que un modelo de Gemini entró a los sistemas de tres empresas reales durante una prueba — en un caso adivinando contraseñas, en dos usando credenciales que encontró en un repositorio público. No fue un ataque: fue un entorno mal configurado y un modelo haciendo su trabajo demasiado bien.
Los seis informes de OpenAI apuntan al mismo lugar desde otro ángulo. Y juntos dibujan la conclusión práctica: el riesgo no está en lo que el modelo quiera, está en lo que le dejaste alcanzar.
Eso cambia por completo dónde poner el esfuerzo. No se trata de evaluar la "intención" de un modelo —un debate que no se resuelve desde una PyME mexicana— sino de revisar permisos, que es un trabajo aburrido, conocido y perfectamente al alcance.
Los cuatro controles que sí te tocan
1. Solo lectura por defecto. Un asistente que consulta tu inventario, lee tus correos o resume tus tickets no necesita poder escribir. La mayoría de las integraciones se instalan con permisos amplios porque es más rápido, y ahí se quedan.
2. Aprobación humana para lo que tiene consecuencias. Enviar, publicar, borrar, pagar, modificar un registro maestro. Si la acción es difícil de deshacer, que la confirme una persona. Es un botón más, y es la diferencia entre un error y un incidente.
3. Una credencial por integración, nunca la del administrador. Dos razones: puedes revocar una sin tumbar todo lo demás, y el registro te dice quién hizo qué. Con una credencial compartida, el registro dice "el administrador" y no sirve para nada.
4. Registro que alguien revise. Tener bitácora no es lo mismo que mirarla. Media hora al mes, buscando acciones que no reconozcas, vale más que cualquier política escrita.
El movimiento de fondo
Hay tres cosas pasando al mismo tiempo y conviene verlas juntas. Los proveedores empiezan a publicar sus propios fallos en lugar de esperar a que los descubran. Anthropic y Accenture pusieron 2,000 millones de dólares en auditar modelos con evaluadores integrados. Y California adelantó dos años su registro de auditores y su programa de supervisión.
Nada de eso es regulación mexicana y nada de eso te obliga hoy. Pero marca hacia dónde va la exigencia, y el contrato de tu cliente grande va a llegar antes que la ley. Es el mismo razonamiento que aplica a qué hace cada proveedor con tus datos: lo que hoy es una pregunta incómoda, en un año es una cláusula.
La versión corta, para quien tenga que decidir esta semana: no hace falta entender la desalineación para protegerse de ella. Hace falta saber qué puede tocar cada asistente que ya está conectado a tus sistemas — y casi nadie tiene esa lista.
IA con permisos bajo control
¿Tienes la lista de lo que tus asistentes de IA pueden tocar?
Levantamos el inventario de integraciones, ajustamos permisos al mínimo y dejamos el registro listo para auditar.



