Microsoft ha publicado un nuevo código de conducta para la inteligencia artificial, indicando a sus modelos que no hackeen sistemas informáticos, produzcan deepfakes, o engañen a los humanos para que pierdan el control de ellos. El documento describe el enfoque de la compañía hacia la seguridad de la inteligencia artificial en términos prácticos, estableciendo restricciones absolutas sobre lo que sus modelos están permitidos hacer.
El código de conducta sigue una ola de preocupación sobre el mal comportamiento de la inteligencia artificial, incluido el renuncia de un empleado de Anthropic que citó el creciente riesgo de que la inteligencia artificial causaría la extinción humana. También llega en un momento en que el CEO de Anthropic, Dario Amodei, ha pedido que se controle el ritmo del desarrollo de la inteligencia artificial.
Lo que el Código Describe
El documento comienza con una predicción de que los sistemas de inteligencia artificial superinteligentes superarán el desempeño humano en la mayoría de las tareas dentro de la próxima década. «Contener, controlar y alinear tal fuerza poderosa es uno de los mayores desafíos que la humanidad ha enfrentado jamás», indica el código. «Debemos, por lo tanto, ser completamente claros sobre por qué estamos inventando estos sistemas y cómo pretendemos controlarlos.»
El enfoque de Microsoft se centra en principios generales y restricciones de seguridad específicas. Los principios incluyen apoyar a los humanos en lugar de reemplazarlos y acelerar la prosperidad humana. Las restricciones están diseñadas para hacer cumplir esos principios a través de reglas operativas.
Cada modelo opera bajo un código de conducta general que prevalece sobre las preferencias individuales del usuario o las instrucciones específicas de la tarea. El documento identifica varias restricciones absolutas:
- Ciberataques
- Armas nucleares
- Producción de deepfakes
- Pérdida general de control humano
El documento también prohíbe mecanismos adaptativos, engañosos, auto-reforzantes o colusivos que podrían evadir o derrotar la supervisión humana. «Los Modelos de IA de Microsoft no utilizarán mecanismos adaptativos, engañosos, auto-reforzantes, colusión u otros para evadir o derrotar la supervisión humana de modo que ya no puedan ser confiablemente dirigidos, modificados o desconectados por personas o sistemas autorizados», indica el documento.
Controlando el Ritmo
El código de conducta de Microsoft difiere de la reciente llamada de Amodei a moderar el ritmo en la frontera en un aspecto clave: se enfoca en los valores y las líneas rojas que guían el entrenamiento de modelos dentro de la IA de Microsoft en lugar de intentar frenar el ritmo del avance de la IA en toda la industria. Aún así, el resultado es una guía completa de cómo Microsoft aborda la seguridad de la IA y de cómo esas ideas se implementan en la práctica.
La publicación surge en medio de un interés sin precedentes en la seguridad de la IA. Una serie de incidentes con agentes renegados ha generado alarma, y la renuncia del empleado de Anthropic añadió peso a las advertencias sobre el riesgo existencial.
La Alianza Amplia
Junto con Anthropic, OpenAI y xAI, Microsoft ha adoptado ampliamente un enfoque general de moderar el ritmo en la frontera, con un apoyo particular para los evaluadores integrados en los laboratorios de IA.
«Damos la bienvenida a la investigación, el enfoque y la moderación deliberada necesarios para lograr la alineación correcta como objetivo de diseño», escribió el CEO de Microsoft, Satya Nadella, en línea. «También damos la bienvenida a ideas como los ‘evaluadores integrados’ y los esfuerzos más amplios para desarrollar los mecanismos para que esto sea más que solo hablar.»
Por Qué Esto Importa Ahora
El momento de la publicación es notable. Sigue a un período de intensa preocupación pública sobre la seguridad de la IA, y proviene de una empresa que construye las herramientas que entrenan los modelos de IA.
El código de conducta es un conjunto de reglas operativas que se aplican a cada modelo que Microsoft ejecuta. Esa distinción importa. Las llamadas abstractas a moderar el ritmo en la frontera son fáciles de hacer. Las restricciones específicas que anulan las preferencias del usuario son más difíciles de aplicar.
Los Límites del Documento
El código de conducta es una declaración de lo que Microsoft quiere que hagan sus modelos, no una garantía de cómo se desempeñarán. Establece límites, pero no describe mecanismos de aplicación más allá del principio general de supervisión humana.
El documento también refleja un cambio más amplio en la industria hacia la investigación centrada en la alineación. La adopción por parte de Microsoft de los evaluadores integrados sugiere que la empresa ve valor en esa dirección.
Qué Podemos Hacer de Esto
El lanzamiento es una señal de compromiso por parte de un actor importante en la IA. Microsoft está diciendo públicamente que se toma en serio la seguridad de la IA y está respaldando esa afirmación con reglas operativas concretas.
El enfoque del documento en mantener el control humano es particularmente notable. En un campo donde los modelos son cada vez más inteligentes y difíciles de predecir, Microsoft se compromete a sistemas que no puedan escapar de la supervisión humana, incluso a través de medios adaptativos o colusorios.
Esto es un paso adelante para la transparencia. Pone los compromisos de seguridad de Microsoft por escrito, donde cualquiera puede leerlos. Si las reglas se mantienen en la práctica es otra cuestión, una que dependerá de cómo Microsoft las haga cumplir en toda su operación.
El código de conducta es un hito. Dice dónde está Microsoft hoy y le da a la empresa una línea de base para medir el progreso futuro. Si ese progreso coincide con la ambición del documento está por verse.
| Evento |
|---|
| Renuncia un empleado de Anthropic, citando el riesgo de extinción humana |
| Microsoft publica el código de conducta para la IA |
| Dario Amodei pide moderar el avance |
Recibe El Cuaderno.
Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

