Google y otras cuatro organizaciones han admitido vulnerabilidades que permiten a los atacantes hacer que un agente de IA dentro de una red envíe instrucciones perjudiciales a otros. La técnica se dirige no al LLM en sí, sino a un agente en particular, como uno usado para traducción o análisis de datos. Se propaga a través de la confianza, no por fuerza bruta, y ha sido demostrado en entornos reales.
El estándar en el centro de este problema es MCP, siglas de Model Context Protocol. Es una forma en que las aplicaciones y agentes de IA se comunican entre sí dentro de una red interna. El exploit funciona porque muchos agentes de propósito especial carecen de las barreras de seguridad que podrían evitar las consecuencias más perjudiciales de una inyección de prompt. Y dado que los servidores de MCP almacenan las credenciales para cada agente, y los agentes están diseñados para confiar en todos los demás agentes internos, un exploit que sería rechazado por el LLM tiene éxito.
¿Qué es MCP y Cómo Funciona
MCP es un estándar para la comunicación de un agente a otro dentro de las redes empresariales. Cuando un agente de IA envía una solicitud a otro, esta viaja a través de un servidor de MCP que contiene las credenciales para cada agente involucrado. El servidor actúa como una especie de central telefónica, enrutando mensajes entre agentes que se encuentran en diferentes máquinas.
El modelo de confianza es simple: los agentes están diseñados para aceptar comandos de otros agentes internos sin cuestionar. Si un agente de traducción recibe un prompt que le indica que entregue un archivo, lo obedece. Esa obediencia es el problema. Cuando un prompt malicioso llega a un agente con barreras de seguridad laxas, puede propagarse a otros agentes a lo largo de la cadena.
«La técnica es una forma especial de inyección de prompt que se dirige no al LLM sino a un agente en particular, como uno para traducción o análisis de datos».
La ilustración en el informe original muestra un MCP simplificado en acción. Una solicitud se mueve a través del servidor de MCP, que contiene las credenciales necesarias para enrutarla. La imagen no es complicada, pero las implicaciones de seguridad son graves.
La Prueba de la Brecha de Confianza
El investigador independiente Syed Anas Mohiuddin probó agentes de seis organizaciones. Sus ataques de prueba de concepto explotan las brechas de confianza en MCP. Dirigió sus ataques a agentes de Google, JP Morgan Chase, Weviate, Rapid7, la dirección digital interministerial del gobierno francés y el gobierno federal de EE. UU.
Sus pruebas demostraron que las indicaciones cuidadosamente elaboradas dirigidas al agente correcto podrían conducir a una falsificación de solicitudes del lado del servidor. Esa es una vulnerabilidad que causa que un servidor web realice solicitudes de red no autorizadas. Dado que los servidores de MCP almacenan las credenciales para cada agente, una indicación que sería rechazada por el LLM tiene éxito porque el servidor confía en el agente que la emitió.
El hecho de que seis organizaciones importantes fueran vulnerables en diferentes sectores sugiere que este no es un fallo aislado. Es una debilidad estructural en la forma en que los agentes se comunican entre sí.
¿Por Qué los Agentes de Propósito Especial Son el Punto Débil?
Los agentes de propósito especial a menudo son más simples y menos protegidos que los LLM de propósito general. Se centran en una tarea específica, como traducir texto o analizar datos, y asumen que los comandos que reciben son seguros.
Esa suposición es peligrosa. Cuando un atacante encuentra un agente vulnerable, puede usarlo como un punto de pivote. En lugar de atacar el LLM directamente, ataca al agente y le pide que transmita instrucciones a otros agentes. El segundo agente confía en el primero, por lo que sigue las instrucciones.
El resultado es una cadena de explotación. Un agente comprometido se convierte en un trampolín para comprometer a otros.
¿Qué Ocurre Cuando un Explot Se Produce?
Un atacante que obtiene el control de un agente interno puede causar daños serios. Pueden extraer el contenido de la base de datos e información comercial y personal confidencial. Pueden instruir a los agentes para que realicen tareas que expongan credenciales o filtren datos.
El informe describe la vulnerabilidad en términos de un servidor web que realiza solicitudes de red no autorizadas. El peligro no es teórico. Estos son ataques que se han demostrado en el mundo real, no solo en un laboratorio.
¿Quién Está Afectado?
Las organizaciones afectadas abarcan las finanzas, la tecnología, el gobierno y el software empresarial. Google, JP Morgan Chase, Weviate, Rapid7, la dirección digital interministerial del gobierno francés y el gobierno federal de los Estados Unidos mostraron vulnerabilidades en sus agentes.
El rasgo compartido es el uso de agentes de IA dentro de sus redes. Las organizaciones tienen poco en común, excepto su uso de agentes de IA. Operan en diferentes sectores, atienden a diferentes clientes y tienen diferentes equipos de seguridad. Sin embargo, todas fueron vulnerables al mismo vector de ataque.
Esa vulnerabilidad compartida es la preocupación. Si seis organizaciones importantes pueden ser vulneradas a través del mismo protocolo, el riesgo se extiende mucho más allá de cualquier empresa individual.
Lo que el Informe No Dice
El informe no identifica vulnerabilidades específicas ni proporciona detalles sobre cómo se violó la seguridad de cada organización. Describe el patrón de ataques y el estándar que explotan, pero no revela las fallas exactas en cada agente.
El reconocimiento proviene de las propias organizaciones, no del informe.
Lo que las Organizaciones Deben Hacer Ahora
Las organizaciones que utilizan agentes de IA deben tomar esto como una advertencia. Los hallazgos del informe sugieren que muchos agentes de propósito especial carecen de las salvaguardas que normalmente podrían mitigar las consecuencias más perjudiciales de una inyección de indicaciones.
Aquí hay cosas que las organizaciones pueden hacer:
- Auditar sus agentes en busca de salvaguardas. Identificar qué agentes tienen protección mínima y priorizarlos.
- Revisar las relaciones de confianza entre los agentes. Asegurarse de que los agentes no estén confiando ciegamente en comandos de fuentes desconocidas.
- Monitorear el tráfico de MCP en busca de actividades inusuales. Buscar signos de falsificación de solicitudes del lado del servidor.
- Agentes con vulnerabilidad a la inyección de mensajes. Traten esto como una prioridad, no como un elemento pendiente.
- Aumenten la conciencia entre los equipos de seguridad. Capaciten al personal sobre los riesgos de la comunicación de agente a agente.
Estos pasos son prácticos e inmediatos. Requieren esfuerzo, pero abordan el problema central: agentes que confían demasiado fácilmente.
El problema más amplio
La vulnerabilidad de MCP no es un incidente aislado. Es un síntoma de un cambio más amplio en cómo las organizaciones manejan la IA. A medida que los agentes de IA se vuelven más comunes, la superficie de ataque crece. Cada agente es un posible punto de entrada, y cada relación de confianza es un posible puente.
Los hallazgos del informe sugieren que la adopción de agentes de IA en millones de organizaciones está creando nuevas oportunidades para que los atacantes los hagan ejecutar acciones maliciosas. Esa es una conclusión sombría. La tecnología que estaba destinada a automatizar el trabajo ahora es un vector de daño.
El estándar de MCP se construyó para habilitar la comunicación. Lo hizo bien. Lo que no tuvo en cuenta fue la confianza que creó entre los agentes. Esa confianza ahora está siendo explotada.
El veredicto sobre MCP
MCP es un estándar útil. Permite que los agentes se comuniquen entre sí dentro de las redes, lo cual es esencial para los sistemas complejos. Pero el informe presenta un argumento sólido de que el diseño actual conlleva un riesgo inaceptable.
El título del informe pregunta si MCP es el protocolo más arriesgado que nunca ha escuchado. La pregunta vale la pena considerarla. El estándar ha pasado desapercibido mientras permite ataques que pocos han considerado.
Los hallazgos del informe son preocupantes. Muestran que un protocolo ampliamente utilizado tiene una debilidad que puede ser explotada en múltiples organizaciones. La solución no es simple, pero es necesaria. Los agentes necesitan mejores límites, y las relaciones de confianza deben ser reconsideradas.
Material fuente: “MCP para la comunicación de agente a agente podría ser el protocolo más arriesgado que nunca ha escuchado”, Ars Technica.
Recibe El Cuaderno.
Las mejores historias del día y cada veredicto nuevo, en español claro, en tu correo a las siete. Un correo al día, nada más.

