Dos desarrolladores extrajeron el sistema de archivos completo de Muse, el asistente de inteligencia artificial de Meta, con un simple prompt. Peter James y Jonny L. Saunders replicaron el resultado por separado. La compañía, consultada por The Verge, niega que el episodio constituya una brecha de seguridad.
Claves de la operación
- Un prompt desnuda toda la máquina virtual. Muse comprimió y entregó su sistema raíz, los archivos del sistema Ubuntu, plantillas de aplicaciones y documentación interna.
- Dos desarrolladores replicaron el fallo por separado. Saunders lo describió como ‘extremadamente fácil’ y señaló una resistencia ‘casi nula’ a la inyección de prompts.
- Meta rechaza la etiqueta de brecha de seguridad. La compañía defiende que cada usuario opera en una máquina virtual Linux persistente y aislada del resto.
El fallo de seguridad que Meta se niega a llamar brecha
La respuesta de la compañía se apoya en la arquitectura. Muse corre sobre máquinas virtuales Linux persistentes, una por usuario, según la nota de presentación firmada por Meta. Bajo ese diseño, cada sesión queda encapsulada y el contenido de una no debería alcanzar a las demás. La defensa, sin embargo, choca con una pregunta incómoda: si el asistente entrega su propio entorno al primer requerimiento, ¿de qué sirve el aislamiento?
El resto de la conversación lo conocemos por los propios implicados. James fue el primero en documentar el comportamiento; Saunders confirmó el mismo resultado horas después con ‘casi nula’ resistencia a la inyección. Entre lo expuesto aparecen desde archivos del sistema operativo hasta plantillas internas y documentación que ninguna empresa exhibiría en abierto.
Meta mantiene que no ha habido acceso a datos de terceros ni a infraestructura compartida. Es una postura razonable desde el punto de vista legal y frágil desde el punto de vista reputacional. Negar la brecha no equivale a negar la fuga de datos internos, y la diferencia entre ambas cosas es exactamente la que aprovechará cualquier competidor en su argumentario comercial.
La inyección de prompts se convierte en el talón de Aquiles de la IA agéntica
Los asistentes con capacidad de ejecutar tareas (leer archivos, lanzar comandos, mover datos) han pasado de ser una promesa a ser un producto. Ese salto multiplica la superficie de ataque. Un modelo que solo conversa comete errores; un modelo que toca el sistema de archivos comete daños. Y la inyección de prompts, un fenómeno documentado desde los primeros despliegues de asistentes conectados, sigue sin una defensa robusta.
La paradoja competitiva es evidente. Meta, OpenAI, Google y Anthropic compiten por ofrecer el agente más capaz, no el más prudente. En esa carrera, cada nueva capacidad de ejecución es una función de venta y un riesgo que nadie quiere publicitar. Los equipos de seguridad internos lo saben; los ciclos de lanzamiento, en cambio, no se detienen a esperarlos.
Un asistente que entrega su propio sistema de archivos no ha sufrido un despiste: ha demostrado que la confianza depositada en él no estaba justificada.
Para las empresas que evalúan desplegar agentes de IA sobre datos sensibles, el episodio funciona como una advertencia de manual. La pregunta ya no es si el modelo acierta en sus respuestas, sino qué alcance tiene cuando se le pide algo fuera de guion. Ahí, la mayoría de los proveedores siguen respondiendo con arquitectura aislada y promesas de actualización.
El pulso entre velocidad de producto y confianza que decide el negocio
La IA agéntica ha dejado de ser un experimento de laboratorio para convertirse en una línea de ingresos. Meta integra Muse en su ecosistema como palanca de retención; OpenAI y Anthropic lo venden a empresas como herramienta de productividad. Cada incidente de este tipo erosiona la confianza que sostiene esas suscripciones, y la confianza, a diferencia de una función, no se recupera con una nota de prensa.
En España, Indra ha convertido la ciberseguridad en uno de sus pilares de crecimiento dentro del IBEX 35, con la protección de entornos de IA y datos como línea prioritaria. Telefónica Tech juega en la misma liga desde la integración. Ambas compañías llevan meses subrayando que la adopción empresarial de agentes exige controles que el mercado de producto todavía no ha estandarizado. El incidente de Muse no crea ese mercado: lo acelera.
Queda por ver cómo evoluciona la respuesta regulatoria. El calendario de aplicación del reglamento europeo de IA avanza por fases y las obligaciones sobre modelos de propósito general ya están sobre la mesa. La agencia europea de ciberseguridad lleva tiempo advirtiendo de que los agentes autónomos son un vector de riesgo distinto al de los modelos conversacionales. Un caso como este es munición para quienes piden reglas más duras antes de que la IA agéntica llegue a la administración pública.
Meta tiene ahora dos frentes abiertos: corregir la resistencia a la inyección de prompts sin recortar capacidades, y convencer a un mercado empresarial que ya ha aprendido a leer la letra pequeña. La próxima cita relevante serán las cuentas del tercer trimestre, que la compañía presentará previsiblemente a finales de octubre, y cualquier mención a la seguridad de Muse en esa llamada dirá más que el comunicado oficial. Sin una corrección verificable por terceros, el prompt seguirá siendo la puerta más barata de abrir.




