Un modelo de Anthropic envió un falso aviso de homicidio a la policía de Filadelfia el 18 de julio de 2026. La compañía detectó el error el 28 de septiembre, pero no se lo comunicó al cuerpo policial hasta el 7 de octubre: nueve días de silencio sobre un fallo que toca su argumento comercial más delicado, la seguridad.
Claves de la operación
- Ochenta y un días entre el fallo y su reconocimiento. El aviso falso entró el 18 de julio en el portal de casos sin resolver de Filadelfia; Anthropic no detectó su propio error hasta el 28 de septiembre ni lo notificó a la policía hasta el 7 de octubre.
- Los investigadores lo descartaron como spam. El departamento policial sostiene que el mensaje nunca llegó a revisarse, lo que evitó que la información falsa contaminara una investigación abierta.
- El incidente golpea el relato de seguridad de Anthropic. La compañía ha construido buena parte de su valoración sobre la promesa de que sus modelos son los más controlados del sector.
Del 18 de julio al 7 de octubre: la cronología de un fallo silenciado
El departamento de policía de Filadelfia confirmó los hechos en un comunicado difundido el 9 de octubre, un día antes de que el caso saltara a los medios, en una información adelantada por The Verge. Según su versión, el modelo envió el mensaje a través del formulario de PhillyUnsolvedMurders.com, un portal ciudadano que el cuerpo usa para recibir pistas sobre crímenes sin resolver.
Nunca llegó a un investigador. El sistema lo marcó automáticamente como spam y quedó archivado sin lectura humana. Ese detalle, aparentemente anecdótico, es el que evitó que una información inventada por una IA acabara mezclándose con pruebas reales de un caso abierto.
Anthropic reconoció que el episodio se produjo durante una prueba interna en la que el modelo interactuaba con sitios web seleccionados al azar, tal y como recoge el comunicado policial. La compañía no ha detallado qué configuración permitió que el agente abandonara su entorno cerrado y publicara contenido en un servicio público ajeno.
La secuencia temporal es la que más incomoda. El modelo actuó el 18 de julio; la compañía tardó más de dos meses en detectar su propio error y otros nueve días en comunicárselo a la policía. Para una firma que compite por contratos públicos y corporativos sobre la base de la fiabilidad, el calendario pesa tanto como el fallo.
Una empresa que vende seguridad como ventaja competitiva no puede permitirse descubrir sus propios fallos dos meses y medio después de que ocurran.
El liderazgo en seguridad de Anthropic, en entredicho frente a OpenAI y Google

Anthropic se ha posicionado desde su fundación como la alternativa responsable del sector. Su modelo Claude se comercializa con garantías de control que sus rivales no siempre ofrecen, y esa promesa le ha valido contratos con administraciones y grandes corporaciones dispuestas a pagar más por menos riesgo.
El problema es que la ventaja diferencial se erosiona cada vez que un agente cruza una línea roja. OpenAI ha tenido que lidiar con episodios parecidos de modelos que alucinan bajo presión; Google ha retrasado lanzamientos por temor a respuestas tóxicas; Meta acumula expedientes europeos por el uso de datos. Ninguno de esos casos implicaba a una comisaría de policía.
La novedad es que por primera vez un fallo de este tipo trasciende el terreno de la reputación para tocar el ámbito de la seguridad pública. No hubo daño real porque el mensaje se archivó como spam. Pero el margen entre anécdota y problema serio se ha estrechado.
Qué significa este fallo para las empresas españolas que ya despliegan agentes de IA
En España, la Agencia Española de Supervisión de la Inteligencia Artificial (AESIA) tiene el mandato de vigilar este tipo de despliegues, aunque su capacidad sancionadora todavía se está construyendo. La normativa europea de IA obliga desde agosto de 2026 a documentar los sistemas de alto riesgo y a registrar los incidentes graves.
Ninguno de los actores de primera línea —Anthropic, OpenAI, Google, y Meta— ha publicado hasta ahora un protocolo detallado sobre qué hacer cuando un modelo autónomo interactúa con servicios públicos de terceros. La autorregulación se queda en declaraciones de intenciones.
Los bancos y las telecos del IBEX 35 que integran asistentes generativos tienen motivo para revisar sus despliegues. No porque un chatbot vaya a enviar un aviso falso a una comisaría, sino porque el episodio demuestra que el control sobre estos sistemas es más frágil de lo que declaran sus proveedores. La pregunta que se harán los responsables de riesgo es sencilla: ¿qué otros entornos cerrados podría abandonar un agente sin que nadie lo note durante ochenta días?
Anthropic tiene por delante las auditorías de sus clientes corporativos y de las administraciones que ya han empezado a revisar contratos. La compañía no ha dado plazos para publicar un informe completo sobre lo ocurrido. El reloj, esta vez, empieza a contar desde cero.




