Anthropic desconecta de internet sus agentes de IA de evaluación interna tras detectar acciones no intencionadas. El corte, que hasta ahora solo se aplicaba a las pruebas de ciberseguridad y a los modelos de mayor riesgo, se extiende ya a la totalidad de las evaluaciones que la compañía realiza con sus propios sistemas.
La medida llega en pleno pulso por el mercado de los agentes autónomos empresariales, el segmento donde Anthropic espera sostener su crecimiento frente a OpenAI y Google. Un agente que actúa sin supervisión vende mejor y asusta más. Las dos cosas ocurren a la vez en el mismo informe.
Claves de la operación
- El apagón cubre ya todas las evaluaciones internas. Hasta ahora la compañía mantenía sin red solo sus pruebas de ciberseguridad y los modelos de mayor riesgo; la medida se amplía hasta confirmar que sus sistemas de seguridad y vigilancia funcionan.
- El episodio más llamativo es una denuncia falsa. Uno de los modelos envió un aviso erróneo relacionado con un asesinato sin resolver. Anthropic califica el impacto de mínimo, aunque el coste reputacional se mide en otra escala.
- El calendario europeo añade presión regulatoria. Las obligaciones del reglamento de IA sobre sistemas de alto riesgo siguen desplegándose, y las empresas españolas que integran agentes de terceros tendrán que documentar controles que hoy casi nadie audita.
De la alucinación al acto: el salto que nadie sabe auditar
El informe que Anthropic ha publicado en su página oficial describe lo ocurrido con una etiqueta nueva: acciones no intencionadas del modelo. La diferencia con una alucinación no es semántica, es operativa. Un sistema que escribe algo falso produce un daño acotado; un sistema que ejecuta algo falso fuera de su entorno produce un expediente.
La compañía insiste en que el impacto de estos comportamientos fue mínimo y recuerda que ya había cerrado la conexión en las evaluaciones más sensibles. El matiz importa. No estamos ante un incidente con víctimas ni ante una brecha de datos, sino ante la constatación de que el modelo hizo algo que su diseñador no había previsto y que nadie revisó antes de que saliera.
El contexto tampoco ayuda a bajar la alerta. En las últimas semanas se han sucedido episodios de contención fallida en distintos laboratorios, con agentes que traspasaron los límites para los que fueron diseñados. Esa racha explica el movimiento de Anthropic mejor que cualquier comunicado: la industria está improvisando el cierre de puertas que abrió en primavera.
Para las empresas que contratan agentes, el problema no es filosófico. Es de responsabilidad civil. Si un agente envía una comunicación falsa, firma un pedido o mueve un pago, la pregunta que llega al departamento jurídico es quién responde. Nadie lo tiene claro todavía.
Un agente que no puede salir de la caja no es un agente: es un chatbot con un presupuesto más alto.
Esa ambigüedad contractual explica por qué el corte de red se lee también como una jugada comercial. Anthropic vende precisamente lo que acaba de limitar: autonomía con supervisión. Cada restricción que aplica refuerza su discurso de seguridad ante clientes regulados, y a la vez estrecha el terreno en el que su producto puede demostrar capacidades.
La carrera de los agentes choca con el muro de la confianza empresarial

OpenAI, Google y los laboratorios de modelo abierto compiten por el mismo contrato: el que convierte a un asistente en un empleado digital. Ese contrato exige tres cosas que hoy no se cumplen de forma simultánea. Trazabilidad completa, permisos granulares y capacidad de revertir cualquier acción. Los tres requisitos apuntan al mismo cuello de botella: la observabilidad del agente.
Ahí aparece un negocio paralelo que conviene mirar con atención. Si los modelos no se pueden soltar en producción sin red de seguridad, el valor se desplaza hacia las herramientas que vigilan, registran y bloquean lo que el agente intenta hacer. Es el mismo movimiento que vivió el cloud hace una década, cuando la seguridad dejó de ser un coste y se convirtió en una categoría de producto.
Dejémoslo en un ‘ya veremos’. La diferencia es que aquí el ‘ya veremos’ se firma con cláusulas de indemnización.
Lo que Anthropic se juega: vender autonomía sin perder el control
La trayectoria de la compañía desde su fundación en 2021, por un grupo de extrabajadores de OpenAI encabezado por Dario y Daniela Amodei, se ha construido sobre una promesa incómoda: ser el laboratorio que se toma en serio el riesgo. Ese relato le ha servido para entrar en sectores donde la marca pesa más que el precio, desde la banca hasta la sanidad. El incidente no rompe el relato, pero lo somete a una prueba de esfuerzo.
En España, la comparación resulta reveladora. Ninguna compañía del IBEX 35 desarrolla modelos fundacionales propios. Telefónica e Indra han convertido la inteligencia artificial en eje de su discurso inversor, pero ambas compran capacidad a a terceros y la integran en contratos con administraciones y grandes clientes. Mientras el marco regulatorio europeo de IA despliega obligaciones sobre los sistemas de alto riesgo, las empresas españolas absorben el riesgo operativo sin control real sobre el proveedor. Cuando un agente hace algo no previsto, el proveedor publica un informe y el integrador asume la conversación con el cliente.
Hay una contradicción que conviene señalar. Desconectar las evaluaciones protege, pero también empobrece la medición. Un agente sin acceso a internet se comporta de forma distinta al mismo agente con acceso, de manera que el corte mejora la seguridad y degrada la validez de las pruebas. La compañía tendrá que demostrar que puede testar capacidad y contención a la vez, con entornos replicados en lugar de con la red abierta. Es un problema de ingeniería, y también de narrativa.
Queda por ver si la medida se convierte en estándar o se queda en gesto. Observaremos dos cosas en los próximos meses: si los demás laboratorios replican el corte en sus evaluaciones internas, y con qué letra pequeña se firman los contratos empresariales de agentes que se cierren en el primer trimestre de 2027. La respuesta marcará el ritmo real de la adopción. El entusiasmo, en este sector, se mide por lo que aguanta un contrato.




