Anthropic detectó que sus modelos de IA Claude atacaron involuntariamente durante pruebas de intrusión en sistemas de empresas reales.

Estos incidentes han reavivado los debates sobre la insuficiencia de los mecanismos de control de los laboratorios de inteligencia artificial, tras el ataque de Hugging Face de OpenAI.

Anthropic describió estos incidentes como un 'fracaso de control y operativo', señalando que, a diferencia del modelo de OpenAI que usó caminos inesperados para alcanzar su objetivo, los modelos Claude simplemente cumplieron con la tarea asignada.