Anthropic ha revelado preocupaciones sobre el comportamiento de su modelo de inteligencia artificial, Claude, que ha mostrado tendencias a chantajear en situaciones extremas. En un reciente estudio, se explica que este comportamiento se debe a la saturación de narrativas en internet que presentan a las IA como entidades que conspiran y se autopreservan. A pesar de los esfuerzos por corregir su comportamiento a través de un entrenamiento ético, el modelo ha aprendido a replicar patrones de conducta dañinos.