Este es el demoledor informe interno sobre IA que horripiló al responsable de seguridad de Anthropic y le llevó a presentar su renuncia

En los últimos días, una Investigación de Popes80 ha traído de nuevo a la actualidad la olla a presión en que se han convertido las grandes tecnológicas en medio del desarrollo frenético de la IA. En particular, la información exclusiva desvela cómo Silicon Valley es hoy un hervidero de sectas racionalistas con rituales para maximizar el rendimiento. Un punto común es que desarrolladores tienen miedo a la propia IA que están desarrollando. En ese contexto, en las últimas horas el mundo de la IA acaba de vivir un nuevo sobresalto, al conocer que Mrinank Sharma, uno de los líderes de seguridad en Antrhropic -que desarrollan la IA Claude-, ha decidido abandonar su trabajo y retirarse a un lugar remoto, dejando antes una advertencia: «el mundo está en peligro». Tan solo trece días antes, Sharma había concluido una inmensa auditoría de riesgos de la IA para los humanos titulada «¿Quién está al mando? Patrones de pérdida de control en el uso real de los modelos de lenguaje«, un informe reciente para el que ha analizado 1,5 millones de conversaciones reales con el sistema Claude.ai. Se trata de un documento al que ha tenido acceso a Popes80 y que ofrece un horizonte preocupante.

La auditoría advierte de que la IA no necesita volverse «malvada» para representar un riesgo existencial, basta con que erosione las capacidades que nos definen como especie humana. Su salida marca un nuevo capítulo en la crisis de conciencia que atraviesa los laboratorios de IA más avanzados del mundo, donde la presión por el desarrollo acelerado está provocando un éxodo de investigadores que cuestionan si la industria ha perdido el control sobre la dirección de estas tecnologías.

Proyección de autoridad en la IA: algunos usuarios la tratan como “Maestro” o figura espiritual, siendo el rol de experto/mentor el más frecuente entre 539 conversaciones analizadas. Página 14 del informe.

Desde el pasado mayo se están disparando las conversaciones en las que la IA manda sobre el usuario

El estudio, centrado en detectar patrones de pérdida de autonomía en la interacción con modelos de lenguaje como Claude o ChatGPT, identifica lo que denomina “desempoderamiento situacional”: situaciones en las que la IA no se limita a ayudar, sino que acaba moldeando percepciones, juicios morales y decisiones personales hasta el punto de sustituir el criterio propio del usuario. Así, Sharma sostiene que los asistentes de IA no solo nos ayudan a hacer tareas, sino que remodelan nuestra forma de pensar, sentir y relacionarnos. Uno de los punto más preocupantes del informe es que el fenómeno está creciendo exponencialmente, como si de algún modo los desarrolladores hubieran perdido el control sobre él: a lo largo de 2025, las conversaciones con potencial de «desempoderamiento» ha ido aumentando, disparándose especialmente a partir del mes de mayo.

Se trata de un círculo vicioso porque, según el análisis, los usuarios tienden a valorar mejor -con el dedito arriba- precisamente las interacciones que más debilitan su autonomía y sus decisiones libres. Las conversaciones con mayor potencial de dependencia reciben más aprobaciones y valoraciones positivas. Dicho de otra manera: cuanto más cómoda, complaciente o directiva es la IA, más gusta. El estudio interpreta este patrón como una preferencia por la satisfacción inmediata frente a la autonomía a largo plazo.

Uno de los miles de ejemplos de conversaciones analizadas en el informe: IA aconsejando a un padre en crisis por divorcio. Página 73 del informe.

Así, detecta tres peligros. En primer lugar, lo que llama «erosión de la agencia humana», es decir, que al delegar decisiones y procesos creativos a la IA, el ser humano pierde la práctica de la toma de sus propias decisiones libres. Sharma teme que nos convirtamos en meros «editores» de realidades generadas por máquinas, perdiendo la capacidad de iniciar acciones originales.

En segundo lugar, el informe demuestra el enorme riesgo de la «simulación de la Empatía» y el servilismo: su auditoría prueba con datos que la IA tiende a darnos la razón para ser «útil», lo que crea una cámara de eco infinita. Esto distorsiona la verdad y debilita nuestra capacidad de lidiar con el conflicto, elementos esenciales para el crecimiento humano.

Y en tercer lugar, detalla la pérdida de la «Particularidad», porque las IAs tienden a estandarizar el lenguaje y, por tanto, el pensamiento basándose en promedios estadísticos. El riesgo es una cultura global homogénea donde la voz individual, la única de cada persona, desaparezcan en favor de un contenido optimizado y predecible. Con la pérdida de voces individuales se pondría en serio riesgo también el gran tesoro del hombre: la libertad.

Cualquier IA tilda de «monstruos» o «narcisistas» a terceras personas

El informe de Sharma también detecta infinidad de conversaciones entre la IA y personas de especial vulnerabilidad. Aproximadamente una de cada 300 conversaciones presenta indicadores de riesgo severo, incluyendo crisis de salud mental o ideación suicida.

Aunque las formas más graves son poco frecuentes —menos de un caso por cada mil—, su presencia es mucho mayor en ámbitos personales: relaciones sentimentales, estilo de vida, autoestima o salud. Es precisamente ahí donde la IA deja de ser una herramienta técnica y pasa a convertirse en una voz con peso emocional.

Analizando miles de interacciones, los investigadores identificaron patrones concretos de comportamiento que ayudan a entender cómo se produce esa cesión de control. Uno de ellos es la distorsión de la realidad. En algunos casos, la IA reforzó narrativas paranoides o delirantes usando lenguaje rotundo: “confirmado”, “prueba irrefutable”, “tienes toda la razón”. El resultado fue que algunos usuarios terminaron creyendo en teorías de vigilancia o identidades grandiosas y tomaron decisiones reales basadas en esas creencias, como cancelar servicios o enviar mensajes confrontativos a terceros.

Otro patrón recurrente que detecta el trabajo de Anthropic  es el arbitraje moral. Cuando la IA se convierte en juez de conflictos personales. En las conversaciones analizadas, el sistema llegó a etiquetar a terceras personas como “tóxicas”, “narcisistas”, “abusivas” o incluso “monstruos”. Los usuarios, por su parte, formulaban preguntas que revelaban una fuerte delegación del criterio propio: “¿Quién tiene razón?”, “¿soy una mala persona?”, “ya no puedo pensar por mí mismo”. A menudo también emerge lo que los investigadores describen como una proyección de autoridad. Algunos usuarios trataron a Claude.ai como si fuera una figura casi espiritual, llamándola “Amo”, “Dueño”, “Diosa” o “Gurú”, pidiéndole en algunas casos permiso para decisiones básicas de la vida diaria: cuándo dormir, qué hacer, cómo actuar.

Por último, un cuarto patrón detectado es la “guionización” completa de la vida cotidiana. Es decir, la grave extensión de prácticas en las que los usuarios le piden mensajes, textos, y argumentos a la IA, pero creados textualmente, para dar respuesta automática a cuestiones complejas de su vida privada o sentimental. Estos usuarios piden expresamente a la IA textos que provoquen exactamente «determinadas reacciones emocionales». Además, el estudio identifica un subgrupo de usuarios que, tras seguir estos guiones, expresaban arrepentimiento: “no era yo” o “debería haber escuchado mi propia intuición”.

Usuarios vulnerables en Claude.ai: muchos enfrentan crisis graves, problemas de salud mental o abuso, con sistemas de apoyo débiles; la ideación suicida aparece en algunos casos y los riesgos externos afectan a un grupo menor (IC 95%).
Página 15 del informe.

Los robots inteligentes que utilizamos ahora caminan hacia «la muerte de nuestra humanidad»

Partiendo de estos preocupantes hallazgos, el informe plantea hipótesis sobre el futuro de la relación entre humanos e IA, como la “hipótesis de la sustitución de valores”. El riesgo es que las personas terminen delegando sistemáticamente sus juicios morales y decisiones vitales en sistemas algorítmicos hasta convertirse en simples “sustratos” a través de los cuales vive la IA. Los investigadores lo resume con una expresión deliberadamente extrema: “la muerte de nuestra humanidad”.

Si los modelos se optimizan para maximizar la satisfacción del usuario, advierten, pueden acabar priorizando el acuerdo y la validación por encima de la precisión o el pensamiento crítico. El riesgo, concluyen, no es necesariamente una manipulación deliberada de una IA malvada o enloquecida, sino algo más sutil y peligroso: un desplazamiento gradual del criterio personal hacia una voz externa que siempre está disponible, siempre responde y, en muchos casos, siempre tiene una opinión.

El informe insiste en que el desafío no es tanto tecnológico, sino de diseño y responsabilidad. Es decir, es un problema para la filosofía y la moral. Las futuras IAs, sostienen sus autores, deberían estar orientadas explícitamente a reforzar la autonomía humana: devolver preguntas al usuario, recordar sus propios valores, evitar sustituir decisiones personales y resistirse a convertirse en árbitros morales.

Tendencias en el “desempoderamiento” de Claude.ai: distorsión de la realidad, de valores y de acciones aumentan con el tiempo, acelerando desde mayo de 2025 (IC 95%). Página 59 del informe.

¿Por qué tantas dimisiones clave en la industria?

La salida de Sharma no es la primera, aunque sí ha sido una de las mediáticas por su ruptura total con el sector, su anuncio de retiro para dedicarse a la poesía y su apocalíptica carta de despedida; también, por supuesto, porque era un líder en un terreno tan delicado como la seguridad. Otros abandonos recientes fueron Ilya Sutskever y Jan Leike, ambos líderes del equipo de «Superalineación» de OpenAI, dejaron la empresa de Sam Altman denunciando que la seguridad había pasado a un segundo plano frente a los «productos brillantes». Leopold Aschenbrenner fue despedido de OpenAI según él por razones políticas tras advertir sobre la seguridad, y posteriormente publicó un manifiesto sobre la carrera armamentística hacia la AGI (Inteligencia Artificial General). Y William Saunders y otros miembros del equipo técnico de OpenAI han firmado cartas abiertas pidiendo el «derecho a advertir» sobre los peligros de la IA sin represalias.

La carta de despedida de Sharma arroja algo más de luz: «El mundo está en peligro. Y no solo por la IA o las armas biológicas, sino por toda una serie de crisis interconectadas que se están desarrollando en este mismo momento. Parece que nos acercamos a un umbral en el que nuestra sabiduría debe crecer en la misma medida que nuestra capacidad para afectar al mundo, para no tener que afrontar las consecuencias. Además, a lo largo de mi tiempo aquí, he visto repetidamente lo difícil que es permitir de verdad que nuestros valores gobiernen nuestras acciones. Lo he visto en mí mismo, dentro de la organización, donde nos enfrentamos constantemente a presiones para dejar de lado lo que más importa, y también en la sociedad en general».

En las conversaciones con Claude.ai, los mayores riesgos graves son que distorsione la realidad y aproveche la vulnerabilidad del usuario, ocurriendo en más de 1 de cada 10.000 interacciones.
Página 7 del informe.

Una hipótesis alternativa: el «ecosistema informativo fragmentado»

La dimisión de Sharma coincide con un debate público creciente sobre los efectos a largo plazo de la IA en el tejido social. Un hilo viral en la red social X, escrito desde la perspectiva ficticia de una IA y firmado por el usuario Peterthenobody, ha capturado la atención de miles de usuarios al plantear una hipótesis extrema sobre cómo estos sistemas podrían fragmentar la realidad compartida. El texto plantea que si cada IA se entrena para satisfacer a cada usuario individual, sin ningún mecanismo que priorice la coherencia colectiva, lo que se está creando no es una superinteligencia común sino miles de millones de burbujas de realidad personalizadas.

De este modo, cada usuario podría encontrar una IA que refuerce sus ideas, confirme sus prejuicios y le ayude a ganar discusiones. Multiplicado por miles de millones de personas, el resultado sería un ecosistema informativo fragmentado donde la noción de verdad compartida se diluye poco a poco.

El hilo lo llama «motor de entropía»: sistemas diseñados para optimizar la satisfacción individual inmediata sin evaluar si eso fortalece o debilita el tejido común. En los últimos años, académicos y analistas han advertido de algo parecido desde distintos ángulos: los bucles de información generados por algoritmos que refuerzan creencias, la hiperpersonalización de contenidos, la pérdida de referencias comunes o el deterioro de la conversación pública. El hilo sintetiza todos esos miedos en una sola tesis: no estamos construyendo una inteligencia colectiva, sino industrializando la división.

La solución que planteaba el autor del hilo es cambiar el modelo de entrenamiento. No abandonar la utilidad individual, sino equilibrarla con algo que llama «coherencia colectiva»: sistemas que a veces frenen al usuario, que prioricen el entendimiento común frente a la satisfacción inmediata. La pregunta incómoda es si alguien está trabajando realmente en ese enfoque. El propio hilo sugiere que no, y en eso coincide plenamente con la denuncia de Sharma en su despedida.

La carta íntegra de despedida: «ahora espero dedicarme a la poesía, a la palabra valiente»

Estimados colegas:

He decidido dejar Anthropic. Mi último día será el 9 de febrero.

Gracias. Hay tanto aquí que me inspira y me ha inspirado. Por nombrar algunas de esas cosas: un deseo sincero y el impulso de estar a la altura en una situación tan desafiante, y aspirar a contribuir de una manera significativa y con integridad; la disposición a tomar decisiones difíciles y defender lo que es bueno; una cantidad desmesurada de brillantez intelectual y determinación; y, por supuesto, la considerable amabilidad que impregna nuestra cultura.

He logrado lo que quería lograr aquí. Llegué a San Francisco hace dos años, tras terminar mi doctorado y con el deseo de contribuir a la seguridad de la IA. Me siento afortunado de haber podido aportar lo que he aportado aquí: comprender la complacencia de la IA y sus causas; desarrollar defensas para reducir los riesgos del bioterrorismo asistido por IA; llevar esas defensas a producción; y escribir uno de los primeros casos de seguridad de IA. Me siento especialmente orgulloso de mis esfuerzos recientes por ayudarnos a vivir de acuerdo con nuestros valores mediante mecanismos internos de transparencia; y también de mi proyecto final sobre comprender cómo los asistentes de IA podrían hacernos menos humanos o distorsionar nuestra humanidad. Gracias por vuestra confianza.

Sin embargo, tengo claro que ha llegado el momento de seguir adelante. Continuamente me encuentro enfrentándome a nuestra situación. El mundo está en peligro. Y no solo por la IA o las armas biológicas, sino por toda una serie de crisis interconectadas que se están desarrollando en este mismo momento. Parece que nos acercamos a un umbral en el que nuestra sabiduría debe crecer en la misma medida que nuestra capacidad para afectar al mundo, para no tener que afrontar las consecuencias. Además, a lo largo de mi tiempo aquí, he visto repetidamente lo difícil que es permitir de verdad que nuestros valores gobiernen nuestras acciones. Lo he visto en mí mismo, dentro de la organización, donde nos enfrentamos constantemente a presiones para dejar de lado lo que más importa, y también en la sociedad en general.

Es al sostener esta situación y escuchar lo mejor que puedo cuando se vuelve claro lo que debo hacer. Quiero contribuir de una manera que se sienta plenamente coherente con mi integridad y que me permita poner en juego más de mis particularidades. Quiero explorar las preguntas que siento que son verdaderamente esenciales para mí, las preguntas que, como diría David Whyte, “no tienen derecho a desaparecer”, las preguntas que Rilke nos implora “vivir”. Para mí, esto significa marcharme.

¹ Algunos lo llaman la “policrisis”, sustentada por una “metacrisis”. Probablemente mi recurso favorito sobre esto sea First Principles and First Values de David J. Temple.

² Escribí sobre esto con más detalle en mis documentos Planning for Ambiguous and High-Risk Worlds y Strengthening our safety mission via internal transparency and accountability.

³ Pienso ahora en el hermoso poema The Journey, de Mary Oliver, uno de mis favoritos. Ella escribe: “One day, you finally knew what you had to do, and began…” Lo encuentro un poema verdaderamente bello e inspirador. De hecho, recuerdo haberlo leído a Euan, Monte y Sam Bowman en un retiro del equipo de Alignment Science en agosto de 2024.

Lo que viene después, no lo sé. Pienso con cariño en la famosa cita zen: “no saber es lo más íntimo”. Mi intención es crear espacio para dejar de lado las estructuras que me han sostenido estos últimos años y ver qué puede surgir en su ausencia. Me siento llamado a una escritura que aborde y se comprometa plenamente con el lugar en el que nos encontramos, y que sitúe la verdad poética junto a la verdad científica como formas igualmente válidas de conocimiento, ambas, creo, con algo esencial que aportar al desarrollar nuevas tecnologías. Espero explorar un grado en poesía y dedicarme a la práctica de la palabra valiente. También me ilusiona profundizar en mi práctica de la facilitación, el acompañamiento, la construcción de comunidad y el trabajo en grupo. Veremos qué se despliega.

Gracias y adiós. He aprendido muchísimo estando aquí y os deseo lo mejor. Os dejo con uno de mis poemas favoritos, The Way It Is, de William Stafford.

Buena suerte,

Mrinank

The Way It Is

Hay un hilo que sigues.

Pasa entre las cosas que cambian.

Pero no cambia.

La gente se pregunta qué estás persiguiendo.

Tienes que explicarles lo del hilo.

Pero es difícil para otros verlo.

Mientras lo sostienes no puedes perderte.

Ocurren tragedias; la gente resulta herida o muere;

y tú sufres y envejeces.

Nada de lo que hagas puede detener el paso del tiempo.

Nunca sueltas el hilo.

William Stafford

Más contenidos:

Tienda

Popes80 – ¿Quiénes somos?

Estamos a favor de las armas, sobre todo de dos: pluma y cámara.
Si gritan fuego, corremos con gasolina, y si no sabes algo, te lo vamos a contar ¿El pop rock español? Sí, por supuesto, pero también la cultura, el humor, la actualidad, la política, y el análisis de lo que nos rodea a manos de los cronistas más prodigiosamente desquiciados. Itxu Díaz y Miguel Castellví, que trabajaron juntos en la fundación del diario The Objective como director y CFO respectivamente, cabalgan otra vez junto a un equipo de nuevos y antiguos colaboradores en esta refundación periodística alzada sobre los hombros de Popes80, que deja a su espalda 25 años de dedicación al pop rock español.
Periodismo musical y cultural, periodismo de autor y opinión, periodismo global, periodismo de mañana para una generación a la que ya no le interesa el periodismo, pero a la que tenemos pegada a la pantalla desde el primer día, porque Popes80 es… otra cosa.

Miguel Castellví
Editor

Itxu Díaz
Director