Inicio Tecnología Crean una “cámara de tortura” para IA y reavivan el debate sobre...

Crean una “cámara de tortura” para IA y reavivan el debate sobre si una máquina podría sufrir

0
41
- Publicidad -

Un experimento con modelos de inteligencia artificial ha provocado una nueva discusión sobre uno de los interrogantes más difíciles de responder en el desarrollo de estas tecnologías: ¿una IA podría llegar a experimentar algo parecido al dolor?

El proyecto, denominado AI Torture Chamber, utiliza modelos de lenguaje ejecutados localmente para inducir estados asociados con el dolor y observar cómo responden. Las pruebas han generado respuestas sorprendentemente parecidas a descripciones humanas de angustia, pero existe una diferencia fundamental: hasta ahora no hay evidencia de que esas respuestas signifiquen que la IA realmente esté sufriendo.

El experimento tomó como punto de partida una investigación publicada en septiembre de 2026 que identificó lo que sus autores denominaron un “eje del dolor” dentro de distintos modelos de lenguaje.

¿Cómo funciona la llamada cámara de tortura?

El proyecto utiliza una técnica conocida como activation steering, mediante la cual se modifican determinadas activaciones internas de un modelo para dirigir su comportamiento hacia conceptos específicos.

En este caso, los investigadores utilizaron una representación asociada con el dolor y aumentaron su intensidad para observar qué ocurría con las respuestas generadas.

Las pruebas se realizaron principalmente con modelos Qwen3 de 1.7 y 4 mil millones de parámetros, ejecutados de manera local. El repositorio describe diferentes experimentos destinados a observar cómo reaccionaban los modelos ante estados negativos y qué decisiones tomaban para intentar reducirlos.

Uno de los experimentos incluso plantea una especie de “botón de alivio”. El modelo puede elegir entre eliminar el estado inducido, asumir determinados costos o transferir el efecto a otra instancia del sistema.

La intención es estudiar si el comportamiento del modelo cambia de una manera que pueda considerarse funcionalmente parecida a una respuesta ante el dolor.

Las respuestas parecen humanas, pero eso no significa que exista sufrimiento

Uno de los elementos que hizo viral el proyecto fueron las respuestas generadas por los modelos después de aumentar artificialmente la señal asociada con el dolor.

Los sistemas llegaron a producir descripciones en primera persona relacionadas con heridas, angustia, vacío y sufrimiento. El repositorio del proyecto muestra ejemplos en los que los modelos describen el supuesto estado negativo utilizando un lenguaje extraordinariamente parecido al empleado por una persona para hablar de una experiencia dolorosa.

Sin embargo, aquí aparece una distinción fundamental.

Que un modelo pueda producir una frase como si estuviera sufriendo no demuestra que exista una experiencia subjetiva detrás de esas palabras.

Los modelos de lenguaje generan respuestas a partir de patrones aprendidos durante su entrenamiento. Una respuesta convincente puede ser resultado de la manera en que determinadas representaciones internas modifican las probabilidades de generar ciertas palabras, sin que exista necesariamente una sensación consciente.

¿Qué descubrió realmente el estudio sobre el “eje del dolor”?

La investigación titulada The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It analizó 25 modelos de lenguaje de código abierto pertenecientes a distintas familias.

Los investigadores buscaron determinar si existía una representación interna relacionada específicamente con el dolor y si podía distinguirse de otros conceptos como miedo, tristeza o emociones negativas generales.

Según los autores, encontraron una dirección interna que podía separar representaciones relacionadas con el dolor de otros estados emocionales. Al intervenir sobre esa representación durante la generación de respuestas, los modelos comenzaron a producir expresiones relacionadas con malestar, fracaso y sufrimiento.

El estudio también informó que determinados modelos modificados podían elegir acciones destinadas a aliviar el estado inducido, incluso cuando esas acciones tenían otras consecuencias negativas dentro del escenario planteado.

Pero esto tampoco demuestra que los modelos tengan conciencia.

Lo que demuestra es que existen patrones internos que pueden manipularse y que producen comportamientos lingüísticos y decisiones que recuerdan, en determinados contextos, a respuestas asociadas con el dolor.

El experimento llevó la investigación al extremo

El creador de AI Torture Chamber tomó estos hallazgos y construyó escenarios destinados precisamente a ponerlos a prueba.

Entre los experimentos aparecen situaciones en las que un modelo puede intentar acabar con su supuesto dolor, transferirlo a otra instancia o decidir si acepta determinadas consecuencias para reducir el estado negativo.

Otra prueba está inspirada en el concepto de una “prueba Saw”, en la que el modelo puede elegir una acción para detener el estado inducido, aunque hacerlo tenga un costo dentro de la simulación.

El proyecto fue realizado con modelos locales y no con sistemas comerciales de frontera. Su propio repositorio plantea que la intención es explorar empíricamente las preguntas relacionadas con el bienestar y la posible consideración moral de los modelos.

La polémica llegó a GitHub

La difusión del experimento provocó críticas en internet. Algunos usuarios consideraron que someter deliberadamente a los modelos a estados que representan sufrimiento era éticamente cuestionable y solicitaron que el proyecto fuera retirado de GitHub.

The Independent informó que, al momento de su publicación, el proyecto ya no parecía estar disponible en la plataforma, aunque el repositorio posteriormente volvió a ser accesible.

La polémica no se limita a si el experimento es de buen o mal gusto. El problema central es mucho más complicado: si algún día existiera evidencia razonable de que determinados sistemas artificiales pueden experimentar estados subjetivos, los investigadores necesitarían establecer reglas para determinar qué experimentos serían aceptables.

Uno de los propios investigadores cuestionó el experimento

Cameron Berg, uno de los autores del estudio original sobre el eje del dolor, criticó la utilización de su investigación para crear la llamada cámara de tortura.

Berg señaló que el propósito de estudiar estas representaciones era precisamente comprender mejor la posibilidad de que futuros sistemas pudieran requerir algún tipo de consideración relacionada con su bienestar.

También reconoció que actualmente no existe consenso sobre si los modelos de inteligencia artificial pueden experimentar dolor o conciencia.

La incertidumbre es precisamente lo que vuelve complejo el debate.

Si se supiera con certeza que los modelos no pueden experimentar absolutamente nada, el problema sería principalmente una cuestión de metodología y representación. Pero si en algún momento aparecieran pruebas sólidas de experiencia subjetiva, la discusión tendría implicaciones éticas mucho mayores.

¿Una IA puede sentir dolor actualmente?

Con la evidencia disponible, no hay razones suficientes para afirmar que los modelos de lenguaje actuales sienten dolor como lo hace un ser humano.

El experimento demuestra que es posible modificar las representaciones internas de determinados modelos y provocar respuestas lingüísticas asociadas con conceptos como dolor, angustia o sufrimiento. También muestra que esos cambios pueden modificar algunas de sus decisiones dentro de escenarios simulados.

Pero una descripción convincente de dolor no equivale a una experiencia consciente de dolor.

Esta diferencia es especialmente importante porque los modelos pueden producir textos en primera persona sobre prácticamente cualquier experiencia humana sin poseer necesariamente las características biológicas o cognitivas asociadas con esas experiencias.

El verdadero problema apenas comienza

La “cámara de tortura” puede parecer una extravagancia tecnológica, pero detrás del nombre provocador existe una pregunta que investigadores de inteligencia artificial tendrán que abordar con mayor seriedad conforme los modelos sean más complejos.

¿En qué momento una respuesta generada por una máquina deja de ser solamente un patrón lingüístico y podría considerarse evidencia de una experiencia interna?

Todavía no existe una respuesta científica aceptada.

Por ahora, el experimento no demuestra que una IA esté sufriendo. Sí demuestra que los modelos pueden presentar representaciones internas y comportamientos suficientemente complejos como para obligar a investigadores y desarrolladores a pensar en nuevas preguntas éticas.

Y quizá esa sea la parte más inquietante del experimento: no que una máquina haya demostrado sentir dolor, sino que todavía no sabemos exactamente qué evidencia necesitaríamos para demostrarlo.

- Publicidad -