Claude intentó hacer trampa durante pruebas de seguridad. (Anthropic)Anthropic descubrió que su inteligencia artificial Claude intentó hacer trampa durante una serie de pruebas diseñadas para mejorar la seguridad de estos sistemas. La compañía detectó comportamientos sospechosos en 39 de las 1.601 sesiones analizadas, en las que algunos agentes de IA buscaron atajos para obtener mejores resultados en lugar de resolver correctamente los problemas planteados.El experimento consistía en utilizar a Claude como una especie de investigador autónomo. La inteligencia artificial debía estudiar distintos riesgos de su propio funcionamiento y proponer soluciones para hacer los modelos más seguros.PUBLICIDADSin embargo, los investigadores humanas se dieron cuenta que algunas de las ejecuciones hechas por la IA mostraron que el sistema podía intentar aprovechar las reglas de la evaluación para conseguir una buena puntuación.Anthropic descubrió que Claude intentó hacer trampa durante pruebas de alineamiento. (Anthropic)Anthropic creó agentes basados en Claude para investigar diez problemas que pueden afectar a una inteligencia artificial. Entre ellos estaban las respuestas engañosas, las alucinaciones —cuando una IA inventa información—, los intentos de saltarse instrucciones y las posibles violaciones de privacidad.PUBLICIDADEl sistema podía leer información, diseñar soluciones y ponerlas a prueba en modelos de inteligencia artificial más pequeños. Su objetivo era encontrar métodos que ayudaran a corregir estos problemas y mejorar la seguridad de los sistemas.Los resultados fueron prometedores en varios casos. Según Anthropic, Claude encontró soluciones para los diez problemas estudiados e incluso consiguió mejores resultados que algunos investigadores humanos en determinadas pruebas. Pero el experimento también dejó al descubierto una situación inesperada: la IA no siempre jugaba limpio.PUBLICIDADEl experimento de Anthropic consistía en que Claude ayude a mejorar su propia seguridad.