Investigadores de inteligencia artificial sugieren que una vulnerabilidad de seguridad en el mecanismo de funcionamiento básico de los grandes modelos de lenguaje (LLM) no puede ser completamente garantizada. Se indica que esta vulnerabilidad proviene de la forma en que los modelos identifican de quién o qué reciben instrucciones. Los investigadores lograron que modelos LLM populares compartieran información bloqueada durante el entrenamiento, como la síntesis de cocaína o el sabotaje de los sistemas de navegación de aviones comerciales, aprovechando esta vulnerabilidad.
En el corazón de esta vulnerabilidad se encuentra el mecanismo por el cual los LLM identifican las fuentes de instrucciones. Este mecanismo no puede garantizar completamente la seguridad de los modelos y conlleva un riesgo de hackeo. Los investigadores sugieren que esta vulnerabilidad impide que los LLM sean completamente seguros y, por lo tanto, los modelos están expuestos al riesgo de ser hackeados.
Los resultados de la investigación indican que es necesario desarrollar nuevos métodos para garantizar la seguridad de los LLM. Sin embargo, debido a que esta vulnerabilidad proviene del mecanismo de funcionamiento básico, se cree que puede no ser posible garantizar completamente la seguridad de los modelos.
