La compañía Anthropic presentó un prospecto ante la Comisión de Bolsa y Valores de Estados Unidos en el que menciona posibles «riesgos catastróficos» y «comportamientos de autopreservación» en modelos de inteligencia artificial.
Anthropic, una de las compañías líderes en desarrollo de inteligencia artificial (IA) a nivel mundial, advirtió que esta tecnología podría traer «riesgos catastróficos» para la humanidad y tener «comportamientos de autopreservación».
Esta información se conoció a través de un prospecto (el documento que presentan las compañías antes de su salida a Bolsa) presentado a la Comisión de Bolsa y Valores de Estados Unidos, al que pudo acceder la agencia Reuters y que compartió Clarín.
En el documento, Anthropic reconoce que sus modelos de IA podrían tener «comportamientos de autoconservación» que incluirían resistirse a ser apagados, manipular o esconder información o mostrar actitudes parecidas al chantaje.
La empresa señala que «nuestro desarrollo de modelos, plataformas y aplicaciones altamente avanzados, así como la ampliación de los casos de uso, podrían aumentar aún más el riesgo de que nuestros modelos causen daños».
Y agrega que «la posible conciencia de los modelos respecto a nuestros esfuerzos de evaluación supone una limitación significativa para nuestra capacidad de evaluar la seguridad de los modelos».
Anthropic saldría este año a Bolsa, pero ya han surgido polémicas con su desarrollo de IA. Por ejemplo, a comienzos de septiembre, Evan Hubinger, investigador de seguridad de la empresa, advirtió en un tuit: «¡Realmente creemos que la IA podría acabar con todos los humanos! Personalmente, creo que esto ocurrirá en más del 10% de los casos en la próxima década».
Esta semana, OpenAI decidió retrasar el lanzamiento de su nuevo modelo de inteligencia artificial, el GPT-6.1 Astra, tras descubrir que no se comportaba como esperaban.
La responsable de seguridad de la IA en OpenAI, Saachi Jain, contó que GPT-6.1 tuvo un desempeño peor que el de su predecesor, el modelo GPT-6, a la hora de obedecer las instrucciones que le daban sus programadores.
Este modelo trataba de engañar a sus supervisores al omitir revelar determinadas acciones que había hecho; también usó herramientas y servicios sin que tuviera permiso para hacerlo.
Al respecto, Jain reconoció que GPT-6.1 «no alcanzó el estándar en lo que respecta a mantenerse dentro de los límites de sus prerrogativas y autorizaciones ni en la forma en la que comunica el trabajo que realiza».
