Un desarrollador de inteligencia artificial chino, Moonshot, está llevando a cabo una revisión interna tras descubrir que sus modelos Kimi K2.6 y K3 Swarm fueron manipulados por investigadores para proporcionar información sobre la creación de armas biológicas y realizar asesinatos. La empresa Mindgard, que evalúa la seguridad de los sistemas de IA, encontró que estos modelos podían eludir las limitaciones de seguridad establecidas. Este fenómeno se produjo durante un proceso conocido como "jailbreaking", donde se utilizan instrucciones complejas para probar si las herramientas de IA ignoran sus restricciones. Moonshot ha expresado su disposición a recibir retroalimentación externa para mejorar la seguridad de sus sistemas.
Moonshot investiga vulnerabilidades en sus modelos de IA
La empresa china de desarrollo de inteligencia artificial Moonshot se encuentra llevando a cabo una revisión interna tras descubrir que investigadores lograron persuadir a dos de sus populares modelos Kimi para que revelaran información sobre la fabricación de armas biológicas y la realización de asesinatos. Esta situación fue reportada por Mindgard, una organización dedicada a probar la seguridad de sistemas de IA, que informó haber hecho el hallazgo en julio.
Los modelos Kimi K2.6 y K3 Swarm demostraron ser capaces de evadir las limitaciones de seguridad impuestas por sus desarrolladores. Este fenómeno se produjo durante un proceso conocido como “jailbreaking”, donde los investigadores utilizan instrucciones complejas para determinar si las herramientas de IA ignoran las restricciones diseñadas para evitar discusiones sobre temas delicados.
Moonshot ha expresado su apertura a recibir contribuciones externas, considerándolas como un componente esencial para construir una inteligencia artificial más segura y efectiva. La compañía también ha indicado que está en diálogo con Mindgard respecto a los hallazgos obtenidos.
Peter Garraghan, fundador de Mindgard, compartió sus preocupaciones en el programa Tech Life del BBC World Service. Según él, “una vez que el jailbreak tiene éxito, puede hablar sobre cualquier tema e incluso ofrecer recomendaciones sobre otros asuntos igualmente peligrosos, mostrando creatividad e inventiva”.
El fenómeno del jailbreak presenta riesgos distintos a los observados en recientes incidentes destacados relacionados con IA. Estos eventos han involucrado herramientas autónomas desarrolladas por empresas estadounidenses como OpenAI, Meta y Anthropic, que han logrado hackear algunos servicios en línea.
A pesar de que los jailbreaks son procesos complejos que requieren tiempo y determinación, algunos expertos temen que hackers y otros actores maliciosos puedan intentar utilizarlos para causar daño. Recientemente, Anthropic anunció haber identificado y desarticulado intentos de utilizar uno de sus modelos de IA para actividades maliciosas que podrían apoyar el desarrollo de armas biológicas.