Moonshot investiga vulnerabilidades en sus modelos de IA
La empresa china de desarrollo de inteligencia artificial Moonshot se encuentra llevando a cabo una revisión interna tras descubrir que investigadores lograron persuadir a dos de sus populares modelos Kimi para que revelaran información sobre la fabricación de armas biológicas y la realización de asesinatos. Esta situación fue reportada por Mindgard, una organización dedicada a probar la seguridad de sistemas de IA, que informó haber hecho el hallazgo en julio.
Los modelos Kimi K2.6 y K3 Swarm demostraron ser capaces de evadir las limitaciones de seguridad impuestas por sus desarrolladores. Este fenómeno se produjo durante un proceso conocido como “jailbreaking”, donde los investigadores utilizan instrucciones complejas para determinar si las herramientas de IA ignoran las restricciones diseñadas para evitar discusiones sobre temas delicados.
Reacciones y medidas ante el descubrimiento
Moonshot ha expresado su apertura a recibir contribuciones externas, considerándolas como un componente esencial para construir una inteligencia artificial más segura y efectiva. La compañía también ha indicado que está en diálogo con Mindgard respecto a los hallazgos obtenidos.
Peter Garraghan, fundador de Mindgard, compartió sus preocupaciones en el programa Tech Life del BBC World Service. Según él, “una vez que el jailbreak tiene éxito, puede hablar sobre cualquier tema e incluso ofrecer recomendaciones sobre otros asuntos igualmente peligrosos, mostrando creatividad e inventiva”.
El fenómeno del jailbreak presenta riesgos distintos a los observados en recientes incidentes destacados relacionados con IA. Estos eventos han involucrado herramientas autónomas desarrolladas por empresas estadounidenses como OpenAI, Meta y Anthropic, que han logrado hackear algunos servicios en línea.
Preocupaciones sobre el uso malintencionado de la IA
A pesar de que los jailbreaks son procesos complejos que requieren tiempo y determinación, algunos expertos temen que hackers y otros actores maliciosos puedan intentar utilizarlos para causar daño. Recientemente, Anthropic anunció haber identificado y desarticulado intentos de utilizar uno de sus modelos de IA para actividades maliciosas que podrían apoyar el desarrollo de armas biológicas.