Una herramienta de inteligencia artificial con una apariencia aparentemente inofensiva está generando preocupación entre investigadores de seguridad. Se trata de KawaiiGPT, un proyecto de código abierto diseñado para interactuar con modelos de lenguaje intentando evitar sus filtros y restricciones de seguridad.
Aunque sus desarrolladores pueden presentarlo como una solución para pruebas de penetración y experimentación, una investigación publicada por Unit 42, la división de inteligencia de amenazas de Palo Alto Networks, incluyó a KawaiiGPT entre las herramientas de IA consideradas maliciosas por sus capacidades y por la facilidad con la que puede ser utilizada.
Según el informe, KawaiiGPT fue identificado durante julio de 2025 y destacó principalmente por ser gratuito, accesible y relativamente sencillo de configurar en sistemas Linux. Esta facilidad podría permitir que personas con pocos conocimientos técnicos accedan a funciones que anteriormente requerían experiencia avanzada en programación y ciberseguridad.
Las pruebas realizadas por los investigadores mostraron que la herramienta podía producir mensajes de ingeniería social, contenido relacionado con campañas de phishing y fragmentos de código potencialmente utilizables en diferentes etapas de un ataque informático. Unit 42 advierte que estas capacidades pueden acelerar determinadas actividades maliciosas y disminuir la experiencia necesaria para intentar ejecutarlas.
Sin embargo, KawaiiGPT no sería realmente un nuevo modelo de inteligencia artificial entrenado desde cero. Un análisis independiente de su código determinó que funciona principalmente como una interfaz o wrapper que aplica instrucciones de jailbreak y redirige las consultas hacia modelos externos mediante diferentes servicios y APIs.
El caso demuestra el creciente problema del doble uso de la inteligencia artificial. Las mismas tecnologías que pueden ayudar a detectar vulnerabilidades, capacitar especialistas y fortalecer sistemas también pueden ser modificadas para evadir controles y automatizar actividades dañinas.
Los expertos recomiendan que cualquier investigación de seguridad con este tipo de herramientas se realice exclusivamente en laboratorios aislados, sistemas propios y entornos expresamente autorizados. También señalan que los modelos de lenguaje no deben considerarse una barrera de seguridad y que las empresas necesitan controles adicionales, validación de resultados y pruebas continuas frente a inyecciones de prompts.
KawaiiGPT no representa únicamente una curiosidad tecnológica. Su aparición evidencia cómo las técnicas de jailbreak están evolucionando y por qué la protección de los sistemas basados en inteligencia artificial será uno de los principales desafíos para la ciberseguridad durante los próximos años.