Investigadores de ciberseguridad han descubierto una nueva técnica de inyección de prompts llamada PuzzleMask. Esta técnica permite ocultar instrucciones contrarias a las políticas de seguridad en textos que parecen completamente normales, logrando evadir los controles de seguridad en arquitecturas de inteligencia artificial (IA). Con PuzzleMask, los actores maliciosos pueden inyectar comandos dañinos sin recurrir a métodos tradicionales, lo que plantea un riesgo significativo para los entornos corporativos. Los resultados de las pruebas realizadas por Check Point Software Technologies han demostrado la efectividad del método, con una tasa de éxito del 100% en la evasión de filtros de seguridad.
Nueva Técnica de Inyección de Prompts: PuzzleMask
Funcionamiento de PuzzleMask
PuzzleMask permite a los atacantes ocultar instrucciones maliciosas dentro de textos que parecen inocentes, haciendo uso de una estructura gramatical natural para frustrar la detección por parte de los modelos de filtrado. Esta técnica es especialmente peligrosa porque no requiere métodos complejos ni violaciones de políticas internas, aprovechando un punto ciego en muchas arquitecturas de seguridad actuales.
Pruebas y Resultados
La división de Inteligencia de Amenazas de Check Point realizó pruebas en varios modelos de filtrado, incluyendo Claude-3-Haiku, GPT-4o-Mini, GPT-oss-safeguard y Llama-Guard3. Durante 23 ensayos, ninguno de los modelos detectó las inyecciones de PuzzleMask, logrando el método una tasa de éxito del 100%. Además, las instrucciones ocultas fueron correctamente interpretadas en 17 de las 18 pruebas realizadas.
Puntos Ciegos en Arquitecturas de Seguridad
Vulnerabilidades de los Modelos de Filtrado Rápido
Los modelos de inspección rápida están diseñados para evaluar la seguridad de las solicitudes antes de enviarlas a sistemas más robustos. Sin embargo, debido a la naturaleza de los comandos enmascarados por PuzzleMask, estos modelos no pueden identificar anomalías. Esto ha revelado una superficie de ciberataque que puede ser explotada sin la necesidad de técnicas avanzadas de evasión.
Implicaciones para Empresas
La vulnerabilidad afecta principalmente a las empresas que utilizan agentes o asistentes que manejan datos corporativos. Un sistema de seguridad que solo evalúa las entradas en un sistema de IA es claramente insuficiente frente a vectores que hacen uso del lenguaje natural.
Recomendaciones para Organizaciones
Mejora de Sistemas de Seguridad
Dadas las vulnerabilidades expuestas, es crucial que las organizaciones reevalúen sus sistemas de ciberseguridad. Aquí hay algunas recomendaciones:
-
Auditoría de Solicitudes: Revisar no solo la solicitud inicial, sino el proceso completo de razonamiento y respuesta del modelo tras recibir comandos.
-
Cuidado con Fuentes Externas: Tratar el contenido copiado de sitios web, correos electrónicos o documentos de la misma forma que se trataría un archivo adjunto o un enlace sospechoso.
-
Técnicas de Parafraseado: Implementar procesos de parafraseo en las entradas para diluir mensajes ocultos, protegiendo así la integridad de la información.
-
Endurecimiento de Políticas: Reforzar los filtros y modelos de seguridad existentes para prevenir la inyección exitosa de comandos ocultos.
- Enfoque Preventivo: Adoptar estrategias que incluyan inteligencia de amenazas, gobernanza de la IA y protección en tiempo real, desplazando el enfoque de simple inspección de entradas hacia una monitorización activa del comportamiento del agente.
Conclusiones
La técnica PuzzleMask representa un desafío significativo para la ciberseguridad en organizaciones que utilizan inteligencia artificial. A medida que los sistemas de IA se integran más en las operaciones empresariales, la defensa contra estos nuevos métodos de ataque tendrá que evolucionar. Las empresas deben implementar sistemas de seguridad más robustos y proactivos que no solo se centren en la revisión de entradas, sino que también monitoricen activamente las respuestas y comportamientos de los sistemas de IA. Esto es esencial para proteger los datos y flujos de trabajo automatizados de posibles ataques maliciosos.