X

Noticias IA

Descubren PuzzleMask: técnica de inyección de prompts que oculta instrucciones maliciosas en textos normales

Investigadores de ciberseguridad han descubierto una nueva técnica de inyección de prompts llamada PuzzleMask. Esta técnica permite ocultar instrucciones contrarias a las políticas de seguridad en textos que parecen completamente normales, logrando evadir los controles de seguridad en arquitecturas de inteligencia artificial (IA). Con PuzzleMask, los actores maliciosos pueden inyectar comandos dañinos sin recurrir a métodos tradicionales, lo que plantea un riesgo significativo para los entornos corporativos. Los resultados de las pruebas realizadas por Check Point Software Technologies han demostrado la efectividad del método, con una tasa de éxito del 100% en la evasión de filtros de seguridad.

Nueva Técnica de Inyección de Prompts: PuzzleMask

Funcionamiento de PuzzleMask

PuzzleMask permite a los atacantes ocultar instrucciones maliciosas dentro de textos que parecen inocentes, haciendo uso de una estructura gramatical natural para frustrar la detección por parte de los modelos de filtrado. Esta técnica es especialmente peligrosa porque no requiere métodos complejos ni violaciones de políticas internas, aprovechando un punto ciego en muchas arquitecturas de seguridad actuales.

Pruebas y Resultados

La división de Inteligencia de Amenazas de Check Point realizó pruebas en varios modelos de filtrado, incluyendo Claude-3-Haiku, GPT-4o-Mini, GPT-oss-safeguard y Llama-Guard3. Durante 23 ensayos, ninguno de los modelos detectó las inyecciones de PuzzleMask, logrando el método una tasa de éxito del 100%. Además, las instrucciones ocultas fueron correctamente interpretadas en 17 de las 18 pruebas realizadas.

Puntos Ciegos en Arquitecturas de Seguridad

Vulnerabilidades de los Modelos de Filtrado Rápido

Los modelos de inspección rápida están diseñados para evaluar la seguridad de las solicitudes antes de enviarlas a sistemas más robustos. Sin embargo, debido a la naturaleza de los comandos enmascarados por PuzzleMask, estos modelos no pueden identificar anomalías. Esto ha revelado una superficie de ciberataque que puede ser explotada sin la necesidad de técnicas avanzadas de evasión.

Implicaciones para Empresas

La vulnerabilidad afecta principalmente a las empresas que utilizan agentes o asistentes que manejan datos corporativos. Un sistema de seguridad que solo evalúa las entradas en un sistema de IA es claramente insuficiente frente a vectores que hacen uso del lenguaje natural.

Recomendaciones para Organizaciones

Mejora de Sistemas de Seguridad

Dadas las vulnerabilidades expuestas, es crucial que las organizaciones reevalúen sus sistemas de ciberseguridad. Aquí hay algunas recomendaciones:

  1. Auditoría de Solicitudes: Revisar no solo la solicitud inicial, sino el proceso completo de razonamiento y respuesta del modelo tras recibir comandos.

  2. Cuidado con Fuentes Externas: Tratar el contenido copiado de sitios web, correos electrónicos o documentos de la misma forma que se trataría un archivo adjunto o un enlace sospechoso.

  3. Técnicas de Parafraseado: Implementar procesos de parafraseo en las entradas para diluir mensajes ocultos, protegiendo así la integridad de la información.

  4. Endurecimiento de Políticas: Reforzar los filtros y modelos de seguridad existentes para prevenir la inyección exitosa de comandos ocultos.

  5. Enfoque Preventivo: Adoptar estrategias que incluyan inteligencia de amenazas, gobernanza de la IA y protección en tiempo real, desplazando el enfoque de simple inspección de entradas hacia una monitorización activa del comportamiento del agente.

Conclusiones

La técnica PuzzleMask representa un desafío significativo para la ciberseguridad en organizaciones que utilizan inteligencia artificial. A medida que los sistemas de IA se integran más en las operaciones empresariales, la defensa contra estos nuevos métodos de ataque tendrá que evolucionar. Las empresas deben implementar sistemas de seguridad más robustos y proactivos que no solo se centren en la revisión de entradas, sino que también monitoricen activamente las respuestas y comportamientos de los sistemas de IA. Esto es esencial para proteger los datos y flujos de trabajo automatizados de posibles ataques maliciosos.

Compartir noticia

Publicado

en

por

Newsletter Negocios con IA

¿Quieres Mejorar tu Negocio?