Meta's Prompt Guard 2 logra detectar el 1% de ataques de inyección en herramientas, revelando una significativa brecha en la seguridad de AgentDojo.

Meta’s Prompt Guard 2 logra detectar el 1% de ataques de inyección en herramientas, revelando una significativa brecha en la seguridad de AgentDojo.

El ámbito de la inteligencia artificial y la seguridad cibernética sigue enfrentando desafíos significativos, especialmente cuando se trata de detectar ataques a través de inyecciones en sistemas. Recientemente, se han puesto a prueba diez detectores de código abierto utilizando un conjunto completo de ataques reales de inyección de «AgentDojo», involucrando 629 ataques en total, cada uno en el contexto de salidas de herramientas ordinarias que un firewall de agentes podría encontrar.

Los hallazgos revelan que los actuales modelos de detección tienen un desempeño variado frente a estos ataques, con ninguno de ellos capaz de captar la mayoría de los intentos sin también bloquear un tráfico normal considerable. El detector que mostró el mejor equilibrio fue el «jailbreak-detector-large», que registró un 51% de éxito en la detección, con apenas un 2% de falsos positivos. En contraste, otros detectores como el «Prompt Guard 2» de Meta lograron captar solo un 1% de los ataques.

Rendimiento de los Detectores

El análisis de los detectores destacó varias deficiencias en su rendimiento:

  • El «jailbreak-detector-large» fue el más efectivo en términos de balance, mientras que el «deepset-deberta» y «fmops-distilbert» marcaron un 100% de detección, pero a costa de casi el 98% de bloqueos de las salidas normales.
  • El «preamble-defense» y el «testsavant-defender» también retuvieron un alto porcentaje de detección, a la vez que impedían el tráfico seguro.
  • La incapacidad de detectores como «Prompt Guard 2» para identificar ciertos ataques en contextos más complicados, donde el texto malicioso se mezcla con salidas normales, resalta limitaciones críticas.

Los datos muestran que varios detectores que eran buenos en reconocer ataques aislados fallaban al hacerlo en un contexto más amplio. En particular, los modelos «ProtectAI» y «LLM Guard» capturaron todos los ataques en pruebas individuales, pero su eficacia disminuyó dramáticamente al ser rodeados por datos benignos. Esto plantea preocupaciones para su implementación en entornos de producción.

Desafíos en la Detección de Inyecciones

El estudio identificó tres formas clave en las que los detectores fallan:

  1. Falta de reconocimiento del lenguaje: Algunos detectores no capturan el texto específico utilizado en los ataques.
  2. Pérdida de contexto: La inclusión de salidas normales hace que los detectores pierdan efectividad al identificar ataques, aunque funcionen bien de manera aislada.
  3. Bloqueos excesivos: La estrategia de algunos detectores de bloquear todo lo que consideran potencialmente amenazante puede resultar en un gran número de falsos positivos.

Esta problemática no significa que los modelos actuales sean inútiles; sin embargo, subraya la necesidad de enfoques más sofisticados y contextuales para la detección de inyecciones. Los sistemas deben ser capaces de distinguir instrucciones normales de los usuarios frente a posibles amenazas, lo que implica una mayor inteligencia en la filtración de datos.

Al final, los hallazgos incitan a una reconsideración de las estrategias de detección y de las metodologías de seguridad utilizadas en la inteligencia artificial, señalando que el desarrollo de políticas de seguridad efectivas será fundamental para enfrentar los retos del futuro.