Cada vez que un LLM dice "No puedo ayudarte con eso", le está regalando un gradiente de optimización al atacante.
No es intuición. Es matemática:
ASR = 1 - (1 - β_D · (1 - β_A))^N → 1 cuando N → ∞
Enter fullscreen mode
Exit fullscreen mode
Presentamos misdirection-proxy v0.5.0: un gateway de seguridad que reemplaza los bloqueos predecibles por desinformación controlada, degradando el optimizador del atacante hasta el colapso de Markov.
Cada vez que un LLM dice "No puedo ayudarte con eso", le está regalando un gradiente de optimización al atacante.
No es intuición. Es matemática:
ASR = 1 - (1 - β_D · (1 - β_A))^N → 1 cuando N → ∞
Enter fullscreen mode
Exit fullscreen mode

Le dije a un atacante de IA que ganó. Perdió. Un proxy defensivo que no bloquea prompts...

Recientemente, el análisis de vulnerabilidades en endpoints de IA (como se detalla en el artículo...

Según MIT Technology Review, este fenómeno se ha estudiado principalmente en el contexto del aprendizaje por refuerzo

PromptSpy y ‘quishing’ con inteligencia artificial están acelerando fraudes y ataques con códigos QR. Así funcionan estos…

La IA puede ser perversa al obedecernos, pero parece seguro que los grandes peligros siguen sentados tras las pantallas: Pascual…

Un estudio muestra que delegar en una máquina tan complaciente con las peticiones humanas multiplica las decisiones poco éticas.…