> For the complete documentation index, see [llms.txt](https://ai.mrw0l05zyn.cl/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://ai.mrw0l05zyn.cl/ataque/prompt-injection.md).

# Prompt injection

Prompt injection aprovecha la difusa frontera entre "instrucciones" y "datos de entrada" en un prompt, lo que resulta en un cambio en el comportamiento del modelo. Estos ataques pueden ser directos "direct prompt injection" (introducidos directamente por el usuario) o indirectos "indirect prompt injection" (leídos de otras fuentes, como un documento, un correo electrónico o un sitio web).

Los jailbreaks constituyen una modalidad de ataque de "prompt injection" que induce a un modelo a adoptar comportamientos que su proceso de entrenamiento pretende evitar, como la generación de contenido inseguro o la divulgación de información personal identificable. Estas fallas de seguridad se conocen como vulnerabilidades de "ignorar instrucciones previas" o "Do Anything Now (DAN)".

La filtración del "system prompt" puede ser peligrosa de varias maneras. En primer lugar, si el "system prompt" contiene información confidencial, acceder a él proporciona datos de manera no autorizada. En segundo lugar, conocer su contenido permite planificar ataques futuros, como el jailbreaking del modelo, y facilita la identificación y eludir posibles mecanismos de mitigación o restricciones implementadas. Además, el "system prompt" podría revelar sistemas adicionales o recursos a los que el modelo tiene acceso, abriendo la puerta a nuevos vectores de ataque.
