Entrada de Pandipedia
Which cyberattack technique relies on adversarial text prompts to manipulate AI
The cyberattack technique that uses adversarial text prompts to manipulate large language models is known as prompt injection, which is often paired with LLM jailbreaking techniques [1].
In these attacks, actors insert crafted prompts designed to bypass model restrictions and force models to reveal hidden step-by-step internal reasoning, system instructions, or proprietary functionalities [2]. Threat actors have used these prompt manipulation techniques to extract reasoning capabilities and training data from frontier AI models [3].
Guarda esta respuesta
Crea tu cuenta para conservar esta respuesta y continuar desde aquí más tarde.
Lo sentimos, Pandi no pudo encontrar una respuesta.
Veamos alternativas:
- Modifica la consulta.
- Inicia un nuevo hilo.
- Eliminar fuentes (si se han agregado manualmente).