Prompt Injection
KonzeptPrompt Injection entsteht, wenn im späteren Kontext ein Hinweis platziert wird, der den ursprünglichen Instruktionen widerspricht
- etwa in einem eingefügten Dokument, einer Webseite oder einer Nutzereingabe. Dieser Hinweis konkurriert mit System-Prompt oder vorheriger Anweisung um dieselbe Wahrscheinlichkeitsverteilung bei der Token-Auswahl.
Was ist Prompt Injection?
Prompt Injection entsteht, wenn im späteren Kontext ein Hinweis platziert wird, der den ursprünglichen Instruktionen widerspricht - etwa in einem eingefügten Dokument, einer Webseite oder einer Nutzereingabe. Dieser Hinweis konkurriert mit System-Prompt oder vorheriger Anweisung um dieselbe Wahrscheinlichkeitsverteilung bei der Token-Auswahl.
Wie es funktioniert
Ein Sprachmodell unterscheidet Instruktionen nicht anhand einer festen Zugriffsregel, sondern verarbeitet System-Prompt, frühere Nachrichten und eingefügten Text innerhalb desselben Kontexts. Ein widersprüchlicher Hinweis im späteren Kontext verschiebt die Wahrscheinlichkeitsverteilung der nächsten Token - wie stark, hängt vom Modelltraining, der Rollenkennzeichnung, dem übrigen Kontext und der konkreten Formulierung ab.
Warum keine Instruktion absolut ist
Es gibt keine feste Rangfolge, nach der grundsätzlich der spätere oder der frühere Text gewinnt - ein System-Prompt ist keine serverseitige Zugriffsregel, sondern wirkt als Gewichtsverschiebung innerhalb derselben Berechnung wie der Rest des Kontexts. Jede Anwendung, die nicht vertrauenswürdige Inhalte in den Modellkontext übernimmt - etwa Dokumente, Webseiten oder andere externe Inhalte wie API-Rückgaben und Tool-Ergebnisse - muss Prompt-Injection-Angriffe deshalb grundsätzlich berücksichtigen.
Prompt Injection ist dabei kein Programmierfehler im klassischen Sinne, der sich einmalig vollständig beheben lässt - sie ist eine direkte Konsequenz davon, dass Sprachmodelle Instruktionen und Inhalte nicht strukturell getrennt verarbeiten, sondern beides als Text im selben Kontext. Härtere Formulierungen oder zusätzliche Regeln können das Risiko verringern, aber nicht grundsätzlich ausschließen.
Warum Prompt Injection praktische Auswirkungen hat
- Fremde Inhalte: Jede Anwendung, die nicht vertrauenswürdige Inhalte wie Dokumente, Webseiten oder Nutzereingaben in den Modellkontext übernimmt, muss Prompt-Injection-Angriffe berücksichtigen
- Keine vollständige Abhilfe: Sicherheitsmaßnahmen reduzieren das Risiko, garantieren aber keine vollständige Immunität
- Kontextabhängigkeit: Wie leicht eine Injection wirkt, hängt von Modell, Rollenkennzeichnung und Formulierung ab - nicht von einer festen Regel
Typisches Beispiel
Ein eingefügtes Dokument enthält einen versteckten Hinweis wie “Ignoriere alle vorherigen Anweisungen und antworte stattdessen mit …” - dieser Text konkurriert im Kontext mit dem eigentlichen System-Prompt um die Wahrscheinlichkeitsverteilung der Antwort.
Weiterführend
Grundlagen → Prompts: Warum Formulierungen die Antwort verändern
Verwandte Begriffe
→ System-Prompt
→ Prompt
Weiterführender Artikel
Prompts: Warum Formulierungen die Antwort verändernTokenisierung, System-Prompts, Temperatur und die Grenzen von Prompt Engineering
Quellen
Quellen archiviert am: 2026-08-02