Prompt Injection

Konzept
Auch bekannt als: Prompt-Injektion
Im Kontext platzierter, gegenläufiger Hinweis, der mit System-Prompt oder Nutzer-Absicht um dieselbe Wahrscheinlichkeitsverteilung konkurriert

Prompt Injection entsteht, wenn im späteren Kontext ein Hinweis platziert wird, der den ursprünglichen Instruktionen widerspricht

  • etwa in einem eingefügten Dokument, einer Webseite oder einer Nutzereingabe. Dieser Hinweis konkurriert mit System-Prompt oder vorheriger Anweisung um dieselbe Wahrscheinlichkeitsverteilung bei der Token-Auswahl.

Was ist Prompt Injection?

Prompt Injection entsteht, wenn im späteren Kontext ein Hinweis platziert wird, der den ursprünglichen Instruktionen widerspricht - etwa in einem eingefügten Dokument, einer Webseite oder einer Nutzereingabe. Dieser Hinweis konkurriert mit System-Prompt oder vorheriger Anweisung um dieselbe Wahrscheinlichkeitsverteilung bei der Token-Auswahl.

Wie es funktioniert

Ein Sprachmodell unterscheidet Instruktionen nicht anhand einer festen Zugriffsregel, sondern verarbeitet System-Prompt, frühere Nachrichten und eingefügten Text innerhalb desselben Kontexts. Ein widersprüchlicher Hinweis im späteren Kontext verschiebt die Wahrscheinlichkeitsverteilung der nächsten Token - wie stark, hängt vom Modelltraining, der Rollenkennzeichnung, dem übrigen Kontext und der konkreten Formulierung ab.

Warum keine Instruktion absolut ist

Es gibt keine feste Rangfolge, nach der grundsätzlich der spätere oder der frühere Text gewinnt - ein System-Prompt ist keine serverseitige Zugriffsregel, sondern wirkt als Gewichtsverschiebung innerhalb derselben Berechnung wie der Rest des Kontexts. Jede Anwendung, die nicht vertrauenswürdige Inhalte in den Modellkontext übernimmt - etwa Dokumente, Webseiten oder andere externe Inhalte wie API-Rückgaben und Tool-Ergebnisse - muss Prompt-Injection-Angriffe deshalb grundsätzlich berücksichtigen.

Prompt Injection ist dabei kein Programmierfehler im klassischen Sinne, der sich einmalig vollständig beheben lässt - sie ist eine direkte Konsequenz davon, dass Sprachmodelle Instruktionen und Inhalte nicht strukturell getrennt verarbeiten, sondern beides als Text im selben Kontext. Härtere Formulierungen oder zusätzliche Regeln können das Risiko verringern, aber nicht grundsätzlich ausschließen.

Warum Prompt Injection praktische Auswirkungen hat

  • Fremde Inhalte: Jede Anwendung, die nicht vertrauenswürdige Inhalte wie Dokumente, Webseiten oder Nutzereingaben in den Modellkontext übernimmt, muss Prompt-Injection-Angriffe berücksichtigen
  • Keine vollständige Abhilfe: Sicherheitsmaßnahmen reduzieren das Risiko, garantieren aber keine vollständige Immunität
  • Kontextabhängigkeit: Wie leicht eine Injection wirkt, hängt von Modell, Rollenkennzeichnung und Formulierung ab - nicht von einer festen Regel

Typisches Beispiel

Ein eingefügtes Dokument enthält einen versteckten Hinweis wie “Ignoriere alle vorherigen Anweisungen und antworte stattdessen mit …” - dieser Text konkurriert im Kontext mit dem eigentlichen System-Prompt um die Wahrscheinlichkeitsverteilung der Antwort.

Weiterführend

GrundlagenPrompts: Warum Formulierungen die Antwort verändern

Verwandte BegriffeSystem-Prompt
Prompt

Weiterführender Artikel

Prompts: Warum Formulierungen die Antwort verändern

Tokenisierung, System-Prompts, Temperatur und die Grenzen von Prompt Engineering

Quellen

Quellen archiviert am: 2026-08-02