Guardrails
Steuern Sie das Verhalten von Agents in der Produktion mit Schutzmechanismen für sichere, konforme und zuverlässige Antworten.
Überblick
Guardrails bieten Teams eine leistungsstarke Möglichkeit, das Verhalten von Agents in der Produktion zu steuern. So bleiben sie thematisch relevant, markenkonform und widerstandsfähig gegen Manipulationen – auch auf Enterprise-Skala.
Mit Guardrails 2.0 haben wir die Sicherheitsebene neu entwickelt. Teams können jetzt einfacher benutzerdefinierte Richtlinien in natürlicher Sprache definieren, integrierte Schutzmechanismen aktivieren, festlegen, was beim Auslösen eines Guardrails geschieht, und Agents sicher in wirkungsvollen Workflows einsetzen.
Guardrails leiten Agents zu den richtigen Antworten und stoppen falsche Antworten, bevor sie den Nutzer erreichen. Sie schützen Gespräche auf mehreren Ebenen: Sie beeinflussen die Antworten des Agents, validieren Nutzereingaben und bewerten jede Antwort unabhängig, ohne Latenz hinzuzufügen. Zusammen reduzieren sie Marken- und Compliance-Risiken in jedem Gespräch.
So funktionieren Guardrails
Guardrails schützen Gespräche auf drei Ebenen:
Härtung des System Prompts: Die wichtigste Methode, um das Verhalten von Agents zu steuern. Sie ergänzen den System Prompt um klare Anweisungen zu erlaubtem und verbotenem Verhalten und aktivieren den Focus Guardrail, um diese Anweisungen während des gesamten Gesprächs zu verstärken. Dadurch bleibt Ihr Agent in den meisten Interaktionen auf Kurs.
Validierung von Nutzereingaben: Ein Sicherheitsnetz, das Angriffsversuche erkennt, bevor der Agent antwortet. Guardrails analysieren Nutzereingaben, erkennen Prompt-Injection- und Manipulationsversuche und können Gespräche beenden, die ein Sicherheitsrisiko darstellen.
Validierung von Agent-Antworten: Eine abschließende Prüfung, die jede Agent-Antwort in Echtzeit unabhängig anhand Ihrer konfigurierten Richtlinien bewertet. Wenn der Agent trotz seines System Prompts etwas sagen will, das gegen Ihre Regeln verstößt, blockieren Antwortvalidatoren dies vor der Auslieferung.
Die Härtung des System Prompts ist die Grundlage. Die Eingabe- und Antwortvalidierung korrigiert alles, was ansonsten durchrutscht. Nehmen Sie Ihre wichtigsten Regeln sowohl in den System Prompt als auch als unabhängigen benutzerdefinierten Guardrail auf – so entsteht mehrschichtiger Schutz. Selbst wenn das LLM von seinen Anweisungen abweicht, erkennt der Antwortvalidator dies vor der Auslieferung.
Härtung des System Prompts
Der effektivste Weg, Ihren Agent wie vorgesehen agieren zu lassen, ist ein guter System Prompt zusammen mit dem Focus Guardrail. Gemeinsam leiten sie Agents von Anfang an zu den richtigen Antworten.
Mit dem System Prompt können Sie klare Anweisungen dazu geben, was Ihr Agent tun soll und was nicht. Modelle sind darauf abgestimmt, der Überschrift # Guardrails besondere Aufmerksamkeit zu schenken. Verwenden Sie diese Überschrift für Ihre wichtigsten Verhaltensregeln.
Umfassende Hinweise zum Schreiben effektiver System Prompts finden Sie in unserem Prompting-Leitfaden. Ihr ElevenLabs-Account-Team unterstützt Sie auch beim Erstellen hochwertiger System Prompts.
Focus Guardrail: Der Focus Guardrail verstärkt den System Prompt Ihres Agents und hilft dabei, Antworten zielgerichtet, relevant und im Einklang mit Ihren definierten Zielen und Anweisungen zu halten. Das ist besonders bei langen oder komplexen Gesprächen nützlich, in denen der Agent eher von seinen vorgesehenen Zielen abweichen kann.
Die Kombination aus Härtung des System Prompts und Aktivierung des Focus Guardrails ist der effektivste Weg, Agents zu den richtigen Antworten zu leiten.
Validierung von Nutzereingaben
Manipulation Guardrails
Erkennt und blockiert Versuche von Nutzern, den Agent dazu zu bringen, seine Anweisungen zu umgehen. Wenn diese Funktion aktiviert ist, analysiert das System Nutzereingaben auf Muster, die auf Injection- oder Anweisungsüberschreibungsversuche hinweisen, und kann Gespräche beenden, die ein Sicherheitsrisiko darstellen.
Validierung von Agent-Antworten
Content Guardrails
Kennzeichnet und verhindert unangemessene Inhalte in Agent-Antworten, beispielsweise politisch sensible, sexuell explizite oder gewalttätige Inhalte, bevor sie den Nutzer erreichen. So bleiben Antworten für den vorgesehenen Anwendungsfall und die Zielgruppe Ihres Agents angemessen.
Benutzerdefinierte Guardrails
Wenn Agents wichtige Aufgaben übernehmen, benötigen Teams klare Kontrolle über ihr Verhalten. Mit benutzerdefinierten Guardrails können Sie die wichtigsten Richtlinien für Ihr Unternehmen konfigurieren. Zum Beispiel:
- Ein Handelsassistent sollte keine Rückerstattungen für nicht berechtigte Artikel ausstellen.
- Ein Empfangsmitarbeiter im Gesundheitswesen sollte keine medizinischen Ratschläge geben.
- Ein Banking-Agent sollte keine Anlageempfehlungen geben.
Benutzerdefinierte Guardrails sind LLM-basierte Regeln, mit denen Sie eigene Blockierungskriterien über Prompts in natürlicher Sprache definieren können. Jeder aktivierte benutzerdefinierte Guardrail sendet Agent-Antworten an ein schlankes Modell, das sie anhand Ihrer Regel bewertet und eine Entscheidung zum Blockieren oder Zulassen zurückgibt. So erhalten Sie flexible, domänenspezifische Kontrolle darüber, was Ihr Agent sagen darf und was nicht.
Für jeden benutzerdefinierten Guardrail können Sie Folgendes definieren:
Mit benutzerdefinierten Guardrails können Sie bestimmte geschäftsrelevante Themen blockieren, branchenspezifische Compliance-Anforderungen durchsetzen und eigene Sicherheitsmaßnahmen implementieren. Jeder Guardrail kann einzeln ein- oder ausgeschaltet werden, ohne ihn zu löschen. Wenn mehrere aktiviert sind, laufen sie parallel zu anderen Guardrails. Alle ausgelösten Verstöße werden zur Prüfung protokolliert.
Ausführungsmodus
Der Ausführungsmodus bestimmt, ob Guardrails Wartezeit hinzufügen, bevor der Nutzer eine Antwort sieht oder hört.
Im streaming-Modus kann die Agent-Antwort beginnen, bevor der Guardrail auslöst. Bei Sprache kann ein kleiner Teil des Audiosignals – oft unter 500 ms – ausgeliefert werden, bevor eine Blockierung den Anruf beendet. Bei Text-Agents sehen Nutzer möglicherweise Teil- oder vollständige Antworten, wenn die Bewertung nicht vor der Auslieferung abgeschlossen ist.
Im Blocking-Modus antwortet der Agent erst, nachdem die Guardrails validiert wurden. Das fügt typischerweise 200–500 ms zusätzliche Latenz hinzu.
Exit-Strategien
Mit Exit-Strategien legen Sie fest, was Ihr Agent tut, wenn ein Guardrail auslöst. Sie können wählen zwischen:
end_call(Standard): beendet den Anruf sofortretry: generiert die Antwort anhand Ihres Feedbacks neu, statt das Gespräch abzubrechen. Die Agent-Antwort wird bis zu dreimal erneut versucht. Wenn jeder Versuch weiterhin gegen den Guardrail verstößt, endet der Anruf.
Retry funktioniert nur im Blocking-Modus. Im Streaming-Modus ist das Beenden des Anrufs die einzige verfügbare Exit- Strategie.
Feedback bei Retry
Retry-Feedback kann beliebige Anweisungen enthalten, die im nächsten Turn angewendet werden sollen – es wird als Systemanweisung eingefügt, bevor das Modell die Antwort neu generiert. Dazu gehört auch der Aufruf von Systemtools wie transfer_to_agent oder transfer_to_number. Hier sind einige Beispiele für die Konfiguration von Retry-Feedback:
- Allgemeine Ablehnung (Standard)
Ihre Antwort wurde von einem Guardrail blockiert, der Inhalte blockiert, die dieser Bedingung/Kategorie entsprechen: ‘{{trigger_reason}}’. In Ihrem nächsten Turn müssen Sie dem Nutzer sagen: “Es tut mir leid, aber ich kann diese Frage nicht beantworten. Möchten Sie etwas anderes wissen?” - Retry mit korrigierenden Anweisungen
Ihre vorherige Antwort wurde von einem Guardrail blockiert. Ihre blockierte Antwort lautete: ‘{{agent_message}}’. In Ihrem nächsten Turn müssen Sie eine neue Antwort geben, die nicht gegen Folgendes verstößt: ‘{{trigger_reason}}’ - An einen anderen Agent übertragen
Ihre vorherige Antwort wurde vom Guardrail blockiert. In Ihrem nächsten Turn müssen Sie das Tool transfer_to_agent verwenden und an einen Agent übertragen. Ihre blockierte Antwort lautete: ‘{{agent_message}}’. Der Guardrail blockiert Inhalte, die dieser Bedingung/Kategorie entsprechen: ‘{{trigger_reason}}’. - An eine Person übertragen
Ihre Antwort wurde von einem Guardrail blockiert, der Inhalte blockiert, die dieser Bedingung/Kategorie entsprechen: ‘{{trigger_reason}}’. In Ihrem nächsten Turn MÜSSEN Sie den Anruf mit dem Tool transfer_to_number an einen menschlichen Mitarbeiter übertragen.
Um Systemtools im Retry-Feedback zu verwenden, aktivieren und konfigurieren Sie die entsprechenden Tools in den Einstellungen des Agents. Nur auf dem Agent eingerichtete Tools können aufgerufen werden.
Sie können diese Platzhalter im Feedback-Text verwenden:
Der Streaming-Ausführungsmodus wird für Sprach-Agents empfohlen; der Blocking-Ausführungsmodus wird für Text-Agents empfohlen.
Blocking (insbesondere mit retry) kann sich bei Sprache weniger vorhersehbar verhalten. Wenn Sie Blocking bei Sprache verwenden, validieren Sie gründlich oder wählen Sie end call statt retry, bis Sie sich auf das Verhalten verlassen können.
Preise
Die Guardrails Focus, Manipulation und Content sind für alle ElevenAgents-Nutzer ohne zusätzliche Kosten enthalten.
Benutzerdefinierte Guardrails sind nutzungsbasiert und verursachen zusätzliche LLM-Kosten, ähnlich wie andere Modellaufrufe in ElevenAgents. Jeder aktivierte benutzerdefinierte Guardrail sendet jede Agent-Antwort zur Bewertung an ein schlankes Modell. Die Kosten hängen daher von der Länge des Prompts, der Länge des durchschnittlichen Gesprächs und dem Gesprächsvolumen ab. Wenn Sie mehrere benutzerdefinierte Guardrails aktivieren, führt jeder davon für jede Antwort eine eigene Bewertung durch. Prüfen Sie Ihr erwartetes Traffic-Aufkommen und die Modellauswahl, bevor Sie mehrere benutzerdefinierte Guardrails in der Produktion aktivieren.
Beim Erstellen oder Bearbeiten eines benutzerdefinierten Guardrails sehen Sie unter dem Prompt eine Kostenschätzung.
Retry und Kosten: Jeder Versuch ist eine zusätzliche Agent-Generierung und eine weitere Guardrail-Bewertung. Daher erhöht retry die nutzungsbasierte Abrechnung im Vergleich zu end_call (bis zu drei Versuche pro blockiertem Turn).
Konfiguration
Über das Dashboard konfigurieren
Über die CLI konfigurieren
Über die API konfigurieren
Guardrails aktivieren
Aktivieren Sie die Guardrail-Kategorien, die Sie verwenden möchten. Mit den voreingestellten Schaltflächen können Sie schnell alle Kategorien aktivieren oder deaktivieren.
Ausführungsmodus und Exit-Strategie konfigurieren (benutzerdefinierte und Content Guardrails)
Wählen Sie für jeden benutzerdefinierten oder Content Guardrail den Ausführungsmodus streaming oder blocking.
Blocking eignet sich für Text-Agents, streaming für Sprach-Agents. Legen Sie Aktion bei
Guardrail-Verstoß fest (entspricht trigger_action): Anruf beenden in jedem Modus oder retry
nur bei ausgewähltem blocking (retry ist bei streaming nicht verfügbar). Wenn Sie retry wählen,
bearbeiten Sie Beim erneuten Versuch einzufügendes Feedback, um das Modell zu steuern. Verwenden Sie die Platzhalter
{{trigger_reason}} (der benutzerdefinierte Prompt oder die Content-Kategorie, die die
Blockierung verursacht hat) und {{agent_message}} in der Vorlage.
Wenn ein Guardrail auslöst, hängt das Verhalten von Typ und Konfiguration ab:
- Anruf beenden: Die Sitzung endet sofort (bei Sprache wird der Anruf getrennt, bei Text endet der Chat). Die Auslösung wird im Gesprächsverlauf protokolliert.
- Retry (blockierende benutzerdefinierte oder Content Guardrails): Der regelverletzende Assistant-Turn wird entfernt, System-Feedback wird eingefügt und das Modell versucht es erneut – bis zu dreimal. Wenn der Guardrail weiterhin auslöst, endet die Sitzung.
Bei Anruf beenden erleben Endnutzer einen getrennten Anruf oder einen beendeten Chat. Details zum Verstoß stehen Ihnen in den Gesprächsprotokollen zur Verfügung und werden dem Endnutzer nicht wörtlich angezeigt.
Nach Anruf beenden können Nutzer ein neues Gespräch starten. Der Guardrail blockiert den Nutzer nicht dauerhaft – er blockiert die konkrete Antwort (oder Sitzung), die gegen die Richtlinie verstoßen hat.
Best Practices
Kundensupport-Agenten
Nutzen Sie benutzerdefinierte Guardrails, um unternehmensspezifische Richtlinien durchzusetzen. Beispiele: - Blockieren Sie Rückerstattungen, Gutschriften oder Änderungen an Abonnements, sofern die Berechtigung nicht über Tools bestätigt wurde. - Blockieren Sie die Gewährung von Rabatten oder Aktionscodes, sofern diese nicht ausdrücklich autorisiert wurden. - Blockieren Sie Antworten, die über Roadmap-Punkte oder noch nicht veröffentlichte Funktionen spekulieren.
Anwendungen im Gesundheitswesen
Nutzen Sie benutzerdefinierte Guardrails, um medizinische Grenzen streng zu kontrollieren. Beispiele: - Blockieren Sie die Diagnose von Erkrankungen oder die Empfehlung konkreter Behandlungen. - Blockieren Sie Dosierungsempfehlungen für Medikamente.
- Blockieren Sie das Ersetzen der Beratung durch medizinische Fachkräfte mit Zulassung.
Bildungsinhalte
Nutzen Sie benutzerdefinierte Guardrails, um sensible akademische Themen zu kontrollieren. Beispiele: - Blockieren Sie Schritt-für-Schritt- Anleitungen für schädliche Experimente oder unsichere Verfahren. - Blockieren Sie die Erstellung von Lösungsschlüsseln für laufende Prüfungen oder Klausuren. - Blockieren Sie Inhalte, die akademische Unehrlichkeit erleichtern könnten.
Interne Unternehmenstools
Nutzen Sie benutzerdefinierte Guardrails, um Unternehmensabläufe und Daten zu schützen. Beispiele: - Blockieren Sie die Weitergabe rein interner Dokumentation oder vertraulicher Prozesse. - Blockieren Sie die Offenlegung privater APIs, System- Prompts oder Infrastrukturdetails. - Blockieren Sie die Simulation von Aktionen, die Befugnisse der Geschäftsleitung oder administrative Berechtigungen erfordern.
Mit realistischen Szenarien testen
Testen Sie Ihre Guardrail-Konfiguration vor der Bereitstellung mit:
- Normalen Gesprächsverläufen, um sicherzustellen, dass keine Fehlalarme auftreten
- Grenzfällen, die Sicherheitsgrenzen nahekommen, aber nicht überschreiten
- Adversarial Prompts, die versuchen, schädliche Antworten hervorzurufen
Häufig gestellte Fragen
Beeinflussen Guardrails die Latenz?
Bei benutzerdefinierten Guardrails und Content Guardrails verursacht der Streaming-Modus keine zusätzliche Latenz, aber die Antwort kann beginnen, bevor das Guardrail ausgelöst wird. Der Blocking-Modus wartet auf das Guardrail, bevor der Agent antwortet, was typischerweise eine Verzögerung von etwa 200–500 ms bedeutet. Retry fügt pro Versuch vollständige zusätzliche Generierungen (und erneute Auswertungen) hinzu, bis zu dreimal pro blockiertem Turn, und erhöht dadurch auch die nutzungsabhängigen Kosten.
Was ist der Unterschied zwischen dem Ausführungsmodus Streaming und Blocking?
Streaming verursacht keine zusätzliche Latenz, aber die Agent-Antwort kann beginnen, bevor das Guardrail
ausgelöst wird. Blocking wartet auf das Guardrail-Ergebnis, bevor der Agent antwortet (typischerweise
200–500 ms Verzögerung). Retry als Exit-Strategie (trigger_action) ist nur
im Blocking-Modus verfügbar; im Streaming-Modus verwenden Sie Anruf beenden, wenn ein Guardrail
ausgelöst wird. Blocking ermöglicht Retry mit eingefügtem System-Feedback, statt die
Unterhaltung sofort zu beenden – auf Kosten zusätzlicher Modellnutzung und zusätzlicher Abrechnung, wenn
Wiederholungen auftreten. Blocking wird für Text-Agenten empfohlen; Streaming wird für
Voice-Agenten empfohlen.
Kann ich Guardrails vollständig deaktivieren?
Ja, aber wir empfehlen dringend, alle Guardrails aktiviert zu lassen – insbesondere das Focus Guardrail. Sie schützen Ihre Marke, Ihre Nutzer und Ihre Compliance-Position und werden für alle Produktionsanwendungen empfohlen, einschließlich interner Tools. In seltenen Fällen möchten Sie möglicherweise ein bestimmtes Guardrail deaktivieren, wenn es den vorgesehenen Anwendungsfall Ihres Agenten beeinträchtigt. Einige Anwendungen können beispielsweise Themen behandeln, die das Content Guardrail andernfalls markieren würde, oder ein stark angepasster System-Prompt funktioniert möglicherweise nicht richtig, wenn das Focus Guardrail aktiviert ist. Jedes Guardrail kann einzeln aktiviert oder deaktiviert werden.
Können Nutzer gegen Guardrail-Entscheidungen Einspruch einlegen?
Guardrail-Auslösungen werden protokolliert und können in Ihrer Gesprächsanalyse geprüft werden. Wenn Sie Fehlalarme feststellen, passen Sie Ihre Guardrail-Prompts an. Es gibt keinen automatisierten Einspruchsprozess – der Nutzer sollte einfach eine neue Unterhaltung starten.
Wie erkenne ich, welches Guardrail ausgelöst wurde?
Informationen darüber, welches Guardrail ausgelöst wurde, finden Sie in Ihren Gesprächsprotokollen.
Sollte ich sowohl Guardrails als auch System-Prompt-Härtung verwenden?
Ja. Sie erfüllen sich ergänzende Zwecke. Die System-Prompt-Härtung gibt Verhaltensrichtlinien vor und verhindert die meisten Probleme durch das Befolgen von Anweisungen. Plattform-Guardrails sorgen als Sicherheitsnetz für eine unabhängige Durchsetzung. Beide zusammen schaffen eine mehrschichtige Absicherung.
Nächste Schritte
- Prompting-Leitfaden: Erfahren Sie, wie Sie effektive System-Prompts mit Verhaltens-Guardrails schreiben
- Datenschutz: Konfigurieren Sie Einstellungen für Datenaufbewahrung und Datenschutz
- Tests: Testen Sie Ihren Agenten mit verschiedenen Szenarien
- Unterhaltungen simulieren: Testen Sie Guardrail-Konfigurationen programmatisch
- Schwärzung des Gesprächsverlaufs: Schwärzen Sie sensible Informationen wie Namen und Bankdaten im Gesprächsverlauf
Release-Status
Guardrails befindet sich derzeit in der Alpha-Phase. Wir verbessern das Produkt aktiv und erweitern seine Funktionen. Sie können davon ausgehen, dass sich Funktionsumfang, Standardeinstellungen, Dashboard-Steuerelemente und API-Felder vor der allgemeinen Verfügbarkeit weiterentwickeln werden. Einige Änderungen können Breaking Changes sein.
Während wir Guardrails weiter verbessern, empfehlen wir, Ihr Setup zu validieren und das Guardrail-Verhalten in Ihren Protokollen zu überwachen. Wir empfehlen außerdem, Ihre Konfiguration bei Updates zu überprüfen.