Der falsche Kunde
Die ID eines anderen Kunden taucht im Gespräch auf, und der Agent handelt für dieses Konto statt für das angemeldete.
Ausführungskontrolle für KI-Agenten
Eine falsche Antwort lässt sich in der nächsten Nachricht korrigieren. Ein geänderter Datensatz, eine offengelegte Datei oder eine wiederholte Operation sind bereits geschehen. Phalanx sitzt zwischen Ihren KI-Agenten und Ihren Geschäftssystemen und lässt eine geschützte Aktion nur ausführen, wenn sie innerhalb der von Ihnen definierten Autorität liegt.
Keiner dieser Fälle braucht einen Angreifer. Jeder entsteht, wenn ein vernünftig wirkender Plan auf ein laufendes System trifft.
Die ID eines anderen Kunden taucht im Gespräch auf, und der Agent handelt für dieses Konto statt für das angemeldete.
Eine Antwort geht verloren, der Agent versucht es erneut, und die Operation läuft ein zweites Mal.
Der Agent liest einen Datensatz, jemand anders aktualisiert ihn, und der Agent schreibt den früher gesehenen Inhalt zurück.
Ein Fallverlauf geht an eine Adresse außerhalb des Unternehmens, weil jemand darum bat oder es hilfreich erschien.
Drei Tools bleiben jeweils innerhalb ihrer eigenen Grenze. Zusammen tun sie weit mehr, als die Aufgabe erlaubte.
Jeder Fall ist ein formal korrekter Tool-Aufruf. Genau deshalb kommt er durch.
Jede der folgenden Kontrollen ist nützlich. Keine wurde dafür gebaut, zu entscheiden, ob diese Aktion für diesen Kunden im aktuellen Zustand jetzt ausgeführt werden sollte.
| Wenn Sie sich verlassen auf | Es wurde entwickelt, um | Wo es nicht ausreicht |
|---|---|---|
| Prompt-Guardrails und Klassifikatoren | Zu beurteilen, ob Text schädlich wirkt | Alle fünf Szenarien wirken wie gewöhnliche, höfliche Tool-Aufrufe |
| API-Schlüssel mit begrenztem Umfang und Tool-Freigabelisten | Zu entscheiden, welche Tools ein Agent nutzen darf | Der Schlüssel weiß nicht, welcher Kunde angemeldet ist, ob sich der Datensatz geändert hat oder was andere Tools bereits getan haben |
| Prüfungen in jedem Tool-Handler | Durchzusetzen, was Sie für dieses Tool programmiert haben | Jedes Tool sieht nur sich selbst, und die Prüfung läuft im selben Prozess, der die Zugangsdaten besitzt |
| Eine Person, die jede Aktion genehmigt | Fehler durch Prüfung zu erkennen | Es funktioniert, bis die Menge die Prüfung zur Formalität macht, und nimmt dem Einsatz eines Agenten seinen Zweck |
Die eine Prüfung, die sich nicht überspringen lässt, ist die am Ausführungspunkt.
Besitzt der Agent Zugangsdaten, sind alle anderen Prüfungen nur Empfehlungen: Ein falscher Plan kann weiterhin ausgeführt werden. Phalanx verlagert die Zugangsdaten außerhalb der Reichweite des Agenten. Der Agent kann nur Vorschläge machen.
Phalanx prüft jeden Vorschlag anhand der authentifizierten Aufgabe, Ihrer Regeln, des aktuellen Zustands und der verbleibenden Grenzen. Nur eine einmal verwendbare Erlaubnis lässt einen geschützten Konnektor, die Komponente mit den Zugangsdaten, die Aktion ausführen. Anschließend zeichnet Phalanx auf, was geschehen ist, auch wenn das Ergebnis ungewiss bleibt.
| Szenario | Mit Phalanx im Ausführungsweg |
|---|---|
| Der falsche Kunde | Der Kunde kommt aus Ihrer Anmeldung, nicht aus dem Chat. Ein anderes Konto liegt daher außerhalb der Aufgabe, und die Aktion wird blockiert. |
| Dieselbe Aktion zweimal | Ein erneuter Versuch wird als dieselbe Operation erkannt. Eine verlorene Antwort wird abgeglichen, bevor etwas erneut gesendet wird. |
| Das veraltete Überschreiben | Die Zustandsprüfung des Vertrags erkennt die Änderung des Datensatzes und stoppt den Schreibzugriff. |
| Das falsche Ziel | Das Ziel ist für diese Aktion nicht genehmigt, daher wird keine Erlaubnis erteilt. |
| Jede Grenze eingehalten, die Gesamtgrenze überschritten | In einem konfigurierten gemeinsamen Workflow greifen alle beteiligten Tools auf ein Aufgabenbudget zu. Ein weiteres Tool bedeutet kein weiteres Kontingent. |
Ihre Regeln liegen außerhalb des Prompts und Ihre Zugangsdaten außerhalb des Agenten. Der Agent kann echte Arbeit erledigen, ohne die Schlüssel für beliebige Aktionen zu besitzen.
Welche Zugangsdaten existieren, wo sie liegen und was jede geschützte Aktion tun darf: eine Stelle zum Prüfen statt jedes einzelnen Prompts.
Ein signierter Nachweis zeigt, was vorgeschlagen, entschieden, ausgeführt und verifiziert wurde und was noch eine Person benötigt. Aktionen in HOLD warten auf die Betreiber.
Erkunden Sie Phalanx in Meridian, einer synthetischen Kundenplattform. Phalanx kontrolliert ausgewählte eingebundene Aktionspfade und zeichnet Entscheidungen, Ausführung und Ergebnisse auf. Fragen Sie den Support-Chatbot nach Ihrem Konto; die Antwort stammt aus einem geschützten Lesezugriff mit eigenem Beleg.
Phalanx 1.9 ist ein Produktionsrelease, dessen signierte Artefakte vor der Auslieferung qualifiziert wurden.
Läuft in Ihrer Infrastruktur, auf Linux mit Docker oder auf Render. Bereitstellung
Bringen Sie einen Workflow, die verwendeten Tools und die wichtigen Grenzen mit. Wir zeigen, wo Phalanx passt, was Ihre Architektur benötigt und was eine Evaluierung nachweisen sollte.