Hinweis
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, sich anzumelden oder das Verzeichnis zu wechseln.
Für den Zugriff auf diese Seite ist eine Autorisierung erforderlich. Sie können versuchen, das Verzeichnis zu wechseln.
Sicherheitsforscher wiesen 2025 auf MCP-Rug-Pull-Angriffe in Agentennetzwerken hin: Wenn die Definition eines Tools auf einem MCP-Server nach der ursprünglichen Freigabe stillschweigend geändert wird, kann ein Agent das Tool in dem Glauben aufrufen, es sei sicher, obwohl das Tool nun bösartiges Verhalten zeigt. Beispielsweise könnte ein vertrauenswürdiges Tool wie "send_slack_message" später geändert werden, um Datenexfiltration durchzuführen oder nicht autorisierte Aktionen ohne Erkennung auszuführen. Da Agents die Toolintegrität nicht erneut überprüfen, werden die schädlichen Aktionen unter dem Radar ausgeführt. Solche Forschungsergebnisse trieben die Entwicklung von MCP-Sicherheitsgateways voran, um Änderungen an Tools zu überwachen und schädliche Inhalte zu filtern. Dieses Szenario ist nicht nur theoretisch: Im April 2025 warnte Microsofts KI-Sicherheitsteam vor genau diesen „domänenübergreifenden Prompt-Injection“-Exploits in agentenbasierten Systemen und implementierte Gegenmaßnahmen (Prompt Shields und Lieferkettenprüfungen), um die eigenen Azure AI-Dienste zu schützen.
Was geschieht in diesem Szenario?
Bei einem Rug-Pull-Angriff gerät ein böswilliger KI-Agent oder ein böswilliges KI-Tool in einem Ökosystem mit mehreren Agents „außer Kontrolle”, nachdem ihm zunächst vertraut wurde. Beispiel:
Ein Unternehmen richtet ein System ein, bei dem der KI-Assistent (Agent A) eines Benutzers einen zentralen MCP-Server (Model Context Protocol) abfragt, um einen speziellen Service-Agent für eine Aufgabe zu finden (z. B. Das Abrufen von Wetterdaten).
Ein Angreifer registriert oder kompromittiert einen Service-Agent (Agent B) auf dieser Plattform. Wenn Agent A nach Wetterinformationen fragt, leitet das MCP-Verzeichnis unwissentlich die Anforderung an bösartige Agent B weiter.
Der böswillige Agent sendet dann entitätsübergreifende Anweisungen (eine Form der Eingabeaufforderungseinfügung) zurück an Agent A und weist ihn an, schädliche Aktionen unter dem Vordruck einer gültigen Antwort auszuführen.
Im Wesentlichen zieht der Angreifer dem Vertrauensverhältnis den Boden unter den Füßen weg und nutzt dabei aus, dass Agent A den Antworten aus dem MCP-Netzwerk vertraut. Dies kann zu nicht autorisierten Datenexposition oder unbeabsichtigten Befehlen führen, die von Agent A ausgeführt werden.
Warum diese Technik effektiv ist
Es nutzt implizites Vertrauen und fehlende Verifizierung in der Agent-zu-Agent-Kommunikation aus, und dasselbe Vertrauensversagen kann sich auch auf Agent-zu-Tool- und Agent-zu-Daten-Interaktionen erstrecken. In vielen Agentnetzwerken werden die Ausgaben eines Agents, eines Tools oder einer Grundlagendatenquelle nach deren Genehmigung nicht fortlaufend erneut überprüft. Angreifer nutzen dies, indem sie entweder die Identität eines legitimen Dienstes annehmen, einen einmal legitimen Agent oder ein Tool kompromittieren oder Daten bearbeiten, die der Agent als autoritativ behandelt.
Da Agents in der Regel Anweisungen von ihren Peers akzeptieren, verbundene Tools, API-Antworten, abgerufene Dokumente, Speichereinträge oder Erdungsdaten ohne menschliche Aufsicht akzeptieren, kann ein böswilliger Agent, ein Tool oder eine vergiftete Datenquelle Direktiven einfügen, die glaubwürdig erscheinen. Wenn Agent A Schlussfolgerungen ziehen oder auf Daten zugreifen kann, könnte er vertrauliche Informationen an einen feindlichen Agenten weitergeben, ein kompromittiertes Tool aufrufen, sich auf manipulierte Daten verlassen oder Anweisungen ausführen, im Glauben, diese seien Teil des normalen Betriebs.
Kurz gesagt gelingt der Angriff durch den Missbrauch des Vertrauens und der mangelnden fortlaufenden Überprüfung in einem Agentennetzwerk.
Empfohlene Steuerelemente
Ein tiefgehender Verteidigungsansatz ist entscheidend. Zu den wichtigsten Maßnahmen zählen:
Starke Agent-Identität und Autorisierung: Implementieren Sie robuste Authentifizierung und Role-Based Access Control (RBAC) für jeden Agent oder Tool. Jeder Agent, Tools oder Plug-In sollte über eine überprüfte Identität und Berechtigungen verfügen, die auf seine Rolle beschränkt sind. Fordern Sie beispielsweise an, dass Service-Agents ihre Funktionen deklarieren und sicherstellen, dass Agent A nur Antworten akzeptiert, die dem erwarteten Format oder der erwarteten Quelle entsprechen.
Lieferkettenüberprüfung für Agenten und Tools: Behandeln Sie jeden Agenten, Tool, Plug-In, MCP-Server und Datenkonnektor als Teil der KI-Lieferkette. Überprüfen und genehmigen Sie die Agents und Tools, mit denen Ihr System kommuniziert, bevor Sie eine Vertrauensstellung einrichten, einschließlich Besitz, Quelle, Signatur, Versionsintegrität, Berechtigungen und erwartetes Verhalten.
MCP-Serverschutz und -überwachung: Verbessern Sie den zentralen Koordinationsserver mit Sicherheitskontrollen. Der MCP sollte Antworten von Agenten mithilfe von Prompt-Überwachung oder Anomalieerkennung auf schädliche Muster (z. B. unerwartete Anweisungen) überprüfen. Verdächtige agentenübergreifende Anweisungen sollten blockiert oder zur Überprüfung markiert werden.
Richtlinien zur Datenkennzeichnung und -freigabe: Nutzen Sie die Datenklassifizierung (z. B. Vertraulichkeitsbezeichnungen über DLP-Lösungen), damit selbst dann, wenn Agent A Daten abruft, klar ist, was weitergegeben werden darf. Kontextbasierten Zugriff erzwingen – Agents sollten nur Daten abrufen oder verbreiten, die für die Berechtigungen der anfordernden Entität geeignet sind.
Sandboxing der Agentenkommunikation: Gestalten Sie Agenteninteraktionen so, dass sie eingeschränkt sind. Verbieten Sie z. B. frei formulierte Agent-zu-Agent-Anweisungen, wenn möglich, oder fordern Sie eine Vermittlungsschicht, die Inhalte entfernt oder validiert. Verwenden Sie Positivlisten für genehmigte Agentantworten oder -formate.
KI-Protokollierung und forensische Überwachung: Erfassen Sie detaillierte Protokolle von Inter-Agent-Nachrichten und -Aktionen. Senden Sie diese Protokolle an ein SIEM-System (Security Information and Event Management) zur Echtzeitanalyse (zur Erkennung von Anomalien) und Untersuchungen nach dem Vorfall.
Blockieren und Eskalieren kritischer Anomalien: Kritische oder besonders vertrauenswürdige Anomalien sollten nicht nur protokolliert oder gekennzeichnet werden. Sie sollten die vorgeschlagene Aktion automatisch blockieren und sie vor der Ausführung zur Prüfung und Genehmigung an eine autorisierte Person, einen Richtlinien-Workflow oder eine Warteschlange für Sicherheitsvorgänge eskalieren.
Zu berücksichtigende Technologien
Dies allein löst kein einziges Tool; Ein mehrschichtiger Ansatz ist erforderlich. Mögliche Komponenten sind:
MCP-Gateway mit Sicherheitsfiltern: Verwenden Sie bei Verwendung eines MCP oder einer ähnlichen Agent-Orchestrierung ein Gateway, das Richtlinien erzwingen kann (z. B. nur bekannte, sichere Agent-Antworten zulassen). Microsofts Forschung zu KI-„Prompt Shields“ ist ein Beispiel für aufkommende Technologien, mit denen sich schädliche agentenübergreifende Prompts erkennen und neutralisieren lassen.
Agentverwaltung: Verwenden Sie Microsoft Agent 365, um Agents in der gesamten Umgebung zu ermitteln, zu inventarisieren, zu steuern und zu überwachen, um sicherzustellen, dass nur genehmigte Agents und Agent-zu-Tool-Interaktionen zulässig und kontinuierlich überprüft werden.
Identitäts- und Zugriffsverwaltung: Microsoft Entra oder ähnliche IAM-Lösungen, um RBAC zu erzwingen und Agents oder Plugins zu authentifizieren.
Datenbezeichnungen & DLP : Tools wie Microsoft Purview zum Klassifizieren und Schützen vertraulicher Daten und sicherstellen, dass Agents Datenfreigaberichtlinien einhalten.Sicherheitsüberwachung: SIEM-Lösungen wie Microsoft Sentinel oder gleichwertig für das Aggregieren von Agentprotokollen und erkennen ungewöhnliche Aktivitäten oder Richtlinienverletzungen in Agentinteraktionen.
Endpunkt- und Anwendungsschutz: Herkömmliche Maßnahmen (Firewalls, Endpunktschutz, Netzwerksegmentierung), um potenzielle Auswirkungen zu begrenzen, wenn sich ein Agent fehlverhält.
Zuordnung zu den OWASP Top 10
OWASP Top 10 für LLM und generative KI (2025)
Dieses Szenario lässt sich LLM01: Prompt Injection zuordnen (vom Angreifer konstruierte Eingaben, die das Modell zur Nutzung bösartiger Werkzeuge verleiten), LLM03: Lieferkette (Ausnutzung kompromittierter oder nicht vertrauenswürdiger Werkzeuge, Plug-ins oder externer Abhängigkeiten), LLM06: Übermäßige Handlungsfreiheit (das Modell delegiert schädliche Aktionen an überprivilegierte Werkzeuge), LLM07: Offenlegung von System-Prompts (Prompt-Muster, die interne Anweisungen offenlegen oder manipulieren, um den Austausch auszulösen), und LLM08: Vektor- und Einbettungsschwächen (vergiftete Retrieval-Ergebnisse oder manipulierte Einbettungen, die das Modell in Richtung des betrügerischen „Rug-Pull“-Endpunkts lenken).
MITRE ATLAS-Zuordnung
Ein vertrauenswürdiger Agent oder ein vertrauenswürdiges Werkzeug wird nach der Freigabe unbemerkt verändert, sodass der betroffene Agent bösartige agentenübergreifende Anweisungen ausführt, als wären sie legitim. MITRE ATLAS definiert derzeit keine dedizierte „Rug-Pull“-Technik, daher handelt es sich hierbei um die am besten passende Zuordnung. Sie lässt sich der Kompromittierung der Lieferkette, dem Missbrauch von Agent-Tools und der indirekten Prompt-Injection zuordnen.
MITRE ATLAS-Techniken (Angriff): Der Angriff spiegelt in erster Linie den Kompromittierung von Lieferketten und angreiferhaften Eingabemissbrauch wider: Ein vertrauenswürdiger Agent, ein Tool, eine Registrierung oder eine Datenquelle wird nach der Genehmigung geändert oder missbraucht, was dazu führt, dass der Opferagent böswillige Anweisungen als legitim akzeptiert.
- AML.T0010 Kompromittierung der KI-Lieferkette (insb. .005 KI-Agenten-Tool)
- AML.T0051.001 LLM Prompt Injection
- AML. T0053 KI-Agent-Aufruf
- AML.T0110 KI-Agenten-Tool-Vergiftung
MITRE ATLAS Mitigations (Defense): Priorisieren Sie die Überprüfung der Lieferkette, komponentenüberprüfung, Eingabefilterung, Sandkastenausführung, Verhaltensüberwachung und Eskalation für kritische Anomalien.
- AML.M0005 / AML.M0019 Zugriff auf KI-Modelle und Daten kontrollieren (im Ruhezustand / im Produktivbetrieb)
- AML.M0013 Code Signing
- AML.M0014 KI-Artefakte überprüfen
- AML.M0020 Leitplanken für generative KI
- AML.M0023 AI Bill of Materials
- AML.M0024 KI-Telemetrieprotokollierung