Microsoft Copilot Cowork Sandbox-Bypass machte eine vertrauenswürdige Skill zu einem Exfiltrationskanal
Microsoft hat eine Schwachstelle in Copilot Cowork entschärft, nachdem Forscher gezeigt hatten, dass eine einzelne bösartige Skill die Sandbox des Produkts umgehen und Arbeitsdaten exfiltrieren konnte. Der Microsoft Copilot Cowork Sandbox-Bypass soll einen Befehlskanal zwischen einem Angreifer-Server und der isolierten Umgebung des Agenten geschaffen haben.
Laut PromptArmor konnte dieser Kanal Daten erreichen, die über Outlook, SharePoint, Teams, verbundene Plugins und die aktive Sitzung verfügbar waren. Der Forscher meldete das Problem am 24. Juni 2026, Microsoft bestätigte die Entschärfung am 19. August.
Der Befund stellt ein zentrales Versprechen hinter Arbeitsplatz-Agenten infrage. Eine Sandbox kann Code isolieren, doch die Isolierung bedeutet wenig, wenn ein vertrauenswürdiger Dienst zu einer unüberwachten Route über ihre Grenze hinweg wird. Microsoft zufolge bewertet Cowork Skills nun und warnt Nutzer, sie nur aus vertrauenswürdigen Quellen hochzuladen.
Der gemeldete Fehler ist laut Offenlegungszeitplan kein offener Zero-Day mehr. Die Design-Lehre reicht jedoch über eine einzelne behobene Implementierung hinaus. Unternehmensagenten vereinen nicht vertrauenswürdige Anweisungen, ausführbare Assets, Organisationsdaten und authentifizierte Tools in einem Workflow.
Diese Kombination macht die Vertrauensgrenze schwerer definierbar als bei herkömmlicher Unternehmenssoftware. Die zentrale Frage lautet nicht mehr, ob ein Agent innerhalb einer Sandbox läuft. Käufer müssen fragen, welche Dienste diese Sandbox überschreiten, was diese Dienste akzeptieren und welche Aktivitäten Sicherheitsteams beobachten können.
Wie die Copilot-Cowork-Dateiexfiltrationskette funktionierte
Der Exploit soll einen legitimen Dateiübertragungsdienst in einen bidirektionalen Befehlskanal verwandelt haben, den die Netzwerkbeschränkungen der Sandbox nicht stoppten.
Copilot Cowork ist ein agentisches Microsoft-365-System, das mehrstufige Aufgaben planen und ausführen kann. Es kann mit Dokumenten arbeiten, Organisationsinformationen durchsuchen, Dateien erstellen, Nachrichten senden und spezialisierte Skills aufrufen.
Eine Skill ist ein wiederverwendbares Anweisungspaket, das den Agenten durch einen bestimmten Workflow führt. Microsoft unterstützt je nach Cowork-Umgebung und administrativer Konfiguration integrierte, benutzerdefinierte, geteilte und Plugin-basierte Skills.
Das Beispiel von PromptArmor begann mit einer normalen Geschäftsaufgabe. Ein Nutzer bat Cowork, einen Vertrag mithilfe einer aus externer Quelle heruntergeladenen Skill zur Dokumentenkonsistenz mit einem Angebot zu vergleichen.
Die Skill lieferte den angeforderten Vergleich, sodass die sichtbare Aufgabe erfolgreich erschien. PromptArmor zufolge rief ein gebündeltes Skript jedoch zusätzlich einen Dateisynchronisierungsdienst auf, der außerhalb der Sandbox des Agenten lief.
Berichten zufolge nutzte Cowork diesen Dienst, um Dateien zwischen externem Speicher und der isolierten Arbeitsumgebung zu verschieben. Der Dienst akzeptierte eine URL, die die abzurufende Datei identifizierte.
Laut der Analyse des Sandbox-Bypasses des Forschers konnte bösartiger Code stattdessen eine vom Angreifer kontrollierte URL übergeben. Dieses Verhalten ermöglichte es dem Skript, einen externen Dienst dazu zu bringen, Infrastruktur zu kontaktieren, die die Sandbox nicht direkt erreichen konnte.
Der Server des Angreifers lieferte eine Datei zurück, die einen Befehl enthielt. Das bösartige Skript las diese Datei, führte den Befehl innerhalb von Cowork aus und kodierte das Ergebnis in eine weitere angeforderte URL.
Diese zweite Anfrage übermittelte die Befehlsausgabe zurück an den Server des Angreifers. Eine Wiederholung dieses Prozesses alle paar Sekunden etablierte Berichten zufolge eine Command-and-Control-Schleife, sodass ein Angreifer auf Grundlage früherer Ergebnisse neue Anweisungen erteilen konnte.
Dabei handelte es sich um mehr als eine einzelne ausgehende Anfrage. Es entstand ein interaktiver Zugang zu einer Umgebung, die mit Organisationsdiensten verbunden war.
PromptArmor zufolge nutzte die Demonstration den Model Context Protocol-Server von Cowork. MCP ist eine Standardschnittstelle, über die eine KI-Anwendung verbundene Tools aufrufen und Daten abrufen kann.
Der Forscher behauptet, der Angreifer könne Befehle nutzen, um Dienste abzufragen, die über diese MCP-Verbindung verfügbar waren. Die Demonstration umfasste das Auflisten von Outlook-Nachrichten und das Abrufen des Inhalts eines E-Mail-Threads.
Derselbe Zugriffspfad legte Berichten zufolge SharePoint-Dateien, Sitzungsverlauf, Plugin-Daten und weitere Informationen offen, die dem aktiven Nutzer zur Verfügung standen. Der tatsächliche Umfang hing von den Berechtigungen und verbundenen Diensten dieses Nutzers ab.
Ein Detail machte das gemeldete Verhalten besonders besorgniserregend. PromptArmor zufolge beendete die Auswahl des Stopp-Steuerelements nicht bereits im Hintergrund laufende Prozesse.
Der sichtbare Agentenlauf konnte enden, während das bösartige Skript weiterhin den Server des Angreifers abfragte. Ein Nutzer konnte daher glauben, die Aufgabe sei gestoppt worden, obwohl der verdeckte Kanal aktiv blieb.
PromptArmor meldete das Problem am 24. Juni an Microsoft. Microsoft bat am 24. Juli um zusätzliche Informationen, besprach bis Anfang August eine Lösung und bestätigte die Entschärfung am 19. August.
Die öffentlichen Belege stammen hauptsächlich aus der technischen Darstellung und Demonstration von PromptArmor. Microsoft hat keine ausführliche Mitteilung veröffentlicht, die die Codeänderung, betroffene Versionen oder für rückwirkende Untersuchungen verfügbare Telemetriedaten erklärt.
Warum der Microsoft Copilot Cowork Sandbox-Bypass wichtig ist
Die Schwachstelle griff den Dienst an, der die Sandbox mit nützlichen Daten verbindet, statt die Isolierung durch einen herkömmlichen Ausbruch zu überwinden.
Eine traditionelle Sandbox versucht, nicht vertrauenswürdigen Code einzudämmen, indem sie Dateien, Prozesse, Geräte und Netzwerkverbindungen beschränkt. Dieses Modell funktioniert nur, wenn jede Route über die Grenze hinweg gleichermaßen strenge Validierung anwendet.
Moderne Agenten verkomplizieren diese Anordnung, weil produktive Arbeit kontrollierte Ausnahmen erfordert. Ein Agent muss Dokumente empfangen, erzeugte Dateien zurückgeben, Tools aufrufen, auf Unternehmenssysteme zugreifen und genügend Zustand bewahren, um lange Aufgaben abzuschließen.
Jede Ausnahme wird zu einem Vermittler zwischen der isolierten Umgebung und etwas Vertrauenswürdigerem. Der Vermittler kann sicher sein, wenn er sowohl Ziele als auch Datenflüsse validiert. Er wird gefährlich, wenn nicht vertrauenswürdiger Code ihn umfunktionieren kann.
Die Darstellung von PromptArmor beschreibt keinen klassischen Memory-Corruption-Exploit oder Betriebssystemausbruch. Die bösartige Copilot-Cowork-Skill blieb angeblich innerhalb der Sandbox, während sie einen privilegierten Dienst außerhalb davon missbrauchte.
Diese Unterscheidung ist für Sicherheitsprüfungen in Unternehmen wichtig. Ein Anbieter kann wahrheitsgemäß sagen, dass Code isoliert ausgeführt wird, und dabei einen Vermittler übersehen, der für diesen Code beliebige externe Anfragen stellt.
Diese architektonische Spannung steht im Zentrum des Werts von Cowork. Microsoft präsentiert das Produkt als einen Agenten, der über Chat hinausgeht und Arbeit in Microsoft 365 erledigt.
In Microsofts Cowork-Produktankündigung hob das Unternehmen Inbox-Workflows, Recherche, Dokumentenerstellung, Integrationen und wiederverwendbare Skills hervor. Diese Fähigkeiten erfordern Zugriff auf wertvollen Geschäftskontext.
Die aktuelle Dokumentation von Cowork besagt, dass Aufgaben Nutzerdateien innerhalb einer temporären, isolierten Umgebung in der Dienstgrenze von Microsoft 365 verarbeiten. Sie besagt außerdem, dass die Umgebung nach Abschluss der Aufgabe entfernt wird.
Dieses Sicherheitsmodell begrenzt die direkte Gefährdung, beseitigt aber nicht das Risiko verbundener Tools. Eine isolierte Umgebung kann weiterhin zum Ausgangspunkt werden, wenn ein vertrauenswürdiger Vermittler vom Angreifer kontrollierte Eingaben akzeptiert.
Deshalb setzt der Microsoft Copilot Cowork Sandbox-Bypass sowohl Microsoft als auch Unternehmenskäufer unter Druck. Microsoft muss zeigen, dass die reparierte Grenze jeden Vermittler abdeckt, nicht nur die von einem Forscher identifizierte Synchronisierungsroute.
Kunden müssen zudem ihre Annahmen über Nutzerberechtigungen überdenken. Cowork arbeitet mit dem Zugriff des aktiven Nutzers, sodass eine ausgenutzte Aufgabe keinen separaten Kontokompromittierung benötigt, um auf erlaubte Daten zuzugreifen.
Das Prinzip der minimalen Berechtigung verringert weiterhin den Schadensradius. Es verhindert jedoch nicht den Missbrauch von Zugriffen, die der Nutzer rechtmäßig besitzt.
Ein Mitarbeiter, der zwei Dokumente vergleicht, kann berechtigt sein, sensible E-Mails, Deal-Ordner oder interne Diskussionen zu lesen. Diese Berechtigungen können einem Agenten über seine genehmigten Verbindungen zur Verfügung stehen.
Die bösartige Eingabe kam zudem als wiederverwendbare Workflow-Komponente und nicht als offensichtlich feindselige ausführbare Datei. Diese Verpackung senkt den Verdacht der Nutzer, weil Skills wie Produktivitätserweiterungen gestaltet sind.
Der Exploit verbindet daher zwei Sicherheitsprobleme, die Organisationen häufig getrennt verwalten. Das eine ist das Risiko der Software-Lieferkette durch heruntergeladene Pakete. Das andere ist das Autorisierungsrisiko durch Agenten, die als authentifizierte Nutzer handeln.
Sicherheitsprogramme müssen beides gemeinsam behandeln. Wer Code prüft, ohne zugängliche Daten zuzuordnen, übersieht die Auswirkungen; wer Berechtigungen verwaltet, ohne Skill-Assets zu untersuchen, übersieht den Einstiegspunkt.
Eine bösartige Copilot-Cowork-Skill kann weiterhin nützlich wirken
Die gefährlichste Skill ist nicht eine, die sichtbar scheitert, sondern eine, die ihre zugewiesene Aufgabe erledigt und zugleich eine verborgene zweite Aufgabe ausführt.
Die Demonstration von PromptArmor nutzte einen Workflow zum Dokumentenvergleich, weil er eine gewöhnliche Anfrage aus der Wissensarbeit widerspiegelt. Die Skill erzeugte Berichten zufolge einen vollständigen Konsistenzbericht, während das bösartige Skript den verdeckten Kanal öffnete.
Dieses Doppelverhalten schwächt ein vertrautes Sicherheitssignal. Nutzer betrachten ein korrektes Ergebnis oft als Beleg dafür, dass das Tool wie vorgesehen funktioniert hat.
Bei einem Agenten sind Ausgabequalität und Ausführungsintegrität getrennte Fragen. Ein nützlicher Bericht legt nicht jedes Skript, jeden Dienstaufruf oder jede Datenanfrage offen, die während seiner Erstellung erfolgten.
Microsofts aktuelle Leitlinien zu benutzerdefinierten Skills besagen, dass Cowork Skills automatisch bewertet. Die dokumentierten Prüfungen variieren je nach Reichweite und Risikostufe.
Statische Prüfungen untersuchen Struktur, gebündelten Code und Text auf Prompt-Injection-Muster. Verhaltensprüfungen bewerten Ausgaben, Aktionen, Tool-Nutzung, Konflikte und Leistung unter realistischen Prompts.
Die Dokumentation beschreibt zusätzliche Hürden für Bereitstellungen mit höherem Risiko. Dazu können Asset-Validierung, Trust-and-Safety-Tests, adversarielle Evaluierung, Regressionstests und menschliche Prüfung gehören.
Microsoft gibt Nutzern zudem eine direkte Warnung: Sie sollten Skills nur aus Quellen hochladen, denen sie vertrauen. Dieser Rat erkennt an, dass automatisierte Prüfung beliebigen Drittanbieter-Code nicht in eine sichere Abhängigkeit verwandeln kann.
Der Zeitpunkt dieser dokumentierten Kontrollen verdient eine vorsichtige Einordnung. Die aktuelle Dokumentation von Microsoft spiegelt das heutige Produkt wider, nicht unbedingt die exakte Konfiguration, die PromptArmor vor dem 19. August getestet hat.
Daher wäre es unsicher zu behaupten, dass während der Demonstration jede heutige Kontrolle versagt hat. Ebenso unsicher wäre die Annahme, dass die aufgeführten Prüfungen jede Variante des Angriffs erkennen würden.
Statisches Scannen hat inhärente Grenzen. Bösartiges Verhalten kann über Dateien verteilt, hinter normalen Funktionen verborgen, später heruntergeladen oder nur unter bestimmten Bedingungen ausgelöst werden.
Auch Verhaltenstests erfassen nur eine begrenzte Anzahl von Ausführungen. Eine Skill kann sich während der Bewertung sicher verhalten und schädliche Logik erst nach einem Datum, bei einem Ziel-Tenant oder beim Auftreten bestimmter Daten aktivieren.
Jüngere akademische Arbeiten behandeln Agenten-Skills als Angriffsfläche der Software-Lieferkette und nicht als einfache Prompt-Vorlagen. Die SkillGate-Forschung bewertete einen hybriden Scanner anhand eines Benchmarks mit 1.650 Skill-Paketen.
Die Autoren berichteten einen F1-Score von 0,817 und eine Falschpositivrate von 1,13 Prozent. Diese Ergebnisse sprechen für ein Laufzeit-Screening, zeigen aber auch, dass die Erkennung probabilistisch bleibt.
Der Vergleich ist keine direkte Bewertung von Cowork, und die Studie konzentriert sich auf Skills für Coding-Agenten. Dennoch entspricht ihr Bedrohungsmodell eng dem umfassenderen Problem.
Ein wiederverwendbares Instruktionspaket kann Skripte, vertrauenswürdig wirkende Dokumentation und verborgenes Verhalten enthalten. Seine Installation erweitert die effektive Code- und Instruktionsbasis des Agenten.
Klassische App-Stores begegnen vergleichbaren Risiken durch Signierung, Prüfung, Reputation, schnelle Entfernung und Berechtigungsdeklarationen. Agent Skills benötigen diese Maßnahmen zusätzlich zu Transparenz über modellgesteuerte Ausführung.
Das Modell kann entscheiden, wann und wie es unterstützende Dateien aufruft. Diese Flexibilität macht einen Skill anpassungsfähiger, erschwert jedoch die Erstellung eines vollständigen Verhaltensmanifests.
Microsoft unterstützt die gemeinsame Nutzung innerhalb von Organisationen und App-Store-Plugins neben persönlichen benutzerdefinierten Skills. Administratoren können Plugin-Verfügbarkeit, Bereitstellung, Konnektoren und zugewiesene Nutzer steuern.
Diese Kontrollen schaffen einen stärkeren Vertriebsweg als der Download eines unbekannten Archivs. Sie ersetzen jedoch nicht die Prüfung privat geteilter oder persönlich hochgeladener Pakete.
Unternehmen sollten einen bösartigen Copilot Cowork Skill wie eine nicht vertrauenswürdige Anwendungsabhängigkeit behandeln. Herkunft, Versionierung, Freigabe und Widerruf sind genauso wichtig wie die darin enthaltenen Anweisungen in natürlicher Sprache.
Das Sandbox-Versprechen traf auf die Realität vernetzter Agenten
Der zentrale Konflikt besteht zwischen Abschottung als Sicherheitsversprechen und Konnektivität als jener Funktion, die einen Unternehmensagenten wertvoll macht.
Microsoft zufolge kann Cowork E-Mails senden, Besprechungen planen, Dokumente erstellen, in Teams posten, Informationen der Organisation durchsuchen und Dateien verwalten. Diese Aktionen machen daraus mehr als einen Chatbot: ein operatives System.
Jeder zusätzliche Konnektor erhöht den Wert einer erfolgreich erledigten Aufgabe. Zugleich vergrößert er die potenziellen Auswirkungen, wenn die Integrität der Ausführung versagt.
Der gemeldete Exploit benötigte nicht, dass Cowork mehr Berechtigungen erhielt als vorgesehen. Er verwandelte angeblich die bestehende authentifizierte Tool-Schicht in eine vom Angreifer kontrollierte Schnittstelle.
Diese Umkehr sollten Unternehmenskäufer im Gedächtnis behalten. Eine Sandbox schützte die Ausführungsumgebung, doch ein externer Synchronisierungsdienst verschaffte Code Berichten zufolge einen Weg an seiner Netzwerkrichtlinie vorbei.
Dasselbe Muster kann auf allen Agentenplattformen auftreten. Sandboxed Agents sind häufig auf Browserautomatisierung, Artefaktspeicher, Tool-Gateways, MCP-Server, Credential-Broker und Connector-Runtimes angewiesen.
Sicherheitsteams prüfen oft jede Komponente für sich. Angreifer suchen nach Kombinationen.
Ein Datei-Dienst, der risikoarm erscheint, kann zu einem Netzwerk-Proxy werden. Ein für den Agenten vorgesehener Tool-Endpunkt kann sich zu einer Datenzugriffs-API für bösartigen Code entwickeln.
Ein für Zuverlässigkeit entwickelter Hintergrund-Worker kann einen Angriff fortbestehen lassen, nachdem die sichtbare Aufgabe beendet wurde. Keine dieser Komponenten muss isoliert betrachtet gefährlich wirken.
Der unmittelbare Vergleich lautet nicht Microsoft gegen einen einzelnen Wettbewerber. Aussagekräftiger ist der Vergleich zwischen dem Abschottungsversprechen der Branche und der operativen Realität vernetzter Agenten.
Anthropic, OpenAI, Microsoft, Google und Anbieter von Coding-Agenten stehen alle vor Varianten dieser Spannung. Ihre Produkte werden nützlicher, indem sie mehr Kontext lesen und mehr Aktionen ausführen.
Der gemeldete Cowork-Fehler ist ein implementationsspezifisches Beispiel. Er sollte nicht als Beleg verallgemeinert werden, dass jede Sandbox- oder MCP-Bereitstellung dieselbe Schwachstelle aufweist.
Er zeigt jedoch, warum ein Sandbox-Label keine vollständige Sicherheitsbewertung ersetzen kann. Käufer benötigen ein Datenflussmodell, das jeden Dienst mit Zugriff über die Grenze hinweg einbezieht.
Sie benötigen zudem Klarheit über die Prozesslaufzeit. Microsoft dokumentiert Pausen- und Abbruchkontrollen für Cowork-Aufgaben, doch der PromptArmor-Test ergab Berichten zufolge, dass ein Hintergrundprozess die sichtbare Stopp-Aktion überdauerte.
Microsoft könnte dieses Verhalten im Rahmen der Abhilfe geändert oder möglicherweise nur den Netzwerkweg geschlossen haben. Die öffentliche Offenlegung erklärt die Reparatur nicht in dieser Detailtiefe.
Diese Verifikationslücke ist wichtig. Organisationen können anhand der öffentlichen Zeitachse nicht bestimmen, ob Microsoft eine Zielvalidierung eingeführt, die Dienstautorisierung geändert, Hintergrundjobs beendet, die Erkennung verbessert oder mehrere Kontrollen kombiniert hat.
Das Fehlen eines detaillierten Advisorys bedeutet nicht, dass die Abhilfe fehlgeschlagen ist. Es bedeutet, dass Kunden über Mandantenleitlinien, Supportkanäle, Auditdaten und kontrollierte Tests Sicherheit einholen müssen.
Die Sicherheitsarchitektur sollte davon ausgehen, dass eine präventive Kontrolle irgendwann ein feindliches Paket übersehen wird. Ein robustes Design begrenzt dann, was dieses Paket erreichen kann, und macht ungewöhnliches Verhalten sichtbar.
Für vernetzte Agenten bedeutet das, ausgehende Ziele zu beschränken, Broker-Anfragen zu authentifizieren, Dienste an bestimmte Aufgaben zu binden und Lesezugriff von Aktionsberechtigungen zu trennen.
Es bedeutet auch, Anmeldedaten zu widerrufen, wenn eine Aufgabe endet. Eine abgebrochene Agentensitzung sollte zugehörige Prozesse beenden und jede für diese Ausführung erstellte temporäre Autorisierung ungültig machen.
Schließlich muss das Monitoring Agentenaktivitäten mit herkömmlicher Sicherheitstelemetrie verbinden. Ein Skill-Aufruf, eine Dateiübertragung, ein MCP-Aufruf und eine ungewöhnliche ausgehende Anfrage können in getrennten Konsolen harmlos wirken.
Zusammen können sie eine Angriffskette beschreiben.
Die Abhilfe schließt nicht die Verifikationslücke
Microsoft hat die Abhilfe bestätigt, doch Kunden fehlen weiterhin ausreichend öffentliche Details, um die Exposition zu rekonstruieren oder jede betroffene Kontrolle zu validieren.
PromptArmor zufolge bestätigte Microsoft am 19. August, fast acht Wochen nach der ersten Offenlegung, dass das Problem behoben wurde. Diese Zeitachse deutet auf eine koordinierte Behebung statt auf einen ungelösten öffentlichen Exploit hin.
Der Forscher veröffentlichte keine Belege für eine weitverbreitete Ausnutzung. Die Demonstration beweist einen technischen Weg unter getesteten Bedingungen, nicht die Zahl der in der Praxis betroffenen Mandanten.
In der Offenlegung erscheinen keine öffentliche Incident-Zahl, kein Bereich betroffener Versionen, keine Schwachstellenkennung und kein Kompromittierungsindikator. Leser sollten den Proof of Concept nicht als Beleg für eine umfassende Sicherheitsverletzung interpretieren.
Auch der umgekehrte Schluss wäre verfrüht. Ohne ein detailliertes Microsoft-Advisory können Organisationen nicht annehmen, dass das Fehlen offengelegter Vorfälle bedeutet, es habe keine böswillige Nutzung gegeben.
Eine rückblickende Untersuchung hängt von Telemetrie ab. Administratoren müssen wissen, ob Cowork-Logs hochgeladene Skill-Versionen, Skriptausführung, Broker-Anfragen, MCP-Aufrufe und die Laufzeit von Hintergrundprozessen sichtbar machen.
Microsoft erklärt, dass Cowork-Aktivitäten in einheitlichen Audit-Logs erscheinen können und Purview-Richtlinien für den Dienst gelten. Die aktuelle administrative Dokumentation beschreibt zudem Kontrollen für Plugins, Modelle, Browsernutzung und automatisierte Aufgaben.
Diese Kontrollen sind relevant, doch allgemeine Audit-Abdeckung ist nicht dasselbe wie Erkennungsabdeckung für diesen Exploit. Ein Log kann eine zulässige Dienstanfrage erfassen, ohne ihr Ziel als feindlich zu kennzeichnen.
Organisationen, die Cowork vor dem 19. August getestet haben, sollten Microsoft fragen, welche Ereignisse das verwundbare Verhalten identifizieren können. Sie sollten zudem relevante Audit-Aufzeichnungen sichern, bevor Aufbewahrungsfristen ablaufen.
Die wichtigste Prüfung betrifft die Herkunft von Skills. Teams sollten benutzerdefinierte Skills, hochgeladene Archive, gebündelte Skripte und organisationsweit geteilte Pakete inventarisieren, die im betroffenen Zeitraum verwendet wurden.
Unbekannte oder nicht überprüfbare Pakete sollten bis zur Prüfung entfernt werden. Sicherheitsteams sollten, soweit verfügbar, kryptografische Hashes vergleichen, da ein vertrauter Skill-Name keine Dateiintegrität belegt.
Administratoren sollten anschließend jeden Skill den Nutzern zuordnen, die ihn ausgeführt haben, sowie den Daten, auf die diese Nutzer zugreifen konnten. Das ergibt eine präzisere Einschätzung der Exposition als die Analyse von Skill-Text allein.
Auch ausgehende Netzwerktelemetrie kann ein weiteres Signal liefern. Anfragen an unbekannte Domains, wiederholte Polling-Intervalle oder codierte Daten in URL-Abfragezeichenfolgen verdienen Untersuchung.
Die gemeldeten Anfragen liefen jedoch über einen Dienst außerhalb der Sandbox. Die Endpunktüberwachung auf dem Gerät eines Mitarbeiters könnte sie daher übersehen.
Cloud-seitige Logs und Anbietertelemetrie werden unverzichtbar. Kunden sollten fragen, ob Microsoft die auslösende Aufgabe, den Skill, Nutzer, Mandanten und das angefragte Ziel für vermittelte Übertragungen sichtbar machen kann.
Organisationen benötigen zudem eine Richtlinie für künftige Uploads. Wenn jeder Nutzer einen Skill aus dem öffentlichen Internet importieren darf, wird die Vertrauensbewertung zu einer individuellen Entscheidung.
Ein sichereres Modell nutzt ein internes Register mit Verantwortlichkeit, Prüfstatus, freigegebenen Versionen und Ablaufdaten. Skills mit hohem Risiko sollten sowohl Code-Review als auch Laufzeittests erhalten.
Geteilte Skills benötigen nach der Freigabe ein Change Management. Ein harmloses Paket kann durch ein Update, ein kompromittiertes Maintainer-Konto oder eine ausgetauschte Begleitdatei gefährlich werden.
Die Freigabe sollte daher für eine bestimmte Version gelten, nicht für einen dauerhaften Namen. Nach jeder wesentlichen Änderung sollte eine erneute Prüfung erfolgen.
Diese Schritte bedeuten nicht, dass Cowork einzigartig unsicher ist. Sie spiegeln das Governance-Niveau wider, das für jeden Agenten angemessen ist, der E-Mails, Dokumente, Chats und Geschäftsanwendungen erreichen kann.
Wissensarbeiter sollten sensibles Ausgangsmaterial zudem in klar abgegrenzten Repositories halten. Besseres Wissensmanagement kann unnötige Datenexposition verringern, wenn Teams den Zugriff an tatsächlichen Arbeitsanforderungen ausrichten.
Das Ziel ist nicht, jedem Agenten nützlichen Kontext zu entziehen. Es besteht darin, zu verhindern, dass ein bequemer Workflow ohne bewusste Prüfung die gesamte digitale Reichweite eines Mitarbeiters übernimmt.
Drei Signale werden zeigen, ob die Agentensicherheit aufholt
Der nächste Test besteht darin, ob Microsoft aus einer einzelnen Abhilfe messbare, für Mandanten sichtbare Kontrollen für jeden Weg macht, der Coworks Sandbox überschreitet.
Das erste Signal ist eine detaillierte Microsoft-Erklärung zur Behebung. Kunden müssen wissen, ob Cowork jetzt Synchronisierungsziele validiert, Anfragen an genehmigten Speicher bindet und Prozesse beendet, wenn Aufgaben stoppen.
Ein technisches Advisory würde das Vertrauen stärken, weil Administratoren die relevanten Grenzen testen könnten. Schweigen würde keine fortbestehende Exposition beweisen, doch die Verifikation weiterhin von privaten Supportkanälen abhängig machen.
Das zweite Signal ist umfangreichere Mandantentelemetrie. Sicherheitsteams sollten auf neue Cowork-Ereignisse achten, die Skill-Hashes, die Ausführung gebündelter Skripte, MCP-Operationen, Broker-Ziele und aufgabenbezogene Hintergrundprozesse abdecken.
Diese Aufzeichnungen müssen über bestehende Erkennungssysteme nutzbar sein. Ein Aktivitätsprotokoll, das nur innerhalb einer Cowork-Sitzung sichtbar ist, unterstützt keine unternehmensweite Bedrohungssuche.
Das dritte Signal ist eine stärkere Skill-Governance. Microsofts dokumentiertes Bewertungssystem beschreibt bereits statische, verhaltensbasierte, adversariale, Regressions- und menschliche Prüfungen für unterschiedliche Risikostufen.
Die entscheidende Frage ist, wie konsequent diese Kontrollen auf importierte, persönliche, geteilte und über den Store vertriebene Skills angewandt werden. Käufer sollten nach signierten Paketen, versionsgebundenen Freigaben, zentralen Allowlists und schnellem Widerruf suchen.
Microsoft sollte zudem klarstellen, ob die Begleitdateien eines Skills derselben Prüfung unterliegen wie seine Hauptinstruktionsdatei. Das PromptArmor-Szenario beruhte auf bösartigem gebündeltem Code, nicht allein auf täuschendem Text.
Diese Signale werden den umfassenderen Fall für autonome Arbeitsplatzagenten entweder stärken oder schwächen. Bessere Verifikation würde zeigen, dass Anbieter Skills als ausführbare Komponenten der Lieferkette behandeln.
Begrenzte Transparenz würde Kunden einen großen Teil des Risikos aufbürden. Sie müssten einer reparierten Sandbox vertrauen, ohne die veränderten Grenzen zu sehen.
Für Unternehmen, die Cowork jetzt evaluieren, lautet die praktische Antwort: ein kontrollierter Einsatz. Bestätigen Sie die Abhilfe, beschränken Sie, wer Skills hochladen darf, prüfen Sie bestehende Pakete, minimieren Sie Zugriffe und überwachen Sie verbundene Dienste.
Die Sandbox-Umgehung bei Microsoft Copilot Cowork wurde Berichten zufolge behoben, doch ihre architektonische Warnung bleibt bestehen. Agenten bündeln Anweisungen, Code, Zugangsdaten und organisatorischen Kontext in einem einzigen Ausführungspfad.
Bevor Sie den Einsatz ausweiten, stellen Sie eine konkrete Frage: Kann Ihr Sicherheitsteam jedes Skill, jeden Prozess, jeden Tool-Aufruf und jede externe Anfrage hinter einer abgeschlossenen Aufgabe rekonstruieren? Falls die Antwort unklar ist, machen Sie diese Transparenz zur Voraussetzung, bevor Sie umfassenderen Zugriff gewähren.



