KI klingt nicht nur dann überzeugend, wenn sie recht hat. Gefährlich wird das, wenn eine Führungskraft die Antwort zur Entscheidung macht, bevor jemand ihre tragenden Aussagen geprüft hat. Dann bekommt ein Fehler aus dem Chat die Autorität der Geschäftsführung.
KI kann schwierige Sachverhalte erklären, Unterlagen strukturieren und auf menschliche Fehleinschätzungen hinweisen. Gerade außerhalb des eigenen Fachgebiets ist das nützlich. Führung muss deshalb nicht auf KI verzichten. Sie muss dafür sorgen, dass zwischen einer plausiblen Antwort und einer folgenreichen Entscheidung ein belastbarer Prüfweg liegt.
Eine Umfrage ist noch kein Beleg für Fehlentscheidungen
Den Anlass liefert eine Befragung im Auftrag von Adobe Acrobat: 3Gem befragte im April 2026 insgesamt 2.000 Erwachsene im Vereinigten Königreich. TechRadar berichtet, fast 75 Prozent der befragten C-Suite-Führungskräfte seien bereit, Arbeitsdokumente mit KI-Werkzeugen zu teilen; bei Beschäftigten ohne Führungsverantwortung seien es 20 Prozent. Golem greift diese Angaben unter Verweis auf TechRadar auf.
Auf der öffentlich zugänglichen Adobe-Seite fehlen diese Zahlen zu den Führungsgruppen. Auch die Größe der Untergruppen, die genauen Fragen und die Gewichtung lassen sich dort nicht prüfen. TechRadar wechselt zudem zwischen Bereitschaft zur Dokumentweitergabe und tatsächlicher KI-Nutzung. Das belegt weder vertrauliche Uploads noch ungeprüfte Managemententscheidungen. In einem Artikel über unbelegte KI-Schlüsse wäre es etwas peinlich, diese Grenze selbst wegzuhalluzinieren.
Auch sachlich sind zwei Fragen zu trennen: Darf ein Dokument an diesen Dienst gehen? Und trägt dessen Antwort eine Entscheidung? Die erste betrifft Datenschutz, Verträge, Datenklassifikation und technische Vertrauensgrenzen. Die zweite betrifft Evidenz und Verantwortung. Ein sauber betriebener interner KI-Dienst kann die Datenweitergabe beherrschbar machen. Eine fachlich falsche Antwort wird dadurch nicht richtig.
Wenn der Chat mit Chefstimme spricht
Führungskräfte müssen über Dinge entscheiden, die sie nicht bis ins letzte Detail beherrschen. KI kann ihnen Fachbegriffe erklären, Widersprüche zeigen und bessere Fragen vorbereiten. Ihre Aufgabe bleibt, zu erkennen, welche Aussagen eine Entscheidung tragen und wer diese belastbar prüfen oder bestreiten kann.
Die bequeme Abkürzung sieht anders aus: Die KI liefert in Sekunden eine schlüssig klingende Geschichte. Statt offene Fragen an die zuständigen Fachleute zurückzugeben, übernimmt die Führung sie als fertige Lagebeurteilung. Ungeprüft, aber jetzt mit der Autorität der Geschäftsführung.
Die Hierarchie macht eine Korrektur zusätzlich unangenehm. Hat die Geschäftsführung die Geschichte bereits übernommen, müssen Fachleute nicht nur eine fehlerhafte Analyse zerlegen. Sie müssen ihrem Vorgesetzten erklären, dass dessen vermeintlich fertige Entscheidungsgrundlage nicht trägt. Schlechte Nachrichten nach oben zu transportieren gehört bekanntlich zu den reibungslosesten Abläufen jeder Organisation.
Das macht Fachabteilungen, Berater oder Lieferanten nicht unfehlbar. Auch sie können irren, Interessen verfolgen oder gemeinsame blinde Flecken haben. KI kann solche Einschätzungen sinnvoll angreifen. Ihre Ausgabe gehört dann als prüfbare Gegenhypothese in die Diskussion, nicht als digitaler Kronzeuge für eine bereits gewünschte Entscheidung. „Welche Belege sprechen dagegen?“ ist eine Führungsfrage. „Die KI sagt aber etwas anderes“ ist noch keine.
Wenn ein CEO alle Entscheidungsvorschläge einer KI ungeprüft übernimmt, muss das Unternehmen irgendwann erklären, wofür es noch den CEO braucht.
Führung setzt Ziele und Grenzen, wägt widersprüchliche Einschätzungen ab und trägt die Folgen. Wer lediglich die am sichersten klingende Antwort weiterreicht, hat diese Arbeit nicht erledigt.
Realer Einzelfall: falsche Ursache, unbegründete Entwarnung
Einordnung: Der folgende Abschnitt beschreibt einen realen Einzelfall, der uns bekannt geworden ist und den wir nachträglich fachlich geprüft haben. Zum Schutz der Beteiligten lassen wir technische Identifikatoren, Produktbezüge und einzelne Ablaufdetails weg oder verallgemeinern sie. Die internen Grundlagen können wir nicht veröffentlichen; Leser können den konkreten Vorgang daher nur eingeschränkt unabhängig überprüfen. Der Fall dokumentiert einen Mechanismus, nicht dessen Verbreitung.
Eine Führungskraft ließ einen allgemein einsetzbaren externen KI-Dienst einen möglichen weiteren Sicherheitsvorfall auf einem extern erreichbaren System beurteilen. Der Dienst hatte privilegierten Zugriff auf Teile der Umgebung, handelte in diesem Fall aber nicht selbständig. Nach den uns vorliegenden Angaben waren weder der behauptete Schadcode noch die relevanten Logs für ihn zugänglich. Er konnte beides daher nicht selbst untersuchen.
Ein alter Vorfall beweist keinen neuen Eintrittsweg
In derselben Umgebung hatte es zuvor mindestens einen bestätigten Sicherheitsvorfall mit einem anderen bekannten Eintrittsweg gegeben. Er war bearbeitet worden, notwendige Nacharbeiten blieben aber bis zum späteren Verdachtsfall unerledigt. Das war ein reales Betriebs- und Sicherheitsproblem. Genauere Angaben zu Zeitraum, Eintrittsweg und ausstehenden Arbeiten lassen wir zum Schutz der Beteiligten weg.
Dem KI-Dienst lagen nach unserer Kenntnis auch Informationen zum älteren Vorfall vor. Seine Bewertung trennte jedoch nicht belastbar zwischen dem bestätigten früheren Zugriff, den offenen Nacharbeiten und dem neu behaupteten Angriff. Ob ein weiterer Sicherheitsvorfall stattgefunden hatte, ließ sich anhand der uns bekannten Informationen nicht klären. Der konkret behauptete Eintrittsweg war dagegen technisch ausgeschlossen.
Der Dienst führte den Vorfall auf eine bekannte Schwachstelle in einer Softwarekomponente zurück. Dabei vermischte er jedoch mindestens zwei öffentlich dokumentierte Schwachstellen mit unterschiedlichen technischen Wirkungen und Versionsgrenzen. Die von ihm angeführte Beschreibung belegte lediglich einen unberechtigten Lesezugriff. Die behauptete Möglichkeit, Dateien hochzuladen und Code auszuführen, gehörte zu einer anderen Schwachstelle. Die im Fall festgestellte Produktversion lag zudem außerhalb der veröffentlichten betroffenen Versionsbereiche.
Aus diesen unvereinbaren Angaben konstruierte der Dienst eine vollständige Angriffskette: Über die vermeintliche Schwachstelle sei eine Schadkomponente installiert worden, die weitere Konten, Dateien und clientseitigen Code erzeugt habe. Die Fachbegriffe waren real. Der daraus zusammengesetzte Ablauf war technisch nicht möglich.
Auch tatsächlich gesicherter Schadcode oder unautorisiert angelegte Konten hätten diese Erklärung nicht gerettet. Sie können eine Kompromittierung belegen, aber für sich genommen weder ihren Eintrittsweg noch einen neuen Zugriff statt fortbestehender Spuren des alten Vorfalls. Tauchen sie nur in der KI-Erklärung auf, sind sie überhaupt keine eigenständigen Beweise. Für eine Ursachenzuschreibung müssen technische Spuren und Chronologie zusammenpassen.
Die versäumten Nacharbeiten blieben ein reales Versäumnis. Sie machten die unmögliche Angriffskette nicht möglich. Dennoch wurde diese Ursachenbehauptung zur Grundlage eines Vorwurfs gegen die vorherige Bearbeitung.
Unbekannter Code, trotzdem Entwarnung
Der Dienst behauptete, sämtlichen Nutzern im relevanten Zeitraum sei Schadcode ausgeliefert worden. Zugleich räumte er ein, dessen konkrete Wirkung nicht bestimmen zu können: Der Code sei vor Abschluss einer Analyse gelöscht worden. Auch den Beginn des behaupteten Vorfalls kannte er nicht und verwies dafür auf eine noch erforderliche Auswertung der Zugriffsprotokolle. Diese Aussagen dokumentieren Erkenntnislücken. Sie belegen nicht, dass zuvor tatsächlich eine Teilanalyse stattgefunden hatte.
Trotzdem schloss der Dienst einen Datenabfluss aus, bewertete das Risiko für Nutzer als überschaubar und riet von öffentlicher Kommunikation ab. Nach Entfernung des Codes erklärte er neue Nutzer für vollständig geschützt. Gleichzeitig nannte er mehrere mögliche Funktionen des unbekannten Codes, darunter das Abfangen von Eingaben. Das passt nicht zum kategorischen Ausschluss eines Datenlecks.
Die fehlende Zugriffsmöglichkeit kennen wir aus den Umständen des Falls; die Antwort selbst belegt die ungeklärte Codewirkung und den unbekannten Zeitraum. Schon dieser Widerspruch zwischen eingeräumtem Nichtwissen und anschließender Entwarnung hätte eine Rückfrage auslösen müssen. Bezeichner und Strukturen können Ermittlungsansätze liefern, aber keine unbekannte Codewirkung oder vollständige Bereinigung nachweisen. Auch eine juristische Prüfung möglicher Melde- oder Informationspflichten war mit der Kommunikationsempfehlung nicht belegt.
Nach unserer Kenntnis übernahmen die Entscheidungsverantwortlichen diese Bewertung und ließen daraufhin technische Maßnahmen ausführen. Weitere Änderungen erschwerten die spätere Rekonstruktion. Maßnahmen zur Eindämmung können notwendig sein, bevor alle Fragen geklärt sind. Das rechtfertigt aber weder vermeidbaren Beweisverlust noch unzureichend protokollierte Eingriffe oder die Behandlung bloßer Annahmen als gesicherte Tatsachen.
Eine ungeprüfte Annahme trägt mehrere Entscheidungen
Fehlende Belege für einen Schaden sind keine Belege für Schadensfreiheit. Umgekehrt beweist die Lücke auch keinen Schaden. Verantwortliche müssen trotzdem handeln können: nach möglicher Schadenshöhe, plausiblen Szenarien und den Folgen einer Fehlreaktion. Dabei zählt auch, ob sich eine Maßnahme rückgängig machen lässt. Nichtwissen darf nur nicht als Entwarnung ausgegeben werden.
Nach unserer Kenntnis verwendeten die Entscheidungsverantwortlichen dieselbe ungeprüfte KI-Bewertung für die technische Untersuchung, die Einschätzung möglicher Betroffenheit und die Kommunikationsentscheidung. Diese Aufgaben laufen bei Vorfällen parallel und sind aufeinander angewiesen. Übernehmen alle dieselbe unbelegte Tatsachenannahme als geklärt, wird aus Abstimmung jedoch ein gemeinsamer Fehler.
Warum der Dienst so antwortete, bleibt offen. Fehler des Modells, fehlender oder gekürzter Kontext, Systemanweisungen und die Auswahl abgerufener Quellen kommen als Ursachen infrage. Ohne die nötigen Einblicke lässt sich das nicht entscheiden. Unsere fachliche Nachprüfung stellte dagegen konkrete Fehler fest: Die Angriffskette war technisch falsch zusammengesetzt, und für die Entwarnung fehlte die Grundlage.
Die KI hatte in diesem Fall weder die Kontrolle übernommen noch selbst entschieden. Menschen hatten ihre Bewertung übernommen. Dass die Führungskraft die technischen Aussagen nicht persönlich prüfen konnte, war nicht der Fehler. Der Fehler bestand darin, reale Versäumnisse, einen ungeklärten neuen Verdacht und eine technisch ausgeschlossene Ursachenbehauptung nicht unabhängig voneinander prüfen zu lassen.
Was auch ein besseres Modell nicht erledigt
Für absichtliche Täuschung gibt es in diesem Fall keinen Beleg. Der Titel meint die Verbindung aus erfundener technischer Erklärung, unberechtigter Sicherheit und menschlicher Freigabe. Nicht jeder Analysefehler ist eine Halluzination. Für den Entscheidungsprozess ist aber ausschlaggebend, ob die tragenden Aussagen stimmen — nicht, unter welchem Fehleretikett sie scheitern.
Was im Betrieb bekannt ist, weiß das Modell noch lange nicht
Ein Sprachmodell bringt gelerntes Allgemeinwissen mit. Den konkreten Betrieb kennt es aber nur, soweit entsprechende Informationen in sein Arbeitssystem gelangen: über Anweisungen, Unterlagen, Werkzeuge oder frühere Interaktionen. Zusagen, informelle Abhängigkeiten, technische Altlasten oder Erfahrungen mit einem Lieferanten können für Beschäftigte selbstverständlich sein und im verfügbaren Material vollständig fehlen.
Das Modell kann erkennbare Lücken markieren. Es kann nicht zuverlässig nach Wissen fragen, dessen Existenz aus dem Material gar nicht hervorgeht. Führung muss deshalb klären, wer noch gehört werden muss. Eine weitere Modellantwort ersetzt diesen fehlenden Betriebskontext nicht.
Viel Eingabe ist noch keine zuverlässige Auswertung
Ein großes Kontextfenster beschreibt zunächst die mögliche Eingabemenge. Es garantiert nicht, dass ein System alle enthaltenen Informationen zuverlässig findet, verknüpft und gewichtet. Lost in the Middle zeigte 2023 bei den untersuchten Modellen und Aufgaben deutliche Leistungseinbrüche, wenn relevante Informationen in der Mitte langer Eingaben lagen. RULER untersuchte 2024 siebzehn Long-Context-Modelle anhand synthetischer Aufgaben; bei fast allen sank die Leistung mit wachsender Kontextlänge stark.
Das sind keine Tests heutiger Modelle und kein Nachweis für die Fehlerursache im beschriebenen Fall. Sie zeigen aber, warum die beworbene Kontextgröße allein kein Qualitätsnachweis ist. Ein konkretes Arbeitssystem muss an seinen tatsächlichen Aufgaben geprüft werden: Findet es entscheidende Ausnahmen? Verknüpft es widersprüchliche Unterlagen korrekt? Bleiben Gegenbelege in der Zusammenfassung erhalten?
Dazu kommen unterschiedliche Verarbeitungsschritte: Retrieval wählt Dokumentausschnitte aus, Kürzung entfernt Verlauf, Verdichtung fasst ihn zusammen. Dabei können jeweils andere Informationen verloren gehen. Eine überzeugende Zusammenfassung beweist deshalb nicht, dass die entscheidenden Primärunterlagen vollständig berücksichtigt wurden.
Verantwortung lässt sich nicht ins Modell verschieben
Wer eine Personalmaßnahme freigibt, einen Sicherheitsvorfall bewertet, einen Vertrag kündigt oder eine öffentliche Aussage autorisiert, muss diese Entscheidung vertreten. Welche Person oder welches Organ im Einzelfall haftet, hängt vom rechtlichen und organisatorischen Rahmen ab. Das Sprachmodell übernimmt diese Haftung nicht und legt auch nicht anstelle der Führung gegenüber Beschäftigten, Kunden oder Aufsicht Rechenschaft ab.
Das gilt auch bei menschlicher Beratung: Expertise unterstützt die Entscheidung, sie nimmt der Führung nicht jede Verantwortung ab. Wie aufwendig geprüft werden muss, hängt von Tragweite, Unsicherheit und Reversibilität ab. Eine Personalmaßnahme, eine Incident-Entwarnung oder eine Vertragskündigung braucht einen anderen Prüfweg als ein interner Formulierungsvorschlag.
Vier Prüfungen vor der Entscheidung
- Auftrag begrenzen: Soll die KI zusammenfassen, recherchieren oder Gegenhypothesen liefern? Welche Tatsachen müssen vor einer Freigabe am Primärmaterial geprüft sein?
- Aussagen prüfen: Was ist belegt, was angenommen, was offen? Quellen müssen die konkrete Behauptung tragen. Ein Link oder eine zweite KI-Antwort genügt nicht.
- Widerspruch ermöglichen: Wer bringt fehlenden Betriebskontext ein, prüft Gegenbelege und darf eine Entscheidung eskalieren? Ein zweiter Prüfer ist nicht schon deshalb unabhängig, weil er eine andere Person oder ein anderes Modell ist. Entscheidend sind sein Prüfweg und seine Möglichkeit, der ersten Bewertung tatsächlich zu widersprechen.
- Entscheidung festhalten: Wer gibt welche Maßnahme frei, auf welcher Grundlage und mit welchen offenen Risiken? Technische, rechtliche und kommunikative Zuständigkeiten müssen benannt sein. Bei Entscheidungen unter Unsicherheit gehört dazu, wann und aufgrund welcher neuen Erkenntnisse sie überprüft werden.
Die Unterschrift bleibt menschlich
In „Automatisierter Müll ist auch ein Sicherheitsproblem“ ging es um schlechte KI-Sicherheitsberichte, die Fachleuten Arbeit aufladen. Hier verschärft die Hierarchie das Problem: Eine ungeprüfte Analyse wird zur Vorgabe, an der sich andere abarbeiten müssen.
KI kann Führung entlasten und Fachleute auf Fehler stoßen. Gerade jenseits der eigenen Fachkenntnis ist sie nützlich, wenn ihre Antworten zu besseren Fragen führen. Die entscheidenden Aussagen zu prüfen, fehlenden Betriebskontext einzubeziehen und Widerspruch zu ermöglichen bleibt Führungsarbeit.
Wer diese Arbeit überspringt, hat Verantwortung nicht automatisiert. Er hat einer Halluzination Zeichnungsbefugnis erteilt.
Quellen
- Adobe Acrobat: The Rise of AI Documents in the Workplace
- Golem: Führungskräfte nutzen KI trotz Sicherheitsrisiken
- TechRadar: New study finds bosses are far more comfortable sharing work documents with AI
- Lost in the Middle: How Language Models Use Long Contexts
- RULER: What’s the Real Context Size of Your Long-Context Language Models?