Zum Inhalt springen

Wer nicht weiß, was das System kann, entscheidet nicht

Drei Entscheidungen bestimmen den betrieblichen Nutzen von KI: welche Prozesse automatisiert werden, zu welchem Zeitpunkt und mit welchem Qualitätsanspruch. Alle drei verlangen von Führungskräften ein klares Verständnis davon, wie diese Systeme arbeiten.

Bei der Recherche zu diesem Text spuckte mir ein KI-System einen juristischen Quellennachweis aus: Aufsatz, Fachzeitschrift, Jahrgang, Autor. Der Autor verstarb 2023, der Aufsatz existiert schlichtweg nicht. Formal war alles makellos, inhaltlich frei erfunden. Wer so ein Zitat ungeprüft in einen Vermerk übernimmt, merkt den Fehler erst beim Nachschlagen in der Bibliothek.

Genau um dieses Gespür geht es. Man muss dafür nicht programmieren können. Man muss einem Ergebnis ansehen, was es taugt, und daraus ableiten, wo der Einsatz überhaupt Sinn ergibt.

Welche Bereiche. Wer hier nur an Prioritäten denkt, verfehlt die Kernfrage: Es geht um Eignung. Sprachliche Aufgaben mit Spielraum funktionieren verlässlich, etwa Rohfassungen, Zusammenfassungen oder die Vorsortierung. Vorhaben mit strikter Fehlerfreiheit, bei denen die Endkontrolle teurer ausfällt als die manuelle Bearbeitung, scheitern. Wer diese Grenze übersieht, entscheidet nach Vorzeigbarkeit. Das Ergebnis sind Projekte, die sich leicht vorführen lassen, aber im Betrieb wirkungslos bleiben.

Was solche Fehlentscheidungen kosten, zeigt der meistzitierte Branchenbericht, sobald man ihn unverfälscht liest. Die Initiative Project NANDA am MIT Media Lab untersuchte von Januar bis Juni 2025 über 300 öffentlich dokumentierte Vorhaben, führte Gespräche in 52 Organisationen und befragte 153 Führungskräfte. Bei maßgeschneiderten Spezialwerkzeugen schafften es 20 Prozent der geprüften Vorhaben in den Pilotbetrieb und ganze 5 Prozent in den Produktivbetrieb. Aus der Pilotphase erreichte folglich nur jedes vierte Vorhaben den Regelbetrieb. Bei generischen Chatbots lag diese Quote dagegen bei rund 83 Prozent. Dieselbe Grundlagentechnik lieferte die dreifache Erfolgsquote, vorentschieden allein durch den Werkzeugtyp.

Bekanntheit erlangte vor allem eine Schlagzeile: „95 Prozent aller KI-Piloten scheitern". Die Zahl stammt aus demselben Datenbestand, erfasst aber lediglich eine selbstberichtete Wirkung sechs Monate nach dem Pilotbetrieb. Eine geprüfte Ertragsrechnung liefert sie nicht. Dem Bericht fehlt eine wissenschaftliche Begutachtung, die Initiative empfiehlt im Fazit ihre eigene Infrastruktur, und an der ursprünglichen Webadresse ist das Papier nicht mehr frei abrufbar. Wer diese Zahl ungeprüft zitiert, begeht genau das Versäumnis, vor dem hier gewarnt wird.

Zur Aussagekraft dieser Daten: Sie belegen den massiven Einfluss des Werkzeugtyps. Sie belegen nicht, dass mangelnde Führungskompetenz die Ursache des Scheiterns ist. Das behauptet der Bericht auch an keiner Stelle. Als Haupthürden nennt er Arbeitsabläufe, Lernfähigkeit und Organisationsstrukturen. Darauf kommt es an: Werkzeugauswahl, Einführungszeitpunkt und Qualitätsmaßstäbe bestimmt die Leitungsebene. An exakt diesen Schrauben entscheidet sich der statistische Erfolg.

Zu welchem Zeitpunkt. Diese Weichenstellung verbrennt schnell viel Geld. Wer zu früh einsteigt, baut Abläufe auf Fähigkeiten auf, die den Systemen noch fehlen, und reißt das Ganze nach zwölf Monaten wieder ab. Wer zu spät handelt, verliert den Anschluss an Wettbewerber, die den Umbau bereits hinter sich haben. Die Prognose, was die Technik in einem Jahr leisten wird, lässt sich nicht nach unten wegdelegieren. Daran hängen harte Budgetentscheidungen, und die gehören nach oben.

In welcher Qualität. Der heikelste Punkt. Ein Sprachmodell kalkuliert Wahrscheinlichkeiten. Seine Ausgabe ist eine statistische Verteilung, deren Ränder man kennen muss. Dass diese Systeme Fehler produzieren, steht fest. Die eigentliche Frage lautet: Welche Fehlerquote verträgt der jeweilige Prozess, und was kostet ein einzelner Ausreißer? Bei der Bewerbervorauswahl wiegt ein Fehlschluss völlig anders als in der Finanzbuchhaltung. Diese Abwägung bleibt eine unternehmerische Geschäftsentscheidung. Sie setzt voraus, dass man versteht, wie Fehler entstehen, ob sie rein zufällig auftreten oder gezielt bestimmte Fallgruppen benachteiligen.

Der gängigste Einwand lautet: Ein Vorstand bucht schließlich auch keine Bilanz eigenhändig. Das stimmt, spricht aber für die Gegenseite. Ein Vorstand bucht nicht selbst, doch er muss einen Jahresabschluss lückenlos lesen können. Genau diese Urteilskraft verlangt der KI-Einsatz. Führungskräfte müssen keine Modelle trainieren. Sie müssen deren Ergebnisse prüfen können wie ein Zahlenwerk: Erkennen, was belegt ist, wo Lücken klaffen und an welchen Stellen reine Schätzungen stehen. Wer dazu fachlich außerstande ist, winkt Vorlagen blind durch. Die Strategie diktiert dann der Verfasser der Beschlussvorlage, und häufig ist das der Anbieter der Software.

Wie dünn diese Urteilsfähigkeit in der Praxis ist, zeigt eine Deloitte-Erhebung von Anfang 2025 unter 695 Aufsichtsrats- und Vorstandsmitgliedern in 56 Ländern. Zwei Drittel räumen ein, dass ihr Gremium nur über begrenzte oder gar keine KI-Kenntnisse verfügt. In Deutschland waren es 59 Prozent, bezogen allerdings auf lediglich 49 Befragte. Strukturierte KI-Weiterbildungen für ihre Führungsgremien bieten 48 Prozent der Unternehmen an.

Die Gegenposition klingt juristisch beruhigend. Eine führende US-Kanzlei für Gesellschaftsrecht stellte im Mai 2026 fest, Organmitglieder müssten keineswegs zwingend eigene Fachexpertise aufbauen oder jedes Werkzeug persönlich freigeben; sie dürften sich auf Management und Fachleute stützen. Doch die Einschränkungen folgen auf dem Fuß: Gefordert werden ein klarer Überblick über die kritischen Kernwerkzeuge, die betroffenen Arbeitsabläufe sowie funktionierende Melde- und Eskalationswege. Um überhaupt festzulegen, welche Systeme als kritisch einzustufen sind, braucht die Führung bereits ein fundiertes eigenes Urteil. Die Bedingung verlangt exakt das Wissen ab, von dem der Leitsatz scheinbar entlastet. Zudem zielt diese Stellungnahme auf Aufsichtsorgane nach US-Recht ab. Sie hilft den Kontrolleuren, über die Pflichten der operativen Leitung sagt sie nichts.

Rechtlich lässt sich daraus kein Hebel schmieden, und man sollte es auch nicht versuchen. Artikel 4 der KI-Verordnung forderte ab Februar 2025 ein ausreichendes Maß an KI-Kompetenz. Seit dem 27. Juli 2026 begnügt sich die Vorschrift mit Maßnahmen zur Kompetenzförderung. Ein festgelegtes Fachwissen bestimmter Einzelpersonen ist ausdrücklich nicht mehr vorgeschrieben; Adressat der Pflicht bleibt die Organisation als Anbieter oder Betreiber.

Maßgeblich bleibt die Zuständigkeit. Den Entschluss über das Ob des KI-Einsatzes wertet die juristische Fachkommentierung als Leitungsentscheidung, die die Geschäftsleitung wegen ihrer Gesamtverantwortung für die Geschäftspolitik eigenhändig treffen muss. Delegieren lässt sich die operative Ausführung, der Grundsatzbeschluss verbleibt an der Spitze.

An dieser Stelle verweisen viele gern auf die Business Judgement Rule: Wer sich auf Fachberater stützt und das Vorgehen protokolliert, sei haftungsrechtlich abgesichert. Das stimmt, blendet aber eine entscheidende Voraussetzung aus: Der Schutz greift nur bei einer angemessenen Informationsgrundlage. Ob eine Unterlage diesen Anspruch erfüllt, muss der Entscheider eigenständig beurteilen können. Wer Berichte mangels Sachverstand nicht prüfen kann, besitzt keine Rechtssicherheit. Er verlässt sich auf das Prinzip Hoffnung.

Die nötigen Schritte sind pragmatischer, als viele vermuten. Für die Bilanzprüfung gibt es Ausbildungsstandards und Wirtschaftsprüfer, die für ihr Urteil geradestehen. Bei KI-Systemen fehlen solche Sicherheiten vollständig. Urteilsfähigkeit wächst hier ausschließlich durch eigene Anschauung.

Erstens: Regelmäßig selbst mit den Systemen arbeiten, über deren Einsatz man entscheidet. Anhand realer Aufgaben, deren Resultate man fachlich selbst einschätzen kann, fernab geschönter Vertriebsvorführungen. Das sichert eine fundierte Urteilsbasis. Zweitens: Gezielt nach Schwachstellen suchen, statt sich an funktionierenden Beispielen zu berauschen. Die Belastbarkeit einer Technik zeigt sich an ihren Bruchstellen. Drittens: Von jedem Anbieter verbindlich beantworten lassen, an welchen Kriterien man das Scheitern seiner Software im Betrieb eindeutig erkennen würde. Wer darauf keine präzise Antwort geben kann, will nur verkaufen.

Das hat nichts mit operativer Kleinarbeit zu tun und macht weder Fachabteilungen noch Beratung überflüssig. Es ist die Stichprobe, um das eigene Urteil zu eichen. Nach jedem Modellwechsel muss sie wiederholt werden, damit der Wissensstand nicht veraltet. Wer darauf verzichtet, trifft Grundsatzentscheidungen über Automatisierung, Zeitpläne und Qualitätsgrenzen auf fremde Rechnung. Genau darin liegt die Trennlinie zwischen einer tragfähigen Strategie und einer Ansammlung zielloser Pilotprojekte, die niemand stoppt, weil niemand die Kriterien für deren Scheitern kennt.