IDC-Ergebnisse stellen Resultate von KI-Projekten unter die Kontrolle der CIOs
IDC-Forschung hat eine Google-News-Debatte über das Scheitern von KI-Projekten ausgelöst; eine Schlagzeile behauptet, dass 45 % der Projekte keine Ergebnisse liefern.
Die zugrunde liegenden Daten verlangen eine sorgfältigere Lesart. Mit IDC verbundene Forschung besagt, dass im Durchschnitt nur 45 % der KI-Initiativen messbare Ergebnisse erzielen. Je nachdem, wie Unternehmen Erfolg definieren, deutet dieses Ergebnis auf eine größere Wertlücke hin, als die Schlagzeile vermuten lässt.
Die Unterscheidung ist wichtig, weil CIOs nicht länger daran gemessen werden, wie viele KI-Piloten sie starten. Vorstände erwarten nun messbare Erträge, sichere Implementierungen und Governance, die autonome Agenten nach ihrem Eintritt in den Produktivbetrieb kontrollieren kann.
Darin liegt der eigentliche Konflikt hinter der Schlagzeile. Unternehmensverantwortliche wollen KI-Systeme, die mehr Arbeit mit größerer Autonomie erledigen. Doch genau diese Autonomie erschwert es, Kosten, Entscheidungen, Berechtigungen und Fehler einzugrenzen.
IDC beschreibt daher mehr als einen weiteren enttäuschenden Technologiezyklus. Das Unternehmen dokumentiert eine Verantwortungsverlagerung von experimentellen KI-Teams zu CIOs, die Geschäftsergebnisse und operative Risiken vertreten müssen.
Was die IDC-Behauptung in Google News tatsächlich aussagt
Die berichtete Zahl von 45 % misst Initiativen mit messbaren Ergebnissen, nicht eine universelle Misserfolgsquote für jedes KI-Projekt in Unternehmen.
Die ursprüngliche Google-News-Schlagzeile stellt 45 % der KI-Projekte als erfolglos dar. Begleitmaterial mit Bezug zu IDC präsentiert die Statistik jedoch anders.
Eine Fujitsu-Analyse verweist auf IDCs Technology Investment and Innovation Monitor vom September 2025. Demnach erzielen weltweit durchschnittlich 45 % der KI-Initiativen messbare Ergebnisse.
Laut Fujitsus Verweis umfasste die Forschung 894 Befragte. Zudem erzielten nur 11 % der Unternehmen bei mehr als drei Vierteln ihrer KI-Projekte Erfolg.
Diese Messgrößen belegen nicht, dass exakt 45 % gescheitert sind. Sie zeigen, dass 45 % messbare Ergebnisse erzielten, während für 55 % nach dem Messansatz der Umfrage kein nachgewiesenes Ergebnis vorlag.
Diese Lücke kann mehrere Zustände umfassen. Ein Projekt kann sich noch in der Testphase befinden, ohne messbaren Nutzen in den Produktivbetrieb gelangen, sein ursprüngliches Ziel verfehlen oder nicht genügend Daten für eine Bewertung liefern.
Das sind unterschiedliche Ergebnisse. Sie zu einer einzigen Misserfolgsquote zusammenzufassen, schafft zwar eine eingängigere Schlagzeile, aber ein weniger präzises Bild der Unternehmensleistung.
Die verfügbaren Belege beweisen auch nicht, dass die zugrunde liegenden KI-Modelle jedes schwache Ergebnis verursacht haben. Geschäftliche Akzeptanz, Workflow-Design, Datenqualität, Betriebskosten und unklare Kennzahlen können jeweils verhindern, dass Wert realisiert wird.
Diese Unterscheidung trennt technisches von organisatorischem Scheitern. Ein Modell kann akzeptable Ergebnisse erzeugen, während das umgebende Projekt sein Geschäftsziel dennoch verfehlt.
Ein interner Assistent kann beispielsweise Mitarbeiterfragen korrekt beantworten. Wirtschaftlich scheitert er trotzdem, wenn Beschäftigte ihn meiden, Antworten zu langsam eintreffen oder die Supportkosten die Einsparungen übersteigen.
Auch ein Prognosemodell kann in kontrollierten Tests gut abschneiden. Es liefert wenig Wert, wenn Führungskräfte weiterhin Entscheidungen über einen älteren Prozess treffen, der seine Empfehlungen ignoriert.
IDCs umfassendere Forschung stützt diese Interpretation. Das Unternehmen erklärt, dass Organisationen Schwierigkeiten haben, Experimente mit messbaren Geschäftsergebnissen zu verbinden – insbesondere wenn nie Ausgangskennzahlen definiert wurden.
Deshalb verdient die Schlagzeile Prüfung, ohne verworfen zu werden. Der genaue Prozentsatz bleibt von Definitionen abhängig, doch das zugrunde liegende Wertproblem ist gut belegt.
Andere Forschung weist in dieselbe Richtung. Die CIO.com-Umfrage von 2026 ergab, dass nur 19 % der Befragten angaben, ihre KI-Initiativen hätten die Geschäftsziele erreicht oder übertroffen.
Die Studie State of the CIO umfasste 662 IT-Führungskräfte und 249 Geschäftsanwender. Sie ergab, dass 18 % berichteten, bei weniger als einem Drittel ihrer Anwendungsfälle die Erwartungen erfüllt zu haben.
Die Studien verwenden unterschiedliche Stichproben und Definitionen, weshalb ihre Prozentsätze nicht als direkte Vergleiche behandelt werden sollten. Gemeinsam zeigen sie, dass messbarer Unternehmenswert weiterhin selten ist.
Die verantwortungsvolle Schlussfolgerung ist enger gefasst als die virale Behauptung. Viele Organisationen können für die meisten KI-Initiativen keine konsistenten Erträge nachweisen, und CIOs müssen nun erklären, warum.
Diese Schlussfolgerung ist ernst genug, ohne die Zahl zu überdehnen.
KI-Experimente weichen einem ROI-Mandat
Die zentrale Veränderung ist nicht das nachlassende Interesse an KI. Es ist das Ende der Finanzierung von Experimenten ohne klar definierte Verantwortliche, Ausgangswerte und Geschäftsergebnisse.
Investitionen in Unternehmens-KI setzen sich fort, obwohl Erträge schwer nachzuweisen bleiben. Dieser scheinbare Widerspruch spiegelt eher Wettbewerbsdruck als Vertrauen in jedes einzelne Projekt wider.
Vorstände befürchten, dass geringere Investitionen ihre Unternehmen zurückfallen lassen. Zugleich wollen sie von CIOs sehen, dass bestehende Ausgaben Umsatz, Kosten, Kundenservice, Resilienz oder Entscheidungsgeschwindigkeit verbessern.
Das schafft einen engeren Handlungsspielraum für Technologieführungskräfte. Sie müssen die Dynamik der Einführung aufrechterhalten und zugleich Projekte beenden, die ihre operative Belastung nicht rechtfertigen können.
IDC berichtet, dass 42 % der Organisationen den ROI digitaler und KI-Investitionen nur schwer oder gar nicht bewerten können. Das Unternehmen nennt inkonsistente Ausgangswerte und begrenzte langfristige Transparenz als wesentliche Hindernisse.
Sein Framework für agentischen ROI argumentiert, dass agentische Systeme diese Probleme verschärfen. Ihr Wert und ihre Kosten verändern sich mit der Entwicklung von Workflows, Modellen und Nutzungsmustern.
Herkömmliche Software stützt oft einen relativ stabilen Business Case. Käufer schätzen vor der Implementierung Kosten, Lizenzbedarf, erwartete Nutzerzahl und Prozesseinsparungen.
Agentische KI verhält sich anders. Ein Agent ist Software, die Schritte planen, Tools einsetzen und mit begrenztem menschlichem Eingreifen Maßnahmen zur Erreichung eines Ziels ausführen kann.
Seine Betriebskosten können je nach Modellaufrufen, Kontextgröße, Tool-Nutzung, Wiederholungsversuchen und menschlichen Prüfungen variieren. Seine Leistung kann sich zudem verändern, wenn sich Geschäftsbedingungen oder Quelldaten ändern.
Ein erfolgreicher Pilot liefert daher nur unvollständige Belege. Der Pilot kann kuratierte Daten, eine kleine Nutzergruppe und intensive technische Betreuung nutzen, die Produktionsteams nicht dauerhaft aufrechterhalten können.
Bei einer breiten Einführung trifft dasselbe System auf uneinheitliche Eingaben, Zugriffsbeschränkungen, seltene Fälle und Beschäftigte, die es auf unerwartete Weise nutzen.
TIAA-Manager Sastry Durvasula beschrieb diese Spannung im Bericht von CIO.com. Er sagte, dass ein erfolgreicher Pilot dennoch Schwierigkeiten haben kann, echten ROI zu erzielen, sobald Organisationen die Betriebskosten berücksichtigen.
Zu diesen Kosten zählen Token-Verbrauch, Traffic-Abwicklung, Wartung von Integrationen, Evaluierungen, Sicherheitsprüfungen und Support. In einer frühen Demonstration treten sie selten zutage.
Das neue CIO-Mandat beginnt damit, Wert vor dem Aufbau zu definieren. Ein Projekt benötigt einen messbaren Ausgangswert, der zeigt, wie der Prozess ohne KI funktioniert.
Zudem braucht es einen Geschäftsverantwortlichen, der vom Ergebnis profitiert. Technische Teams können Geschäftswert nicht eigenständig zertifizieren, wenn eine andere Abteilung über Einführung und Workflow-Änderungen entscheidet.
CIO.com stellte fest, dass 83 % der befragten IT-Führungskräfte bereichsübergreifende KI-Strukturen hatten oder deren Einführung im Laufe des Jahres planten. Formelle Genehmigung und Messung waren jedoch weniger ausgereift.
Nur 53 % verfügten über einen offiziellen Genehmigungsprozess für KI-Projekte. Weitere 28 % planten, innerhalb der folgenden 12 Monate einen solchen einzuführen.
Formelle Kennzahlen bestanden bei 47 % der antwortenden Organisationen, während 34 % ihre Einführung planten. Diese Lücke hilft zu erklären, warum Implementierungen und messbare Erträge häufig auseinanderlaufen.
Organisationen können keine Verbesserung nachweisen, wenn sie die ursprünglichen Prozesskosten, Fehlerraten, Bearbeitungszeiten oder Kundenergebnisse nie erfasst haben.
Das Ergebnis ist eine Umkehr der Verantwortlichkeit. Frühere KI-Programme belohnten Pilotvolumen und sichtbare Experimente. Die nächste Phase belohnt disziplinierte Auswahl und wiederholbaren Wert.
Dieser Wandel verändert auch Gespräche mit Anbietern. Behauptungen zur Modellqualität sind weniger relevant, wenn ein Käufer diese Qualität nicht einem operativen Ergebnis zuordnen kann.
CIOs benötigen zunehmend Nachweise über den gesamten Workflow hinweg. Sie müssen messen, ob Beschäftigte das System nutzen, ob die Ausgabequalität stabil bleibt und ob die Kosten innerhalb der Grenzen bleiben.
Sie benötigen außerdem eine Abbruchregel. Projekte, die wiederholt Schwellenwerte bei Akzeptanz, Qualität oder Finanzen verfehlen, sollten ihre Finanzierung verlieren, bevor sie zu dauerhafter Infrastruktur werden.
Diese Praxis steht nicht für Feindseligkeit gegenüber KI. Sie behandelt KI-Ausgaben mit derselben Disziplin wie andere strategische Investitionen.
Der Hauptkonflikt besteht zwischen KI-Versprechen und Betriebsrealität
KI-Projekte in Unternehmen scheitern häufig an der Grenze zwischen einer überzeugenden Demonstration und der komplexen Umgebung, in der echte Arbeit stattfindet.
Der zentrale Gegenspieler in dieser Geschichte ist nicht ein KI-Anbieter gegen einen anderen. Es ist das Versprechen schnellen KI-Werts gegen die Realität des Unternehmensbetriebs.
Demonstrationen isolieren meist eine eng umrissene Aufgabe. Produktivsysteme müssen Berechtigungen, veraltete Datensätze, widersprüchliche Richtlinien, unvollständige Daten und mehrere abhängige Anwendungen bewältigen.
Jede zusätzliche Abhängigkeit schafft einen weiteren Fehlerpfad. Das Modell kann eine plausible Antwort liefern, während ein nicht verfügbares Tool, ein veralteter Datensatz oder eine falsche Berechtigung die erforderliche Aktion verhindert.
Die Datenqualität stellt ein ähnliches Problem dar. KI-Systeme können Informationen zusammenfassen, klassifizieren oder abrufen, aber sie können nicht jeden Widerspruch beheben, der in Unternehmens-Repositories verborgen ist.
Ein Support-Agent kann auf drei Versionen derselben Erstattungsrichtlinie stoßen. Ohne eine maßgebliche Quelle und Versionshistorie kann er selbstsicher die falsche Regel auswählen.
Wissensarbeit schafft eine weitere Herausforderung bei der Messung. Schnelleres Erstellen von Entwürfen schafft nicht automatisch finanziellen Wert, wenn Beschäftigte die eingesparte Zeit mit der Prüfung unzuverlässiger Ergebnisse verbringen.
Das Projekt muss den gesamten Prozess messen. Dazu gehören Vorbereitung, Generierung, Prüfung, Korrektur, Eskalation und sämtliche nachgelagerten Fehler.
Hier kann ein Knowledge-Blending-Ansatz relevant werden. Die Kombination genehmigter Quellen mit Arbeitskontext kann Lücken beim Abruf verringern, doch Governance bestimmt weiterhin, welchem Material vertraut wird.
Auch die Akzeptanz von Workflows ist wichtig. Beschäftigte umgehen ein neues System häufig, wenn es zusätzliche Schritte erfordert, ungewohnte Oberflächen voraussetzt oder bei seltenen Fällen versagt.
Dieses Verhalten kann während eines geförderten Piloten unsichtbar bleiben. Teilnehmer erhalten Schulung und Unterstützung, während normale Nutzer mit konkurrierenden Prioritäten konfrontiert sind.
Erfolgreiche Einführung erfordert daher eine Neugestaltung von Prozessen, nicht bloß Zugriff auf ein Modell. Teams müssen entscheiden, welche Aufgaben sich ändern, welche Genehmigungen bestehen bleiben und wer Ausnahmen bearbeitet.
Der Unterschied zwischen Unterstützung und Autonomie erhöht den Einsatz zusätzlich. Ein Schreibassistent schlägt Text vor, den eine Person prüft. Ein Agent kann Tickets erstellen, Datensätze ändern, Kunden kontaktieren oder Transaktionen auslösen.
Ein ungenauer Vorschlag kostet Prüfzeit. Eine ungenaue autonome Handlung kann reale Systeme verändern, bevor ein Mensch sie bemerkt.
IDCs Forschung argumentiert, dass Organisationen agentische Technologie nicht auf jede Aufgabe anwenden sollten. Deterministische Automatisierung eignet sich weiterhin besser für stabile Prozesse mit klaren Regeln.
Agentische Systeme ergeben mehr Sinn, wenn Arbeit mehrere Schritte, wechselnden Kontext, Urteilsvermögen und Orchestrierung über verschiedene Tools hinweg erfordert. Selbst dann muss Autonomie genügend Wert schaffen, um das zusätzliche Risiko zu rechtfertigen.
Diese Disziplin bei der Auswahl von Anwendungsfällen hilft, die Debatte über das Scheitern von IDC-KI-Projekten zu erklären. Einige schwache Projekte beginnen mit einer Technologie auf der Suche nach einem Problem.
Teams entscheiden sich zunächst für ein Modell oder eine Agentenplattform. Anschließend suchen sie nach einem Workflow, der den Kauf rechtfertigen kann.
Diese Abfolge führt häufig zu interessanten Prototypen mit begrenzter operativer Bedeutung. Keine Geschäftseinheit übernimmt Verantwortung für das Ergebnis, weil das Projekt nicht aus einem gemessenen Bedarf entstanden ist.
Eine stärkere Abfolge beginnt mit einem kostspieligen oder eingeschränkten Workflow. Teams dokumentieren dessen Ausgangslage, identifizieren die beteiligten Entscheidungen und prüfen, ob KI das Gesamtergebnis verbessert.
Der Vergleich sollte auch herkömmliche Software und Prozessänderungen einbeziehen. KI sollte gewinnen, weil sie zum Problem passt – nicht weil Führungskräfte eine KI-Initiative angefordert haben.
Organisationen müssen außerdem Produktivität von realisiertem Wert unterscheiden. Wenn ein Mitarbeiter einige Minuten spart, hat das nicht automatisch eine finanzielle Bedeutung.
Das Unternehmen realisiert Wert nur, wenn diese Zeit den Output verbessert, die Kundenreaktion verkürzt, Kapazitäten erhöht oder eine identifizierte Ausgabe senkt.
Auch Mitarbeitererfahrung und Resilienz können wichtig sein. Führungskräfte müssen jedoch festlegen, wie diese Vorteile gemessen werden, statt sie als bequeme Erklärungen zu behandeln, nachdem finanzielle Ziele verfehlt wurden.
IDC schlägt aus diesem Grund eine umfassendere Wertzuordnung vor. Das Framework umfasst neben konventionellen Finanzkennzahlen auch Kundenvertrauen, Resilienz, Nachhaltigkeit und Zeithorizonte.
Dieses breitere Modell sollte nicht zu einer Entschuldigung für vage Erfolgsaussagen werden. Jede Dimension benötigt weiterhin einen Verantwortlichen, eine Ausgangsbasis, eine Messmethode und einen Überprüfungstermin.
Die operative Realität ist daher weniger dramatisch als ein Zusammenbruch von Modellen, aber schwieriger zu beheben. Sie erfordert Koordination zwischen Technologie-, Finanz-, Sicherheits-, Rechts- und Geschäftsteams.
Kein Modell-Update kann diese Koordination automatisch schaffen.
Governance für Agentic AI macht Sicherheit zu einer geschäftlichen Einschränkung
Die Governance für Agentic AI entscheidet darüber, ob Autonomie sicher skalieren kann, denn Agenten verwandeln unsichere Ergebnisse in Aktionen über verbundene Systeme hinweg.
Sicherheit hat Entscheidungen über Unternehmenstechnologie schon immer beeinflusst. Agentische Systeme verändern das Problem, indem sie Modellunsicherheit mit Zugangsdaten, Tools, Speicher und operativem Zugriff verbinden.
Ein herkömmlicher Chatbot liefert in der Regel Informationen. Ein Agent kann eine Anfrage interpretieren, einen Plan erstellen, Anwendungen aufrufen und nach dem Erhalt neuer Ergebnisse weiter handeln.
Diese Fähigkeit erweitert die Angriffsfläche. Bösartige Inhalte können die Anweisungen eines Agenten beeinflussen, während übermäßige Berechtigungen eine einzelne Fehlentscheidung in einen größeren Vorfall verwandeln können.
Prompt Injection ist ein Beispiel. Ein Angreifer platziert Anweisungen in Inhalten, die das Modell liest, um das System von seiner autorisierten Aufgabe wegzulenken.
Die Gefahr steigt, wenn ein Agent Nachrichten senden, Datenbanken ändern, vertrauliche Datensätze abrufen oder Code ausführen kann. Eine irreführende Antwort ist dann nur eine mögliche Fehlerart.
IDC warnt vor unkontrollierten Entscheidungskaskaden, intransparentem Verhalten und fragmentierter Eskalation. Seine Governance-Analyse beschreibt Governance als operative Infrastruktur und nicht als abschließende Compliance-Prüfung.
Das Unternehmen prognostiziert, dass bis zu 20 % der Global-1000-Organisationen bis 2030 mit Klagen, Geldstrafen oder der Entlassung von CIOs konfrontiert sein könnten. IDC verknüpft dieses Risiko mit öffentlichkeitswirksamen Störungen, die durch schwache Governance für KI-Agenten verursacht wurden.
Dabei handelt es sich um eine Prognose, nicht um eine beobachtete Ausfallquote. Sie signalisiert das Ausmaß potenzieller Rechenschaftspflicht und kein garantiertes Ergebnis.
IDC empfiehlt Nachverfolgbarkeit, integrierte Governance und klar definierte Verantwortlichkeitsschleifen. Diese Kontrollen helfen Teams, Entscheidungen nachzuvollziehen und Aktionen zu unterbrechen, bevor sie festgelegte Grenzen überschreiten.
Nachverfolgbarkeit bedeutet, die Daten, das Modell, die Anweisungen, Tool-Aufrufe und Ergebnisse zu protokollieren, die an einer autonomen Entscheidung beteiligt waren. Ohne diese Aufzeichnungen können Teams Fehler weder untersuchen noch Ergebnisse verteidigen.
Integrierte Governance verbindet Sicherheit, Daten, Recht, Risiko und geschäftliche Verantwortung über den gesamten Lebenszyklus des Systems hinweg. Ein Ausschuss, der nur das Modell überprüft, kann nicht den vollständigen Workflow steuern.
Verantwortlichkeitsschleifen legen fest, wann eine Person eine Aktion genehmigen, überprüfen oder stoppen muss. Der Schwellenwert sollte von der möglichen Konsequenz abhängen, nicht nur vom Vertrauen des Modells.
Aktionen mit geringem Risiko können mehr Autonomie erhalten. Das Versenden einer internen Erinnerung hat andere Folgen als die Genehmigung einer Zahlung oder die Änderung eines Kundenkontos.
Identitätskontrollen sind ebenso wichtig. Jeder Agent benötigt eine eigene Identität, Berechtigungen, einen Verantwortlichen und einen Zweck, statt uneingeschränkte Zugangsdaten von einem Entwickler oder einem gemeinsam genutzten Dienst zu übernehmen.
Berechtigungen sollten dem Prinzip der geringsten Rechte folgen. Ein Agent erhält nur den Zugriff, den er für seinen zugewiesenen Workflow benötigt, und keine weitergehenden Befugnisse.
Organisationen benötigen außerdem ein verlässliches Inventar. Sicherheitsteams können keine Agenten schützen, von deren Existenz sie nichts wissen – insbesondere wenn Abteilungen diese innerhalb von Geschäftsanwendungen konfigurieren können.
Das Inventar sollte Verantwortlichkeit, verbundene Systeme, freigegebene Daten, Modellanbieter, Evaluierungsergebnisse und Notfallkontrollen erfassen.
Nach dem Start wird eine kontinuierliche Evaluierung erforderlich. Das Verhalten von Agenten kann sich ändern, wenn Modelle aktualisiert werden, Prompts sich weiterentwickeln, verbundene Tools geändert werden oder Geschäftsdaten neue Muster entwickeln.
IDC weist darauf hin, dass die Leistung nachlassen kann, wenn sich der Kontext verschiebt und Sonderfälle zunehmen. Das macht einen Agenten zu einem fortlaufend verwalteten Dienst statt zu einer abgeschlossenen Bereitstellung.
Sicherheit und ROI laufen daher zusammen. Monitoring, Evaluierungen, Zugriffskontrollen, Incident Response und menschliche Überprüfung verursachen allesamt Betriebskosten.
Ein Business Case, der diese Kontrollen ausschließt, stellt eine künstlich günstige Rendite dar. Sie zu entfernen, um die Prognose zu schützen, verlagert finanziellen Druck in Sicherheitsrisiken.
Dies ist der zentrale Zielkonflikt, den CIOs steuern müssen. Mehr Autonomie kann Geschwindigkeit und Kapazität erhöhen, steigert jedoch auch die Kosten der Absicherung.
Die Antwort ist nicht die unbegrenzte Überprüfung jeder Aktion. Das würde die Effizienz aufheben, die den Agenten rechtfertigte.
Organisationen benötigen risikobasierte Autonomie. Sie können reversible, beobachtbare Aktionen automatisieren und gleichzeitig für Entscheidungen mit rechtlichen, finanziellen oder sicherheitsrelevanten Folgen eine menschliche Genehmigung verlangen.
Die Governance für Agentic AI muss auch Verfahren zur Abschaltung abdecken. Teams brauchen die Möglichkeit, Zugangsdaten zu widerrufen, Workflows zu stoppen, Speicher zu isolieren und während eines Vorfalls Beweise zu sichern.
Ohne diese Fähigkeiten kann ein Agent weiterarbeiten, während mehrere Teams über die Zuständigkeit diskutieren. Das ist ein Versagen organisatorischer Kontrollen, selbst wenn sich das Modell wie vorgesehen verhalten hat.
Was die Zahlen weiterhin nicht beweisen können
Die verfügbaren Statistiken zeigen ein weitreichendes Wertproblem, stützen jedoch keine universelle Ausfallquote für KI-Projekte.
Die Google-News-Darstellung verleitet zu einer binären Lesart. Ein Projekt ist entweder erfolgreich oder scheitert, wobei ein Prozentsatz den gesamten Markt zusammenfasst.
Unternehmensweite Bereitstellungen passen selten in dieses Modell. Ein Projekt kann einen technischen Benchmark erreichen, ein Akzeptanzziel verfehlen, innerhalb des Budgets bleiben und dennoch keine messbaren Umsätze erzielen.
Ein anderes Projekt kann seine ursprünglichen Kosten übersteigen und dabei strategisch wichtiges Wissen oder Kundenvorteile schaffen. Ob es als erfolgreich gilt, hängt vom Bewertungsrahmen ab.
Auch die Formulierung von Umfragen verändert die Ergebnisse. „Messbare Ergebnisse erzielt“ unterscheidet sich von „Erwartungen erfüllt“, „in Produktion gegangen“ oder „finanzielle Rendite erzielt“.
Auch die Auswahl der Stichprobe ist wichtig. Eine Umfrage unter Technologieführungskräften kann andere Ergebnisse liefern als eine Studie zu Geschäftsnutzern, Finanzteams oder einzelnen Projekten.
Der Nenner schafft ein weiteres Problem. Manche Studien zählen jeden Prototypen. Andere berücksichtigen nur Produktionsbereitstellungen oder Initiativen, die der Unternehmensleitung bekannt sind.
Auch die Zeithorizonte unterscheiden sich. Ein KI-System benötigt möglicherweise mehrere Quartale an Workflow-Neugestaltung und Einführung, bevor seine Vorteile sichtbar werden.
Es nach einem Quartal zum Scheitern zu erklären, kann verfrüht sein. Es ohne Belege unbegrenzt fortzusetzen, kann weiteres Kapital verschwenden.
Diese Einschränkungen entkräften die Erkenntnisse von IDC nicht. Sie definieren, was Leser daraus verantwortungsvoll schließen können.
Die stärkste Schlussfolgerung lautet, dass Unternehmen Schwierigkeiten haben, KI-Wert zu messen und zu wiederholen. Die schwächste Schlussfolgerung lautet, dass ein fester Prozentsatz aller Projekte aus demselben Grund definitiv gescheitert ist.
Diese Unterscheidung beeinflusst auch die Rechenschaftspflicht. Wenn das Modell automatisch beschuldigt wird, könnten Organisationen Anbieter wechseln und gleichzeitig die Workflow-, Daten- und Governance-Probleme beibehalten, die die schwachen Ergebnisse verursacht haben.
Wenn jedes Problem auf mangelnde organisatorische Bereitschaft geschoben wird, können Anbieter die Verantwortung für unzuverlässige Produkte vermeiden. Beide Narrative verdienen eine kritische Prüfung.
Die Modellqualität ist weiterhin wichtig. Halluzinationen, inkonsistentes Schlussfolgern, Latenz, begrenzter Kontext und Fehler bei der Tool-Nutzung können eine Anwendung für den Produktionseinsatz ungeeignet machen.
Auch das Design der Anbieter ist wichtig. Käufer benötigen nutzbare Audit-Logs, Berechtigungskontrollen, Hinweise auf Modelländerungen, Evaluierungstools und vorhersehbares Serviceverhalten.
Organisationen bleiben dafür verantwortlich, geeignete Anwendungsfälle auszuwählen und Zugriffe sicher zu konfigurieren. Anbieter bleiben dafür verantwortlich, Fähigkeiten und Einschränkungen korrekt zu beschreiben.
Die Diskussion über das Scheitern von IDC-KI-Projekten sollte daher bessere Fragen hervorbringen, nicht einen bequemen einzelnen Schuldigen.
Welche Ausgangsbasis sollte das Projekt verbessern? Welcher Geschäftsverantwortliche akzeptierte das Ziel? Waren Sicherheits- und Betriebskosten vor der Genehmigung berücksichtigt?
Nutzten Mitarbeiter das System noch, als die Unterstützung während der Pilotphase endete? Blieb die Ausgabequalität bei ungewöhnlichen Fällen und sich verändernden Daten akzeptabel?
Konnten Teams die Aktionen eines Agenten nach einem Fehler rekonstruieren? Konnten sie den Workflow sofort stoppen, ohne nicht betroffene Systeme zu deaktivieren?
Diese Fragen verwandeln eine umstrittene Schlagzeile in eine operative Überprüfung. Sie sind zudem schwieriger zu beantworten als die Frage, ob ein Pilotprojekt planmäßig gestartet ist.
Ein unabhängiger Vergleich unterstreicht die Notwendigkeit zur Vorsicht. Gartner berichtete, dass 45 % der Organisationen mit hoher Reife KI-Projekte mindestens drei Jahre lang in Betrieb hielten.
Seine KI-Reifegradumfrage verknüpfte Langlebigkeit mit reifen Praktiken, doch Langlebigkeit allein beweist keinen Geschäftswert.
Ein Projekt kann aus strategischen oder politischen Gründen in Betrieb bleiben. Ein Projekt kann auch enden, nachdem seine Fähigkeit erfolgreich in eine andere Plattform überführt wurde.
Keine einzelne Kennzahl erfasst das gesamte Ergebnis. Organisationen benötigen eine Portfolio-Perspektive, die technische Leistung, Akzeptanz, finanzielle Auswirkungen, Risiko und strategischen Wert voneinander trennt.
Dieses Portfolio sollte auch erfolglose Projekte umfassen. Das Verbergen aufgegebener Pilotprojekte erzeugt ein irreführendes Bild und hindert Teams daran, wiederkehrende Ursachen zu erkennen.
Es sollte außerdem zwischen einer sinnvollen Beendigung und unkontrolliertem Scheitern unterscheiden. Ein schwaches Projekt frühzeitig zu beenden, kann disziplinierte Governance statt schlechter Leistung demonstrieren.
Eine CIO.com-Quelle beschrieb es als gesund, etwa ein Drittel der gestarteten Projekte zu stoppen. Die Organisation nutzte stufenweise Finanzierung und Ergebnis-Checkpoints, um zu verhindern, dass schwache Vorhaben dauerhaft Ressourcen binden.
Dieser Ansatz rahmt Scheitern neu. Das gefährliche Projekt ist nicht immer dasjenige, das gestoppt wird. Es kann dasjenige sein, das ohne Belege fortgesetzt wird, weil niemand die Entscheidung verantwortet.
Drei Signale, auf die CIOs als Nächstes achten sollten
Der nächste Test besteht darin, ob Organisationen Pilotzahlen durch Ergebnisberichte, kontrollierte Autonomie und Belege dafür ersetzen, dass Mitarbeiter KI in realen Workflows nutzen.
Das erste Signal ist die Einführung formaler Playbooks für den KI-Wert. IDC erwartet, dass bis 2027 60 % der CIOs der Asia-Pacific 500 mit deren Erstellung beauftragt werden.
Ein Value Playbook standardisiert die Auswahl von Anwendungsfällen, Baselines, Kostenmodelle, Verantwortlichkeiten und Prüfschwellen. Es ermöglicht Führungskräften, Projekte anhand konsistenter Evidenz zu vergleichen.
Dieses Signal würde IDCs Argument stärken, wenn Unternehmen beginnen, Projekte ohne messbare Ergebnisse einzustellen. Es würde das Argument schwächen, wenn die formale Messung ausgeweitet wird, ohne die Portfolio-Performance zu verbessern.
Die entscheidende Kennzahl ist nicht die Zahl der veröffentlichten Playbooks. Entscheidend ist der Anteil der Produktionsinitiativen mit benannten Verantwortlichen, Baselines, vollständigen Betriebskosten und geplanten Ergebnisprüfungen.
Vorstände sollten auch darauf achten, wie Unternehmen indirekte Vorteile ausweisen. Kundenvertrauen, Resilienz und schnellere Entscheidungen können wichtig sein, doch für jeden dieser Aspekte ist eine beobachtbare Messmethode erforderlich.
Das zweite Signal ist die Einführung durchsetzbarer Agentenkontrollen. Richtlinien allein können Software, die kontinuierlich über Geschäftssysteme hinweg agiert, nicht steuern.
CIOs sollten verfolgen, wie viele Agenten über eigene Identitäten, eingeschränkte Berechtigungen, vollständige Aktionsprotokolle, Regeln für menschliche Eskalation und getestete Abschaltverfahren verfügen.
Sicherheitsteams sollten Vorfälle außerdem nach Schweregrad und Grundursache melden. Steigende Vorfallzahlen können entweder auf eine verschlechterte Sicherheit oder auf eine bessere Sichtbarkeit zuvor verborgener Aktivitäten hindeuten.
Aussagekräftiger ist, ob schwere Vorfälle zurückgehen, während die Nutzung von Agenten zunimmt. Unternehmen sollten Vorfallraten mit Agentenaktionen, angebundenen Systemen und Risikostufen vergleichen.
IDCs Ausblick für den asiatisch-pazifischen Raum prognostiziert schwerwiegende Folgen unzureichender Agentenkontrollen, darunter rechtliche Risiken und die Rechenschaftspflicht von Führungskräften. Diese Prognose wird glaubwürdiger, wenn autonome Implementierungen schneller wachsen als die technische Aufsicht.
Sie wird weniger glaubwürdig, wenn Unternehmen nachweisen, dass risikobasierte Kontrollen mit der Nutzung skalieren. Die Evidenz sollte Audit-Ergebnisse, Eindämmungszeiten, Berechtigungsverstöße und erfolgreiche menschliche Eingriffe umfassen.
Das dritte Signal ist die produktive Nutzung, die an Workflow-Ergebnisse gebunden ist. Genauigkeit in Pilotprojekten und Begeisterung der Mitarbeitenden können eine nachhaltige Nutzung im Tagesgeschäft nicht ersetzen.
CIOs sollten aktive Nutzung, Abschlussquoten, die Häufigkeit von Ausnahmen, Prüfzeiten und den Anteil generierter Arbeit überwachen, der zu einem nützlichen Ergebnis führt.
Sie sollten außerdem messen, was geschieht, nachdem die Unterstützung bei der Implementierung abnimmt. Ein System, das auf ständige Eingriffe seiner Ersteller angewiesen ist, hat noch keine wiederholbare Produktionsreife erreicht.
Geschäftsbereiche müssen berichten, ob KI Durchlaufzeiten verkürzt, Kapazitäten erweitert, Fehler reduziert oder Kundenergebnisse verbessert. Finanzteams sollten alle behaupteten Einsparungen überprüfen.
Dieses Signal würde das google news-Narrativ stärken, wenn die Nutzung wächst, während der messbare Wert schwach bleibt. Es würde zeigen, dass Einführung allein das ROI-Problem nicht lösen kann.
Es würde dieses Narrativ schwächen, wenn ausgereifte Programme nach Einbeziehung vollständiger Sicherheits- und Betriebskosten über mehrere Workflows hinweg wiederholbare Verbesserungen nachweisen.
Diese drei Signale hängen zusammen. Bessere Wertmodelle wählen stärkere Anwendungsfälle aus, stärkere Kontrollen ermöglichen sichere Autonomie, und eine nachhaltige Workflow-Nutzung liefert messbare Evidenz.
Das Entfernen eines Elements führt zu einem fragilen Ergebnis. Ein profitables System ohne Kontrollen birgt verborgene Risiken. Ein sicheres System ohne Nutzer schafft keinen Wert.
Ein beliebtes System ohne Baseline-Messungen erzeugt beeindruckende Aktivität, aber unsichere Erträge.
CIOs sollten dem Druck widerstehen, die Debatte mit einem weiteren pauschalen Prozentsatz zu beantworten. Ihre eigenen Portfolios liefern nützlichere Evidenz als eine aggregierte Schlagzeile.
Sie können damit beginnen, eine kleine Zahl wesentlicher Workflows auszuwählen und die aktuelle Leistung zu dokumentieren. Jedes Projekt sollte einen geschäftlichen Verantwortlichen, einen technischen Verantwortlichen, eine Risikoklassifizierung und einen Prüfplan erhalten.
Teams sollten Kosten über die anfängliche Entwicklung hinaus berechnen. Dazu zählen Modellnutzung, Wartung von Integrationen, Monitoring, Evaluierungen, Sicherheit, Support und menschliche Prüfung.
Sie sollten inakzeptable Ergebnisse definieren, bevor sie Autonomie gewähren. Diese Grenzen können Datenoffenlegung, finanzielle Limits, Kundenauswirkungen und verbotene Tool-Aktionen abdecken.
Schließlich sollten sie interne Ergebnisse veröffentlichen, einschließlich eingestellter Projekte. Transparente Berichterstattung erschwert es schwachen Projekten, allein durch Begeisterung zu überleben.
Die umstrittene 45%-Behauptung ist daher als Warnung nützlich, nicht als universelle Scorecard. Sie zeigt, wie leicht unpräzise Messungen zu einer selbstsicheren KI-Schlagzeile werden.
Die bessere Reaktion besteht nicht darin, über einen einzelnen google news-Prozentsatz zu streiten. Sie besteht darin, Nachweise dafür zu verlangen, dass jedes KI-System Wert schafft, nachdem seine vollständigen Kosten und Risiken berücksichtigt wurden.
Welche Projekte würden diesen Test in Ihrem Unternehmen bestehen, und welche werden weiterhin finanziert, weil niemand definiert hat, was Erfolg bedeutet?



