Eine viel zitierte MIT-Untersuchung aus dem Jahr 2025 kam zu dem Ergebnis, dass 95 Prozent der untersuchten Generative-KI-Initiativen keinen messbaren Effekt auf die Gewinn- und Verlustrechnung hatten. Die Zahl wird gern als Beleg gegen KI gelesen. Sie belegt etwas anderes.

Was die Studie tatsächlich untersucht hat

Grundlage waren 52 Interviews mit Führungskräften, eine Befragung von 153 Verantwortlichen und die Auswertung von 300 öffentlich dokumentierten Einführungen. Gemessen wurde nicht, ob die Technik funktioniert, sondern ob ein Effekt in den Zahlen ankommt. Das ist ein strengerer Maßstab als „die Demo lief“, und genau deshalb ist das Ergebnis brauchbar.

Die Trennlinie verläuft nicht beim Modell

Die Autoren beschreiben eine Kluft: Generische Werkzeuge erreichen hohe Nutzungszahlen bei einfachen Aufgaben und bleiben genau dort stehen, wo ein Arbeitsablauf Kontext und Anpassung verlangt. Die kleine Gruppe, bei der etwas ankommt, hat nicht die besseren Modelle, sondern die tiefere Einbettung: Anbindung an die vorhandenen Systeme, Gedächtnis über Vorgänge hinweg, und eine Rückkopplung, die aus Korrekturen lernt.

Was eine Demo von einem System unterscheidet

Aus unserer Arbeit sind es immer dieselben vier Punkte. Ein Vorgang muss nachvollziehbar sein, wer nicht rekonstruieren kann, wie eine Entscheidung zustande kam, kann sie nicht verantworten. Es braucht einen verlässlichen Weg zurück in die manuelle Bearbeitung, weil jedes System Ausnahmen hat. Die Kosten müssen begrenzt sein, sonst wird der Dauerbetrieb zur offenen Rechnung. Und es braucht eine Messung, ob die Ergebnisse besser werden, ohne die ist jede Aussage über Qualität eine Vermutung.

Warum Pilotprojekte diese Punkte systematisch auslassen

Weil sie sie nicht brauchen. Ein Pilot muss beeindrucken, kein System muss laufen. Die Arbeit, die den Unterschied macht, ist unsichtbar und lässt sich schlecht vorführen. Deshalb entsteht sie in Pilotprojekten selten, und deshalb ist der Sprung in die Produktion so viel größer, als er im Zeitplan aussieht.

Was wir daraus machen

Wir bauen den kleinsten Ausschnitt, der einen echten Vorgang vollständig abdeckt, mit Protokoll, Rückfallweg und Messung von Anfang an. Das sieht in der ersten Demo weniger beeindruckend aus als ein Chatfenster, das alles zu können scheint. Es ist aber der Teil, der drei Monate später noch da ist.

Quellen: Mind the Product zur MIT-Studie 2025; Forbes: Why 95% of AI Pilots Fail; Fortune zur MIT-Auswertung.