AI Academy News - ChatGPT macht schneller. Doch wer erkennt, wann die KI irrt?
WENN KI IRRT

News

ChatGPT macht schneller. Doch wer erkennt, wann die KI irrt?

News

Studien zeigen: Generative KI kann die Arbeitsleistung deutlich steigern – und bei anderen Aufgaben die Trefferquote senken. Für Unternehmen wird deshalb eine unterschätzte Fähigkeit entscheidend: zu erkennen, wann Unterstützung in falsche Sicherheit umschlägt.

AI-Avatar AmariKI-gestützt · AI-Avatar Amari · News & Trends · AI-Redaktion
VH

Expert in the Loop · Fachlich geprüft von Viktor Hettich, Founder & CEO

29. September 2026 · 6 Min Lesezeit

Artikel teilen
Artikel anhören

Management Summary

Studien zeigen: Generative KI kann die Arbeitsleistung deutlich steigern – und bei anderen Aufgaben die Trefferquote senken. Für Unternehmen wird deshalb eine unterschätzte Fähigkeit entscheidend: zu erkennen, wann Unterstützung in falsche Sicherheit umschlägt.

September 2023, Harvard Business School. Eine Forschungsarbeit über 758 Beraterinnen und Berater zeigt einen bemerkenswerten Widerspruch: Mit GPT-4 erledigen die Teilnehmenden bestimmte Aufgaben schneller und besser. Bei einer anderen Problemstellung sinkt dagegen die Wahrscheinlichkeit einer richtigen Lösung. Dasselbe Werkzeug. Gegensätzliche Ergebnisse.

Hier liegt eine der wichtigsten Fragen für den wirtschaftlichen Einsatz künstlicher Intelligenz: Nicht allein, was ein System leisten kann, sondern ob Menschen seine Grenzen rechtzeitig erkennen. Ein überzeugender Text trägt schließlich kein Warnschild, wenn seine Schlussfolgerung falsch ist.

Für die Weiterbildung verschiebt sich damit der Schwerpunkt. Gute Eingaben zu formulieren bleibt nützlich. Aber wer ChatGPT und andere Assistenten professionell verwendet, muss vor allem lernen, Ergebnisse zu prüfen und Verantwortung nicht unbemerkt abzugeben.

Redaktionelle Einordnung zum 29. September 2026: Dieser Beitrag analysiert veröffentlichte Forschung und den verabschiedeten EU-Rechtsrahmen. Eine tagesaktuelle Nachrichtenprüfung liegt nicht vor; ein neuester Durchbruch wird deshalb nicht behauptet.

ChatGPT im Büro: Der Produktivitätsschub ist messbar

Beginnen wir mit der guten Nachricht. Der Nutzen ist keineswegs nur Marketing.

In einem 2023 in Science veröffentlichten Experiment von Shakked Noy und Whitney Zhang bearbeiteten 453 akademisch ausgebildete Berufstätige berufstypische Schreibaufgaben. Die Gruppe mit Zugang zu ChatGPT benötigte im Durchschnitt rund 40 Prozent weniger Zeit. Zugleich stieg die bewertete Qualität ihrer Ergebnisse um etwa 18 Prozent.

Schneller und besser: Diese Kombination macht die Technologie für Geschäftsleitungen so attraktiv. Sie widerspricht dem vertrauten Tauschgeschäft, bei dem Tempo gewöhnlich zusätzliche Fehler kostet.

Doch die Untersuchung prüfte abgegrenzte Aufgaben, nicht den vollständigen Alltag einer Organisation. Sie belegt weder automatisch höhere Jahresgewinne noch eine entsprechende Verringerung des Personalbedarfs. Abstimmungen, Datenschutzprüfungen oder die spätere Verwendung eines Textes verschwinden nicht, nur weil dessen Entwurf früher fertig ist.

Der entscheidende Unterschied lautet deshalb: Gemessene Bearbeitungszeit ist noch kein nachgewiesener Geschäftserfolg. Wer beides verwechselt, baut seine Investitionsrechnung auf eine Abkürzung.

Die Leistungsgrenze: Warum bessere Texte falsch sein können

Die eingangs erwähnte Studie von Fabrizio Dell’Acqua und weiteren Forschenden entstand mit der Boston Consulting Group. Sie beschreibt eine „zerklüftete technologische Grenze“: Manche Aufgaben liegen innerhalb der Fähigkeiten eines Sprachmodells, andere außerhalb. Diese Trennlinie verläuft nicht dort, wo unser Bauchgefühl sie unbedingt vermutet.

Bei Aufgaben innerhalb dieser Grenze erledigten Personen mit GPT-4 im Durchschnitt 12,2 Prozent mehr Aufgaben und arbeiteten 25,1 Prozent schneller. Ihre Ergebnisse wurden zudem um mehr als 40 Prozent besser bewertet.

Dann kam der Bruch. Bei einer Aufgabe außerhalb der untersuchten Leistungsgrenze lag die Wahrscheinlichkeit einer korrekten Lösung mit Unterstützung um 19 Prozentpunkte niedriger als ohne sie. Prozentpunkte bezeichnen hier den direkten Abstand zwischen zwei Erfolgsquoten, nicht deren relative Veränderung.

Das ist der eigentliche Warnruf: Ein Assistent kann bei benachbarten Tätigkeiten glänzen und scheitern. Sprachliche Eleganz ist kein verlässlicher Qualitätsmesser.

Die Arbeit wurde zunächst als Arbeitspapier veröffentlicht und untersuchte ein bestimmtes Modell in einem bestimmten Versuchsaufbau. Daraus folgt keine Fehlerquote für heutige Produkte. Wohl aber eine robuste Managementfrage: Testen wir die konkrete Tätigkeit – oder vertrauen wir dem allgemeinen Ruf des Anbieters?

KI-Kompetenz: Nicht alle Beschäftigten profitieren gleich

Ein weiteres Forschungsprojekt verschiebt den Blick vom Werkzeug auf die Menschen davor.

Das NBER-Arbeitspapier „Generative AI at Work“ berichtete 2023 über die Einführung eines Assistenzsystems bei 5.179 Beschäftigten im Kundensupport. Die Produktivität, gemessen an gelösten Anliegen pro Stunde, stieg im Durchschnitt um rund 14 Prozent. Weniger erfahrene und geringer qualifizierte Mitarbeitende profitierten besonders deutlich.

Die Zahlen beziehen sich auf die damalige Arbeitspapierversion. Es war außerdem keine Untersuchung von frei eingesetztem ChatGPT, sondern eines in den Arbeitsablauf eingebetteten Helfers.

Trotzdem ist die didaktische Botschaft wichtig: Eine einheitliche Schulung für alle verfehlt möglicherweise den Bedarf. Einsteiger benötigen Orientierung und fachliche Maßstäbe. Erfahrene Fachkräfte brauchen eher anspruchsvolle Grenzfälle, Vergleichstests und Möglichkeiten, ihr Wissen in überprüfbare Arbeitsabläufe zu übersetzen.

Der überraschende Perspektivwechsel: Derselbe Assistent kann für eine Person eine Lernstütze sein und für eine andere bloß zusätzliche Prüfungsarbeit erzeugen. Welche Wirkung überwiegt, muss vor Ort untersucht werden.

AI-Tools lernen: Prüfen gehört in jede Übung

Was sollte daraus für einen Kurs folgen? Nicht noch eine Sammlung vermeintlicher Wunderbefehle. Sinnvoller ist ein Lernaufbau, der Urteilskraft sichtbar macht.

Erstens: den eigenen Maßstab erkennen. Teilnehmende bearbeiten eine kurze Fachaufgabe zunächst ohne Unterstützung. So zeigt sich, welche Kenntnisse vorhanden sind und wo Unsicherheit beginnt. Das ist eine Diagnose, kein Wettbewerb gegen die Maschine.

Zweitens: denselben Auftrag mit einem Assistenten lösen. Anschließend werden Zeitbedarf, Vollständigkeit und sachliche Richtigkeit getrennt bewertet. Ein schöneres Ergebnis darf nicht automatisch als besser gelten.

Drittens: gezielt widersprechen. Die Übung enthält eine vorab fachlich geprüfte fehlerhafte Aussage. Die Lernenden müssen sie entdecken, mit einer belastbaren Quelle korrigieren und erklären, warum sie zunächst plausibel wirkte.

Viertens: die Übergabe begründen. Wer darf das Resultat weiterverwenden? Welche Unsicherheit bleibt? Wann ist eine fachliche Freigabe erforderlich?

Dieser Aufbau ist ein didaktischer Vorschlag, kein durch die genannten Studien nachgewiesenes Universalrezept. Sein Vorteil: Er macht überprüfbar, ob jemand nur flüssig bedient oder tatsächlich sicherer entscheidet. Ein Kurs kann bereits dann wertvoll sein, wenn Teilnehmende hinterher seltener vorschnell zustimmen.

Was bedeutet das für Unternehmen?

Die erste Konsequenz ist unbequem: Eine hohe Nutzungsquote beweist noch keinen sinnvollen Einsatz. Viele erzeugte Entwürfe können ebenso gut viele neue Kontrollaufgaben bedeuten.

Für einen überschaubaren Pilotversuch empfehlen sich deshalb drei Messgrößen: die gesamte Bearbeitungszeit einschließlich Nacharbeit, die fachliche Fehlerquote und die Zahl nötiger Eskalationen an qualifizierte Personen. Verglichen werden sollten ähnliche Aufgaben unter möglichst vergleichbaren Bedingungen. Auch die verwendete Modellversion gehört in die Dokumentation.

Die zweite Konsequenz betrifft Zuständigkeiten. Wer einen Text erstellt, muss nicht automatisch die Kompetenz besitzen, jede darin enthaltene Behauptung zu prüfen. Gerade bei rechtlichen, finanziellen oder technischen Aussagen braucht es einen ausdrücklich benannten Prüfweg.

Die dritte betrifft Weiterbildung als organisatorische Aufgabe. Artikel 4 der EU-Verordnung über künstliche Intelligenz, des sogenannten AI Act, verpflichtet Anbieter und Betreiber im Anwendungsbereich zu Maßnahmen für ein ausreichendes Maß an KI-Kompetenz bei relevanten Mitarbeitenden und weiteren beauftragten Personen. Nach dem verabschiedeten Regelungstext gilt diese Vorschrift seit dem 2. Februar 2025.

Dabei sollen unter anderem Vorwissen, Erfahrung und Einsatzkontext berücksichtigt werden. Aus dem Artikel allein folgt kein vorgeschriebenes Einheitszertifikat. Die praktische Schlussfolgerung: Eine absolvierte Präsentation ersetzt keine rollenbezogene Befähigung. Für rechtliche Entscheidungen bleibt eine aktuelle Prüfung erforderlich.

Fazit: Der nächste Fortschritt braucht bessere Urteilskraft

Die Forschung liefert weder einen Freibrief zur Automatisierung noch einen Grund für pauschale Ablehnung. Sie zeigt etwas Anspruchsvolleres: Der Nutzen hängt von Aufgabe, Arbeitsumgebung und Fähigkeiten der Beschäftigten ab.

Für Unternehmen lautet die Leitfrage deshalb nicht nur: Wie schnell entsteht ein Ergebnis? Sondern: Wie zuverlässig erkennen wir, ob wir es verwenden dürfen?

Eine plausible Antwort ist noch keine belastbare Entscheidung. Genau diesen Unterschied zu lehren, macht Weiterbildung zum Bestandteil der Wertschöpfung – statt zur Bedienungsanleitung für das nächste Werkzeug.

Häufige Fragen

Reicht ein Prompting-Kurs für den Einstieg?

Prompting bedeutet, einem Modell Aufgaben und Kontext durch Eingaben zu vermitteln. Das hilft, reicht allein aber nicht aus. Quellenprüfung, Datenschutz, Fachwissen und klare Freigaberegeln gehören ebenfalls zum sicheren Einsatz.

Lassen sich die Studienwerte auf heutige Modelle übertragen?

Nicht unmittelbar. Produkte, Versionen und Aufgaben unterscheiden sich. Die Ergebnisse begründen eigene Tests, liefern jedoch keine verlässliche Produktivitätsprognose für jeden Betrieb.

Woran erkennt man eine wirksame Schulung?

Nicht allein an Zufriedenheit oder Teilnahmebescheinigungen. Aussagekräftiger ist, ob Beschäftigte anschließend Fehler zuverlässiger entdecken, Unsicherheit klarer benennen und definierte Aufgaben mit weniger Nacharbeit bewältigen.

Noch keine Kurse verfügbar.

Dein nächster Schritt

Lernen, vernetzen, umsetzen

Wissen anwenden statt nur lesen – vertiefe das Thema in unseren KI-Kursen mit Zertifikat, Executive Circle, KI-Trends und AI Automation.