Zwanzig Sekunden schreiben, zwei Stunden reparieren:
KI und Textqualität

Ein Entwurf ist in zwanzig Sekunden da. Die Nacharbeit daran dauert im Schnitt knapp zwei Stunden.

Diese Zahl stammt aus einer Untersuchung von BetterUp Labs und der Stanford University, die in der Harvard Business Review veröffentlicht wurde, und sie beschreibt das eigentliche Problem hinter KI und Textqualität.

Tempo spart keine Arbeit. Es verschiebt sie. Wer die gewonnene Zeit nicht in die Prüfung zurücksteckt, bezahlt sie später an anderer Stelle. Die Rechnung kommt in drei Varianten: als Zeitrechnung, als Sichtbarkeitsrechnung und als Vertrauensrechnung.

Was ist eigentlich ein schlechter KI-Text?

Die Forschenden aus Stanford nennen oberflächlich polierte, aber inhaltlich substanzlose Inhalte Workslop. Gemeint sind Inhalte, die professionell aussehen und inhaltlich hohl sind. Korrekte Grammatik, saubere Gliederung, und trotzdem steht am Ende nichts drin, was jemand nicht schon wusste.

Warum Workslop durch jede Freigabe rutscht

Genau diese Kombination macht das Zeug so zäh. Ein schlecht geschriebener Text fällt beim Überfliegen auf und landet zurück beim Absender. Ein glatter Text ohne Substanz rutscht durch die Freigabe, weil er einfach nicht mit den Lesenden „connnectet“. Die Prüfinstanz merkt erst beim dritten Absatz, dass sie nichts gelernt hat, und dann ist die Zeit schon weg.

Die erste Rechnung: Zeit

Rechnen wir das durch. Knapp zwei Stunden Nacharbeit pro Dokument summieren sich laut Studie auf etwa 186 Dollar pro Mitarbeiter und Monat. Bei 10.000 Beschäftigten sind das über neun Millionen Dollar im Jahr, verbrannt für das Reparieren von Material, das nie hätte verschickt werden dürfen.

Wie viel Zeit die Nacharbeit an KI-Texten wirklich kostet

Eine zweite Untersuchung liefert die Gegenprobe. Der Softwareanbieter Workday hat 3.200 Führungskräfte und Mitarbeitende befragt und kommt zu dem Ergebnis, dass 37 Prozent der KI-Produktivitätsgewinne durch Nachbearbeitung wieder aufgezehrt werden. Auf zehn eingesparte Stunden kommen knapp vier Stunden Korrektur. 85 Prozent der Befragten glauben, wöchentlich ein bis sieben Stunden zu sparen. Nur 14 Prozent erzielen konsistent einen Netto-Nutzen, bei dem die Qualität der Arbeit tatsächlich steigt.

Wer den Zeitgewinn hat und wer ihn bezahlt

Die Lücke zwischen diesen beiden Zahlen ist die interessanteste Erkenntnis des ganzen Themas. Der Zeitgewinn ist echt, aber er entsteht beim Schreibenden und die Kosten entstehen beim Lesenden. Wer ungeprüft weiterleitet, hat nicht schneller gearbeitet. Er hat die Arbeit weitergereicht.

Die zweite Rechnung: Sichtbarkeit

Bestraft Google KI-generierte Texte?

Hier räumen wir zuerst mit einem Missverständnis auf, das sich hartnäckig hält. Google bestraft KI-Texte nicht. Das sagt nicht nur Google selbst, das zeigen auch die Daten. Ahrefs hat im Juli 2026 rund 150.000 Seiten aus 100.000 Suchergebnisseiten ausgewertet. Ergebnis: 5,3 Prozent der Seiten auf den Plätzen eins bis drei sind zu hundert Prozent KI-generiert. Vollautomatischer Content kann ganz oben ranken, das ist belegt.

Was die Ahrefs-Daten zum KI-Anteil im Ranking zeigen

Der zweite Blick auf dieselben Daten ist allerdings ernüchternd. 54,7 Prozent der Top-3-Seiten enthalten weniger als 20 Prozent KI-Text, und Seiten mit unter 50 Prozent KI-Anteil stellen 82,2 Prozent aller Spitzenplatzierungen. Die Indexierungsrate sinkt von 49,3 Prozent bei niedrigem KI-Anteil auf 40,4 Prozent bei sehr hohem. Am deutlichsten fällt der Unterschied bei den Impressionen aus: Seiten mit wenig oder mäßigem KI-Anteil erhalten das Zwei- bis Dreifache dessen, was stark generierte Seiten einsammeln.

Ryan Law, der die Studie verantwortet, zieht daraus einen Schluss, den wir teilen. Google richtet sich nicht gegen KI, sondern gegen schwache Inhalte. Die beiden fallen nur auffällig oft zusammen. Typische generierte Artikel wiederholen Allgemeinwissen, verzichten auf interne und externe Verlinkung, liefern keine Erfahrung aus erster Hand und enthalten Fehler, die niemand geprüft hat. Das würde jedem Text schaden, gleich wer ihn geschrieben hat.

Für Entscheider heißt das: Die Frage „Dürfen wir KI einsetzen?" führt in die Irre. Die Frage lautet, ob am Ende etwas dasteht, das eine Maschine nicht aus zehn Wettbewerbertexten zusammensetzen kann.

Die dritte Rechnung: Vertrauen

Viele Unternehmen versuchen, das Qualitätsproblem an eine Software zu delegieren. Ein Detektor soll melden, was generiert wurde, und der Rest gilt als sauber. Das funktioniert nicht, und zwar aus zwei Gründen.

Erstens messen die Werkzeuge schlecht. In der bislang größten Vergleichsstudie von Debora Weber-Wulff et al. wurden 14 Erkennungstools getestet. Keines erreichte eine zufriedenstellende Genauigkeit. Bei paraphrasierten KI-Texten sank die Erkennungsrate auf rund 26 Prozent. Eine Stanford-Studie zeigt die Kehrseite: Sieben verbreitete Detektoren stuften 61 Prozent der Aufsätze von Nicht-Muttersprachlern fälschlich als maschinell ein. Wer international arbeitet, verdächtigt mit so einem Türsteher systematisch die falschen Leute.

Zweitens misst ein Detektor ohnehin die falsche Größe. Er sucht nach einer sprachlichen Signatur, nicht nach Substanz. Wohin das führt, zeigt der Markt der sogenannten Humanizer. Ein Anbieter empfiehlt in seiner Anleitung allen Ernstes, kleine Rechtschreibfehler stehen zu lassen, weil Fehlerfreiheit verdächtig wirke. Ein Text, der so behandelt wurde, ist nicht besser geworden. Er ist nur unauffälliger.

Wo sich Tempo tatsächlich auszahlt

Das alles ist kein Argument gegen KI. Wir arbeiten in der Contentkolonie täglich damit und wollen es nicht missen. Der Gewinn liegt nur woanders, als die Tool-Werbung verspricht.

Wofür sich KI in der Textproduktion lohnt

Gut funktioniert die Maschine überall dort, wo Material entsteht, das ohnehin noch bewertet wird. Recherchevorbereitung. Zwölf Überschriftenvarianten, von denen elf in den Papierkorb wandern. Rohgliederungen, an denen man merkt, wo das Argument noch hakt. Zusammenfassungen langer Ausschreibungsunterlagen. Eine Zweitmeinung um 22 Uhr, wenn niemand mehr im Büro ist.

Wo KI im Textprozess an ihre Grenzen stößt

Schlecht funktioniert sie überall dort, wo Urteil gefragt ist. Was die Marke behaupten kann und was nicht. Ob eine Zahl stimmt. Ob eine Formulierung im Kontext dieser Branche witzig wirkt oder herablassend. Und vor allem: die letzten 20 Prozent, in denen aus einem korrekten Text ein guter wird. Diese 20 Prozent sind der ganze Unterschied, und sie kosten fast so viel Zeit wie die ersten 80.

Woran Sie einen guten Text erkennen, auch wenn KI beteiligt war

Vier Prüffragen haben sich in unserer Redaktion bewährt. Sie brauchen keine Software dafür, nur zehn Minuten und jemanden mit Fachkenntnis.

  1. Steht etwas drin, das nicht auch in zehn Wettbewerbertexten steht? Eigene Zahlen, ein konkretes Projekt, eine Einschätzung, die jemand verantworten muss.

  2. Ist eine Person erkennbar, die für den Inhalt einsteht, mit Namen und Fachprofil?

  3. Stimmt die kleinste überprüfbare Angabe im Text, also die Jahreszahl, der Firmenname, die Prozentangabe? Wo dort geschlampt wurde, ist meist auch der Rest ungeprüft.

  4. Wagt der Text eine Behauptung, oder wägt er nur ab? Generierte Entwürfe neigen zur Unverbindlichkeit, weil Unverbindlichkeit statistisch sicherer ist.

Schnell ist eine Eigenschaft, gut ist eine Entscheidung

Die Werkzeuge sind besser geworden, das Handwerk ist gleich geblieben. Ein Text wird nicht dadurch wertvoll, dass er existiert, sondern dadurch, dass jemand etwas zu sagen hatte und die Mühe auf sich genommen hat, es präzise zu sagen. KI verkürzt den Weg zum Entwurf erheblich. Den Weg vom Entwurf zum fertigen Text verkürzt sie nicht.

Diesen Artikel haben wir übrigens genau so produziert. Recherche mit Maschinenhilfe, Zahlen von Hand geprüft, jeder Satz redigiert. Eine Stunde haben wir uns vorher genommen statt hinterher zwei. Und falls Sie ihn jetzt trotzdem durch einen Detektor jagen wollen, nur zu. Was dabei herauskommt, sagt mehr über den Detektor aus als über uns.