Rico EberleDübendorf, zur Startseite

KI-Detektoren sind kein Beweis

Warum schon ein Prozent Fehlalarm viele ehrliche Lernende trifft, was Studien über KI-Detektoren zeigen und was im Unterricht stattdessen hilft.

Read in English

Auch auf YouTube (neues Fenster)

Transkript anzeigen

99 Prozent Genauigkeit. Klingt nach einem zuverlässigen KI-Detektor. Rechnen wir kurz nach.

Eine Schule prüft 1000 Aufsätze, die alle ehrlich geschrieben wurden. Ein Prozent Fehlalarm heisst: Zehn Lernende stehen unter Verdacht, obwohl sie nichts falsch gemacht haben. Zehn schwierige Gespräche, zehn Mal beschädigtes Vertrauen. Und das ist ein Rechenbeispiel mit einem sehr optimistischen Wert.

Denn in der Praxis sind die Detektoren deutlich schlechter. Eine Studie hat 2023 vierzehn Tools getestet. Ihr Fazit: weder genau noch zuverlässig. Eine andere Studie zeigte: Texte von Menschen, die nicht in ihrer Muttersprache schreiben, werden besonders häufig als KI markiert. Und OpenAI hat seinen eigenen Detektor wieder eingestellt, wegen zu geringer Genauigkeit.

Ein Detektor-Ergebnis ist also kein Beweis. Was stattdessen hilft: den Entstehungsprozess sichtbar machen, mit Entwürfen und Notizen. Das Gespräch über den Text suchen. Und Aufgaben so stellen, dass eigenes Denken gefragt ist.

Vertrauen entsteht nicht durch Software, sondern durch gute Aufgaben.

Seit Sprachmodelle ganze Aufsätze schreiben, wächst der Wunsch nach einem Werkzeug, das auf Knopfdruck sagt: Das war die KI. Anbieter von KI-Detektoren versprechen genau das, oft mit beeindruckenden Prozentzahlen. Das Problem liegt nicht nur darin, dass diese Zahlen in der Praxis selten halten. Es liegt schon in der Rechnung selbst.

Ein Prozent klingt wenig, bis man nachrechnet

Nimm an, ein Detektor liegt in 99 Prozent der Fälle richtig. Deine Schule lässt 1000 Aufsätze prüfen, und alle sind ehrlich geschrieben. Ein Prozent Fehlalarm heisst dann: Zehn Lernende stehen unter Verdacht, obwohl sie nichts falsch gemacht haben.

Folie «1000 ehrliche Aufsätze»: ein Raster aus 1000 Punkten, zehn davon rot markiert. Daneben «1 % Fehlalarm = 10 falsche Verdächtigungen» und der Hinweis «Rechenbeispiel mit optimistischem Wert».

Schon bei 99 Prozent Genauigkeit geraten von 1000 ehrlichen Aufsätzen zehn unter Verdacht.

Das Entscheidende an dieser Rechnung: Die Fehlalarme wachsen mit der Menge. Je mehr Texte geprüft werden, desto mehr Unschuldige trifft es, auch wenn der Prozentsatz gleich bleibt. Und jeder dieser Fälle ist ein schwieriges Gespräch, bei dem Vertrauen auf dem Spiel steht. Dabei ist 99 Prozent ein bewusst optimistischer Wert.

Was die Forschung zeigt

In der Praxis schneiden die Werkzeuge deutlich schlechter ab. Eine Forschungsgruppe um Weber-Wulff hat 2023 vierzehn Detektoren getestet. Ihr Fazit: Die Tools sind weder genau noch zuverlässig.

Folie «In der Praxis schlechter» mit drei Karten: «14 Tools getestet: ‹weder genau noch zuverlässig›» (Weber-Wulff et al., 2023), «Nicht in der Muttersprache geschrieben: besonders oft als KI markiert» (Liang et al., 2023), «OpenAI: eigenen Detektor eingestellt» (OpenAI, 2023).

Drei Befunde aus der Forschung zu KI-Detektoren.

Eine zweite Studie von Liang und Kollegen zeigt ein Fairness-Problem. Englische Texte von Menschen, die nicht in ihrer Muttersprache schreiben, werden besonders häufig als KI markiert. Untersucht wurden englische Aufsätze, unter anderem aus dem Sprachtest TOEFL; ob das für Deutsch als Zweitsprache genauso gilt, sagt die Studie nicht. Im Video ist das verkürzt. Die Forschenden vermuten, dass die Detektoren Menschen mit eingeschränkterem sprachlichem Ausdruck unbeabsichtigt benachteiligen. Sie raten ausdrücklich davon ab, solche Werkzeuge in Bewertungs- und Bildungssituationen einzusetzen.

Und selbst OpenAI, das Unternehmen hinter ChatGPT, hat seinen eigenen Detektor im Juli 2023 wieder eingestellt, wegen zu geringer Genauigkeit.

Was stattdessen hilft

Ein Detektor-Ergebnis ist kein Beweis. Es kann höchstens ein Anlass sein, genauer hinzuschauen. Was im Alltag mehr bringt, sind meine drei Empfehlungen aus dem Video:

  1. Den Entstehungsprozess sichtbar machen. Entwürfe, Notizen und Zwischenstände gehören zur Abgabe. Wer einen Text selbst entwickelt hat, kann diesen Weg zeigen.
  2. Das Gespräch über den Text suchen. Nicht als Verhör, sondern als Teil der Beurteilung: Warum dieser Aufbau? Was war schwierig?
  3. Aufgaben so stellen, dass eigenes Denken gefragt ist. Zum Beispiel mit Bezug auf den eigenen Unterricht, eigene Erfahrungen oder eine begründete Entscheidung.

Folie «Kein Beweis. Was stattdessen hilft»: 1. Entstehungsprozess sichtbar machen: Entwürfe, Notizen. 2. Das Gespräch über den Text suchen. 3. Aufgaben stellen, die eigenes Denken verlangen.

Drei Wege, die mehr bringen als ein Detektor-Ergebnis.

Eine Übung fürs Kollegium

Mein Vorschlag für die nächste Teamsitzung: Schätzt gemeinsam, wie viele schriftliche Arbeiten an eurer Schule pro Semester abgegeben werden. Rechnet dann mit einem Prozent Fehlalarm, also dem optimistischen Wert. Die Zahl, die dabei herauskommt, sind die Gespräche mit ehrlichen Lernenden, die ihr führen müsstet. Danach lohnt sich die Frage: Welche Aufgaben in unserem Alltag würden einen Detektor überflüssig machen?

Vertrauen entsteht nicht durch Software, sondern durch gute Aufgaben.

Häufige Fragen

Wie zuverlässig sind KI-Detektoren?

Wenig. Eine Forschungsgruppe um Weber-Wulff testete 2023 vierzehn Detektoren und kam zum Schluss, dass sie weder genau noch zuverlässig sind. OpenAI hat seinen eigenen Detektor im Juli 2023 wegen zu geringer Genauigkeit eingestellt.

Ist das Ergebnis eines KI-Detektors ein Beweis?

Nein, höchstens ein Anlass, genauer hinzuschauen. Selbst bei optimistischen 99 Prozent Genauigkeit stünden von 1000 ehrlich geschriebenen Aufsätzen zehn Lernende zu Unrecht unter Verdacht.

Benachteiligen KI-Detektoren Menschen, die nicht in ihrer Muttersprache schreiben?

Für englische Texte ja: Laut einer Studie von Liang und Kollegen (2023) werden englische Texte von Menschen, die nicht in ihrer Muttersprache schreiben, besonders häufig als KI markiert. Für Deutsch als Zweitsprache hat die Studie das nicht untersucht. Die Forschenden raten davon ab, Detektoren in Bewertungs- und Bildungssituationen einzusetzen.

Learning Nugget einbetten

Für Lernplattformen, Blogs und Schul-Websites. Inhalte unter CC BY 4.0.

Über den Autor

Rico Eberle

Rico Eberle ist E-Learning-Experte, Betriebsökonom FH und Gemeinderat in Dübendorf. Er präsidiert den Stiftungsrat der Stiftung Weiterbildungskurse Dübendorf (WBK). In den Learning Nuggets erklärt er Forschung zu Lernen, KI und digitaler Souveränität kurz und mit Quellen.

Text, Transkript und Video von Rico Eberle unter CC BY 4.0 (ohne Musik und Soundeffekte). Für den Unterricht frei verwendbar: Weiterverwenden und offene Daten.