In der Schule, im Studium oder bei der Arbeit – jeder ist wahrscheinlich schon einmal mit Künstlicher Intelligenz (KI) in Berührung gekommen. Vor allem bei wissenschaftlichen Arbeiten ist es von enormer Relevanz, KI- und plagiatsfreie Texte zu erstellen, da diese als Prüfungsleistung eingereicht werden. Wenn die Universität einen KI-Detektor benutzt, kostet es im schlimmsten Fall den Abschluss.
Doch wie genau diese KI-Scanner eigentlich funktionieren und ob man sich auf sie verlassen kann, klären wir in diesem Beitrag.
Was sind KI-Detektoren / KI-Scanner?
KI-Texterkennung soll einen Text darauf untersuchen, ob dieser mit Hilfe künstlicher Intelligenz erstellt wurde oder nicht. Technische Lösungen dafür gibt es viele auf dem Markt: Turnitin, ZeroGPT, GPT Zero und Originality.AI sind wahrscheinlich die bekanntesten unter ihnen und werden weltweit von Privatpersonen, aber auch Hochschulen genutzt.
Wie nutzt man KI-Detektoren?
In ihrer Bedienung sind diese Tools recht einfach: Man fügt seinen Text in das Programm ein und erhält anschließend eine Auswertung in Form einer Prozentzahl von 1 bis 100. Diese gibt dann an, wie wahrscheinlich es ist, dass der Text KI-generiert bzw. menschlich ist. In der Praxis gibt es teilweise erhebliche Schwankungen in den Ergebnissen, je nachdem, welches Tool man verwendet.
Wie funktionieren KI-Scanner?
KI-Detektoren benutzen ähnliche Sprachmodelle wie die KI-Textgeneratoren (z. B. ChatGPT). Dabei wird immer mit Wahrscheinlichkeiten gearbeitet. Die Maschine prüft also, wie wahrscheinlich es ist, dass bestimmte Wörter aufeinander folgen.
Es gibt hier zwei relevante Metriken für die KI-Erkennung:
- Perplexität (engl. perplexity = Verwirrung)
- Burstiness (engl. to burst = aufbrechen)
Beide Eigenschaften sind einfach gesagt sehr menschlich. Wenn ein Text also ein hohes Maß an Perplexität und Burstiness aufweist, ist er erwartungsgemäß eher von einem Menschen geschrieben als von einer KI.
Was bedeutet Perplexität?
Praktisch kann man sich dies mit einem Beispiel veranschaulichen. Wie würde man diesen Satz sehr wahrscheinlich beenden:
- „Ich habe heute verschlafen, weil …“
Das Level an Perplexität ist wohl eher niedrig bei folgendem Ausgang:
- „Ich habe heute verschlafen, weil mein Wecker nicht geklingelt hat“.
Einen hohen Grad an Perplexität weist im Gegenzug etwa diese Formulierung auf:
- „Ich habe heute verschlafen, weil der Teller ecklig ist“
Hier ist sogar noch ein Rechtschreibfehler/Tippfehler enthalten. Somit würde dieser Satz wahrscheinlich als menschlich eingestuft werden.
Was ist Burstiness?
Mit dieser Metrik misst man die Variation in Satzstruktur und Satzlänge. Gibt es also kaum Variationen in Länge und Struktur des Satzes, ist der Text sehr wahrscheinlich von einer KI erstellt worden.
Gibt es allerdings verschachtelte Sätze – wie es bei wissenschaftlichen Arbeiten häufig zu lesen ist – und enthalten diese sogar noch verschiedene Satzzeichen wie Gedankenstriche oder Semikolons, dann vermutet der Scanner hier wohl eher einen menschlichen Texter.
Wie erkennt man KI-generierte Texte?
Hier ist es sinnvoll, eine kleine Auflistung vorzunehmen mit typischen Eigenschaften eines KI-generierten Textes, bei dem keine bestimmten Prompts zur Vermeidung dessen formuliert wurden:
- Es gibt keine Rechtschreib- oder Grammatikfehler.
- Der Text ist einheitlich formatiert und es gibt immer wieder typische Absätze, an deren Anfang eine zusammenfassende Wortgruppe steht.
- Der Text enthält wenig variable Satzzeichen (Gedankenstriche, Anführungszeichen etc.)
- Die Sätze sind kurz und prägnant und nicht verschachtelt.
- Nichtssagende Satzanfänge wie „Es ist wichtig zu beachten, dass…“
- Argumente werden oft wiederholt und es geht inhaltlich nicht in die Tiefe.
- Der Wortschatz ist begrenzt und Wörter werden wiederholt.
- Jargon, Dialekte, Jugend- oder Umgangssprache wird nicht verwendet.
- Es gibt keinen eigenen erkennbaren Stil.
- Es gibt keine Wortneuschöpfungen (Neologismen) oder ungewöhnliche Wortzusammensetzungen (Komposita)
- Zahlen kommen selten vor.
Sind KI-Detektoren zuverlässig?
Es gibt mittlerweile immer mehr wissenschaftliche Studien, deren Ergebnisse genau daran zweifeln lassen. Eine Auswahl mit entsprechenden Abstracts findet ihr hier:
- https://arxiv.org/abs/2306.15666?utm_source=chatgpt.com
- https://arxiv.org/abs/2403.19148
- https://arxiv.org/abs/2303.11156?utm_source=chatgpt.com
Aber auch im Selbstversuch kann man die Detektoren prüfen. Der Bayerische Rundfunk hat dies zum Beispiel mit einer echten Doktorarbeit probiert und die Tools Genaios und Scribbr gaben an, dass sie KI-generiert sei.
Solche „False Positive„-Ergebnisse zeigte auch eine Studie mit GPTZero, bei der jeder 10. menschliche Text fälschlicherweise als KI-generiert deklariert wurde. Selbst OpenAI, also das Unternehmen hinter ChatGPT, nahm im Juli 2023 seinen hauseigenen KI-Detektor den AI Classifier offline. Auch hier war die niedrige Genauigkeit des Tools der Grund.
So kann man KI-Detektoren also austricksen
Formuliert man eine relativ einfache Aufgabe für die KI zum Beispiel „Schreibe mir ein Fazit für meine Bachelorarbeit“, dann wird der KI-Scanner bei dem ausgegebenen Text sehr zuverlässig anschlagen. Wenn man diese sogenannten Prompts aber umändert und die KI zum Beispiel bittet, kleine Rechtschreibfehler einzufügen oder Unregelmäßigkeiten wie unterschiedliche Satzlängen, dann werden die Detektoren immer hilfloser. Rechtschreib- und Grammatikfehler sind unlogische Wortfolgen sorgen für niedrige KI-Raten. In manchen Fällen weisen sie den Text sogar als 100% menschlich aus. Dieses Vorgehen ist allerdings nicht zu empfehlen, da solche Texte auch nicht gut bewertet werden.
Wird es in Zukunft bessere KI-Tools geben?
Genauso wie die KI-Textgeneratoren selbst entwickeln sich auch die KI-Detektoren weiter. Allerdings ist es fraglich, ob sie den jeweiligen Stand der Programme irgendwann übertreffen. OpenAI hat daran gearbeitet, ein Wasserzeichen-Tool für ChatGPT zu entwickeln, allerdings ist es fraglich, ob dies wirklich veröffentlicht wird. Außerdem ist unklar, ob das Wasserzeichen, das ChatGPT automatisch in die ausgegebenen Texte einfügt, auch noch bei umgeschriebenem Text bestehen bleibt. Wahrscheinlich braucht es in naher Zukunft Regulierungen von staatlicher Seite, die auch immer wieder gefordert werden.


