MGTD-Benchmark (ICAIE, 2025)– the biggest and most robust benchmark for AI checkers, consisting of 15 different datasets. Authors collected over 2M samples and measured quality or popular AI detectors. It's AI took the first place mit über 92 % Roc-Auc-Score.

RAID (ACL-Papier, 2024) ist ein weiterer wichtiger Maßstab für die Bewertung von KI-Detektoren, wenn auch schon etwas veraltet, da er im August 2024 veröffentlicht wurde. Er enthält über 600.000 Textbeispiele, die von 11 verschiedenen Modellen in 8 Domänen in seiner Testaufteilung generiert wurden.

Wir haben It's AI in ihre offizielle Quelle eingereicht Bestenliste und erreichte 98,3 % Genauigkeit.
GPT Reddit-Datensatz (GRiD) besteht aus Kontext-Prompt-Paaren, die von Reddit stammen und Antworten enthalten, die von Menschen generiert und von ChatGPT generiert wurden.
Der HC3 (Menschlicher ChatGPT-Vergleichskorpus) Der Datensatz besteht aus fast 40.000 Fragen und den entsprechenden menschlichen/ChatGPT-Antworten.
Der GhostBusters Der Datensatz nutzt das GPT-3.5-Turbo-Modell zur Generierung von Texten in den Bereichen kreatives Schreiben, Nachrichten und studentische Aufsätze.
Im Durchschnitt erzielte It's AI bei diesen 3 Datensätzen 99,1 % Genauigkeit und 96 % f1-Scoreund übertraf damit alle in den Papieren berücksichtigten Detektoren (kommerzielle Detektoren wurden dort nicht bewertet).
Falsch-Positiv-Rate (FPR) ist eine weitere wichtige Kennzahl, die wir berücksichtigen sollten, wenn wir über KI-Erkennung sprechen. Es gibt an, wie viele Texte, die tatsächlich von Menschen geschrieben wurden, versehentlich als KI gekennzeichnet werden.
Ein niedriger FPR ist besonders kritisch für die Bildung, wenn es besser ist, ein paar KI-generierte Werke zu übersehen, anstatt Schülern falsche Vorwürfe zu machen, die selbst Texte geschrieben haben. Aus diesem Grund haben wir uns entschieden, zusätzlich zu früheren Benchmarks auch die bildungsbezogenen Aspekte zu messen ASAP 2.0-Datensatz.
Das ASAP 2.0-Korpus umfasst 25.000 überzeugende Aufsätze von Studenten, die aus standardisierten Schreibtests stammen. Die Aufsätze wurden ausgewählt, um die Menge an demografischen Informationen zu maximieren, die für jeden Autor verfügbar sind, einschließlich des Status beim Erlernen der englischen Sprache (ELL), des wirtschaftlichen Hintergrunds (benachteiligt oder nicht), des Behinderungsstatus, der Rasse/ethnischen Zugehörigkeit, des Geschlechts und der Klassenstufe.
It's AI schien diese Texte in weniger als 1 % der Fälle falsch zu klassifizieren FPR entspricht 0,8 %.
It's AI unterstützt die KI-Erkennung in arabischer Sprache vollständig. Wir haben es an mehreren arabischen Benchmarks gemessen und Sie können die Ergebnisse unten finden:
ASJP – wissenschaftliche Arbeiten. Dieser Datensatz enthält maschinengenerierten arabischen Text über mehrere Generierungsmethoden und Large Language Model (LLMs). Es wurde im Rahmen der Forschungsarbeit „The Arabic AI Fingerprint: Stylometrische Analyse und Erkennung von Texten großer Sprachmodelle“ erstellt.
XL-SUMME– Arabische Nachrichten. XLSum ist ein umfassender und vielfältiger Datensatz, der 1,35 Millionen professionell kommentierte Artikel-Zusammenfassungspaare der BBC umfasst und mithilfe einer Reihe sorgfältig entwickelter Heuristiken extrahiert wurde. Der Datensatz deckt 45 Sprachen ab, darunter Arabisch, von ressourcenarm bis ressourcenintensiv, für viele davon ist derzeit kein öffentlicher Datensatz verfügbar. XL-Sum ist hochabstrakt, prägnant und von hoher Qualität, wie die menschliche und intrinsische Bewertung zeigt.
Gesamt, It's AI wurde ein neues SOTA-Modell (State-of-the-Art). beim MGTD-Benchmark, übertraf andere KI-Detektoren und zeigte eine signifikante Leistung bei den Datensätzen RAID, GRiD, HC3, GhostBuster, ASAP 2.0, ASJP und XL-SUM, was dies beweist Konstanz und Zuverlässigkeit.
