Précision

Puis-je faire confiance à cet outil ?

Décidez vous-même !

Le détecteur AI le plus précis selon le benchmark MGTD

Benchmark MGTD (ICAIE, 2025)– le benchmark le plus grand et le plus robuste pour les vérificateurs d'IA, composé de 15 ensembles de données différents. Les auteurs ont collecté plus de 2 millions d'échantillons et mesuré la qualité des détecteurs d'IA populaires. It's AI a pris la première place avec plus de 92 % de score Roc-Auc.

MGTD benchmark ROC-AUC
Le benchmark MGTD, source

RAID

RAID (ACL paper, 2024) est une autre référence importante pour l'évaluation des détecteurs d'IA, bien que déjà un peu obsolète, car elle a été publiée en août 2024. Il contient plus de 600 000 échantillons de texte générés par 11 modèles différents dans 8 domaines dans sa répartition de test.

RAID benchmark
Paramètres de référence RAID

Nous avons soumis It's AI dans leur classement officiel et avons obtenu 98,3 % de précision.

99 % de précision sur GRiD, HC3, GhostBuster

GRiD

GPT Reddit Ensemble de données (GRiD) se compose de paires d'invites contextuelles provenant de Reddit, présentant des réponses générées par des humains et générées par ChatGPT.

HC3

Le HC3 (Corpus de comparaison ChatGPT humain) l'ensemble de données comprend près de 40 000 questions et leurs réponses humaines/ChatGPT correspondantes.

GhostBusters

L'ensemble de données GhostBusters exploite le Modèle GPT-3.5-turbo pour générer des textes dans les domaines de l'écriture créative, des actualités et des essais d'étudiants.

En moyenne sur ces 3 ensembles de données It's AI a pris 99,1% de précision et 96% de score f1, surpassant tous ceux pris en compte dans les détecteurs papiers (les détecteurs commerciaux n'y ont pas été notés).

0,8% de taux de faux positifs sur ASAP 2.0

Taux de faux positifs (FPR) est une autre mesure importante que nous devrions prendre en compte lorsque nous parlons de détection de l'IA. Cela représente combien de textes réellement écrits par des humains seront signalés par erreur comme IA.

Un faible FPR est particulièrement critique pour l'éducation, car il est préférable de manquer quelques travaux générés par l'IA au lieu de faussement accuser les étudiants, qui ont écrit le texte par eux-mêmes. C'est pourquoi, en plus des critères de référence précédents, nous avons décidé de le mesurer sur le plan de l'éducation. Ensemble de données ASAP 2.0.

Le corpus ASAP 2.0 comprend 25 000 essais convaincants d'étudiants tirés de tests d'écriture standardisés. Les essais ont été sélectionnés pour maximiser la quantité d'informations démographiques disponibles pour chaque écrivain, y compris le statut d'apprentissage de l'anglais (ELL), le contexte économique (défavorisé ou non), le statut de handicap, la race/origine ethnique, le sexe et le niveau scolaire.

It's AI a semblé mal classer ces textes dans moins de 1 % des cas avec FPR égal à 0,8 %

0,8 % FPR
sur l'ensemble de données ASAP 2.0

Évaluation de la langue arabe

It's AI prend entièrement en charge la détection de l'IA en langue arabe. Nous l'avons mesuré sur plusieurs références arabes et vous pouvez trouver leurs résultats ci-dessous :

98.7%
précision
0.5%
FPR

ASJP – articles scientifiques. Cet ensemble de données contient du texte arabe généré automatiquement selon plusieurs méthodes de génération et un grand modèle linguistique (LLM). Il a été créé dans le cadre du document de recherche "L'empreinte digitale de l'IA arabe : analyse stylométrique et détection de textes de modèles de langage larges".

It's AI a atteint une précision de 98,7 % avec 0,5% FPR sur ASJP.

XL-SUM– Actualités arabes. XLSum est un ensemble de données complet et diversifié comprenant 1,35 million de paires article-résumé annotées professionnellement de la BBC, extraites à l'aide d'un ensemble d'heuristiques soigneusement conçues. L'ensemble de données couvre 45 langues, dont l'arabe, allant de faibles à élevées, pour lesquelles aucun ensemble de données publiques n'est actuellement disponible. XL-Sum est très abstrait, concis et de haute qualité, comme l'indique l'évaluation humaine et intrinsèque.

It's AI a parfaitement classé XL-SUM comme corpus entièrement écrit par l'homme, donc le FPR est de 0 % dessus.

It's AI — Une précision inégalée à laquelle vous pouvez faire confiance

Dans l'ensemble, It's AI est devenu un nouveau modèle SOTA (état de l'art) sur le benchmark MGTD, surpassant les autres détecteurs AI et a démontré une performance significative sur les ensembles de données RAID, GRiD, HC3, GhostBuster, ASAP 2.0, ASJP et XL-SUM, prouvant sa cohérence et fiabilité.

Essayez-le par vous-même

Assurez l'originalité de votre travail

Détecter l'IA
Trouver du plagiat
Améliorer les textes
originality