Prueba comparativa MGTD (ICAIE, 2025): la prueba comparativa más grande y sólida para verificadores de IA, que consta de 15 conjuntos de datos diferentes. Los autores recopilaron más de 2 millones de muestras y midieron la calidad de los detectores de IA populares. It's AI ocupó el primer lugar con más del 92% de puntuación Roc-Auc.

RAID (documento ACL, 2024) es otro gran punto de referencia para la evaluación de detectores de IA, aunque ya un poco desactualizado, porque se publicó en agosto de 2024. Contiene más de 600.000 muestras de texto generadas por 11 modelos diferentes en 8 dominios en su división de prueba.

Hemos enviado It's AI a su tabla de clasificación oficial y obtuvimos 98,3% de precisión.
Conjunto de datos de Reddit GPT (GRiD) consta de pares de indicaciones de contexto procedentes de Reddit, que presentan respuestas generadas por humanos y generadas por ChatGPT.
El HC3 (Corpus de comparación de ChatGPT humanos) el conjunto de datos consta de casi 40.000 preguntas y sus correspondientes respuestas humanas/ChatGPT.
El Cazafantasmas el conjunto de datos aprovecha el Modelo GPT-3.5-turbo para generar textos en los dominios de escritura creativa, noticias y ensayos de estudiantes.
En promedio en estos 3 conjuntos de datos It's AI tomó 99,1% de precisión y 96% de puntuación f1, superando a todos los detectores considerados en los artículos (los detectores comerciales no fueron calificados allí).
Tasa de falsos positivos (FPR) es otra métrica importante que debemos considerar cuando hablamos de detección de IA. Representa cuántos textos que en realidad están escritos por humanos se marcarán por error como IA.
Un FPR bajo es especialmente crítico para la educación, cuando es mejor perderse un par de trabajos generados por IA en lugar de acusar falsamente a los estudiantes, que escribieron textos por sí mismos. Es por eso que, además de los puntos de referencia anteriores, decidimos medirlo en los aspectos relacionados con la educación. Conjunto de datos ASAP 2.0.
El corpus ASAP 2.0 comprende 25.000 ensayos de estudiantes persuasivos tomados de pruebas de escritura estandarizadas. Los ensayos se seleccionaron para maximizar la cantidad de información demográfica disponible para cada escritor, incluido el estado de aprendizaje del idioma inglés (ELL), los antecedentes económicos (desfavorecidos o no), el estado de discapacidad, la raza/etnia, el género y el nivel de grado.
It's AI pareció clasificar erróneamente estos textos en menos del 1% de los casos con FPR igual al 0,8%.
It's AI es totalmente compatible con la detección de IA en idioma árabe. Lo hemos medido en varios puntos de referencia árabes y puede encontrar sus resultados a continuación:
ASJP – artículos científicos. Este conjunto de datos contiene texto árabe generado por máquina a través de múltiples métodos de generación y modelos de lenguaje grande (LLM). Fue creado como parte del artículo de investigación "La huella digital de IA árabe: análisis estilométrico y detección de texto de modelos lingüísticos grandes".
XL-SUM– Noticias árabes. XLSum es un conjunto de datos completo y diverso que comprende 1,35 millones de pares de resúmenes de artículos anotados profesionalmente de la BBC, extraídos mediante un conjunto de heurísticas cuidadosamente diseñadas. El conjunto de datos cubre 45 idiomas, incluido el árabe, que van desde bajos hasta altos recursos, para muchos de los cuales no hay ningún conjunto de datos públicos disponible actualmente. XL-Sum es altamente abstracto, conciso y de alta calidad, como lo indica la evaluación humana e intrínseca.
En general, It's AI se convirtió en un nuevo modelo SOTA (de última generación) en el punto de referencia MGTD, superando a otros detectores de IA y demostró un rendimiento significativo en los conjuntos de datos RAID, GRiD, HC3, GhostBuster, ASAP 2.0, ASJP y XL-SUM, lo que demuestra su consistencia y confiabilidad.
