Exactitud y evaluaciones

¿Qué tan exacto es It’s AI al detectar textos de IA en español?

Evaluamos la detección en español con DetectRL⁠-⁠X y medimos los falsos positivos por separado en más de 20.000 textos auténticos de estudiantes de español del corpus CAES.

Detección de textos de IA

DetectRL-XACL 2026
96,0 %
de exactitud en DetectRL⁠-⁠X
Benchmark multilingüe que abarca ámbitos de uso real, modelos generativos recientes y operaciones de edición.

Falsos positivos en textos humanos

CAESTextos de estudiantes de español
0,72 % FPR
en 20.629 textos auténticos de estudiantes de español
Corpus de estudiantes de español utilizado para evaluar los falsos positivos

Evaluado por terceros independientes

El rendimiento de It’s AI está respaldado por investigaciones publicadas y evaluaciones independientes. Nuestros resultados en MGTD aparecen en un estudio revisado por pares, y el resultado en RAID figura en la clasificación pública oficial. Ambas evaluaciones miden la detección en inglés.

MGTD · ICAIE 2025

El detector de IA más exacto según MGTD

MGTD reúne 15 conjuntos de datos de referencia y casi 2 millones de muestras de prueba para comparar directamente los principales detectores de IA. It’s AI obtuvo el mayor valor ROC-AUC, por delante de GPTZero, Originality AI, ZeroGPT y los demás sistemas evaluados.

  • 15 conjuntos de datos
  • Casi 2 millones de muestras
  • Comparación de varios detectores
Leer el estudio de MGTD
Clasificación de MGTD que compara los valores ROC-AUC de los detectores de IA
Clasificación de MGTD
RAID · ACL 2024

98,3 % de exactitud en la clasificación oficial de RAID

RAID somete a los detectores de IA a pruebas de robustez con distintos grandes modelos de lenguaje, ámbitos de escritura, parámetros de decodificación y modificaciones diseñadas para eludir la detección: paráfrasis, errores ortográficos, caracteres visualmente similares, manipulación de espacios y otras alteraciones realistas.

  • Más de 6 millones de textos generados
  • 11 grandes modelos de lenguaje
  • 8 ámbitos
  • 11 tipos de ataques
Ver la clasificación oficial de RAID
Benchmark RAID: modelos, ámbitos, decodificación y modificaciones adversarias
Diseño del benchmark RAID

Resultados de las evaluaciones en español

Cada benchmark enlaza al estudio, al conjunto de datos o a la página oficial correspondiente.

BenchmarkQué evalúaMuestrasResultado de It’s AI
DetectRL-X
Benchmark multilingüe de uso real
Detección de textos de IA en seis ámbitos11.997 textos
96,0 % Exactitud
CAES
Textos auténticos de estudiantes de español
Falsos positivos en textos humanos20.629 textos de estudiantes de español
0,72 % FPR

Metodología

Presentamos las métricas de cada conjunto de datos por separado, sin promediar benchmarks que miden tareas diferentes.

Criterios de evaluación

Las evaluaciones por idioma utilizan la configuración del detector desplegado en el producto cuando corresponde. Los resultados de benchmarks y clasificaciones de terceros siguen el protocolo publicado por cada uno.

Longitud mínima de texto admitida

Cuando es necesario filtrar los datos, las pruebas con textos humanos aplican el mínimo de 200 caracteres exigido por It’s AI. Así, los textos que la propia aplicación rechazaría no distorsionan la tasa de falsos positivos publicada.

Definición de las métricas

La exactitud (accuracy) es la proporción de clasificaciones correctas en conjuntos que incluyen textos humanos y generados por IA. La tasa de falsos positivos (FPR) indica con qué frecuencia se clasifican erróneamente textos humanos auténticos como generados por IA. ROC-AUC, el área bajo la curva ROC, mide la capacidad del detector para distinguir ambas clases a través de distintos umbrales de decisión.

Revisa tu texto antes de entregarlo o publicarlo

Analiza posibles señales de IA
Comprueba posibles coincidencias
Revisa la redacción
originality