Saltar al contenido

Cómo funciona

No es un modelo al que le pegas un PDF. Es un instrumento construido a partir de revisiones por pares reales y medido como se mide un instrumento — con preregistro, conjunto de validación reservado y juez de otra familia de modelos.

75%de lo que plantean los revisores humanos, detectado — el mejor modelo genérico con un buen prompt: 67%
94%de sus hallazgos tienen eco en lo que dijeron revisores reales del mismo artículo
90%de las citas al manuscrito, verificadas por código — los revisores humanos: 42%

De dónde salen los datos

El corpus

118artículos completos
292informes de revisores reales
100informes codificados
1.423comentarios de revisor, codificados uno a uno

Revisión por pares abierta y publicada — Routledge Open Research (38 artículos · 87 informes) y Open Research Europe (80 · 205). Informes firmados, citables y comprobables por cualquiera.

Qué contiene de verdad un informe de revisor

críticascomentarios neutroselogios
90%de los problemas se arregla escribiendo
3-4%son irreparables sin rehacer el estudio
del informe no pide nada: resumen, andamiaje y valoración global

Coinciden en el destino, no en el camino

65%coinciden dos revisores del mismo artículo en el VEREDICTO (azar: 38%)
≈ azarcoinciden en QUÉ aspectos criticar (solape 0,26 frente a 0,24 por azar)

Es el hallazgo que gobierna el diseño del sistema: qué critica un revisor lo decide más el revisor que el manuscrito; cuánto de grave es el conjunto, lo decide el manuscrito. Por eso el objetivo no es imitar la lista de un revisor concreto — es cubrir el espacio de críticas replicables y acertar el juicio agregado.

Cómo se construyó el instrumento

El método, en tres pasos

  1. 01
    InductivaCuatro pasadas independientes sobre el material, sin categorías previas: qué temas emergen solos.
  2. 02
    CuraciónUn investigador del campo poda, fusiona y define fronteras. De 22 categorías a 7 familias.
  3. 03
    DeductivaSe aplica a ciegas a informes que no se usaron para construirlo. Paso separado, a propósito.
Generar el sistema de categorías y aplicarlo se hicieron en pasos separados, para que el esquema no pudiera justificarse a sí mismo.
22categorías
7familias
3%cae en «otro» — el esquema no deja huecos

Fiabilidad entre codificadores

Un sistema de categorías solo vale si dos codificadores independientes, leyendo lo mismo, coinciden. Se mide con la α de Krippendorff y se publica con su intervalo de confianza — el nuestro, por bootstrap de 3.000 remuestreos.

0,667 — umbral convencionalPolaridad0,8100,747Subsanabilidad0,5570,696Aspecto (7 familias)0,6840,000,250,500,751,00
Ronda 1 (n=100)Ronda 2 (n=75), con intervalo de confianza al 95%

La fila de aspecto muestra las 7 familias, que es el nivel al que el producto trabaja y reporta. Al nivel fino de 22 categorías el acuerdo se quedó en 0,53 —insuficiente— y por eso no se usa. Preferimos decirlo.

Cómo se calculan los intervalos, y qué dice la estabilidad del codificador

Los intervalos al 95% salen de un bootstrap de 3.000 remuestreos sobre las unidades codificadas.

El mismo codificador, releyendo la misma submuestra en tres pasadas, se repite a sí mismo con α = 0,952 · 0,966 · 0,971. Es el dato que separa «el esquema es ambiguo» de «el codificador es ruidoso»: si el desacuerdo entre dos personas fuera ruido del codificador, esta cifra bajaría también. No baja, así que el desacuerdo es ambigüedad del esquema — y eso se puede arreglar.

A nivel de las 7 familias el acuerdo llega a α = 0,684. A nivel de las 22 categorías finas se queda en torno a 0,53, y por eso el sistema no trabaja a ese nivel.

La comprobación que casi nadie hace

Agrupar 22 categorías en 7 sube el acuerdo por sí solo. ¿Y si toda la mejora fuera solo eso, aritmética? Lo probamos contra el azar: 3.000 agrupaciones aleatorias de 22 en 7.

ninguna de las 3.000 agrupaciones al azar superó este punto0,530mediana al azar0,684nuestras 7 familias

La estructura de familias corresponde a algo real del dominio, no al efecto de tener menos categorías.

Cómo analiza tu manuscrito

El análisis, por dentro

01 / 06Manuscrito

Cada versión entra con su diseño detectado — cuantitativo, cualitativo o mixto — y el texto extraído. El fichero original se borra en ese momento.

El cruce de citas contra tu bibliografía lo hace código, no un modelo: las candidatas se calculan de forma determinista y el modelo solo las verifica. Es la diferencia entre «creo que falta esta referencia» y «falta esta referencia».

Qué dicen los benchmarks

Contra el mejor modelo genérico, con preregistro

La pregunta que cualquier investigador se hace: «¿y por qué no le pego el PDF a un chatbot?». La respondimos midiendo — no opinando: modelos genéricos de dos compañías —Claude y ChatGPT, cada uno con dos prompts— contra nuestro sistema, sobre los mismos 20 artículos (~800 comentarios de revisores reales como vara de medir), con los prompts congelados antes de ver un solo resultado, la mitad de los artículos reservados como conjunto de validación, y el emparejamiento juzgado por un modelo de otra familia distinta al nuestro.

Can I Publish75%ChatGPT67%Claude58%% de lo que plantean los revisores, detectadoCan I Publish94%ChatGPT92%Claude90%% de hallazgos con eco en revisores reales
Can I Publishla mejor configuración genérica de cada compañía, con un buen prompt

La métrica de cobertura es el Atomic Recall de PRAIB, reimplementado sobre nuestro corpus de ciencias sociales. La consistencia entre los artículos ya vistos y los reservados fue de ±2 puntos: el resultado no está inflado por familiaridad.

El anclaje: donde no imitamos al revisor, lo superamos

Can I Publish90%Revisores humanos42%
De las citas al manuscrito que cada uno hace, cuántas se localizan literalmente en el texto. Las del sistema las comprueba código, una a una; las marcadas como no localizadas se muestran con su aviso.

Los revisores humanos citan de memoria: solo el 42% de sus citas al manuscrito se localizan literalmente en el texto. Aquí el anclaje no es una costumbre — es una regla comprobada por código en cada hallazgo.

Marco de validez

Toda la evidencia está encuadrada en el estándar de la medición psicométrica — Messick (1995) y los Standards de AERA/APA/NCME (2014). No basta con que un instrumento correlacione: hay que documentar de qué está hecho, cómo se comporta y qué consecuencias tiene sobre quien lo usa.

Qué recibes y qué no

La anatomía de un hallazgo

Rigor metodológico·transparencia analítica·importante

«se alcanzó la saturación teórica tras la vigésima entrevista»

Se afirma saturación pero no con qué criterio se determinó. ¿Qué contó como código nuevo, y cuántas entrevistas sin códigos nuevos se tomaron como umbral? Conviene explicitarlo en Método.

Ejemplo ilustrativo

Ejede qué dimensión habla
Subdimensiónel problema concreto
Polaridadproblema o acierto
Severidadbloqueante · importante · menor
Anclala cita literal que lo justifica
Comentarioqué pasa y qué haría falta

El veredicto general

Es un resumen de la gravedad de lo encontrado, y una recomendación. No predice si te van a aceptar el artículo, y no lo presentamos como tal.

Lo que todavía no hace

No sustituye a un revisor. Una de cada cuatro cuestiones que plantearía sigue escapándose.

Calibrado a ciencias sociales. Fuera de ese ámbito no tenemos evidencia.

Evidencia de revisión abierta. Sobre doble ciego no podemos afirmar nada.

No predice la decisión editorial. Y esa decisión, además, es menos firme de lo que parece:

64 de cada 100. Es lo que coinciden entre sí dos revisores humanos evaluando el mismo manuscrito.Cicchetti (1991). Por eso ninguna herramienta puede predecir la decisión editorial: el criterio que intentaría predecir tampoco es estable.

Corpus y fiabilidad verificados el 29 de julio de 2026; benchmark y anclaje, el 31 de julio de 2026 bajo preregistro. ¿Detectas un error o quieres el detalle metodológico completo? [email protected]