Cómo funciona
No es un modelo al que le pegas un PDF. Es un instrumento construido a partir de revisiones por pares reales y medido como se mide un instrumento — con preregistro, conjunto de validación reservado y juez de otra familia de modelos.
De dónde salen los datos
El corpus
Revisión por pares abierta y publicada — Routledge Open Research (38 artículos · 87 informes) y Open Research Europe (80 · 205). Informes firmados, citables y comprobables por cualquiera.
Qué contiene de verdad un informe de revisor
Coinciden en el destino, no en el camino
Es el hallazgo que gobierna el diseño del sistema: qué critica un revisor lo decide más el revisor que el manuscrito; cuánto de grave es el conjunto, lo decide el manuscrito. Por eso el objetivo no es imitar la lista de un revisor concreto — es cubrir el espacio de críticas replicables y acertar el juicio agregado.
Cómo se construyó el instrumento
El método, en tres pasos
- 01InductivaCuatro pasadas independientes sobre el material, sin categorías previas: qué temas emergen solos.
- 02CuraciónUn investigador del campo poda, fusiona y define fronteras. De 22 categorías a 7 familias.
- 03DeductivaSe aplica a ciegas a informes que no se usaron para construirlo. Paso separado, a propósito.
Fiabilidad entre codificadores
Un sistema de categorías solo vale si dos codificadores independientes, leyendo lo mismo, coinciden. Se mide con la α de Krippendorff y se publica con su intervalo de confianza — el nuestro, por bootstrap de 3.000 remuestreos.
La fila de aspecto muestra las 7 familias, que es el nivel al que el producto trabaja y reporta. Al nivel fino de 22 categorías el acuerdo se quedó en 0,53 —insuficiente— y por eso no se usa. Preferimos decirlo.
Cómo se calculan los intervalos, y qué dice la estabilidad del codificador
Los intervalos al 95% salen de un bootstrap de 3.000 remuestreos sobre las unidades codificadas.
El mismo codificador, releyendo la misma submuestra en tres pasadas, se repite a sí mismo con α = 0,952 · 0,966 · 0,971. Es el dato que separa «el esquema es ambiguo» de «el codificador es ruidoso»: si el desacuerdo entre dos personas fuera ruido del codificador, esta cifra bajaría también. No baja, así que el desacuerdo es ambigüedad del esquema — y eso se puede arreglar.
A nivel de las 7 familias el acuerdo llega a α = 0,684. A nivel de las 22 categorías finas se queda en torno a 0,53, y por eso el sistema no trabaja a ese nivel.
La comprobación que casi nadie hace
Agrupar 22 categorías en 7 sube el acuerdo por sí solo. ¿Y si toda la mejora fuera solo eso, aritmética? Lo probamos contra el azar: 3.000 agrupaciones aleatorias de 22 en 7.
La estructura de familias corresponde a algo real del dominio, no al efecto de tener menos categorías.
Cómo analiza tu manuscrito
El análisis, por dentro
Cada versión entra con su diseño detectado — cuantitativo, cualitativo o mixto — y el texto extraído. El fichero original se borra en ese momento.
El cruce de citas contra tu bibliografía lo hace código, no un modelo: las candidatas se calculan de forma determinista y el modelo solo las verifica. Es la diferencia entre «creo que falta esta referencia» y «falta esta referencia».
Qué dicen los benchmarks
Contra el mejor modelo genérico, con preregistro
La pregunta que cualquier investigador se hace: «¿y por qué no le pego el PDF a un chatbot?». La respondimos midiendo — no opinando: modelos genéricos de dos compañías —Claude y ChatGPT, cada uno con dos prompts— contra nuestro sistema, sobre los mismos 20 artículos (~800 comentarios de revisores reales como vara de medir), con los prompts congelados antes de ver un solo resultado, la mitad de los artículos reservados como conjunto de validación, y el emparejamiento juzgado por un modelo de otra familia distinta al nuestro.
La métrica de cobertura es el Atomic Recall de PRAIB, reimplementado sobre nuestro corpus de ciencias sociales. La consistencia entre los artículos ya vistos y los reservados fue de ±2 puntos: el resultado no está inflado por familiaridad.
El anclaje: donde no imitamos al revisor, lo superamos
Los revisores humanos citan de memoria: solo el 42% de sus citas al manuscrito se localizan literalmente en el texto. Aquí el anclaje no es una costumbre — es una regla comprobada por código en cada hallazgo.
Marco de validez
Toda la evidencia está encuadrada en el estándar de la medición psicométrica — Messick (1995) y los Standards de AERA/APA/NCME (2014). No basta con que un instrumento correlacione: hay que documentar de qué está hecho, cómo se comporta y qué consecuencias tiene sobre quien lo usa.
Qué recibes y qué no
La anatomía de un hallazgo
«se alcanzó la saturación teórica tras la vigésima entrevista»
Se afirma saturación pero no con qué criterio se determinó. ¿Qué contó como código nuevo, y cuántas entrevistas sin códigos nuevos se tomaron como umbral? Conviene explicitarlo en Método.
Ejemplo ilustrativo
El veredicto general
Es un resumen de la gravedad de lo encontrado, y una recomendación. No predice si te van a aceptar el artículo, y no lo presentamos como tal.
Lo que todavía no hace
No sustituye a un revisor. Una de cada cuatro cuestiones que plantearía sigue escapándose.
Calibrado a ciencias sociales. Fuera de ese ámbito no tenemos evidencia.
Evidencia de revisión abierta. Sobre doble ciego no podemos afirmar nada.
No predice la decisión editorial. Y esa decisión, además, es menos firme de lo que parece:
Corpus y fiabilidad verificados el 29 de julio de 2026; benchmark y anclaje, el 31 de julio de 2026 bajo preregistro. ¿Detectas un error o quieres el detalle metodológico completo? [email protected]