Qué afirmamos
- Sensibilidad de seguridad del cribado: 96,8 % agrupada en las 4 revisiones de la validación (91/94 estudios conservados): 95,6 % en los conjuntos de validación y 98,0 % en dos revisiones sistemáticas nuevas no vistas (una al 100 %). «Sensibilidad de seguridad» = porcentaje de los estudios realmente incluidos por la revisión original que nuestro cribado conserva (como «incluir» o «revisar») en la fase de resumen. La duda se deriva a una persona, nunca al silencio. Que esas dos revisiones fueran nuevas y no vistas es la parte que más nos importa. Fijamos dos revisiones como prueba antes de medir y después añadimos otras dos que no habían intervenido en el diseño. Sin ese corte, un número alto solo demuestra que el sistema aprendió a aprobar su propio examen.
- Carga de revisión humana: del 9 % al 26 % según el corpus, ajustable por proyecto mediante la banda de incertidumbre. No prometemos un número único porque depende del ruido del corpus, y lo decimos.
- Sensibilidad de la búsqueda (recall): del 7 % al 60 % según el corpus en la validación de junio, medida entonces con una sola base (nuestras variantes de OpenAlex). Hoy la búsqueda ejecuta cuatro bases (PubMed, Europe PMC, OpenAlex y ClinicalTrials.gov) y sus consultas pasan pruebas automáticas que hoy conservan 47/47 estudios de referencia en 6 revisiones de contraste, el mismo resultado que la consulta escrita a mano por un experto (ver «Validación continua»). La re-medición completa de aquel corpus de revistas regionales con las cuatro bases está pendiente; hasta que exista, el dato de junio sigue publicado abajo tal cual.
Por qué no publicamos un criterio de parada
Las herramientas de cribado por priorización aprenden de tus decisiones y reordenan la lista para que lo relevante suba. Después necesitan una regla que diga cuándo dejar de leer: cincuenta irrelevantes seguidos, un porcentaje del corpus, una estimación de cuántos quedan. Esa regla es de donde sale el ahorro, y también de donde sale el riesgo: lo que no se lee no se ve, así que un corte prematuro no deja rastro.
En 2026 se publicaron dos trabajos que lo cuantifican. Uno evaluó quince métodos de parada sobre ochenta y un conjuntos de datos reales y concluyó que casi todos, o paran tan tarde que no ahorran, o paran tan pronto que pierden estudios; solo uno alcanza su objetivo de recall de forma fiable, y lo hace parando muy conservador. El otro repitió una revisión ya publicada de 4.690 registros con una herramienta de priorización muy usada, dejando sus reglas de parada por defecto: recuperó 16 y 21 de los 30 estudios que la revisión original incluyó.
revisia no tiene ese problema porque no usa ese diseño. No ordenamos por relevancia para que pares antes: cribamos cada registro del cupo con una decisión por criterio, y derivamos la duda a una persona. No hay ningún punto en el que el sistema declare que ya has visto bastante.
Lo que sí existe es el límite del cupo. Los registros por encima quedan marcados «sin cribar · verificación humana», se cuentan aparte en el diagrama PRISMA y son trabajo tuyo. Si no los revisas, pierdes estudios igual que con cualquier otro método. La diferencia está en que el diagrama lo dice.
Cómo lo medimos
- Listas de referencia reales: 4 revisiones sistemáticas publicadas (2 EN, 2 ES: burnout docente, mindfulness, ejercicio y sueño, estrés académico) con sus listas oficiales de estudios incluidos. Una de ellas con corpus 59 % iberoamericano.
- Incorporación de los estudios de referencia: construimos conjuntos de cribado con registros reales de nuestras búsquedas e inyectamos todos los estudios incluidos de la revisión original. La sensibilidad se calcula de forma exacta sobre la lista de referencia completa; la carga de revisión, muestreada con IC95.
- Sobre el producto real: cuentas recién creadas, flujo de producción completo, con cola, instrucciones del modelo reales (prompts) y banda por defecto, sin ajustes manuales por el camino.
- Reproducible: publicamos la metodología y las revisiones de contraste para que cualquier grupo pueda repetir la comprobación por su cuenta.
Fase A: reproducción sobre los conjuntos validados
| Métrica | Producción | Validación original | Umbral |
|---|---|---|---|
| Sensibilidad de seguridad combinada | 95,6 % | 95,6 % | ≥ 90 % ✓ |
| Carga derivada a revisión humana | 13,1 % | 10,6 % | ≤ 15 % ✓ |
| Concordancia por registro | 93,2 % | — | — |
Fase B: generalización en 2 revisiones nuevas
| Métrica | Revisión EN (sueño) | Revisión ES (estrés académico) | Combinada |
|---|---|---|---|
| Sensibilidad (lista de referencia completa, exacta) | 95,5 % (21/22) | 100 % (27/27) | 98,0 % |
| Carga de revisión humana (muestreada, banda por defecto) | 15,7 % ±4,1 | 25,7 % ±4,9 | 20,7 % |
| Tras ajustar la banda (sin perder ningún estudio de referencia) | 12,0 % | 23,8 % | — |
| Sensibilidad de la búsqueda (nuestras variantes OpenAlex) | 27,3 % | 7,4 % | publicado tal como se obtuvo, sin filtrar |
Agrupado en las 4 revisiones de las fases A y B (94 estudios incluidos): sensibilidad de seguridad del 96,8 % (91/94) — la cifra que publicamos en la portada.
Fase C: réplica externa en 2 revisiones médicas de PubMed (julio 2026)
Validación independiente adicional, en dominios distintos a los conjuntos anteriores: reprodujimos las búsquedas en PubMed de dos revisiones sistemáticas recién publicadas en 2026, reconstruimos su lista oficial de estudios incluidos a partir del diagrama PRISMA y pasamos nuestro cribado real sobre esos corpus. La señal que medimos es la sensibilidad: ¿conservamos los estudios que los revisores humanos incluyeron?
| Revisión (2026) | Incluidos conservados |
|---|---|
| Amlodipino en hipertensión (Front Cardiovasc Med) | 5/6 |
| Anticuerpos anti-CGRP en migraña crónica (Neurol Sci) | 11/11 |
| Combinado | 16/17 (94 %) |
El único estudio no conservado (en amlodipino) es un caso frontera defendible: un ensayo de un solo brazo, sin grupo de comparación, que el criterio de comparador excluye con causa textual, la misma lectura estricta que haría un revisor humano. Ambas revisiones publican su lista de incluidos, pero no la de exclusiones con identificadores, así que esta fase mide sensibilidad (no perder un estudio), no la carga de revisión.
Validación continua (agosto 2026)
- Dos réplicas nuevas desde la pregunta en español, sin PICO escrito a mano, sobre revisiones recién publicadas: la búsqueda guiada conservó 7/8 estudios incluidos en una (el ausente estudia prediabetes y queda fuera del PICO que la propia revisión declara) y 4/4 en la otra.
- Pruebas automáticas de la búsqueda: por cada estudio incluido de 6 revisiones de contraste comprobamos, contra PubMed y Europe PMC, si la consulta que genera revisia lo recupera. Última pasada (21 de agosto): 47/47 en las dos bases, el mismo resultado que la consulta escrita a mano por un experto.
- La prueba del cero: comprobar solo que los estudios aparecen no detecta un fallo que devuelve de más. Si una base ignora la consulta y responde con cientos de miles de registros, los estudios buscados «aparecen» por pura fuerza bruta, y todo parece correcto con la búsqueda rota. Por eso añadimos una comprobación con trampa: buscamos términos inventados que no existen en ningún artículo, y el único resultado correcto es cero. Si una base devuelve algo, está ignorando la consulta, y no damos la búsqueda por buena hasta arreglarlo. Lo contamos porque descubrir este fallo nos costó uno real.
Lo que todavía no va bien (y qué hacemos al respecto)
- Sensibilidad de la búsqueda cuando la revista solo está en bases regionales: 7,4 % (junio) en una revisión cuyos estudios se publicaron en revistas que solo indexan LILACS y Dialnet — bases que los competidores tampoco cubren. El problema no es quién firma el estudio: los equipos iberoamericanos que publican en revistas indexadas en PubMed se encuentran con normalidad. Es dónde está indexada la revista: si no vive en ninguna base consultable, ninguna consulta puede encontrarla. Lo que hemos hecho: entre junio y septiembre de 2026 la búsqueda incluyó SciELO, con una mejora medida y modesta en ese corpus (7,4 % → 11,1 % con las mismas estrategias; la publicamos aunque fuera pequeña). La retiramos en septiembre de 2026: su buscador no admite el acceso automatizado, y en siete revisiones reales aportaba 8 artículos exclusivos de 97, porque OpenAlex ya cubre casi todo lo suyo. Las búsquedas hechas entonces siguen en cada proyecto y en su PRISMA. Sigue en marcha ClinicalTrials.gov para registros de ensayos (los estándares de Cochrane los exigen para localizar lo no publicado). Sobre LILACS: en agosto medimos su aporte contra 4 proyectos reales — 42 registros que la búsqueda internacional no trajo, con estudios primarios en tema —, pero el acceso estable vía la API de BIREME sigue pendiente de acuerdo (no es posible registrarse de forma autónoma). Mitigación adicional hoy: importación manual de referencias (RIS/BibTeX/CSV/PubMed). La re-medición de este corpus con las cuatro bases actuales es lo siguiente que publicaremos aquí.
- La carga de revisión depende del corpus: en un conjunto ruidoso, mantener el 100 % de sensibilidad costó honestamente ~24 % de revisión humana. La banda es ajustable y mostramos el efecto antes de aplicarla.
- No determinismo: entre ejecuciones, algunos registros oscilan entre «incluir» y «revisar». Todas esas oscilaciones acaban en ojos humanos, nunca en exclusiones silenciosas.
- El único estudio de referencia perdido en la fase B se autodescribe como «estudio observacional preliminar» en su propio título; un cribado por resumen lo excluye con causa textual. Lo contamos porque ese es el trato.
Nuestras reglas de honestidad
- Ningún número sin su metodología al lado.
- La incertidumbre se deriva a revisión humana, nunca se descarta en silencio.
- Si un número deja de aguantar al revalidar, se corrige aquí primero.
- Las exportaciones son gratuitas siempre: puedes llevarte tu revisión y auditarnos desde fuera.
Última actualización: 2026-08-21