Investigadores de Stanford publicaron el 16 de septiembre de 2026 en Nature Paper2Agent, un sistema que convierte un paper científico junto con su código público, datos y materiales complementarios en un agente de IA que puede responder consultas y ejecutar métodos mediante lenguaje natural. En una prueba con 100 papers de biología computacional, 74 generaron agentes ejecutables, mientras 26 quedaron fuera por problemas con código, datos o entornos. El resultado delimita el alcance real del proyecto: no hace que cualquier PDF “hable”, sino que vuelve operativa una investigación cuando su trabajo técnico puede reconstruirse y comprobarse.
El proyecto ya circulaba como preprint desde el 8 de septiembre de 2025. La novedad de esta semana es su publicación revisada por pares en Nature, no la primera aparición de la idea.
No es un chatbot que resume el paper
Paper2Agent analiza el manuscrito y los materiales que lo acompañan para construir un servidor MCP, siglas de Model Context Protocol. Es una interfaz estandarizada que permite a un agente conversacional acceder a herramientas y recursos externos.
El sistema localiza el repositorio del estudio, prepara un entorno de ejecución, extrae funciones del método y las empaqueta como herramientas reutilizables. También incorpora el texto, los suplementos, los datos disponibles y prompts que ordenan los pasos de un flujo de trabajo. En los casos de estudio, esos servidores se conectaron a Claude Code con Sonnet 4.
La diferencia frente a cargar un PDF en un chat es que las herramientas se prueban contra salidas de referencia del código original. El proceso verifica archivos generados, resultados numéricos y figuras; las funciones que no superan las pruebas se excluyen. El código de Paper2Agent está disponible públicamente bajo licencia MIT.
El requisito no es el PDF, sino una investigación reproducible
La prueba a escala deja claro por qué la promesa no aplica a cualquier publicación. De los 100 papers de biología computacional procesados sin limpieza manual, 74 lograron una conversión ejecutable en agentes. El sistema propuso 599 herramientas y 593 pasaron su validación automática.
Los otros 26 no pudieron convertirse de forma completa. Entre las causas aparecieron repositorios sin código ejecutable, datos o artefactos de modelo ausentes, dependencias difíciles de recuperar y scripts que no podían generalizarse. La propia investigación plantea que esa fricción puede funcionar como una señal práctica de reproducibilidad: un paper puede explicar un método con claridad, pero no basta si no permite reconstruirlo.
Mejor ejecución no equivale a una conclusión científica validada
En 300 preguntas derivadas de tutoriales, Paper2Agent registró 91.2% de precisión, frente a 80.3% de Claude Code con acceso directo al repositorio, según el estudio. También reportó un costo medio de US$0.20 y 1.6 minutos por consulta, frente a US$0.38 y 4.3 minutos para esa línea de comparación.
Estas pruebas miden sobre todo qué tan fielmente el agente ejecuta un método y reproduce respuestas de referencia. Los autores advierten que, en análisis abiertos, coincidir con una única respuesta no demuestra por sí mismo la validez científica de una interpretación. Además, los servidores requieren mantenimiento cuando cambian dependencias, APIs o repositorios, y pueden heredar problemas de seguridad, licencias o atribución del código que exponen.
La hipótesis sobre psoriasis no es una causa confirmada
Para mostrar cómo podrían colaborar varios agentes, el equipo conectó tres trabajos convertidos en herramientas y analizó datos ya publicados sobre un locus asociado con psoriasis. El sistema priorizó a GPR137 como gen candidato, pero un investigador humano eligió una de las diez estrategias de validación que el agente propuso.
La correlación que respaldó esa hipótesis apareció bajo condiciones de estimulación y no en reposo. El caso no equivale a descubrir una causa confirmada de la enfermedad ni a validar una terapia: es una demostración de cómo un agente puede integrar métodos y datos previos para proponer una línea de investigación que todavía requiere juicio humano.
Paper2Agent abre una vía para reutilizar investigación computacional con menos fricción, pero también convierte la calidad de un paper en una prueba más exigente. Para que una publicación se vuelva un agente confiable no basta con que suene convincente: debe conservar código, datos y flujos de trabajo que otros puedan ejecutar y revisar.