>_ DevTrendses

Idioma

Inicio

Lenguajes

Secciones

Frontend Backend Móvil DevOps AI / ML GameDev Blockchain Embebidos Seguridad
Tex

Cómo enseñar a los agentes LLM a recordar contexto y reproducir artículos científicos

Hace poco me encontré con el benchmark PaperGuru, donde los autores decidieron profundizar en un problema desagradable con los agentes autónomos. Las ventanas de contexto en los modelos modernos han crecido hasta un millón de tokens. Sin embargo, las tareas de varios días donde un agente necesita explorar repositorios, leer decenas de artículos y escribir código funcional todavía fallan.

Por lo general, todo se reduce a la memoria. Las bases de datos vectoriales encuentran fragmentos de texto por similitud coseno, pero pasan completamente por alto las relaciones a lo largo del tiempo. Si un artículo ha sido actualizado o una biblioteca se ha quedado obsoleta, un RAG estándar mezclará felizmente un fragmento obsoleto en el prompt. En el repositorio PaperGuru-Benchmark, los investigadores del equipo AutoTrustAI publicaron una arquitectura de memoria a largo plazo con conocimiento del ciclo de vida de los datos (Lifecycle-Aware Memory, o LAM), junto con los resultados de las pruebas realizadas en benchmarks complejos.

Comparación del rendimiento del agente antes y después de PaperGuru

¿Qué tiene de malo el RAG estándar?

Cuando un agente escribe una gran revisión de literatura o reproduce código de un artículo en PDF, la búsqueda de embeddings planos tropieza con cosas básicas.

Primero, la información se vuelve obsoleta. Si un método fue refutado en un artículo más reciente, una base de datos plana no lo sabe.

Segundo, la evidencia necesaria a menudo no se encuentra en el fragmento que se parece a la consulta por palabras clave, sino a dos enlaces de distancia en el grafo de citas.

Tercero, a medida que crece el archivo, los costos de búsqueda aumentan y el agente comienza a ahogarse en ruido.

Los autores formularon cuatro reglas para trabajar con la memoria:

  1. Versionado de contenido. El sistema rastrea ediciones, depreciaciones y retractaciones de artículos.
  2. Relevancia estructural multi-salto. La búsqueda atraviesa el grafo de relaciones, no solo la similitud vectorial.
  3. Costo de consulta acotado con crecimiento infinito del archivo.
  4. Rastreo de evidencia. Cada afirmación del agente está vinculada a una fuente específica.

Arquitectura Capital Chunk Memory

Arquitectura CCM de PaperGuru

En lugar de dividir el texto en fragmentos uniformes y volcarlos en Chroma o Pinecone, la arquitectura PaperGuru divide la memoria en dos capas. La primera capa se llama chunk heads. Son encabezados compactos con metadatos para cada artefacto, utilizados para el enrutamiento rápido. La segunda capa, chunk contents, almacena texto sin procesar y se carga de forma perezosa solo cuando realmente se necesita.

El router se basa en un grafo temporal de artefactos. El grafo contiene dos tipos de relaciones: estructurales (por ejemplo, cites, implements, benchmarked-on) y causales (deprecated-by, retracted-by, superseded-by).

Pipeline de memoria

El pipeline de generación consiste en cuatro pasos:

  • Búsqueda: búsqueda rápida de encabezados de artefactos coincidentes en el archivo.
  • Extracción: extraer los fragmentos necesarios y ensamblar las llamadas tarjetas de evidencia.
  • Razonamiento: un ciclo de generación y crítica donde el modelo redacta y verifica la lógica.
  • Verificación: validación final con comprobación de referencias de fuentes.
Animación del pipeline

Lo que muestran las pruebas

Los autores probaron el sistema en dos benchmarks difíciles: PaperBench de OpenAI y SurveyBench.

PaperBench evalúa la capacidad de un modelo para tomar un PDF de un artículo de ML y escribir un repositorio funcional con reproducción de experimentos. La línea base humana (un estudiante de doctorado en ML con un presupuesto de 48 horas) es del 41%.

Resultados generales de PaperBench

PaperGuru mostró un resultado promedio del 66.05% en 23 artículos, superando todas las soluciones base publicadas. El mejor resultado anterior de otros agentes se mantenía en el 35.74%.

Resultados por artículos individuales

En 19 de 20 artículos con líneas base conocidas, la nueva arquitectura de memoria mostró una mejora significativa. Por ejemplo, al reproducir el artículo sobre classifier-free guidance, el resultado creció un 68%. La única caída ocurrió en la tarea PINN (-4.47%), donde la línea base original utilizaba heurísticas manuales específicas del dominio.

Distribución de mejora de calidad

En SurveyBench, que evalúa la calidad de escribir grandes revisiones científicas, el sistema obtuvo una puntuación del 94.66% en calidad de contenido bajo un juez basado en Claude Opus.

Gráfico radar de SurveyBench

Vale la pena mirar la métrica de Riqueza. Cuenta no las calificaciones subjetivas del modelo de lenguaje, sino la presencia real de gráficos compilados, tablas, código funcional y citas correctas en el material generado.

Estructura y riqueza de contenido

Aquí, PaperGuru obtuvo un 43.76%, mientras que la mitad de los enfoques competidores obtuvieron cero, generando texto plano sin estructura.

Artículos aceptados

Qué hay en el repositorio

El repositorio tiene aproximadamente 350 MB y contiene muchos materiales prácticos:

  • Infraestructura completa del benchmark con pipelines de evaluación reproducibles
  • Embeddings precalculados y estructuras de grafos para todos los artículos del benchmark
  • Implementaciones base de los componentes de la arquitectura LAM
  • Scripts de evaluación y herramientas de visualización
  • Envíos listos para usar para los 23 artículos de PaperBench

Todos los gráficos del README se pueden reconstruir localmente. La carpeta assets/figures/ contiene un archivo data.json con todas las métricas y un script de compilación:

python scripts/rebuild_graphs.py

Quién debería estudiar este proyecto

Si estás construyendo sistemas de agentes que trabajan con bases de código grandes o documentación técnica compleja, este repositorio proporciona un excelente material de reflexión. La idea de dividir la memoria en encabezados ligeros y un grafo de relaciones causales se transfiere fácilmente a bases de conocimiento corporativas.

Los envíos listos para usar en la carpeta PaperBench/submissions/ serán útiles para quienes prueban sus propios pipelines de generación de código a partir de artículos. Allí puedes ver cómo estructurar la reproducción de pipelines de ML complejos, cuando el modelo necesita generar no solo un script individual, sino un árbol de proyecto funcional con dependencias y pruebas.