Cómo Construir un Zoológico de Herramientas de Agentes IA en una Sola Pila
Cualquiera que haya intentado desplegar agentes autónomos o pipelines complejos de LLM en producción rápidamente se encuentra con el mismo punto de dolor. Primero, enganchas Langfuse o Phoenix para tracing. Luego te das cuenta de que los logs sin evaluación automatizada son inútiles, así que arrastras una biblioteca separada para evals. A continuación, descubres que el agente está felizmente capturando jailbreaks y filtrando tokens, así que añades Guardrails o Lakera encima. Y todavía necesitas un gateway rápido para enrutar entre proveedores y un simulador para ejecutar diálogos antes del despliegue.
Como resultado, en lugar de trabajar en el producto, los equipos pasan semanas pegando con cinta adhesiva cinco servicios diferentes. El proyecto future-agi intenta resolver este caos con una sola caja. El equipo construyó una plataforma de código abierto bajo la licencia Apache 2.0 que agrupa tracing, evals, simulaciones, un gateway y optimización de prompts.
Qué Hay Dentro de la Caja
La idea central detrás de la plataforma es simple: combinar la recolección de datos de producción y la mejora del agente en un solo ciclo cerrado. Si un agente cometió un error con un usuario real, esa traza debería convertirse inmediatamente en un caso de prueba para la siguiente iteración del prompt.
Toda la funcionalidad está dividida en seis áreas principales.
Simulación de Escenarios y Pruebas Sintéticas
Probar agentes manualmente es lento e ineficiente. El módulo de simulación integrado puede generar miles de diálogos de múltiples pasos con diferentes roles, preguntas complicadas y intentos de hacking.
Lo interesante es que el módulo soporta no solo texto sino también agentes de voz a través de integraciones con LiveKit, Retell, VAPI y Pipecat. Puedes verificar la latencia y el rendimiento del detector de actividad de voz (VAD) antes de que un cliente en vivo escuche los balbuceos incoherentes del bot.
Evaluación de Calidad en Tiempo Real y Seguridad
La biblioteca incluye más de 50 métricas integradas. Hay verificaciones estándar para alucinaciones y adherencia al contexto, evaluación de corrección del uso de herramientas, análisis de tono y detección de fuga de datos personales. La evaluación funciona a través de una combinación de heurísticas, modelos ligeros de ML y el enfoque de LLM-como-juez.
Para protección en tiempo real, hay 18 escáneres integrados contra inyecciones y jailbreaks, además de adaptadores para soluciones externas como Presidio o Llama Guard. Los escáneres pueden invocarse directamente dentro del gateway proxy o llamarse a través de un SDK separado en el código de tu aplicación.
Gateway del Centro de Comando y Tracing
El enrutamiento de solicitudes es manejado por un gateway escrito en Go. Los autores afirman una latencia de enrutamiento ponderada de aproximadamente 9.9 nanosegundos y un rendimiento de aproximadamente 29,000 solicitudes por segundo en una instancia t3.xlarge. Con las verificaciones de seguridad habilitadas, la latencia P99 se mantiene alrededor de 21 milisegundos.
El gateway es compatible con la API de OpenAI, soporta más de cien proveedores (desde OpenAI y Anthropic hasta Ollama local y vLLM), puede hacer caché semántico y gestiona claves virtuales.
Para tracing, se utiliza el estándar OpenTelemetry. La plataforma recopila gráficos de spans, latencia y costos de tokens de 50 frameworks como LangChain, CrewAI, DSPy o LlamaIndex sin configuración manual compleja.
Optimización de Prompts con Datos Reales
La parte más interesante es el ajuste algorítmico de prompts. En lugar de modificar manualmente el texto en el código, hay seis algoritmos de optimización disponibles, incluyendo GEPA, PromptWizard, ProTeGi y búsqueda bayesiana. Las trazas de errores reales de producción se alimentan al optimizador, que genera y prueba automáticamente nuevas variantes del prompt del sistema.
Inicio Rápido
El proyecto puede desplegarse localmente a través de Docker Compose o ejecutarse en la nube. Para el despliegue local, simplemente clona el repositorio y ejecuta el script de instalación:
git clone https://github.com/future-agi/future-agi.git
cd future-agi
./bin/install
Después de completar, la interfaz web está disponible en http://localhost:3000.
La integración en código Python existente toma literalmente tres líneas:
from fi_instrumentation import register
from traceai_openai import OpenAIInstrumentor
import openai
register(project_name="support-agent")
OpenAIInstrumentor().instrument()
client = openai.OpenAI()
response = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "Как оформить возврат товара?"}],
)
En una base de código TypeScript o Node.js, todo se ve similar:
import { register } from "@traceai/fi-core";
import { OpenAIInstrumentation } from "@traceai/openai";
import OpenAI from "openai";
register({ projectName: "support-agent" });
new OpenAIInstrumentation().instrument();
const openai = new OpenAI();
const response = await openai.chat.completions.create({
model: "gpt-4o",
messages: [{ role: "user", content: "Как оформить возврат товара?" }],
});
Después de la llamada, los datos van automáticamente al tracer donde puedes ver el árbol de llamadas, los parámetros pasados y medir el tiempo de generación.
Arquitectura y Pila de Tecnologías
Bajo el capó, la plataforma utiliza una pila bastante práctica sin opciones exóticas:
- Backend escrito en Python 3.11 usando Django 5.1 y Django Channels para WebSockets.
- Gateway de alta carga escrito en Go 1.23.
- Frontend construido con React 18 y bundler Vite.
- PostgreSQL se usa para almacenamiento de metadatos y configuración, ClickHouse para análisis de spans y series temporales, Redis para estado y caché. Las tareas en segundo plano se ejecutan a través de RabbitMQ y Temporal.
Todos los componentes del ecosistema están divididos en paquetes separados. Si no necesitas toda la interfaz, puedes instalar solo el módulo de métricas pip install ai-evaluation o el optimizador de prompts pip install agent-opt.
Para Quién Es Este Proyecto Ahora Mismo
Si estás construyendo un chatbot FAQ simple que responde preguntas con un botón, Future AGI parecerá un exceso. Un par de logs básicos de consola serán suficientes allí.
Pero si estás construyendo:
- Pipelines RAG complejos donde necesitas validar citas y verificar hechos de las respuestas.
- Asistentes de voz basados en LiveKit o Retell donde cada milisegundo de latencia es crítico.
- Agentes que llaman a docenas de APIs externas y herramientas MCP donde es crítico detectar fallos en las cadenas de razonamiento.
- Sistemas que no pueden delegarse a servicios SaaS externos debido a requisitos de aislamiento de datos.
En estos escenarios, poder levantar toda la pila de monitoreo, simulación y gateway con un solo comando docker compose up ahorra muchas horas de ingeniería.
El proyecto está actualmente en desarrollo activo, como advierte honestamente el banner en el README. Puedes encontrar algunos bordes ásperos en la interfaz aquí y allá, pero el código de código abierto y la arquitectura basada en OTel y ClickHouse lo convierten en un gran candidato para probar en tu propia infraestructura.
Proyectos relacionados