Hoe bouw je een zoo aan AI-agenttools in één enkele stack
Iedereen die heeft geprobeerd om autonome agents of complexe LLM-pipelines naar productie te brengen, stuit al snel op hetzelfde pijnpunt. Eerst plak je Langfuse of Phoenix erbij voor tracing. Dan realiseer je je dat logs zonder geautomatiseerde evaluatie nutteloos zijn, dus sleep je een aparte bibliotheek voor evals erbij. Vervolgens ontdek je dat de agent vrolijk jailbreaks opvangt en tokens lekt, dus leg je Guardrails of Lakera bovenop. En je hebt nog steeds een snelle gateway nodig voor routing tussen providers en een simulator om dialogen door te lopen voor deployment.
Het resultaat is dat teams, in plaats van aan het product te werken, weken bezig zijn met het aan elkaar knopen van vijf verschillende services. Het future-agi project probeert deze chaos op te lossen met één doos. Het team bouwde een open-source platform onder de Apache 2.0-licentie dat tracing, evaluaties, simulaties, een gateway en prompt-optimalisatie bundelt.
Wat zit er in de doos
Het kernidee achter het platform is simpel: combineer productiegegevensverzameling en agent-verbetering in één gesloten lus. Als een agent een fout maakte bij een echte gebruiker, zou die trace onmiddellijk een testcase moeten worden voor de volgende prompt-iteratie.
Alle functionaliteit is opgesplitst in zes hoofdgebieden.
Scenariosimulatie en synthetische tests
Agents handmatig testen is traag en inefficiënt. De ingebouwde simulatiemodule kan duizenden meerstapsdialogen genereren met verschillende rollen, lastige vragen en hackpogingen.
Interessant is dat de module niet alleen tekst ondersteunt, maar ook voice-agents via integraties met LiveKit, Retell, VAPI en Pipecat. Je kunt latentie en VAD-prestaties (voice activity detector) controleren voordat een live klant de onsamenhangende mompel van de bot hoort.
Real-time kwaliteitsbeoordeling en veiligheid
De bibliotheek bevat meer dan 50 ingebouwde metrieken. Er zijn standaardcontroles voor hallucinaties en contextnaleving, evaluatie van toolgebruik, toonanalyse en detectie van persoonlijke gegevenslekken. Evaluatie werkt via een combinatie van heuristieken, lichtgewicht ML-modellen en de LLM-as-a-judge-benadering.
Voor real-time bescherming zijn er 18 ingebouwde scanners tegen injecties en jailbreaks, plus adapters voor externe oplossingen zoals Presidio of Llama Guard. Scanners kunnen direct worden aangeroepen binnen de proxy-gateway of via een aparte SDK in je applicatiecode.
Command Center Gateway en tracing
Request-routing wordt afgehandeld door een gateway geschreven in Go. De auteurs beweren een gewogen routing-latentie van ongeveer 9,9 nanoseconden en een doorvoer van ongeveer 29.000 requests per seconde op een t3.xlarge instance. Met beveiligingscontroles ingeschakeld blijft de P99-latentie rond 21 milliseconden.
De gateway is OpenAI API-compatibel, ondersteunt meer dan honderd providers (van OpenAI en Anthropic tot lokale Ollama en vLLM), kan semantische caching doen en beheert virtuele sleutels.
Voor tracing wordt de OpenTelemetry-standaard gebruikt. Het platform verzamelt span-grafieken, latentie en token-kosten van 50 frameworks zoals LangChain, CrewAI, DSPy of LlamaIndex zonder complexe handmatige configuratie.
Prompt-optimalisatie op echte data
Het meest interessante deel is algoritmische prompt-tuning. In plaats van handmatig de formulering in code aan te passen, zijn er zes optimalisatie-algoritmen beschikbaar, waaronder GEPA, PromptWizard, ProTeGi en Bayesiaans zoeken. Echte productiefout-traces worden in de optimizer gevoerd, die automatisch nieuwe systeemprompt-varianten genereert en test.
Snelle start
Het project kan lokaal worden geïmplementeerd via Docker Compose of in de cloud worden uitgevoerd. Voor lokale implementatie kun je gewoon de repository klonen en het installatiescript uitvoeren:
git clone https://github.com/future-agi/future-agi.git
cd future-agi
./bin/install
Na voltooiing is de webinterface beschikbaar op http://localhost:3000.
Integratie in bestaande Python-code kost letterlijk drie regels:
from fi_instrumentation import register
from traceai_openai import OpenAIInstrumentor
import openai
register(project_name="support-agent")
OpenAIInstrumentor().instrument()
client = openai.OpenAI()
response = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "Как оформить возврат товара?"}],
)
In een TypeScript- of Node.js-codebase ziet alles er vergelijkbaar uit:
import { register } from "@traceai/fi-core";
import { OpenAIInstrumentation } from "@traceai/openai";
import OpenAI from "openai";
register({ projectName: "support-agent" });
new OpenAIInstrumentation().instrument();
const openai = new OpenAI();
const response = await openai.chat.completions.create({
model: "gpt-4o",
messages: [{ role: "user", content: "Как оформить возврат товара?" }],
});
Na de aanroep gaan gegevens automatisch naar de tracer waar je de call tree, doorgegeven parameters en generatietijd kunt zien.
Architectuur en tech stack
Onder de motorkap gebruikt het platform een vrij praktische stack zonder exotische keuzes:
- Backend geschreven in Python 3.11 met Django 5.1 en Django Channels voor WebSockets.
- Gateway voor hoge belasting geschreven in Go 1.23.
- Frontend gebouwd met React 18 en Vite bundler.
- PostgreSQL wordt gebruikt voor metadata en configuratieopslag, ClickHouse voor span-analytics en time series, Redis voor status en cache. Achtergrondtaken draaien via RabbitMQ en Temporal.
Alle ecosysteemcomponenten zijn opgesplitst in aparte packages. Als je niet de hele interface nodig hebt, kun je alleen de metrics-module pip install ai-evaluation of de prompt-optimizer pip install agent-opt installeren.
Voor wie is dit project nu bedoeld
Als je een eenvoudige FAQ-chatbot bouwt die vragen beantwoordt met één knop, zal Future AGI overkill lijken. Een paar basisconsole-logs volstaan daar prima.
Maar als je bouwt:
- Complexe RAG-pipelines waar je citaties moet valideren en feiten moet controleren.
- Voice-assistants gebaseerd op LiveKit of Retell waar elke milliseconde latentie kritisch is.
- Agents die tientallen externe API's en MCP-tools aanroepen waar het opvangen van fouten in redeneerketens cruciaal is.
- Systemen die vanwege data-isolatievereisten niet kunnen worden uitbesteed aan externe SaaS-services.
In deze scenario's bespaart de mogelijkheid om met één commando docker compose up de hele monitoring-, simulatie- en gateway-stack op te zetten veel engineering-uren.
Het project is momenteel in actieve ontwikkeling, zoals de banner in de README eerlijk waarschuwt. Je kunt hier en daar wat ruwe randjes in de interface tegenkomen, maar de open-source code en architectuur gebaseerd op OTel en ClickHouse maken het een uitstekende kandidaat om te testen in je eigen infrastructuur.
Gerelateerde projecten