>_ DevTrendsit

Lingua

Home

Linguaggi

Sezioni

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embedded Sicurezza
Python

Come Costruire uno Zoo di Strumenti per Agenti AI in un Singolo Stack

Future AGI Logo

Chiunque abbia provato a distribuire agenti autonomi o pipeline LLM complesse in produzione si scontra rapidamente con lo stesso punto critico. Prima, agganci Langfuse o Phoenix per il tracing. Poi ti rendi conto che i log senza valutazione automatica sono inutili, quindi trascini dentro una libreria separata per le valutazioni. Successivamente, scopri che l'agente sta felicemente intercettando jailbreak e perdendo token, quindi aggiungi Guardrails o Lakera sopra. E hai ancora bisogno di un gateway veloce per il routing tra provider e un simulatore per eseguire dialoghi prima della distribuzione.

Di conseguenza, invece di lavorare sul prodotto, i team passano settimane a incollare insieme cinque servizi diversi. Il progetto future-agi cerca di risolvere questo caos con una singola scatola. Il team ha costruito una piattaforma open-source sotto licenza Apache 2.0 che raggruppa tracing, valutazioni, simulazioni, un gateway e ottimizzazione dei prompt.

Cosa C'è Dentro la Scatola

L'idea fondamentale dietro la piattaforma è semplice: combinare la raccolta di dati di produzione e il miglioramento degli agenti in un unico ciclo chiuso. Se un agente ha commesso un errore su un utente reale, quella traccia dovrebbe immediatamente diventare un caso di test per la prossima iterazione del prompt.

Tutta la funzionalità è suddivisa in sei aree principali.

Simulazione di Scenari e Test Sintetici

Testare gli agenti manualmente è lento e inefficiente. Il modulo di simulazione integrato può generare migliaia di dialoghi multi-step con diversi ruoli, domande insidiose e tentativi di hacking.

Ciò che è interessante è che il modulo supporta non solo il testo ma anche gli agenti vocali attraverso integrazioni con LiveKit, Retell, VAPI e Pipecat. Puoi verificare la latenza e le prestazioni del rilevatore di attività vocale (VAD) prima che un cliente reale senta le risposte incoerenti del bot.

Valutazione della Qualità e Sicurezza in Tempo Reale

La libreria include oltre 50 metriche integrate. Ci sono controlli standard per allucinazioni e aderenza al contesto, valutazione dell'uso corretto degli strumenti, analisi del tono e rilevamento di perdite di dati personali. La valutazione funziona attraverso una combinazione di euristiche, modelli ML leggeri e l'approccio LLM-as-a-judge.

Per la protezione in tempo reale, ci sono 18 scanner integrati contro iniezioni e jailbreak, più adattatori per soluzioni esterne come Presidio o Llama Guard. Gli scanner possono essere invocati direttamente all'interno del gateway proxy o chiamati tramite un SDK separato nel codice dell'applicazione.

Gateway Command Center e Tracing

Il routing delle richieste è gestito da un gateway scritto in Go. Gli autori dichiarano una latenza di routing ponderata di circa 9,9 nanosecondi e una velocità effettiva di circa 29.000 richieste al secondo su un'istanza t3.xlarge. Con i controlli di sicurezza abilitati, la latenza P99 rimane intorno ai 21 millisecondi.

Il gateway è compatibile con l'API OpenAI, supporta oltre cento provider (da OpenAI e Anthropic a Ollama locale e vLLM), può fare caching semantico e gestisce chiavi virtuali.

Per il tracing, viene utilizzato lo standard OpenTelemetry. La piattaforma raccoglie grafici di span, latenza e costi dei token da 50 framework come LangChain, CrewAI, DSPy o LlamaIndex senza configurazione manuale complessa.

Ottimizzazione dei Prompt su Dati Reali

La parte più interessante è il tuning algoritmico dei prompt. Invece di modificare manualmente la formulazione nel codice, sono disponibili sei algoritmi di ottimizzazione, tra cui GEPA, PromptWizard, ProTeGi e ricerca bayesiana. Le tracce di errore reali della produzione vengono alimentate nell'ottimizzatore, che genera e testa automaticamente nuove varianti di system prompt.

Avvio Rapido

Il progetto può essere distribuito localmente tramite Docker Compose o eseguito nel cloud. Per la distribuzione locale, basta clonare il repository ed eseguire lo script di installazione:

git clone https://github.com/future-agi/future-agi.git
cd future-agi
./bin/install

Dopo il completamento, l'interfaccia web è disponibile all'indirizzo http://localhost:3000.

L'integrazione nel codice Python esistente richiede letteralmente tre righe:

from fi_instrumentation import register
from traceai_openai import OpenAIInstrumentor
import openai

register(project_name="support-agent")
OpenAIInstrumentor().instrument()

client = openai.OpenAI()

response = client.chat.completions.create(
    model="gpt-4o",
    messages=[{"role": "user", "content": "Как оформить возврат товара?"}],
)

In un codebase TypeScript o Node.js, tutto funziona in modo simile:

import { register } from "@traceai/fi-core";
import { OpenAIInstrumentation } from "@traceai/openai";
import OpenAI from "openai";

register({ projectName: "support-agent" });
new OpenAIInstrumentation().instrument();

const openai = new OpenAI();
const response = await openai.chat.completions.create({
  model: "gpt-4o",
  messages: [{ role: "user", content: "Как оформить возврат товара?" }],
});

Dopo la chiamata, i dati vengono automaticamente inviati al tracer dove è possibile visualizzare l'albero delle chiamate, i parametri passati e misurare il tempo di generazione.

Architettura e Stack Tecnologico

Sotto il cofano, la piattaforma utilizza uno stack abbastanza pratico senza scelte esotiche:

  • Backend scritto in Python 3.11 usando Django 5.1 e Django Channels per i WebSocket.
  • Gateway ad alto carico scritto in Go 1.23.
  • Frontend costruito con React 18 e il bundler Vite.
  • PostgreSQL viene utilizzato per l'archiviazione di metadati e configurazione, ClickHouse per l'analisi degli span e le serie temporali, Redis per stato e cache. Le attività in background vengono eseguite tramite RabbitMQ e Temporal.

Tutti i componenti dell'ecosistema sono suddivisi in pacchetti separati. Se non hai bisogno dell'intera interfaccia, puoi installare solo il modulo delle metriche pip install ai-evaluation o l'ottimizzatore di prompt pip install agent-opt.

A Chi È Destinato il Progetto Adesso

Se stai costruendo un semplice chatbot FAQ che risponde alle domande con un pulsante, Future AGI sembrerà un trattore esagerato. Un paio di log console di base saranno più che sufficienti lì.

Ma se stai costruendo:

  • Pipeline RAG complesse dove devi validare le citazioni e verificare i fatti delle risposte.
  • Assistenti vocali basati su LiveKit o Retell dove ogni millisecondo di latenza è critico.
  • Agenti che chiamano dozzine di API esterne e strumenti MCP dove catturare i fallimenti nelle catene di ragionamento è fondamentale.
  • Sistemi che non possono essere affidati a servizi SaaS esterni a causa dei requisiti di isolamento dei dati.

In questi scenari, la possibilità di avviare l'intero stack di monitoraggio, simulazione e gateway con un comando docker compose up fa risparmiare molte ore di ingegneria.

Il progetto è attualmente in fase di sviluppo attivo, come avverte onestamente il banner nel README. Potresti incontrare alcune imperfezioni nell'interfaccia qua e là, ma il codice open-source e l'architettura basata su OTel e ClickHouse lo rendono un ottimo candidato per il test nella tua infrastruttura.

Progetti correlati