>_ DevTrendspt

Idioma

Início

Linguagens

Seções

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarcados Segurança
Python

Como Construir um Zoológico de Ferramentas de Agentes de IA em uma Única Stack

Future AGI Logo

Qualquer pessoa que tentou implementar agentes autônomos ou pipelines complexos de LLMs em produção rapidamente encontra o mesmo ponto de dor. Primeiro, você conecta Langfuse ou Phoenix para tracing. Então você percebe que logs sem avaliação automatizada são inúteis, então você arrasta uma biblioteca separada para evals. Em seguida, você descobre que o agente está alegremente capturando jailbreaks e vazando tokens, então você adiciona Guardrails ou Lakera em cima. E você ainda precisa de um gateway rápido para roteamento entre provedores e um simulador para executar diálogos antes do deploy.

Como resultado, em vez de trabalhar no produto, as equipes passam semanas colando cinco serviços diferentes com fita adesiva. O projeto future-agi tenta resolver esse caos com uma única caixa. A equipe construiu uma plataforma open-source sob a licença Apache 2.0 que agrupa tracing, evals, simulações, um gateway e otimização de prompts.

O Que Está Dentro da Caixa

A ideia central por trás da plataforma é simples: combinar coleta de dados de produção e melhoria de agentes em um único loop fechado. Se um agente cometeu um erro em um usuário real, esse trace deve imediatamente se tornar um caso de teste para a próxima iteração de prompt.

Toda a funcionalidade é dividida em seis áreas principais.

Simulação de Cenários e Testes Sintéticos

Testar agentes manualmente é lento e ineficiente. O módulo de simulação integrado pode gerar milhares de diálogos multi-step com diferentes papéis, perguntas complicadas e tentativas de hacking.

O interessante é que o módulo suporta não apenas texto, mas também agentes de voz através de integrações com LiveKit, Retell, VAPI e Pipecat. Você pode verificar latência e desempenho do detector de atividade de voz (VAD) antes que um cliente real ouça o balbucio incoerente do bot.

Avaliação de Qualidade em Tempo Real e Segurança

A biblioteca inclui mais de 50 métricas integradas. Existem verificações padrão para alucinações e aderência ao contexto, avaliação de uso correto de ferramentas, análise de tom e detecção de vazamento de dados pessoais. A avaliação funciona através de uma combinação de heurísticas, modelos leves de ML e a abordagem LLM-as-a-judge.

Para proteção em tempo real, existem 18 scanners integrados contra injeções e jailbreaks, além de adaptadores para soluções externas como Presidio ou Llama Guard. Os scanners podem ser invocados diretamente dentro do gateway proxy ou chamados via um SDK separado no código da sua aplicação.

Gateway Command Center e Tracing

O roteamento de requisições é tratado por um gateway escrito em Go. Os autores alegam latência de roteamento ponderado de cerca de 9.9 nanossegundos e throughput de cerca de 29.000 requisições por segundo em uma instância t3.xlarge. Com verificações de segurança habilitadas, a latência P99 fica em torno de 21 milissegundos.

O gateway é compatível com a API OpenAI, suporta mais de cem provedores (de OpenAI e Anthropic até Ollama local e vLLM), pode fazer cache semântico e gerencia chaves virtuais.

Para tracing, é utilizado o padrão OpenTelemetry. A plataforma coleta grafos de spans, latência e custos de tokens de 50 frameworks como LangChain, CrewAI, DSPy ou LlamaIndex sem configuração manual complexa.

Otimização de Prompts em Dados Reais

A parte mais interessante é o ajuste algorítmico de prompts. Em vez de ajustar manualmente a redação no código, estão disponíveis seis algoritmos de otimização, incluindo GEPA, PromptWizard, ProTeGi e busca bayesiana. Traces de erros de produção reais são alimentados no otimizador, que gera e testa automaticamente novas variantes de prompts de sistema.

Início Rápido

O projeto pode ser implementado localmente via Docker Compose ou executado na nuvem. Para implementação local, basta clonar o repositório e executar o script de instalação:

git clone https://github.com/future-agi/future-agi.git
cd future-agi
./bin/install

Após a conclusão, a interface web está disponível em http://localhost:3000.

A integração em código Python existente leva literalmente três linhas:

from fi_instrumentation import register
from traceai_openai import OpenAIInstrumentor
import openai

register(project_name="support-agent")
OpenAIInstrumentor().instrument()

client = openai.OpenAI()

response = client.chat.completions.create(
    model="gpt-4o",
    messages=[{"role": "user", "content": "Как оформить возврат товара?"}],
)

Em uma base de código TypeScript ou Node.js, tudo parece similar:

import { register } from "@traceai/fi-core";
import { OpenAIInstrumentation } from "@traceai/openai";
import OpenAI from "openai";

register({ projectName: "support-agent" });
new OpenAIInstrumentation().instrument();

const openai = new OpenAI();
const response = await openai.chat.completions.create({
  model: "gpt-4o",
  messages: [{ role: "user", content: "Как оформить возврат товара?" }],
});

Após a chamada, os dados vão automaticamente para o tracer onde você pode ver a árvore de chamadas, parâmetros passados e medir o tempo de geração.

Arquitetura e Stack de Tecnologias

Por baixo do capô, a plataforma usa uma stack bastante prática sem escolhas exóticas:

  • Backend escrito em Python 3.11 usando Django 5.1 e Django Channels para WebSockets.
  • Gateway de alta carga escrito em Go 1.23.
  • Frontend construído com React 18 e bundler Vite.
  • PostgreSQL é usado para armazenamento de metadados e configuração, ClickHouse para analytics de spans e séries temporais, Redis para estado e cache. Tarefas em segundo plano rodam via RabbitMQ e Temporal.

Todos os componentes do ecossistema são divididos em pacotes separados. Se você não precisa de toda a interface, pode instalar apenas o módulo de métricas pip install ai-evaluation ou o otimizador de prompts pip install agent-opt.

Para Quem o Projeto É Útil Agora

Se você está construindo um chatbot FAQ simples que responde perguntas com um botão, o Future AGI vai parecer um canhão para matar uma formiga. Alguns logs básicos no console são suficientes lá.

Mas se você está construindo:

  • Pipelines RAG complexos onde você precisa validar citações e verificar fatos nas respostas.
  • Assistente de voz baseados em LiveKit ou Retell onde cada milissegundo de latência é crítico.
  • Agentes chamando dezenas de APIs externas e ferramentas MCP onde capturar falhas nas cadeias de raciocínio é crítico.
  • Sistemas que não podem ser transferidos para serviços SaaS externos devido a requisitos de isolamento de dados.

Nesses cenários, poder subir toda a stack de monitoramento, simulação e gateway com um comando docker compose up economiza muitas horas de engenharia.

O projeto está em desenvolvimento ativo, como o banner no README honestamente avisa. Você pode encontrar algumas arestas brutas na interface aqui e ali, mas o código open-source e a arquitetura baseada em OTel e ClickHouse fazem dele um ótimo candidato para testar na própria infraestrutura.

Projetos relacionados