AIエージェントツールの寄せ集めを1つのスタックにまとめる方法
自律型エージェントや複雑なLLMパイプラインを本番環境にデプロイしようとしたことがある人なら 누구나、同じ痛苦にすぐに突き当たります。まず、トレーシングのためにLangfuseやPhoenixを取り付けます。そうすると、自動化されていない評価付きのログは無意味だと気づき、評価用の別のライブラリを引きずり込んできます。次に、エージェントが喜んでジェイルブレイクをキャッチしてトークンをリークしていることに気づき、GuardrailsやLakeraを上に重ねます。それでも、プロバイダー間のルーティング用の高速ゲートウェイと、デプロイ前にダイアログを実行するためのシミュレーターがまだ必要です。
結果として、チームは製品の作業ではなく、5つの異なるサービスを接着剤のように組み合わせるのに何週間も費やことになります。future-agiプロジェクトは、この混沌を1つの箱で解決しようとしています。チームはApache 2.0ライセンスの下で、トレーシング、評価、シミュレーション、ゲートウェイ、プロンプト最適化をバンドルしたオープンソースプラットフォームを構築しました。
箱の中身
このプラットフォームの核となるアイデアはシンプルです:本番データの収集とエージェントの改善を1つの閉じたループに統合します реальный пользователь. If an agent made a mistake on a real user, that trace should immediately become a test case for the next prompt iteration.
すべての機能は6つの主要エリアに分割されています。
シナリオシミュレーションと合成テスト
エージェントの手動テストは遅くて非効率です。組み込みのシミュレーションモジュールでは、異なる役割、厄介な質問、ハッキング試行を伴う何千ものマルチステップダイアログを生成できます。
興味深いのは、このモジュールがLiveKit、Retell、VAPI、Pipecatとの統合を通じてテキストだけでなく音声エージェントもサポートしていることです。ライブの顧客がボットの支離滅裂な言葉を聞く前に、レイテンシーと音声アクティビティディテクター(VAD)のパフォーマンスを確認できます。
リアルタイム品質評価と安全性
このライブラリには50以上の組み込みメトリクスが含まれています。幻覚やコンテキスト遵守の標準チェック、ツール使用の正確性評価、トーン分析、個人データ漏洩検出があります。評価はヒューリスティクス、軽量MLモデル、LLM-as-a-judgeアプローチの組み合わせを通じて機能します。
リアルタイム保護には、注入やジェイルブレイクに対する18の組み込みスキャナーと、PresidioやLlama Guardなどの外部ソリューション用のアダプターがあります。スキャナーはプロキシゲートウェイ内で直接呼び出すことも、アプリケーションコード内の別のSDKで呼び出すこともできます。
Command Centerゲートウェイとトレーシング
リクエストルーティングはGoで書かれたゲートウェイによって処理されます。著者は、t3.xlargeインスタンスで重み付きルーティングレイテンシー約9.9ナノ秒、約29,000リクエスト/秒のスループットを主張しています。セキュリティチェックを有効にすると、P99レイテンシーは約21ミリ秒に抑えられます。
このゲートウェイはOpenAI API互換で、OpenAIやAnthropicからローカルのOllamaやvLLMまで100以上のプロバイダーをサポートし、セマンティックキャッシュと仮想キーの管理も可能です。
トレーシングにはOpenTelemetry標準が使用されています。このプラットフォームは、LangChain、CrewAI、DSPy、LlamaIndexなどの50のフレームワークからスパングラフ、レイテンシー、トークンコストを複雑な手動設定なしで収集します。
実データに基づくプロンプト最適化
最も興味深い部分はアルゴリズムによるプロンプトチューンです。コード内で手動で言い回りを微調整する代わりに、GEPA、PromptWizard、ProTeGi、ベイジアンスパースなどを含む6つの最適化アルゴリズムが利用可能です реальный пользователь. Real production error traces are fed into the optimizer, which automatically generates and tests new system prompt variants.
クイックスタート
このプロジェクトはDocker Composeでローカルにデプロイするか、クラウドで実行できます。ローカルデプロイの場合、リポジトリをクローンしてインストールスクリプトを実行するだけです:
git clone https://github.com/future-agi/future-agi.git
cd future-agi
./bin/install
完了後、Webインターフェースは http://localhost:3000 で利用可能です。
既存のPythonコードへの統合は literally 3行で完了します:
from fi_instrumentation import register
from traceai_openai import OpenAIInstrumentor
import openai
register(project_name="support-agent")
OpenAIInstrumentor().instrument()
client = openai.OpenAI()
response = client.chat.completions.create(
model="gpt-4o",
messages=[{"role": "user", "content": "Как оформить возврат товара?"}],
)
TypeScriptまたはNode.jsコードベースでは、すべて同様に表示されます:
import { register } from "@traceai/fi-core";
import { OpenAIInstrumentation } from "@traceai/openai";
import OpenAI from "openai";
register({ projectName: "support-agent" });
new OpenAIInstrumentation().instrument();
const openai = new OpenAI();
const response = await openai.chat.completions.create({
model: "gpt-4o",
messages: [{ role: "user", content: "Как оформить возврат товара?" }],
});
呼び出し後、データは自動的にトレーサーに送られ、コールツリー、渡されたパラメータ、生成時間の測定を確認できます。
アーキテクチャと技術スタック
内部では、このプラットフォームは экзотических選択のないかなり実用的なスタックを使用しています:
- Django 5.1とDjango Channels for WebSocketsを使用したPython 3.11で書かれたバックエンド。
- Go 1.23で書かれた高負荷ゲートウェイ。
- React 18とVite bundlerで構築されたフロントエンド。
- メタデータと設定ストレージにはPostgreSQL、スパン分析と時系列にはClickHouse、状態とキャッシュにはRedisを使用。バックグラウンドタスクはRabbitMQとTemporal経由で実行されます。
すべてのエコシステムコンポーネントは別々のパッケージに分割されています。 전체 интерфейсが必要ない場合は、 metricsモジュール pip install ai-evaluation やプロンプトオプティマイザー pip install agent-opt だけをインストールできます。
このプロジェクトは今すぐ誰にとって役立つか
1つのボタンで質問に答えるシンプルなFAQチャットボットを構築している場合、Future AGIはオーバースペックなコンバインのように感じるでしょう。基本的なコンソールログ数行で十分です。
しかし、以下を構築している場合は:
- 引用の検証と回答のファクトチェックが必要な複雑なRAGパイプライン。
- すべてのミリ秒のレイテンシーが重要なLiveKitやRetellベースの音声アシスタント。
- 数十の外部APIとMCPツールを呼び出すエージェントで推論チェーンの失敗をキャッチすることが重要な場合。
- データの分離要件により外部SaaSサービスに引き渡せないシステム。
このようなシナリオでは、1つのコマンド docker compose up で監視、シミュレーション、ゲートウェイスタック全体をスピンアップできることは、多くのエンジニアリング時間を節約します。
READMEのバナーが正直に警告しているように、このプロジェクトは現在積極的に開発中です。インターフェース全体にいくつかの粗いエッジ遭遇するかもしれませんが、OTelとClickHouseに基づくオープンソースコードとアーキテクチャにより、独自のインフラストラクチャでのテストに最適な候補となります。
関連プロジェクト