>_ DevTrendsde

Sprache

Start

Sprachen

Bereiche

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embedded Sicherheit
Python

So werden Sie den Container-Zoo beim Erstellen von KI-Agenten mit SIE los

Superlinked-Logo

Der Aufbau autonomer Agenten auf lokalen oder Open-Source-Neuronalen Netzen wird schnell zu einem Infrastruktur-Albtraum. Wenn Sie ein RAG-System mit mehreren Entscheidungsschritten zusammenstellen, müssen Sie mehrere schmalbandige Systeme gleichzeitig ausführen. Sie benötigen ein Vektormodell für die Suche, einen separaten Reranker, ein Tool zum Parsen komplexer Grafiken in PDFs, einen Sicherheitsklassifikator und ein generatives LLM.

Als Ergebnis verwandelt sich die Entwicklungsumgebung schnell in einen Haufen von Docker-Compose-Dateien. Ein Container belegt den Speicher für vLLM, ein anderer startet Text Embeddings Inference, ein dritter launcht PyTorch nur für paranoide Entity-Extraktion via GLiNER. Alle diese Instanzen ständig am Laufen zu halten, ist ein sicherer Weg, um massive GPU-Kosten anzufeuern.

Ingenieure bei Superlinked sind auf dasselbe Problem gestoßen und haben SIE (Superlinked Inference Engine) veröffentlicht. Dies ist ein Inferenz-Server, der die gesamte Agenten-Aufgabenverarbeitung unter einem Dach konsolidiert.

So funktioniert es unter der Haube

SIE verfolgt einen anderen Ansatz. Anstatt fünf unabhängige Inferenz-Server zu betreiben, deployen Sie einen Cluster, der auf Standard-OpenAI-Endpunkte wie /v1/embeddings oder /v1/chat/completions reagiert.

Das Hauptfeature ist dynamisches Modell-Laden bei Bedarf mit einem LRU (Least Recently Used) Eviction-Algorithmus. Wenn ein Agent OCR benötigt, um einen hochgeladenen Scan zu parsen, lädt SIE das Dokumenterkennungsmodell in den GPU-Speicher. Sobald der Parsing-Schritt abgeschlossen ist und das System zur Dialogführung übergeht, gibt das selten genutzte Modell den Speicher für das generative Netz frei.

Der Katalog enthält über hundert vorkonfigurierte Setups out of the box. Beliebte Optionen umfassen BGE-M3, ColBERTv2, SPLADE-v3, GLiNER, Docling, Qwen3 und Prompt-Injection-Schutzmodelle wie Granite Guardian.

Schnellstart auf Ihrem lokalen Rechner

Für einen ersten Blick reicht ein Standard-Python-Paket. Sie können eine Testinstanz auf CPU oder Apple Silicon mit zwei Befehlen starten:

pip install "sie-server[local]"
sie-server serve

Wenn Sie planen, schwere Workloads auf NVIDIA-GPUs auszuführen, greifen Sie von Anfang an zu Docker. Die Entwickler haben die Dienste aufgrund widersprüchlicher Systemabhängigkeiten absichtlich in isolierte Container aufgeteilt. OCR-Modelle erfordern die neueste Transformers-Bibliothek, daher werden sie als separates Tag ausgeliefert.

Für die Vektorsuche sieht das Starten des Basis-Containers so aus:

docker run --gpus all -p 8080:8080 \
  -v sie-hf-cache:/app/.cache/huggingface \
  ghcr.io/superlinked/sie-server:latest-cuda12-default

Sie können mit einem Standard-cURL-Aufruf verifizieren, dass es funktioniert:

curl http://localhost:8080/v1/embeddings \
  -H 'Content-Type: application/json' \
  -d '{"model": "sentence-transformers/all-MiniLM-L6-v2", "input": "Привет, мир"}'

Bei der ersten Anfrage lädt der Server automatisch Gewichte von Hugging Face herunter und speichert sie im lokalen Cache, sodass nachfolgende Abfragen ohne Download-Verzögerungen laufen.

Programmieren mit dem Python SDK

Für die Arbeit mit dem Server haben die Autoren Bibliotheken für Python und TypeScript geschrieben. Das SDK übernimmt den Aufruf spezifischer Aufgaben wie Klassifizierung oder Named Entity Extraction.

Hier ist ein Beispiel, wie Sie Text vektorisieren, Ergebnisse reranken und Entities in einem einzigen Client extrahieren:

from sie_sdk import SIEClient
from sie_sdk.types import Item

client = SIEClient("http://localhost:8080")

# Получаем эмбеддинг
embedding = client.encode("sentence-transformers/all-MiniLM-L6-v2", Item(text="Привет мир"))

# Считаем релевантность документов
scores = client.score(
    "cross-encoder/ms-marco-MiniLM-L-6-v2",
    Item(text="Что такое машинное обучение?"),
    [Item(text="ML обучается на данных."), Item(text="Сегодня солнечная погода.")],
)

# Извлекаем сущности через GLiNER
entities = client.extract(
    "urchade/gliner_multi-v2.1",
    Item(text="Тим Кук руководит компанией Apple в Купертино."),
    labels=["person", "organization", "location"],
)

Die Syntax ist straightforward. Sie müssen keine eigenen Wrapper für HTTP-Endpunkte schreiben oder Third-Party-Bibliotheken für jedes kleine Modell einbinden.

Produktionsreif

Viele ähnliche Open-Source-Projekte bleiben auf der Ebene einer polierten README für die lokale Nutzung stecken. Bei SIE haben die Autoren sofort die Infrastructure-Tooling für das Deployment auf Kubernetes veröffentlicht.

Das Repository und verwandte Projekte in der Organisation umfassen:

  • Helm-Chart sie-cluster für schnelle Installation.
  • Ready-made Terraform-Module für AWS (EKS), Google Cloud (GKE) und Azure (AKS).
  • KEDA-Konfigurationen für Autoscaling von Pods bis auf null.
  • Load-Balancer- und Grafana-Dashboards für Metriken-Sammlung.

Die Möglichkeit, Pods auf null herunterzuskalieren, ist praktisch für interne Unternehmensdienste. Wenn Mitarbeiter nachts den Agenten nicht nutzen, sitzen Cloud-GPUs einfach nicht ungenutzt da.

Der Haken

Das Konzept eines einzelnen Inferenz-Servers für alle Aufgaben klingt großartig, aber es gibt keine perfekten Lösungen.

Der Hauptfallstrick ist die Cold-Start-Latenz. Wenn ein Modell aufgrund von LRU-Eviction aus dem GPU-Speicher entfernt wird, muss die nächste Anfrage warten, bis die Gewichte von der Disk neu geladen werden. Auf relativ langsamem Storage fügt das ein paar Sekunden Verzögerung zur Antwort des Agenten hinzu.

Der zweite Punkt betrifft die Docker-Image-Trennung. Wenn Ihre Pipeline gleichzeitig OCR basierend auf LightOnOCR und schnelle LLM-Inferenz auf SGLang benötigt, müssen Sie trotzdem zwei verschiedene SIE-Container starten, da sich ihre Umgebungen unterscheiden.

Lohnt es sich?

SIE ist ein großartiger Kandidat für Teams, die Pipelines auf eigener Hardware oder in einer Private Cloud aufbauen. Wenn Sie es leid sind, Infrastruktur zu stützen, die nur für ein RAG-System mit fünf verschiedenen Containern zusammengehalten wird, wird dieses Projekt eine Menge Zeit sparen.

Wenn Ihre Architektur einfach ist und nur aus einem konversationellen Modell ohne komplexe Dokumentenverarbeitung und Reranking-Stufen besteht, gibt es keinen Punkt, auf SIE umzusteigen. Reguläres vLLM oder Ollama ist in diesem Szenario völlig ausreichend.

Ähnliche Projekte