>_ DevTrendsnl

Taal

Home

Talen

Secties

Frontend Backend Mobiel DevOps AI / ML GameDev Blockchain Embedded Beveiliging
Python

Waarom Agents Speciale Inference Nodig Hebben en Hoe TokenSpeed LLMs Versnelt

Wanneer je een standaard neuraal netwerk uitvoert voor tekst- of code-generatie, hebben engines zoals vLLM meestal meer dan genoeg mogelijkheden. Maar zodra het gaat om autonome AI-agents, verandert het beeld. Constante tool-aanroepen, dialoogvertakkingen, herhaalde context-doorgaves en groeiende KV-cache brengen standaard inference snel op de knieën.

In mei van dit jaar heeft het LightSeek-team TokenSpeed op GitHub uitgebracht. De ontwikkelaars wilden een gespecialiseerde engine creëren voor agent-workloads die de snelheid van TensorRT-LLM combineert met een duidelijke en eenvoudige Python-interface.

TokenSpeed Banner

Wat Er Breken Kan in Standaard Engines bij het Werken met Agents

Agent-scenario's verschillen aanzienlijk van chatbot-dialogen. Een bot ontvangt een verzoek, genereert een enkele reactie en geeft resources vrij. Een agent daarentegen werkt in cycli:

  • Vormt gedachten en selecteert een tool
  • Wacht op een reactie van een externe API of database
  • Analyseert het ontvangen resultaat en neemt de volgende stap

Dit zorgt ervoor dat de context continu groeit, waardoor de server lange token-ketens opnieuw moet berekenen of enorme geheugenvolumes voor de KV-cache moet onderhouden. Als je tientallen van dergelijke agents tegelijkertijd uitvoert, beginnen zelfs krachtige accelerators te wachten op datatransfer.

TokenSpeed Architectuur en de Oplossing

De auteurs van TokenSpeed hebben geen dunne wrapper over PyTorch gemaakt. Ze hebben kritieke systeemcomponenten herschreven om maximale prestaties uit de hardware te halen.

Ten eerste hebben ze de control loop gescheiden van de uitvoering. De request scheduler is geschreven in C++, terwijl de hogere-niveau uitvoering in Python blijft. De status van elk verzoek, KV-cache eigendomsoverdracht en timing zijn gekoppeld aan een strikte finite state machine. Het C++ type-systeem controleert cache resource hergebruik-veiligheid tijdens compile-time, waardoor geheugenlekken volledig worden geëlimineerd.

Ten tweede bevat de engine een statische compiler voor gedistribueerde computing. Ontwikkelaars hoeven geen handmatige parallelliteitslogica te schrijven via torch.distributed. Simpelweg annotaties plaatsen bij module-grenzen is voldoende—de compiler genereert automatisch commando's voor inter-processor communicatie.

Ten derde hebben ze de low-level kernels herwerkt. De auteurs hebben hun eigen versie van het Multi-head Latent Attention (MLA) algoritme geïmplementeerd, geoptimaliseerd voor NVIDIA Hopper en Blackwell architecturen. Het minimaliseert latentie tijdens actief werk met lange contexten.

Cijfers en Real-World Tests

De ontwikkelaars geven concrete benchmarks op actuele modellen. In mei toonde het project een snelheid van 580 tokens per seconde op het Qwen3.5-397B-A17B model in agent-taken.

Bij het bekijken van vergelijkingsgrafieken met TensorRT-LLM op NVIDIA B200 chips bij het uitvoeren van het Kimi K2.5 model, wint TokenSpeed op throughput bij hetzelfde latency-niveau.

TokenSpeed vs TensorRT-LLM

Het is interessant om te zien hoe snel het project zich aanpast aan nieuwe releases. Ondersteuning voor Kimi K3 modellen en FP4 inference voor NVIDIA en AMD GPU's werd bijvoorbeeld letterlijk toegevoegd op de dag van hun officiële release.

Integratie in Bestaande Code

Vanuit een entry point perspectief gebruikt TokenSpeed AsyncLLM. De architectuur minimaliseert CPU overhead voor het verwerken van inkomende HTTP requests, dus de server raakt niet overweldigd bij hoge RPS.

Het server startup voorbeeld ziet er bekend uit voor iedereen die met vLLM heeft gewerkt:

python3 -m tokenspeed.entrypoints.openai.api_server \
    --model Qwen/Qwen2.5-7B-Instruct \
    --port 8000

Daarna kan je verbinden met de server via de standaard OpenAI client, wat integratie vereenvoudigt in bestaande agent frameworks zoals AutoGen, CrewAI, of LangChain.

Is Het De Moeite Waard om in Productie te Zetten

Momenteel heeft de repository ongeveer 17.000 sterren en bijna 50 open issues. Dit is een jong, dynamisch project waar het te vroeg voor is om het een conservatieve industriestandaard te noemen.

Het is zeker de moeite waard om TokenSpeed te proberen als je al AI agent infrastructuur hebt uitgerold en je de prestatieplafond van vLLM op lange contexten hebt bereikt. Als je een eenvoudige server nodig hebt voor het serveren van een basis chatbot, volstaan standaard tools voor nu.

Gerelateerde projecten