>_ DevTrendses

Idioma

Inicio

Lenguajes

Secciones

Frontend Backend Móvil DevOps AI / ML GameDev Blockchain Embebidos Seguridad
Python

Por qué los Agentes Necesitan Inferencia Especial y Cómo TokenSpeed Acelera los LLMs

Cuando ejecutas una red neuronal estándar para generación de texto o código, motores como vLLM generalmente tienen más que suficientes capacidades. Pero en cuanto se trata de agentes de IA autónomos, la situación cambia. Las llamadas constantes a herramientas, la ramificación de diálogos, los pases de contexto repetidos y el crecimiento del KV-cache rápidamente llevan la inferencia estándar a sus rodillas.

En mayo de este año, el equipo de LightSeek lanzó TokenSpeed en GitHub. Los desarrolladores se propusieron crear un motor especializado para cargas de trabajo de agentes que combina la velocidad de TensorRT-LLM con una interfaz clara y simple en Python.

TokenSpeed Banner

Qué se Rompe en los Motores Estándar al Trabajar con Agentes

Los escenarios de agentes difieren significativamente del diálogo de chatbots. Un bot recibe una solicitud, genera una única respuesta y libera recursos. Un agente, por otro lado, opera en ciclos:

  • Forma pensamientos y selecciona una herramienta
  • Espera una respuesta de una API externa o base de datos
  • Analiza el resultado recibido y toma el siguiente paso

Esto hace que el contexto crezca continuamente, obligando al servidor a recalcular largas cadenas de tokens o mantener volúmenes masivos de memoria para el KV-cache. Si ejecutas docenas de estos agentes simultáneamente, incluso aceleradores potentes comienzan a estar inactivos mientras esperan la transferencia de datos.

Arquitectura de TokenSpeed y la Solución

Los autores de TokenSpeed no crearon otro wrapper delgado sobre PyTorch. Reescribieron componentes críticos del sistema para extraer el máximo rendimiento del hardware.

Primero, separaron el bucle de control de la ejecución. El programador de solicitudes está escrito en C++, mientras que la ejecución de nivel superior permanece en Python. El estado de cada solicitud, la transferencia de propiedad del KV-cache y el tiempo están vinculados a una máquina de estados finitos estricta. El sistema de tipos de C++ verifica la seguridad de reutilización de recursos de caché en tiempo de compilación, eliminando completamente las fugas de memoria.

Segundo, el motor incluye un compilador estático para computación distribuida. Los desarrolladores no necesitan escribir manualmente lógica de paralelismo a través de torch.distributed. Simplemente colocar anotaciones en los límites del módulo es suficiente—el compilador genera automáticamente comandos para la comunicación entre procesadores.

Tercero, reescribieron los kernels de bajo nivel. Los autores implementaron su propia versión del algoritmo Multi-head Latent Attention (MLA), optimizado para arquitecturas NVIDIA Hopper y Blackwell. Minimiza la latencia durante el trabajo activo con contextos largos.

Números y Pruebas Reales

Los desarrolladores proporcionan benchmarks concretos en modelos actuales. En mayo, el proyecto demostró una velocidad de 580 tokens por segundo en el modelo Qwen3.5-397B-A17B en tareas de agentes.

Al observar los gráficos de comparación con TensorRT-LLM en chips NVIDIA B200 al ejecutar el modelo Kimi K2.5, TokenSpeed gana en throughput al mismo nivel de latencia.

TokenSpeed vs TensorRT-LLM

Es interesante ver qué tan rápido el proyecto se adapta a nuevos lanzamientos. Por ejemplo, el soporte para modelos Kimi K3 e inferencia FP4 para GPUs NVIDIA y AMD se agregó literalmente el mismo día de su lanzamiento oficial.

Integración en Código Existente

Desde la perspectiva del punto de entrada, TokenSpeed usa AsyncLLM. La arquitectura minimiza la sobrecarga de CPU para procesar solicitudes HTTP entrantes, por lo que el servidor no se abruma con RPS altos.

El ejemplo de inicio del servidor resulta familiar para cualquiera que haya trabajado con vLLM:

python3 -m tokenspeed.entrypoints.openai.api_server \
    --model Qwen/Qwen2.5-7B-Instruct \
    --port 8000

Después de eso, puedes conectarte al servidor usando el cliente OpenAI estándar, lo que simplifica la integración en marcos de agentes existentes como AutoGen, CrewAI o LangChain.

¿Vale la Pena Desplegar en Producción

Actualmente, el repositorio tiene alrededor de 17,000 estrellas y casi 50 issues abiertos. Este es un proyecto joven y dinámico al que es demasiado pronto para llamar un estándar conservador de la industria.

Definitivamente vale la pena probar TokenSpeed si ya tienes infraestructura de agentes de IA desplegada y has alcanzado el techo de rendimiento de vLLM en contextos largos. Si necesitas un servidor simple para servir un chatbot básico, las herramientas estándar serán suficientes por ahora.

Proyectos relacionados