>_ DevTrendspt

Idioma

Início

Linguagens

Seções

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarcados Segurança
Python

Por que Agentes Precisam de Inferência Especial e Como o TokenSpeed Acelera LLMs

Quando você executa uma rede neural padrão para geração de texto ou código, motores como o vLLM geralmente têm mais do que capacidades suficientes. Mas assim que se trata de agentes AI autônomos, o cenário muda. Chamadas constantes de ferramentas, ramificações de diálogo, passagens de contexto repetidas e cache KV crescente rapidamente levam a inferência padrão ao limite.

Em maio deste ano, a equipe LightSeek lançou o TokenSpeed no GitHub. Os desenvolvedores se propuseram a criar um motor especializado para cargas de trabalho de agentes que combina a velocidade do TensorRT-LLM com uma interface Python clara e simples.

TokenSpeed Banner

O Que Quebra nos Motores Padrão ao Trabalhar com Agentes

Cenários de agentes diferem significativamente de diálogos de chatbot. Um bot recebe uma solicitação, gera uma única resposta e libera recursos. Um agente, por outro lado, opera em ciclos:

  • Forma pensamentos e seleciona uma ferramenta
  • Aguarda uma resposta de uma API externa ou banco de dados
  • Analisa o resultado recebido e dá o próximo passo

Isso faz o contexto crescer continuamente, forçando o servidor a recalcular longas cadeias de tokens ou manter volumes massivos de memória para o cache KV. Se você executar dezenas desses agentes simultaneamente, até aceleradores poderosos começam a ficar ociosos enquanto aguardam a transferência de dados.

Arquitetura do TokenSpeed e a Solução

Os autores do TokenSpeed não criaram outro wrapper fino sobre o PyTorch. Eles reescreveram componentes críticos do sistema para extrair o máximo desempenho do hardware.

Primeiro, eles separaram o loop de controle da execução. O agendador de requisições é escrito em C++, enquanto a execução de nível superior permanece em Python. O estado de cada requisição, transferência de propriedade do cache KV e temporização estão vinculados a uma máquina de estados finitos rigorosa. O sistema de tipos C++ verifica a segurança de reutilização de recursos de cache em tempo de compilação, eliminando completamente vazamentos de memória.

Segundo, o motor inclui um compilador estático para computação distribuída. Desenvolvedores não precisam escrever manualmente lógica de paralelismo através de torch.distributed. Simplesmente colocar anotações nos limites do módulo é suficiente—o compilador gera automaticamente comandos para comunicação entre processadores.

Terceiro, eles retrabalharam os kernels de baixo nível. Os autores implementaram sua própria versão do algoritmo Multi-head Latent Attention (MLA), otimizado para arquiteturas NVIDIA Hopper e Blackwell. Ele minimiza a latência durante trabalho ativo com contextos longos.

Números e Testes Reais

Os desenvolvedores fornecem benchmarks concretos em modelos atuais. Em maio, o projeto demonstrou uma velocidade de 580 tokens por segundo no modelo Qwen3.5-397B-A17B em tarefas de agentes.

Olhando para gráficos de comparação com o TensorRT-LLM em chips NVIDIA B200 ao executar o modelo Kimi K2.5, o TokenSpeed vence em throughput no mesmo nível de latência.

TokenSpeed vs TensorRT-LLM

É interessante ver como o projeto se adapta rapidamente a novos lançamentos. Por exemplo, suporte para modelos Kimi K3 e inferência FP4 para GPUs NVIDIA e AMD foi adicionado literalmente no dia do lançamento oficial deles.

Integração no Código Existente

De uma perspectiva de ponto de entrada, o TokenSpeed usa AsyncLLM. A arquitetura minimiza a sobrecarga de CPU para processar requisições HTTP recebidas, então o servidor não fica sobrecarregado em RPS alto.

O exemplo de inicialização do servidor parece familiar para qualquer pessoa que trabalhou com o vLLM:

python3 -m tokenspeed.entrypoints.openai.api_server \
    --model Qwen/Qwen2.5-7B-Instruct \
    --port 8000

Depois disso, você pode conectar ao servidor usando o cliente OpenAI padrão, o que simplifica a integração em frameworks de agentes existentes como AutoGen, CrewAI ou LangChain.

Vale a Pena Colocar em Produção

Atualmente, o repositório tem cerca de 17.000 estrelas e quase 50 issues abertas. Este é um projeto jovem e dinâmico que ainda é cedo demais para chamar de padrão conservador da indústria.

Definitivamente vale a pena experimentar o TokenSpeed se você já tem infraestrutura de agentes AI implantada e atingiu o teto de desempenho do vLLM em contextos longos. Se você precisa de um servidor simples para servir um chatbot básico, ferramentas padrão serão suficientes por enquanto.

Projetos relacionados