Switchyard — Roteador e Tradutor de Tráfego LLM da NVIDIA
Imagine este cenário: você quer usar uma ferramenta de autocompletar do terminal ou um agente de codificação como Claude Code ou Codex CLI. É uma ferramenta útil, mas ela é feita para uma API específica. Se você quiser redirecionar suas requisições para um vLLM local, Ollama ou NVIDIA NIM, encontrará um problema: os formatos dos endpoints e as estruturas de dados não vão corresponder. A Anthropic espera o formato Messages, a OpenAI usa Chat Completions, e seu modelo local é ajustado para um terceiro formato inteiramente diferente.
O projeto Switchyard da equipe NVIDIA NeMo resolve exatamente esse problema. É um servidor proxy e biblioteca Rust projetado para tradução de protocolos de API e roteamento inteligente de requisições entre diferentes modelos de linguagem.

O que o Switchyard Pode Fazer
O projeto é construído sobre dois mecanismos principais: conversão de requisições em tempo real e algoritmos de roteamento.
A aplicação cliente continua "achando" que está se comunicando com a API nativa da Anthropic ou OpenAI. Na realidade, o Switchyard recebe a requisição, traduz para o formato do provedor alvo, envia para o backend apropriado e transforma a resposta de volta.
Atualmente, três formatos principais são suportados:
- OpenAI Chat
- Anthropic Messages
- OpenAI Responses
Isso significa que você pode apontar o Claude Code para um modelo local via vLLM, e o cliente nem perceberá a troca.
Roteamento Inteligente em Vez de Round-Robin Simples
Qualquer servidor proxy pode balancear carga aleatoriamente. O que torna o Switchyard interessante são seus cenários de distribuição de tráfego. Os autores incluíram quatro algoritmos nativos:
- Stage Router. Avalia sinais dentro do próprio diálogo. Se uma chamada de ferramenta anterior terminou em erro, o roteador redirecionará a próxima rodada para um modelo mais forte. Se tudo está correndo bem, um modelo mais barato atenderá a requisição.
- Escalation Router. Primeiro envia a requisição para um modelo mais fraco. Em paralelo, um modelo juiz especial avalia a qualidade da resposta. Se o resultado for insatisfatório, a mesma requisição é automaticamente escalada para um modelo principal.
- LLM Classifier. Um modelo leve separado classifica as requisições recebidas por complexidade e seleciona o backend apropriado antes mesmo de começar a geração principal.
- Random. Distribuição aleatória padrão com divisão fixa. Útil para testes A/B ou avaliação de custos entre diferentes provedores.
Arquitetura e Opções de Integração
Os desenvolvedores estruturaram o Switchyard como vários módulos. A escolha do modo de operação depende da sua tarefa.
Se você precisa iniciar rapidamente um agente de codificação com as configurações certas, use o launcher CLI. Toda a instalação se resume a um único comando do gerenciador de pacotes:
Depois disso, o agente inicia com uma única linha especificando o config:
Para executar como proxy de rede, compile o binário. Ele rastreia métricas via Prometheus (contagem de tokens, latências, erros) e é configurado através de um arquivo.
Se você está escrevendo sua própria aplicação Rust, não precisará incluir um servidor HTTP separado. O crate incorpora a lógica de roteamento diretamente no seu código. A biblioteca não faz chamadas de rede por conta própria — ela apenas toma uma decisão de roteamento e retorna o backend alvo selecionado para sua aplicação.
Status Atual do Projeto
A página do repositório carrega um aviso: o Switchyard está em estágio pré-alfa. No momento desta análise, o projeto tem perto de 800 estrelas no GitHub e status de software experimental.
Isso significa que a API pública, a estrutura de configuração TOML e a arquitetura interna do crate estão sujeitas a alterações. Usá-lo agora em produção crítica é uma jogada arriscada.
Quem Deve Ficar de Olho neste Projeto
O Switchyard parece promissor para duas categorias de desenvolvedores:
- Aqueles que usam ativamente agentes de IA no terminal (Claude Code, Codex CLI) e querem economizar dinheiro redirecionando algumas tarefas simples para modelos locais ou APIs mais baratas.
- Equipes construindo sua própria infraestrutura em torno de LLMs baseada em Rust. A capacidade de puxar algoritmos de escalação e tradutores de protocolo prontos do crate economizará algumas semanas de trabalho.
Se você tem procurado uma ferramenta limpa para substituição transparente de backend sem reescrever o código do próprio agente, este projeto definitivamente vale a pena acompanhar.
Projetos relacionados