>_ DevTrendsnl

Taal

Home

Talen

Secties

Frontend Backend Mobiel DevOps AI / ML GameDev Blockchain Embedded Beveiliging
Rust

Switchyard — NVIDIA's LLM-verkeersrouter en vertaler

Stel je dit scenario voor: je wilt een terminal-autocomplete-tool of coding-agent gebruiken zoals Claude Code of Codex CLI. Het is een handig hulpmiddel, maar het is afgestemd op een specifieke API. Als je de requests wilt omleiden naar een lokale vLLM, Ollama of NVIDIA NIM, loop je tegen een probleem aan: de endpoint-formaten en datastructuren komen niet overeen. Anthropic verwacht het Messages-formaat, OpenAI gebruikt Chat Completions, en je lokale model is afgestemd op een geheel ander formaat.

Het Switchyard-project van het NVIDIA NeMo-team lost dit probleem exact op. Het is een proxyserver en Rust-bibliotheek ontworpen voor API-protocolvertaling en intelligent request-routing tussen verschillende taalmodellen.

Switchyard

Wat Switchyard Kan Doen

Het project is opgebouwd rond twee kernmechanismen: on-the-fly request-conversie en routing-algoritmes.

De client-applicatie denkt nog steeds dat het communiceert met de native Anthropic- of OpenAI-API. In werkelijkheid ontvangt Switchyard de request, vertaalt deze naar het formaat van de doelprovider, stuurt deze naar de juiste backend, en transformeert het antwoord terug.

Momenteel worden drie hoofdformaten ondersteund:

  • OpenAI Chat
  • Anthropic Messages
  • OpenAI Responses

Dit betekent dat je Claude Code kunt richten op een lokaal model via vLLM, en de client zal de switch niet eens merken.

Slim Routeren In Plaats van Gewoon Round-Robin

Elke proxyserver kan de belasting willekeurig verdelen. Wat Switchyard interessant maakt, zijn de verkeersdistributiescenario's. De auteurs hebben vier ingebouwde algoritmes gebouwd:

  • Stage Router. Evalueert signalen binnen het gesprek zelf. Als een eerdere toolcall eindigde in een fout, zal de router de volgende turn omleiden naar een sterker model. Als alles soepel verloopt, zal een goedkoper model de request afhandelen.
  • Escalation Router. Stuurt de request eerst naar een zwakker model. Parallel evalueert een speciaal judge-model de antwoordkwaliteit. Als het resultaat onbevredigend is, wordt dezelfde request automatisch geëscaleerd naar een flagship-model.
  • LLM Classifier. Een apart lichtgewicht model classificeert inkomende requests op complexiteit en selecteert de juiste backend voordat de hoofdgeneratie überhaupt begint.
  • Random. Standaard willekeurige verdeling met een vast splitsingspercentage. Nuttig voor A/B-tests of het evalueren van kosten tussen verschillende providers.

Architectuur en Integratieopties

De ontwikkelaars hebben Switchyard gestructureerd als verschillende modules. De keuze van de werkingsmodus hangt af van je taak.

Als je snel een coding-agent wilt lanceren met de juiste instellingen, gebruik je de CLI-launcher. De gehele installatie komt neer op een enkele package manager-opdracht:

Daarna start de agent met een enkele regel die de config specificeert:

Om als netwerkproxy te draaien, bouw je de binary. Het volgt metrics via Prometheus (token-tellingen, latenties, fouten) en wordt geconfigureerd via een bestand.

Als je je eigen Rust-applicatie schrijft, hoef je geen aparte HTTP-server toe te voegen. De crate embedt routing-logica direct in je code. De bibliotheek voert zelf geen netwerkoproepen uit — het neemt alleen een routing-beslissing en retourneert het geselecteerde doelbackend naar je applicatie.

Huidige Projectstatus

Op de repository-pagina staat een waarschuwing: Switchyard is in pre-alpha stadium. Ten tijde van deze review heeft het project bijna 800 sterren op GitHub en de status van experimentele software.

Dit betekent dat de publieke API, TOML-configstructuur en interne crate-architectuur aan verandering onderhevig zijn. Het nu gebruiken in kritische productie is een riskante zet.

Voor Wie Is Dit Project Het Volgen Waard

Switchyard lijkt veelbelovend voor twee categorieën ontwikkelaars:

  1. Diegenen die actief terminal AI-agents gebruiken (Claude Code, Codex CLI) en geld willen besparen door sommige eenvoudige taken om te leiden naar lokale modellen of goedkopere API's.
  2. Teams die hun eigen infrastructuur bouwen rond LLMs op basis van Rust. De mogelijkheid om kant-en-klare escalatie-algoritmes en protocolvertalers uit de crate te halen, bespaart een paar weken werk.

Als je op zoek bent naar een schone tool voor transparante backendsubstitutie zonder de code van de agent zelf te herschrijven, is dit project zeker het volgen waard.

Gerelateerde projecten