Nieuw open Qwen3.8-model daagt proprietaire flagship-modellen uit
Het team van Alibaba heeft de Qwen3.8-gewichtenserie vrijgegeven als open source, waaronder het Qwen3.8-27B-model en de kolossale MoE-variant Qwen3.8-2.4T-A95B. Voor het eerst zijn Qwen-Max-klasse modellen beschikbaar op Hugging Face en ModelScope voor zelf-hosting en fine-tuning.
Als je de afgelopen jaar de ontwikkeling van open LLM's hebt gevolgd, heb je waarschijnlijk een interessante verschuiving opgemerkt. Ontwikkelaars concurreerden ooit op ruwe contextvenster-grootte of MMLU-benchmark scores. Nu is de focus verschoven naar praktische taken: het behouden van reasoning-context in lange gesprekken, correct reageren op omgevingsfouten bij het schrijven van code, en betrouwbaar toolgebruik. De Qwen3.8-serie is precies op deze gebieden gericht.
Wat is nieuw in Qwen3.8
In deze update hebben ontwikkelaars de architectuurverbeteringen van Qwen3.5 overgezet naar krachtigere gewichten en twee nuttige controls voor reasoning-logica toegevoegd.
De eerste functie is de reasoning_effort parameter. Nu kun je expliciet de diepte van het denkproces van het model reguleren voordat het een antwoord genereert. Als de taak eenvoudig is, verspilt het model geen extra tokens aan eindeloze reasoning-ketens. Voor complexe refactoring of wiskundige afleidingen kun je de parameter op maximum zetten.
De tweede functie lost een veelvoorkomend probleem op met lange agent-dialogen — preserve_thinking. Meestal gaat bij het overgaan naar de volgende stap de context van eerdere redeneringen verloren, waardoor het model gaat loopen of eerder afgewezen hypothesen herhaalt. Hier wordt de thought process-context behouden tussen berichten, wat iteratieve ontwikkeling merkbaar versnelt.
Architecturaal vertrouwt de familie op een combinatie van Gated Delta Networks en sparse Mixture-of-Experts. Dit vermindert geheugenoverhead en biedt hoge generatiesnelheid, zelfs bij contexten tot 262k tokens.
Benchmarkresultaten en Metrieken
Laten we de benchmarks bekijken voor de Qwen3.6- en Qwen3.5-modelseries die de basis vormden voor de huidige release.


Bij codegeneratie en externe function calling-taken presteert de 35B-A3B-architectuur gelijk aan zwaardere monolithische modellen. Tegelijkertijd blijven er slechts ongeveer 3 miljard parameters actief per token.
Hieronder staan resultaten voor de oudere en jongere modellen in de 3.5-lineup:



Hoe lokaal of op een server uit te voeren
Het Qwen-team heeft integraties voorbereid met vrijwel alle populaire inference-engines. Je kunt het model draaien op een bescheiden server, maar ook op een cluster van meerdere GPU's.
Snelle start via Hugging Face Transformers
De meest eenvoudige manier om een OpenAI-compatibel endpoint op te zetten is de ingebouwde CLI van de transformers bibliotheek:
transformers serve Qwen/Qwen3.8-27B --port 8000 --continuous-batching
Na het uitvoeren van het commando luistert de server op http://localhost:8000/v1.
Productiedeployment via vLLM en SGLang
Voor hoge doorvoer is het beter om gespecialiseerde engines te gebruiken. Let op de reasoning- en tool-calling-parser flags — deze zijn nodig voor correcte werking van agent-functies.
Starten via vLLM:
vllm serve Qwen/Qwen3.8-27B \
--port 8000 \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder
Starten via SGLang:
sglang serve \
--model-path Qwen/Qwen3.8-27B \
--port 8000 \
--tp-size 4 \
--context-length 262144 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder
Als je op Apple Silicon werkt, gebruik dan de mlx-lm of mlx-vlm packages. Voor het draaien op consumentenhardware via CPU en bescheiden GPU's zijn gekwantiseerde GGUF-builds al beschikbaar op Hugging Face onder llama.cpp.
Fine-tuning voor je taken
Als je het model wilt aanpassen voor een interne codebase of specifieke API-dialect, raadt de repository aan om bewezen bibliotheken te gebruiken:
Unslothvoor snelle en geheugenefficiënte LoRA/QLoRA-trainingLLaMA-FactoryenSwiftvoor SFT, DPO en GRPO
Flaghship MoE-varianten vereisen serieuze serverresources, maar de 27B-versie finetuned zonder problemen op één of twee kaarten zoals RTX 4090 of A100 bij gebruik van kwantisatie.
Wie heeft baat bij dit project
De Qwen3.8-serie pakt tegelijkertijd verschillende praktische scenario's aan:
- Lokale code-assistenten en autocomplete in een afgesloten bedrijfsomgeving waar je code niet naar externe cloud-API's kunt sturen
- Complexe autonome agents die multi-step pipelines uitvoeren, testlogs lezen en fouten in de repository zelf oplossen
- Onderzoekspipelines met lange context, documentverwerking en het vinden van verbanden in grote hoeveelheden tekst
- Het tunen van compacte versies voor smalle domeinen zonder verlies van algemene reasoning-samenhang
Als je op zoek bent naar een open fundament voor autonome agents of een terminal code-assistent, probeer Qwen3.8-27B. Het model wordt al ondersteund door de meeste ecosysteemtools en deployt in letterlijk een paar commando's.
Gerelateerde projecten