>_ DevTrendsnl

Taal

Home

Talen

Secties

Frontend Backend Mobiel DevOps AI / ML GameDev Blockchain Embedded Beveiliging
Unknown

Nieuw open Qwen3.8-model daagt proprietaire flagship-modellen uit

Het team van Alibaba heeft de Qwen3.8-gewichtenserie vrijgegeven als open source, waaronder het Qwen3.8-27B-model en de kolossale MoE-variant Qwen3.8-2.4T-A95B. Voor het eerst zijn Qwen-Max-klasse modellen beschikbaar op Hugging Face en ModelScope voor zelf-hosting en fine-tuning.

Als je de afgelopen jaar de ontwikkeling van open LLM's hebt gevolgd, heb je waarschijnlijk een interessante verschuiving opgemerkt. Ontwikkelaars concurreerden ooit op ruwe contextvenster-grootte of MMLU-benchmark scores. Nu is de focus verschoven naar praktische taken: het behouden van reasoning-context in lange gesprekken, correct reageren op omgevingsfouten bij het schrijven van code, en betrouwbaar toolgebruik. De Qwen3.8-serie is precies op deze gebieden gericht.

Wat is nieuw in Qwen3.8

In deze update hebben ontwikkelaars de architectuurverbeteringen van Qwen3.5 overgezet naar krachtigere gewichten en twee nuttige controls voor reasoning-logica toegevoegd.

De eerste functie is de reasoning_effort parameter. Nu kun je expliciet de diepte van het denkproces van het model reguleren voordat het een antwoord genereert. Als de taak eenvoudig is, verspilt het model geen extra tokens aan eindeloze reasoning-ketens. Voor complexe refactoring of wiskundige afleidingen kun je de parameter op maximum zetten.

De tweede functie lost een veelvoorkomend probleem op met lange agent-dialogen — preserve_thinking. Meestal gaat bij het overgaan naar de volgende stap de context van eerdere redeneringen verloren, waardoor het model gaat loopen of eerder afgewezen hypothesen herhaalt. Hier wordt de thought process-context behouden tussen berichten, wat iteratieve ontwikkeling merkbaar versnelt.

Architecturaal vertrouwt de familie op een combinatie van Gated Delta Networks en sparse Mixture-of-Experts. Dit vermindert geheugenoverhead en biedt hoge generatiesnelheid, zelfs bij contexten tot 262k tokens.

Benchmarkresultaten en Metrieken

Laten we de benchmarks bekijken voor de Qwen3.6- en Qwen3.5-modelseries die de basis vormden voor de huidige release.

Qwen3.6-27B Benchmarkresultaten

Qwen3.6-35B-A3B Benchmarkresultaten

Bij codegeneratie en externe function calling-taken presteert de 35B-A3B-architectuur gelijk aan zwaardere monolithische modellen. Tegelijkertijd blijven er slechts ongeveer 3 miljard parameters actief per token.

Hieronder staan resultaten voor de oudere en jongere modellen in de 3.5-lineup:

Qwen3.5-397B-A17B Benchmarkresultaten

Qwen3.5-122B-A10B, Qwen3.5-35B-A3B en Qwen3.5-27B Benchmarkresultaten

Qwen3.5-9B en Qwen3.5-4B Benchmarkresultaten

Hoe lokaal of op een server uit te voeren

Het Qwen-team heeft integraties voorbereid met vrijwel alle populaire inference-engines. Je kunt het model draaien op een bescheiden server, maar ook op een cluster van meerdere GPU's.

Snelle start via Hugging Face Transformers

De meest eenvoudige manier om een OpenAI-compatibel endpoint op te zetten is de ingebouwde CLI van de transformers bibliotheek:

transformers serve Qwen/Qwen3.8-27B --port 8000 --continuous-batching

Na het uitvoeren van het commando luistert de server op http://localhost:8000/v1.

Productiedeployment via vLLM en SGLang

Voor hoge doorvoer is het beter om gespecialiseerde engines te gebruiken. Let op de reasoning- en tool-calling-parser flags — deze zijn nodig voor correcte werking van agent-functies.

Starten via vLLM:

vllm serve Qwen/Qwen3.8-27B \
  --port 8000 \
  --tensor-parallel-size 4 \
  --max-model-len 262144 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder

Starten via SGLang:

sglang serve \
  --model-path Qwen/Qwen3.8-27B \
  --port 8000 \
  --tp-size 4 \
  --context-length 262144 \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder

Als je op Apple Silicon werkt, gebruik dan de mlx-lm of mlx-vlm packages. Voor het draaien op consumentenhardware via CPU en bescheiden GPU's zijn gekwantiseerde GGUF-builds al beschikbaar op Hugging Face onder llama.cpp.

Fine-tuning voor je taken

Als je het model wilt aanpassen voor een interne codebase of specifieke API-dialect, raadt de repository aan om bewezen bibliotheken te gebruiken:

  • Unsloth voor snelle en geheugenefficiënte LoRA/QLoRA-training
  • LLaMA-Factory en Swift voor SFT, DPO en GRPO

Flaghship MoE-varianten vereisen serieuze serverresources, maar de 27B-versie finetuned zonder problemen op één of twee kaarten zoals RTX 4090 of A100 bij gebruik van kwantisatie.

Wie heeft baat bij dit project

De Qwen3.8-serie pakt tegelijkertijd verschillende praktische scenario's aan:

  • Lokale code-assistenten en autocomplete in een afgesloten bedrijfsomgeving waar je code niet naar externe cloud-API's kunt sturen
  • Complexe autonome agents die multi-step pipelines uitvoeren, testlogs lezen en fouten in de repository zelf oplossen
  • Onderzoekspipelines met lange context, documentverwerking en het vinden van verbanden in grote hoeveelheden tekst
  • Het tunen van compacte versies voor smalle domeinen zonder verlies van algemene reasoning-samenhang

Als je op zoek bent naar een open fundament voor autonome agents of een terminal code-assistent, probeer Qwen3.8-27B. Het model wordt al ondersteund door de meeste ecosysteemtools en deployt in letterlijk een paar commando's.

Gerelateerde projecten