>_ DevTrendspt

Idioma

Início

Linguagens

Seções

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarcados Segurança
Unknown

Novo Modelo Aberto Qwen3.8 Desafia os Flagships Proprietários

A equipe da Alibaba lançou a série de pesos Qwen3.8 como código aberto, incluindo o modelo Qwen3.8-27B e o variante MoE massivo Qwen3.8-2.4T-A95B. Pela primeira vez, modelos da classe Qwen-Max estão disponíveis no Hugging Face e no ModelScope para auto-hospedagem e fine-tuning.

Se você tem acompanhado o desenvolvimento de LLMs abertos ao longo do último ano, provavelmente notou uma mudança interessante. Desenvolvedores costumavam competir no tamanho bruto da janela de contexto ou nas pontuações do benchmark MMLU. Agora o foco mudou para tarefas práticas: manter o contexto de raciocínio em conversas longas, responder apropriadamente a erros de ambiente ao escrever código e uso confiável de ferramentas. A série Qwen3.8 está focada precisamente nessas áreas.

O Que Há de Novo no Qwen3.8

Nesta atualização, desenvolvedores portaram as melhorias arquiteturais do Qwen3.5 para pesos mais poderosos e adicionaram dois controles úteis para a lógica de raciocínio.

O primeiro recurso é o parâmetro reasoning_effort. Agora você pode regular explicitamente a profundidade do pensamento do modelo antes de gerar uma resposta. Se a tarefa é simples, o modelo não desperdiça tokens extras em correntes de raciocínio intermináveis. Para refatoração complexa ou derivações matemáticas, você pode aumentar o parâmetro ao máximo.

O segundo recurso resolve um problema comum em diálogos longos de agentes — preserve_thinking. Geralmente, ao passar para o próximo passo, o contexto do raciocínio anterior é perdido, fazendo o modelo entrar em loop ou repetir hipóteses rejeitadas. Aqui, o contexto do processo de pensamento é preservado entre mensagens, acelerando perceptivelmente o desenvolvimento iterativo.

Arquiteturalmente, a família depende de uma combinação de Gated Delta Networks e Mixture-of-Experts esparsa. Isso reduz a sobrecarga de memória e fornece alta velocidade de geração mesmo em contextos de até 262k tokens.

Resultados de Benchmarks e Métricas

Vamos examinar os benchmarks das séries de modelos Qwen3.6 e Qwen3.5 que formaram a base para o lançamento atual.

Resultados de Benchmark do Qwen3.6-27B

Resultados de Benchmark do Qwen3.6-35B-A3B

Em geração de código e tarefas de chamada de funções externas, a arquitetura 35B-A3B tem desempenho equivalente a modelos monolíticos mais pesados. Ao mesmo tempo, apenas cerca de 3 bilhões de parâmetros permanecem ativos por token.

Abaixo estão resultados para os modelos mais antigos e mais novos da linha 3.5:

Resultados de Benchmark do Qwen3.5-397B-A17B

Resultados de Benchmark do Qwen3.5-122B-A10B, Qwen3.5-35B-A3B e Qwen3.5-27B

Resultados de Benchmark do Qwen3.5-9B e Qwen3.5-4B

Como Executar Localmente ou em um Servidor

A equipe do Qwen preparou integrações com quase todos os mecanismos de inferência populares. Você pode executar o modelo em um servidor modesto, assim como em um cluster de múltiplas GPUs.

Início Rápido via Hugging Face Transformers

A forma mais direta de iniciar um endpoint compatível com OpenAI é o CLI integrado da biblioteca transformers:

transformers serve Qwen/Qwen3.8-27B --port 8000 --continuous-batching

Após executar o comando, o servidor escuta em http://localhost:8000/v1.

Implantação em Produção via vLLM e SGLang

Para alta taxa de transferência, é melhor usar mecanismos especializados. Observe as flags do parser de raciocínio e chamada de ferramentas — elas são necessárias para o funcionamento correto das funções de agente.

Iniciando via vLLM:

vllm serve Qwen/Qwen3.8-27B \
  --port 8000 \
  --tensor-parallel-size 4 \
  --max-model-len 262144 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder

Iniciando via SGLang:

sglang serve \
  --model-path Qwen/Qwen3.8-27B \
  --port 8000 \
  --tp-size 4 \
  --context-length 262144 \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder

Se você está trabalhando em Apple Silicon, use os pacotes mlx-lm ou mlx-vlm. Para executar em hardware de consumo via CPU e GPUs modestas, builds GGUF quantizados já estão disponíveis no Hugging Face em llama.cpp.

Fine-tuning para Suas Tarefas

Se você precisa adaptar o modelo para uma base de código interna ou dialeto de API específico, o repositório recomenda usar bibliotecas comprovadas:

  • Unsloth para treinamento LoRA/QLoRA rápido e eficiente em memória
  • LLaMA-Factory e Swift para SFT, DPO e GRPO

Variantes MoE de ponta exigirão recursos de servidor significativos, mas a versão 27B faz fine-tuning sem problemas em uma ou duas placas como RTX 4090 ou A100 ao usar quantização.

Quem Se Beneficiará deste Projeto

A série Qwen3.8 aborda vários cenários práticos de uma vez:

  • Assistentes de código locais e autocompletar em um ambiente de empresa fechado onde você não pode enviar código para APIs de nuvem externas
  • Agentes autônomos complexos que executam pipelines de múltiplas etapas, leem logs de testes e corrigem erros no repositório por conta própria
  • Pipelines de pesquisa com contexto longo, processamento de documentação e encontrar conexões em grandes volumes de texto
  • Ajustar versões compactas para domínios específicos sem perder a coerência de raciocínio geral

Se você está procurando uma base aberta para agentes autônomos ou um assistente de código de terminal, experimente Qwen3.8-27B. O modelo já é suportado pela maioria das ferramentas do ecossistema e é implantado literalmente em poucos comandos.

Projetos relacionados