El nuevo modelo abierto Qwen3.8 desafía a los flagships propietarios
El equipo de Alibaba ha lanzado la serie de pesos Qwen3.8 como código abierto, incluyendo el modelo Qwen3.8-27B y la variante MoE monstruosa Qwen3.8-2.4T-A95B. Por primera vez, los modelos de clase Qwen-Max están disponibles en Hugging Face y ModelScope para autoalojamiento y ajuste fino.
Si has estado siguiendo el desarrollo de LLM de código abierto durante el último año, probablemente hayas notado un cambio interesante. Los desarrolladores solían competir en el tamaño de la ventana de contexto o en las puntuaciones del benchmark MMLU. Ahora el enfoque se ha movido a tareas prácticas: mantener el contexto de razonamiento en conversaciones largas, responder apropiadamente a errores del entorno al escribir código, y el uso confiable de herramientas. La serie Qwen3.8 se enfoca precisamente en estas áreas.
¿Qué hay de nuevo en Qwen3.8
En esta actualización, los desarrolladores portaron las mejoras arquitecturales de Qwen3.5 a pesos más potentes y agregaron dos controles útiles para la lógica de razonamiento.
La primera característica es el parámetro reasoning_effort. Ahora puedes regular explícitamente la profundidad del pensamiento del modelo antes de generar una respuesta. Si la tarea es simple, el modelo no desperdicia tokens extra en cadenas de razonamiento interminables. Para refactorización compleja o derivaciones matemáticas, puedes subir el parámetro al máximo.
La segunda característica resuelve un problema común con diálogos largos de agentes — preserve_thinking. Generalmente, cuando se pasa al siguiente paso, se pierde el contexto del razonamiento previo, causando que el modelo haga bucles o repita hipótesis rechazadas. Aquí, el contexto del proceso de pensamiento se preserva entre mensajes, acelerando notablemente el desarrollo iterativo.
Arquitecturalmente, la familia depende de una combinación de Gated Delta Networks y sparse Mixture-of-Experts. Esto reduce la sobrecarga de memoria y proporciona alta velocidad de generación incluso en contextos de hasta 262k tokens.
Resultados de benchmarks y métricas
Echemos un vistazo a los benchmarks para las series de modelos Qwen3.6 y Qwen3.5 que formaron la base para el lanzamiento actual.


En generación de código y llamadas a funciones externas, la arquitectura 35B-A3B funciona al nivel de modelos monolíticos más pesados. Al mismo tiempo, solo cerca de 3 mil millones de parámetros permanecen activos por token.
Abajo están los resultados para los modelos más antiguos y más nuevos en la línea 3.5:



Cómo ejecutar localmente o en un servidor
El equipo de Qwen ha preparado integraciones con casi todos los motores de inferencia populares. Puedes ejecutar el modelo en un servidor modesto así como en un clúster de múltiples GPUs.
Inicio rápido a través de Hugging Face Transformers
La forma más directa de levantar un endpoint compatible con OpenAI es el CLI integrado de la biblioteca transformers:
transformers serve Qwen/Qwen3.8-27B --port 8000 --continuous-batching
Después de ejecutar el comando, el servidor escucha en http://localhost:8000/v1.
Despliegue en producción a través de vLLM y SGLang
Para alto rendimiento, es mejor usar motores especializados. Nota las banderas del parser de razonamiento y llamadas a herramientas — son necesarias para el funcionamiento correcto de las funciones del agente.
Lanzamiento a través de vLLM:
vllm serve Qwen/Qwen3.8-27B \
--port 8000 \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder
Lanzamiento a través de SGLang:
sglang serve \
--model-path Qwen/Qwen3.8-27B \
--port 8000 \
--tp-size 4 \
--context-length 262144 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder
Si estás trabajando en Apple Silicon, usa los paquetes mlx-lm o mlx-vlm. Para ejecutar en hardware de consumo a través de CPU y GPUs modestas, builds GGUF cuantizados ya están disponibles en Hugging Face bajo llama.cpp.
Ajuste fino para tus tareas
Si necesitas adaptar el modelo para un codebase interno o dialecto de API específico, el repositorio recomienda usar bibliotecas probadas:
Unslothpara entrenamiento LoRA/QLoRA rápido y eficiente en memoriaLLaMA-FactoryySwiftpara SFT, DPO y GRPO
Las variantes MoE insignia requerirán recursos de servidor serios, pero la versión 27B se ajusta sin problemas en una o dos tarjetas como RTX 4090 o A100 cuando se usa cuantización.
¿Quién se beneficiará de este proyecto
La serie Qwen3.8 aborda varios escenarios prácticos simultáneamente:
- Asistentes de código locales y autocompletado en un entorno empresarial cerrado donde no puedes enviar código a APIs de nube externas
- Agentes autónomos complejos que ejecutan pipelines de múltiples pasos, leen logs de pruebas y corrigen errores en el repositorio por sí mismos
- Pipelines de investigación con contexto largo, procesamiento de documentación y búsqueda de conexiones en grandes volúmenes de texto
- Ajuste de versiones compactas para dominios estrechos sin perder la coherencia de razonamiento general
Si buscas una base abierta para agentes autónomos o un asistente de código de terminal, prueba Qwen3.8-27B. El modelo ya es compatible con la mayoría de herramientas del ecosistema y se despliega en literalmente un par de comandos.
Proyectos relacionados