新しいオープンソースQwen3.8モデルがProprietary最高峰モデルに 도전
AlibabaのチームがQwen3.8 Weightシリーズをオープンソースとしてリリースしました。Qwen3.8-27Bモデルと巨大なMoEバリアントであるQwen3.8-2.4T-A95Bを含みます。初めて、Qwen-MaxクラスのモデルがHugging FaceとModelScopeで自己ホスティングやファインチューニングに利用可能になりました。
過去1年間のオープンLLM開発を追跡してきた方なら、興味深い転換に気づいているかもしれません。開発者はかつて、生のコンテキストウィンドウサイズやMMLUベンチマークスコアで競い合っていました。今では、実用的なタスクに焦点が移っています:長い会話での推論コンテキストの維持、コード記述時の環境エラーへの適切な対応、信頼性の高いツール使用です。Qwen3.8シリーズはまさにこれらの分野に焦点を当てています。
Qwen3.8の新機能
このアップデートでは、開発者がQwen3.5からのアーキテクチャ改善をより強力なWeightに移植し、推論ロジック向けの2つの有用なコントロールを追加しました。
最初の特徴はreasoning_effortパラメータです。応答を生成する前に、モデルの思考の深さを明示的に調整できるようになりました。タスクが単純な場合、モデルは延々と続く推論チェーンに余分なトークンを浪費しません。複雑なリファクタリングや数学的導出には、パラメータを最大に上げることができます。
2番目の機能は、長いエージェントダイアログにおける一般的な問題 — preserve_thinkingを解決します。通常、次のステップに進むとき、以前の推論のコンテキストが失われ、モデルがループしたり、拒否された仮説を繰り返したりします。ここでは、メッセージ間で思考プロセスのコンテキストが保持され、反復的な開発が著しく高速化されます。
アーキテクチャ的には、このファミリーはGated Delta NetworksとSparse Mixture-of-Expertsの組み合わせに依存しています。これによりメモリオーバーヘッドが削減され、最大262kトークンのコンテキストでも高い生成速度が実現されます。
ベンチマーク結果とメトリクス
現在のリリースの基礎となったQwen3.6およびQwen3.5モデルシリーズのベンチマークを見てみましょう。


コード生成と外部関数呼び出しタスクでは、35B-A3Bアーキテクチャがより大きなモノリシックモデルと同等のパフォーマンスを示します。同時に、トークンあたり約30億のパラメータのみがアクティブのままです。
以下は、3.5シリーズの古いモデルと新しいモデルの結果です:



ローカルまたはサーバーでの実行方法
Qwenチームは、ほとんどすべての一般的な推論エンジンとの統合を準備しています。控えめなサーバーでも、複数のGPUのクラスターでもモデルを実行できます。
Hugging Face Transformersによるクイックスタート
OpenAI互換エンドポイントを起動する最も簡単な方法は、transformersライブラリの組み込みCLIを使用することです:
transformers serve Qwen/Qwen3.8-27B --port 8000 --continuous-batching
コマンドを実行すると、サーバーはhttp://localhost:8000/v1でリッスンします。
vLLMとSGLangによる本番環境へのデプロイ
高スループットには、専用エンジンの使用をお勧めします。推論とツール呼び出しパーサーフラグに注意してください — これらはエージェント関数の正しい動作に必要です。
vLLMでの起動:
vllm serve Qwen/Qwen3.8-27B \
--port 8000 \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder
SGLangでの起動:
sglang serve \
--model-path Qwen/Qwen3.8-27B \
--port 8000 \
--tp-size 4 \
--context-length 262144 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder
Apple Siliconで作業している場合は、mlx-lmまたはmlx-vlmパッケージを使用してください。CPUや控えめなGPUでコンシューマーハードウェア上で実行する場合は、Hugging Faceのllama.cppで量子化されたGGUFビルドがすでに利用可能です。
タスクに応じたファインチューニング
モデルを社内コードベースや特定のAPIダイアレクトに適応させる必要がある場合、リポジトリでは実証済みのライブラリの使用を推奨しています:
- 高速でメモリ効率の良いLoRA/QLoRAトレーニング用の
Unsloth - SFT、DPO、GRPO用の
LLaMA-FactoryおよびSwift
フラッグシップMoEバリアントには 상당なサーバー資源が必要ですが、27Bバージョンは量子化を使用するとRTX 4090やA100などの1枚または2枚のカードでファインチューニングできます。
このプロジェクト誰が恩恵を受けるか
Qwen3.8シリーズは複数の実用的なシナリオに同時に対応します:
- コードを外部クラウドAPIに送信できない閉鎖的な企業環境でのローカルコードアシスタントと自動補完
- マルチステップパイプラインを実行し、テストログを読み取り、 リポジトリ内のエラーを自分で修正する複雑な自律型エージェント
- 長いコンテキスト、ドキュメント処理、大量のテキストでの接続の発見を伴う研究パイプライン
- 全体的な推論の一貫性を失うことなく、狭いドメイン向けのコンパクトバージョンの調整
自律型エージェントやターミナルコードアシスタント用のオープン基盤を探している場合は、Qwen3.8-27Bを試してみてください。このモデルはすでにほとんどのエコシステムツールでサポートされており、 literally数コマンドでデプロイできます。
関連プロジェクト