全新开源 Qwen3.8 模型挑战闭源旗舰
阿里巴巴团队已正式开源 Qwen3.8 权重系列,包括 Qwen3.8-27B 模型以及超大规模 MoE 变体 Qwen3.8-2.4T-A95B。Qwen-Max 级别的模型首次登陆 Hugging Face 和 ModelScope,支持自托管和微调。
如果你一直在关注过去一年开源 LLM 的发展,可能已经注意到一个有趣的变化。开发者们过去在原始上下文窗口大小或 MMLU 基准分数上竞争,而现在焦点已转向实际任务:在长对话中保持推理上下文、在编写代码时适当响应环境错误,以及可靠的工具调用。Qwen3.8 系列正是聚焦于这些领域。
Qwen3.8 的新特性
本次更新中,开发者将 Qwen3.5 的架构改进移植到了更强大的权重上,并新增了两个实用的推理控制功能。
第一个功能是 reasoning_effort 参数。现在你可以显式调节模型在生成响应前的思考深度。如果任务简单,模型不会在无尽的推理链上浪费额外 token。对于复杂的重构或数学推导,可以将该参数调到最大。
第二个功能解决了长 Agent 对话中的常见问题—— preserve_thinking。通常情况下,当进入下一步时,之前的推理上下文会丢失,导致模型陷入循环或重复已被拒绝的假设。这里,思维过程上下文在消息之间得以保留,显著加速了迭代开发。
在架构上,该系列采用了 Gated Delta Networks 与稀疏 Mixture-of-Experts 的组合。这降低了内存开销,即使在高达 262k token 的上下文中也能提供高生成速度。
基准测试结果与指标
让我们看看构成当前发布基础 Qwen3.6 和 Qwen3.5 模型系列的基准测试。


在代码生成和外部函数调用任务中,35B-A3B 架构的性能与更重的单体模型相当。同时,每个 token 仅激活约 30 亿参数。
以下是 3.5 系列中较老和较新模型的结果:



如何在本地或服务器上运行
Qwen 团队已准备了与几乎所有流行推理引擎的集成。你可以在普通服务器上运行模型,也可以部署在多 GPU 集群上。
通过 Hugging Face Transformers 快速启动
启动 OpenAI 兼容端点的最直接方式是 transformers 库的内置 CLI:
transformers serve Qwen/Qwen3.8-27B --port 8000 --continuous-batching
执行命令后,服务器监听在 http://localhost:8000/v1。
通过 vLLM 和 SGLang 进行生产部署
为了获得高吞吐量,最好使用专用引擎。注意推理和工具调用解析器标志——这些是正确运行 Agent 函数所必需的。
通过 vLLM 启动:
vllm serve Qwen/Qwen3.8-27B \
--port 8000 \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder
通过 SGLang 启动:
sglang serve \
--model-path Qwen/Qwen3.8-27B \
--port 8000 \
--tp-size 4 \
--context-length 262144 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder
如果你在 Apple Silicon 上工作,可以使用 mlx-lm 或 mlx-vlm 包。对于通过 CPU 和普通 GPU 在消费级硬件上运行,Hugging Face 上已有量化 GGUF 构建版本,位于 llama.cpp。
针对任务进行微调
如果需要将模型适配到内部代码库或特定 API 方言,仓库推荐使用经过验证的库:
Unsloth用于快速且内存高效的 LoRA/QLoRA 训练LLaMA-Factory和Swift用于 SFT、DPO 和 GRPO
旗舰级 MoE 变体需要相当规模的服务器资源,但 27B 版本在使用量化的情况下可以在单卡或双卡(如 RTX 4090 或 A100)上顺利微调。
谁将从这个项目中受益
Qwen3.8 系列同时解决了多个实际场景:
- 本地代码助手和自动补全,适用于无法将代码发送到外部云 API 的封闭企业环境
- 复杂的自主 Agent,执行多步骤流水线、读取测试日志并自行修复仓库中的错误
- 需要长上下文的研究流水线,处理文档并在大量文本中寻找关联
- 为窄领域调优紧凑版本,同时不丧失整体推理连贯性
如果你正在寻找用于自主 Agent 或终端代码助手的基础模型,请尝试 Qwen3.8-27B。该模型已被大多数生态工具支持,只需几个命令即可完成部署。
相关项目