>_ DevTrendszh

语言

首页

语言

板块

前端 后端 移动端 DevOps AI / ML 游戏开发 区块链 嵌入式 安全
Unknown

全新开源 Qwen3.8 模型挑战闭源旗舰

阿里巴巴团队已正式开源 Qwen3.8 权重系列,包括 Qwen3.8-27B 模型以及超大规模 MoE 变体 Qwen3.8-2.4T-A95B。Qwen-Max 级别的模型首次登陆 Hugging Face 和 ModelScope,支持自托管和微调。

如果你一直在关注过去一年开源 LLM 的发展,可能已经注意到一个有趣的变化。开发者们过去在原始上下文窗口大小或 MMLU 基准分数上竞争,而现在焦点已转向实际任务:在长对话中保持推理上下文、在编写代码时适当响应环境错误,以及可靠的工具调用。Qwen3.8 系列正是聚焦于这些领域。

Qwen3.8 的新特性

本次更新中,开发者将 Qwen3.5 的架构改进移植到了更强大的权重上,并新增了两个实用的推理控制功能。

第一个功能是 reasoning_effort 参数。现在你可以显式调节模型在生成响应前的思考深度。如果任务简单,模型不会在无尽的推理链上浪费额外 token。对于复杂的重构或数学推导,可以将该参数调到最大。

第二个功能解决了长 Agent 对话中的常见问题—— preserve_thinking。通常情况下,当进入下一步时,之前的推理上下文会丢失,导致模型陷入循环或重复已被拒绝的假设。这里,思维过程上下文在消息之间得以保留,显著加速了迭代开发。

在架构上,该系列采用了 Gated Delta Networks 与稀疏 Mixture-of-Experts 的组合。这降低了内存开销,即使在高达 262k token 的上下文中也能提供高生成速度。

基准测试结果与指标

让我们看看构成当前发布基础 Qwen3.6 和 Qwen3.5 模型系列的基准测试。

Qwen3.6-27B 基准测试结果

Qwen3.6-35B-A3B 基准测试结果

在代码生成和外部函数调用任务中,35B-A3B 架构的性能与更重的单体模型相当。同时,每个 token 仅激活约 30 亿参数。

以下是 3.5 系列中较老和较新模型的结果:

Qwen3.5-397B-A17B 基准测试结果

Qwen3.5-122B-A10B、Qwen3.5-35B-A3B 和 Qwen3.5-27B 基准测试结果

Qwen3.5-9B 和 Qwen3.5-4B 基准测试结果

如何在本地或服务器上运行

Qwen 团队已准备了与几乎所有流行推理引擎的集成。你可以在普通服务器上运行模型,也可以部署在多 GPU 集群上。

通过 Hugging Face Transformers 快速启动

启动 OpenAI 兼容端点的最直接方式是 transformers 库的内置 CLI:

transformers serve Qwen/Qwen3.8-27B --port 8000 --continuous-batching

执行命令后,服务器监听在 http://localhost:8000/v1

通过 vLLM 和 SGLang 进行生产部署

为了获得高吞吐量,最好使用专用引擎。注意推理和工具调用解析器标志——这些是正确运行 Agent 函数所必需的。

通过 vLLM 启动:

vllm serve Qwen/Qwen3.8-27B \
  --port 8000 \
  --tensor-parallel-size 4 \
  --max-model-len 262144 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder

通过 SGLang 启动:

sglang serve \
  --model-path Qwen/Qwen3.8-27B \
  --port 8000 \
  --tp-size 4 \
  --context-length 262144 \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder

如果你在 Apple Silicon 上工作,可以使用 mlx-lmmlx-vlm 包。对于通过 CPU 和普通 GPU 在消费级硬件上运行,Hugging Face 上已有量化 GGUF 构建版本,位于 llama.cpp

针对任务进行微调

如果需要将模型适配到内部代码库或特定 API 方言,仓库推荐使用经过验证的库:

  • Unsloth 用于快速且内存高效的 LoRA/QLoRA 训练
  • LLaMA-FactorySwift 用于 SFT、DPO 和 GRPO

旗舰级 MoE 变体需要相当规模的服务器资源,但 27B 版本在使用量化的情况下可以在单卡或双卡(如 RTX 4090 或 A100)上顺利微调。

谁将从这个项目中受益

Qwen3.8 系列同时解决了多个实际场景:

  • 本地代码助手和自动补全,适用于无法将代码发送到外部云 API 的封闭企业环境
  • 复杂的自主 Agent,执行多步骤流水线、读取测试日志并自行修复仓库中的错误
  • 需要长上下文的研究流水线,处理文档并在大量文本中寻找关联
  • 为窄领域调优紧凑版本,同时不丧失整体推理连贯性

如果你正在寻找用于自主 Agent 或终端代码助手的基础模型,请尝试 Qwen3.8-27B。该模型已被大多数生态工具支持,只需几个命令即可完成部署。

相关项目