>_ DevTrendsit

Lingua

Home

Linguaggi

Sezioni

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embedded Sicurezza
Unknown

Il nuovo modello open Qwen3.8 sfida i flagship proprietari

Il team di Alibaba ha rilasciato la serie di pesi Qwen3.8 come open source, includendo il modello Qwen3.8-27B e la variante MoE mastodontica Qwen3.8-2.4T-A95B. Per la prima volta, i modelli di classe Qwen-Max sono disponibili su Hugging Face e ModelScope per l'auto-hosting e il fine-tuning.

Se hai seguito lo sviluppo degli LLM open nell'ultimo anno, avrai probabilmente notato un cambiamento interessante. Gli sviluppatori competevano sulla dimensione grezza della finestra di contesto o sui punteggi del benchmark MMLU. Ora l'attenzione si è spostata su compiti pratici: mantenere il contesto di ragionamento in conversazioni lunghe, rispondere in modo appropriato agli errori dell'ambiente durante la scrittura del codice e un uso affidabile degli strumenti. La serie Qwen3.8 si concentra esattamente su queste aree.

Novità in Qwen3.8

In questo aggiornamento, gli sviluppatori hanno trasferito i miglioramenti architetturali da Qwen3.5 a pesi più potenti e hanno aggiunto due controlli utili per la logica di ragionamento.

La prima funzionalità è il parametro reasoning_effort. Ora puoi regolare esplicitamente la profondità del pensiero del modello prima di generare una risposta. Se il compito è semplice, il modello non spreca token extra in catene di ragionamento infinite. Per refactoring complessi o derivazioni matematiche, puoi portare il parametro al massimo.

La seconda funzionalità risolve un problema comune nei dialoghi lunghi degli agenti — preserve_thinking. Di solito, quando si passa al passo successivo, il contesto del ragionamento precedente viene perso, causando al modello di ripetere o rimanere bloccato in ipotesi già rifiutate. Qui, il contesto del processo di pensiero viene preservato tra i messaggi, accelerando notevolmente lo sviluppo iterativo.

Architettonicamente, la famiglia si basa su una combinazione di Gated Delta Networks e sparse Mixture-of-Experts. Questo riduce l'overhead di memoria e fornisce un'elevata velocità di generazione anche su contesti fino a 262k token.

Risultati dei benchmark e metriche

Vediamo i benchmark per le serie di modelli Qwen3.6 e Qwen3.5 che hanno formato la base per il rilascio attuale.

Risultati benchmark Qwen3.6-27B

Risultati benchmark Qwen3.6-35B-A3B

Nei compiti di generazione di codice e chiamata di funzioni esterne, l'architettura 35B-A3B si comporta alla pari con modelli monolitici più pesanti. Allo stesso tempo, solo circa 3 miliardi di parametri rimangono attivi per token.

Di seguito i risultati per i modelli più vecchi e più giovani nella lineup 3.5:

Risultati benchmark Qwen3.5-397B-A17B

Risultati benchmark Qwen3.5-122B-A10B, Qwen3.5-35B-A3B e Qwen3.5-27B

Risultati benchmark Qwen3.5-9B e Qwen3.5-4B

Come eseguire in locale o su un server

Il team Qwen ha preparato integrazioni con quasi tutti i motori di inferenza più diffusi. Puoi eseguire il modello su un server modesto così come su un cluster di più GPU.

Quick Start tramite Hugging Face Transformers

Il modo più diretto per avviare un endpoint compatibile con OpenAI è la CLI integrata della libreria transformers:

transformers serve Qwen/Qwen3.8-27B --port 8000 --continuous-batching

Dopo l'esecuzione del comando, il server rimane in ascolto su http://localhost:8000/v1.

Deploy in produzione tramite vLLM e SGLang

Per un throughput elevato, è meglio usare motori specializzati. Nota i flag del parser per il ragionamento e la chiamata di strumenti — sono necessari per il corretto funzionamento delle funzioni degli agenti.

Lancio tramite vLLM:

vllm serve Qwen/Qwen3.8-27B \
  --port 8000 \
  --tensor-parallel-size 4 \
  --max-model-len 262144 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder

Lancio tramite SGLang:

sglang serve \
  --model-path Qwen/Qwen3.8-27B \
  --port 8000 \
  --tp-size 4 \
  --context-length 262144 \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder

Se stai lavorando su Apple Silicon, usa i pacchetti mlx-lm o mlx-vlm. Per l'esecuzione su hardware consumer tramite CPU e GPU modeste, le build GGUF quantizzate sono già disponibili su Hugging Face sotto llama.cpp.

Fine-tuning per i tuoi compiti

Se hai bisogno di adattare il modello per un codebase interno o un dialetto API specifico, il repository consiglia di usare librerie collaudate:

  • Unsloth per addestramento LoRA/QLoRA rapido ed efficiente in termini di memoria
  • LLaMA-Factory e Swift per SFT, DPO e GRPO

Le varianti MoE di punta richiederanno risorse server serie, ma la versione 27B si adatta senza problemi su una o due schede come RTX 4090 o A100 quando si usa la quantizzazione.

Chi trarrà beneficio da questo progetto

La serie Qwen3.8 affronta diversi scenari pratici contemporaneamente:

  • Assistenti di codice locali e completamento automatico in un ambiente aziendale chiuso dove non puoi inviare codice ad API cloud esterne
  • Agenti autonomi complessi che eseguono pipeline multi-step, leggono log di test e correggono errori nel repository autonomamente
  • Pipeline di ricerca con contesto lungo, elaborazione di documenti e ricerca di connessioni in grandi volumi di testo
  • Tuning di versioni compatte per domini ristretti senza perdere la coerenza di ragionamento complessiva

Se stai cercando una base aperta per agenti autonomi o un assistente di codice da terminale, prova Qwen3.8-27B. Il modello è già supportato dalla maggior parte degli strumenti dell'ecosistema e si implementa in letteralmente un paio di comandi.

Progetti correlati