Aller au contenu
Retour au blog

Qwen 3.8 27B — le 27B open qui rapproche le frontier du local

Caractéristiques de Qwen3.8-27B, scores officiels face à 3.6 et à Opus 4.6 Max, et ce que ça change pour l’IA locale.

6 min de lecture
  • Qwen
  • Local LLM
  • Open source
  • Benchmarks

Qwen3.8-27B est sorti à la mi-août 2026 : un dense 27B Apache 2.0, multimodal natif, 262k de contexte. Pas un MoE de 2 T de paramètres — un modèle que tu peux télécharger et servir. La model card le place au-dessus de Qwen3.6-27B partout, et au-dessus de Claude Opus 4.6 Max sur plusieurs benches de code et d’agent. Chiffres vendeur, à prendre comme plafond en attendant des reproductions indépendantes — mais le signal pour l’IA locale est clair.

Barres groupées : Qwen3.8-27B, Qwen3.6-27B et Claude Opus 4.6 Max sur six benchmarks officiels
Scores de la model card officielle (Qwen/Qwen3.8-27B). SWE-bench Pro et les benches coding utilisent le harness Claude Code.

Caractéristiques

Le 27B est le dense compact de la génération Qwen3.8, construit sur l’archi Qwen3.5 : 64 couches, attention hybride (16 blocs Gated Attention, le reste en Gated DeltaNet linéaire), encodeur vision, Multi-Token Prediction. Apache 2.0, poids ouverts, pensé pour le déploiement — pas seulement pour une API cloud.

  • 27B dense (≈28B avec la tour vision), 64 couches, hidden 5120, vocab 248 320.
  • Contexte natif 262 144 tokens, extensible à 1 000 000 via YaRN.
  • Multimodal natif : images et vidéo (docs, schémas STEM, vidéos longues).
  • Thinking on by default, réglable via reasoning_effort (xhigh / medium / low) et preserve_thinking.
  • Servi par vLLM 0.17+, SGLang, Transformers ≥ 5.8 ; quants communautaires MLX / GGUF / NVFP4 / FP8 dès le jour 0.

Ce que disent les benches

Sur la carte officielle, le saut vs 3.6 est surtout agentique et coding. DeepSWE 1.1 passe de 13,3 à 42,2. QwenSWEBench de 49,3 à 79,0. SWE-bench Pro 61,7 vs 53,5 (et 53,4 pour Opus 4.6 Max, harness différent pour Opus). LiveCodeBench v6 90,3 vs 83,9. Côté vision / computer use : OSWorld-Verified 84,3 vs 63,9.

  • Terminal-Bench 2.1 : 73,0 (3.6 : 63,4 — Opus : 78,2).
  • SWE-bench Pro : 61,7 (3.6 : 53,5 — Opus : 53,4).
  • LiveCodeBench v6 : 90,3 (3.6 : 83,9 — Opus : 88,8).
  • CoWorkBench : 70,7 (3.6 : 61,0 — Opus : 68,2).
  • IFBench : 79,5 (3.6 : 69,1 — Opus : 62,5).
  • OSWorld-Verified : 84,3 (3.6 : 63,9 — Opus : 72,7).

Opus reste devant sur Terminal-Bench, GPQA Diamond (91,3 vs 89,2) et Humanity’s Last Exam. Le 27B n’est pas « mieux qu’Opus partout ». Il est assez proche, sur assez de tâches d’ingénierie, pour qu’un poids open de 27B change le calcul local vs API.

Impact sur l’IA locale

Jusqu’ici, le local tenait surtout le volume : petits modèles, quants agressifs, tâches courtes. Le frontier agentique (gros diffs, computer use, boucles d’outils) restait facturé au token. Un 27B Apache qui affiche des scores de coding / SWE au niveau d’un Opus cloud, et qui tourne en FP8 sur une 48 Go ou en 4-bit sur laptop, déplace la frontière.

  • Plus de licence à négocier, plus de quota qui coupe une session agent au milieu d’un refactor.
  • 262k de contexte natif : un repo, pas un fichier, tient dans une fenêtre locale.
  • Vision + computer use (OSWorld, WebArena, AndroidWorld) : le local n’est plus « texte only ».
  • Quants jour 0 (Unsloth, MLX, GGUF, NVFP4) : le même poids va du Mac au serveur vLLM.
  • Thinking contrôlable : tu paies le raisonnement seulement quand la tâche le justifie.

Ça ne tue pas les APIs. Ça rend défendable de garder le travail quotidien — revue, proto, MCP, Hermes — sur une machine que tu contrôles. Le 3.6 m’avait déjà poussé vers vLLM self-hosted ; le 3.8 rend ce choix moins « compromis qualité ».

Un essai local

Je l’ai fait tourner en MLX 4-bit dans Unsloth Studio sur un MacBook M1 32 Go. Pas un bench : un Tetris HTML, ~11 tok/s, assez fluide pour itérer. Détail ici : x.com/tamsi_besson/status/2089656034449080484

Bilan

Qwen 3.8 27B n’est pas un miracle de taille. C’est un dense open, multimodal, long-contexte, dont les scores officiels de coding et d’agent se rapprochent des flagships cloud. Pour l’IA locale, c’est le palier où « self-host un 27B » cesse d’être un hobby et devient une option d’ingénierie. Les reproductions indépendantes diront si les barres tiennent ; les poids, eux, sont déjà là.

  • Model card : huggingface.co/Qwen/Qwen3.8-27B
  • Essai local : x.com/tamsi_besson/status/2089656034449080484
  • Studio : /blog/unsloth-studio
  • Serveur 3.6 : /blog/qwen-3-6-27b-remote-server