Aller au contenu
Retour au blog

Unsloth Studio — faire tourner et entraîner des LLM en local

Studio, le Desktop et les kernels Unsloth : GGUF / MLX, fine-tune low-VRAM, Data Recipes — et pourquoi le GGUF Qwen3.8-27B tient en 17 Go.

6 min de lecture
  • Unsloth
  • Local LLM
  • GGUF
  • Qwen
  • Fine-tuning

Mi-août, Unsloth a poussé un GGUF de Qwen3.8-27B. En moins de 24 heures : 1 000 likes, 3e modèle trending sur Hugging Face, 1 M de downloads. Leur phrase utile n’est pas le compteur — c’est « Run on 17GB RAM/VRAM setups via Unsloth ». Un 27B frontier-adjacent qui tient sur une machine que tu possèdes, c’est exactement le job de Studio.

Annonce Unsloth : Qwen3.8-27B GGUF, 1000 likes en 24 h, exécutable en 17 Go via Unsloth
UnslothAI — Qwen3.8-27B GGUF : 1 000 likes en 24 h, #3 trending, 1 M de downloads, 17 Go RAM/VRAM.

Ce qu’est Unsloth

Unsloth (github.com/unslothai/unsloth) est d’abord une lib de training : kernels custom, ~2× plus vite, ~70 % de VRAM en moins vs le stack Transformers + PEFT, sans perte de qualité annoncée. Studio est l’UI locale par-dessus : une app Desktop (Mac, Windows, Linux) ou un unsloth studio dans le navigateur. Même moteur, plus de notebook.

  • Inférence locale : GGUF, safetensors, MLX sur Mac, diffusion image/vidéo.
  • Training no-code : 500+ modèles texte, vision, TTS, embeddings — QLoRA, LoRA, FP8, full.
  • Data Recipes : PDF, CSV, JSON, DOCX, TXT → dataset (NVIDIA NeMo Data Designer).
  • Export : GGUF, safetensors 16-bit, adaptateur LoRA — vers llama.cpp, Ollama, vLLM, LM Studio.
  • Agents : endpoint OpenAI-compatible + unsloth start (Claude Code, Codex, Hermes, OpenCode).

Pourquoi 17 Go changent le calcul

Le GGUF Unsloth de Qwen3.8-27B (huggingface.co/unsloth/Qwen3.8-27B-GGUF) est le cas d’école. Le même modèle en BF16 pèse ~55 Go. En quant Unsloth, il rentre dans 17 Go — RTX 4070, Mac 32 Go en MLX, petite instance cloud. Tu ne loues plus une H100 pour « juste essayer ». Tu charges, tu chats, tu compares, tu exportes.

  • Pas besoin de fine-tuner pour s’en servir : Studio charge un GGUF et c’est tout.
  • Tool calling self-healing, web search privé, exécution Bash/Python sandboxée.
  • Arena : deux modèles / quants côte à côte dans la même UI.
  • Offline : pas de télémétrie d’usage ; hardware minimal pour la compat.

Le parcours Studio

La doc (unsloth.ai/docs/new/studio) décrit une boucle unique. Tu n’enchaînes plus Transformers, un quantizer, Ollama et un YAML.

  • Lancer Desktop ou unsloth studio — chercher un modèle Hub ou un GGUF local.
  • Optionnel : Data Recipes pour fabriquer le set à partir de tes fichiers.
  • Fine-tune QLoRA (défaut low-VRAM) / LoRA / full, métriques et VRAM en temps réel.
  • Comparer le checkpoint au baseline dans le chat.
  • Exporter vers le runtime que tu as déjà.

Installer

Desktop : unsloth.ai/download/mac (aussi Windows et Linux). CLI :

# macOS / Linux / WSL
curl -fsSL https://unsloth.ai/install.sh | sh

unsloth studio -H 0.0.0.0 -p 8888
# → http://127.0.0.1:8888

# Tunnel HTTPS Cloudflare (optionnel)
unsloth studio --secure

NVIDIA : training + inférence GPU. Mac : training, MLX et GGUF. CPU : chat et Data Recipes. Le training lourd reste côté GPU NVIDIA. Une fois un modèle chargé :

unsloth start hermes
# aussi : claude, codex, opencode, openclaw

Dans mon stack

vLLM sur AWS garde l’agent quotidien. Studio est là où j’essaie un GGUF du jour — Qwen3.8-27B en 4-bit sur le M1, par exemple — et où je fine-tunerais un corpus qui ne doit pas sortir de la machine. Détail sur le 27B : /blog/qwen-3-8-27b

Bilan

Unsloth n’est plus seulement une lib de LoRA rapide. Studio en fait l’endroit où tu cours, compares et exportes les modèles open du moment — y compris un 27B qui rentre en 17 Go. Le tweet Qwen3.8 n’est pas du marketing vide : c’est la preuve que le local a rattrapé le rythme des sorties.

  • Doc Studio : unsloth.ai/docs/new/studio
  • Repo : github.com/unslothai/unsloth
  • GGUF Qwen3.8-27B : huggingface.co/unsloth/Qwen3.8-27B-GGUF
  • Annonce : x.com/UnslothAI/status/2088627177655050362
  • Qwen 3.8 27B : /blog/qwen-3-8-27b