Par Tamsi Besson ·
Unsloth Studio — faire tourner et entraîner des LLM en local
Studio, le Desktop et les kernels Unsloth : GGUF / MLX, fine-tune low-VRAM, Data Recipes — et pourquoi le GGUF Qwen3.8-27B tient en 17 Go.
- Unsloth
- Local LLM
- GGUF
- Qwen
- Fine-tuning
Mi-août, Unsloth a poussé un GGUF de Qwen3.8-27B. En moins de 24 heures : 1 000 likes, 3e modèle trending sur Hugging Face, 1 M de downloads. Leur phrase utile n’est pas le compteur — c’est « Run on 17GB RAM/VRAM setups via Unsloth ». Un 27B frontier-adjacent qui tient sur une machine que tu possèdes, c’est exactement le job de Studio.

Ce qu’est Unsloth
Unsloth (github.com/unslothai/unsloth) est d’abord une lib de training : kernels custom, ~2× plus vite, ~70 % de VRAM en moins vs le stack Transformers + PEFT, sans perte de qualité annoncée. Studio est l’UI locale par-dessus : une app Desktop (Mac, Windows, Linux) ou un unsloth studio dans le navigateur. Même moteur, plus de notebook.
- Inférence locale : GGUF, safetensors, MLX sur Mac, diffusion image/vidéo.
- Training no-code : 500+ modèles texte, vision, TTS, embeddings — QLoRA, LoRA, FP8, full.
- Data Recipes : PDF, CSV, JSON, DOCX, TXT → dataset (NVIDIA NeMo Data Designer).
- Export : GGUF, safetensors 16-bit, adaptateur LoRA — vers llama.cpp, Ollama, vLLM, LM Studio.
- Agents : endpoint OpenAI-compatible +
unsloth start(Claude Code, Codex, Hermes, OpenCode).
Pourquoi 17 Go changent le calcul
Le GGUF Unsloth de Qwen3.8-27B (huggingface.co/unsloth/Qwen3.8-27B-GGUF) est le cas d’école. Le même modèle en BF16 pèse ~55 Go. En quant Unsloth, il rentre dans 17 Go — RTX 4070, Mac 32 Go en MLX, petite instance cloud. Tu ne loues plus une H100 pour « juste essayer ». Tu charges, tu chats, tu compares, tu exportes.
- Pas besoin de fine-tuner pour s’en servir : Studio charge un GGUF et c’est tout.
- Tool calling self-healing, web search privé, exécution Bash/Python sandboxée.
- Arena : deux modèles / quants côte à côte dans la même UI.
- Offline : pas de télémétrie d’usage ; hardware minimal pour la compat.
Le parcours Studio
La doc (unsloth.ai/docs/new/studio) décrit une boucle unique. Tu n’enchaînes plus Transformers, un quantizer, Ollama et un YAML.
- Lancer Desktop ou
unsloth studio— chercher un modèle Hub ou un GGUF local. - Optionnel : Data Recipes pour fabriquer le set à partir de tes fichiers.
- Fine-tune QLoRA (défaut low-VRAM) / LoRA / full, métriques et VRAM en temps réel.
- Comparer le checkpoint au baseline dans le chat.
- Exporter vers le runtime que tu as déjà.
Installer
Desktop : unsloth.ai/download/mac (aussi Windows et Linux). CLI :
# macOS / Linux / WSL
curl -fsSL https://unsloth.ai/install.sh | sh
unsloth studio -H 0.0.0.0 -p 8888
# → http://127.0.0.1:8888
# Tunnel HTTPS Cloudflare (optionnel)
unsloth studio --secureNVIDIA : training + inférence GPU. Mac : training, MLX et GGUF. CPU : chat et Data Recipes. Le training lourd reste côté GPU NVIDIA. Une fois un modèle chargé :
unsloth start hermes
# aussi : claude, codex, opencode, openclawDans mon stack
vLLM sur AWS garde l’agent quotidien. Studio est là où j’essaie un GGUF du jour — Qwen3.8-27B en 4-bit sur le M1, par exemple — et où je fine-tunerais un corpus qui ne doit pas sortir de la machine. Détail sur le 27B : /blog/qwen-3-8-27b
Bilan
Unsloth n’est plus seulement une lib de LoRA rapide. Studio en fait l’endroit où tu cours, compares et exportes les modèles open du moment — y compris un 27B qui rentre en 17 Go. Le tweet Qwen3.8 n’est pas du marketing vide : c’est la preuve que le local a rattrapé le rythme des sorties.
- Doc Studio : unsloth.ai/docs/new/studio
- Repo : github.com/unslothai/unsloth
- GGUF Qwen3.8-27B : huggingface.co/unsloth/Qwen3.8-27B-GGUF
- Annonce : x.com/UnslothAI/status/2088627177655050362
- Qwen 3.8 27B : /blog/qwen-3-8-27b