La distillation est la raison pour laquelle l’auto-hébergement d’un LLM ouvert est finalement pratique. Un modèle 7B distillé d’un enseignant 400B peut maintenant gérer le suivi des instructions, le codage et le raisonnement à un niveau qui aurait nécessité un équipement de centre de données il y a deux ans. Le récent article de XDA sur ce que “distiller” signifie vraiment est juste sur la récompense : les bons petits modèles existent, et maintenant vous pouvez les affiner à la maison. La question est quel outil de bureau choisir. Nous avons mis sept des applications d’affinement les plus utilisées sur une station de travail avec un seul RTX 4090 et avons exécuté le même LoRA sur une ligne de base Llama 3.3 8B distillée pour voir comment elles se comparaient. Ce sont les meilleures applications de bureau pour affiner les LLM ouverts en 2026.
Ce qu’il faut rechercher dans un outil d’affinement
L’affinement est différent du service. Une bonne application de bureau doit résoudre quatre choses que python train.py simple ne fait pas :
- Les astuces de mémoire (QLoRA, 4-bit, gradient checkpointing) qui ajustent un modèle réel sur un seul GPU grand public
- Un chargeur d’ensemble de données qui gère les formats courants (ShareGPT, Alpaca, JSONL) sans script de prétraitement
- Des valeurs par défaut sensées pour que la première exécution ne soit pas une recherche d’hyperparamètre
- Un chemin d’exportation vers GGUF, MLX ou ONNX pour que le modèle affiné fonctionne réellement quelque part d’utile après
Tableau de comparaison rapide
| Application | Meilleur pour | Matériel | Plan gratuit | Prix de départ/mois | Formats d’exportation |
|---|---|---|---|---|---|
| Unsloth | Affinement GPU unique le plus rapide | NVIDIA, certains AMD | Entièrement gratuit | Gratuit | GGUF, HF, ONNX |
| Axolotl | Formation sérieuse basée sur la configuration | NVIDIA, AMD | Entièrement gratuit | Gratuit | HF, GGUF (via assistant) |
| LLaMA-Factory | Interface Web pour les non-programmeurs | NVIDIA, AMD, Ascend | Entièrement gratuit | Gratuit | HF, GGUF, AWQ |
| Torchtune | PyTorch natif, dépendances minimales | NVIDIA, AMD, Apple | Entièrement gratuit | Gratuit | HF, GGUF |
| HuggingFace TRL | Réglage des préférences + renforcement | NVIDIA | Entièrement gratuit | Gratuit | HF |
| MLX-LM | Affinement Apple Silicon | Apple M-series | Entièrement gratuit | Gratuit | MLX, GGUF |
| Ludwig | Entraînement déclaratif de style AutoML | NVIDIA, CPU | Entièrement gratuit | Gratuit | HF, ONNX |
1. Unsloth, meilleur pour l’affinement GPU unique le plus rapide
Unsloth a réécrit les kernels d’attention en Triton et a extrait des accélérations 2x plus 40 % de réduction de la mémoire à partir des exécutions LoRA et QLoRA. Sur nos 4090, un affinement Llama 3.3 8B qui a pris 12 heures sur Transformers vanilla s’est terminé en environ 5 heures sur Unsloth. La bibliothèque s’intègre à Hugging Face TRL et Axolotl, vous pouvez donc l’adopter sans réécrire votre boucle d’entraînement.
Où elle échoue : la cible principale est les GPU NVIDIA. Le support AMD a atterri mais est en retard sur la couverture des noyaux ; Apple Silicon n’est pas à la feuille de route.
Tarification :
- Gratuit : la bibliothèque et chaque noyau
Plateformes : Linux (préféré), Windows via WSL2
Télécharger : Unsloth
Conclusion : le choix par défaut pour quiconque dispose d’un GPU NVIDIA moderne.
2. Axolotl, meilleur pour la formation sérieuse basée sur la configuration
Axolotl est ce que les véritables magasins de modèles utilisent pour former des versions de poids ouvert sérieuses. Le flux de travail basé sur un fichier de configuration vous oblige à réfléchir à votre exécution avant qu’elle ne commence, c’est pourquoi il produit des artefacts reproductibles. Le support des ensembles de données est le meilleur de sa catégorie : ShareGPT, Alpaca et JSONL personnalisé fonctionnent tous sans scripts de prétraitement.
Où elle échoue : la courbe d’apprentissage est réelle. Attendez-vous à lire attentivement la référence de configuration avant votre première exécution réussie.
Tarification :
- Gratuit
Plateformes : Linux (Docker recommandé)
Télécharger : Axolotl
Conclusion : le choix quand la sortie va en production, pas seulement une expérience.
3. LLaMA-Factory, meilleur pour une interface Web que vous pouvez remettre à un collègue
LLaMA-Factory est livré avec un tableau de bord Web complet, aucun code requis. Vous choisissez un modèle de base, chargez un ensemble de données à partir du disque ou du Hugging Face Hub, choisissez une méthode (SFT, DPO, PPO, KTO) et cliquez sur Démarrer l’entraînement. Pour les équipes où une personne est à l’aise avec les scripts et une autre ne l’est pas, c’est l’outil qui les unit.
Où elle échoue : l’abstraction cache certains contrôles. Les utilisateurs avancés finiront par descendre à un fichier de configuration.
Tarification :
- Gratuit
Plateformes : Linux (natif), Windows via WSL2, macOS avec backend MLX
Télécharger : LLaMA-Factory
Conclusion : le choix quand l’opérateur d’entraînement n’est pas un développeur Python.
4. Torchtune, meilleur pour PyTorch natif setup minimal
Torchtune est la bibliothèque d’affinement officielle de Meta. PyTorch pur, peu de dépendances externes et des fichiers de recette clairs qui se lisent comme des tutoriels. La version 2026 a ajouté un support natif pour FSDP2 et la famille Llama 4, elle se déplace donc en synchronisation avec les nouveaux modèles de base.
Où elle échoue : les formats d’ensemble de données sont stricts. Si vos données ne sont pas dans la forme attendue des recettes, vous écrivez une passe de prétraitement.
Tarification :
- Gratuit
Plateformes : Linux (NVIDIA et AMD), macOS (Apple Silicon)
Télécharger : Torchtune
Conclusion : le choix quand vous voulez PyTorch de première partie, magie minimale.
5. Hugging Face TRL, meilleur pour le réglage des préférences et RL
Hugging Face TRL est l’implémentation de référence pour DPO, PPO, GRPO, ORPO et tous les autres méthodes d’optimisation des préférences qui ont atterri depuis ChatGPT. Lorsque votre objectif n’est pas “enseigner au modèle ce domaine” mais “enseigner au modèle à préférer ces réponses”, TRL est la boîte à outils.
Où elle échoue : le support SFT existe mais n’est pas l’étoile. Pour l’affinement supervisé simple, Unsloth ou Axolotl est plus rapide.
Tarification :
- Gratuit
Plateformes : Linux (NVIDIA principal), Windows via WSL2
Télécharger : TRL
Conclusion : le choix quand l’objectif d’entraînement est l’alignement, pas l’injection de connaissances.
6. MLX-LM, meilleur pour l’affinement Apple Silicon
MLX-LM est le framework officiel d’Apple pour l’entraînement et l’inférence LLM sur les puces de la série M. Sur un Mac Studio M3 Ultra de 128 Go, nous avons réussi à affiner un modèle Qwen 2.5 32B pendant la nuit sans matériel NVIDIA. La mémoire unifiée est un vrai avantage : vous pouvez conserver des modèles qui causeraient un OOM sur une carte NVIDIA grand public de 24 Go.
Où elle échoue : le support de l’écosystème en dehors d’Apple est minimal. Tout ce que vous affinez doit être réexporté pour s’exécuter sur du matériel non-Apple.
Tarification :
- Gratuit
Plateformes : macOS sur Apple Silicon (M1 et ultérieur)
Télécharger : MLX-LM
Conclusion : le choix pour le propriétaire du Mac Studio qui veut affiner sans acheter un équipement séparé.
7. Ludwig, meilleur pour les exécutions déclaratives de style AutoML
Ludwig prend une déclaration YAML de vos entrées, sorties et métrique cible et figure la boucle d’entraînement. Ce n’est pas l’option la plus rapide, mais pour un premier affinement où vous ne savez pas encore quels hyperparamètres comptent, l’approche déclarative de Ludwig raccourcit la boucle.
Où elle échoue : elle cache la boucle d’entraînement. Lorsque vous voulez finalement régler la boucle elle-même, vous sortez de Ludwig rapidement.
Tarification :
- Gratuit
Plateformes : Linux (NVIDIA et CPU), macOS
Télécharger : Ludwig
Conclusion : le choix pour un premier affinement, ou pour un data scientist qui préfère le déclaratif à l’impératif.
Comment choisir le bon
Si vous avez un GPU NVIDIA moderne et voulez la vitesse, commencez par Unsloth. Si votre modèle va en production, passez à Axolotl. Si l’opérateur n’est pas un programmeur, installez LLaMA-Factory. Choisissez Torchtune quand vous voulez PyTorch de première partie sans magie. Cherchez HuggingFace TRL quand l’objectif est DPO ou PPO, pas SFT. Utilisez MLX-LM sur n’importe quel Mac Apple Silicon. Essayez Ludwig pour un premier affinement où vous apprenez encore les contrôles.
FAQ
Ai-je besoin de plusieurs GPU pour affiner un LLM ouvert moderne? Non. QLoRA sur un modèle 7B ou 8B s’adapte à un GPU grand public 12 Go. Un modèle 13B a besoin de 24 Go. Les modèles 70B ont toujours besoin d’une multi-GPU ou d’une carte de classe centre de données.
Quelle est la différence entre l’affinement et la distillation? La distillation entraîne un petit modèle à imiter les sorties d’un grand modèle. L’affinement enseigne à un modèle existant (de n’importe quelle taille) à se spécialiser sur vos données. L’affinement d’un modèle de base distillé est le point idéal actuel pour l’auto-hébergement avec du matériel bas.
Quelle application a la rampe la plus courte? LLaMA-Factory pour la voie UI-first, Unsloth pour la voie script-first. Ludwig est le plus proche du “configuration uniquement” déclaratif des sept.
Puis-je affiner sur CPU? Techniquement oui avec Ludwig ou Torchtune, mais seulement pour les minuscules modèles (moins de 1B de paramètres). Pour tout ce qui est utile, une GPU ou Apple Silicon est requise.
Où le modèle affiné devrait-il s’exécuter après? Exportez vers GGUF et chargez dans Ollama, LM Studio ou Jan pour l’inférence locale. Exportez vers Hugging Face pour le service cloud. Les exportations MLX-LM s’exécutent nativement sur n’importe quel Mac Apple Silicon.