LM Studio et Ollama ont rendu l’exécution des LLM locaux aussi simple qu’un clic. Le fine-tuning est resté un travail de centre de données pendant des années, hors de portée sur le même matériel. Cela change enfin. La nouvelle application de bureau d’Unsloth est le signe visible, mais un petit groupe de frameworks ouverts forme maintenant un vrai adaptateur LoRA sur une seule GPU grand public de 12 Go ou 24 Go en l’espace d’un après-midi.
Nous avons testé sept outils sur une RTX 4070, une RTX 4090 et un Mac M2 Pro de base. Les choix ci-dessous sont ceux qui ont complété une exécution LoRA Llama 3.1 8B ou Mistral 7B sans manquer de mémoire, sans avoir besoin d’un cluster, et sans vous demander d’écrire d’abord une boucle d’entraînement en PyTorch. La liste mélange les outils privilégiant l’interface graphique avec les frameworks privilégiant la CLI pour que vous puissiez choisir le niveau ergonomique que vous souhaitez.
Ce qu’il faut rechercher dans un fine-tuner GPU grand public
- Support LoRA et QLoRA, pour qu’un modèle 7B s’entraîne sur 12 Go et un 13B sur 24 Go.
- Chargement quantifié 4-bit et 8-bit, ce qui est la raison pour laquelle tout cela tient.
- Flash Attention ou un kernel équivalent pour que la vitesse d’entraînement ne s’effondre pas.
- Support pour les familles de modèles qui vous importent vraiment : Llama, Mistral, Qwen, Gemma, Phi.
- Formats d’ensemble de données faciles à préparer, idéalement JSONL avec champs instruction/output.
- Checkpointing pour qu’un crash à l’heure quatre ne vous coûte pas toute l’exécution.
Comparaison rapide
| Application | Meilleur pour | Plates-formes | Plan gratuit | Prix de départ/mois | Licence |
|---|---|---|---|---|---|
| Unsloth | LoRA plus rapide sur 12–24 Go | Windows, Linux | Application complète | Gratuit (Pro tier) | Apache 2.0 |
| Axolotl | Utilisateur avancé de fichiers de configuration | Linux | Application complète | Gratuit | Apache 2.0 |
| LLaMA-Factory | Basé sur GUI, support large de modèles | Windows, Linux | Application complète | Gratuit | Apache 2.0 |
| Text Generation WebUI | Joindre LoRA et tester sur place | Windows, macOS, Linux | Application complète | Gratuit | AGPLv3 |
| PEFT | Bibliothèque pour votre propre boucle d’entraînement | Windows, macOS, Linux | Application complète | Gratuit | Apache 2.0 |
| H2O LLM Studio | Interface utilisateur d’entreprise avec suivi d’expériences | Windows, Linux | Gratuit (code ouvert) | Support Enterprise | Apache 2.0 |
| MLX-LM | Fine-tuning natif sur Apple Silicon | macOS | Application complète | Gratuit | MIT |
Les applications
1. Unsloth, meilleur LoRA plus rapide sur 12–24 Go
Unsloth réécrit les chemins critiques du fine-tuning de Llama, Mistral, Qwen, Gemma et Phi pour être environ deux à cinq fois plus rapide et environ la moitié de la mémoire de Transformers standard. Un LoRA 7B tient sur une seule GPU de 12 Go et se termine sur un ensemble de données modeste en un après-midi. La nouvelle application de bureau supprime la dernière étape CLI pour les recettes courantes.
Où il manque : la couverture penche vers les familles de modèles les plus populaires ; les architectures obscures ont besoin du chemin Transformers amont.
Tarification :
- Gratuit : Framework complet et application de bureau.
- Payant : Pro tier pour le support d’entreprise et des kernels multi-GPU plus rapides.
Plates-formes : Windows (via WSL2), Linux.
Télécharger : unsloth.ai · GitHub
Conclusion : Le choix par défaut en 2026 pour l’entraînement LoRA sur une seule carte grand public.
2. Axolotl, meilleur utilisateur avancé de fichiers de configuration
Axolotl est un framework d’entraînement basé sur configuration construit autour de Hugging Face. Un seul fichier YAML décrit le modèle, l’ensemble de données, le rang LoRA et les arguments d’entraînement, et Axolotl s’occupe du reste. Il supporte moins d’optimisations de vitesse qu’Unsloth mais gagne en flexibilité sur les modèles et formats d’ensemble de données moins courants.
Où il manque : pas d’interface graphique ; la configuration a une courbe d’apprentissage ; la documentation suppose que vous avez déjà entraîné quelque chose.
Tarification :
- Gratuit : Application complète.
- Payant : Non applicable.
Plates-formes : Linux (Docker sur macOS/Windows).
Télécharger : GitHub (axolotl-ai-cloud/axolotl)
Conclusion : Le bon choix lorsqu’Unsloth n’a pas votre modèle et que vous voulez toujours un pipeline sensé.
3. LLaMA-Factory, meilleur entraîneur basé sur GUI
LLaMA-Factory est livré avec une interface graphique basée sur Gradio au-dessus d’une large boîte à outils d’entraînement. Choisissez un modèle, chargez un ensemble de données, définissez le rang LoRA et le taux d’apprentissage, et démarrez. Il couvre 100+ familles de modèles prêts à l’emploi et ses graphiques rendent l’ajustement des hyperparamètres accessible.
Où il manque : l’interface graphique cache certains des choix plus difficiles ; dans les cas limites de VRAM, il a besoin de la CLI de toute façon.
Tarification :
- Gratuit : Application complète.
- Payant : Non applicable.
Plates-formes : Windows, Linux.
Télécharger : GitHub (hiyouga/LLaMA-Factory)
Conclusion : Le meilleur point d’entrée basé sur GUI pour quiconque débute en entraînement LoRA.
4. Text Generation WebUI, meilleur pour joindre et tester LoRA
Text Generation WebUI (“oobabooga”) est l’interface utilisateur de chat LLM local que la plupart des enthousiastes exécutent déjà. Son onglet Entraînement effectue l’entraînement LoRA sur place, et une fois qu’une exécution se termine, vous pouvez activer l’adaptateur et discuter avec le modèle pour vérifier immédiatement le résultat.
Où il manque : ce n’est pas l’entraîneur le plus rapide de cette liste ; l’onglet d’entraînement est un bon outil « connecter les points », pas un pipeline de production.
Tarification :
- Gratuit : Application complète.
- Payant : Non applicable.
Plates-formes : Windows, macOS, Linux.
Télécharger : GitHub (oobabooga/text-generation-webui)
Conclusion : L’outil avec le moins de friction pour voir si le fine-tuning de vos données change quelque chose qui vous importe.
5. PEFT, meilleure bibliothèque pour votre propre boucle d’entraînement
PEFT est la bibliothèque Parameter-Efficient Fine-Tuning de Hugging Face. C’est un ensemble de briques de construction Python, LoRA, IA3, ajustement de préfixe, que vous glissez dans un Trainer. Si vous voulez contrôler la boucle, c’est le niveau auquel vous travaillez.
Où il manque : pas d’interface utilisateur ; chaque expérience est un script ; vous êtes responsable de l’ergonomie.
Tarification :
- Gratuit : Application complète.
- Payant : Non applicable.
Plates-formes : Windows, macOS, Linux.
Télécharger : GitHub (huggingface/peft)
Conclusion : Le bon niveau d’abstraction pour un chercheur ou un passionné sérieux qui veut le contrôle total.
6. H2O LLM Studio, meilleur entraîneur de saveur d’entreprise
H2O LLM Studio enveloppe les mêmes frameworks ouverts dans une interface utilisateur React propre, ajoute le suivi d’expériences et s’intègre proprement avec les outils cloud de H2O lorsqu’une exécution dépasse une seule GPU. Sur un poste de travail avec un 4090, c’est confortable.
Où il manque : l’interface utilisateur est une installation plus lourde que n’importe quel autre choix ici ; les paramètres par défaut opinionés peuvent cacher les commandes sous-jacentes.
Tarification :
- Gratuit : Application complètement open source.
- Payant : Support Enterprise.
Plates-formes : Windows, Linux.
Télécharger : GitHub (h2oai/h2o-llmstudio)
Conclusion : Le choix lorsque les expériences vont à une équipe, pas à un seul ordinateur portable.
7. MLX-LM, meilleur fine-tuning natif sur Apple Silicon
MLX-LM est le framework LM natif Apple construit sur MLX. Sur un Mac Studio ou un Mac M2 Pro de base avec 32 Go de mémoire unifiée, le fine-tuning LoRA sur les modèles 7B et 13B est maintenant un chemin pris en charge, et le modèle de mémoire du framework utilise l’allocation GPU/CPU partagée pour adapter les modèles que CUDA ne pourrait jamais.
Où il manque : macOS seulement ; le catalogue de modèles est plus petit que celui de CUDA ; moins mature que les outils basés sur PyTorch.
Tarification :
- Gratuit : Application complète.
- Payant : Non applicable.
Plates-formes : macOS (Apple Silicon).
Télécharger : GitHub (ml-explore/mlx-lm)
Conclusion : Le bon choix sur un Mac moderne, le mauvais choix ailleurs.
Comment choisir le bon
Si vous avez une seule GPU grand public de 12 Go ou 24 Go et que vous voulez de la vitesse, installez Unsloth et exécutez l’un de ses notebooks. Rien d’autre dans cette liste n’arrive à un adaptateur fonctionnel plus rapidement.
Si votre modèle ou format d’ensemble de données se situe en dehors du chemin rapide d’Unsloth, choisissez Axolotl pour sa flexibilité basée sur configuration.
Si vous n’avez jamais entraîné quoi que ce soit auparavant, LLaMA-Factory ajoute une interface graphique sur les mêmes outils et raccourcit le débat « quel taux d’apprentissage ».
Si vous exécutez déjà Text Generation WebUI, utilisez son onglet Entraînement. N’ajoutez pas un autre outil pour une exécution unique.
Pour contrôler la boucle d’entraînement, PEFT est la bonne bibliothèque. Attendez-vous à écrire du Python.
Si les expériences doivent être examinées par d’autres personnes, H2O LLM Studio fournit cette interface utilisateur dans la version open source.
MLX-LM est le bon choix sur Apple Silicon et seulement là.
FAQ
Ai-je besoin d’une GPU de 24 Go pour fine-tuner un modèle 7B ?
Non. Unsloth et QLoRA rentrent un LoRA 7B en 8–12 Go. 24 Go vous donne 13B confortablement.
Puis-je faire du fine-tuning sur CPU ?
Techniquement oui, de la manière que vous pouvez techniquement traverser un océan en bateau à rames. Utilisez une GPU ou Apple Silicon.
Le fine-tuning améliorera-t-il mon modèle local pour mon travail ?
Pour suivre les instructions et le vocabulaire du domaine, oui. Pour des gains de raisonnement difficile, largement non ; le plafond du modèle de base est le plafond.
Quelle devrait être la taille de mon ensemble de données ?
Pour une LoRA ciblée sur les tâches, 500 à 5 000 exemples de haute qualité surpassent 100 000 exemples médiocres. Sélectionnez impitoyablement.
Puis-je partager l’adaptateur LoRA que j’ai entraîné ?
Oui ; les adaptateurs sont petits. Vérifiez d’abord la licence du modèle de base, la plupart des variantes Llama et Mistral sont permissives mais non identiques.