Unsloth effectuant un fine-tuning d'un modèle Llama local sur une GPU de bureau

Un article de XDA cette semaine décrivait l’entraînement d’un LLM local sur ses propres erreurs. L’auteur a rassemblé les mauvaises sorties du modèle, en a annoté manuellement quelques dizaines, les a empaquetées dans un petit ensemble de données et a exécuté un fine-tuning léger. Le résultat était un modèle notablement meilleur sur les problèmes exacts que la version de base n’avait pas eu raison. Ce qui autrefois exigeait un cluster loué s’exécute maintenant sur un portable avec une GPU de 12 Go. Voici les sept meilleures applications pour le fine-tuning de LLM locaux sur bureau en 2026, tous gratuits et open-source, classés par la vitesse réelle du premier fine-tuning.

Ce qu’il faut chercher dans une application de fine-tuning local

Comparaison rapide

Application Meilleur pour Backend LoRA/QLoRA Apple Silicon Facilité
Unsloth LoRA single-GPU plus rapide CUDA Oui Beta Plus facile
Axolotl Exécutions de production configurables CUDA (+ROCm) Oui Non Moyen
LLaMA-Factory Fine-tuning web-UI CUDA (+ROCm) Oui Beta Facile
MLX-LM Fine-tuning Apple Silicon MLX Oui Oui Facile
Torchtune Référence officielle PyTorch CUDA Oui Limité Moyen
Hugging Face TRL RLHF/DPO/PPO au-dessus de Transformers CUDA (+ROCm) Oui Non Moyen
LM Studio GUI tout-en-un pour l’inférence + workflows de fine-tuning léger CUDA/Metal Chargement d’adaptateur Oui Très facile

1. Unsloth, Meilleur pour LoRA single-GPU plus rapide

Unsloth est l’outil qui a transformé « affiner un modèle 7B sur votre portable » d’un article de recherche en notebook Colab et pip install. Sur une seule RTX 4070 avec 12 Go de VRAM, une exécution 7B QLoRA à contexte 2048 se termine en environ 30 minutes pour quelques centaines d’exemples. L’astuce mathématique est un passage avant-arrière économe en mémoire ; l’avantage pratique est un fine-tuning qui s’exécute pendant que vous faites du café.

Où ça pêche : Le fine-tuning multi-GPU est de deuxième classe par rapport à Axolotl ou Torchtune. Certaines architectures de niche arrivent plus tard que dans les piles de référence.

Prix : Gratuit.

Plateformes : Linux (meilleur), Windows (via WSL2), Apple Silicon (beta).

Télécharger : unsloth.ai / github.com/unslothai/unsloth

Conclusion : Le choix par défaut pour le premier fine-tuning de quiconque dispose d’une GPU grand public unique.

2. Axolotl, Meilleur pour les exécutions de production configurables

Axolotl est ce que les équipes utilisent quand le chemin heureux d’Unsloth ne suffit pas. L’approche basée sur un fichier de configuration rend les exécutions reproductibles : un seul fichier YAML décrit le modèle de base, l’ensemble de données, le rang LoRA, le taux d’apprentissage, la cadence d’évaluation et la cible d’exportation. Multi-GPU avec DeepSpeed et FSDP fonctionne. La communauté a publié des dizaines de configurations prédéfinies pour les tâches courantes.

Où ça pêche : La courbe d’apprentissage est plus raide qu’Unsloth. La première exécution signifie lire un fichier de configuration YAML et comprendre ce que fait chaque champ.

Prix : Gratuit.

Plateformes : Linux, Windows via WSL2.

Télécharger : github.com/axolotl-ai-cloud/axolotl

Conclusion : L’outil à utiliser une fois que le premier fine-tuning Unsloth a fonctionné et que vous voulez plus de contrôle.

3. LLaMA-Factory, Meilleur pour le workflow de fine-tuning avec web-UI

LLaMA-Factory enveloppe les mêmes mathématiques qu’Axolotl et Unsloth derrière une interface web. Chargez un modèle de base, choisissez un ensemble de données d’un dossier local, ajustez un curseur pour le rang LoRA et lancez l’exécution. Les courbes de perte s’affichent dans le navigateur. Pour quelqu’un qui ne veut pas toucher un terminal, c’est le truc le plus proche d’une application de fine-tuning de bureau conviviale.

Où ça pêche : La web-UI n’est pas un IDE complet. Les pipelines complexes à plusieurs étapes exigent toujours une vraie config. Tous les optimiseurs ne sont pas exposés dans l’interface.

Prix : Gratuit.

Plateformes : Linux, Windows via WSL2, macOS via Docker.

Télécharger : github.com/hiyouga/LLaMA-Factory

Conclusion : Le meilleur choix si un workflow basé sur un terminal vous décourage.

4. MLX-LM, Meilleur pour le fine-tuning Apple Silicon

MLX-LM est la pile de modèles de langage officielle d’Apple, construite sur le framework de tableaux MLX. Sur une M2 Max ou M3 Max avec 64 Go de mémoire unifiée, un fine-tuning 7B LoRA s’exécute à des vitesses compétitives avec une GPU NVIDIA de gamme intermédiaire. Sur une M2 Pro avec 16 Go, cela fonctionne pour les modèles plus petits. MLX-LM exporte directement au format MLX pour Ollama et les runtimes d’inférence propres d’Apple.

Où ça pêche : Pas tous les modèles de base sont disponibles au format MLX ; l’étape de conversion des poids Hugging Face ajoute des frottements. L’écosystème est plus petit que la pile CUDA.

Prix : Gratuit.

Plateformes : Uniquement macOS Apple Silicon.

Télécharger : github.com/ml-explore/mlx-lm

Conclusion : L’outil approprié sur un Mac. Rien d’autre n’utilise Apple Silicon aussi bien.

5. Torchtune, Meilleur pour la référence officielle PyTorch

Torchtune est la propre bibliothèque de fine-tuning de PyTorch, gérée par l’équipe de Meta. Les recettes sont du Python lisible, pas un DSL de configuration, ce qui convient aux ingénieurs qui veulent voir et modifier la boucle d’entraînement. Support du fine-tuning complet, LoRA et DPO. Multi-GPU fonctionne dès la sortie de la boîte. La documentation est de qualité ingénierie.

Où ça pêche : Moins « batteries incluses » qu’Unsloth ou Axolotl. La posture de mise en œuvre de référence signifie moins de raccourcis.

Prix : Gratuit.

Plateformes : Linux, Windows via WSL2, macOS avec fonctionnalités limitées.

Télécharger : github.com/pytorch/torchtune

Conclusion : Choisissez Torchtune si vous écrivez déjà PyTorch et voulez voir la boucle d’entraînement.

6. Hugging Face TRL, Meilleur pour RLHF, DPO et modélisation des récompenses

TRL (Transformer Reinforcement Learning) est le toolkit pour les étapes de fine-tuning au-delà du simple fine-tuning supervisé : DPO (optimisation directe des préférences), PPO (optimisation des politiques proximales), entraînement des modèles de récompense. Dans le workflow « train on failures » de XDA, DPO est la technique réelle qui a transformé les échecs annotés en un modèle meilleur. TRL est ce qui l’exécute.

Où ça pêche : Plus de mathématiques à comprendre. RLHF/DPO peut mal tourner de façons que SFT ne peut pas ; attendez-vous à quelques exécutions échouées avant que ça clique.

Prix : Gratuit.

Plateformes : Linux, Windows via WSL2.

Télécharger : github.com/huggingface/trl

Conclusion : L’outil pour la deuxième étape d’un vrai pipeline de fine-tuning « apprenez de vos erreurs ».

7. LM Studio, Meilleur pour une GUI tout-en-un de bureau

LM Studio n’est pas principalement une application de fine-tuning. C’est une GUI de bureau pour télécharger, exécuter et discuter avec des modèles locaux sur Windows, macOS et Linux. Son rôle dans cette liste est le polish qu’il fournit autour du workflow de fine-tuning : chargez un modèle de base, chargez un adaptateur LoRA produit par Unsloth ou Axolotl, discutez avec le modèle fine-tuned, itérez. Les versions 2026 ont ajouté des wrappers de commodité de fine-tuning léger qui appellent Unsloth sous le capot.

Où ça pêche : Le côté entraînement est mince. LM Studio est un chat et un frontend d’inférence ; utilisez-le pour la moitié inférence de la boucle, pas la moitié entraînement.

Prix : Gratuit.

Plateformes : Windows, macOS, Linux.

Télécharger : lmstudio.ai

Conclusion : Choisissez LM Studio comme le côté inférence de la boucle de fine-tuning, pas le côté entraînement.

Comment choisir le bon

Associez n’importe quel outil d’entraînement que vous choisissez avec LM Studio pour tester l’adaptateur résultant localement avant de l’envoyer à une pile d’inférence.

FAQ

Quelle est la GPU minimum pour affiner un modèle 7B ?

QLoRA à contexte 2048 tient dans 8 Go de VRAM pour les plus petites variantes 7B et 12 Go confortablement. 8 Go fonctionne pour les contextes plus courts et les rangs inférieurs ; 24 Go ouvre 13B QLoRA.

Pouvons-nous affiner sans GPU ?

Techniquement oui, sur CPU, mais c’est trop lent pour être pratique. La location cloud pour quelques heures coûte souvent moins cher que l’électricité pour exécuter un fine-tuning CPU jusqu’à terminer.

Quel format de données ces outils acceptent-ils ?

JSON Lines avec des champs instruction et output (style Alpaca) est la norme universelle. La plupart des outils acceptent également le format ShareGPT et le format de message de chat OpenAI.

Les modèles fine-tuned s’exécutent-ils dans Ollama, LM Studio ou llama.cpp ?

Oui, après exportation vers GGUF (pour llama.cpp et Ollama) ou MLX (pour la pile Apple). Chaque outil ci-dessus exporte vers au moins l’un de ces formats.

Le fine-tuning est-il légal pour les poids de modèle fermés ?

Uniquement pour les modèles dont la licence le permet. Llama 3 et 4, modèles Mistral, Qwen, Gemma et tous les modèles open-weight de cette liste permettent le fine-tuning sous leurs licences. Les modèles fermés (classe GPT-4) n’ont pas de poids téléchargeables, donc le fine-tuning local n’est pas possible.