Former un modèle local sur ses propres défaillances n’est pas exactement un préentraînement, mais si c’est bien fait, cela enseigne à un petit modèle à cesser de répéter l’erreur qui vous a ennuyé hier. C’est la promesse derrière la boucle « d’auto-amélioration » sur laquelle la communauté LLM locale itère depuis toute l’année : enregistrez les mauvaises réponses du modèle, organisez-les en un petit ensemble de données de rétroaction, exécutez un fine-tuning LoRA léger et regardez le taux d’erreur baisser. Ce sont les meilleures applications pour l’auto-amélioration des LLM locaux à partir des défaillances sur le bureau, que vous exécutiez un modèle 7B sur un ordinateur portable ou un 70B sur une station de travail.
Ce qu’il faut rechercher dans une pile d’auto-amélioration
- Capture de rétroaction intégrée. Un outil qui enregistre l’invite, la réponse et un signal pouce vers le haut/bas (ou mieux, une réponse corrigée) est où la boucle commence.
- Curation d’ensemble de données. Le journal des défaillances doit devenir un ensemble de données d’ajustement d’instructions propre avant d’être utile.
- Fine-tuning efficace. LoRA et QLoRA réduisent un fine-tuning de 24 Go à quelque chose qu’un GPU de consommateur unique peut exécuter pendant la nuit.
- Inférence locale pour l’évaluation. Le même outil qui sert le modèle à votre agent devrait servir la version affinée pour que vous puissiez comparer les deux.
- Optimisation programmative des invites. Pour de nombreux modes de défaillance, la solution n’est pas le fine-tuning mais une meilleure invite. Les cadres d’optimisation le rendent mécanique.
Comparaison rapide
| Application | Meilleure pour | Plateformes | Plan gratuit | Tarif initial/mois | Note |
|---|---|---|---|---|---|
| LangChain | Chaîner la capture de rétroaction dans un flux de travail de fine-tuning | Windows, macOS, Linux | Complet | Gratuit (open source) | 4.5 |
| LM Studio | Inférence quotidienne plus exportation d’ensemble de données | Windows, macOS, Linux | Complet | Gratuit | 4.6 |
| Ollama | Servir les modèles affinés à n’importe quel client | Windows, macOS, Linux | Complet | Gratuit (open source) | 4.7 |
| Axolotl | Exécutions LoRA reproductibles pilotées par YAML | Linux (Windows via WSL, macOS via conteneur) | Complet | Gratuit (open source) | 4.6 |
| Unsloth | 2-5x plus rapide LoRA sur un GPU unique | Windows, Linux | Complet | Niveau gratuit, Pro disponible | 4.8 |
| Text Generation WebUI | Interface locale pour l’inférence, l’évaluation et l’étiquetage manuel | Windows, macOS, Linux | Complet | Gratuit (open source) | 4.4 |
| DSPy | Optimisation des invites et des pipelines à partir des défaillances étiquetées | Windows, macOS, Linux | Complet | Gratuit (open source) | 4.7 |
Les applications
1. LangChain – meilleure pour chaîner la boucle de rétroaction
LangChain n’est pas un fine-tuner. Ce qu’il fait bien, c’est vous donner les éléments de base pour capturer chaque paire invite-réponse d’un agent, étiqueter les défaillances et les acheminer vers un ensemble de données d’entraînement. Les couches Callbacks et Tracing sont exactement ce qu’une boucle d’auto-amélioration nécessite : un enregistrement durable de ce que le modèle a dit, ce que l’utilisateur a fait avec la réponse et comment elle a été corrigée.
Où ça s’effondre : La surface de l’API est large et change souvent. Les exemples de code plus anciens sur Internet sont souvent incorrects.
Tarification :
- Gratuit : Le framework.
- Payant : LangSmith est un traceur géré payant si vous voulez un tableau de bord hébergé.
Plateformes : Windows, macOS, Linux.
Télécharger : langchain.com — Source (GitHub)
Conclusion : Commencez ici pour la plomberie entre le modèle, l’application et les données d’entraînement.
2. LM Studio – meilleure pour l’inférence quotidienne et l’exportation d’ensemble de données
LM Studio est l’interface d’inférence locale la plus facile sur le bureau. Pointez-la vers un modèle Hugging Face, obtenez une fenêtre de chat et un serveur local compatible avec OpenAI, et commencez à collecter les sessions. Les versions récentes ont ajouté une fonctionnalité d’export de session qui vide les conversations en JSONL, ce qui est la matière première pour un ensemble de données de rétroaction.
Où ça s’effondre : Aucun fine-tuning intégré. LM Studio est d’abord l’inférence; l’entraînement se fait ailleurs.
Tarification :
- Gratuit : Tout.
- Payant : Aucun.
Plateformes : Windows, macOS, Linux.
Télécharger : lmstudio.ai
Conclusion : Le défaut pour capturer et inspecter la sortie du modèle en route vers une exécution de fine-tuning.
3. Ollama – meilleure pour servir le modèle affiné ensuite
Ollama est le serveur de modèles ennuyeux et fiable. Une fois que vous avez affiné un LoRA, enveloppez-le en tant que fichier de modèle Ollama et chaque client parlant à un point de terminaison OpenAI local obtient votre version améliorée instantanément. Les versions récentes ont ajouté le chargement LoRA de première classe, vous pouvez donc échanger les adaptateurs sans retélécharger les poids de base.
Où ça s’effondre : Pas d’interface utilisateur. C’est un démon qui s’attend à ce que d’autres outils soient au-dessus.
Tarification :
- Gratuit : Tout.
- Payant : Aucun.
Plateformes : Windows, macOS, Linux.
Télécharger : ollama.com — Source (GitHub)
Conclusion : Le bon choix pour héberger le modèle affiné sur votre machine.
4. Axolotl – meilleure pour les exécutions LoRA reproductibles
Axolotl est un wrapper piloté par YAML autour de la pile d’entraînement Hugging Face. Pointez vers un ensemble de données, choisissez un modèle de base, définissez votre rang LoRA et taux d’apprentissage, et c’est parti. Chaque exécution est reproductible à partir du fichier de configuration, ce qui importe quand tout le but de l’auto-amélioration est de mesurer l’amélioration dans les itérations.
Où ça s’effondre : Natif de Linux. S’exécute sur Windows via WSL et sur macOS via conteneur mais avec des bords rugueux.
Tarification :
- Gratuit : Tout.
- Payant : Aucun.
Plateformes : Principalement Linux; WSL pour Windows.
Télécharger : github.com/axolotl-ai-cloud/axolotl
Conclusion : Le bon choix si vous voulez que les expériences soient reproductibles un mois plus tard.
5. Unsloth – meilleure pour LoRA rapide sur GPU unique
Unsloth est une bibliothèque de fine-tuning qui extrait 2-5x de vitesse sur un GPU de consommateur unique par rapport à l’entraîneur Hugging Face stock. L’utilisation de VRAM est à peu près divisée par deux. Sur un 4090, cela signifie une exécution 7B LoRA en une heure au lieu de quatre ; sur un 3060, cela signifie que l’exécution se termine du tout.
Où ça s’effondre : Certaines architectures sont derrière la version du transformateur de base. Le support des modèles les plus récents arrive dans une ou deux versions plus tard.
Tarification :
- Gratuit : Tout sur un GPU unique.
- Payant : Unsloth Pro pour multi-GPU et support entreprise.
Plateformes : Windows, Linux.
Télécharger : unsloth.ai — Source (GitHub)
Conclusion : Le bon choix quand un GPU de bureau unique est tout ce que vous avez.
6. Text Generation WebUI – meilleure pour l’étiquetage manuel et l’évaluation
Text Generation WebUI (Oobabooga) est l’interface de référence pour l’inférence locale, et elle fonctionne également comme un environnement d’étiquetage et d’évaluation. Chargez les modèles de base et affiné côte à côte, exécutez la même invite contre les deux et marquez laquelle la meilleure réponse. Chaque note va dans le même journal de conversation pour le prochain tour.
Où ça s’effondre : L’interface par défaut est obsolète. La configuration peut être délicate sur Windows sans WSL.
Tarification :
- Gratuit : Tout.
- Payant : Aucun.
Plateformes : Windows, macOS, Linux.
Télécharger : github.com/oobabooga/text-generation-webui
Conclusion : Le harnais d’évaluation pour les personnes qui aiment une interface.
7. DSPy – meilleure quand la défaillance est l’invite, pas les poids
DSPy traite les invites comme des paramètres. Donnez-lui un petit ensemble de données étiquetées de défaillances, définissez une métrique et il optimise l’invite (et les quelques exemples) pour s’adapter. Pour de nombreux modes de défaillance, c’est plus rapide et moins cher que le fine-tuning. L’invite optimisée peut alors revenir à votre agent de production.
Où ça s’effondre : Courbe d’apprentissage. Les abstractions (Signatures, Modules, Optimiseurs) sont puissantes mais non évidentes à la première lecture.
Tarification :
- Gratuit : Tout.
- Payant : Aucun.
Plateformes : Windows, macOS, Linux.
Télécharger : dspy.ai — Source (GitHub)
Conclusion : Essayez DSPy avant le fine-tuning. Les invites bon marché réparent les défaillances bon marché.
Comment choisir le bon
Si vous faites vos premiers pas et que vous voulez une pile unique, LM Studio pour l’inférence plus LangChain pour la capture plus Unsloth pour l’exécution du fine-tuning LoRA est le chemin le moins cher vers une boucle fonctionnelle.
Si vos défaillances sont principalement des lacunes de raisonnement (le modèle a divagué, a manqué une étape), commencez par DSPy. L’optimisation des invites ferme souvent l’écart pour des centimes plutôt que des heures GPU.
Si vos défaillances sont spécifiques au domaine (le modèle ne connaît pas votre base de code ou votre produit), c’est du fine-tuning. Utilisez Axolotl ou Unsloth au-dessus du duo LM Studio et Ollama.
Si vous êtes sur une station de travail avec deux GPU ou plus, Axolotl s’étend au-delà du niveau gratuit d’Unsloth.
Utilisez Text Generation WebUI comme votre interface d’évaluation indépendamment de ce que vous entraînez. Les tests A/B manuels sont le moyen le plus rapide de savoir qu’un fine-tuning a réellement amélioré les choses.
FAQ
Puis-je améliorer automatiquement un LLM local sans entraîner sur mes propres données? Seulement jusqu’à un certain point. L’optimisation des invites avec DSPy vous amène plus loin que la plupart des gens ne s’y attendraient, mais les défaillances spécifiques au domaine ont besoin de données spécifiques au domaine.
De combien de données ai-je besoin pour un fine-tuning LoRA utile? Pour une correction ciblée, quelques centaines d’exemples de défaillance étiquetés suffisent. L’ajustement des instructions d’un modèle général nécessite des dizaines de milliers.
Quel est le plus rapide sur un 3060 ou 4060: Unsloth ou Axolotl? Unsloth, par une large marge sur un GPU unique. Axolotl est mieux une fois que vous avez plusieurs GPU ou que vous voulez des configs YAML reproductibles.
Je perds les capacités du modèle de base quand je fine-tune LoRA? Pas généralement. LoRA gèle les poids de base et ajoute un petit adaptateur. Vous pouvez décharger l’adaptateur et retrouver le modèle de base.
Puis-je exécuter tout cela sur un Mac Apple Silicon? Inférence (LM Studio, Ollama, Text Generation WebUI) oui. L’entraînement s’exécute plus lentement sur Metal que sur CUDA ; certaines architectures nécessitent toujours une boîte GPU Linux pour des temps d’entraînement pratiques.