Famille de modèles à poids ouvert Google Gemma

La famille Gemma de Google est un bon compromis pour les ordinateurs portables. Un checkpoint 4B tient confortablement dans 8 Go de VRAM, la licence est suffisamment permissive pour les outils internes, et Ollama télécharge les poids en une commande. Ce n’est pas non plus le seul petit modèle à poids ouvert qui fonctionne bien sur un bureau modeste. Depuis l’arrivée de Gemma 3, nous avons testé six autres familles sur le même ordinateur portable 16 Go et un ordinateur de bureau 24 Go, et plusieurs d’entre elles surpassent Gemma sur les tâches qui comptent pour nous. Voici les alternatives à Gemma que nous avons laissées installées.

Comparaison rapide

Famille de modèles Meilleur pour Plan gratuit Licence Caractéristique remarquable
Llama 3 (Meta) Chat général, utilisation d’outils Oui, poids sur Hugging Face Licence communautaire Meta Support d’outils et quantification les plus larges
Qwen 3 (Alibaba) Raisonnement multilingue Oui Apache 2.0 Mode de pensée intégré que vous pouvez activer
Phi-4 (Microsoft) Ordinateurs portables 8 Go Oui MIT Meilleur raisonnement de petit modèle par gigaoctet
Mistral 7B / Nemo Code et chat rapide Oui Apache 2.0 Appels de fonction inclus prêts à l’emploi
DeepSeek V3 / R1 distills Mathématiques, code, chaînes de pensée Oui MIT (distills) Balises <think> explicites
IBM Granite 3.3 Brouillons sûrs pour l’entreprise Oui Apache 2.0 Fort sur l’extraction structurée
SmolLM 3 Raspberry Pi et anciens ordinateurs portables Oui Apache 2.0 Modèle 3B qui fonctionne sous 4 Go de RAM

Pourquoi les gens cherchent des alternatives à Gemma

Gemma 3 est capable, mais quelques lacunes réelles nous poussent vers d’autres familles de modèles :

Les alternatives

Llama 3 (Meta) - Meilleur pour l’écosystème le plus large

Llama 3 est le modèle local par défaut pour la plupart des gens qui hébergent leur propre IA, et la raison est ennuyeuse : chaque exécuteur le supporte, chaque format de quantification le cible en premier, et chaque communauté fine-tune écrit pour lui. Le modèle 8B fonctionne sur le même ordinateur portable 16 Go où Gemma 4B tient, avec un peu plus d’espace RAM, et le modèle 70B s’adapte jusqu’aux GPU de poste de travail.

Où il est défaillant : la licence communautaire Meta a des restrictions d’utilisation qu’Apache 2.0 n’a pas. La qualité multilingue est en retard sur Qwen 3.

Tarification :

Migration depuis Gemma : ollama pull llama3.1:8b et échangez le nom du modèle dans votre configuration Open WebUI ou LM Studio. Les invites se portent bien. Les modèles de chat diffèrent, alors réexécutez les invites système une fois.

Téléchargement : ollama.com/library/llama3.1

Résumé : choisissez Llama 3 lorsque la largeur des outils est plus importante que les benchmarks bruts. Ignorez-le si vous avez besoin d’Apache 2.0.

Qwen 3 (Alibaba) - Meilleur comme standard polyvalent

Qwen 3 est devenu la recommandation à usage général la plus sûre pour l’utilisation locale. La famille couvre les checkpoints denses de 0,6 B à 32 B, plus une variante MoE de 30 B et 235 B, vous pouvez donc choisir par VRAM et basculer entre les checkpoints sans modifier votre style d’invite. La qualité du raisonnement en mathématiques et en code dépasse Gemma avec le même nombre de paramètres, et il existe un mode de pensée approprié que vous pouvez activer au moment de l’inférence.

Où il est défaillant : les clauses de licence d’Alibaba autour des seuils de nombre d’utilisateurs perturbent certaines entreprises. Les variantes MoE ont besoin d’un exécuteur qui prend en charge le mixture-of-experts, ce que toutes les applications de bureau ne gèrent pas gracieusement.

Tarification :

Migration depuis Gemma : flux Ollama identique. Si vous utilisez les heuristiques d’invite système intégrées de Gemma, Qwen accepte les mêmes instructions. Activez le mode de pensée avec /set think dans le CLI.

Téléchargement : ollama.com/library/qwen3

Résumé : le modèle que nous suggérons à quiconque demande « que dois-je exécuter localement » sans plus de contexte.

Phi-4 (Microsoft) - Meilleur pour le matériel faible

Phi-4 et son frère Phi-4-mini ciblent les petites machines. Le modèle 14B surclasse son poids sur les benchmarks de raisonnement, et Phi-4-mini à 3,8 B s’exécute sur 8 Go de RAM sans GPU. Microsoft licencie tout sous MIT, donc il s’adapte aux projets commerciaux sans paperasse.

Où il est défaillant : la conversation générale semble plus sèche que Llama ou Qwen, et l’écriture créative est faible. Pas le modèle à utiliser pour les copies marketing ou la narration.

Tarification :

Migration depuis Gemma : remplacement direct. La fenêtre de contexte de Phi-4-mini est plus petite (128k sur le modèle complet, 32k sur mini), alors auditez d’abord les invites de documents longs.

Téléchargement : ollama.com/library/phi4

Résumé : choisissez Phi-4-mini pour les anciens ordinateurs portables et Phi-4 lorsque la qualité du raisonnement est plus importante que la personnalité.

Mistral 7B et Mistral Nemo - Meilleur pour le code et les appels de fonction

Mistral 7B reste pointu, et le modèle Nemo 12B plus récent que Mistral a construit avec NVIDIA est la famille vers laquelle nous nous tournons lorsque nous voulons une complétion de code rapide et des appels de fonction fiables. L’utilisation d’outils de Nemo a fonctionné au premier essai dans chaque exécuteur de bureau que nous avons testé. Apache 2.0, pas de conditions.

Où il est défaillant : les modèles de base sont moins bavards que Llama 3, et les résultats peuvent sembler laconiques. Les nouveaux modèles Mistral plus grands sont verrouillés derrière leur API commerciale.

Tarification :

Migration depuis Gemma : tirage Ollama, ajustez le modèle de chat au format [INST] de Mistral. Si vous utilisez Gemma pour les agents d’appel d’outils, Nemo se sentira comme une amélioration la première fois que vous l’exécuterez.

Téléchargement : mistral.ai

Résumé : l’alternative quand le support des outils de Gemma vous a déçu.

DeepSeek V3 et R1 distills - Meilleur pour le raisonnement

DeepSeek expédie deux familles à connaître : V3, un modèle MoE général solide, et les R1 distills qui fine-tune les bases Llama et Qwen en machines de pensée. Les R1 distills exposent leur chaîne de pensée dans des balises <think>, ce que l’écrivain de XDA voulait dire par « un LLM local qui pense réellement avant de répondre ». Sur les problèmes de mots mathématiques et les changements de code multi-étapes, les R1 distills battent souvent Gemma 3 27B tout en fonctionnant dans moins de VRAM.

Où il est défaillant : le mode de pensée consomme des tokens, ce qui ralentit la latence du premier token et consomme le contexte. Le modèle MoE V3 est lourd pour la plupart des bureaux.

Tarification :

Migration depuis Gemma : tirez deepseek-r1:14b et invitez exactement comme vous le feriez pour Gemma. Filtrez les balises <think> de votre interface utilisateur si les utilisateurs finaux ne doivent pas les voir.

Téléchargement : ollama.com/library/deepseek-r1

Résumé : le choix orienté vers le raisonnement.

IBM Granite 3.3 - Meilleur pour l’extraction structurée

IBM Granite est silencieux, inglorieux, et très bon sur le travail d’entreprise pour lequel la plupart des LLM locaux sont réellement utilisés : extraire les champs des documents, rédiger des e-mails, classer les tickets. Licence Apache 2.0, outils Watsonx du côté entreprise, et le modèle 8B fonctionne aux côtés de Gemma sur le même matériel.

Où il est défaillant : le ton conversationnel est rigide. Les tâches créatives ressemblent à un mémo juridique.

Tarification :

Migration depuis Gemma : remplacement direct. Si vous utilisez Gemma avec un wrapper d’invite en mode JSON, Granite le respecte plus fiablement.

Téléchargement : ollama.com/library/granite3.3

Résumé : la réponse ennuyeuse correcte pour les pipelines d’extraction et de classification.

SmolLM 3 - Meilleur pour les anciens ordinateurs portables et ordinateurs mono-plaquette

SmolLM 3 de Hugging Face est un modèle 3B conçu pour fonctionner sur du matériel minuscule. Il tient sous 4 Go de RAM, démarre sur un Raspberry Pi 5 et entretient une conversation cohérente. Il ne surclassera pas Gemma 4B en raisonnement, mais il continuera à fonctionner sur une machine où Gemma basculerait sur le disque.

Où il est défaillant : la date limite des connaissances est plus ancienne, et le rappel de contexte long est plus faible.

Tarification :

Migration depuis Gemma : tirez via Ollama ou exécutez via llama.cpp directement. Attendez-vous à refondre toute invite qui suppose la date limite des connaissances spécifique de Gemma.

Téléchargement : huggingface.co/HuggingFaceTB/SmolLM3-3B

Résumé : la solution de secours quand la machine ne peut pas gérer quelque chose de plus grand.

Comment choisir

Choisissez d’abord par mémoire, deuxièmement par tâche.

FAQ

Qu’est-ce qu’une bonne alternative à Gemma pour un ordinateur portable 16 Go ? Qwen 3 8B ou Phi-4-mini conviennent tous les deux et dépassent tous les deux Gemma 3 4B en raisonnement général. Qwen 3 gagne sur le travail multilingue, Phi gagne sur les mathématiques.

DeepSeek R1 est-il meilleur que Gemma pour le codage ? Pour les tâches de débogage multi-étapes et de refactorisation, le distill R1 à 14B bat généralement Gemma 3 27B, principalement parce que la chaîne de pensée l’aide à attraper les cas limites manqués.

Puis-je exécuter Llama 3 aux côtés de Gemma dans Ollama ? Oui. Ollama bascule les modèles à la demande. Tirez les deux, basculez par nom à la CLI ou dans Open WebUI.

Quel LLM local léger a la licence la plus permissive ? Qwen 3, Mistral 7B, IBM Granite et SmolLM 3 sont tous livrés sous Apache 2.0. Phi-4 et distills DeepSeek R1 sont MIT.

Y a-t-il une alternative à Gemma avec un mode de pensée intégré ? Qwen 3 a un basculement de pensée explicite, et les distills DeepSeek R1 enveloppent le raisonnement dans des balises <think>. Gemma 3 n’expose ni l’un ni l’autre.