Un téléphone Android moderne avec 8 Go de RAM peut contenir un modèle 3B en mémoire et répondre aux questions en quelques secondes, hors ligne. L’objectif n’est pas de remplacer GPT ou Claude pour les problèmes difficiles. L’objectif est un chat privé sans réseau qui survit à un vol, un franchissement frontalier ou une mauvaise Wi-Fi d’hôtel. Les meilleures applications pour exécuter des LLM sur appareil sur Android diffèrent de trois manières : les formats de modèle quantifiés qu’elles chargent, la quantité de RAM dont elles ont besoin pour rester stables et l’utilité de l’interface de chat sur un petit écran. Nous avons mis sept applications à l’épreuve pendant un mois d’utilisation quotidienne.
Quoi chercher dans une application LLM sur appareil
Six choses séparent une application de chat qui reste installée d’une qui est désinstallée en une semaine :
- Prise en charge du format de modèle. GGUF est le plus courant ; MLC et ONNX suivent. Le format que l’application prend en charge détermine les modèles disponibles.
- Options de quantification. Q4_K_M est le point optimal pour un modèle 3B sur 8 Go ; Q3 est plus petit mais nettement pire.
- Gestion de la fenêtre contextuelle. Si l’application conserve un historique continu ou réinitialise à chaque tour.
- Jetons par seconde sur du matériel modeste. Un téléphone Snapdragon 8 Gen 2 exécute un 3B Q4 à environ 15 à 25 tok/s.
- Comportement de la batterie. Les générations longues réchauffent le téléphone. Un drapeau d’arrière-plan ou un minuteur qui limite les sessions aide.
- Coût et statut du code fermé. Certaines options sont freemium avec des secours cloud qui doivent être désactivés.
Comparaison rapide
| Application | Meilleur pour | Formats de modèle | Niveau gratuit | Remarquable |
|---|---|---|---|---|
| PocketPal AI | Chat général sur appareil | GGUF | Gratuit, open-source | Meilleure UX de téléchargement pour les modèles GGUF |
| MLC Chat | Vitesse sur Snapdragon 8 | MLC | Gratuit, open-source | Tok/s le plus rapide de tous ici |
| Layla | Chat de personnage et jeu de rôle | GGUF | Niveau gratuit, abonnement | UI soigné, bibliothèque de personnages |
| MyDeviceAI | Assistant avec outils | GGUF, ONNX | Gratuit, open-source | Base de recherche Web, reste sur appareil |
| SmolChat | Petits téléphones (4 à 6 Go) | GGUF (small) | Gratuit, open-source | Exécute les modèles 1B et 1.5B proprement |
| Private AI Chat | Pas de compte, pas de télémétrie | GGUF | Gratuit | Livré avec une liste de modèles sélectionnée |
| Enchanted | Ollama sur le serveur domestique | Contrôle à distance vers Ollama | Gratuit, open-source | Meilleur quand le téléphone parle à un LLM domestique |
Les applications
1. PocketPal AI, meilleur chat général sur appareil
PocketPal AI télécharge les modèles GGUF de Hugging Face dans l’application et les gère dans une bibliothèque. Les présets pour Phi-3.5, Gemma 3, Llama 3.2 et Qwen 2.5 offrent des quantifications initiales sensées. L’interface de chat supporte les invites système, la température, top-p et la pénalité de répétition par modèle, ce qui est plus de contrôle que la plupart des applications ici.
Où il est limité : Les nouveaux utilisateurs ont besoin d’une idée approximative du modèle à choisir. Il n’y a pas de recommandation intégrée.
Prix : Gratuit, open-source (MIT).
Plates-formes : Android, iOS.
Télécharger : GitHub · Google Play
Résumé : Commencez ici. C’est l’option gratuite la plus complète et ne pousse pas un niveau payant.
2. MLC Chat, meilleure vitesse brute sur Snapdragon 8
MLC Chat compile les modèles au format MLC à l’avance et les exécute via TVM. Sur un téléphone Snapdragon 8 Gen 2, Gemma 2B de MLC fonctionne à environ deux fois le tok/s du même modèle en GGUF sur llama.cpp. Les options de modèle sont plus étroites car chaque modèle est précompilé.
Où il est limité : Ajouter un nouveau modèle nécessite la chaîne d’outils MLC sur un ordinateur portable. Pas un flux de travail « télécharger et partir ».
Prix : Gratuit, licence Apache.
Plates-formes : Android, iOS.
Télécharger : MLC Chat · Google Play
Résumé : Le choix si le téléphone est un phare récent et que l’objectif est la réponse sur appareil la plus rapide possible.
3. Layla, meilleur pour le chat de personnage et le jeu de rôle
Layla enveloppe llama.cpp dans une interface de chat soignée avec des personnages, une entrée vocale et une bibliothèque de personas communautaires. Le niveau gratuit comprend le téléchargement local du modèle ; l’abonnement ajoute des modèles hébergés dans le cloud et la génération d’images, tous deux optionnels. Parce que l’application est sur appareil par défaut, la bibliothèque de personnages fonctionne hors ligne.
Où il est limité : Le focus RP se montre dans les invites par défaut. Le transformer en assistant générique signifie remplacer l’invite système à chaque session.
Prix :
- Niveau gratuit : modèles locaux uniquement
- Pro : d’une modeste redevance mensuelle ajoute des modèles hébergés et des images
Plates-formes : Android, iOS.
Télécharger : Layla
Résumé : Pour quiconque veut un chat qui penche plus vers la créativité qu’vers l’utilité.
4. MyDeviceAI, meilleur assistant avec outils
MyDeviceAI exécute un modèle GGUF local, puis ajoute une étape de recherche web qui lit les extraits et les renvoie au modèle comme contexte. Cela reste privé car la requête de recherche est la seule chose qui quitte le téléphone. C’est le plus proche d’un assistant de style Perplexity avec raisonnement local.
Où il est limité : L’intégration de recherche Web dépend d’un backend de recherche qui change. Les appels d’outils occasionnellement cassés incombent à l’opérateur de remarquer.
Prix : Gratuit, open-source.
Plates-formes : Android.
Télécharger : GitHub
Résumé : Le choix quand l’assistant a besoin d’informations actuelles, pas seulement ce qui rentre dans les poids du modèle.
5. SmolChat, meilleur pour les petits téléphones
SmolChat cible les téléphones avec 4 à 6 Go de RAM. Il est livré avec des paramètres ajustés pour les modèles 1B et 1.5B (Phi-3-mini, Gemma 2 2B, Llama 3.2 1B) et refuse d’ouvrir les plus grands. Le résultat est une application de chat qui reste réactive sur un téléphone d’entrée de gamme de deux ans.
Où il est limité : Volontairement limité. Si le téléphone peut exécuter un modèle 3B, utilisez plutôt PocketPal AI.
Prix : Gratuit, open-source.
Plates-formes : Android.
Télécharger : GitHub · Google Play
Résumé : Pour les téléphones d’entrée de gamme qui gèleraient sur un modèle 7B.
6. Private AI Chat, meilleur « sans compte, sans télémétrie »
Private AI Chat expédie une petite liste de modèles GGUF vérifiés, les télécharge au premier lancement et ne demande jamais de compte. L’historique du chat reste dans une base de données sur l’appareil. La politique de confidentialité tient sur un écran parce que l’application ne collecte pas de données.
Où il est limité : Aucune sauvegarde cloud si le modèle ne suffit pas pour une question difficile. Aucun modèle ajouté par l’utilisateur au-delà de la liste sélectionnée.
Prix : Gratuit.
Plates-formes : Android.
Télécharger : Google Play
Résumé : Le choix quand tout le point est « aucune donnée ne quitte le téléphone » et choisir un modèle n’est pas la partie amusante.
7. Enchanted, meilleur si vous exécutez déjà Ollama à la maison
Enchanted est un client téléphone pour Ollama s’exécutant sur le serveur domestique. Ce n’est pas entièrement sur l’appareil (le modèle s’exécute sur la machine domestique, qui gère le calcul), mais le chat reste sur le LAN ou via un tunnel Tailscale. Pour quiconque ayant déjà une boîte domestique puissante hébergeant Ollama, c’est le chemin le plus court vers un modèle 70B depuis le téléphone.
Où il est limité : Nécessite une instance Ollama domestique. L’utilisation cellulaire nécessite un tunnel comme Tailscale pour atteindre le serveur.
Prix : Gratuit, open-source.
Plates-formes : Android, iOS.
Télécharger : GitHub
Résumé : Le choix quand le téléphone est un client léger pour un modèle local beaucoup plus grand.
Comment choisir le bon
Si le téléphone a 8 Go de RAM ou plus, commencez par PocketPal AI et un modèle 3B Q4. L’interface est la plus conviviale et la bibliothèque de modèles la plus large.
Si le téléphone est un phare récent et que la vitesse importe plus que le choix du modèle, passez à MLC Chat.
Si le téléphone a 4 à 6 Go de RAM, utilisez SmolChat avec un modèle 1.5B ou 2B.
Si l’objectif est un assistant privé qui peut chercher des choses, utilisez MyDeviceAI.
Si la journée implique un chat créatif ou un jeu de rôle, utilisez Layla.
Si un serveur domestique puissant exécute déjà Ollama, utilisez Enchanted et traitez le téléphone comme un client léger.
FAQ
Quels téléphones Android peuvent exécuter un modèle 7B? Les téléphones avec au moins 12 Go de RAM (Pixel 9 Pro XL, Galaxy S25 Ultra, OnePlus 13). Un modèle 7B Q4 plus le système d’exploitation tient bien sur 12 Go et bouge. Sur 8 Go le téléphone échange et l’application plante en quelques minutes.
Ces applications épuisent-elles la batterie? Oui, pendant la génération. Un modèle 3B à 20 tok/s sur un SoC moderne tire 4 à 6 W. Une conversation de dix minutes représente environ un pour cent de batterie. Les générations longues réchauffent le téléphone.
Puis-je utiliser ceux-ci hors ligne? Oui, c’est le point. PocketPal AI, MLC Chat, SmolChat, Layla et Private AI Chat s’exécutent entièrement sur l’appareil une fois le modèle téléchargé. Le mode avion ne les affecte pas.
Mes données sont-elles privées? Sur les six applications sur appareil, oui. Enchanted envoie le chat à votre propre serveur Ollama. Aucun d’eux n’envoie d’invites à un cloud tiers en mode par défaut.
Par quel modèle devrais-je commencer? Phi-3.5-mini en Q4_K_M est la valeur par défaut la plus sûre sur 8 Go. Il répond bien aux questions courantes et tient dans environ 2,5 Go de RAM. Passez à Gemma 2 2B ou Llama 3.2 3B si le téléphone peut le gérer.
Ceux-ci peuvent-ils remplacer ChatGPT? Pour les questions rapides, les brouillons de texte court et les extraits de code de moins de 200 lignes, oui. Pour le raisonnement prolongé, les événements actuels et le code complexe, non. Traitez sur l’appareil comme la couche privée, hors ligne, pas la boîte à outils complète.