
XDA a transformé un ancien téléphone en serveur LLM local et a réussi à faire fonctionner Gemma 4 suffisamment bien pour un véritable travail de productivité. C’est un très bon usage pour un ancien Android qui dort dans un tiroir, et grâce aux optimisations ARM de llama.cpp, un Snapdragon 8 Gen 1 ou plus récent peut héberger un modèle quantisé de 3B à 7B qui répond aux autres appareils sur notre Wi-Fi. Sept applications font le travail, certaines sont des clients de chat qui exposent également une API compatible OpenAI, certaines sont des terminaux qui nous permettent d’exécuter llama.cpp ou ollama directement.
Ce qu'il faut rechercher dans une application LLM locale Android
- Mode serveur API. Pour un “ancien téléphone en tant que serveur LLM”, l’application doit exposer un point de terminaison HTTP que d’autres appareils peuvent appeler, idéalement compatible avec OpenAI.
- Support des formats de modèle. GGUF via llama.cpp est la norme, le format propre de MLC est une autre option.
- Déchargement GPU. Backend Vulkan ou OpenCL qui utilise le GPU Adreno ou Mali de notre téléphone modifie les jetons par seconde de 3x à 5x.
- Contrôle de la batterie et thermique. L’inférence soutenue cuit un téléphone. Recherchez les contrôles de service au premier plan et l’accélération thermique.
- Empreinte RAM. Les anciens téléphones avec 4 à 6 GB de RAM ne peuvent pas accueillir des modèles plus grands même avec une quantisation agressive.
- Persistance en arrière-plan. L’application doit survivre au gestionnaire de mémoire agressif d’Android sur les OEM bon marché.
Comparaison rapide
| Application | Meilleur pour | Gratuit | Serveur API | Note |
|---|---|---|---|---|
| Termux | llama.cpp ou ollama complet dans un terminal | Oui | Oui, via llama-server | 4.7 |
| PocketPal AI | Chat GUI avec bascule serveur | Oui | Oui, expérimental | 4.5 |
| Layla | Chat poli plus jeu de rôle | Oui | Trial Pro API | 4.4 |
| MLC Chat | Modèles optimisés MLC | Oui | Local uniquement en stable | 4.3 |
| ChatterUI | Interface de style SillyTavern | Oui | Oui, via serveur intégré | 4.4 |
| SmolChat | Client de chat minimal | Oui | Non | 4.3 |
| llama.cpp Android | Build de référence | Oui | Oui, via llama-server | 4.5 |
Les sept applications
1. Termux, meilleur llama.cpp ou ollama complet dans un terminal
Termux est la boîte à outils Linux-dans-votre-poche qui nous permet de construire et exécuter llama.cpp ou ollama directement. pkg install cmake python git, clonez llama.cpp, compilez avec LLAMA_VULKAN=1 et démarrez llama-server lié à notre adresse IP LAN. L’ancien téléphone sert maintenant une API compatible OpenAI à n’importe quel appareil sur Wi-Fi.
Où il échoue: Pas pour les fans de terminal. La configuration initiale prend une heure de gestion des paquets.
Tarification:
- Gratuit: Boîte à outils complète
- Payant: Aucun
Plateformes: Android
Télécharger: F-Droid · Aptoide
Termux pour l’hébergement LLM local gagne en flexibilité. Tout ce que llama.cpp supporte, Termux le supporte.
Conclusion: Le choix pour les lecteurs à l’aise dans un terminal. Le potentiel est bien plus élevé que n’importe quel GUI sur cette liste.
2. PocketPal AI, meilleur GUI avec bascule serveur
PocketPal AI est un client de chat Android open source qui charge les modèles GGUF depuis Hugging Face et les exécute sur l’appareil. Les builds récentes ajoutent une bascule serveur expérimentale qui expose le même modèle sur notre LAN via un point de terminaison compatible OpenAI.
Où il échoue: La bascule serveur est encore marquée comme expérimentale et manque de TLS.
Tarification:
- Gratuit: Open source sous MIT
- Payant: Aucun
Plateformes: Android, iOS
Télécharger: Google Play · F-Droid
PocketPal AI pour l’hébergement LLM local gagne en simplicité GUI. Choisissez un modèle sur Hugging Face, appuyez sur charger, commencez à discuter.
Conclusion: Le choix pour les lecteurs qui veulent un GUI d’abord et une API ensuite.
3. Layla, meilleur chat poli plus jeu de rôle
Layla est un client de chat Android favorable au paiement qui exécute les modèles quantisés sur l’appareil avec une UI élégante. Jeu de rôle de personnage, mémoire persistante et mode vocal inclus. Le niveau Pro ajoute un mode serveur API qui expose le modèle chargé.
Où il échoue: Le niveau gratuit limite la longueur du contexte. Les caractéristiques du personnage ajoutent de la complexité à l’interface.
Tarification:
- Gratuit: Chat de base
- Payant: Abonnement Pro pour un contexte étendu et un mode API
Plateformes: Android
Télécharger: Google Play
Layla pour l’hébergement LLM local gagne en polissage du chat et aux outils de jeu de rôle.
Conclusion: Le choix pour les lecteurs qui veulent une interface centrée sur le chat, pas un outil dev.
4. MLC Chat, meilleur modèles optimisés MLC
MLC Chat de l’équipe MLC est livré avec des modèles précompilés optimisés pour les GPU Qualcomm Adreno et MediaTek. Les jetons par seconde sont les meilleurs sur cette liste pour les téléphones que l’application supporte officiellement, au prix d’une bibliothèque de modèles plus petite que llama.cpp.
Où il échoue: Le mode serveur API est sur la feuille de route, pas encore dans la version stable.
Tarification:
- Gratuit: Open source
- Payant: Aucun
Plateformes: Android, iOS
MLC Chat pour l’hébergement LLM local gagne en vitesse d’inférence brute quand notre téléphone est sur la liste supportée.
Conclusion: Le choix pour les lecteurs dont l’appareil est sur la liste supportée par MLC et veulent les jetons maximum par seconde localement.
5. ChatterUI, meilleur interface de style SillyTavern
ChatterUI est un client de chat Android modélisé sur SillyTavern. Cartes de personnage, branches de chat et un serveur intégré que d’autres appareils sur notre LAN peuvent frapper comme point de terminaison compatible OpenAI.
Où il échoue: Le format de la carte de personnage est l’essentiel, mais cela rend ChatterUI plus lourd que PocketPal pour un Q&A simple.
Tarification:
- Gratuit: Open source
- Payant: Aucun
Plateformes: Android
Télécharger: GitHub
ChatterUI pour l’hébergement LLM local gagne si notre pile de chat existante a une forme SillyTavern.
Conclusion: Le choix pour les lecteurs qui utilisent déjà SillyTavern.
6. SmolChat, meilleur client de chat minimal
SmolChat est un client Android minimaliste pour les modèles llama.cpp GGUF. Il ne sert pas d’API, mais son empreinte est assez petite pour que les anciens téléphones avec 4 GB de RAM puissent toujours accueillir un modèle quantisé 3B.
Où il échoue: Chat local seulement, pas de mode serveur.
Tarification:
- Gratuit: Open source
- Payant: Aucun
Plateformes: Android
Télécharger: GitHub
SmolChat pour l’hébergement LLM local gagne comme l’option la plus légère pour les appareils 4 GB.
Conclusion: Le choix quand le téléphone cible est vraiment ancien et limité en RAM.
7. llama.cpp Android, meilleur build de référence
llama.cpp Android est le build de référence officiel de ggerganov. Pas dans aucune boutique, nous téléchargeons l’APK depuis les versions GitHub. Exécute llama-server directement avec les mêmes drapeaux que nous utiliserions sur Linux.
Où il échoue: Zéro polissage de l’interface, et nous devons connaître les drapeaux llama.cpp avant de commencer.
Tarification:
- Gratuit: Open source sous MIT
- Payant: Aucun
Plateformes: Android
Télécharger: GitHub
llama.cpp Android pour l’hébergement LLM local gagne comme implémentation de référence.
Conclusion: Le choix pour les lecteurs qui veulent le même outil qu’ils exécutent sur un ordinateur portable, sur Android.
Comment choisir le bon
- À l’aise dans un terminal, veut une flexibilité maximale: Termux
- Veut GUI plus bascule API: PocketPal AI
- Veut le polissage du chat avec le jeu de rôle: Layla
- Le téléphone est sur la liste supportée MLC et veut la vitesse maximale: MLC Chat
- Exécute déjà SillyTavern: ChatterUI
- Le téléphone n’a que 4 GB de RAM: SmolChat
- Veut le build de référence llama.cpp: llama.cpp Android
FAQ
Un ancien téléphone Android peut-il vraiment exécuter un LLM?
Oui, sur Snapdragon 855 et plus récent, avec 6 GB ou plus de RAM. Attendez 3 à 5 jetons par seconde sur un modèle quantisé 3B sur du matériel plus ancien, et 10 à 20 jetons par seconde sur les téléphones plus récents.
Quel modèle fonctionne le mieux sur Android?
Gemma 2B, Phi-3 Mini, Llama 3.2 3B et Qwen 2.5 3B s’adaptent tous confortablement à la quantisation Q4_K_M. Gemma 4 s’exécute sur les téléphones plus récents avec 8 GB ou plus de RAM.
Puis-je utiliser mon téléphone comme serveur API LLM pour mon ordinateur portable?
Oui. Termux exécutant llama-server lié à notre adresse IP LAN fonctionne. Pointez le client de chat de notre ordinateur portable vers http://<phone-ip>:8080/v1 pour le point de terminaison compatible OpenAI.
L'exécution d'un LLM tuera-t-elle la batterie de mon téléphone?
L’inférence soutenue se vide rapidement, prévoyez l’alimentation murale. Attendez également que le téléphone fonctionne chaud, soulevez-le pour la circulation d’air.
llama.cpp est-il gratuit?
Oui, sous licence MIT. Chaque application sur cette liste qui l’utilise est soit open source, soit payante au-dessus de la base llama.cpp gratuite.