
L’article XDA qui a fait la une de nombreuses pages a soulevé un point que beaucoup d’utilisateurs d’Obsidian testaient tranquillement de leur côté : un téléphone Android moderne avec 8 ou 12 Go de RAM peut exécuter un modèle de 3 milliards de paramètres à une vitesse lisible, entièrement hors ligne, et associé à Obsidian, il transforme le coffre en quelque chose entre un journal et un deuxième cerveau consultable. Pas de requête cloud, pas de facturation par token, pas de signal requis dans un avion ou un trajet en métro.
Nous avons testé 7 applications Android qui rendent cet appairage pratique. Chacune des applications ci-dessous exécute le modèle sur l’appareil, se connecte à un coffre Obsidian stocké sur le téléphone, et reste utile sans connexion réseau.
Ce qu’il faut rechercher
- Inférence sur l’appareil. Si l’application appelle une API, ce n’est pas l’outil que nous testons.
- Des modèles raisonnables. Q4-quantifié 3B ou 7B est le point optimal ; tout ce qui est plus grand submerge le swap.
- Accès au coffre. L’accès direct au système de fichiers du coffre Obsidian est mieux que copier-coller à chaque fois.
- Vitesse du prompt. Moins de 15 tokens par seconde est inutilisable pour quoi que ce soit de plus long qu’une phrase.
- Comportement de la batterie. Une génération qui prend deux minutes à 30 % CPU va bien ; une qui prend dix minutes à 100 % ne va pas.
- Paramètres par défaut sensés. Modèles, recherche consciente des balises, et historique de chat qui survit à la fermeture de l’application.
Comparaison rapide
| Application | Meilleur pour | Plan gratuit | Fonctionnalité en vedette | Note |
|---|---|---|---|---|
| Obsidian | Le coffre lui-même, sur le téléphone | Oui | Le même coffre sur desktop et mobile avec plugins locaux | 4,7 étoiles sur Aptoide |
| MLC Chat | Vitesse d’inférence sur appareil la plus rapide pour le chat | Oui (open source) | Modèles 3B et 7B accélérés Vulkan à vitesse raisonnable | Sideload uniquement |
| PocketPal AI | Meilleur point d’entrée pour les débutants en LLM local | Oui (open source) | Télécharge les GGUFs de Hugging Face dans l’application | 4,4 étoiles |
| Layla | Chat avec RAG local sur n’importe quel fichier | Niveau gratuit | Exécute un petit modèle sur vos notes sans configuration | 4,3 étoiles |
| Ollama in Termux | Serveur Ollama complet sur le téléphone, pour utilisateurs avancés | Oui (open source) | La même API que le desktop, donc les plugins fonctionnent simplement | Sideload uniquement |
| Smart Composer (plugin Obsidian) | Accès au modèle local depuis Obsidian mobile | Oui (open source) | Parle à n’importe quel point de terminaison compatible OpenAI, y compris Ollama local | Plugin gratuit |
| Text Generator (plugin Obsidian) | Prompts avec modèles contre les modèles locaux | Oui (open source) | Transforme n’importe quelle note en prompt avec variables | Plugin gratuit |
Les 7 meilleures applications pour Obsidian avec une LLM locale sur Android
1. Obsidian — meilleur parce que tout le reste s’exécute contre son coffre
Obsidian sur Android porte le même coffre Markdown que le desktop, se synchronise via Obsidian Sync, Syncthing, ou un dépôt Git auto-hébergé, et exécute la plupart des plugins qui ne nécessitent pas une API navigateur. Les plugins locaux signifient que la couche IA reste sur le téléphone même quand le coffre est ailleurs.
Où il échoue : Les plugins communautaires qui supposent un environnement de bureau échouent silencieusement. Les utilisateurs d’iCloud doivent compter sur Obsidian Sync ou Working Copy puisqu’Android ne voit pas iCloud.
Tarification :
- Gratuit : application complète avec coffres locaux
- Payant : Obsidian Sync (optionnel) pour synchronisation de coffre chiffrée
Plateformes : Android, iOS, Windows, macOS, Linux
Télécharger : obsidian.md — également disponible sur Aptoide et Google Play
Conclusion : Choisissez Obsidian d’abord, car chaque plugin IA ici cible un coffre situé sur le téléphone.
2. MLC Chat — meilleure vitesse d’inférence sur appareil
MLC Chat propose des modèles compilés par le projet MLC LLM pour s’exécuter sur le GPU du téléphone via Vulkan. Un modèle 3B comme Phi-3.5-mini génère à plus de 20 tokens par seconde sur un Snapdragon 8 Gen 3, et un 7B Q4 quantifié est utilisable sur les téléphones haut de gamme. Les chats vivent localement, aucun compte nécessaire.
Où il échoue : Sideload uniquement, le catalogue de modèles est plus petit que celui de PocketPal, et ajouter un modèle personnalisé nécessite une étape de compilation sur desktop.
Tarification :
- Gratuit : open source sous Apache 2.0
- Payant : aucun
Plateformes : Android (sideload APK)
Télécharger : llm.mlc.ai
Conclusion : Choisissez MLC Chat quand vous voulez la génération locale la plus rapide sur le téléphone et que vous êtes à l’aise avec un APK sideloadé.
3. PocketPal AI — meilleur point d’entrée pour les nouveaux utilisateurs de LLM locales
PocketPal AI est le moyen le plus convivial de se lancer dans les modèles locaux. Installez l’application, parcourez un ensemble curé de modèles GGUF de Hugging Face, appuyez pour télécharger et commencez à discuter. Les modèles couvrent la plupart des familles de modèles d’usine, donc un utilisateur novice n’édite pas JSON chat_template sur l’écran du téléphone.
Où il échoue : L’inférence est CPU uniquement via llama.cpp, donc les vitesses sont inférieures à MLC Chat sur le même matériel. L’accès au coffre est copier-coller sauf si vous l’associez à un plugin Obsidian.
Tarification :
- Gratuit : open source sous MIT
- Payant : aucun
Plateformes : Android, iOS
Télécharger : Google Play
Conclusion : Choisissez PocketPal si c’est votre première tentative d’exécution d’un modèle sur un téléphone.
4. Layla — meilleur quand le chat doit voir vos notes
Layla exécute de petits modèles localement et ajoute une légère étape de récupération augmentée par-dessus, donc un prompt peut faire référence à des notes ou des PDF que vous désignez. Pour un utilisateur d’Obsidian, cela signifie que “résumez les notes de la semaine dernière” fonctionne sans aucun travail de plugin, pourvu que le coffre se trouve dans un dossier que Layla peut lire.
Où il échoue : La qualité RAG sur un petit modèle est inégale. Le niveau gratuit limite la taille du modèle ; le niveau payant l’élimine. Le raffinement de l’interface utilisateur traîne derrière PocketPal.
Tarification :
- Niveau gratuit avec modèles limités
- Payant : mise à niveau unique déverrouille des modèles plus grands
Plateformes : Android, iOS
Télécharger : Google Play
Conclusion : Choisissez Layla si l’objectif est “répondre à des questions sur mes notes” et que vous ne voulez pas construire le pipeline vous-même.
5. Ollama in Termux — meilleure configuration d’utilisateur avancé qui reflète le desktop
Installer Ollama à l’intérieur de Termux donne au téléphone le même serveur HTTP que celui en cours d’exécution sur le desktop, sur l’interface loopback. Tout plugin Obsidian qui parle à Ollama lui parle alors directement. La batterie est plus lourde car Termux ne quitte pas gracieusement, mais les performances surpassent la plupart des exécuteurs GUI sur le même téléphone.
Où il échoue : Termux de Play Store est obsolète ; téléchargez depuis F-Droid ou la version officielle GitHub. Les permissions du service au premier plan nécessitent de l’attention, et l’étranglement thermique peut nuire aux générations longues.
Tarification :
- Gratuit : open source
- Payant : aucun
Plateformes : Android (Termux)
Télécharger : ollama.com avec Termux
Conclusion : Choisissez ceci si vous êtes déjà à l’aise dans Termux et que vous voulez l’expérience Ollama desktop sur le téléphone.
6. Smart Composer — meilleur plugin Obsidian pour pointer vers un modèle local
Smart Composer est le plugin communautaire qui transforme une discussion dans Obsidian en conversation avec n’importe quel point de terminaison compatible OpenAI, y compris Ollama local ou LM Studio s’exécutant sur le même téléphone via Termux, ou sur un serveur domestique via le LAN. Les prompts peuvent @-mentionner des notes, des dossiers et des balises, donc un prompt “réécrivez ce paragraphe dans le ton des notes quotidiennes du mois dernier” a un contexte réel.
Où il échoue : Le plugin suppose toujours que vous pouvez atteindre un serveur, donc si le téléphone est hors ligne et qu’aucun serveur local n’est en cours d’exécution, il ne fait rien.
Tarification :
- Gratuit : open source sous MIT
- Payant : aucun
Plateformes : Android, iOS, Windows, macOS, Linux (dans Obsidian)
Télécharger : github.com/glowingjade/obsidian-smart-composer
Conclusion : Choisissez Smart Composer comme pont entre Obsidian et le modèle, que ce modèle s’exécute sur le téléphone ou sur votre serveur domestique.
7. Text Generator — meilleur plugin pour les modèles de prompts
Text Generator traite les notes comme des modèles. Enveloppez une variable, ajoutez un prompt système, et l’exécution du modèle sur n’importe quelle note remplit les espaces réservés et envoie le résultat au modèle configuré. Il fonctionne contre Ollama local, LM Studio ou des fournisseurs hébergés, et la bibliothèque de modèles sur le forum communautaire est vaste.
Où il échoue : La syntaxe nécessite une après-midi pour apprendre. Déboguer un modèle échoué sur mobile est plus douloureux que sur desktop.
Tarification :
- Gratuit : open source sous GPLv3
- Payant : aucun
Plateformes : Android, iOS, Windows, macOS, Linux (dans Obsidian)
Télécharger : text-gen.com
Conclusion : Choisissez Text Generator si vous voulez des modèles de prompts réutilisables qui transforment une note en action IA répétable.
Comment choisir
Si vous n’avez pas encore de coffre sur le téléphone, installez Obsidian d’abord et synchronisez.
Si vous voulez la génération locale la plus rapide et que vous êtes à l’aise avec un APK sideloadé, exécutez MLC Chat.
Si c’est votre première tentative de modèles locaux sur un téléphone, installez PocketPal AI et choisissez un modèle 3B.
Si le chat doit voir vos notes sans un pipeline manuel, essayez Layla avec le dossier du coffre partagé.
Si vous vivez déjà dans Termux, installez Ollama là et laissez chaque plugin Obsidian pointer vers localhost.
Pour amener le modèle dans Obsidian lui-même, ajoutez Smart Composer comme surface de chat.
Pour les prompts modulaires répétables sur les notes, ajoutez également Text Generator.
FAQ
Quel est le plus petit téléphone qui peut exécuter un modèle utile ?
Un téléphone RAM 8 Go des deux dernières générations de flagship exécutera un modèle 3B à une vitesse utile. Un téléphone RAM 12 Go ouvre les quants 7B Q4. En dessous de 6 Go, le système d’exploitation continue d’échanger le modèle et les vitesses s’effondrent.
Quel modèle dois-je commencer par ?
Phi-3.5-mini et Llama-3.2-3B sont tous deux de bons défauts pour un téléphone. Les deux s’adaptent en dessous de 3 Go en Q4, génèrent de manière cohérente et connaissent suffisamment de connaissances générales pour être utiles. Passez à un 7B comme Qwen2.5-7B ou Mistral-7B sur un appareil flagship.
Exécuter le modèle va-t-il détruire ma batterie ?
Les générations courtes d’une paire de centaines de tokens vont bien. Les exécutions d’agents longues, les pipelines RAG qui ré-encodent un grand coffre ou l’utilisation continue au premier plan épuiseront un téléphone normal en quelques heures. Traitez le modèle local comme un assistant de forme courte, pas un service de fond.
Obsidian mobile peut-il appeler un modèle s’exécutant sur mon desktop ?
Oui. Pointez Smart Composer vers l’adresse IP locale de votre desktop et le port Ollama sur votre réseau domestique. Ajoutez Tailscale ou WireGuard si vous voulez que la même connexion fonctionne quand vous êtes loin de chez vous. Le téléphone reste privé ; le modèle est juste ailleurs.