
Les snapshots qui n’ont jamais été restaurés ne comptent pas comme des snapshots. Un rig Proxmox qui a tranquillement survécu six mois sans incident ne manque qu’une carte mère de ne rien prouver du tout. Le bon rituel est de casser le laboratoire intentionnellement, selon un calendrier, et de voir ce qui revient réellement. Voici les meilleures applications pour les tests de chaos en home lab sur Android en 2026 : des clients SSH qui survivent sur un téléphone, des tableaux de bord qui restent honnêtes lors d’une panne, et des alertes qui atteignent la poche quand tout le reste tombe.
Ce qu’il faut rechercher
- SSH avec clés sauvegardées, serveurs de saut et déverrouillage biométrique
- Un chemin de restauration à partir du téléphone si la restauration d’une snapshot se comporte mal
- Un tableau de bord public montrant les services verts et rouges en temps réel
- Des alertes sur une voie réseau qui survit à la panne qu’elles annoncent
- Un maillage distant pour que le laboratoire reste accessible quand le routeur est la panne
- Une conversation Signal avec un collègue de confiance pour que les exercices restent enregistrés
Comparaison rapide
| Application | Meilleur pour | Plan gratuit | Commence à | Point fort |
|---|---|---|---|---|
| Termius | SSH vers chaque hôte depuis un téléphone | Oui | Tarif Pro mensuel modeste | Synchronisation, snippets, clés déverrouillées biométriquement |
| Home Assistant | Automatiser les exercices et les rapports post-incidents | Oui | Gratuit | Serveur local, tableaux de bord sur le téléphone |
| Uptime Kuma | Page de statut de disponibilité auto-hébergée | Oui | Gratuit | URL de statut public et notifications push |
| Grafana | Des graphiques qui montrent ce qui s’est vraiment passé | Oui | Tarif Cloud Grafana mensuel modeste | Tableaux de bord fédérés, vues conviviales pour le téléphone |
| Fing | Vue instantanée de ce qui s’est déconnecté du LAN | Oui | Tarif Premium annuel modeste | Wake-on-LAN, scan de port, carte de sous-réseau |
| Tailscale | Laboratoire accessible quand le WAN est la panne | Oui | Tarif d’équipe mensuel modeste | VPN maillé avec support SSH |
| Signal | Chat post-incident, alertes depuis des scripts | Oui | Gratuit | Chiffrement de bout en bout pour les groupes et les bots de script |
1. Termius — meilleur pour SSH depuis le téléphone
Termius est le client SSH qui reste utile pendant un exercice. Les hôtes sauvegardés, les snippets comme systemctl status pve-cluster, et les clés déverrouillées par empreinte digitale signifient qu’une restauration de snapshot n’a pas besoin d’un ordinateur portable. Les sessions multi-onglets vous permettent de regarder une restauration sur un hôte et de suivre les journaux sur un autre. Le niveau Pro synchronise la même configuration sur un ordinateur portable, une tablette et un téléphone.
Où il est insuffisant : la version gratuite limite la synchronisation et les snippets. Les applications de terminal complexes comme tmux veulent toujours un clavier réel.
Tarification :
- Gratuit : SSH local sur un appareil
- Payant : tarif Pro mensuel modeste
Plates-formes : Android, iOS, Windows, macOS, Linux
Résumé : Choisissez Termius comme outil de premier intervenant lors d’un exercice de chaos.
2. Home Assistant — meilleur pour automatiser les exercices
Home Assistant fait office de planificateur d’exercices de chaos. Ajoutez des automatisations qui arrêtent un service à 2h du matin le premier dimanche du mois, attendent le redémarrage et enregistrent le résultat dans une note dans l’enregistreur. L’application compagnon envoie une notification au téléphone avec le statut réussi ou échoué. Comme le serveur se trouve sur le LAN, l’exercice continue de fonctionner quand le WAN est arrêté.
Où il est insuffisant : le serveur doit survivre à ses propres exercices ; conservez l’état d’automatisation sur le même disque que vous sauvegardez. Il y a une courbe d’apprentissage pour les automatisations elles-mêmes.
Tarification :
- Gratuit : code ouvert
- Payant : abonnement Home Assistant Cloud optionnel
Plates-formes : Android, iOS, Linux, Windows, macOS (serveur)
Résumé : Choisissez Home Assistant pour lancer l’exercice et enregistrer le résultat sans toucher un ordinateur portable.
3. Uptime Kuma — meilleur pour une page de statut auto-hébergée
Uptime Kuma est le moniteur de disponibilité auto-hébergé le plus convivial. Pointez-le vers chaque service du laboratoire (interface web Proxmox, Home Assistant, Nextcloud, quoi que ce soit) et laissez-le vérifier toutes les 30 secondes. Le tableau de bord web fonctionne également comme une page conviviale pour le téléphone que vous pouvez ouvrir sur un widget d’écran de verrouillage ou mettre en signet ; les notifications push arrivent sur Android via l’application Web progressive ou le webhook générique de Kuma Push.
Où il est insuffisant : il surveille son propre hôte, donc un exercice qui tue la boîte tue aussi le moniteur. Exécutez-le sur une Raspberry Pi qui n’est pas dans la zone d’effet.
Tarification :
- Gratuit : code ouvert
Plates-formes : Android (via web), Linux, Windows, macOS (serveur)
Télécharger : Basé sur le web ; ajoutez à l’écran d’accueil depuis un navigateur Chromium.
Résumé : Choisissez Uptime Kuma comme le score public de l’exercice.
4. Grafana — meilleur pour le graphique “ce qui s’est vraiment passé”
Grafana est où l’exercice continue de vivre après. Connectez InfluxDB, Prometheus ou Loki aux services en test, et laissez le téléphone ouvrir les mêmes tableaux de bord que le bureau. Les URL des panneaux fonctionnent comme des signets, et l’affichage mobile est utilisable pour quelques graphiques clés même à 400px de largeur.
Où il est insuffisant : configurer les sources de données est le vrai travail. Sur les téléphones, l’éditeur de tableau de bord interactif est exigu.
Tarification :
- Gratuit : code ouvert
- Payant : tarif Cloud Grafana mensuel modeste
Plates-formes : Android (via navigateur), Windows, macOS, Linux
Télécharger : Basé sur le web.
Résumé : Choisissez Grafana pour l’image de l’incident que le runbook référencera le mois prochain.
5. Fing — meilleur pour “ce qui vient de tomber de mon LAN”
Fing répond à “quel hôte manque maintenant” sans invite SSH. Exécutez une analyse, comparez-la avec les appareils connus en dernier, et voyez lequel s’est déconnecté. Wake-on-LAN et les scans de port se trouvent dans la même application. Le niveau Premium envoie des rapports hebdomadaires et un centre d’alertes.
Où il est insuffisant : Fing est un scanner, pas un moniteur de service ; il indique qu’un hôte est actif, pas si le service à l’intérieur est sain. Certaines politiques MDM restreignent l’application sur les appareils gérés.
Tarification :
- Gratuit : scan, liste d’appareils basique
- Payant : tarif Premium annuel modeste
Plates-formes : Android, iOS, Windows, macOS
Résumé : Choisissez Fing pour répondre à la question “est-ce branché” en moins de 15 secondes.
6. Tailscale — meilleur pour l’accessibilité quand le WAN est arrêté
Tailscale est le VPN maillé qui cesse tranquillement d’avoir de l’importance, au meilleur sens. Chaque hôte du laboratoire et le téléphone dans la poche se trouvent sur le même réseau virtuel, et Tailscale SSH vous permet d’accéder à un hôte Proxmox sans port public. Quand le routeur redémarre ou que le FAI tombe, le maillage converge à nouveau dès que la connectivité revient.
Où il est insuffisant : le plan de contrôle est un service hébergé ; une option entièrement auto-hébergée se trouve dans Headscale pour ceux qui la veulent. Certains FAI NAT au niveau du transporteur frustrent la configuration initiale.
Tarification :
- Gratuit : utilisation personnelle
- Payant : tarif mensuel modeste par utilisateur pour les équipes
Plates-formes : Android, iOS, Windows, macOS, Linux
Résumé : Choisissez Tailscale pour garder le laboratoire accessible quand le routeur est la panne.
7. Signal — meilleur pour le canal de chat de l’exercice
Signal est où le runbook vit réellement pendant un exercice. Un groupe de chat avec la personne qui a accepté d’être le deuxième examinateur conserve un journal horodaté des décisions, et les scripts peuvent envoyer des événements via signal-cli depuis le même serveur qui a exécuté l’exercice. Le chiffrement de bout en bout garde les détails du runbook en dehors de l’application de notes plus large.
Où il est insuffisant : la livraison en arrière-plan sur les ROM OEM agressifs est parfois lente ; gardez Signal dans la liste toujours autorisée. signal-cli est une installation distincte pour les messages de script.
Tarification :
- Gratuit : application complète
Plates-formes : Android, iOS, Windows, macOS, Linux
Résumé : Choisissez Signal comme journal d’audit et pageur de l’exercice en un.
Comment choisir
- Commencez par Termius, Uptime Kuma et Tailscale : le client SSH, le score et l’accessibilité.
- Ajoutez Home Assistant pour planifier les exercices et enregistrer les résultats.
- Ajoutez Grafana pour le graphique rétrospectif.
- Ajoutez Fing pour la réponse côté réseau quand un hôte tombe.
- Ajoutez Signal pour le journal des décisions prises pendant l’incident.
FAQ
À quelle fréquence dois-je exécuter un exercice de chaos sur un home lab? Mensuel est suffisant pour la plupart des configurations domestiques ; trimestriel est le minimum. Chaque exercice doit soit se restaurer à partir d’une snapshot, soit échouer bruyamment.
Comment empêcher un exercice de chaos de devenir un incident réel?
Définissez un délai strict qui inverse la modification automatiquement si la restauration ne se termine pas. Les automatisations de Home Assistant et les travaux at font tous les deux cela.
Puis-je exécuter des expériences de chaos sans une pile de surveillance complète? Oui. Uptime Kuma seul vous indique quel service est mort et quand. Grafana ajoute du contexte après mais n’est pas nécessaire pour exécuter l’exercice.
Est-ce que Tailscale est sûr pour exposer un hôte Proxmox? Tailscale est un maillage privé, pas une exposition publique. Combinez-le avec une ACL qui restreint les nœuds pouvant accéder à l’interface web de Proxmox.
Quel est le premier exercice le plus sûr à essayer? Prenez un snapshot d’un petit conteneur, arrêtez-le, supprimez le conteneur et restaurez à partir de la snapshot. Chronométrez la restauration. Si le minuteur dépasse la tolérance, l’exercice s’est déjà rentabilisé.