Physical AI agent body apps

Un robot ESP32 imprimé en 3D qui tape avec l’agent IA vivant sur votre ordinateur portable est une nouveauté. C’est aussi la démonstration d’un modèle réel : un petit microcontrôleur comme corps, une plus grande machine comme cerveau, et quelques outils open source les reliant ensemble. La cloche qu’il sonne quand la tâche se termine est le même événement d’appel d’outil LLM déclenché sur une broche GPIO.

Nous avons regardé sept applications qui rendent ce modèle réalisable en un week-end. Deux sont des environnements de firmware pour le microcontrôleur, une est la couche d’orchestration que la plupart des auto-hébergeurs exécutent déjà, une est le framework d’agent qui transforme les appels LLM en actions d’appareil, et trois sont des outils de support pour la voix, les scripts et la colle sans code.

À quoi faire attention

Comparaison rapide

Application Meilleur pour Plates-formes Plan Gratuit Prix Licence
ESPHome Firmware ESP32/8266 à partir de YAML Windows, macOS, Linux, Docker Oui Gratuit GPL / MIT
PlatformIO IDE complet pour l’embarqué Windows, macOS, Linux Oui Gratuit (Pro payant) Apache 2.0
Home Assistant Bus de messages et tableau de bord Windows, macOS, Linux, Docker Oui Gratuit Apache 2.0
LangChain Framework d’agent avec appels d’outils Windows, macOS, Linux Oui Gratuit (SDK) MIT
Willow Voix locale sur matériel ESP32 Windows, macOS, Linux Oui Gratuit Apache 2.0
MicroPython Python sur le microcontrôleur Windows, macOS, Linux Oui Gratuit MIT
n8n Colle sans code entre agent et matériel Windows, macOS, Linux, Docker Oui Gratuit (auto-hébergé) Fair-code

1. ESPHome – Meilleur pour le firmware ESP32/8266 à partir de YAML

ESPHome flashe un ESP32 ou ESP8266 avec un firmware construit à partir d’une description YAML. Déclarez les broches, les capteurs, les boutons, les servos ; ESPHome compile un binaire, le télécharge via USB ou OTA, et connecte l’appareil à Home Assistant sans colle. C’est le chemin le plus rapide de la carte vierge à « appareil contrôlable par agent ».

Où il s’en sort moins bien : YAML n’est pas la même chose que C. Certaines astuces de bas niveau nécessitent d’écrire des lambdas qui sont moitié code, moitié config.

Tarification :

Plates-formes : Windows, macOS, Linux, Docker.

Télécharger : esphome.io.

Conclusion : La couche de firmware par défaut. Des semaines de développement C++ comprimées en cent lignes de YAML.

2. PlatformIO – Meilleur IDE complet pour l’embarqué

PlatformIO est ce à quoi vous montez quand l’abstraction ESPHome ne s’adapte pas. C’est un IDE (ou une extension VS Code) qui parle Arduino, ESP-IDF, STM32Cube, et des dizaines d’autres frameworks, avec un gestionnaire de paquets pour les bibliothèques. Quand l’agent IA a besoin d’un bras de robot piloté par du code de cinématique inverse, ce code vit dans PlatformIO.

Où il s’en sort moins bien : Le tier Pro verrouille certaines fonctionnalités de débogage avancées. La courbe d’apprentissage est réelle si vous n’avez jamais fait d’embarqué.

Tarification :

Plates-formes : Windows, macOS, Linux.

Télécharger : platformio.org.

Conclusion : L’IDE pour tout ce qu’ESPHome ne peut pas décrire de manière déclarative.

3. Home Assistant – Meilleur bus de messages et tableau de bord

Home Assistant est la couche qui permet à un appel d’outil LLM d’atteindre le monde physique. L’agent frappe un point de terminaison HTTP ou un sujet MQTT ; Home Assistant le traduit en « bascule d’interrupteur » ou « faire tourner le servo à 45 degrés » et l’ESP32 obéit. Il fournit également une interface utilisateur pour voir ce que fait le robot sans ouvrir un terminal.

Où il s’en sort moins bien : Courbe d’apprentissage abrupte si vous n’en avez pas configuré une auparavant. L’écosystème des modules complémentaires est puissant mais bruyant.

Tarification :

Plates-formes : Windows, macOS, Linux, Docker, OS dédié.

Télécharger : home-assistant.io.

Conclusion : La couche intermédiaire qui maintient le code de l’agent séparé du matériel.

4. LangChain – Meilleur framework d’agent avec appels d’outils

LangChain est le SDK qui transforme un LLM en agent utilisant des outils. Définissez un outil (« faire sonner la cloche »), passez-le dans le schéma d’outil, et le modèle décide quand l’appeler. Combiné avec un outil HTTP Home Assistant, l’agent obtient l’ensemble complet des capacités du robot sans rien savoir du MQTT.

Où il s’en sort moins bien : API en évolution rapide. Certains modèles d’il y a un an sont déjà obsolètes.

Tarification :

Plates-formes : Windows, macOS, Linux (Python et JS/TS).

Télécharger : python.langchain.com ou js.langchain.com.

Conclusion : Le moyen de donner à un LLM local la capacité d’appeler un outil « faire sonner la cloche ».

5. Willow – Meilleure voix locale sur matériel ESP32

Willow transforme un ESP32-S3 avec une baie de microphones en un point de terminaison vocal Home Assistant qui fonctionne entièrement sur votre réseau. Détection du mot de réveil sur l’appareil, synthèse vocale hébergée sur votre propre serveur, et la demande transcrite acheminée vers Home Assistant ou un LLM local. Pas de cloud, pas de compte, aucune donnée ne quitte la pièce.

Où il s’en sort moins bien : Le choix des cartes est étroit (principalement la gamme ESP32-S3 BOX). Nécessite un serveur d’inférence Willow sur une machine plus puissante.

Tarification :

Plates-formes : Windows, macOS, Linux (pour le serveur d’inférence).

Télécharger : heywillow.io.

Conclusion : Pour quiconque veut que le robot entende et parle sans dépendance cloud.

6. MicroPython – Meilleur pour Python sur le microcontrôleur

MicroPython exécute un interpréteur Python sur un ESP32 ou RP2040, donc le firmware que vous écrivez et le code de l’agent ressemblent au même langage. C’est une véritable victoire pour le développeur qui veut prototyper un mouvement de servo ou des motifs LED sans quitter Python.

Où il s’en sort moins bien : Plus lent que C pour les boucles serrées. Moins éconergétique qu’ESPHome pour un appareil alimenté par batterie.

Tarification :

Plates-formes : Windows, macOS, Linux pour les outils de flash.

Télécharger : micropython.org.

Conclusion : Pour le prototype où la vitesse d’itération importe plus que les watts économisés.

7. n8n – Meilleure colle sans code entre agent et matériel

n8n est l’outil de flux de travail auto-hébergé qui connecte l’API LLM, Home Assistant, ESPHome, une base de données, et n’importe quel point de terminaison HTTP que vous pouvez imaginer, sur un graphique. Quand vous voulez « si l’agent a dit que la tâche est terminée, faire sonner la cloche et enregistrer l’horodatage », n8n est le moyen rapide de le construire sans écrire un service.

Où il s’en sort moins bien : Non conçu pour le temps réel. Bien pour les flux déclenchés par outils, pas pour les boucles de capteurs serrées.

Tarification :

Plates-formes : Windows, macOS, Linux, Docker.

Télécharger : n8n.io.

Conclusion : Le tissu conjonctif entre la sortie de l’agent et les actions du robot.

Comment choisir le bon

FAQ

Ai-je besoin d’une Raspberry Pi ainsi qu’un ESP32 ? Pas toujours. Pour les corps simples, l’ESP32 seul suffit avec un LLM hébergé dans le cloud ou sur le LAN. Pour des corps plus riches avec inférence vocale locale, une Pi 4 ou 5 héberge le modèle et l’ESP32 reste le corps.

Quelle est la carte la moins chère pour commencer ? Une carte de développement ESP32 coûte quelques dollars. Ajoutez des servos, un petit haut-parleur, un affichage OLED, et vous avez un robot qui fait sonner la cloche pour moins de 30 $.

Puis-je le faire sans connexion Internet ? Oui, si vous auto-hébergez le LLM (Ollama, LM Studio ou Llama.cpp) et utilisez Willow pour la voix. Toute la pile — du micro au LLM au servo — peut vivre sur votre LAN.

Est-ce sûr ? L’agent peut-il casser des choses ? Uniquement de la façon que vous le permettez. Donnez à l’agent des points de terminaison HTTP pour les actions qu’il est autorisé à effectuer ; ne lui donnez pas l’accès root au serveur Home Assistant. Limitez le débattement du servo et le courant dans le firmware.

Quel est ce robot ESP32 imprimé en 3D que tout le monde partage ? C’est un petit boîtier autour d’une carte de développement ESP32-S3, un OLED pour les yeux, et un servo-driven bell. L’intérêt n’est pas la cloche — c’est le modèle « l’agent IA obtient une présence physique dans la pièce ». Tout dans cet article vous donne les pièces pour en construire une.