Softonic a signalé cette semaine qu’OpenAI et Anthropic ont conjointement révélé un lot de vulnérabilités d’agents IA, et la question de responsabilité qui s’ensuit est la vraie histoire. Si un agent de codage supprime un répertoire parce qu’une page web le lui a dit, quelqu’un doit en répondre. La bonne réponse d’un utilisateur de bureau n’est pas d’arrêter d’exécuter des agents. C’est de les exécuter derrière des guardrails. Nous avons testé 7 applications qui filtrent les entrées et sorties des agents, isolent leur exécution et enregistrent ce qu’ils font, de sorte que lorsque quelque chose se passe mal, nous pouvons pointer l’invite exacte qui l’a causé.
Quoi chercher dans une application de sécurité des agents IA
La sécurité des agents se divise en trois problèmes : ce que lit l’agent, ce qu’il fait et ce qu’il laisse derrière. Toute configuration sérieuse doit couvrir les trois.
- Filtrage des entrées d’invite contre l’injection d’invite et le PII
- Validation de sortie contre des règles structurelles
- Un bac à sable pour l’exécution de shell, afin que l’agent ne puisse pas toucher le mauvais fichier
- Journaux d’audit de chaque invite, appel d’outil et réponse
- Intégration avec les agents de codage que nous utilisons déjà (Claude Code, Cursor, Cline)
- S’exécuter localement là où c’est possible, sans aucun service tiers ne voie chaque invite
Comparaison rapide
| App | Best for | Platforms | Free | Cost | Rating |
|---|---|---|---|---|---|
| Guardrails AI | Guardrails structurels et de contenu | Windows, macOS, Linux, Python | Yes | Free tier + paid Hub | 4.7 (GitHub) |
| NeMo Guardrails | Sécurité conversationnelle basée sur des règles | Windows, macOS, Linux | Yes | Free | 4.6 |
| Rebuff | Détection d’injection d’invite | Windows, macOS, Linux, cloud | Yes | Free tier | 4.5 |
| Docker Desktop | Bac à sable de conteneur pour agents | Windows, macOS, Linux | Yes | 9/user/mo Pro | 4.5 |
| gVisor | Bac à sable au niveau du noyau pour conteneurs | Linux, macOS Docker | Yes | Free | 4.4 |
| Firecracker | Micro-VM pour isolement léger | Linux | Yes | Free | 4.6 |
| LangKit | Métriques d’exécution pour les invites LLM | Windows, macOS, Linux | Yes | Free | 4.5 |
1. Guardrails AI, mieux pour les guardrails structurels et de contenu
Guardrails AI est une bibliothèque Python et un Hub qui enveloppe les appels de modèle dans des règles déclaratives. Dites « la sortie doit être du JSON valide avec ces champs », « la sortie ne doit pas contenir de PII », « la sortie ne doit pas inclure une commande shell », et la bibliothèque réécrit, réessaie ou refuse l’appel. Le Hub ajoute une place de marché de validateurs prédéfinis.
Où il est insuffisant : centré sur Python, il convient donc mieux aux frameworks d’agents qu’aux cas « je veux juste que Cursor se comporte ».
Tarification :
- Free : core library, Apache 2.0
- Paid : Hub Pro tier pour les validateurs partagés et l’application hébergée
Plateformes : Windows, macOS, Linux, Python
Download: Guardrails AI | GitHub
Bottom line: l’outil à choisir quand nous écrivons notre propre agent et voulons qu’il échoue bruyamment sur une mauvaise sortie.
2. NeMo Guardrails, mieux pour la sécurité conversationnelle basée sur des règles
NeMo Guardrails de NVIDIA nous permet de décrire des politiques dans un petit langage spécifique au domaine, Colang, puis enveloppe tout appel LLM. Une politique pourrait dire « si l’utilisateur demande à propos d’une invite système, refusez », ou « appelez toujours l’outil de récupération avant de répondre aux questions de domaine ». Colang s’exécute avant, pendant et après l’appel du modèle.
Où il est insuffisant : Colang est un langage à apprendre, et le runtime ajoute de la latence.
Tarification :
- Free : open source, Apache 2.0
- Paid : aucun, bien que des services NeMo Enterprise existent pour la pile de formation
Plateformes : Windows, macOS, Linux
Download: NeMo Guardrails
Bottom line: cela en vaut la peine pour la courbe d’apprentissage si l’agent est orienté vers l’utilisateur et les règles de politique doivent vivre en dehors de l’invite.
3. Rebuff, mieux pour la détection d’injection d’invite
Rebuff est une petite bibliothèque dédiée à un problème : attraper l’injection d’invite avant qu’elle atteigne le modèle. Il utilise des heuristiques, une BD vectorielle des chaînes d’attaque connues et une approche de jeton canari. Tout ce qui ressemble à une injection est marqué, et le code appelant décide quoi faire.
Où il est insuffisant : les heuristiques ont des faux positifs, et l’approche vectorielle nécessite une BD vectorielle en cours d’exécution.
Tarification :
- Free : open source, MIT
- Paid : cloud tier avec BD vectorielle hébergée et corpus d’attaque partagé
Plateformes : Python, JavaScript, cloud
Download: Rebuff
Bottom line: l’outil spécialisé. Branchez-le avant la bibliothèque guardrail à usage général.
4. Docker Desktop, mieux pour un bac à sable de conteneur familier
Docker Desktop est l’entrée la moins glamour de la liste et probablement la plus utile. Exécutez des agents de codage à l’intérieur d’un conteneur avec le repo monté en lecture-écriture et tout le reste en lecture seule, et même une invite hostile ne peut pas supprime la machine. Les volumes rendent les transferts vers l’hôte explicites.
Où il est insuffisant : l’application de bureau est lourd en RAM, et les licences ont changé deux fois en trois ans.
Tarification :
- Free : Personal et petites équipes (moins de 250 employés)
- Paid : 9/user/mo Pro, plus pour Team
Plateformes : Windows, macOS, Linux
Download: Docker Desktop
Bottom line: la réponse pratique à « comment puis-je permettre à Claude d’exécuter npm install sans lui donner accès à mon système de fichiers ».
5. gVisor, mieux pour un bac à sable au niveau du noyau
gVisor est un noyau en espace utilisateur écrit par Google. Les conteneurs s’exécutant sous gVisor ne peuvent faire qu’un sous-ensemble d’appels système, de sorte qu’une fuite de conteneur ne peut pas atteindre le noyau de l’hôte. C’est plus lourd qu’un conteneur normal mais beaucoup plus léger qu’une VM complète.
Où il est insuffisant : la surcharge de performance est réelle, et tous les charges de travail ne s’exécutent pas sous elle sans ajustements.
Tarification :
- Free : open source, Apache 2.0
- Paid : aucun
Plateformes : Linux, et Linux-inside-Docker sur macOS
Bottom line: la couche d’isolement plus profonde, pour les agents qui touchent au code d’étrangers.
6. Firecracker, mieux pour les micro-VM
Firecracker est un hyperviseur basé sur KVM pour les micro-VM. Les temps de démarrage sont inférieurs à une seconde, l’empreinte mémoire est mesurée en mégaoctets, et l’isolement est plus proche d’une VM complète que d’un conteneur. AWS Lambda s’exécute dessus. Localement, une Firecracker VM par exécution d’agent maintient le rayon de souffle de chaque travail contenu.
Où il est insuffisant : Linux uniquement, et la configuration n’est pas un exercice de cinq minutes.
Tarification :
- Free : open source, Apache 2.0
- Paid : aucun
Plateformes : Linux
Download: Firecracker | GitHub
Bottom line: l’option d’isolement local la plus forte en dehors d’une VM complète.
7. LangKit, mieux pour les métriques d’exécution et l’observabilité
LangKit de WhyLabs mesure chaque invite et réponse pour la text quality, la toxicité, le sentiment, la similitude avec les injections connues et le PII. Il s’insère avant tout appel LLM, et les tableaux de bord montrent les anomalies au fil du temps. L’idée n’est pas de bloquer, c’est de remarquer.
Où il est insuffisant : l’observabilité seule n’arrête pas une attaque, elle explique ce qui s’est passé après coup.
Tarification :
- Free : open source, Apache 2.0
- Paid : plateforme WhyLabs pour les tableaux de bord hébergés, à partir d’environ 200/mo
Plateformes : Windows, macOS, Linux
Download: LangKit
Bottom line: la couche « ce qui vient de se passer ». Associez-la à l’un des applicateurs ci-dessus.
Comment choisir le bon
- Pour réécrire ou refuser une mauvaise sortie de modèle : Guardrails AI.
- Pour les règles de politique en dehors de l’invite : NeMo Guardrails.
- Pour la détection d’injection d’invite spécifiquement : Rebuff.
- Pour le sandboxing de l’exécution de shell de manière pragmatique : Docker Desktop.
- Pour un isolement plus profond sur Linux : gVisor.
- Pour l’isolement des micro-VM : Firecracker.
- Pour mesurer ce que font les agents : LangKit.
- Pour l’audit au niveau invite : PromptLayer vaut le coup d’œil, il capture chaque requête et réponse avec des métadonnées.
Une configuration de bureau défendable empile généralement trois de ceux-ci : un bac à sable (Docker Desktop), une couche guardrail (Guardrails AI ou NeMo), et observabilité (LangKit ou PromptLayer).
FAQ
Ai-je vraiment besoin de bac à sable pour les agents de codage ?
Si l’agent exécute des commandes shell ou écrit des fichiers, oui. S’il ne fait que discuter, non. La limite est si l’injection d’invite peut se transformer en action.
Quel est le premier pas le plus facile ?
Docker Desktop avec un conteneur verrouillé pour l’agent de codage. Ajoutez Guardrails AI à l’appel du modèle. Cela bloque déjà la plupart des dégâts accidentels.
Ces outils peuvent-ils protéger le modèle contre les attaques de style Astra ?
Contre les attaques directes du modèle, non. Rien dans cette liste ne change les poids du modèle. Contre l’injection d’invite, la fuite de PII et les appels d’outils non sécurisés, oui.
Les free tier sont-ils suffisants ?
Pour un seul développeur, oui. Guardrails AI, NeMo Guardrails, Rebuff, gVisor, Firecracker, LangKit et PromptLayer ont tous de vrais free tier. Seul Docker Desktop commence à facturer au-delà des très petites équipes.
Cela ralentit l’agent ?
Les guardrails ajoutent de la latence, parfois des centaines de millisecondes. Les bacs à sable ajoutent une latence négligeable pour les conteneurs et un peu plus pour les micro-VM. Échangez la latence pour la sécurité, toujours.