Applications de benchmarking GPU AI local pour desktop

Le rapport de XDA selon lequel un GPU de milieu de gamme peut financer une pile d’abonnements IA payants est juste. Une RTX 4070 Ti ou une Radeon RX 7900 XT exécute les modèles 13B et 34B à une vitesse qui dépasse ce que la plupart des services cloud facturent pour un seul niveau d’abonnement. Mais choisir quel modèle, quantification et runtime utiliser sur le matériel que vous possédez déjà nécessite des chiffres réels, pas des suppositions.

Les sept applications ci-dessous couvrent deux types de benchmarking. Les trois premiers sont des benchmarks intégrés au runtime qui rapportent les jetons par seconde et le temps jusqu’au premier jeton pour les charges de travail réelles. Le reste sont des suites de benchmarks tierces qui donnent des scores reproductibles pour comparer le matériel. Chaque choix s’exécute sur Windows et Linux; deux fonctionnent aussi sur macOS avec Apple Silicon.

Ce qu’il faut rechercher dans un benchmark GPU AI

Tous les benchmarks d’IA ne vous disent pas ce que vous devez savoir. Vérifiez ces cinq points:

Tout ce qui rapporte seulement un seul nombre de débit dans un contexte n’est pas utile pour le dimensionnement réel du matériel.

Comparaison rapide

Application Meilleur pour Plan gratuit Prix de départ Caractéristique remarquable
llama-bench Débit LLM reproductible Oui Gratuit Inclus avec llama.cpp
LM Studio Benchmarks GUI + shopping de modèles Oui Gratuit Catalogue de modèles intégré
Ollama benchmark Test de stress LLM d’une commande Oui Gratuit Fonctionne avec n’importe quel modèle tiré
UL Procyon AI Benchmark fournisseur standard du secteur Essai Licence payante Chemins ONNX + DirectML
Geekbench AI Score IA multiplateforme Oui Niveau gratuit iOS, Android, Windows, macOS
MLPerf Client Benchmark de référence de MLCommons Oui Gratuit Profilage matériel approfondi
koboldcpp benchmark Simulation de charge de travail roleplay/chat Oui Gratuit Simule réalistiquement les sessions de chat

Les applications

1. llama-bench – Meilleur débit LLM reproductible

llama-bench est livré dans le cadre de llama.cpp et est la chose la plus proche du monde LLM local d’une règle standard. Pointez-le sur un fichier GGUF, dites-lui une taille de contexte et une taille de lot, et il rapporte les jetons prompt par seconde, les jetons de génération par seconde et le temps jusqu’au premier jeton. Il s’exécute sur n’importe quel backend CUDA, ROCm, Metal ou CPU, donc un seul outil donne des chiffres comparables sur votre rig Nvidia, build Radeon et MacBook.

Où il s’effondre: Ligne de commande uniquement. Pas de GUI. Certaines options (BLAS, taille de lot) nécessitent de lire la documentation.

Tarification:

Plateformes: Windows, macOS, Linux.

Télécharger: llama.cpp sur GitHub

Conclusion: Le benchmark par défaut lors de la comparaison des quantifications ou des modèles. Apprenez ses drapeaux une fois.

2. LM Studio – Meilleur benchmark GUI avec shopping de modèles

LM Studio est une application de bureau qui enveloppe llama.cpp avec une interface graphique pour télécharger, exécuter et maintenant faire des benchmarks de modèles. L’onglet benchmark intégré teste n’importe quel modèle téléchargé dans toute charge de travail prédéfinie et rapporte des métriques d’une manière que les non-experts peuvent lire. Il affiche aussi l’espace de tête VRAM restant, ce qui aide à dimensionner le prochain modèle.

Où il s’effondre: Source fermée. Le catalogue de modèles chevauche HuggingFace et n’est pas exhaustif.

Tarification:

Plateformes: Windows, macOS (Apple Silicon), Linux.

Télécharger: LM Studio

Conclusion: La façon la plus conviviale de faire un benchmark d’un modèle frais sans toucher un terminal.

3. Ollama benchmark – Meilleur test de stress LLM d’une commande

Ollama est livré avec un flag run --verbose qui produit des chronométrages par jeton. Combiné avec des scripts maintenus par la communauté, il fonctionne comme un outil de benchmark. Parce qu’Ollama extrait des modèles par nom, l’exécution du même benchmark sur une deuxième machine prend deux commandes.

Où il s’effondre: Pas une suite de benchmark complète. Focalisé sur la vitesse d’achèvement; moins utile pour les charges de travail avec de nombreux prompts.

Tarification:

Plateformes: Windows, macOS, Linux.

Télécharger: Ollama

Conclusion: Installez Ollama pour une utilisation quotidienne des modèles; utilisez --verbose lorsque vous voulez une lecture de débit rapide.

4. UL Procyon AI – Meilleur benchmark fournisseur standard du secteur

UL Procyon AI Computer Vision Benchmark est le même UL qui publie 3DMark et PCMark. Il exécute les modèles ONNX standard (MobileNet, ResNet, Inception) sur les backends TensorRT, DirectML, OpenVINO et CoreML et produit un score. Les fournisseurs citent les chiffres Procyon dans les critiques, donc le score est directement comparable dans toute l’industrie.

Où il s’effondre: Focalisé sur les charges de travail de vision; moins utile pour le débit LLM. Licence payante pour usage commercial.

Tarification:

Plateformes: Windows.

Télécharger: UL Procyon AI

Conclusion: Achetez ceci si vous prenez des décisions d’achat en utilisant les benchmarks des fournisseurs. Passez si vous ne vous souciez que de la vitesse LLM.

5. Geekbench AI – Meilleur score IA multiplateforme

Geekbench AI produit trois chiffres par run: FP32, FP16 et INT8 quantifié. Il s’exécute sur Windows, macOS, Linux, iOS et Android, donc une comparaison ordinateur portable-vs-téléphone pour la même charge de travail est à un benchmark de distance. La base de données de résultats publics vous permet de comparer votre run avec des milliers d’autres.

Où il s’effondre: Non spécifique à LLM. Les trois scores s’effondrent avec beaucoup de nuances.

Tarification:

Plateformes: Windows, macOS, Linux, iOS, Android.

Télécharger: Geekbench AI

Conclusion: Le chiffre incontournable pour “comment mon matériel capable d’IA se compare”.

6. MLPerf Client – Meilleur benchmark de référence de MLCommons

MLPerf Client est le benchmark de référence soutenu par MLCommons pour l’IA sur matériel client. Il exécute une charge de travail LLM prédéfinie (actuellement Llama 2 7B, passant à des modèles plus récents) et rapporte la latence, le débit et la régression de qualité par rapport à une implémentation de référence. Parce que MLCommons publie les résultats de manière transparente, la comparaison des configurations est simple.

Où il s’effondre: La configuration est plus impliquée que les alternatives. Pas destiné aux utilisateurs finaux.

Tarification:

Plateformes: Windows, Linux (natif), macOS (builds communautaires).

Télécharger: MLPerf Client sur GitHub

Conclusion: Le benchmark faisant autorité. Cela vaut le coût de la mise en place si vous prévoyez de publier une comparaison matérielle.

7. koboldcpp benchmark – Meilleure simulation de charge de travail roleplay et chat

koboldcpp est un fork de llama.cpp focalisé sur roleplay et chat de contexte long. Son mode benchmark simule une session de chat réelle avec contexte déroulant, ce qui est un test plus honnête de ce qu’un serveur LLM domestique ressentira jour après jour. Les chiffres incluent le coût d’échange de contexte et le comportement de débordement RAM système, que llama-bench omet.

Où il s’effondre: Focalisé sur les charges de travail chat/RP; manque les métriques centrées sur le code. L’interface semble occupée au premier abord.

Tarification:

Plateformes: Windows, macOS, Linux.

Télécharger: koboldcpp sur GitHub

Conclusion: Le benchmark le plus représentatif pour quiconque dont le cas d’usage réel est le chat, pas la complétion de code.

Comment choisir le bon

Commencez par llama-bench pour des chiffres reproductibles à travers les quantifications. Ajoutez l’onglet benchmark intégré de LM Studio si vous préférez une GUI. Utilisez le flag verbose d’Ollama pour une vérification d’intégrité rapide sur une machine où vous exécutez déjà des modèles. Ajoutez Geekbench AI lorsque vous avez besoin d’un score portable unique. Conservez UL Procyon ou MLPerf Client pour les comparaisons matérielles formelles où la légitimité tierce compte. Utilisez le benchmark koboldcpp lorsque votre charge de travail quotidienne est le chat plutôt que la complétion de code.

Passez les fiches “AI TOPS” du fournisseur en substitution; les chiffres sont pic-théoriques et reflètent rarement le débit d’inférence réel sur les quantifications que vous utilisez.

FAQ

Quel GPU offre la meilleure vitesse LLM local aujourd’hui? Pour les cartes grand public, RTX 4090, 4080 Super et 5080 mènent chez Nvidia; RX 7900 XTX mène chez AMD. Apple M3 Max et M4 Max comblent l’écart pour les modèles qui s’adaptent à la mémoire unifiée.

Combien de jetons par seconde ai-je vraiment besoin? Le chat en temps réel se sent bien au-dessus de 20 t/s sur la sortie du modèle. N’importe quoi au-dessus de 40 t/s est indiscernable d’une API SaaS rapide.

Plus de VRAM aide-t-il ou le calcul gagne-t-il? Pour les LLM, VRAM est la contrainte la plus difficile. L’ajustement du modèle complet dans VRAM sans débordement en RAM système est plus important que le calcul pur au-dessus d’un seuil.

Un benchmark sous Windows est-il comparable à un sous Linux? Pour les tests basés sur CUDA, en grande partie oui. Les différences de pilote ajoutent quelques points de pourcentage de variance. Pour DirectML vs ROCm la différence est beaucoup plus grande et les chiffres Linux sont généralement plus élevés.

Quelle est l’option de benchmark la moins chère? llama-bench et Ollama coûtent tous deux rien. Les deux s’exécutent sur n’importe quel GPU grand public.

Cela m’aide-t-il à choisir entre LM Studio et Ollama? Oui. Mesurez le même modèle dans les deux et comparez les jetons par seconde et la vitesse de traitement des prompts. Ollama tend à gagner sur la vitesse d’échange de modèles; la GUI de LM Studio aide pour les expériences.