Si vous avez lu mon dernier article sur Openclaw, vous avez constaté qu’il est entré dans ma vie de façon assez rapide tout en prenant beaucoup de place =) Un des défis de travailler avec les agents, c’est d’utiliser les bons LLMs et aussi d’optimiser leur travail en fonction de leur charge. Mettre 100% du travail des agents sur un modèle payant, c’est de l’argent gaspillé, surtout que le prix par token dernièrement est parti vers la lune !
Mes clients aussi ont et auront ce défi de taille. Ce qui m’a donné l’idée de me monter une machine capable de rouler des LLMs en locale offrant une expérience plaisante qui se rapproche de ce qu’on retrouve en ligne, et ça, sans que ça me coûte les yeux de la tête en matériel.
**** L’article va être mis à jour au fur et à mesure que je progresse dans mes tests et mes recherches. *****
LE MATÉRIEL
J’ai beaucoup lu sur ce sujet. Certes, qui dit LLM performant dit cartes graphiques puissantes, mais les LLMs locaux deviennent de plus en plus efficaces tout en requérant moins de puissance. Mon choix s’est arrêté sur le dernier mini PC de la compagnie Minisforum, le AI X1 Pro-470.
Le Minisforum AI X1 Pro-470 est construit pour l’IA locale grâce à son processeur AMD Ryzen AI 9 HX 470, qui intègre un NPU. Ce processeur intègre nativement l’architecture AMD XDNA, qui dédie une partie de sa puce exclusivement à l’accélération matérielle des charges de travail liées à l’intelligence artificielle. Il délivre une puissance totale de 86 TOPS (dont 55 TOPS dédiés uniquement au NPU). Cette architecture permet de faire tourner des modèles de langage (LLM) directement sur l’appareil sans latence. Sa force réside aussi dans sa flexibilité : avec un support allant jusqu’à 128 Go de RAM DDR5 et un port OCuLink pour brancher une carte graphique externe (eGPU), il est compact, silencieux et ne consomme pas beaucoup d’énergie.
Voici quelques photos :





Qu’est ce que le NPU ?
Le NPU (Neural Processing Unit) est un processeur spécialisé conçu pour accélérer les calculs mathématiques propres à l’intelligence artificielle, comme le traitement du langage ou la reconnaissance d’images, tout en consommant beaucoup moins d’énergie qu’un processeur classique (CPU)
Carte graphique
Le AI X1 Pro-470 est équipé de la AMD Radeon 890M, qui est actuellement l’une des cartes graphiques intégrées (iGPU) les plus puissantes du marché.
- Architecture RDNA 3.5 : Elle dispose de 16 unités de calcul (Compute Units).
- Performance brute : fréquence pouvant atteindre 2900 MHz
- Encodage de pointe : Elle supporte nativement le codec AV1
- Évolutivité (Le point fort) : Si la puissance intégrée ne suffit plus pour des projets d’IA massive, le port OCuLink du boîtier permet de connecter une carte graphique externe (eGPU)
- Mémoire : 2 x 16 GB DDR5600 (ouf la mémoire est chere c’est temps ci ! ). Deux barettes de mémoire (plustot qu’une) est aussi important pour aider le travailler de transfère de la mémoire.
- Disque dur : 1 x 1TB NVME M2
LES LOGICIELS
Plusieurs options possibles.
| Logiciel | État du support NPU (XDNA) | Recommandation |
| Ollama | Partiel / Via ROCm (GPU) | Idéal pour la vitesse. |
| LM Studio | Supporté via ONNX | Idéal pour l’experience utilisateur. |
| AMD Razen AI | Natif | Pour les développeurs. |
Je commence les essais avec Ollama. Je l’installe
curl -fsSL https://ollama.com/install.sh | sh
Install complete. Run "ollama" from the command line.
AMD GPU ready
ollama run llama3.1 --verbose
Pour confirmer que la carte graphique est bien utilisée, je prends l’outil nvtop, conçu pour Nvidia, qui fonctionne aussi avec les GPU AMD.
dnf install nvtop
nvtop
À la question : Parle-moi de la ville de Québec

Avec Llama 3.1, j’obtiens 16,36 tokens/s, comparativement à 11,39 tokens/s sur mon ordinateur portable (équipé d’un processeur AMD Ryzen Pro 7). Il y a sûrement moyen d’optimiser ces performances. À titre de comparaison, un être humain lit à une vitesse d’environ 3 tokens/s
TESTS, OPTIMISATION ET PERFORMANCE
Voici quelques tests de performance et des ajustements de configuration réalisés afin d’optimiser les capacités de calcul de ma station de travail dédiée à l’IA locale.
Optimisations matérielles et système
Pour maximiser les performances, j’ai effectué deux interventions clés :
- Configuration BIOS (UMA) : Passage du mode par défaut à UMA_specified, avec une allocation VRAM augmentée de 2 Go à 16 Go (puis testée à 24 Go).
Chemin : Advanced → AMD CBS → NBIO Common Options → GFX Configuration → UMA_specified - Gestion de l’alimentation : Modification des paramètres sous GNOME, en passant du profil « Équilibré » au mode « Performances ».
Résultats des Benchmarks (tokens/s)
Configuration : 16 Go de VRAM allouée
| Modèle | Moteur | Performance (tokens/s) |
|---|---|---|
| llama3.1:8b | Ollama | 17.21 |
| llama3.1:8b-instruct-q2_K | Ollama | 24.00 |
| Qwen 2.5:14b | Ollama | 8.31 |
| llama3.1:8b | LM Studio | 16.62 |
| gemma-4-e4b | LM Studio | 23.30 |
| gemma-4-26b-A4B | LM Studio | 21.27 |
| qwen3.6-35b-a3b | LM Studio | 14.71 |
Configuration : 24 Go de VRAM allouée
| Modèle | Moteur | Performance (tokens/s) |
|---|---|---|
| gemma-4-26b-A4B | LM Studio | 21.00 |
Analyse
Le passage de 16 à 24 Go de VRAM ne semble pas modifier la vitesse brute de génération (tokens/s). En revanche, cet ajustement permet désormais de charger des modèles plus volumineux et complexes.
INTÉGRATION AVEC OPENCLAW
Là, ça se corse, car OpenClaw demande un contexte de 32K au minimum. Comme le contexte est transféré à chaque requête, cela demande davantage de ressources et de temps. Je ne pourrai donc pas utiliser les modèles mentionnés plus haut ; je dois en trouver un plus léger. Mon objectif est de confier à ce LLM la gestion des tâches cron et de requêtes relativement simples.
À SUIVRE …
