Naissance de Jarvis – Mon assistant numérique

Si vous avez lu mon dernier article sur Openclaw, vous avez constaté qu’il est entré dans ma vie de façon assez rapide tout en prenant beaucoup de place =) Un des défis de travailler avec les agents, c’est d’utiliser les bons LLMs et aussi d’optimiser leur travail en fonction de leur charge. Mettre 100% du travail des agents sur un modèle payant, c’est de l’argent gaspillé, surtout que le prix par token dernièrement est parti vers la lune !

Mes clients aussi ont et auront ce défi de taille. Ce qui m’a donné l’idée de me monter une machine capable de rouler des LLMs en locale offrant une expérience plaisante qui se rapproche de ce qu’on retrouve en ligne, et ça, sans que ça me coûte les yeux de la tête en matériel.

LE MATÉRIEL

J’ai beaucoup lu sur ce sujet. Certes, qui dit LLM performant dit cartes graphiques puissantes, mais les LLMs locaux deviennent de plus en plus efficaces tout en requérant moins de puissance. Mon choix s’est arrêté sur le dernier mini PC de la compagnie Minisforum, le AI X1 Pro-470.

Le Minisforum AI X1 Pro-470 est construit pour l’IA locale grâce à son processeur AMD Ryzen AI 9 HX 470, qui intègre un NPU. Ce processeur intègre nativement l’architecture AMD XDNA, qui dédie une partie de sa puce exclusivement à l’accélération matérielle des charges de travail liées à l’intelligence artificielle. Il délivre une puissance totale de 86 TOPS (dont 55 TOPS dédiés uniquement au NPU). Cette architecture permet de faire tourner des modèles de langage (LLM) directement sur l’appareil sans latence. Sa force réside aussi dans sa flexibilité : avec un support allant jusqu’à 128 Go de RAM DDR5 et un port OCuLink pour brancher une carte graphique externe (eGPU), il est compact, silencieux et ne consomme pas beaucoup d’énergie.

Voici quelques photos :

Qu’est ce que le NPU ?

Le NPU (Neural Processing Unit) est un processeur spécialisé conçu pour accélérer les calculs mathématiques propres à l’intelligence artificielle, comme le traitement du langage ou la reconnaissance d’images, tout en consommant beaucoup moins d’énergie qu’un processeur classique (CPU)

Carte graphique

Le AI X1 Pro-470 est équipé de la AMD Radeon 890M, qui est actuellement l’une des cartes graphiques intégrées (iGPU) les plus puissantes du marché.

  • Architecture RDNA 3.5 : Elle dispose de 16 unités de calcul (Compute Units).
  • Performance brute : fréquence pouvant atteindre 2900 MHz
  • Encodage de pointe : Elle supporte nativement le codec AV1
  • Évolutivité (Le point fort) : Si la puissance intégrée ne suffit plus pour des projets d’IA massive, le port OCuLink du boîtier permet de connecter une carte graphique externe (eGPU)
  • Mémoire : 2 x 16 GB DDR5600 (ouf la mémoire est chere c’est temps ci ! ). Deux barettes de mémoire (plustot qu’une) est aussi important pour aider le travailler de transfère de la mémoire.
  • Disque dur : 1 x 1TB NVME M2

LES LOGICIELS

Plusieurs options possibles.

LogicielÉtat du support NPU (XDNA)Recommandation
OllamaPartiel / Via ROCm (GPU)Idéal pour la vitesse.
LM StudioSupporté via ONNXIdéal pour l’experience utilisateur.
AMD Razen AI NatifPour les développeurs.

Je commence les essais avec Ollama. Je l’installe

Pour confirmer que la carte graphique est bien utilisée, je prends l’outil nvtop, conçu pour Nvidia, qui fonctionne aussi avec les GPU AMD.

À la question : Parle-moi de la ville de Québec

Avec Llama 3.1, j’obtiens 16,36 tokens/s, comparativement à 11,39 tokens/s sur mon ordinateur portable (équipé d’un processeur AMD Ryzen Pro 7). Il y a sûrement moyen d’optimiser ces performances. À titre de comparaison, un être humain lit à une vitesse d’environ 3 tokens/s

TESTS, OPTIMISATION ET PERFORMANCE

Voici quelques tests de performance et des ajustements de configuration réalisés afin d’optimiser les capacités de calcul de ma station de travail dédiée à l’IA locale.

Optimisations matérielles et système

Pour maximiser les performances, j’ai effectué deux interventions clés :

  • Configuration BIOS (UMA) : Passage du mode par défaut à UMA_specified, avec une allocation VRAM augmentée de 2 Go à 16 Go (puis testée à 24 Go).
    Chemin : Advanced → AMD CBS → NBIO Common Options → GFX Configuration → UMA_specified
  • Gestion de l’alimentation : Modification des paramètres sous GNOME, en passant du profil « Équilibré » au mode « Performances ».

Résultats des Benchmarks (tokens/s)

Configuration : 16 Go de VRAM allouée

Modèle Moteur Performance (tokens/s)
llama3.1:8bOllama17.21
llama3.1:8b-instruct-q2_KOllama24.00
Qwen 2.5:14bOllama8.31
llama3.1:8bLM Studio16.62
gemma-4-e4bLM Studio23.30
gemma-4-26b-A4BLM Studio21.27
qwen3.6-35b-a3bLM Studio14.71

Configuration : 24 Go de VRAM allouée

Modèle Moteur Performance (tokens/s)
gemma-4-26b-A4B LM Studio 21.00

Analyse

Le passage de 16 à 24 Go de VRAM ne semble pas modifier la vitesse brute de génération (tokens/s). En revanche, cet ajustement permet désormais de charger des modèles plus volumineux et complexes.

INTÉGRATION AVEC OPENCLAW

Là, ça se corse, car OpenClaw demande un contexte de 32K au minimum. Comme le contexte est transféré à chaque requête, cela demande davantage de ressources et de temps. Je ne pourrai donc pas utiliser les modèles mentionnés plus haut ; je dois en trouver un plus léger. Mon objectif est de confier à ce LLM la gestion des tâches cron et de requêtes relativement simples.

Laisser un commentaire

Votre adresse courriel ne sera pas publiée. Les champs obligatoires sont indiqués avec *