ECI-SRV-13
Infrastructure pour l’IA — dimensionnement GPU
Faire tourner un modèle d’intelligence artificielle en interne pose d’abord une question de dimensionnement : quelle VRAM, quelle bande passante mémoire, quelle densité électrique par baie. Nous accompagnons le choix de l’infrastructure GPU, sur site ou hébergée, et sa mise en œuvre en environnement virtualisé.
Périmètre d’intervention
- Cadrage de la charge : taille des modèles visés, volumétrie de requêtes, latence attendue.
- Dimensionnement de la VRAM et de la bande passante mémoire nécessaires à l’inférence.
- Choix entre plusieurs cartes sur un même serveur ou plusieurs serveurs reliés.
- Densité électrique et refroidissement par baie, dimensionnés pour la charge GPU.
- Virtualisation des accélérateurs par passthrough ou par vGPU, selon la plateforme cible.
Livrables
- Note de dimensionnement : VRAM requise, nombre de cartes, contraintes réseau et électriques.
- Architecture cible documentée, incluant le choix de virtualisation des accélérateurs.
- Plateforme d’inférence déployée et validée sur un jeu de modèles représentatif.
- Documentation d’exploitation et procédure de mise à l’échelle.
Technologies
- Passthrough PCIe et vGPU sur Proxmox VE, Red Hat OpenStack et OpenShift Virtualization.
- Bibliothèques d’inférence courantes : vLLM, TensorRT, formats de quantisation usuels.
- Réseaux dédiés haut débit pour les configurations multi-cartes et multi-nœuds.
Modalités
De cinq à vingt jours selon que la mission couvre le seul dimensionnement ou la mise en œuvre complète, au forfait après cadrage.
Nous dimensionnons et déployons l’infrastructure ; le choix et l’entraînement des modèles restent de la responsabilité de vos équipes ou de l’éditeur de la solution utilisée.
Déroulé de la prestation
Phase 1 — Cadrage de la charge
- Modèles envisagés, taille en paramètres, format de quantisation prévu.
- Débit attendu et contraintes de latence.
Phase 2 — Dimensionnement
- Calcul de la VRAM requise et du nombre de cartes ou de serveurs nécessaires.
- Choix du mode de virtualisation des accélérateurs et de la plateforme hôte.
Phase 3 — Mise en œuvre
- Installation et configuration de la plateforme, câblage et refroidissement de la baie.
- Déploiement de la chaîne d’inférence et tests de charge sur les modèles cibles.
Phase 4 — Transfert
- Documentation de l’architecture et des procédures de mise à l’échelle.
- Formation des équipes à l’exploitation courante de la plateforme.
Ce que comprend chaque prestation
- Un devis détaillé, établi après cadrage
- Un chef de projet identifié
- La documentation d’exploitation livrée
- Le transfert de compétences à vos équipes
- Une intervention sur site ou à distance
- Un support après la mise en production
Aucune intervention en production sans plan de retour arrière écrit.
Demander un cadrage
Ou contactez-nous directement :
Parlons de votre contexte
Toute prestation fait l’objet d’un cadrage préalable et d’un devis détaillé.
Prendre rendez-vous