- À retenir
- Comment concevoir une architecture d’IA d’entreprise
- Pourquoi faire évoluer l’IA ne consiste pas seulement à ajouter des GPU
- Comment les serveurs, le stockage et le réseau collaborent dans une infrastructure d’IA
- Qu’est-ce qu’une usine d’IA ?
- Quelles sont les causes des goulets d’étranglement dans l’infrastructure d’IA d’entreprise ?
- Exigences d’infrastructure pour l’entraînement, l’inférence et la génération augmentée par récupération
- Élaborer une stratégie d’infrastructure native pour l’IA
- Comment les entreprises évitent les goulets d’étranglement de l’infrastructure d’IA à grande échelle
- FAQ
À retenir
- Une infrastructure d’IA évolutive repose sur un équilibre entre calcul, stockage, réseau et logiciels de gestion.
- Les GPU sont essentiels, mais le débit du stockage, la bande passante du réseau et l’accès aux données peuvent également limiter les performances de l’IA.
- L’entraînement de l’IA, l’inférence de l’IA et la génération augmentée par récupération imposent chacun des exigences différentes à l’infrastructure.
- Les goulets d’étranglement apparaissent souvent lorsqu’une couche de l’infrastructure évolue plus vite que les autres.
Faire évoluer l’IA nécessite davantage que l’ajout de GPU. À mesure que les organisations passent des projets pilotes à la production, nombre d’entre elles repensent également le lieu d’exécution de l’IA. Pour les entreprises, les administrations et les secteurs réglementés, cela signifie de plus en plus construire sur site afin de prendre en charge l’IA souveraine: conserver les modèles, les données et l’inférence à l’intérieur de leurs propres frontières, réseaux et plans de contrôle afin de renforcer la résidence des données, la protection de la propriété intellectuelle, le contrôle réglementaire et la résilience opérationnelle.
Le défi consiste à transformer ce contrôle en un environnement évolutif et prêt pour la production. Dell Technologies indique que 93 % des organisations rencontrent des difficultés lorsqu’elles intègrent l’IA ou l’IA générative à leurs stratégies métier, ce qui fait de l’alignement de l’infrastructure une étape essentielle. Pour évoluer efficacement, les organisations ont besoin de serveurs, de stockage, de réseau, d’accès aux données et d’outils de gestion capables de fonctionner ensemble pour l’entraînement, l’inférence et la génération augmentée par récupération, y compris des architectures qui rapprochent les données d’entreprise gouvernées du calcul accéléré afin que les GPU n’attendent pas des pipelines de données distants ou fragmentés.
Comment concevoir une architecture d’IA d’entreprise
L’architecture d’IA d’entreprise doit être conçue pour absorber les exigences variées de l’entraînement, de l’inférence, de l’affinage et de la génération augmentée par récupération, sans imposer une refonte à chaque nouveau cas d’usage. Chaque charge de travail sollicite différemment le calcul, le stockage, le réseau, la sécurité et la gestion. L’architecture doit donc tenir compte de l’emplacement des données, de leur circulation et du niveau de bande passante réellement requis par la fabrique de GPU.
Une architecture d’IA d’entreprise évolutive associe serveurs accélérés, stockage hautes performances, réseau adapté, accès sécurisé aux données, outils d’orchestration et modèles de déploiement validés au sein d’une conception reproductible. Cette base aide les équipes à ajouter de la capacité pour la prochaine charge de travail sans devoir repenser l’architecture de la précédente.
Pourquoi faire évoluer l’IA ne consiste pas seulement à ajouter des GPU
Faire évoluer l’IA ne consiste pas seulement à ajouter des GPU, car les performances dépendent de la qualité de la collaboration entre le calcul, le réseau, le stockage et les logiciels. Les GPU peuvent accélérer l’entraînement et l’inférence, mais ils peuvent aussi devenir du silicium coûteux laissé à l’arrêt lorsque des pipelines de données lents, des réseaux encombrés ou des écritures de points de contrôle empêchent le reste de l’infrastructure de suivre.
Il en résulte une utilisation moindre, des tâches d’entraînement plus longues, une latence de bout en bout plus élevée pour l’inférence et un coût croissant par jeton ou par requête. Ajouter des accélérateurs à une architecture déséquilibrée ne fait que multiplier le problème. Pour évoluer efficacement, les organisations doivent faire progresser de concert le débit du stockage, la bande passante du réseau, le déplacement des données et l’orchestration avec la capacité GPU.
NVIDIA formalise ces principes de conception au moyen de ses architectures de référence d’entreprise (ERA): des modèles validés pour les grappes de calcul accéléré qui précisent les ratios de calcul, de stockage et de réseau nécessaires pour éviter les goulets d’étranglement et maintenir l’utilisation des GPU. Les ERA couvrent à la fois les conceptions scale-up, notamment les GPU connectés par NVLink au sein d’un nœud ou d’une baie, et les conceptions scale-out, notamment les réseaux Ethernet ou InfiniBand à bande passante élevée et faible latence entre les nœuds.
Les ERA de NVIDIA fournissent aux équipes un modèle reproductible pour coordonner le calcul, le stockage, le réseau et les logiciels d’IA, plutôt que de dimensionner chaque couche séparément. Cela peut réduire les incertitudes liées à l’intégration lorsque les organisations passent de configurations pilotes à une infrastructure reproductible et évolutive.
Pour une infrastructure d’IA évolutive, l’ajout de capacité GPU n’est utile que si l’architecture environnante peut suivre. Les serveurs, le stockage, le réseau et l’orchestration doivent être planifiés comme un seul système afin que les données circulent efficacement, que les GPU restent utilisés et que l’ajout de capacité améliore les performances au lieu de révéler le prochain goulet d’étranglement.
Comment les serveurs, le stockage et le réseau collaborent dans une infrastructure d’IA
Les serveurs, le stockage et le réseau influent sur les performances de l’IA en contrôlant la vitesse à laquelle les données circulent dans l’environnement. Les serveurs fournissent le calcul accéléré nécessaire à l’entraînement, à l’affinage et à l’inférence, tandis que le stockage fournit les jeux de données, les points de contrôle, les représentations vectorielles et les résultats dont ces charges de travail dépendent.
Le réseau relie les couches de l’infrastructure, mais les grappes d’IA dépendent de deux schémas de trafic différents. Le trafic nord-sud transporte les données entre les utilisateurs, les applications, les systèmes de stockage et la grappe, tandis que le trafic est-ouest transporte les données entre les GPU et les nœuds au sein de la grappe. À mesure que les charges de travail évoluent, les communications GPU à GPU est-ouest deviennent souvent le principal goulet d’étranglement.
Les interconnexions à bande passante élevée et faible latence sont donc essentielles. Si la fabrique de GPU est sous-dimensionnée ou saturée, les accélérateurs peuvent rester inactifs en attendant les communications lors de l’entraînement ou de l’inférence de grands modèles. Ajouter des GPU ne peut pas corriger ce déséquilibre si le réseau ne peut pas les faire travailler efficacement ensemble.
Le tableau ci-dessous montre comment chaque couche de l’infrastructure évolue lorsque les organisations passent de charges de travail d’entreprise standard à l’entraînement, l’inférence et la génération augmentée par récupération.
Domaine de l’infrastructure | Infrastructure d’entreprise traditionnelle | Infrastructure d’IA évolutive |
Serveurs | Systèmes centrés sur le CPU pour les applications métier | Serveurs accélérés pour l’entraînement, l’inférence et l’affinage de l’IA |
Stockage | Stockage axé sur la capacité pour les enregistrements et les applications | Stockage hautes performances pour les jeux de données, les représentations vectorielles, les points de contrôle et les résultats |
Réseau | Connectivité généraliste | Réseau à bande passante élevée et faible latence pour les charges de travail d’IA distribuées |
Opérations | Gestion en silos de l’infrastructure | Gestion coordonnée du calcul, du stockage, du réseau et des logiciels d’IA |
Qu’est-ce qu’une usine d’IA ?
La Dell AI Factory with NVIDIA est un environnement complet co-conçu, destiné à transformer les données d’entreprise en résultats d’IA à grande échelle. Il prend en charge tout le cycle de vie de l’IA, notamment la préparation des données, l’entraînement des modèles, l’affinage, l’inférence, la récupération, la supervision et l’amélioration continue.
Contrairement à un centre de données traditionnel, généralement optimisé pour la disponibilité des applications et le calcul généraliste, Dell AI Factory with NVIDIA est conçu pour l’intensité des charges de travail exigée par l’IA. Il réunit calcul accéléré, stockage à haut débit, fabriques de GPU à faible latence, accès gouverné aux données et gestion coordonnée au sein de blocs modulaires validés, plutôt que de laisser les équipes assembler une intégration personnalisée.
Dell Technologies est un exemple de fournisseur qui construit son infrastructure d’IA d’entreprise et son approche de plateforme de données autour d’architectures de référence validées par NVIDIA, en utilisant ces conceptions pour coordonner les couches d’infrastructure nécessaires à l’IA en production.
Les recommandations ERA de NVIDIA fournissent un point de référence sur la manière dont ces couches s’imbriquent. Dell AI Factory with NVIDIA associe les serveurs Dell PowerEdge, le stockage PowerScale, le réseau PowerSwitch et la Dell AI Data Platform à NVIDIA AI Enterprise, aux microservices NVIDIA NIM et à la fabrique Ethernet haut débit NVIDIA Spectrum-X. En validant la pile dans son ensemble, Dell et NVIDIA fournissent aux entreprises une architecture reproductible qu’elles peuvent faire évoluer pour l’entraînement, l’inférence, la génération augmentée par récupération et les futures charges de travail d’IA, sans devoir repenser l’environnement pour chaque nouveau cas d’usage.
Quelles sont les causes des goulets d’étranglement dans l’infrastructure d’IA d’entreprise ?
Les goulets d’étranglement de l’infrastructure d’IA d’entreprise apparaissent lorsque le calcul, le stockage, le réseau ou les pipelines de données évoluent de manière inégale. Un débit de stockage insuffisant pour les GPU ajoutés, un réseau inadéquat pour les charges de travail d’IA distribuées ou un accès lent aux données d’entreprise pour la génération augmentée par récupération peuvent tous ralentir les performances.
Les points de tension courants incluent :
- Des GPU qui attendent des pipelines de données lents
- Des systèmes de stockage incapables de prendre en charge les charges de travail d’entraînement ou de récupération
- La latence du réseau entre les nœuds de calcul distribués
- Un mauvais placement des charges de travail sur l’infrastructure disponible
- Des systèmes de génération augmentée par récupération incapables de récupérer assez rapidement les données d’entreprise
Les problèmes de performances apparaissent généralement lorsque les données ne peuvent pas circuler assez vite entre les couches de calcul, de stockage et de réseau. Dans les grappes d’IA, un trafic est-ouest mal géré peut ralentir l’entraînement et réduire l’efficacité des pipelines à mesure que les charges de travail s’étendent sur les GPU, les CPU et les systèmes de stockage.
Concevoir une infrastructure pour les charges de travail d’IA évolutives
Les entreprises doivent concevoir une infrastructure d’IA évolutive en fonction des exigences des charges de travail, et non d’une liste de matériel prédéfinie. Avant de changer d’échelle, elles doivent établir pour chaque charge de travail ses exigences en matière de calcul, de stockage, de réseau, de latence, d’accès aux données, de sécurité et de croissance.
Une tâche d’entraînement de grande ampleur, une application d’inférence destinée aux clients et un outil RAG interne ne sollicitent pas l’infrastructure de la même manière. Chacun nécessite son propre équilibre entre performances, accès aux données, latence et évolutivité.
Les principaux critères incluent :
- Taille du modèle : Les modèles plus volumineux nécessitent généralement davantage de calcul accéléré et de mémoire.
- Volume de données : Une quantité de données plus importante accroît les besoins en stockage et en déplacement des données.
- Besoins en latence : L’inférence et la génération augmentée par récupération en production exigent souvent des temps de réponse plus courts.
- Concurrence : Un nombre accru d’utilisateurs ou de requêtes peut augmenter la demande en calcul et en réseau.
- Prévisions de croissance : L’infrastructure doit permettre une extension au-delà du premier cas d’usage.
Exigences d’infrastructure pour l’entraînement, l’inférence et la génération augmentée par récupération
L’entraînement et l’inférence de l’IA à grande échelle nécessitent une architecture équilibrée : calcul accéléré, stockage à haut débit, réseau à bande passante élevée et faible latence, logiciels d’orchestration et accès sécurisé aux données. L’entraînement dépend de performances GPU soutenues et d’un déplacement rapide des données, tandis que l’inférence donne la priorité à la faible latence, à la fiabilité et au placement efficace des charges de travail.
La génération augmentée par récupération nécessite également un accès rapide et gouverné aux données d’entreprise avant que le modèle ne génère une réponse. Dell Technologies indique que 95 % des organisations rencontrent des difficultés pour identifier, préparer ou utiliser les données dans le cadre de cas d’usage d’IA ou d’IA générative. Dans les environnements RAG, les problèmes de préparation des données peuvent également influer sur la planification de l’infrastructure, notamment lorsque les systèmes doivent récupérer et transmettre rapidement les informations pertinentes.
Le tableau ci-dessous montre en quoi les priorités d’infrastructure diffèrent selon les charges de travail d’entraînement, d’inférence et de génération augmentée par récupération.
Charge de travail d’IA | Besoins principaux de l’infrastructure | Pourquoi c’est important |
Entraînement de l’IA | Calcul accéléré, stockage à haut débit, réseau à bande passante élevée | Les tâches d’entraînement traitent de grands jeux de données et nécessitent des performances soutenues |
Inférence de l’IA | Calcul à faible latence, réseau fiable, placement efficace des charges de travail | Les applications d’IA en production ont besoin de temps de réponse constants |
Génération augmentée par récupération | Accès rapide aux données, prise en charge des bases de données vectorielles, stockage et réseau à faible latence | Les systèmes RAG doivent récupérer les données d’entreprise pertinentes avant de générer une réponse |
Exigences d’infrastructure pour les assistants de connaissances d’entreprise avec RAG
Un assistant de connaissances d’entreprise sécurisé avec RAG nécessite davantage qu’une interface de modèle. L’infrastructure doit prendre en charge un accès rapide et gouverné aux données d’entreprise avant que le modèle ne génère une réponse.
Les exigences fondamentales comprennent l’accès gouverné aux documents et aux applications, le stockage des données sources et des représentations vectorielles, la recherche vectorielle, un réseau à faible latence, des contrôles de sécurité qui appliquent les autorisations des utilisateurs, ainsi que la supervision de la latence de récupération et de l’utilisation de l’infrastructure.
Pour les déploiements privés ou sur site, les entreprises doivent également planifier l’emplacement de stockage des données, leur mode d’indexation, la fréquence de leur actualisation et l’application des politiques d’accès.
Élaborer une stratégie d’infrastructure native pour l’IA
Une stratégie d’infrastructure native pour l’IA aligne le calcul, le stockage, le réseau, les logiciels, la sécurité et les services sur les charges de travail qu’une entreprise doit faire évoluer. Dell AI Factory with NVIDIA s’appuie sur la validation ERA de NVIDIA et réunit infrastructure accélérée, logiciels d’IA, conceptions validées, services de données, sécurité et expertise en déploiement pour aider les organisations à faire passer l’IA des projets pilotes à la production.
Cette approche offre aux équipes un parcours coordonné, de la planification du cas d’usage au déploiement en production, au lieu de les obliger à assembler et valider séparément chaque couche de l’infrastructure. En s’appuyant sur des modèles validés, les organisations peuvent réduire les lacunes d’intégration, standardiser les déploiements reproductibles et faire évoluer de nouvelles charges de travail d’IA sans repenser l’environnement à chaque fois.
Comment les entreprises évitent les goulets d’étranglement de l’infrastructure d’IA à grande échelle
Les entreprises évitent les goulets d’étranglement de l’infrastructure d’IA en concevant le calcul, le stockage, le réseau et les opérations comme un système coordonné. Elles doivent tester les charges de travail avant un déploiement étendu, surveiller l’utilisation de l’ensemble de la pile et développer l’infrastructure en fonction des exigences de l’entraînement, de l’inférence et du RAG.
Une approche pratique consiste à adapter l’infrastructure au type de charge de travail, à équilibrer la capacité GPU avec le débit du stockage et la bande passante du réseau, à surveiller la latence et le déplacement des données, à utiliser des architectures validées et à standardiser des modèles de déploiement reproductibles.
Ces mêmes pratiques réduisent également la charge opérationnelle. Lorsque les équipes réutilisent des modèles de déploiement communs et surveillent l’infrastructure de manière cohérente, elles peuvent éviter les environnements d’IA conçus au cas par cas, qui entraînent un travail dupliqué, des configurations incohérentes et une répartition des responsabilités peu claire.
FAQ
Pourquoi faire évoluer l’IA ne consiste-t-il pas seulement à ajouter des GPU ?
Faire évoluer l’IA ne consiste pas seulement à ajouter des GPU, car les charges de travail d’IA dépendent également des performances du stockage, de la bande passante du réseau, de l’accès aux données et de l’orchestration des charges de travail.
Quelles sont les causes des goulets d’étranglement dans une infrastructure d’IA ?
Les goulets d’étranglement apparaissent lorsqu’une couche de la pile d’infrastructure ne peut pas suivre les autres, par exemple lorsque le stockage ne peut pas alimenter les données assez rapidement ou que le réseau ralentit les charges de travail distribuées.
De quelle infrastructure l’IA d’entreprise a-t-elle besoin ?
Une infrastructure d’IA d’entreprise comprend généralement des serveurs accélérés, du stockage hautes performances, un réseau à bande passante élevée, des logiciels d’IA, des outils d’orchestration, des contrôles de sécurité et des services.
Quelle infrastructure prend en charge la génération augmentée par récupération ?
La génération augmentée par récupération nécessite un accès rapide aux données d’entreprise, des bases de données vectorielles, des systèmes de stockage et un réseau à faible latence.
Un assistant de connaissances d’entreprise peut-il fonctionner sans envoyer de données vers le cloud public ?
Oui. Un assistant de connaissances peut fonctionner dans un environnement privé ou sur site lorsque l’organisation dispose d’une infrastructure permettant l’accès sécurisé aux données, la recherche vectorielle, le stockage, le réseau, le service des modèles et la gouvernance.


