- Die wichtigsten Erkenntnisse
- So entwerfen Sie eine Enterprise-KI-Architektur
- Warum die Skalierung von KI mehr bedeutet als das Hinzufügen von GPUs
- Wie Server, Speicher und Netzwerke in der KI-Infrastruktur zusammenspielen
- Was ist eine KI-Fabrik?
- Was verursacht Engpässe in der Enterprise-KI-Infrastruktur?
- Infrastrukturanforderungen für KI-Training, KI-Inferenz und RAG
- Eine AI-native Infrastrukturstrategie aufbauen
- Wie Unternehmen KI-Infrastrukturengpässe bei der Skalierung vermeiden
- Häufig gestellte Fragen
Die wichtigsten Erkenntnisse
- Eine skalierbare KI-Infrastruktur hängt von einer ausgewogenen Kombination aus Rechenleistung, Speicher, Netzwerk und Managementsoftware ab.
- GPUs sind entscheidend, doch auch Speicherdurchsatz, Netzwerkbandbreite und Datenzugriff können die KI-Leistung begrenzen.
- KI-Training, KI-Inferenz und Retrieval-Augmented Generation stellen jeweils unterschiedliche Anforderungen an die Infrastruktur.
- Engpässe treten häufig auf, wenn eine Infrastrukturebene schneller skaliert als die anderen.
Skalierbare KI erfordert mehr, als nur GPUs hinzuzufügen. Wenn Unternehmen KI aus Pilotprojekten in die Produktion überführen, überdenken viele auch, wo KI ausgeführt werden sollte. Für Unternehmen, Behörden und regulierte Branchen bedeutet dies zunehmend, sie vor Ort aufzubauen, um souveräne KI zu unterstützen: Modelle, Daten und Inferenz innerhalb der eigenen Grenzen, Netzwerke und Kontrollinstanzen zu halten, um Datenresidenz, Schutz geistigen Eigentums, regulatorische Kontrolle und betriebliche Resilienz zu stärken.
Die Herausforderung besteht darin, diese Kontrolle in eine skalierbare, produktionsreife Umgebung zu überführen. Dell Technologies berichtet, dass 93 % der Unternehmen vor Herausforderungen stehen wenn sie KI oder generative KI in ihre Geschäftsstrategien integrieren, wodurch die Abstimmung der Infrastruktur zu einem entscheidenden nächsten Schritt wird. Für eine effektive Skalierung benötigen Unternehmen Server, Speicher, Netzwerke, Datenzugriff und Managementtools, die bei Training, Inferenz und Retrieval-Augmented Generation zusammenspielen – einschließlich Architekturen, die verwaltete Unternehmensdaten näher an beschleunigte Rechenleistung bringen, damit GPUs nicht auf entfernte oder fragmentierte Daten-Pipelines warten müssen.
So entwerfen Sie eine Enterprise-KI-Architektur
Eine Enterprise-KI-Architektur sollte so konzipiert sein, dass sie die unterschiedlichen Anforderungen von Training, Inferenz, Fine-Tuning und Retrieval-Augmented Generation bewältigt, ohne für jeden neuen Anwendungsfall eine Neugestaltung zu erzwingen. Jeder Workload beansprucht Rechenleistung, Speicher, Netzwerk, Sicherheit und Management auf unterschiedliche Weise. Daher muss die Architektur berücksichtigen, wo sich Daten befinden, wie sie sich bewegen und welche Bandbreite die GPU-Fabric tatsächlich benötigt.
Eine skalierbare Enterprise-KI-Architektur kombiniert beschleunigte Server, Hochleistungsspeicher, die passende Netzwerktechnik, sicheren Datenzugriff, Orchestrierungstools und validierte Bereitstellungsmuster zu einem einzigen wiederholbaren Design. Diese Grundlage hilft Teams, Kapazität für den nächsten Workload hinzuzufügen, ohne den vorherigen neu zu konzipieren.
Warum die Skalierung von KI mehr bedeutet als das Hinzufügen von GPUs
KI zu skalieren bedeutet mehr, als GPUs hinzuzufügen, denn die Leistung hängt davon ab, wie gut Rechenleistung, Netzwerk, Speicher und Software zusammenspielen. GPUs können Training und Inferenz beschleunigen, aber sie können auch zu teurem ungenutztem Silizium werden, wenn langsame Daten-Pipelines, überlastete Netzwerk-Fabrics oder das Schreiben von Checkpoints verhindern, dass die übrige Infrastruktur Schritt hält.
Das Ergebnis sind eine geringere Auslastung, längere Trainingsläufe, eine höhere Tail-Latenz bei der Inferenz und steigende Kosten pro Token oder Anfrage. Mehr Beschleuniger in einer unausgewogenen Architektur zu ergänzen, vervielfacht das Problem nur. Für eine effiziente Skalierung müssen Speicherdurchsatz, Netzwerkbandbreite, Datenbewegung und Orchestrierung im Gleichschritt mit der GPU-Kapazität wachsen.
NVIDIA fasst diese Designprinzipien in seinen Enterprise Reference Architectures (ERAs) zusammen: validierten Blaupausen für Cluster mit beschleunigter Rechenleistung, die die erforderlichen Verhältnisse von Rechenleistung, Speicher und Netzwerk festlegen, um Engpässe zu vermeiden und die GPU-Auslastung aufrechtzuerhalten. ERAs decken sowohl Scale-up-Designs ab, darunter über NVLink verbundene GPUs innerhalb eines Knotens oder Racks, als auch Scale-out-Designs, darunter Ethernet- oder InfiniBand-Fabrics mit hoher Bandbreite und niedriger Latenz über mehrere Knoten hinweg.
NVIDIA ERAs geben Teams eine wiederholbare Blaupause für die Abstimmung von Rechenleistung, Speicher, Netzwerk und KI-Software, anstatt jede Ebene unabhängig zu dimensionieren. Das kann die Unsicherheit bei der Integration verringern, wenn Unternehmen von Pilotkonfigurationen zu einer reproduzierbaren und skalierbaren Infrastruktur übergehen.
Bei einer skalierbaren KI-Infrastruktur hilft zusätzliche GPU-Kapazität nur, wenn die umgebende Architektur Schritt halten kann. Server, Speicher, Netzwerke und Orchestrierung müssen als ein System geplant werden, damit sich Daten effizient bewegen, GPUs ausgelastet bleiben und neue Kapazität die Leistung verbessert, statt den nächsten Engpass offenzulegen.
Wie Server, Speicher und Netzwerke in der KI-Infrastruktur zusammenspielen
Server, Speicher und Netzwerke beeinflussen die KI-Leistung, indem sie steuern, wie schnell sich Daten durch die Umgebung bewegen. Server stellen die beschleunigte Rechenleistung für Training, Fine-Tuning und Inferenz bereit, während der Speicher die Datensätze, Checkpoints, Embeddings und Ausgaben liefert, auf die diese Workloads angewiesen sind.
Netzwerke verbinden die Infrastrukturebenen, doch KI-Cluster hängen von zwei unterschiedlichen Datenverkehrsmustern ab. North-South-Datenverkehr bewegt Daten zwischen Nutzern, Anwendungen, Speichersystemen und dem Cluster, während East-West-Datenverkehr Daten zwischen GPUs und Knoten innerhalb des Clusters bewegt. Bei einer Scale-out-Architektur wird die Kommunikation zwischen GPUs häufig zum größeren Engpass.
Dadurch werden Interconnects mit hoher Bandbreite und niedriger Latenz entscheidend. Ist die GPU-Fabric unterdimensioniert oder überbucht, können Beschleuniger beim Training oder bei der Inferenz großer Modelle untätig auf Kommunikation warten. Mehr GPUs können dieses Ungleichgewicht nicht beheben, wenn das Netzwerk sie nicht effizient zusammenarbeiten lässt.
Die folgende Tabelle zeigt, wie sich die einzelnen Infrastrukturebenen verändern, wenn Unternehmen von herkömmlichen Enterprise-Workloads zu KI-Training, Inferenz und RAG übergehen.
Infrastrukturbereich | Traditionelle Enterprise-Infrastruktur | Skalierbare KI-Infrastruktur |
Server | CPU-zentrierte Systeme für Geschäftsanwendungen | Beschleunigte Server für KI-Training, Inferenz und Fine-Tuning |
Speicher | Kapazitätsorientierter Speicher für Aufzeichnungen und Anwendungen | Hochleistungsspeicher für Datensätze, Embeddings, Checkpoints und Ausgaben |
Netzwerk | Konnektivität für allgemeine Zwecke | Netzwerke mit hoher Bandbreite und niedriger Latenz für verteilte KI-Workloads |
Betrieb | Isoliertes Infrastrukturmanagement | Koordiniertes Management von Rechenleistung, Speicher, Netzwerk und KI-Software |
Was ist eine KI-Fabrik?
Die Dell AI Factory with NVIDIA ist eine gemeinsam entwickelte Full-Stack-Umgebung, die darauf ausgelegt ist, Unternehmensdaten in großem Maßstab in KI-Ergebnisse zu überführen. Sie unterstützt den gesamten KI-Lebenszyklus, einschließlich Datenaufbereitung, Modelltraining, Fine-Tuning, Inferenz, Retrieval, Überwachung und kontinuierlicher Verbesserung.
Im Gegensatz zu einem traditionellen Rechenzentrum, das typischerweise auf Anwendungsverfügbarkeit und universell einsetzbare Rechenleistung optimiert ist, wurde Dell AI Factory with NVIDIA für die von KI geforderte Workload-Intensität entwickelt. Sie vereint beschleunigte Rechenleistung, Speicher mit hohem Durchsatz, GPU-Fabrics mit niedriger Latenz, verwalteten Datenzugriff und koordiniertes Management in validierten, modularen Bausteinen, statt Teams die Zusammensetzung eines individuellen Integrationsprojekts zu überlassen.
Dell Technologies ist ein Beispiel für einen Anbieter, der seine Enterprise-KI-Infrastruktur und seinen Datenplattform-Ansatz auf NVIDIA-validierten Referenzarchitekturen aufbaut und diese Designs nutzt, um die für produktive KI erforderlichen Infrastrukturebenen zu koordinieren.
Die Leitlinien für NVIDIA ERAs bieten einen Referenzpunkt dafür, wie diese Ebenen zusammenspielen. Dell AI Factory with NVIDIA kombiniert Dell PowerEdge-Server, PowerScale-Speicher, PowerSwitch-Netzwerke und die Dell AI Data Platform mit NVIDIA AI Enterprise, NVIDIA NIM-Microservices und der Hochgeschwindigkeits-Ethernet-Fabric NVIDIA Spectrum-X. Durch die gemeinsame Validierung des Stacks geben Dell und NVIDIA Unternehmen eine wiederholbare Architektur an die Hand, die sie über Training, Inferenz, RAG und künftige KI-Workloads hinweg skalieren können, ohne die Umgebung für jeden neuen Anwendungsfall neu zu konzipieren.
Was verursacht Engpässe in der Enterprise-KI-Infrastruktur?
Engpässe in der Enterprise-KI-Infrastruktur entstehen, wenn Rechenleistung, Speicher, Netzwerk oder Daten-Pipelines ungleichmäßig skalieren. Unzureichender Speicherdurchsatz für zusätzliche GPUs, eine unzureichende Netzwerkausstattung für verteilte KI-Workloads oder ein langsamer Zugriff auf Unternehmensdaten für Retrieval-Augmented Generation können die Leistung bremsen.
Zu den häufigen Engpasspunkten gehören:
- GPUs, die auf langsame Daten-Pipelines warten
- Speichersysteme, die Trainings- oder Retrieval-Workloads nicht unterstützen können
- Netzwerklatenz zwischen verteilten Rechenknoten
- Ungünstige Platzierung von Workloads auf der verfügbaren Infrastruktur
- RAG-Systeme, die Unternehmensdaten nicht schnell genug abrufen können
Leistungsprobleme treten meist auf, wenn sich Daten nicht schnell genug über die Ebenen Rechenleistung, Speicher und Netzwerk bewegen können. In KI-Clustern kann schlecht verwalteter East-West-Datenverkehr das Training verlangsamen und die Effizienz der Pipeline verringern, wenn Workloads über GPUs, CPUs und Speichersysteme skaliert werden.
Infrastruktur für skalierbare KI-Workloads entwerfen
Unternehmen sollten skalierbare KI-Infrastrukturen anhand der Workload-Anforderungen entwerfen, nicht anhand einer vorab festgelegten Hardwareliste. Vor der Skalierung müssen sie jeden Workload seinen Anforderungen an Rechenleistung, Speicher, Netzwerk, Latenz, Datenzugriff, Sicherheit und Wachstum zuordnen.
Ein umfangreicher Trainingsjob, eine kundenorientierte Inferenzanwendung und ein internes RAG-Tool belasten die Infrastruktur nicht auf dieselbe Weise. Jeder benötigt sein eigenes Gleichgewicht aus Leistung, Datenzugriff, Latenz und Skalierbarkeit.
Zu den wichtigsten Kriterien gehören:
- Modellgröße: Größere Modelle benötigen typischerweise mehr beschleunigte Rechenleistung und Speicher.
- Datenvolumen: Mehr Daten erhöhen die Anforderungen an Speicher und Datenbewegung.
- Latenzanforderungen: Produktive Inferenz und RAG erfordern häufig kürzere Antwortzeiten.
- Parallelität: Mehr Nutzer oder Anfragen können den Bedarf an Rechenleistung und Netzwerk erhöhen.
- Wachstumserwartungen: Die Infrastruktur sollte eine Erweiterung über den ersten Anwendungsfall hinaus unterstützen.
Infrastrukturanforderungen für KI-Training, KI-Inferenz und RAG
KI-Training und -Inferenz im großen Maßstab benötigen eine ausgewogene Architektur: beschleunigte Rechenleistung, Speicher mit hohem Durchsatz, Netzwerke mit hoher Bandbreite und niedriger Latenz, Orchestrierungssoftware und sicheren Datenzugriff. Training hängt von anhaltender GPU-Leistung und schneller Datenbewegung ab, während bei der Inferenz niedrige Latenz, Zuverlässigkeit und eine effiziente Platzierung der Workloads im Vordergrund stehen.
Auch RAG erfordert einen schnellen, verwalteten Zugriff auf Unternehmensdaten, bevor das Modell eine Antwort generiert. Dell Technologies berichtet, dass 95 % der Unternehmen vor Herausforderungen stehen, wenn sie Daten für KI- oder generative-KI-Anwendungsfälle identifizieren, aufbereiten oder nutzen. In RAG-Umgebungen können Probleme mit der Datenbereitschaft auch die Infrastrukturplanung beeinflussen, insbesondere wenn Systeme relevante Informationen schnell abrufen und bereitstellen müssen.
Die folgende Tabelle zeigt, wie sich die Infrastrukturprioritäten bei KI-Training, KI-Inferenz und RAG-Workloads unterscheiden.
KI-Workload | Wichtigste Infrastrukturanforderungen | Warum das wichtig ist |
KI-Training | Beschleunigte Rechenleistung, Speicher mit hohem Durchsatz, Netzwerk mit hoher Bandbreite | Trainingsjobs verarbeiten große Datensätze und erfordern anhaltende Leistung |
KI-Inferenz | Rechenleistung mit niedriger Latenz, zuverlässiges Netzwerk, effiziente Platzierung der Workloads | Produktive KI-Anwendungen benötigen konstante Antwortzeiten |
Retrieval-Augmented Generation | Schneller Datenzugriff, Unterstützung für Vektordatenbanken, Speicher und Netzwerk mit niedriger Latenz | RAG-Systeme müssen relevante Unternehmensdaten abrufen, bevor sie eine Antwort generieren |
Infrastrukturanforderungen für Enterprise-Wissensassistenten mit RAG
Ein sicherer Enterprise-Wissensassistent mit RAG benötigt mehr als eine Modellschnittstelle. Die Infrastruktur muss einen schnellen, verwalteten Zugriff auf Unternehmensdaten unterstützen, bevor das Modell eine Antwort generiert.
Zu den grundlegenden Anforderungen gehören verwalteter Zugriff auf Dokumente und Anwendungen, Speicher für Quelldaten und Embeddings, Vektorsuche, Netzwerke mit niedriger Latenz, Sicherheitskontrollen zur Durchsetzung von Nutzerberechtigungen sowie Monitoring der Retrieval-Latenz und der Infrastrukturauslastung.
Bei privaten oder On-Premises-Bereitstellungen sollten Unternehmen außerdem planen, wo Daten gespeichert, wie sie indiziert, wie häufig sie aktualisiert und wie Zugriffsrichtlinien durchgesetzt werden.
Eine AI-native Infrastrukturstrategie aufbauen
Eine AI-native Infrastrukturstrategie stimmt Rechenleistung, Speicher, Netzwerk, Software, Sicherheit und Services auf die Workloads ab, die ein Unternehmen skalieren muss. Dell AI Factory with NVIDIA baut auf der Validierung durch NVIDIA ERAs auf und vereint beschleunigte Infrastruktur, KI-Software, validierte Designs, Datendienste, Sicherheit und Bereitstellungsexpertise, um Unternehmen dabei zu unterstützen, KI aus Pilotprojekten in die Produktion zu überführen.
Dieser Ansatz bietet Teams einen koordinierten Weg von der Planung von Anwendungsfällen bis zur produktiven Bereitstellung, statt sie zu zwingen, jede Infrastrukturebene separat zusammenzustellen und zu validieren. Durch den Aufbau auf validierten Mustern können Unternehmen Integrationslücken reduzieren, wiederholbare Bereitstellungen standardisieren und neue KI-Workloads skalieren, ohne die Umgebung jedes Mal neu zu konzipieren.
Wie Unternehmen KI-Infrastrukturengpässe bei der Skalierung vermeiden
Unternehmen vermeiden Engpässe in der KI-Infrastruktur, indem sie Rechenleistung, Speicher, Netzwerk und Betrieb als ein koordiniertes System entwerfen. Sie sollten Workloads vor einer breiten Bereitstellung testen, die Auslastung im gesamten Stack überwachen und die Infrastruktur anhand der Anforderungen von Training, Inferenz und RAG erweitern.
Ein praxisnaher Ansatz umfasst die Abstimmung der Infrastruktur auf den Workload-Typ, die Balance zwischen GPU-Kapazität, Speicherdurchsatz und Netzwerkbandbreite, die Überwachung von Latenz und Datenbewegung, den Einsatz validierter Architekturen sowie die Standardisierung wiederholbarer Bereitstellungsmuster.
Dieselben Praktiken verringern auch den Betriebsaufwand. Wenn Teams gängige Bereitstellungsmuster wiederverwenden und die Infrastruktur konsistent überwachen, können sie einmalige KI-Umgebungen vermeiden, die doppelte Arbeit, uneinheitliche Konfigurationen und unklare Zuständigkeiten verursachen.
Häufig gestellte Fragen
Warum bedeutet die Skalierung von KI mehr als das Hinzufügen von GPUs?
KI zu skalieren bedeutet mehr, als GPUs hinzuzufügen, da KI-Workloads auch von der Speicherleistung, der Netzwerkbandbreite, dem Datenzugriff und der Workload-Orchestrierung abhängen.
Was verursacht Engpässe in der KI-Infrastruktur?
Engpässe entstehen, wenn eine Ebene des Infrastruktur-Stacks nicht mit den anderen Schritt halten kann – etwa wenn der Speicher Daten nicht schnell genug bereitstellt oder das Netzwerk verteilte Workloads ausbremst.
Welche Infrastruktur wird für Enterprise-KI benötigt?
Eine Enterprise-KI-Infrastruktur umfasst typischerweise beschleunigte Server, Hochleistungsspeicher, Netzwerke mit hoher Bandbreite, KI-Software, Orchestrierungstools, Sicherheitskontrollen und Services.
Welche Infrastruktur unterstützt Retrieval-Augmented Generation?
Retrieval-Augmented Generation erfordert schnellen Zugriff auf Unternehmensdaten, Vektordatenbanken, Speichersysteme und Netzwerke mit niedriger Latenz.
Kann ein Enterprise-Wissensassistent funktionieren, ohne Daten an die Public Cloud zu senden?
Ja. Ein Wissensassistent kann in einer privaten oder On-Premises-Umgebung ausgeführt werden, wenn das Unternehmen über eine Infrastruktur für sicheren Datenzugriff, Vektorsuche, Speicher, Netzwerk, Model Serving und Governance verfügt.


