{"id":26128,"date":"2024-02-21T10:29:07","date_gmt":"2024-02-21T09:29:07","guid":{"rendered":"https:\/\/www.sysbus.eu\/?p=26128"},"modified":"2024-02-13T10:49:29","modified_gmt":"2024-02-13T09:49:29","slug":"ki-workloads-stellen-neue-anforderungen-an-storage-loesungen","status":"publish","type":"post","link":"https:\/\/www.sysbus.eu\/?p=26128","title":{"rendered":"KI-Workloads stellen neue Anforderungen an Storage-L\u00f6sungen"},"content":{"rendered":"\n<p class=\"wp-block-paragraph\">Autor\/Redakteur: <a href=\"https:\/\/www.supermicro.com\/en\/\">Michael McNerney, Vizepr\u00e4sident f\u00fcr Marketing und Netzwerksicherheit bei Supermicro<\/a>\/gg<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Der Einsatz von KI in Unternehmen bedeutet eine komplette Umstellung der IT-Infrastruktur, damit diese die entsprechenden Workloads stemmen kann. Dazu geh\u00f6ren gro\u00dfe Sprachmodelle (LLMs) wie ChatGPT wie auch KI-Modelle, die auf riesigen Trainingsdatens\u00e4tzen, komplexen 3D-Modellen, Simulationen und anderen daten- und rechenintensiven ML-Anwendungen basieren.<\/p>\n\n\n\n<figure class=\"wp-block-image size-large\"><img loading=\"lazy\" decoding=\"async\" width=\"1024\" height=\"614\" src=\"https:\/\/www.sysbus.eu\/wp-content\/uploads\/2024\/02\/Supermicro-ASG-WK1032C-NE3-WEKA-storage-solution-with-16-E3.S-NVMe-slots-002-1024x614.webp\" alt=\"\" class=\"wp-image-26130\" srcset=\"https:\/\/www.sysbus.eu\/wp-content\/uploads\/2024\/02\/Supermicro-ASG-WK1032C-NE3-WEKA-storage-solution-with-16-E3.S-NVMe-slots-002-1024x614.webp 1024w, https:\/\/www.sysbus.eu\/wp-content\/uploads\/2024\/02\/Supermicro-ASG-WK1032C-NE3-WEKA-storage-solution-with-16-E3.S-NVMe-slots-002-300x180.webp 300w, https:\/\/www.sysbus.eu\/wp-content\/uploads\/2024\/02\/Supermicro-ASG-WK1032C-NE3-WEKA-storage-solution-with-16-E3.S-NVMe-slots-002-768x461.webp 768w, https:\/\/www.sysbus.eu\/wp-content\/uploads\/2024\/02\/Supermicro-ASG-WK1032C-NE3-WEKA-storage-solution-with-16-E3.S-NVMe-slots-002.webp 1200w\" sizes=\"auto, (max-width: 1024px) 100vw, 1024px\" \/><figcaption class=\"wp-element-caption\">Supermicro ASG-WK1032C-NE3 WEKA Storage-System mit 16 E3.S NVMe-Steckpl\u00e4tzen. (Quelle: Supermicro)<\/figcaption><\/figure>\n\n\n\n<!--more-->\n\n\n\n<p class=\"wp-block-paragraph\">F\u00fcr eine leistungsf\u00e4hige KI- oder ML-L\u00f6sung muss eine ganze Reihe von Hardwarekomponenten bestm\u00f6glich zusammenarbeiten. Hinter der auff\u00e4lligen Rack-Hardware, die die GPU-gesteuerten Gehirne eines KI-Clusters beherbergt, sind Storage-Systeme mit hohem Durchsatz und niedriger Latenz erforderlich, um den Cluster produktiv zu halten. Diese unterst\u00fctzen die I\/O-Kan\u00e4le, \u00fcber die riesige Datenmengen zum Trainieren von Modellen und zur Durchf\u00fchrung komplexer Simulationen und Analysen eingespeist werden, die zur Unterst\u00fctzung von KI-Workloads erforderlich sind.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Eine der gr\u00f6\u00dften Herausforderungen f\u00fcr Unternehmen, die vom Wachstum der KI profitieren wollen, besteht darin, eine Storage-L\u00f6sung zu finden, die ihre Hochleistungs-CPUs, GPUs oder Datenbank-Cluster nicht zum Flaschenhals macht. Schlie\u00dflich m\u00fcssen die CPUs und GPUs bestm\u00f6glich ausgelastet sein, um die Gesamtbetriebskosten des Rechenzentrums zu senken.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Speicherengp\u00e4sse vermeiden<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Bei verteilten und parallelen Dateisystemen kommen die Daten aus mehreren Quellen, die \u00fcber verschiedene Protokolle und f\u00fcr verschiedene Anwendungen in gro\u00dfem Umfang verarbeitet werden m\u00fcssen. In einem typischen Storage-System werden Metadaten schnell zu einem Engpass. Es k\u00f6nnen nur so viele Daten durch das System gepumpt werden, wie die Metadaten unterst\u00fctzen. Wenn die Datenmenge w\u00e4chst, muss auch die F\u00e4higkeit, Metadaten zu verarbeiten, proportional mitwachsen.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">WEKA Distributed Storage bietet eine solche proportionale Skalierung. Diese erm\u00f6glicht es, die I\/O-Leistung trotz des Hinzuf\u00fcgens von mehr Datenkapazit\u00e4t zu einem System oder Cluster weiterhin linear von acht (Mindestanzahl der Knoten f\u00fcr einen WEKA-Cluster) auf Hunderte von Storage-Knoten zu skalieren. Dies wird durch die Beseitigung von Engp\u00e4ssen erm\u00f6glicht. Selbst die schwersten und anspruchsvollsten KI-Workloads k\u00f6nnen so unterst\u00fctzt werden.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Zur Optimierung von Servern und Clustern geh\u00f6rt jedoch mehr als die Bereitstellung von skalierbaren, hochleistungsf\u00e4higen Storage-L\u00f6sungen mit geringer Latenz. Bei der Entwicklung eines Gesamtsystems darf der Fokus nicht ausschlie\u00dflich auf einem einzigen Merkmal oder einer einzigen Funktion liegen. Die gesamte Architektur muss zusammenarbeiten, um die angestrebten KI-Workloads zu unterst\u00fctzen. Ein System f\u00fcr KI-Anwendungen zu entwerfen bedeutet also, eine Laufzeitumgebung zu schaffen, die von Grund auf so aufgebaut ist, dass datenintensive Anwendungen schnell und zufriedenstellend verarbeitet werden k\u00f6nnen. Was der Server mit den Daten macht, wenn er KI-Workloads verarbeitet, ist genauso wichtig wie der Datenverkehr zu und von einem bestimmten Knoten.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>NVMe als Retter in der Not<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Ein weiteres wichtiges Merkmal ist die Anzahl der PCIe 5.0-Lanes. Diese Technologie erm\u00f6glicht es Servern, eine umfangreichere Anzahl von SSDs, NICs, GPUs und sogar CXL-Ger\u00e4ten mit erweitertem Storage aufzunehmen. Alle diese Komponenten spielen eine wichtige Rolle bei der Bew\u00e4ltigung anspruchsvoller KI- und ML-Workloads, einschlie\u00dflich PCIe Gen5 SSDs f\u00fcr lokalen Hochgeschwindigkeits-Speicher, einer gro\u00dfen Anzahl von Hochgeschwindigkeits-Netzwerkschnittstellen zur Verbindung von Servern mit anderen Knoten wie Storage oder anderen spezialisierten Server-Systemen, um den Datenumfang und die Reichweite zu erweitern, sowie einer gro\u00dfen Anzahl von GPUs zur Bew\u00e4ltigung spezialisierter, gezielter Aufgaben oder Workloads.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">NVMe-Ger\u00e4te haben die Konfigurationsm\u00f6glichkeiten von Servern und Clustern v\u00f6llig ver\u00e4ndert. Mit NVMe als Basis wird eine komplett \u00fcberarbeitete Architektur m\u00f6glich. Sie erm\u00f6glicht es, dass Storage in gro\u00dfem Umfang und mit hoher Geschwindigkeit neben Hochleistungs-CPUs, GPUs und NICs arbeiten kann, insbesondere mit dem EDSFF-Formfaktor. Das Single-Socket-Design erm\u00f6glicht es den leistungsst\u00e4rksten CPUs, Netzwerkkarten und Storage-Laufwerken, ihre volle Leistung zu entfalten und den h\u00f6chstm\u00f6glichen Grad an Parallelit\u00e4t und Clustering f\u00fcr HPC, KI und andere L\u00f6sungen der n\u00e4chsten Generation zu nutzen.<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Der Einsatz von KI in Unternehmen bedeutet eine komplette Umstellung der IT-Infrastruktur, damit diese die entsprechenden Workloads stemmen kann. Dazu geh\u00f6ren gro\u00dfe Sprachmodelle (LLMs) wie ChatGPT wie auch KI-Modelle, die auf riesigen Trainingsdatens\u00e4tzen, komplexen 3D-Modellen, Simulationen und anderen daten- und rechenintensiven ML-Anwendungen basieren.<\/p>\n","protected":false},"author":81,"featured_media":26130,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"colormag_page_container_layout":"default_layout","colormag_page_sidebar_layout":"default_layout","footnotes":""},"categories":[8,17],"tags":[2540,4281,8220,5585,6735,3766],"class_list":["post-26128","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-artikel","category-storage","tag-cluster","tag-gpu","tag-ki","tag-nvme","tag-supermicro","tag-workload"],"amp_enabled":true,"_links":{"self":[{"href":"https:\/\/www.sysbus.eu\/index.php?rest_route=\/wp\/v2\/posts\/26128","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.sysbus.eu\/index.php?rest_route=\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.sysbus.eu\/index.php?rest_route=\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.sysbus.eu\/index.php?rest_route=\/wp\/v2\/users\/81"}],"replies":[{"embeddable":true,"href":"https:\/\/www.sysbus.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcomments&post=26128"}],"version-history":[{"count":1,"href":"https:\/\/www.sysbus.eu\/index.php?rest_route=\/wp\/v2\/posts\/26128\/revisions"}],"predecessor-version":[{"id":26131,"href":"https:\/\/www.sysbus.eu\/index.php?rest_route=\/wp\/v2\/posts\/26128\/revisions\/26131"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.sysbus.eu\/index.php?rest_route=\/wp\/v2\/media\/26130"}],"wp:attachment":[{"href":"https:\/\/www.sysbus.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fmedia&parent=26128"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.sysbus.eu\/index.php?rest_route=%2Fwp%2Fv2%2Fcategories&post=26128"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.sysbus.eu\/index.php?rest_route=%2Fwp%2Fv2%2Ftags&post=26128"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}