{"id":56749,"date":"2025-03-28T10:01:19","date_gmt":"2025-03-28T09:01:19","guid":{"rendered":"https:\/\/www.schneider.systems\/microsoft-und-nvidia-blackwell-nim-serverlose-gpus-und-mehr\/"},"modified":"2025-03-28T10:35:16","modified_gmt":"2025-03-28T09:35:16","slug":"microsoft-und-nvidia-blackwell-nim-serverlose-gpus-und-mehr","status":"publish","type":"post","link":"https:\/\/www.schneider.systems\/de\/microsoft-und-nvidia-blackwell-nim-serverlose-gpus-und-mehr\/","title":{"rendered":"Microsoft und NVIDIA: Blackwell, NIM, Serverlose GPUs und mehr"},"content":{"rendered":"<p style=\"text-align: justify;\">Mit Wirkung zum 24. M\u00e4rz 2025 <strong>haben Microsoft und <a href=\"https:\/\/www.schneider.systems\/de\/microsoft-azure-ai-und-nvidia-ai-partnerschaft\/\">NVIDIA<\/a> mehrere neue Fortschritte<\/strong> in ihrer <strong>Zusammenarbeit<\/strong> zur <strong>Beschleunigung der KI-Entwicklung und -Leistung<\/strong> <strong>angek\u00fcndigt<\/strong>. Zu diesen \u00c4nderungen geh\u00f6ren die Integration der neuesten <strong>NVIDIA Blackwell Plattform<\/strong> in die Azure AI Services Infrastruktur, die Einf\u00fchrung von <strong>NVIDIA NeMo Inference Microservices (NIM) <\/strong>in Azure AI Foundry, die Einf\u00fchrung von <strong>serverlosen GPUs<\/strong> <strong>und mehr<\/strong>.<\/p>\n<p style=\"text-align: justify;\"><img loading=\"lazy\" decoding=\"async\" class=\"aligncenter size-full wp-image-56699\" src=\"https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more3.jpg\" alt=\"\" width=\"800\" height=\"450\" srcset=\"https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more3.jpg 800w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more3-500x281.jpg 500w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more3-150x84.jpg 150w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more3-768x432.jpg 768w\" sizes=\"auto, (max-width: 800px) 100vw, 800px\" \/><\/p>\n<p>&nbsp;<\/p>\n<h2 style=\"text-align: justify;\"><strong>\u00c4nderungen<\/strong><\/h2>\n<h3 style=\"text-align: justify;\"><strong>Integration der NVIDIA Blackwell Plattform<\/strong><\/h3>\n<p style=\"text-align: justify;\">Die <strong>NVIDIA Blackwell Plattform<\/strong> ist ein bedeutender Fortschritt im Bereich KI und beschleunigtes Computing und verf\u00fcgt \u00fcber die Blackwell GPU Architektur. Im Vergleich zu fr\u00fcheren Architekturen wie Hopper bietet Blackwell eine bis zu 2-fache Beschleunigung der Attention-Layer und 1,5-fache KI-Rechenleistung (FLOPS). Attention-Layer sind ein wichtiger Bestandteil moderner neuronaler Netzwerke, insbesondere in Modellen f\u00fcr nat\u00fcrliche Sprachverarbeitung (NLP). Sie helfen dem Modell, sich auf relevante Teile der Eingabedaten zu konzentrieren, indem sie den Fokus auf bestimmte W\u00f6rter oder Merkmale legen, die f\u00fcr die aktuelle Aufgabe wichtig sind. Diese Verbesserungen macht Blackwell ideal f\u00fcr die Verarbeitung von KI-Modellen mit Billionen von Parametern, die f\u00fcr generative KI, Datenverarbeitung und technische Simulationen entscheidend sind.<\/p>\n<p style=\"text-align: justify;\">Die neueste NVIDIA Blackwell Plattform ist <strong>jetzt in die Azure AI Services Infrastruktur integriert<\/strong>. Diese Integration nutzt die fortschrittliche GPU-Technologie von NVIDIA, um die KI-Leistung und Effizienz auf Azure zu verbessern. KI-Anwendungen, die auf Azure laufen, profitieren automatisch von der verbesserten Geschwindigkeit und Effizienz der Blackwell-GPUs, welche nicht extra ausgew\u00e4hlt oder konfiguriert werden m\u00fcssen.<\/p>\n<p>&nbsp;<\/p>\n<h3 style=\"text-align: justify;\"><strong>Einf\u00fchrung von NVIDIA NIM Microservices<\/strong><\/h3>\n<p style=\"text-align: justify;\"><img loading=\"lazy\" decoding=\"async\" class=\"aligncenter size-full wp-image-56719\" src=\"https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more.jpg\" alt=\"\" width=\"800\" height=\"450\" srcset=\"https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more.jpg 800w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more-500x281.jpg 500w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more-150x84.jpg 150w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more-768x432.jpg 768w\" sizes=\"auto, (max-width: 800px) 100vw, 800px\" \/><\/p>\n<p style=\"text-align: justify;\"><strong>NVIDIA NIM Microservices<\/strong> helfen, KI-Anwendungen schnell und zuverl\u00e4ssig in verschiedenen Umgebungen wie Cloud und Rechenzentren bereitzustellen. Sie werden mit vorgefertigten KI-Modellen geliefert und sind f\u00fcr hohe Leistung und niedrige Latenzzeiten optimiert. Das macht es f\u00fcr Unternehmen einfacher, KI zu nutzen, ohne eine komplexe Infrastruktur zu verwalten.<\/p>\n<p style=\"text-align: justify;\"><img loading=\"lazy\" decoding=\"async\" class=\"aligncenter size-full wp-image-56703\" src=\"https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more2.jpg\" alt=\"\" width=\"800\" height=\"233\" srcset=\"https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more2.jpg 800w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more2-500x146.jpg 500w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more2-150x44.jpg 150w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more2-768x224.jpg 768w\" sizes=\"auto, (max-width: 800px) 100vw, 800px\" \/><\/p>\n<p style=\"text-align: justify;\"><strong>Azure AI Foundry bietet jetzt NVIDIA NIM-Microservices<\/strong>, mit denen Entwickler schnell leistungsoptimierte KI-Anwendungen auf den Markt bringen k\u00f6nnen. Das offene Argumentationsmodell (reasoning model) NVIDIA Llama Nemotron Reason wird in K\u00fcrze ebenfalls in Azure AI Foundry integriert werden.<\/p>\n<p>&nbsp;<\/p>\n<h3 style=\"text-align: justify;\"><strong>Leistungsoptimierung f\u00fcr Meta-Lama-Modelle<\/strong><\/h3>\n<p style=\"text-align: justify;\"><strong>Die Llama-Modelle von Meta<\/strong> (vorher bekannt als Facebook) sind eine Familie von gro\u00dfen Sprachmodellen (LLMs), die f\u00fcr verschiedene KI-Anwendungen entwickelt wurden. Im Vergleich zu Llama 3 bietet das neue <strong>Llama 3.1<\/strong> eine erweiterte Kontexthandhabung, verbesserte Inferenzgeschwindigkeit und verbesserte multimodale Unterst\u00fctzung. Sie unterst\u00fctzen mehrsprachige und multimodale F\u00e4higkeiten, so dass sie sowohl Text als auch visuelle Eingaben verarbeiten k\u00f6nnen.<\/p>\n<p style=\"text-align: justify;\">Microsoft und NVIDIA haben jetzt <strong>die Leistung von Meta Llama-Modellen mit TensorRT-LLM optimiert<\/strong> und damit den Durchsatz und die Effizienz verbessert. <strong>Wie funktioniert diese Opimierung?<\/strong><\/p>\n<ul>\n<li style=\"text-align: justify;\"><strong>Quantisierung<\/strong>: TensorRT-LLM verwendet verschiedene Quantisierungstechniken wie FP8 und INT4 AWQ, um die Modelle zu optimieren. Quantisierung reduziert die Pr\u00e4zision der Berechnungen, was die Geschwindigkeit erh\u00f6ht, ohne die Genauigkeit wesentlich zu beeintr\u00e4chtigen.<\/li>\n<li style=\"text-align: justify;\"><strong>Optimierte Attention-Kerne<\/strong>: Die Attention-Kerne (spezialisierte Berechnungseinheiten innerhalb eines neuronalen Netzwerks) wurden speziell angepasst, um die Berechnungen effizienter zu gestalten. Dies verbessert die Leistung der Attention-Layer (siehe oben), die f\u00fcr die Verarbeitung von Kontextinformationen entscheidend sind.<\/li>\n<li style=\"text-align: justify;\"><strong>KV-Caching<\/strong>: Durch sogenanntes &#8222;Paged KV-Caching&#8220; k\u00f6nnen Zwischenergebnisse gespeichert und wiederverwendet werden, was die Berechnungen beschleunigt und die Latenz verringert.<\/li>\n<li style=\"text-align: justify;\"><strong>In-Flight Batching<\/strong>: Diese Technik erm\u00f6glicht es, mehrere Anfragen gleichzeitig zu verarbeiten, was den Durchsatz erh\u00f6ht und die Effizienz verbessert.<\/li>\n<\/ul>\n<p>&nbsp;<\/p>\n<h3 style=\"text-align: justify;\"><strong>Allgemeine Verf\u00fcgbarkeit von Azure ND GB200 V6 VMs<\/strong><\/h3>\n<p style=\"text-align: justify;\"><strong>Azure ND GB200 V6-virtuelle Maschinen<\/strong> wurden entwickelt, um leistungsstarkes Computing f\u00fcr KI- und Deep Learning-Aufgaben zu erm\u00f6glichen.<\/p>\n<ul style=\"text-align: justify;\">\n<li><strong>High-Performance Computing<\/strong>: Diese VMs verwenden <strong>NVIDIA GB200 Blackwell GPUs<\/strong>, die sehr fortschrittlich und schnell sind. Dadurch eignen sie sich hervorragend f\u00fcr die Verarbeitung komplexer KI-Modelle und gro\u00dfer Datens\u00e4tze.<\/li>\n<li><strong>Effiziente Vernetzung<\/strong>: Sie verwenden auch <strong>NVIDIA Quantum InfiniBand Netzwerke<\/strong>, eine Technologie, die eine sehr schnelle und latenzarme Kommunikation zwischen Computern erm\u00f6glicht. Das bedeutet, dass Daten schnell und effizient \u00fcbertragen werden k\u00f6nnen.<\/li>\n<li><strong>Skalierbarkeit<\/strong>: Diese VMs k\u00f6nnen <strong>bis zu 72 GPUs<\/strong> in einer einzigen NVLink-Dom\u00e4ne verbinden. NVLink ist eine Hochgeschwindigkeitsverbindung, die es den GPUs erm\u00f6glicht, nahtlos zusammenzuarbeiten und so noch mehr Leistung und Effizienz zu erzielen.<\/li>\n<li><strong>Verbesserte Leistung<\/strong>: Im Vergleich zu \u00e4lteren Versionen bieten diese VMs erhebliche Verbesserungen bei <strong>Geschwindigkeit und Effizienz<\/strong>. Dadurch wird sichergestellt, dass anspruchsvolle KI-Workloads reibungslos und schnell ablaufen.<\/li>\n<\/ul>\n<p>&nbsp;<\/p>\n<h3 style=\"text-align: justify;\"><strong>Erweiterung des Azure AI Foundry Modellkatalogs: Mistral Small 3.1<\/strong><\/h3>\n<p style=\"text-align: justify;\">Der <strong>Azure AI Foundry-Katalog<\/strong> enth\u00e4lt jetzt <strong><a href=\"https:\/\/www.schneider.systems\/de\/microsoft-und-mistral-ai-mistral-large-verfuegbar\/\">Mistral<\/a> Small 3.1<\/strong>, das multimodale F\u00e4higkeiten und eine erweiterte Kontextl\u00e4nge bietet.<\/p>\n<p style=\"text-align: justify;\"><img loading=\"lazy\" decoding=\"async\" class=\"aligncenter size-full wp-image-56742\" src=\"https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-24-Update-Website-Microsoft-Azure-Mistral-Small-3.1.png\" alt=\"\" width=\"624\" height=\"182\" srcset=\"https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-24-Update-Website-Microsoft-Azure-Mistral-Small-3.1.png 624w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-24-Update-Website-Microsoft-Azure-Mistral-Small-3.1-500x146.png 500w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-24-Update-Website-Microsoft-Azure-Mistral-Small-3.1-150x44.png 150w\" sizes=\"auto, (max-width: 624px) 100vw, 624px\" \/><\/p>\n<p style=\"text-align: justify;\">Dieses Modell eignet sich hervorragend f\u00fcr Anwendungen wie Programmierung, Argumentation, Dialog und Dokumentenanalyse. Im Vergleich zu fr\u00fcheren Versionen bietet Mistral Small 3.1 eine verbesserte Textleistung, multimodales Verstehen und ein erweitertes Kontextfenster mit bis zu 128.000 Token.<\/p>\n<p>&nbsp;<\/p>\n<h3 style=\"text-align: justify;\"><strong>Einf\u00fchrung von Serverlosen GPUs<\/strong><\/h3>\n<p style=\"text-align: justify;\"><strong>Serverlose GPUs<\/strong> bieten eine skalierbare und flexible L\u00f6sung f\u00fcr die Ausf\u00fchrung von KI-Arbeitsleistungen auf Abruf, ohne dass eine spezielle Infrastrukturverwaltung erforderlich ist. Diese GPUs sind in einer serverlosen Umgebung verf\u00fcgbar und erm\u00f6glichen automatische Skalierung, optimierten Kaltstart und sekundengenaue Abrechnung. Im Vergleich zu herk\u00f6mmlichen GPU-Konfigurationen bieten serverlose GPUs die Vorteile der GPU-Beschleunigung bei gleichzeitiger Minimierung des betrieblichen Aufwands und der Kosten. Das ist wichtig, denn so k\u00f6nnen Unternehmen leistungsstarke GPU-Ressourcen f\u00fcr Echtzeit-Inferencing, Stapelverarbeitung und andere dynamische KI-Anwendungen nutzen, ohne die Komplexit\u00e4t und die Kosten der Verwaltung physischer Hardware. Echtzeit-Inferencing ist die F\u00e4higkeit, KI-Modelle in Echtzeit zu verwenden, um sofortige Vorhersagen oder Entscheidungen zu treffen. Stapelverarbeitung ist ein Verfahren, bei dem gro\u00dfe Mengen von Daten in Bl\u00f6cken oder &#8222;Stapel&#8220; verarbeitet werden, damit viele Daten gleichzeitig verarbeitet werden k\u00f6nnen.<\/p>\n<p style=\"text-align: justify;\"><strong>Azure Container Apps unterst\u00fctzen jetzt serverlose Grafikprozessoren mit NVIDIA NIM<\/strong>, die eine kosteng\u00fcnstige L\u00f6sung f\u00fcr die Ausf\u00fchrung von KI-Workloads auf Abruf bieten.<\/p>\n<p>&nbsp;<\/p>\n<h2 style=\"text-align: justify;\"><strong>Weitere Informationen<\/strong><\/h2>\n<p style=\"text-align: justify;\"><strong>Ank\u00fcndigung:<\/strong> <a href=\"https:\/\/azure.microsoft.com\/en-us\/blog\/microsoft-and-nvidia-accelerate-ai-development-and-performance\/\">https:\/\/azure.microsoft.com\/en-us\/blog\/microsoft-and-nvidia-accelerate-ai-development-and-performance\/.<\/a><\/p>\n<p style=\"text-align: justify;\">Besuchen Sie <strong>Azure AI Foundry:<\/strong> <a href=\"https:\/\/ai.azure.com\/\">https:\/\/ai.azure.com\/.<\/a><\/p>\n<p style=\"text-align: justify;\"><a href=\"https:\/\/www.schneider.systems\/contact\/\"><strong>Kontaktieren Sie SCHNEIDER IT MANAGEMENT<\/strong><\/a><strong> noch heute f\u00fcr eine Beratung zur Lizenzierung von Azure, um Kosten auf Azure zu sparen und von den neuesten Verbesserungen in Azure zu profitieren.<\/strong><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Mit Wirkung zum 24. M\u00e4rz 2025 haben Microsoft und NVIDIA mehrere neue Fortschritte in ihrer Zusammenarbeit zur Beschleunigung der KI-Entwicklung und -Leistung angek\u00fcndigt. Zu diesen \u00c4nderungen geh\u00f6ren die Integration der [&hellip;]<\/p>\n","protected":false},"author":11,"featured_media":33018,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[249,1023],"tags":[],"class_list":["post-56749","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-microsoft-azure-de","category-nvidia-de"],"_links":{"self":[{"href":"https:\/\/www.schneider.systems\/de\/wp-json\/wp\/v2\/posts\/56749","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.schneider.systems\/de\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.schneider.systems\/de\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.schneider.systems\/de\/wp-json\/wp\/v2\/users\/11"}],"replies":[{"embeddable":true,"href":"https:\/\/www.schneider.systems\/de\/wp-json\/wp\/v2\/comments?post=56749"}],"version-history":[{"count":3,"href":"https:\/\/www.schneider.systems\/de\/wp-json\/wp\/v2\/posts\/56749\/revisions"}],"predecessor-version":[{"id":56757,"href":"https:\/\/www.schneider.systems\/de\/wp-json\/wp\/v2\/posts\/56749\/revisions\/56757"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.schneider.systems\/de\/wp-json\/wp\/v2\/media\/33018"}],"wp:attachment":[{"href":"https:\/\/www.schneider.systems\/de\/wp-json\/wp\/v2\/media?parent=56749"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.schneider.systems\/de\/wp-json\/wp\/v2\/categories?post=56749"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.schneider.systems\/de\/wp-json\/wp\/v2\/tags?post=56749"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}