{"id":56751,"date":"2025-03-28T10:01:19","date_gmt":"2025-03-28T09:01:19","guid":{"rendered":"https:\/\/www.schneider.systems\/microsoft-et-nvidia-blackwell-nim-gpu-sans-serveur-et-plus-encore\/"},"modified":"2025-03-28T10:30:42","modified_gmt":"2025-03-28T09:30:42","slug":"microsoft-et-nvidia-blackwell-nim-gpu-sans-serveur-et-plus-encore","status":"publish","type":"post","link":"https:\/\/www.schneider.systems\/fr\/microsoft-et-nvidia-blackwell-nim-gpu-sans-serveur-et-plus-encore\/","title":{"rendered":"Microsoft et NVIDIA : Blackwell, NIM, GPU sans serveur et plus encore"},"content":{"rendered":"<p style=\"text-align: justify;\">Avec effet au 24 mars 2025<strong>, Microsoft et <a href=\"https:\/\/www.schneider.systems\/fr\/microsoft-azure-ai-et-nvidia-ai\/\">NVIDIA<\/a><\/strong> <strong>ont annonc\u00e9<\/strong> <strong>plusieurs nouvelles avanc\u00e9es<\/strong> dans leur <strong>collaboration<\/strong> visant \u00e0 <strong>acc\u00e9l\u00e9rer le d\u00e9veloppement et les performances de l&rsquo;IA<\/strong>. Ces changements incluent l&rsquo;int\u00e9gration de la derni\u00e8re <strong>plateforme NVIDIA Blackwell<\/strong> dans l&rsquo;infrastructure Azure AI Services, l&rsquo;introduction de <strong>microservices d&rsquo;inf\u00e9rence NVIDIA NeMo (NVIDIA NeMo Inference Microservices, NIM) <\/strong>dans Azure AI Foundry, l&rsquo;introduction de <strong>GPU sans serveur<\/strong> <strong>et bien plus encore<\/strong>.<\/p>\n<p style=\"text-align: justify;\"><img loading=\"lazy\" decoding=\"async\" class=\"aligncenter size-full wp-image-56699\" src=\"https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more3.jpg\" alt=\"\" width=\"800\" height=\"450\" srcset=\"https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more3.jpg 800w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more3-500x281.jpg 500w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more3-150x84.jpg 150w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more3-768x432.jpg 768w\" sizes=\"auto, (max-width: 800px) 100vw, 800px\" \/><\/p>\n<p>&nbsp;<\/p>\n<h2 style=\"text-align: justify;\"><strong>Modifications<\/strong><\/h2>\n<h3 style=\"text-align: justify;\"><strong>Int\u00e9gration de la plateforme NVIDIA Blackwell<\/strong><\/h3>\n<p style=\"text-align: justify;\">La <strong>plateforme NVIDIA Blackwell<\/strong> repr\u00e9sente une avanc\u00e9e majeure dans le domaine de l&rsquo;IA et du calcul acc\u00e9l\u00e9r\u00e9 et int\u00e8gre l&rsquo;architecture GPU Blackwell. Par rapport aux architectures pr\u00e9c\u00e9dentes comme Hopper, Blackwell offre une acc\u00e9l\u00e9ration des couches attention jusqu&rsquo;\u00e0 2 fois plus rapide et une puissance de calcul de l&rsquo;IA (FLOPS) 1,5 fois plus \u00e9lev\u00e9e. Les couches attention sont un \u00e9l\u00e9ment important des r\u00e9seaux neuronaux modernes, en particulier dans les mod\u00e8les de traitement du langage naturel (NLP). Elles aident le mod\u00e8le \u00e0 se concentrer sur des parties pertinentes des donn\u00e9es d&rsquo;entr\u00e9e, en mettant l&rsquo;accent sur des mots ou des caract\u00e9ristiques sp\u00e9cifiques qui sont importants pour la t\u00e2che en cours. Ces am\u00e9liorations rendent Blackwell id\u00e9al pour le traitement de mod\u00e8les d&rsquo;IA contenant des trillions de param\u00e8tres essentiels pour l&rsquo;IA g\u00e9n\u00e9rative, le traitement des donn\u00e9es et les simulations techniques.<\/p>\n<p style=\"text-align: justify;\">La derni\u00e8re plateforme NVIDIA Blackwell est <strong>d\u00e9sormais int\u00e9gr\u00e9e \u00e0 l&rsquo;infrastructure Azure AI Services<\/strong>. Cette int\u00e9gration exploite la technologie GPU avanc\u00e9e de NVIDIA pour am\u00e9liorer les performances et l&rsquo;efficacit\u00e9 de l&rsquo;IA sur Azure. Les applications d&rsquo;IA ex\u00e9cut\u00e9es sur Azure b\u00e9n\u00e9ficient automatiquement de la vitesse et de l&rsquo;efficacit\u00e9 am\u00e9lior\u00e9es des GPU Blackwell, qui n&rsquo;ont pas besoin d&rsquo;\u00eatre s\u00e9lectionn\u00e9s ou configur\u00e9s s\u00e9par\u00e9ment.<\/p>\n<p>&nbsp;<\/p>\n<h3 style=\"text-align: justify;\"><strong>Introduction des microservices NVIDIA NIM<\/strong><\/h3>\n<p style=\"text-align: justify;\"><img loading=\"lazy\" decoding=\"async\" class=\"aligncenter size-full wp-image-56719\" src=\"https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more.jpg\" alt=\"\" width=\"800\" height=\"450\" srcset=\"https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more.jpg 800w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more-500x281.jpg 500w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more-150x84.jpg 150w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Website-LinkedIn-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more-768x432.jpg 768w\" sizes=\"auto, (max-width: 800px) 100vw, 800px\" \/><\/p>\n<p style=\"text-align: justify;\"><strong>Les microservices NVIDIA NIM<\/strong> aident \u00e0 d\u00e9ployer rapidement et de mani\u00e8re fiable des applications d&rsquo;IA dans diff\u00e9rents environnements tels que cloud et les centres de donn\u00e9es. Ils sont fournis avec des mod\u00e8les d&rsquo;IA pr\u00e9-construits et sont optimis\u00e9s pour des performances \u00e9lev\u00e9es et une faible latence. Il est ainsi plus facile pour les entreprises d&rsquo;utiliser l&rsquo;IA sans avoir \u00e0 g\u00e9rer une infrastructure complexe.<\/p>\n<p style=\"text-align: justify;\"><img loading=\"lazy\" decoding=\"async\" class=\"aligncenter size-full wp-image-56703\" src=\"https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more2.jpg\" alt=\"\" width=\"800\" height=\"233\" srcset=\"https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more2.jpg 800w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more2-500x146.jpg 500w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more2-150x44.jpg 150w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-26-Update-Website-Microsoft-and-NVIDIA-Blackwell-NIM-Serverless-GPUs-and-more2-768x224.jpg 768w\" sizes=\"auto, (max-width: 800px) 100vw, 800px\" \/><\/p>\n<p style=\"text-align: justify;\"><strong>Azure AI Foundry propose d\u00e9sormais des microservices NVIDIA NIM<\/strong> qui permettent aux d\u00e9veloppeurs de mettre rapidement sur le march\u00e9 des applications d&rsquo;intelligence artificielle aux performances optimis\u00e9es. Le mod\u00e8le de raisonnement (reasoning model) ouvert NVIDIA Llama Nemotron Reason sera \u00e9galement bient\u00f4t int\u00e9gr\u00e9 \u00e0 Azure AI Foundry.<\/p>\n<p>&nbsp;<\/p>\n<h3 style=\"text-align: justify;\"><strong>Optimisation des performances pour les mod\u00e8les Meta-Lama<\/strong><\/h3>\n<p style=\"text-align: justify;\"><strong>Les mod\u00e8les Llama de Meta<\/strong> (pr\u00e9c\u00e9demment connu sous le nom de Facebook) sont une famille de grands mod\u00e8les de langage (LLM) d\u00e9velopp\u00e9s pour diverses applications d&rsquo;IA. Par rapport \u00e0 Llama 3, le nouveau <strong>Llama 3.1<\/strong> offre une gestion avanc\u00e9e du contexte, une vitesse d&rsquo;inf\u00e9rence am\u00e9lior\u00e9e et un support multimodal am\u00e9lior\u00e9. Ils prennent en charge les capacit\u00e9s multilingues et multimodales, ce qui leur permet de traiter \u00e0 la fois les entr\u00e9es textuelles et visuelles.<\/p>\n<p style=\"text-align: justify;\">Microsoft et NVIDIA ont maintenant <strong>optimis\u00e9 les performances des mod\u00e8les Meta Llama avec TensorRT-LLM<\/strong>, am\u00e9liorant ainsi le d\u00e9bit et l&rsquo;efficacit\u00e9. <strong>Comment fonctionne cette optimisation ?<\/strong><\/p>\n<ul>\n<li style=\"text-align: justify;\"><strong>Quantification <\/strong>: TensorRT-LLM utilise diff\u00e9rentes techniques de quantification telles que FP8 et INT4 AWQ pour optimiser les mod\u00e8les. La quantification r\u00e9duit la pr\u00e9cision des calculs, ce qui augmente la vitesse sans affecter significativement la pr\u00e9cision.<\/li>\n<li style=\"text-align: justify;\"><strong>Noyaux Attention optimis\u00e9s <\/strong>: Les noyaux attention (unit\u00e9s de calcul sp\u00e9cialis\u00e9es au sein d&rsquo;un r\u00e9seau neuronal) ont \u00e9t\u00e9 sp\u00e9cialement adapt\u00e9s pour rendre les calculs plus efficaces. Cela am\u00e9liore les performances des couches attention (voir ci-dessus), qui sont essentielles pour le traitement des informations contextuelles.<\/li>\n<li style=\"text-align: justify;\"><strong>Mise en cache du KV <\/strong>: La mise en cache du KV peut \u00eatre utilis\u00e9e pour stocker et r\u00e9utiliser les r\u00e9sultats interm\u00e9diaires, ce qui acc\u00e9l\u00e8re les calculs et r\u00e9duit la latence.<\/li>\n<li style=\"text-align: justify;\"><strong>In-Flight Batching <\/strong>: Cette technique permet de traiter plusieurs requ\u00eates simultan\u00e9ment, ce qui augmente le d\u00e9bit et am\u00e9liore l&rsquo;efficacit\u00e9.<\/li>\n<\/ul>\n<p>&nbsp;<\/p>\n<h3 style=\"text-align: justify;\"><strong>Disponibilit\u00e9 g\u00e9n\u00e9rale des VM Azure ND GB200 V6<\/strong><\/h3>\n<p style=\"text-align: justify;\"><strong>Les machines virtuelles Azure ND GB200 V6<\/strong> sont con\u00e7ues pour fournir un calcul puissant pour les t\u00e2ches d&rsquo;intelligence artificielle et d&rsquo;apprentissage profond.<\/p>\n<ul style=\"text-align: justify;\">\n<li><strong>Calcul haute performance <\/strong>: Ces VM utilisent <strong>des GPU NVIDIA GB200 Blackwell<\/strong> qui sont tr\u00e8s avanc\u00e9s et rapides. Cela les rend id\u00e9ales pour le traitement de mod\u00e8les d&rsquo;IA complexes et de grands ensembles de donn\u00e9es.<\/li>\n<li><strong>Mise en r\u00e9seau efficace <\/strong>: Ils utilisent \u00e9galement <strong>les r\u00e9seaux NVIDIA Quantum InfiniBand<\/strong>, une technologie qui permet une communication tr\u00e8s rapide et \u00e0 faible latence entre les ordinateurs. Cela signifie que les donn\u00e9es peuvent \u00eatre transf\u00e9r\u00e9es rapidement et efficacement.<\/li>\n<li><strong>\u00c9volutivit\u00e9 <\/strong>: Ces VM peuvent connecter <strong>jusqu&rsquo;\u00e0 72 GPU<\/strong> dans un seul domaine NVLink. NVLink est une connexion \u00e0 haut d\u00e9bit qui permet aux GPU de travailler ensemble de mani\u00e8re transparente pour obtenir encore plus de performances et d&rsquo;efficacit\u00e9.<\/li>\n<li><strong>Performances am\u00e9lior\u00e9es <\/strong>: Par rapport aux versions ant\u00e9rieures, ces VM offrent des am\u00e9liorations significatives en termes de <strong>vitesse et d&rsquo;efficacit\u00e9<\/strong>. Cela garantit que les charges de travail d&rsquo;intelligence artificielle exigeantes s&rsquo;ex\u00e9cutent sans probl\u00e8me et rapidement.<\/li>\n<\/ul>\n<p>&nbsp;<\/p>\n<h3 style=\"text-align: justify;\"><strong>Extension du catalogue de mod\u00e8les Azure AI Foundry : Mistral Small 3.1<\/strong><\/h3>\n<p style=\"text-align: justify;\">Le <strong>catalogue Azure AI Foundry<\/strong> comprend d\u00e9sormais <strong><a href=\"https:\/\/www.schneider.systems\/fr\/microsoft-et-mistral-ai-mistral-large-disponible\/\">Mistral<\/a> Small 3.1<\/strong>, qui offre des capacit\u00e9s multimodales et une longueur de contexte \u00e9tendue.<\/p>\n<p style=\"text-align: justify;\"><img loading=\"lazy\" decoding=\"async\" class=\"aligncenter size-full wp-image-56742\" src=\"https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-24-Update-Website-Microsoft-Azure-Mistral-Small-3.1.png\" alt=\"\" width=\"624\" height=\"182\" srcset=\"https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-24-Update-Website-Microsoft-Azure-Mistral-Small-3.1.png 624w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-24-Update-Website-Microsoft-Azure-Mistral-Small-3.1-500x146.png 500w, https:\/\/www.schneider.systems\/media\/2025\/03\/SCHNEIDER-IT-MANAGEMENT-2025-03-24-Update-Website-Microsoft-Azure-Mistral-Small-3.1-150x44.png 150w\" sizes=\"auto, (max-width: 624px) 100vw, 624px\" \/><\/p>\n<p style=\"text-align: justify;\">Ce mod\u00e8le est parfaitement adapt\u00e9 aux applications telles que la programmation, l&rsquo;argumentation, le dialogue et l&rsquo;analyse de documents. Par rapport aux versions pr\u00e9c\u00e9dentes, Mistral Small 3.1 offre des performances textuelles am\u00e9lior\u00e9es, une compr\u00e9hension multimodale et une fen\u00eatre contextuelle \u00e9tendue pouvant contenir jusqu&rsquo;\u00e0 128 000 tokens.<\/p>\n<p>&nbsp;<\/p>\n<h3 style=\"text-align: justify;\"><strong>Introduction des GPU sans serveur<\/strong><\/h3>\n<p style=\"text-align: justify;\"><strong>Les GPU sans serveur<\/strong> offrent une solution \u00e9volutive et flexible pour l&rsquo;ex\u00e9cution de travaux d&rsquo;intelligence artificielle \u00e0 la demande, sans n\u00e9cessiter de gestion d&rsquo;infrastructure sp\u00e9cifique. Ces GPU sont disponibles dans un environnement sans serveur et permettent une mise \u00e0 l&rsquo;\u00e9chelle automatique, un d\u00e9marrage \u00e0 froid optimis\u00e9 et une facturation \u00e0 la seconde. Par rapport aux configurations GPU traditionnelles, les GPU sans serveur offrent les avantages de l&rsquo;acc\u00e9l\u00e9ration GPU tout en minimisant les efforts op\u00e9rationnels et les co\u00fbts. C&rsquo;est important car cela permet aux entreprises d&rsquo;utiliser des ressources GPU puissantes pour l&rsquo;inf\u00e9rence en temps r\u00e9el, le traitement par lots et d&rsquo;autres applications d&rsquo;intelligence artificielle dynamiques, sans la complexit\u00e9 et les co\u00fbts de gestion du mat\u00e9riel physique. L&rsquo;inf\u00e9rence en temps r\u00e9el est la capacit\u00e9 d&rsquo;utiliser des mod\u00e8les d&rsquo;IA en temps r\u00e9el pour faire des pr\u00e9dictions ou prendre des d\u00e9cisions instantan\u00e9es. Le traitement par lots est un processus qui consiste \u00e0 traiter de grandes quantit\u00e9s de donn\u00e9es par blocs ou \u00ab\u00a0piles\u00a0\u00bb afin de pouvoir traiter de nombreuses donn\u00e9es simultan\u00e9ment.<\/p>\n<p style=\"text-align: justify;\"><strong>Azure Container Apps prend d\u00e9sormais en charge les GPU sans serveur avec NVIDIA NIM<\/strong>, offrant ainsi une solution \u00e9conomique pour l&rsquo;ex\u00e9cution de charges de travail d&rsquo;intelligence artificielle \u00e0 la demande.<\/p>\n<p>&nbsp;<\/p>\n<h2 style=\"text-align: justify;\"><strong>Plus d&rsquo;informations<\/strong><\/h2>\n<p style=\"text-align: justify;\"><strong>Annonce de l&rsquo;\u00e9v\u00e9nement :<\/strong> <a href=\"https:\/\/azure.microsoft.com\/en-us\/blog\/microsoft-and-nvidia-accelerate-ai-development-and-performance\/\">https:\/\/azure.microsoft.com\/en-us\/blog\/microsoft-and-nvidia-accelerate-ai-development-and-performance\/.<\/a><\/p>\n<p style=\"text-align: justify;\">Visitez <strong>Azure AI Foundry<\/strong> <a href=\"https:\/\/ai.azure.com\/\">: https:\/\/ai.azure.com\/.<\/a><\/p>\n<p style=\"text-align: justify;\"><a href=\"https:\/\/www.schneider.systems\/contact\/\"><strong>Contactez SCHNEIDER IT MANAGEMENT<\/strong><\/a><strong> d\u00e8s aujourd&rsquo;hui pour des conseils sur l&rsquo;octroi de licences Azure, afin de r\u00e9duire les co\u00fbts sur Azure et de b\u00e9n\u00e9ficier des derni\u00e8res am\u00e9liorations d&rsquo;Azure.<\/strong><\/p>\n","protected":false},"excerpt":{"rendered":"<p>Avec effet au 24 mars 2025, Microsoft et NVIDIA ont annonc\u00e9 plusieurs nouvelles avanc\u00e9es dans leur collaboration visant \u00e0 acc\u00e9l\u00e9rer le d\u00e9veloppement et les performances de l&rsquo;IA. Ces changements incluent [&hellip;]<\/p>\n","protected":false},"author":11,"featured_media":33017,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[250,1022],"tags":[],"class_list":["post-56751","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-microsoft-azure-fr","category-nvidia-fr"],"_links":{"self":[{"href":"https:\/\/www.schneider.systems\/fr\/wp-json\/wp\/v2\/posts\/56751","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/www.schneider.systems\/fr\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/www.schneider.systems\/fr\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/www.schneider.systems\/fr\/wp-json\/wp\/v2\/users\/11"}],"replies":[{"embeddable":true,"href":"https:\/\/www.schneider.systems\/fr\/wp-json\/wp\/v2\/comments?post=56751"}],"version-history":[{"count":1,"href":"https:\/\/www.schneider.systems\/fr\/wp-json\/wp\/v2\/posts\/56751\/revisions"}],"predecessor-version":[{"id":56752,"href":"https:\/\/www.schneider.systems\/fr\/wp-json\/wp\/v2\/posts\/56751\/revisions\/56752"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/www.schneider.systems\/fr\/wp-json\/wp\/v2\/media\/33017"}],"wp:attachment":[{"href":"https:\/\/www.schneider.systems\/fr\/wp-json\/wp\/v2\/media?parent=56751"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/www.schneider.systems\/fr\/wp-json\/wp\/v2\/categories?post=56751"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/www.schneider.systems\/fr\/wp-json\/wp\/v2\/tags?post=56751"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}