NVIDIA a publié le CUDA Toolkit 13.4 le 9 septembre 2026. La nouveauté principale pour les développeurs sous Windows : le support officiel de la plateforme Windows on Arm, jusqu’ici réservé à Linux sur Arm. L’annonce figure dans le billet technique NVIDIA signé Jonathan Bentz.
Concrètement, les applications CUDA peuvent désormais être développées nativement sur Windows Arm64. Les bibliothèques mathématiques du toolkit (dont cuBLAS) couvrent aussi l’écosystème portable N1X / RTX Spark. Le téléchargement et la liste des plateformes supportées restent sur developer.nvidia.com/cuda-toolkit.
Rubin en preview, MPS V3 et découplage du driver
La même version ajoute un support fonctionnel en preview de l’architecture GPU Rubin (compute capability 107, cible compilateur SM_107). Objectif annoncé : permettre aux équipes de démarrer le portage avant la disponibilité générale dans une release CUDA ultérieure.
Côté infrastructure, Multi-Process Service V3 modernise le partage d’un GPU entre plusieurs processus : interface en ligne de commande scriptable, instances nommées, configuration TOML, contrôle des partitions SM et limites mémoire intégrées aux cgroups, utile en environnement conteneurisé.
Parmi les autres points techniques : CUDA Compute Fabric Transport (API destinée surtout aux auteurs de bibliothèques de communication sur fabric NVLink ; NVIDIA renvoie la plupart des applications vers NCCL ou NVSHMEM), domaines de localité, interrogation de la résidence mémoire unifiée, et un changement d’installation notable. Les installateurs SDK ne livrent plus le pilote NVIDIA : il faut installer séparément le driver (nvidia-open ou équivalent) et le toolkit. Sur les plateformes cohérentes Grace Hopper, Grace Blackwell et Vera Rubin, le mode mémoire par défaut bascule vers CDMM plutôt que NUMA. Le mode NUMA reste disponible via un paramètre du module noyau, à régler avant la montée de version.
Python, CCCL et outils Nsight
CUDA Python progresse avec cuda.core 1.1 (textures et surfaces, mémoire managée plus consciente du NUMA, stubs .pyi) et cuda.compute 1.1 (compilation anticipée d’algorithmes CCCL pour plusieurs architectures GPU). CCCL 3.4 met en avant un DeviceScan spécialisé pour Blackwell, annoncé jusqu’à environ 92 % d’utilisation de la bande passante mémoire, ainsi que des algorithmes parallèles du C++ Standard Library exposés sous cuda::std avec la politique cuda::execution::gpu.
Nsight Systems 2026.5.1 et Nsight Compute 2026.3 suivent CUDA 13.4, Rubin et Windows on Arm. Host compilers : compatibilité étendue à GCC 16 et Clang 22 sur les plateformes concernées.
En résumé pour les équipes Windows Arm : le blocage CUDA historique sur cette combinaison OS / architecture est levé dans le 13.4. Le reste du changelog s’adresse surtout aux stacks multi-GPU, aux runtimes Python et aux équipes qui préparent Rubin. Source : NVIDIA Technical Blog, 9 septembre 2026.

