
NVIDIA 釋出 CUDA 13.4 Toolkit,率先加入 Windows on Arm 支援,讓開發者提前為 10 月登場的 RTX Spark 做準備,同時開放 Vera Rubin 架構的預覽存取權限。
CUDA 終於補上 Windows on Arm 這一塊拼圖
NVIDIA 正式釋出最新的 CUDA 13.4 Toolkit,這次更新的重點一方面替即將於 10 月上市的 RTX Spark 系列 Windows on Arm 裝置鋪路,另一方面也悄悄讓開發者提早接觸下一代 Vera Rubin 架構。對長期關注 NVIDIA 開發者生態系的人來說,這波更新算是把「軟體先行、硬體後到」的節奏拉得更明顯。
過去 NVIDIA 雖然已經在 Jetson 與 Linux Arm64 SBSA 平台上提供 CUDA 支援,但 Windows Arm64 一直是空白地帶。CUDA 13.4 這次正式補上這塊拼圖,而且是真正意義上的原生支援,而非透過模擬層或 Linux 交叉編譯繞路。開發者現在可以直接在既有的 Windows on Arm 裝置上,驗證函式庫相依性、抓出不相容的元件,並產出第一版原生 Arm64 應用程式,完全不需要等到手上有實體 RTX Spark 才能開始動工。
NVIDIA 也建議開發者同時測試純 Arm64 版本與 Arm64EC 版本,後者可以讓原生 Arm 元件與既有的 x64 函式庫在同一個應用程式中並存運作,對於還在過渡期的軟體來說相對友善。整個工具包內含 NVCC 編譯器、執行環境元件、匯入函式庫、數學函式庫,以及 Nsight Compute、Nsight Systems 等除錯與效能分析工具,算是把開發者常用的工具鏈一次到位。
值得注意的是,這套 CUDA 13.4 需要搭配全新的 R616 系列開發者驅動程式 (從 616.00 版本開始) 才能發揮新平台的功能,而且驅動程式不會像過去一樣包在工具包裡,必須另外下載安裝。NVIDIA 也明確表示,目前這個版本屬於開發者預覽性質,還不建議用在正式產品、認證流程或商用關鍵系統上。
RTX Spark 是 NVIDIA 針對 Windows on Arm 打造的新平台,採用 Blackwell RTX GPU 搭配 Grace CPU 的組合,最高可配置 6,144 個 CUDA 核心、20 核心 Grace CPU,以及每秒 1 petaflop 的 FP4 AI 運算效能。微軟推出的 Surface RTX Spark Dev Box 是這波開發者預覽驅動程式優先鎖定的裝置,主打全鋁合金無風扇散熱設計,內建 Windows 11 Pro 並預先配置好 WSL 2 GPU 存取、CUDA 支援、Visual Studio Code、GitHub Copilot、Git、Python、Node.js 與 PowerShell 7,微軟方面宣稱這套系統在特定條件下可在本機執行超過 1200 億參數規模的模型。
NVIDIA 選擇讓 CUDA 與驅動程式提前一個多月釋出,用意是讓開發者在 RTX Spark 正式鋪貨前,就能先把應用程式、AI 工具、創作軟體乃至遊戲的相容性問題排除掉,等硬體真的上市時,生態系已經準備好迎接第一批使用者,而不是讓消費者買到裝置後才發現「能跑的軟體沒幾套」。
除了 Windows on Arm 之外,CUDA 13.4 另一個重點是替 Vera Rubin 這個下一世代 GPU 架構 (運算能力代號 107) 開放功能性支援預覽。這讓開發者可以在正式進入 GA (全面上市) 版本之前,就先針對 Rubin 架構進行程式移植與驗證作業,對維護核心函式庫的團隊來說格外重要,畢竟底層數學函式庫要能跟上新架構,才能讓上層應用程式順利銜接。NVIDIA 將 Rubin 定位為推動「代理式 AI (Agentic AI)」時代的新一代架構,這也呼應了近期業界對 AI 推理與自主代理工作負載愈來愈重視的趨勢。
除了上述兩大重點,CUDA 13.4 也對整體平台做了廣泛更新,包括 CUDA 編譯器、PTX ISA、CUDA C++、CUDA Tile 程式設計模型、執行期 API、函式庫與開發工具等面向。其中,Multi-Process Service V3 導入了現代化的控制層,提供可腳本化的 CLI 介面、具名伺服器執行個體、TOML 設定檔格式,以及整合 cgroup 的 GPU 記憶體限制機制,讓容器化環境中的 GPU 資源分割可以做得更精細。CUDA Compute Fabric Transport 則提供了以傳輸為核心的 API,方便通訊函式庫開發者透過具名邏輯端點與非同步操作,在 NVLink 架構上搬運資料。另外,CUDA Python 也同步擴充,cuda.core 更新至 1.1.0 版本,新增紋理與表面程式設計、支援 NUMA 感知的受管理記憶體,以及 .pyi 型別存根;cuda.compute 1.1 則讓 CCCL 演算法能針對多種 GPU 架構進行提前編譯。
目前 NVIDIA CUDA 13.4 Toolkit 已經開放下載,對於手上有 Windows on Arm 裝置、或是想提早研究 Vera Rubin 架構的開發者來說,這波更新值得列入待辦清單。
延伸閱讀












