课程介绍

NVIDIA AI数据中心网络实战:架构设计、Spectrum-X、InfiniBand、Kubernetes与运维全解析。
您将会学到
- 理解NVIDIA AI数据中心网络架构:了解GPU、DPU、交换机和存储如何协同工作以支持AI工作负载。
- 解释AI工厂设计原则:学习轨道优化的网络拓扑结构,以实现可扩展的高性能NVIDIA环境。
- 区分NVIDIA Spectrum-X以太网和InfiniBand网络概念:掌握这些概念在AI训练和推理工作负载中的应用。
- 理解GPU到GPU通信的基础知识:了解网络设计如何影响延迟、吞吐量和AI性能。
- 学习NVIDIA AI网络环境中的核心概念:包括服务质量(QoS)、拥塞控制、遥测和可观测性。
- 理解Kubernetes与NVIDIA AI网络的集成:包括RDMA、InfiniBand和GPU资源感知。
- 培养架构推理能力:分析AI网络性能、可扩展性和可靠性挑战。
- 为NVIDIA NCP-AIN认证做好准备:具备强大的概念清晰度和以设计为中心的理解。
要求
- 基本了解计算机网络概念(IP、路由、交换)
- 对数据中心或云基础设施概念的一般熟悉
- 了解AI、GPU计算或机器学习工作流程(有帮助但不是必须的)
- 对AI基础设施、数据中心设计或高性能网络的兴趣
描述
本课程的重点在于通过清晰的概念理解和全面的基础知识掌握来通过认证考试。此课程是一个快速通道,旨在节省时间并在限定时间内覆盖整个课程大纲以及深化理解。本课程包括2本电子书,您可以下载并详细阅读。
NVIDIA认证专业AI网络(NCP-AIN)
现代AI工作负载需要专门构建的网络架构,而非传统的数据中心设计。高性能GPU、超低延迟结构、轨道优化拓扑、拥塞感知路由和GPU到GPU通信模式从根本上改变了AI数据中心的设计、优化和操作方式。
此课程是专门为准备NVIDIA认证专业AI网络(NCP-AIN)认证的专业人员以及任何希望深入、系统地理解NVIDIA AI网络生态系统的个人创建的一个概念驱动、架构聚焦的学习体验——无需依赖动手实验。
不同于孤立的命令或供应商特定演示,这种培训专注于NVIDIA AI网络的工作原理,帮助您从基础开始建立一个清晰的心理模型,了解AI数据中心的网络。
本课程关注点
本课程将带您全面了解NVIDIA AI网络全景,从AI数据中心设计基础开始,经过基于以太网的Spectrum-X结构、InfiniBand架构、Kubernetes集成、可观察性和自动化——纯粹从概念和设计角度出发。
您将获得对以下方面的清晰理解:
- NVIDIA AI工厂是如何架构的
- 轨道优化拓扑对于大规模GPU集群的重要性
- GPU到GPU通信模式如何影响网络设计
- 拥塞、延迟和吞吐量在AI结构中的管理方式
- NVIDIA Spectrum-X与InfiniBand的区别及各自的应用场景
- DPUs、BlueField、SuperNICs和遥测如何融入AI网络
- Kubernetes如何与RDMA和InfiniBand网络集成
- 企业AI网络的监控、分析和自动化
核心主题包括
- AI数据中心设计与优化
- AI工厂架构和核心组件(GPUs, DPUs, 交换机,可扩展单元)
- 以太网与InfiniBand用于AI工作负载的对比
- AI吞吐量的存储考虑
- 针对AI网络的轨道优化和可扩展拓扑
- GPU到GPU通信基础
- NVIDIA Spectrum-X网络(概念性)
- Spectrum-X架构和设计理念
- QoS、ECN、PFC、遥测和拥塞管理概念
- 使用BGP-EVPN实现多租户AI网络的微分段
- NetQ、CloudAI基准测试和可观察性基础
- 理解WJH®(What Just Happened)遥测
- NVIDIA InfiniBand网络(概念性)
- InfiniBand架构和结构组件
- 子网管理器、分区和PKeys
- QoS和自适应路由概念
- 面向AI可扩展性的轨道优化InfiniBand设计
- 使用NVIDIA统一结构管理器(UFM)进行监控
- Kubernetes和AI网络集成
- NVIDIA网络操作员架构
- 在Kubernetes中启用RDMA和InfiniBand
- GPU资源意识和调度概念
- 容器化环境中AI工作负载的网络考虑
- 可观察性、故障排除和自动化
- 基于遥测的故障排除方法
- 使用NetQ、UFM、WJH和诊断工具的概念
- 理解拥塞、丢包和延迟的根本原因
- NVUE模板和Ansible自动化概念
- 零接触和大规模AI网络操作
本课程适合人群 本课程非常适合网络工程师转向AI基础设施、数据中心架构师处理GPU或AI工作负载、支持AI平台的基础设施和平台工程师、与AI工作负载合作的Kubernetes专业人士、准备NVIDIA NCP-AIN认证的专业人士、以及想要在实施前清楚掌握基础知识的建筑师和技术领导者。
不需要先前的NVIDIA网络实践经验。课程设计为从第一原理开始构建理解。
为什么选择本课程
- 基础知识优先,不依赖实验室环境
- 使用流程图、方块图和示意图进行清晰的架构解释
- 与认证对齐,但避免考前突击
- 企业级视角,而不是工具记忆
- 进阶或实践培训的理想基础
此课程赋予您自信,能够对AI网络设计进行推理,有效地与架构师和供应商沟通,并以清晰的方式应对现实世界的AI数据中心挑战。
此课程面向哪些人:
- 希望转向AI数据中心和GPU网络角色的网络工程师
- 设计或支持基于AI和GPU环境的数据中心和基础设施架构师
- 与AI工作负载和高性能网络合作的平台和云工程师
- 希望理解AI网络集成概念的Kubernetes专业人士
- 寻求架构级别清晰度的AI基础设施、MLOps和平台团队
- 参与AI数据中心设计和规划的技术主管和决策者
- 准备NVIDIA认证专业AI网络(NCP-AIN)认证的专业人士
- 在执行前希望理解设计原则、权衡和架构的工程师