撰文:Techub News 整理
导语
北京时间 2025 年 3 月,NVIDIA 年度技术盛会 GTC 在美国圣何塞盛大开幕。在长达两个多小时的主题演讲中,公司创始人兼 CEO Jensen Huang(黄仁勋)再次以标志性的皮衣造型登台,向全球开发者、合作伙伴与行业观察者展示了 AI 浪潮下的最新进展与未来蓝图。本次演讲被外界誉为「AI 超级碗」,其重要性在于,它不仅宣告了 Blackwell 架构 GPU 的全面量产,更系统性地阐述了 AI 发展已进入以「推理」和「具身智能」为核心的新范式,并揭示了由此引发的百倍级计算需求增长。
黄仁勋在演讲中强调,AI 正在经历从生成式(Generative AI)到智能体(Agentic AI),再到物理 AI(Physical AI)与机器人的演进。当前,支持智能体「推理」能力的 AI 模型,其计算需求远超一年前的预期。为此,NVIDIA 提出了「AI 工厂」的概念,并发布了旨在管理这种新型计算范式的操作系统「Dynamo」。同时,在机器人领域,NVIDIA 宣布开源其通用机器人基础模型 Groot N1,并与 DeepMind、迪士尼研究部门联合推出了新一代物理引擎「Newton」,标志着具身智能的产业化进程全面加速。
摘要
- 推理计算需求爆发:由于智能体 AI 需要进行逐步推理、一致性检查等复杂思考,其生成的令牌(Token)数量可能是传统生成式 AI 的百倍以上,对计算基础设施提出了前所未有的要求。
- 「AI 工厂」与操作系统:未来数据中心将转变为专注于「生成令牌」的 AI 工厂。NVIDIA 推出开源操作系统「Dynamo」,用于在超大规模 GPU 集群上动态调度和管理复杂的推理工作负载。
- Blackwell 平台全面就绪:Blackwell 架构 GPU 已投入全速生产,其 MVLink 72 机架级系统在同等功耗下,推理性能较上一代 Hopper 提升高达 40 倍,旨在应对推理计算的极端需求。
- 机器人时代开启:通过 Omniverse 数字孪生平台、生成式模型 Cosmos 以及新的物理引擎 Newton,NVIDIA 构建了完整的机器人开发与训练堆栈,并开源 Groot N1 模型,加速通用机器人产业发展。
- 全栈 AI 基础设施落地:从云端 AI 工厂、企业级 AI 工作站(DGX Spark/Station),到边缘通信网络(与 T-Mobile、思科合作),再到机器人计算平台,NVIDIA 正在构建覆盖所有场景的 AI 基础设施。
AI 的范式转移:从生成到推理,再到物理世界
黄仁勋开篇回顾了 AI 过去十年的发展历程:从感知 AI(计算机视觉、语音识别)到生成式 AI,再到如今的智能体 AI 和物理 AI。他指出,生成式 AI 从根本上改变了计算模式,从过去的「检索计算」转变为「生成计算」。而当前的关键突破在于智能体 AI,其核心是赋予了 AI「推理」能力。AI 可以感知上下文,规划步骤,使用工具,并通过「思维链」等技术逐步解决问题,而非一次性输出答案。
这种转变带来了计算需求的指数级增长。黄仁勋解释,当一个 AI 进行逐步推理时,它需要生成一系列代表思考步骤的令牌。例如,解决一个复杂的婚宴座位安排问题,传统模型可能快速生成 500 个令牌但答案错误,而推理模型则需要生成近 9000 个令牌来逐步推导出正确答案。这不仅仅是令牌数量的增加,为了保持交互的实时性,计算速度也需要同步提升。「两者叠加,我们需要的计算量很容易达到一年前预期的一百倍以上。」黄仁勋强调。
支撑智能体 AI 的训练方式也发生了变革。通过强化学习与可验证结果(如数学定理、物理定律)相结合,AI 可以在海量合成数据上进行自我训练,无需完全依赖有限的人类标注数据。这解决了数据和训练规模化的根本问题,但也将「极端计算」的挑战摆在了整个产业面前。
AI 工厂:计算基础设施的根本性重塑
面对百倍增长的计算需求,黄仁勋提出了「AI 工厂」的概念。未来的数据中心不再仅仅是运行传统软件的地方,而是一座座专门「生产」智能令牌的工厂。这些令牌被重组为文本、图像、视频、蛋白质结构或商业洞察,直接创造价值。因此,AI 工厂的运营效率直接关系到服务质量和经济收益。
AI 工厂的运营面临一个根本性矛盾:既要为单个用户提供快速(低延迟)的智能响应,又要让整个工厂能同时服务海量用户(高吞吐量)。黄仁勋用一张图表阐释了这一挑战,横轴是用户体验的令牌生成速度,纵轴是整个工厂的令牌产出吞吐量,理想状态是同时最大化两者。这要求基础设施必须具备极高的计算性能(FLOPS)和内存带宽。
为此,NVIDIA 推出了划时代的 Blackwell 平台。其顶级配置 MVLink 72 将一个机柜内的所有 GPU 通过高速互联整合成一个巨型计算设备,提供每秒 1 Exaflops(百亿亿次)的计算能力和 576 TB/s 的内存带宽。黄仁勋展示的数据显示,在同等功耗下,Blackwell MVLink 72 系统在推理工作负载上的性能可达上一代 Hopper 系统的25 倍,而在处理需要复杂推理的模型时,性能优势更可达40 倍。他直言:「当 Blackwell 开始大规模出货时,Hopper 可能会无人问津。」
然而,硬件只是基础。如何在如此庞大且异构的 GPU 集群上高效运行万亿参数模型,并动态分配资源以应对「上下文填充」和「令牌解码」等不同计算阶段的需求,需要极其复杂的软件调度。NVIDIA 今日发布的Dynamo,正是为解决这一问题而生。黄仁勋将其称为「AI 工厂的操作系统」。Dynamo 可以动态管理模型在数万张 GPU 上的张量并行、流水线并行、专家并行等复杂分布策略,并能将计算资源在「思考」和「输出」任务间灵活调配。NVIDIA 宣布将 Dynamo 开源,并与 Perplexity 等合作伙伴共同推进其生态。
攻克通信瓶颈:硅光子与下一代网络
为了将 AI 工厂扩展到数十万甚至数百万 GPU 的规模,传统的网络连接方式在功耗和成本上已难以为继。黄仁勋指出,在当前架构下,每个 GPU 可能需要 6 个光模块,每个功耗 30 瓦,成本约 1000 美元。对于一个百万 GPU 的数据中心,仅光模块的功耗就将高达 180 兆瓦,成本高达 60 亿美元。
NVIDIA 的解决方案是硅光子技术。黄仁勋展示了全球首款 1.6 Tb/s 的共封装光学(CPO)交换机芯片,其核心是采用微环谐振器调制器技术。该技术将光子集成电路、电子集成电路通过 3D 封装集成,实现了极高的密度和能效。相比传统方案,新技术能节省数据中心数十兆瓦的功耗,这些宝贵的电力可以转而用于增加更多的计算单元。搭载该技术的 Spectrum-X 以太网平台预计将于 2026 年下半年上市,为超大规模 AI 集群铺平道路。
机器人:物理 AI 的终极体现与产业爆发
演讲的后半段,焦点转向了物理 AI 和机器人。黄仁勋认为,机器人是解决全球劳动力短缺的关键,未来将成为一个巨大的产业。NVIDIA 为此提供了涵盖仿真、训练、部署的完整计算平台。
核心挑战依然是数据和训练。NVIDIA 通过 Omniverse 数字孪生平台生成高度逼真且多样化的合成训练数据,并通过物理引擎提供可验证的奖励信号来训练机器人 AI。黄仁勋宣布了两项重大进展:一是与 DeepMind、迪士尼研究部门联合推出的新一代 GPU 加速物理引擎Newton,专注于刚体、软体和触觉反馈的高保真、超实时仿真,为机器人精细技能训练提供基础。二是开源其通用人形机器人基础模型Groot N1。该模型采用「快思考」与「慢思考」双系统架构,能感知环境、进行推理规划,并控制机器人执行复杂任务序列。
「物理 AI 和机器人技术的发展速度如此之快,」黄仁勋提醒道,「这很可能成为未来最大的产业。」
从云到端:全栈 AI 基础设施的全面落地
黄仁勋强调,AI 将无处不在,而不仅限于云端。NVIDIA 正在构建覆盖所有场景的 AI 基础设施:
- 云端与 AI 工厂:Blackwell 平台及 Dynamo 操作系统,服务于超大规模 CSP 和 AI 公司。
- 企业级:推出全新的 AI 工作站产品线,包括便携式「DGX Spark」(与联发科合作)和桌面级「DGX Station」,将强大的 AI 计算能力带给每一位开发者和数据科学家。同时,与戴尔、慧与等 OEM 厂商合作,提供全栈企业 AI 解决方案,甚至重新定义了未来的「语义存储」系统。
- 边缘与通信:宣布与 T-Mobile、思科、CUS-ODC 合作,在美国构建融合 AI 的电信边缘计算全栈,旨在用 AI 革新无线通信网络。
- 自动驾驶:宣布通用汽车选择 NVIDIA 作为合作伙伴,共同构建其未来的自动驾驶车队。黄仁勋还特别介绍了 NVIDIA 在功能安全(DRIVE Halos)方面的深厚投入。
最后,黄仁勋公布了清晰的产品路线图,承诺每年更新一次架构,每两年推出新产品系列,并预告下一代平台将以著名物理学家「维拉·鲁宾」和「理查德·费曼」的名字命名。在结束演讲前,他再次感谢了全球开发者生态,并播放了一段由 AI 生成、致敬人类探索精神的震撼影片,将全场气氛推向高潮。
整场演讲表明,NVIDIA 已不再仅仅是一家芯片公司,而是作为 AI 革命的「总建筑师」,通过从硅、系统、软件到生态的全栈创新,正在定义和构建智能时代的核心基础设施。
免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。