在8月的Hot Chips大会上,NVIDIA把“代理AI(Agentic AI)”从概念推进到可落地的算力架构。根据现场发布,面向代理式应用的核心组件正在同时加速:一方面,专为代理AI设计的Vera CPU已确认被SpaceXAI接入,用于其Grok相关基础设施与Starmind AI卫星;另一方面,NVIDIA宣布Groq 3 LPX推理芯片进入全面量产,并提供极快的生成速度,成为Vera Rubin平台的高速引擎。
NVIDIA的判断是:AI从过去的“回答问题”,进阶到“能自主完成任务”的代理时代后,算力分工必须重做。过去很多工作都由GPU一肩挑,但代理场景往往包含多步流程、工具调用、代码编写与编排等复杂环节,容易引入延迟瓶颈。因此,Vera Rubin平台把计算任务重新拆解:Vera CPU承担“逻辑指挥官”的角色,负责写代码、调外部工具、进行流程编排;而Groq 3 LPX则像“极速引擎”,专注于以低延迟输出文本与指令。
其中,Vera CPU是本次关注点。NVIDIA表示,这是业界首款面向AI代理打造的处理器。它不再主要押注矩阵计算,而是强调在代理任务中的整体执行效率:通过自研Olympus核心以及高带宽能力来提升任务完成速度。SpaceXAI也指出,在训练与运行Grok模型时,Vera CPU会接管大量“繁重但不以图形计算为主”的工作,比如代码生成、数据过滤与多模块编排,从而让GPU把算力更充分地用于核心加速,整体数据中心能效更高。
合作不只停留在地面算力工厂。随着SpaceXAI将Grok基础设施扩到更大规模,双方还透露计划把Vera Rubin NVL72机架级系统推向太空轨道,用于第一代Starmind AI卫星。考虑到航天环境的散热、功耗与带宽限制,NVIDIA强调这套高度集成的架构有望让代理AI在“从地表到太空”的条件下仍能稳定运行。
在推理端,Groq 3 LPX同样给出硬指标:NVIDIA称其在基准测试中能达到每秒约3400个输出token,代理模型在长上下文下依然能快速生成。低延迟架构让涉及代码与工程化任务的响应时间显著缩短。首批采用者包括Nebius等,且GroqCloud也已将该芯片整合进服务体系。
换句话说,NVIDIA正在用Vera CPU的代理逻辑能力与Groq 3 LPX的极速推理能力,完成Vera Rubin平台的关键拼图:让AI计算从“自动生成”走向“可执行的代理化自动化”。