英伟达高层透露Groq机架全面量产 AI推理战局加剧


英伟达的高层领导近日表示,Groq 3 LPX机架已经进入全面生产阶段,这意味着该公司历史上最大的收购案所带来的技术正式进入市场应用。美国东部时间8月24日,英伟达的高级总监Dion Harris指出,Groq机架将与Vera中央处理器及Rubin图形处理器一起部署到新成立的云服务提供商Nebius的数据中心,并计划在今年年底上线。英伟达加速了对Groq芯片的生产和交付,反映出低延迟推理在市场中的越来越重要性。低延迟推理能够提高AI的响应速度,显著减少用户等待时间,尤其在编程等场景中显得更加必要。Harris强调,云服务商可以利用这种token(词元)服务收取更高费用,这使得他们能为对延迟极其敏感的用户推出高端服务包。去年的12月,英伟达以200亿美元收购Groq,获得其芯片技术授权,多位核心员工随之加入英伟达,其中创始人Jonathan Ross成为英伟达的首席软件架构师。今年3月,英伟达推出了针对Vera Rubin平台开发的推理加速器Groq 3 LPX。该架构在芯片本体中整合了500MB的高速静态随机存储器(SRAM),以缓解内存相关的瓶颈。据悉,Groq芯片由三星生产,而英伟达的GPU则是由台积电制造。每个LPX机架可以整合256颗Groq 3,英伟达引用Artificial Analysis的测试数据称,这样整合后的机架能够每秒处理3400个token。当前,市场竞争愈发激烈。AMD早前宣布将其机架级系统与Cerebras的芯片进行融合,而Cerebras近期也刚上市,主要集中于低延迟推理领域。与此同时,OpenAI推出的“Ultrafast”模式承诺每秒处理750个token,由Cerebras技术支持。值得注意的是,低延迟芯片并不能完全取代目前AI芯片的主力GPU。GPU既可以用于训练,也能进行推理,具备灵活应对新技术和新模型的能力。而Groq这类低延迟芯片则主要集中于模型服务中的“解码”(decode)环节。Harris强调:“这并不是为了替代GPU,而是为了在不同工作负载中,选用更具性价比和处理能力的处理器。”英伟达也在加快推进Vera Rubin系统的出货速度。黄仁勋曾预计到2027年,当前一代的Blackwell芯片与新一代Vera Rubin系统的销售额将累计达到1万亿美元。他还表示,计划在数据中心中约四分之一的空间分配给Groq芯片,而其余部分则将100%使用Vera Rubin。