浪潮信息刘军:计算产业的新使命是生产智能

近日,在北京举行的2026人工智能计算大会(AICC2026)上,浪潮信息首席AI战略官刘军提出,未来AI计算正形成能力型智算(Capability AI Compute)和容量型智算(Capacit

近日,在北京举行的2026人工智能计算大会(AICC2026)上,浪潮信息首席AI战略官刘军提出,未来AI计算正形成能力型智算(Capability AI Compute)和容量型智算(Capacity AI Compute)两个新的发展维度,前者支撑智能上限的突破,后者推动智能充分供给。

会上,浪潮信息发布元脑AI超节点SD200 Ultra和元脑HC2000多元算力机组,其中,SD200 Ultra可承载2.8万亿参数模型,Token生成时延低至5.85毫秒,打造能力型智算标杆;HC2000则通过多元算力协同提升Token产能,同等投资下Token产能提升10倍,为智能应用规模化落地提供更高效的算力供给。

智能已成为生产要素

刘军表示,过去,智能一直是人类社会最重要、同时也是最稀缺的资源之一。如今,智能正在像计算、像电一样,成为一种可以大规模生产和供给的生产要素。人工智能的发展也由此出现了两个同样重要的方向:一个方向,是不断向上(Capability)——让AI越来越强,去解决过去解决不了的问题;另一个方向,是不断向广(Capacity)——让智能越来越便宜、越来越丰富,让更多人、更多企业、更多行业都能够获得。

其中,Capability AI Compute,是面向智能前沿的能力型智算,这意味着让AI帮助人类解决今天尚无答案的问题。比如从海量蛋白质中发现新的药物分子候选物,探索数学、物理领域尚未找到的求解路径,从而改变人类发现新知识、理解新规律和创造新技术的方式。

刘军指出,要支撑这样的前沿智能,有三个关键核心要素:第一,模型前沿。目前,前沿模型参数量、上下文长度不断增长,全球最大的开源模型参数规模已达到2.8万亿,未来还将向10万亿参数级演进,同时KV Cache等运行状态持续增长,计算系统需要具备更强的承载能力;第二,极低时延。Agent不是调用一次模型,而是持续进行感知、规划、推理、执行和反馈,一次任务可能包含数十次甚至数百次模型调用,延迟会不断累积,因此需要尽可能减少计算、数据访问和芯片间通信的等待;第三,长稳运行。未来Agent执行复杂任务可能持续数天甚至更久,大量模型调用、工具交互和多Agent协同持续发生,计算系统需要支撑长时间连续运行,保证复杂智能任务稳定完成。

这要求计算系统具有更多芯片、更大内存容量以及更低时延的通信,除此之外,如何让模型权重、KV Cache和运行状态在不同芯片与内存之间高效流动,减少数据搬移和通信等待。

Capacity AI Compute是面向智能普及的容量型智算,前沿智能能否进入日常工作,取决于人们能否负担得起并持续使用。如何让个人能够调用多个Agent,让中小企业能够获得过去难以长期配置的专业能力,让计算系统以可负担的成本提供充足的智能服务。是Capacity AI Compute要解决的问题。这要求计算系统需要按负载特点配置算力,让不同资源承担适合的任务,并协调各个推理环节,减少闲置、等待和重复计算,提升规模化供给的效率。

以系统创新支撑高效供给

面向日益丰富的前沿模型和复杂Agent需求,超节点的意义在于突破传统单机的计算边界,把更多芯片和内存纳入一个高效协同的计算域,为前沿智能提供更大的“有效计算空间”。

浪潮信息发布元脑SD200 Ultra超节点AI服务器,元脑SD200 Ultra基于本土AI芯片,单机承载运行2.8万亿参数的Kimi K3大模型,Token生成时延首次突破5.85毫秒,相当于单用户速度170 Tokens/s,达到业界平均水平的5倍。元脑SD200 Ultra以开放系统设计紧耦合128芯本土AI芯片,实现统一内存寻址超低延迟通信,支持10万亿参数规模前沿模型,打造面向Agent时代的能力型智算标杆。

刘军表示,元脑SD200 Ultra超节点AI服务器具备紧致扩展、统一寻址、对称直连、超级算子特点,能通过规模可扩展、物理紧耦合的系统架构,提高前沿模型承载能力,实现低开销通信和长程任务高可靠运行;跨主机域全局统一寻址,构建百纳秒级低时延的内存语义互连域;基于对称内存,首次在本土算力超节点上实现显存直连,Allreduce 通信时间降低 3.5 倍;同时,率先在本土算力超节点上实现通算融合超级算子,算子数量降低10倍,模型推理性能提升3倍以上。

面向持续、大规模推理需求,浪潮信息发布元脑HC2000多元算力机组。HC2000采用DirectCom 2.0极速架构,基于高密液冷AI整机柜、搭配MCIS推理软件栈,实现计算负载按需匹配、动态优化。围绕不同模型与业务的实际负载,选择相应的算力和存储配置,并通过软件栈组织协同,使得同等投资Token产能提升10倍。

刘军表示,未来,Token工厂不能只问拥有多少GPU、CPU、服务器、存储。还应该问:这些算力能够支撑多强的智能?能够以多低的成本生产多少智能?Agent时代计算产业的新使命将从提供算力走向生产智能。计算产业衡量自身价值的方式,也由此从“拥有多少算力”,进一步转向“能够支撑多强的智能,以及能够以多低的成本生产多少智能”。

(来源:电子信息产业网)
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

相关推荐