AI 工程 · 神机百见-具身解读

昇腾 960 超节点:华为把 4096 张卡变成一台机器,具身大脑的算力瓶颈跟着换了位置

9 月 17 日华为发布昇腾 960 超节点:单节点 4096 卡、8 EFLOPS FP8、1PB HBM,用 5500 个光引擎替掉 4.8 万颗 800G 光模块。对具身智能真正有影响的不是这些峰值数字,是内存统一编址、PB 级 KV 缓存和 Agent 沙箱启动提速 30 倍这三件事。

一分钟速览
  1. 发布内容:9 月 17 日华为全联接大会 2026 在上海开幕,轮值董事长汪涛发布全球首个采用 NPO(近封装光学)技术的超节点——昇腾 960 超节点。
  2. 单节点规格:基于「灵衢+Hi-ONE」架构,正交架构与全液冷设计,可扩展至 4096 卡,提供 8 EFLOPS FP8、16 EFLOPS FP4 算力与 1PB HBM 容量。
  3. 光互联替代:5500 个 Hi-ONE 光引擎替代原本所需的 4.8 万颗 800G 光模块,功耗降低超 550 千瓦,系统无故障运行时间提升一倍,可用度达 99.8%。
  4. 配套两件:鲲鹏超节点最大 4096 节点互联、形成 256TB 统一内存池,十万级 Agent 沙箱启动较传统服务器提升 30 倍;OceanStor M900 提供 L3.5 层 PB 级 KV 缓存。
  5. 芯片节奏:昇腾 960DT 提前三个季度、2027 年 Q1 就绪,960PR 2027 年 Q3 就绪,2028、2029 年陆续推出 970、980。
数据来源与边界
素材时间窗为 2026-09-17 19:00 → 2026-09-18 09:00。本篇事实基础是 2026 年 9 月 17 日华为全联接大会现场发布,经澎湃新闻、21世纪经济报道、环球网等多家媒体一致报道,核心数字(4096 卡、8 EFLOPS FP8、1PB HBM、5500 个 Hi-ONE、4.8 万颗光模块、550 千瓦、99.8%、256TB、30 倍)各家口径一致。需标注的边界:其一,全部参数来自厂商发布口径,vendor 信源,无第三方实测数据;其二,「十万级沙箱启动提升 30 倍」「检索效率倍增」为厂商对比自述,未公布对比基准的硬件配置;其三,本篇与第 150 号稿(华为《智能世界 2035》十大命题)是同一厂商的不同事件,题材不重合。
本文事实信息来自上方标注的公开来源;解读、判断与延伸部分为作者个人见解,写作过程使用了 AI 工具辅助整理,已由作者人工核实,不代表信息来源方立场。如有雷同纯属巧合;如涉及版权或权益问题,请联系 shenjibailian@shenjibailian.com,我们将在核实后及时删除或更正。
超节点在解什么问题

理解昇腾 960 超节点,先要理解它要解决的不是「算力不够」,而是卡多了以后通信吃掉算力。

大模型训练规模上去之后,瓶颈从单卡浮点能力转移到了卡与卡之间的数据搬运。传统的做法是用光模块把服务器连起来,卡数越多、光模块越多、功耗与故障点越多。华为给出的替代方案是 NPO(近封装光学):把光引擎做到靠近芯片封装的位置,缩短电信号的走线距离,用更少的器件完成同样的互联带宽。

具体账是这么算的:一个昇腾 960 超节点用 5500 个 Hi-ONE 光引擎,替代传统方案所需的 4.8 万颗 800G 光模块;结果是功耗降低超 550 千瓦,系统无故障运行时间提升一倍,可用度达 99.8%。这三个数字里,最值得记的不是功耗——是器件数量降到约九分之一。器件数量直接决定故障率和运维复杂度,这是把 4096 张卡当一台机器用的前提条件。

单节点的规格是:基于「灵衢+Hi-ONE」架构,正交架构与全液冷设计,通过灵衢实现内存统一编址,可扩展至 4096 卡规模,提供 8 EFLOPS FP8、16 EFLOPS FP4 算力,1PB HBM 容量。集群层面,多个超节点可通过灵衢网络或 RoCE 连接,采用二层 CLOS 四平面组网,最大集群规模达 51.2 万卡;结合多轨道拓扑技术,最大可支持 100 万卡昇腾超节点集群。

昇腾 960 超节点关键参数厂商发布口径 · 2026-09-17
单节点卡规模
4096 卡
FP8 / FP4 算力
8 / 16 EFLOPS
HBM 容量
1 PB
最大集群规模
51.2 万卡 / 100 万卡
系统可用度
99.8%
条形为量级示意,非等比刻度;100 万卡为结合多轨道拓扑后的最大支持规模,51.2 万卡为二层 CLOS 四平面组网下的规模。
对具身智能有用的三件事,都不是峰值算力

把这套参数翻译成具身智能团队能用的东西,真正相关的有三项,没有一项是浮点峰值。

第一项是内存统一编址。具身大脑的训练数据形态和文本完全不同——一条机器人 episode 是视频、深度、力/位序列、动作标签的多模态长序列,单条数据的体积比一段文本大几个数量级,且经常需要跨卡存放同一条轨迹的不同片段。统一编址意味着跨服务器的内存访问不用走协议转换,这对长序列多模态训练是实打实的效率提升。同一套思路被用到了通用计算侧:鲲鹏超节点最大支持 4096 节点互联,形成 256TB 统一内存池。

第二项是 Agent 沙箱启动提速 30 倍。华为给出的场景是:十万级别沙箱启动相比传统服务器方案提升 30 倍,且沙箱密度还可再提升 25%;在百亿千维的复杂向量检索场景下,检索效率比传统服务器性能实现倍增。这一项直接对应具身智能的仿真训练。仿真是具身智能最主要的数据来源,而大规模并行仿真本质就是海量沙箱的启动、运行与回收——启动开销降一个数量级,等于同样的时间能跑更多轮次的策略迭代。

第三项是 PB 级 KV 缓存。OceanStor M900 基于灵衢 UnifiedBus 总线,定位 L3.5 层,支持「一跳直连」。长上下文推理的显存压力主要来自 KV 缓存,把它外置成 PB 级存储池,影响的是单机能承载的上下文长度与并发数——对需要把整段任务历史、环境记忆塞进上下文的机器人 agent,这是成本项而非性能项。

三件套与具身智能的对应关系作者整理 · 非厂商表述
组件发布参数对应的具身场景
昇腾 960 超节点4096 卡、统一编址、1PB HBM多模态长序列策略训练
鲲鹏超节点4096 节点、256TB 内存池、沙箱启动 +30 倍大规模并行仿真与强化学习rollout
OceanStor M900L3.5 层 PB 级 KV 缓存、一跳直连长上下文机器人 agent 的推理成本
「对应的具身场景」为作者依据参数性质给出的映射,华为发布中未作此类表述。
芯片节奏:提前三个季度意味着什么

汪涛在演讲中披露了昇腾芯片的进度表,这组数字比超节点本身更值得关注。

昇腾 960 芯片研发进度超预期,性能实现倍增。具体到两个版本:960DT 的推出时间比原目标提前三个季度,将在 2027 年第一季度就绪;960PR 提前一个季度,2027 年第三季度就绪。后续节奏是一年一代:2028 年推出昇腾 970,2029 年推出昇腾 980,依托「τ 定律」的创新方向实现算力规格继续翻倍,访存带宽、访存容量、互联带宽大幅提升。存量侧的数字是:昇腾 910C 超节点已部署超 1000 套,昇腾 950 超节点已规模商用。

提前三个季度这件事,在工程上的含义是关键路径上的不确定性被消掉了。芯片流片到量产之间有太多可变因素,能把时间点提前三个季度公布,说明样片阶段的主要验证已经完成。对采购方,这意味着 2027 年的算力采购计划可以按这个时间表排;对竞争对手,这是一条明确的节拍信号。

另一条容易被忽略的是一年一代的承诺。固定的演进节奏比单次的性能突破更重要——它让下游敢做三年期的架构规划。这也是 CANN 计算框架全面开源、进入常态化社区运营的背景:硬件节奏确定之后,软件生态才有积累的意义。

昇腾芯片演进表依据华为全联接大会 2026 发布整理
910C
超节点已部署超 1000 套
950
超节点已规模商用
960DT
提前三个季度 · 2027 Q1 就绪
960PR
提前一个季度 · 2027 Q3 就绪
970 / 980
2028 / 2029 年推出 · 算力规格继续翻倍
演进节奏为厂商公布的计划时间点,非交付承诺;「τ 定律」为华为提出的创新方向表述。
瓶颈换了位置:从训练算力到仿真与数据回流

把这次发布和具身智能的实际工程流程放在一起,能看到一个正在发生的位置转移。

两年前,具身智能团队算的账是「训练一个大模型需要多少卡」。现在这道题的答案越来越标准化——模型架构收敛、训练框架成熟、算力供给多元化,训练算力正在变成可采购的商品。真正卡住团队的是另外两件事:一是仿真数据的规模与真实性,二是真机数据的回流与再训练。前者受限于沙箱启动开销和并行度,后者受限于数据管道的吞吐与存储成本。

华为这次发布里,恰好是这两项拿到了明确数字:沙箱启动提升 30 倍、密度提升 25%,以及 PB 级 KV 缓存与全光互联。这不是巧合——超节点这种形态本来就是为「数据与内存密集型」负载设计的,而不是为纯浮点峰值设计的。

对国内具身团队,一条务实建议是:做算力预算时把仿真集群和数据管道单独列项。过去把它们混在「训练算力」一起报,会导致预算被峰值算力吃掉,而真正影响迭代速度的仿真吞吐反而拿不到资源。这次发布的数字提供了一个参照系:如果沙箱启动开销能降一个数量级,同样的卡时预算能跑的策略迭代轮次会显著不同。

判断:超节点形态会在两年内成为具身智能训练基础设施的默认选项,判断依据是具身数据的形态——多模态长序列、跨卡存放、仿真与真机数据混合回流——恰好是超节点针对性优化的负载类型,而非通用浮点算力。判断的另一半是:这次发布的三个关键数字(256TB 统一内存池、沙箱启动 +30 倍、PB 级 KV 缓存)都指向数据与内存,没有一个指向峰值算力,厂商自己已经用产品定义标出了瓶颈的位置。要保留的一条怀疑是:全部参数为厂商发布口径,「30 倍」「倍增」未公布对比基准,在第三方实测出现之前应按厂商自述处理。
来源:华为全联接大会 2026 现场发布(2026-09-17 上海),经澎湃新闻(thepaper.cn/newsDetail_forward_34088120)、21世纪经济报道、环球网三家一致报道;素材时间窗:2026-09-17 19:00 → 2026-09-18 09:00;全部参数为厂商发布口径,vendor 信源,无第三方实测。