# 昇腾 960 超节点：华为把 4096 张卡变成一台机器，具身大脑的算力瓶颈跟着换了位置

> 9 月 17 日华为发布昇腾 960 超节点：单节点 4096 卡、8 EFLOPS FP8、1PB HBM，用 5500 个光引擎替掉 4.8 万颗 800G 光模块。对具身智能真正有影响的不是这些峰值数字，是内存统一编址、PB 级 KV 缓存和 Agent 沙箱启动提速 30 倍这三件事。

### TLDR

- **发布内容**：9 月 17 日华为全联接大会 2026 在上海开幕，轮值董事长汪涛发布**全球首个采用 NPO（近封装光学）技术的超节点——昇腾 960 超节点**。
- **单节点规格**：基于「灵衢+Hi-ONE」架构，正交架构与全液冷设计，**可扩展至 4096 卡**，提供 **8 EFLOPS FP8、16 EFLOPS FP4** 算力与 **1PB HBM 容量**。
- **光互联替代**：**5500 个 Hi-ONE 光引擎**替代原本所需的 **4.8 万颗 800G 光模块**，功耗降低超 **550 千瓦**，系统无故障运行时间提升一倍，可用度达 **99.8%**。
- **配套两件**：鲲鹏超节点最大 **4096 节点**互联、形成 **256TB 统一内存池**，十万级 Agent 沙箱启动较传统服务器**提升 30 倍**；OceanStor M900 提供 **L3.5 层 PB 级 KV 缓存**。
- **芯片节奏**：昇腾 960DT 提前三个季度、**2027 年 Q1** 就绪，960PR **2027 年 Q3** 就绪，2028、2029 年陆续推出 970、980。

### SRC

素材时间窗为 2026-09-17 19:00 → 2026-09-18 09:00。本篇事实基础是 2026 年 9 月 17 日华为全联接大会现场发布，经澎湃新闻、21世纪经济报道、环球网等多家媒体一致报道，核心数字（4096 卡、8 EFLOPS FP8、1PB HBM、5500 个 Hi-ONE、4.8 万颗光模块、550 千瓦、99.8%、256TB、30 倍）各家口径一致。需标注的边界：其一，全部参数来自厂商发布口径，vendor 信源，无第三方实测数据；其二，「十万级沙箱启动提升 30 倍」「检索效率倍增」为厂商对比自述，未公布对比基准的硬件配置；其三，本篇与第 150 号稿（华为《智能世界 2035》十大命题）是同一厂商的不同事件，题材不重合。

### BODY

<div class="sec">
<div class="eyebrow">超节点在解什么问题</div>

理解昇腾 960 超节点，先要理解它要解决的不是「算力不够」，而是**卡多了以后通信吃掉算力**。

大模型训练规模上去之后，瓶颈从单卡浮点能力转移到了卡与卡之间的数据搬运。传统的做法是用光模块把服务器连起来，卡数越多、光模块越多、功耗与故障点越多。华为给出的替代方案是 NPO（近封装光学）：把光引擎做到靠近芯片封装的位置，缩短电信号的走线距离，用更少的器件完成同样的互联带宽。

具体账是这么算的：一个昇腾 960 超节点用 **5500 个 Hi-ONE 光引擎**，替代传统方案所需的 **4.8 万颗 800G 光模块**；结果是功耗降低超 **550 千瓦**，系统无故障运行时间提升一倍，可用度达 **99.8%**。这三个数字里，最值得记的不是功耗——是**器件数量降到约九分之一**。器件数量直接决定故障率和运维复杂度，这是把 4096 张卡当一台机器用的前提条件。

单节点的规格是：基于「灵衢+Hi-ONE」架构，正交架构与全液冷设计，通过灵衢实现内存统一编址，可扩展至 4096 卡规模，提供 8 EFLOPS FP8、16 EFLOPS FP4 算力，1PB HBM 容量。集群层面，多个超节点可通过灵衢网络或 RoCE 连接，采用二层 CLOS 四平面组网，最大集群规模达 **51.2 万卡**；结合多轨道拓扑技术，最大可支持 **100 万卡**昇腾超节点集群。

<div class="jx">
  <div class="jx-h"><span>昇腾 960 超节点关键参数</span><span class="jx-note">厂商发布口径 · 2026-09-17</span></div>
  <div class="jx-bars">
    <div class="jx-bar-row"><div class="jx-bar-lab">单节点卡规模</div><div class="jx-bar-track"><div class="jx-bar-fill" style="background:#0a749a" data-w="85%"></div></div><div class="jx-bar-val">4096 卡</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">FP8 / FP4 算力</div><div class="jx-bar-track"><div class="jx-bar-fill" style="background:#00a6d6" data-w="70%"></div></div><div class="jx-bar-val">8 / 16 EFLOPS</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">HBM 容量</div><div class="jx-bar-track"><div class="jx-bar-fill" style="background:#6d3fd4" data-w="60%"></div></div><div class="jx-bar-val">1 PB</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">最大集群规模</div><div class="jx-bar-track"><div class="jx-bar-fill" style="background:#0d8a5f" data-w="100%"></div></div><div class="jx-bar-val">51.2 万卡 / 100 万卡</div></div>
    <div class="jx-bar-row"><div class="jx-bar-lab">系统可用度</div><div class="jx-bar-track"><div class="jx-bar-fill" style="background:#b85c0a" data-w="99%"></div></div><div class="jx-bar-val">99.8%</div></div>
  </div>
  <div class="cap">条形为量级示意，非等比刻度；100 万卡为结合多轨道拓扑后的最大支持规模，51.2 万卡为二层 CLOS 四平面组网下的规模。</div>
</div>
</div>

<div class="sec">
<div class="eyebrow">对具身智能有用的三件事，都不是峰值算力</div>

把这套参数翻译成具身智能团队能用的东西，真正相关的有三项，没有一项是浮点峰值。

第一项是**内存统一编址**。具身大脑的训练数据形态和文本完全不同——一条机器人 episode 是视频、深度、力/位序列、动作标签的多模态长序列，单条数据的体积比一段文本大几个数量级，且经常需要跨卡存放同一条轨迹的不同片段。统一编址意味着跨服务器的内存访问不用走协议转换，这对长序列多模态训练是实打实的效率提升。同一套思路被用到了通用计算侧：鲲鹏超节点最大支持 4096 节点互联，形成 **256TB 统一内存池**。

第二项是 **Agent 沙箱启动提速 30 倍**。华为给出的场景是：十万级别沙箱启动相比传统服务器方案**提升 30 倍**，且沙箱密度还可再提升 25%；在百亿千维的复杂向量检索场景下，检索效率比传统服务器性能实现倍增。**这一项直接对应具身智能的仿真训练**。仿真是具身智能最主要的数据来源，而大规模并行仿真本质就是海量沙箱的启动、运行与回收——启动开销降一个数量级，等于同样的时间能跑更多轮次的策略迭代。

第三项是 **PB 级 KV 缓存**。OceanStor M900 基于灵衢 UnifiedBus 总线，定位 L3.5 层，支持「一跳直连」。长上下文推理的显存压力主要来自 KV 缓存，把它外置成 PB 级存储池，影响的是单机能承载的上下文长度与并发数——对需要把整段任务历史、环境记忆塞进上下文的机器人 agent，这是成本项而非性能项。

<div class="jx">
  <div class="jx-h"><span>三件套与具身智能的对应关系</span><span class="jx-note">作者整理 · 非厂商表述</span></div>
  <table class="jx-mx">
    <tr><th>组件</th><th>发布参数</th><th>对应的具身场景</th></tr>
    <tr><td class="a">昇腾 960 超节点</td><td>4096 卡、统一编址、1PB HBM</td><td>多模态长序列策略训练</td></tr>
    <tr><td class="a">鲲鹏超节点</td><td>4096 节点、256TB 内存池、沙箱启动 +30 倍</td><td>大规模并行仿真与强化学习rollout</td></tr>
    <tr><td class="a">OceanStor M900</td><td>L3.5 层 PB 级 KV 缓存、一跳直连</td><td>长上下文机器人 agent 的推理成本</td></tr>
  </table>
  <div class="cap">「对应的具身场景」为作者依据参数性质给出的映射，华为发布中未作此类表述。</div>
</div>
</div>

<div class="sec">
<div class="eyebrow">芯片节奏：提前三个季度意味着什么</div>

汪涛在演讲中披露了昇腾芯片的进度表，这组数字比超节点本身更值得关注。

**昇腾 960 芯片研发进度超预期，性能实现倍增**。具体到两个版本：960DT 的推出时间比原目标**提前三个季度**，将在 **2027 年第一季度**就绪；960PR 提前一个季度，**2027 年第三季度**就绪。后续节奏是**一年一代**：2028 年推出昇腾 970，2029 年推出昇腾 980，依托「τ 定律」的创新方向实现算力规格继续翻倍，访存带宽、访存容量、互联带宽大幅提升。存量侧的数字是：昇腾 910C 超节点已部署超 **1000 套**，昇腾 950 超节点已规模商用。

提前三个季度这件事，在工程上的含义是**关键路径上的不确定性被消掉了**。芯片流片到量产之间有太多可变因素，能把时间点提前三个季度公布，说明样片阶段的主要验证已经完成。对采购方，这意味着 2027 年的算力采购计划可以按这个时间表排；对竞争对手，这是一条明确的节拍信号。

另一条容易被忽略的是**一年一代的承诺**。固定的演进节奏比单次的性能突破更重要——它让下游敢做三年期的架构规划。这也是 CANN 计算框架全面开源、进入常态化社区运营的背景：**硬件节奏确定之后，软件生态才有积累的意义**。

<div class="jx">
  <div class="jx-h"><span>昇腾芯片演进表</span><span class="jx-note">依据华为全联接大会 2026 发布整理</span></div>
  <div class="jx-tl">
    <div class="jx-tl-row"><div class="jx-tl-t">910C</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#566781">超节点已部署超 1000 套</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">950</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0a749a">超节点已规模商用</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">960DT</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#00a6d6">提前三个季度 · 2027 Q1 就绪</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">960PR</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#6d3fd4">提前一个季度 · 2027 Q3 就绪</div></div></div>
    <div class="jx-tl-row"><div class="jx-tl-t">970 / 980</div><div class="jx-tl-b"><div class="jx-tl-blk" style="background:#0d8a5f">2028 / 2029 年推出 · 算力规格继续翻倍</div></div></div>
  </div>
  <div class="cap">演进节奏为厂商公布的计划时间点，非交付承诺；「τ 定律」为华为提出的创新方向表述。</div>
</div>
</div>

<div class="sec">
<div class="eyebrow">瓶颈换了位置：从训练算力到仿真与数据回流</div>

把这次发布和具身智能的实际工程流程放在一起，能看到一个正在发生的位置转移。

两年前，具身智能团队算的账是「训练一个大模型需要多少卡」。现在这道题的答案越来越标准化——模型架构收敛、训练框架成熟、算力供给多元化，**训练算力正在变成可采购的商品**。真正卡住团队的是另外两件事：一是**仿真数据的规模与真实性**，二是**真机数据的回流与再训练**。前者受限于沙箱启动开销和并行度，后者受限于数据管道的吞吐与存储成本。

华为这次发布里，恰好是这两项拿到了明确数字：沙箱启动提升 30 倍、密度提升 25%，以及 PB 级 KV 缓存与全光互联。**这不是巧合**——超节点这种形态本来就是为「数据与内存密集型」负载设计的，而不是为纯浮点峰值设计的。

对国内具身团队，一条务实建议是：**做算力预算时把仿真集群和数据管道单独列项**。过去把它们混在「训练算力」一起报，会导致预算被峰值算力吃掉，而真正影响迭代速度的仿真吞吐反而拿不到资源。这次发布的数字提供了一个参照系：如果沙箱启动开销能降一个数量级，同样的卡时预算能跑的策略迭代轮次会显著不同。

<div class="keypoint">判断：超节点形态会在两年内成为具身智能训练基础设施的默认选项，判断依据是具身数据的形态——多模态长序列、跨卡存放、仿真与真机数据混合回流——恰好是超节点针对性优化的负载类型，而非通用浮点算力。判断的另一半是：这次发布的三个关键数字（256TB 统一内存池、沙箱启动 +30 倍、PB 级 KV 缓存）都指向数据与内存，没有一个指向峰值算力，厂商自己已经用产品定义标出了瓶颈的位置。要保留的一条怀疑是：全部参数为厂商发布口径，「30 倍」「倍增」未公布对比基准，在第三方实测出现之前应按厂商自述处理。</div>

<div class="srcline">来源：华为全联接大会 2026 现场发布（2026-09-17 上海），经澎湃新闻（thepaper.cn/newsDetail_forward_34088120）、21世纪经济报道、环球网三家一致报道；素材时间窗：2026-09-17 19:00 → 2026-09-18 09:00；全部参数为厂商发布口径，vendor 信源，无第三方实测。</div>
</div>

---

*来源：神机百见-具身解读 · https://www.shenjibailian.com/jiedu/article/huawei-ascend-960-supernode-npo/*
