第295篇:算力网络(Computing First Network)概念

关键词

算力网络、Computing First Network、CFN、算力路由、算力感知、算力调度、边缘计算、云边协同、算网融合


一、算力网络的定义与背景

1.1 什么是算力网络

算力网络(Computing First Network, CFN)是网络与计算深度融合的新型信息基础设施

算力网络核心理念:

传统模式:用户 → 网络 → 特定的服务器(固定 IP) ┌─ 用户访问某个 IP,请求只能到达指定服务器 ├─ 不考虑计算资源状态 └─ 网络只做传输,不感知计算

算力网络模式:用户 → 网络选择最优的算力节点 ┌─ 用户请求"处理一段视频" → 网络找到最合适的节点 ├─ 综合考虑:算力负载、网络带宽、时延、能耗 ├─ 用户不关心具体哪个服务器处理 └─ 网络感知计算状态 + 算力感知路由

用户需求: "帮我处理这个视频" ▼ ┌────────────────────────────────────┐ └────────────────────────────────────┘ ▼ 处理结果返回用户 算力网络调度 检查各节点算力状态: ┌─ 中心云:CPU 80%, 时延 20ms ├─ 边缘 A:CPU 20%, 时延 3ms ✅ ├─ 边缘 B:CPU 60%, 时延 5ms └─ 选择:边缘 A(最空闲+最近) 路由到边缘 A 处理

1.2 算力网络的驱动力

算力网络发展的驱动力:

  1. 算力泛在化
     ┌─ 云、边、端多级算力
     ├─ 中心云:大规模训练/存储
     ├─ 边缘云:低时延处理(MEC)
     ├─ 终端设备:AI 推理(手机/IoT)
     └─ 算力碎片化严重

  2. 业务需求多样化
     ┌─ AI 训练:需要 GPU 集群(大算力)
     ├─ 自动驾驶:< 5ms 时延(边缘算力)
     ├─ 云游戏:低时延 + 高算力
     ├─ IoT:海量小任务(分散算力)
     └─ 没有单一节点满足所有需求

  3. 网络与计算融合
     ┌─ 算力在哪里,网络怎么路由
     ├─ 动态选择最优算力节点
     ├─ 算力状态变化影响路由决策
     └─ 网络需要感知计算状态

  4. 算力运营化
     ┌─ 计算资源像水电一样按需使用
     ├─ 算力交易市场
     ├─ 算力 SLA(算力质量保障)
     └─ 算力计费

二、算力网络架构

2.1 ITU-T / IETF 参考架构

算力网络逻辑架构:

算力网络管理层 ┌────────────────────────────────────┐ └────────────────────────────────────┘ 算力调度平台(Orchestrator) ┌─ 算力资源管理 ├─ 算力发现与注册 ├─ 算力调度策略 ├─ 算力 SLA 管理 └─ 算力计费
算力网络控制层 ┌───────────────┴────────────────────┐ └───────────────┬────────────────────┘ Controller(控制器) ┌─ 算力路由计算 ├─ 流量调度策略 ├─ 网络切片 + 算力协同 └─ 北向对接管理层
算力网络转发层 ┌───────────────┴────────────────────┐ └────────────────────────────────────┘ 路由器/交换机(算力感知能力) ┌─ 算力通告(类似路由协议) ├─ 算力选路(基于算力+网络) ├─ 算力按需引流 └─ 随流检测(服务质量)
算力资源层 ┌───────────────┴──────────────┐ 中心云 边缘 端侧 算力池 HPC/GPU MEC 终端 异构

2.2 华为算力网络方案

华为算力网络方案(Computing First Network):

方案组件 ┌─ CFN Controller:算力调度核心 ├─ CFN Router:算力感知路由器 └─ CFN Agent:算力节点代理 ├─ 部署在每台算力服务器 ├─ 采集 CPU/GPU/内存/存储/网络状态 └─ 上报给 CFN Controller ├─ 算力资源池化管理 ├─ 实时算力状态感知 └─ 智能调度策略(AI 驱动) ├─ 算力通告(通过 BGP/IGP 扩展) ├─ 算力选路(ECMP + 算力权重) ├─ 按时延+算力综合选路 └─ SRv6 算力路径编程

三、算力路由关键技术

3.1 算力通告

算力信息通告——使网络感知计算资源状态:

类似路由协议的方式通告算力信息:

算力节点 A(GPU 空闲 80%) ▼ ┌────────────────────────────────────┐ └──────────┬─────────────────────────┘ ┌──────┴──────┐ ▼ ▼ 路由器 A 路由器 B 算力路由表: 算力路由表: 节点 A: 80% 节点 A: 80% 节点 B: 50% 节点 B: 50% 节点 C: 30% 节点 C: 30% 通告:GPU=80%, CPU=60%, MEM=40%, 时延=5ms 算力网络控制器 维护全网算力拓扑
通告方式:
┌─ BGP 扩展:通过 BGP NSR(Network Service Route)
├─ IGP 扩展:ISIS/OSPF 扩展 TLVs
├─ 控制器分发:控制器算力拓扑下发
└─ 更新频率:1-10 秒(避免震荡)

3.2 算力选路

算力路由算法——选择最优的算力+路径:

综合度量公式: Score = w1 × 1/时延 + w2 × 算力余量 + w3 × 带宽余量 - w4 × 成本

示例:视频处理请求

算力节点 时延 GPU余量 带宽 得分
边缘 A 边缘 B 中心云 终端 C 3ms 5ms 20ms 1ms 80% 50% 90% 10% 10Gbps 5Gbps 100Gbp - 95 70 60 40

选择边缘 A:时延低 + GPU 空闲多

策略类型: ┌─ 时延优先:URLLC 业务(自动驾驶) ├─ 算力优先:AI 训练(需要 GPU 集群) ├─ 成本优先:批处理业务(低成本) ├─ 负载均衡:避免单节点过载 └─ 混合策略:多目标优化

3.3 SRv6 与算力网络

SRv6 是算力网络的理想转发技术:

| SRv6 算力路径编程 用户请求 → 算力控制器 计算最优路径 ┌─ 节点 A(边缘:算力充足) ├─ 节点 B(中间:低时延链路) └─ 节点 C(终端:处理完成) 生成 SRv6 Policy Segment List: 封装到 IPv6 扩展头 ┌────────────────────────────────────┐ └────────────────────────────────────┘ SRv6 优势: ┌─ 灵活编程:任意指定路径 + 算力节点 ├─ 随流检测:内嵌 SFC 能力 ├─ 无状态:中间节点无需维护会话状态 └─ 原生 IPv6:部署方便 | IPv6 头 | SRH (SL=3) | 原始数据 Segment List: [0] = A (算力处理节点) [1] = B (中转) [2] = C (结果返回) | | | --- | --- | --- |


四、算力网络应用场景

4.1 云边协同

场景:AI 推理业务(人脸识别)

架构: | 摄像头(端侧) ▼ 抓拍图片 ┌────────────────────────────────────┐ └────────────────────────────────────┘ ▼ ┌────────────────────────────────────┐ └────────────────────────────────────┘ | 边缘节点(MEC) ┌─ 轻量级 AI 模型(第一轮检测) ├─ 低时延:< 100ms └─ 处理 80% 简单场景 复杂场景转中心云 中心云(GPU 集群) ┌─ 大规模 AI 模型(精细识别) ├─ 高算力:20% 复杂场景 └─ 时延:200-500ms | | | --- | --- | --- | | | | | | 算力网络的作用: | | | | ┌─ 自动判断:简单场景→边缘,复杂→中心云 | | | | ├─ 动态调度:边缘负载高→转中心云 | | | | ├─ 算力协同:边缘预检测 + 中心精细识别 | | | | └─ 按需分配算力资源 | | |

4.2 算力交易市场

算力交易市场场景:

  ┌──────────────────────────────────────────┐
  │  算力消费者:                              │
  │  ┌─ 短视频公司:需要 GPU 做视频转码      │
  │  ├─ AI 初创:训练模型需要 100 块 GPU    │
  │  └─ 游戏公司:云游戏渲染需要 GPU         │
  │                                            │
  │  算力提供者:                              │
  │  ┌─ 运营商:MEC 机房 GPU 节点            │
  │  ├─ 云厂商:弹性 GPU 实例                 │
  │  └─ 企业:闲置算力(共享)                │
  │                                            │
  │  算力网络平台:                            │
  │  ┌─ 算力注册、发布、查询                  │
  │  ├─ 算力 SLA(价格/质量)                 │
  │  ├─ 算力交易匹配                          │
  │  ├─ 算力路由调度                          │
  │  ├─ 算力计费结算                          │
  │  └─ 服务质量保障                          │
  └──────────────────────────────────────────┘

五、算力网络面临的挑战

算力网络当前挑战:

  1. 标准尚未统一
     ┌─ ITU-T / IETF / CCSA 多组织并行
     ├─ 算力路由协议尚无标准
     ├─ 算力信息模型未统一
     └─ 跨域互通困难

  2. 算力度量标准化
     ┌─ 异构算力:CPU/GPU/NPU/FPGA 无法统一度量
     ├─ 什么算"1 单位算力"
     ├─ 时延敏感性:不同任务对相同算力感受不同
     └─ 需要任务感知的算力度量

  3. 实时性挑战
     ┌─ 算力状态变化快(秒级)
     ├─ 网络状态变化快(毫秒级)
     ├─ 全局算力同步开销大
     └─ 分布式决策 vs 集中式调度平衡

  4. 安全与隐私
     ┌─ 算力状态暴露可能被攻击
     ├─ 用户数据跨节点流转的安全
     ├─ 算力节点可信认证
     └─ 多租户算力隔离

六、算力网络展望

算力网络演进路径:

  ┌──────────────────────────────────────────┐
  │  近期(1-2 年):算力路由试点              │
  │  ┌─ 基于 SRv6 的算力编程                 │
  │  ├─ 边缘计算场景 MEC 落地                 │
  │  ├─ 云边协同业务调度                     │
  │  └─ 标准逐步完善                         │
  │                                          │
  │  中期(3-5 年):算网融合                  │
  │  ┌─ 算力路由协议标准化                   │
  │  ├─ 全网算力统一调度                     │
  │  ├─ 跨运营商/跨厂商算力互通              │
  │  ├─ 算力交易市场成型                     │
  │  └─ AI 驱动的算力调度                   │
  │                                          │
  │  远期(5-10 年):算力即服务               │
  │  ┌─ 算力随需而用(水电模式)             │
  │  ├─ 网络 = 算力总线                      │
  │  ├─ 算力抽象为"1 单位"                   │
  │  └─ 6G 内生算力网络                      │
  └──────────────────────────────────────────┘

总结

关键点 说明
算力网络定义 网络感知计算状态,动态选择最优算力节点
核心驱动力 算力泛在化、业务多样化、网算融合
架构分层 管理层 → 控制层 → 转发层 → 资源层
关键技术 算力通告、算力选路、SRv6 编程
主要场景 云边协同、AI 推理、算力交易
演进方向 近期试点 → 中期融合 → 远期算力即服务

思考

  1. 算力网络和传统网络的核心区别是什么?
  2. 算力信息通告的原理是什么?类似什么协议?
  3. 算力选路综合考虑哪些因素?如何为不同业务选择算法?
  4. SRv6 如何支持算力网络的路径编程?
  5. 算力网络的典型应用场景有哪些?
  6. 算力网络面临的主要挑战是什么?

下篇预告:第296篇 - 算力感知路由与负载分发,深入算力路由的算法、协议扩展和负载分发策略。