第254篇:数据中心 VLAN 规划与 Overlay 趋势

关键词

VLAN规划、大二层、VXLAN Overlay、Underlay、网络虚拟化、多租户隔离、4094限制


一、从 VLAN 说起

1.1 VLAN 在数据中心的角色

VLAN(Virtual Local Area Network)是数据中心最基本的隔离手段:

VLAN 的基本功能:

1. 二层隔离
   VLAN 10:办公网     ── 与 VLAN 20 完全隔离
   VLAN 20:生产网     ── 广播域隔离
   VLAN 30:存储网     ── 安全隔离

2. 广播域划分
   减少 ARP 广播范围
   提升网络性能

3. 安全隔离
   不同安全级别的网络不能直接互通
   必须通过三层路由

1.2 传统数据中心的 VLAN 规划

小型数据中心 VLAN 规划示例:

VLAN ID    用途             网段              网关
─────────────────────────────────────────────────────
VLAN 10    办公管理          10.10.0.0/16      10.10.0.1
VLAN 20    生产业务          10.20.0.0/16      10.20.0.1
VLAN 30    数据库            10.30.0.0/16      10.30.0.1
VLAN 40    存储(iSCSI)     10.40.0.0/16      10.40.0.1
VLAN 50    DMZ              10.50.0.0/16      10.50.0.1
VLAN 99    设备管理          10.99.0.0/16      10.99.0.1
VLAN 100   虚拟化迁移专用     10.100.0.0/16     10.100.0.1

传统 VLAN 规划原则:
  1. 按业务划分 VLAN
  2. 每个 VLAN 对应一个 IP 子网
  3. SVI(Switch Virtual Interface)终结 VLAN
  4. VLAN 间路由通过汇聚层或核心层

二、VLAN 的局限与挑战

2.1 4094 VLAN 上限

IEEE 802.1Q 定义 VLAN ID 为 12 比特,上限 4094(0 和 4095 保留):

4094 的限制在数据中心意味着什么:

公有云场景:
  云提供商 A:
    客户 1:需要 10 个 VLAN
    客户 2:需要 20 个 VLAN
    客户 3:需要 50 个 VLAN
    ...共 200 个客户

    按平均值 20 个 VLAN/客户:
    需要 4000 个 VLAN → 接近 4094 上限!

    如果客户超过 200 个 → 无法满足
    一个字:不够用

私有云大二层:
  虚拟机迁移需要同一二层网络:
    VLAN 100 必须跨越所有 Leaf 设备

  物理限制:
    Leaf 交换机 MAC 表容量有限
    VLAN 广播域过大 → 广播风暴风险

2.2 大二层挑战

虚拟机热迁移要求"源端和目标端必须在同一二层网络":

大二层需求示意:

                ┌────── Leaf1 ──── 服务器A(VLAN 100)
              ─┤
  Spine Fabric ─┼────── Leaf2 ──── 服务器B(VLAN 100)
              ─┤
                └────── Leaf3 ──── 服务器C(VLAN 100)

问题 1:STP 不兼容 Spine-Leaf
  STP 会阻塞 Leaf1→Leaf2 的 Spine 间链路
  Spine-Leaf 架构中不需要 STP

问题 2:VLAN 4094 限制
  所有租户共享 VLAN 空间
  无法支持大规模多租户

问题 3:MAC 表膨胀
  所有 Leaf 必须学习全网 MAC
  每台 Leaf 的 MAC 表 = 所有服务器的 MAC
  10000 台服务器 → 10000+ MAC 地址

2.3 VLAN 的运维痛点

VLAN 运维中的常见问题:

1. VLAN ID 冲突
   部门 A:VLAN 100 = 生产
   部门 B:VLAN 100 = 测试
   → 合并后需重新规划

2. VLAN 蔓延(VLAN Sprawl)
   一个 VLAN 跨越多台交换机
   扩大故障域
   变更影响面大

3. 手工配置多
   添加新 VLAN 需要:
     - 创建 VLAN(每台设备)
     - 配置 Trunk 允许列表
     - 创建 SVI 和 IP
     - 配置路由
   50 台 Leaf × 4 条命令 = 200 条命令

三、Overlay 网络:VLAN 的替代方案

3.1 Overlay 的核心思路

Overlay 网络在物理网络(Underlay)之上构建虚拟网络

Underlay + Overlay 两层模型:

Overlay 层 VXLAN/VLAN/GRE 隧道 租户 A:VNI 10001 租户 B:VNI 10002 逻辑拓扑:Full Mesh / Hub-Spoke Underlay 层 物理网络:Spine-Leaf 路由协议:ISIS / OSPF / EBGP 转发机制:IP / ECMP 物理拓扑:IP Fabric(IP Clos)

核心思想: Underlay 只负责 IP 可达性 Overlay 负责租户隔离和虚拟网络 两者解耦,互不影响

3.2 Overlay 相比 VLAN 的优势

对比维度          VLAN(传统)        Overlay(VXLAN)
────────────────────────────────────────────────
隔离数量          4094               1600 万(24-bit VNI)
网络范围          单台/几台交换机     跨整个数据中心
多租户支持        无原生支持          原生支持
MAC 表约束        所有 MAC 必须学习   远端 MAC 封装在隧道
广播域大小        物理广播域          逻辑广播域
虚拟化亲和性      差                  强(虚机迁移不受限)
配置方式          逐台手工配置         自动(控制面/编排)
故障域            大(VLAN 蔓延)     小(隔离在 VNI 内)

3.3 从 VLAN 到 Overlay 的演进路径

数据中心网络虚拟化演进:

第 1 阶段:纯 VLAN(2000 年代)

VLAN 100 ────── VLAN 200 ────── VLAN 300 │ │ │ | S | | S | | S | | --- | --- | --- | --- | --- | │ │ │ └──── SVI 路由 ──┴── SVI 路由 ────┘

第 2 阶段:VLAN + QinQ(2000 年代末)

VLAN 100(客户 VLAN)+ S-VLAN(运营商 VLAN) 扩展了隔离数量(4094 × 4094)

缺点:MAC 表问题未解决 广播域扩大

第 3 阶段:VXLAN Overlay(2010 年代至今)

┌── VNI 10001 ──┐ ┌── VNI 10002 ──┐ ┌── VNI 10003 ──┐
VLAN 10 租户 A 生产 VLAN 20 租户 B 生产 VLAN 30 租户 C 生产
│ │ │
┌────┴───────────────────┴───────────────────┴────┐
│ VXLAN 隧道(Overlay) │
│ Underlay IP Fabric │
└─────────────────────────────────────────────────┘

四、Underlay 网络设计

4.1 Underlay 设计原则

Underlay 的核心任务:提供 IP 可达性

设计原则:
  1. 简单——只做 IP 转发,不做 Overlay
  2. 健壮——多路径、快速收敛
  3. 统一——全网统一 IGP 或 EBGP
  4. 可扩展——支持大规模水平扩展

4.2 Underlay 路由协议选择

方案 A:ISIS(推荐)

  # 典型 ISIS Underlay 配置
  isis 1
   network-entity 49.0001.0010.0100.1001.00
   is-level level-2
   cost-style wide
   #
  interface 100GE1/0/1
   isis enable 1
   isis circuit-type level-2
   isis cost 10

  优点:CLNS,不依赖 IP,纯路由协议
        适合大规模数据中心(RFC 动态主机名)
  缺点:学习成本较高

方案 B:EBGP Underlay(RFC 7938)

  # 典型 EBGP Underlay 配置
  bgp 65001
   peer 10.0.0.1 as-number 65002
   peer 10.0.0.1 connect-interface LoopBack0
   #
  interface 100GE1/0/1
   ip address 10.0.0.0/31
   #

  优点:天然防环、策略控制强、大规模成熟
        每 Spine/Leaf 独立 AS
  缺点:配置量大、BGP 学习曲线

方案 C:OSPF(小规模)

  适用:< 50 台设备的较小 DC
  不推荐用于大规模数据中心

4.3 Underlay 地址规划

Underlay IP 地址规划示例(/31 P2P 链路):

设备 Loopback 地址
Spine-1 Spine-2 Spine-3 Spine-4 Leaf-1 Leaf-2 Leaf-3 ... 10.1.0.1/32 10.1.0.2/32 10.1.0.3/32 10.1.0.4/32 10.1.1.1/32 10.1.1.2/32 10.1.1.3/32 ...

P2P 链路地址(10.2.x.x/31):

Spine-1 → Leaf-1: 10.2.0.0/31(Spine 端: .0, Leaf 端: .1) Spine-1 → Leaf-2: 10.2.0.2/31 Spine-2 → Leaf-1: 10.2.1.0/31 ...

设计要点: Loopback 地址用于 BGP/ISIS Router-ID 和隧道源 P2P 使用 /31 不浪费地址 地址规划预留扩容空间


五、Overlay 网络设计

5.1 VNI(VXLAN Network Identifier)

VNI 规划原则:

  1. VNI = Overlay 的 VLAN
  2. 每个租户/业务/子网对应唯一 VNI
  3. VNI 全局唯一(跨所有 Leaf)

VNI 规划示例:

  数据中心 A:

  VNI 10001: 租户 A - 生产 - VLAN 10 - 192.168.1.0/24
  VNI 10002: 租户 A - 开发 - VLAN 20 - 192.168.2.0/24
  VNI 10003: 租户 A - 测试 - VLAN 30 - 192.168.3.0/24
  VNI 20001: 租户 B - 生产 - VLAN 10 - 10.10.0.0/16
  VNI 20002: 租户 B - 开发 - VLAN 20 - 10.20.0.0/16
  ...

  推荐编码方案:
    VNI = 租户ID(8bit) + 子网ID(8bit) + 环境位(8bit)

  例如:
    10001 = 0001 0000 0001(租户1,子网0,环境1=生产)
    10002 = 0001 0000 0010(租户1,子网0,环境2=开发)

5.2 Overlay 网关设计

Overlay 网关位置:

  方式 1:集中式网关(VLAN 时代遗留)

    所有 Overlay 流量集中到一对网关设备
    网关做 VXLAN 终结 + 三层路由

    缺点:
      单点瓶颈
      东西向流量绕行
      不适用于 Spine-Leaf

  方式 2:分布式网关(Spine-Leaf 推荐)

    每台 Leaf 都是 VXLAN 网关
    VTEP(VXLAN Tunnel Endpoint)在 Leaf 上

    优点:
      东西向流量直接 Leaf 转发
      无集中瓶颈
      水平扩展

5.3 VXLAN 隧道建立

VXLAN 隧道模式:

  模式 1:静态 VXLAN(手工配置)

    # Leaf1 上配置静态 VXLAN
    bridge-domain 10
     vxlan vni 10001
     vxlan peer 10.1.1.2        # Leaf2 的 IP

  缺点:
    每增加一台 Leaf,需要在所有 Leaf 上配置
    N 台 Leaf → N×(N-1)/2 条配置
    20 台 Leaf → 190 条配置

  适用:小规模静态环境

  模式 2:EVPN 动态 VXLAN(推荐)

    EVPN 自动完成:
      VTEP 发现
      VNI 映射发布
      MAC/IP 路由学习

    新增 Leaf 时 EVPN 自动感知
    无需手工配置隧道

六、Overlay 趋势总结

当前及未来的 Overlay 技术趋势:

1. VXLAN 已成为 Overlay 事实标准
   所有主流厂商支持
   EVPN 作为控制面

2. 从 VLAN 到 VXLAN 的迁移不可逆
   虚拟化和容器化驱动
   4094 的限制无法绕过

3. Underlay 趋简
   CLOS + EBGP/ISIS
   只负责 IP 可达性

4. Overlay 智能化
   EVPN 自动控制面
   意图驱动策略(HUAWEI iMaster NCE-Fabric)

七、总结

知识点 核心要点
VLAN 优势 简单、成熟、广泛支持
VLAN 局限 4094 上限、大二层困难、MAC 表膨胀
Overlay 核心 Underlay+Overlay 两层解耦
VXLAN VNI 24-bit,1600 万隔离域
Underlay IP 可达性,ISIS/EBGP 协议
分布式网关 每 Leaf 做 VXLAN 终结,水平扩展
演进趋势 VLAN → QinQ → VXLAN Overlay
EVPN 驱动 自动 VTEP 发现、MAC/IP 路由分发

八、思考

  1. VLAN 的 4094 限制在数据中心场景下为什么成为瓶颈?哪些场景最容易碰到这个限制?
  2. Overlay 网络的核心思路是什么?Underlay 和 Overlay 如何解耦?
  3. 传统 VLAN 在虚拟机热迁移场景下有什么问题?VXLAN 如何解决?
  4. Underlay 选择 ISIS 和 EBGP 各有什么优缺点?
  5. VNI 规划的原则有哪些?如果租户 A 有 3 个业务(生产、开发、测试),每个业务在不同 Leaf 上,应该如何规划 VNI 和 VLAN 的映射关系?

下篇预告:第255篇《VXLAN 在数据中心的应用场景》——深入 VXLAN 封装格式、VTEP 工作原理、数据平面转发流程与典型部署。