Proxmox VE 集群管理器 pvecm 是一款用于创建一组 物理服务器。这样的群称为。我们使用 Corosync 集群引擎来实现可靠的群组 沟通。集群中没有明确的节点数量限制。 实际上,实际可能的节点数可能受主机和 网络表现。目前(2021年),有关于集群(使用 高端企业硬件)拥有超过50个节点在生产中。

PVECM可用于创建新集群,将节点连接到集群, 离开集群,获取状态信息,并做各种与集群相关的工作 任务。Proxmox cluster File System(“pmxcfs”) 用于透明地将集群配置分发到所有集群 节点。

将节点分组到集群中有以下优势:

  • 集中式、基于网络的管理

  • 多主集群:每个节点可以完成所有管理任务

  • 使用 pmxcfs,一种数据库驱动的文件系统,用于存储配置 文件,通过CoroSync在所有节点上实时复制

  • 虚拟机和容器在物理间的便捷迁移 主持人

  • 快速部署

  • 集群范围的服务,如防火墙和HA

集群要求

  • 所有节点必须能够通过UDP端口5405-5412相互连接 为了让Corosync正常工作。

  • 日期和时间必须同步。

  • 节点之间需要在TCP 22端口上建立SSH隧道。

  • 如果你对高可用性感兴趣,你需要拥有 至少有三个节点以确保可靠的法定人数。所有节点都应拥有 同样的版本。

    注释对于较小的双节点集群,QDevice 可以用来提供第三票。
  • 我们建议为集群流量使用专用的物理网卡。

    注释Proxmox VE 集群通信使用 Corosync 协议。需要保持一致 低延迟但带宽不多。一个专用的1 Gbit网卡就足够了 大多数情况下都是这样。这有助于避免其他服务被消耗的情况 所有可用的带宽。这反过来又会增加 Corosync 数据包。
  • 额外的集群流量链路提供冗余,以防专用网络瘫痪了。

    注释Corosync 支持最多 8 条链路。
    注释为了确保Corosync的可靠性,至少必须有 另一个连接在另一个物理网络上。这使得 Corosync 能够保持 如果专用网络瘫痪,集群通信仍保持活跃。
    注释单一链路由键支撑,在某些失效时可能存在问题 情景,参见Corosync相对于债券
  • 添加节点需要集群节点的root密码。

  • 只有当节点拥有 CPU 时,虚拟机的在线迁移才被支持。 来自同一个供应商。否则可能有效,但这从来没有保证。

  • 集群所有节点的时区和时间要统一,推荐配置同一个NTP服务器。

集群实现功能

加入集群后的 PVE 节点可以实现集中管理、虚拟机/容器的在线迁移、高可用 (HA) 故障自愈,以及统一的配置与防火墙策略。相比单机模式,集群显著提升了可扩展性、可靠性和运维效率。


加入集群后的主要功能

  • 集中式管理
    所有节点共享 Web 界面,任何节点都能管理整个集群。配置通过 pmxcfs 自动同步,避免手工维护。

  • 虚拟机/容器迁移
    支持 在线迁移 (Live Migration),在不中断业务的情况下将 VM/LXC 从一台物理主机迁移到另一台,实现负载均衡与维护便利。

  • 高可用 (HA)
    借助 pve-ha-managerwatchdog,当节点宕机时,集群会自动在其他节点上重启受影响的虚拟机,保障业务连续性。

  • 统一防火墙策略
    防火墙规则可在集群范围内快速下发,保证安全策略一致。

  • 共享存储整合
    配合 Ceph、NFS、iSCSI 等共享存储,迁移时只需传输内存状态,速度快且网络压力小。


集群架构关键点

组件 作用
Corosync 集群通信与心跳检测,保证节点状态一致
pmxcfs 分布式配置文件系统,实时同步配置
votequorum 仲裁机制,防止脑裂,保证集群一致性
pve-ha-manager 高可用资源监控与故障恢复
watchdog 节点失联时自动重启释放资源

风险与注意事项

  • 配置覆盖风险:加入集群时,节点原有 /etc/pve 配置会被覆盖,需提前备份虚拟机并重新导入。
  • 节点数量要求:至少 3 节点才能保证可靠的 quorum;双节点需额外配置 QDevice
  • 硬件兼容性:在线迁移要求 CPU 厂商一致,否则可能失败。
  • 网络要求:Corosync 对延迟敏感,建议使用专用 NIC,避免与存储/迁移流量混用。 virtualenvironment.cn shallowhave.github.io Proxmox VE 中文文档

在 PVE 集群中启用 HA (High Availability),需要满足一系列条件,确保故障时虚拟机能自动迁移或重启。核心条件如下:


HA 实现条件

  • 集群节点数量
    至少 3 个节点,保证 quorum 仲裁正常工作。双节点集群必须额外配置 QDevice,否则容易脑裂。

  • 共享存储
    所有 HA 虚拟机必须使用共享存储(如 Ceph、NFS、iSCSI),否则故障节点上的磁盘无法在其他节点访问。

  • Corosync 通信稳定
    集群心跳依赖 Corosync,要求低延迟、稳定网络,最好使用独立网卡或 VLAN,避免与迁移/存储流量混合。

  • Watchdog 配置
    每个节点必须启用硬件或软件 Watchdog,保证节点失联时能自动触发重启,释放资源。

  • pve-ha-manager 服务
    集群必须运行 HA 管理器,负责监控虚拟机状态并在故障时调度到其他节点。

  • 一致的 CPU 架构
    在线迁移和 HA 重启要求 CPU 指令集兼容,通常需同一厂商、同一代架构。

  • 虚拟机 HA 标记
    在 VM 配置中显式启用 HA,集群才会对其进行故障恢复;未启用的 VM 不会自动迁移。


额外注意事项

  • 仲裁机制:必须保证多数节点在线,否则 HA 无法正常工作。
  • 资源预留:集群需有足够的空闲资源,否则故障节点上的 VM 无法在其他节点启动。
  • 测试验证:建议在生产前进行故障模拟,验证 HA 是否能按预期恢复。

创建集群

  • 打开Web界面,数据中心-集群 - 创建集群 - 输入集群名字 - 选择集群通信链接

  • 创建完成

在shell查看状态

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
root@pve-S1:~# pvecm status
Cluster information
-------------------
Name: PVE-CU1
Config Version: 1
Transport: knet
Secure auth: on

Quorum information
------------------
Date: Mon Aug 24 12:15:17 2026
Quorum provider: corosync_votequorum
Nodes: 1
Node ID: 0x00000001
Ring ID: 1.5
Quorate: Yes

Votequorum information
----------------------
Expected votes: 1
Highest expected: 1
Total votes: 1
Quorum: 1
Flags: Quorate

Membership information
----------------------
Nodeid Votes Name
0x00000001 1 100.64.91.61 (local)

加入集群

获取集群加入信息 - 在一个PVE上创建集群后复制加入信息

PS:注意IP地址可互相通信,这个IP地址在 /etc/hosts文件里面读取,可修改重启后再次读取。

在第二台PVE节点加入到已有集群

  • 注意,密码是第一台创建集群的PVE root密码。

查看状态 - 在任意集群内节点登录

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
root@PVE-S2:~# pvecm status  
Cluster information
-------------------
Name: PVE-CU1
Config Version: 2
Transport: knet
Secure auth: on

Quorum information
------------------
Date: Mon Aug 24 12:52:37 2026
Quorum provider: corosync_votequorum
Nodes: 2
Node ID: 0x00000002
Ring ID: 1.32
Quorate: Yes

Votequorum information
----------------------
Expected votes: 2
Highest expected: 2
Total votes: 2
Quorum: 2
Flags: Quorate

Membership information
----------------------
Nodeid Votes Name
0x00000001 1 100.64.91.61
0x00000002 1 100.64.91.104 (local)

PS:Ceph + HA最好使用3个以上节点才能支持。

集群统一性配置

  • 网卡可三层互通
  • 配置统一的NTP和时区
  • 统一的apt源,且软件包版本统一。

PVE系列文章:https://songxwn.com/categories/PVE/

运维技术交流群

发送邮件到 ➡️ [email protected]

或者关注WX公众号:网工格物

微信扫码

博客(最先更新)

https://songxwn.com/