PVE 超融合基础设施 - 2.PVE 配置集群
Proxmox VE 集群管理器 pvecm 是一款用于创建一组 物理服务器。这样的群称为簇。我们使用 Corosync 集群引擎来实现可靠的群组 沟通。集群中没有明确的节点数量限制。 实际上,实际可能的节点数可能受主机和 网络表现。目前(2021年),有关于集群(使用 高端企业硬件)拥有超过50个节点在生产中。
PVECM可用于创建新集群,将节点连接到集群, 离开集群,获取状态信息,并做各种与集群相关的工作 任务。Proxmox cluster File System(“pmxcfs”) 用于透明地将集群配置分发到所有集群 节点。
将节点分组到集群中有以下优势:
集中式、基于网络的管理
多主集群:每个节点可以完成所有管理任务
使用 pmxcfs,一种数据库驱动的文件系统,用于存储配置 文件,通过CoroSync在所有节点上实时复制
虚拟机和容器在物理间的便捷迁移 主持人
快速部署
集群范围的服务,如防火墙和HA
集群要求
所有节点必须能够通过UDP端口5405-5412相互连接 为了让Corosync正常工作。
日期和时间必须同步。
节点之间需要在TCP 22端口上建立SSH隧道。
如果你对高可用性感兴趣,你需要拥有 至少有三个节点以确保可靠的法定人数。所有节点都应拥有 同样的版本。
对于较小的双节点集群,QDevice 可以用来提供第三票。 我们建议为集群流量使用专用的物理网卡。
Proxmox VE 集群通信使用 Corosync 协议。需要保持一致 低延迟但带宽不多。一个专用的1 Gbit网卡就足够了 大多数情况下都是这样。这有助于避免其他服务被消耗的情况 所有可用的带宽。这反过来又会增加 Corosync 数据包。 额外的集群流量链路提供冗余,以防专用网络瘫痪了。
Corosync 支持最多 8 条链路。 为了确保Corosync的可靠性,至少必须有 另一个连接在另一个物理网络上。这使得 Corosync 能够保持 如果专用网络瘫痪,集群通信仍保持活跃。 单一链路由键支撑,在某些失效时可能存在问题 情景,参见Corosync相对于债券。 添加节点需要集群节点的root密码。
只有当节点拥有 CPU 时,虚拟机的在线迁移才被支持。 来自同一个供应商。否则可能有效,但这从来没有保证。
集群所有节点的时区和时间要统一,推荐配置同一个NTP服务器。
集群实现功能
加入集群后的 PVE 节点可以实现集中管理、虚拟机/容器的在线迁移、高可用 (HA) 故障自愈,以及统一的配置与防火墙策略。相比单机模式,集群显著提升了可扩展性、可靠性和运维效率。
加入集群后的主要功能
集中式管理
所有节点共享 Web 界面,任何节点都能管理整个集群。配置通过 pmxcfs 自动同步,避免手工维护。虚拟机/容器迁移
支持 在线迁移 (Live Migration),在不中断业务的情况下将 VM/LXC 从一台物理主机迁移到另一台,实现负载均衡与维护便利。高可用 (HA)
借助 pve-ha-manager 与 watchdog,当节点宕机时,集群会自动在其他节点上重启受影响的虚拟机,保障业务连续性。统一防火墙策略
防火墙规则可在集群范围内快速下发,保证安全策略一致。共享存储整合
配合 Ceph、NFS、iSCSI 等共享存储,迁移时只需传输内存状态,速度快且网络压力小。
集群架构关键点
| 组件 | 作用 |
|---|---|
| Corosync | 集群通信与心跳检测,保证节点状态一致 |
| pmxcfs | 分布式配置文件系统,实时同步配置 |
| votequorum | 仲裁机制,防止脑裂,保证集群一致性 |
| pve-ha-manager | 高可用资源监控与故障恢复 |
| watchdog | 节点失联时自动重启释放资源 |
风险与注意事项
- 配置覆盖风险:加入集群时,节点原有
/etc/pve配置会被覆盖,需提前备份虚拟机并重新导入。 - 节点数量要求:至少 3 节点才能保证可靠的 quorum;双节点需额外配置 QDevice。
- 硬件兼容性:在线迁移要求 CPU 厂商一致,否则可能失败。
- 网络要求:Corosync 对延迟敏感,建议使用专用 NIC,避免与存储/迁移流量混用。 virtualenvironment.cn shallowhave.github.io Proxmox VE 中文文档
在 PVE 集群中启用 HA (High Availability),需要满足一系列条件,确保故障时虚拟机能自动迁移或重启。核心条件如下:
HA 实现条件
集群节点数量
至少 3 个节点,保证 quorum 仲裁正常工作。双节点集群必须额外配置 QDevice,否则容易脑裂。共享存储
所有 HA 虚拟机必须使用共享存储(如 Ceph、NFS、iSCSI),否则故障节点上的磁盘无法在其他节点访问。Corosync 通信稳定
集群心跳依赖 Corosync,要求低延迟、稳定网络,最好使用独立网卡或 VLAN,避免与迁移/存储流量混合。Watchdog 配置
每个节点必须启用硬件或软件 Watchdog,保证节点失联时能自动触发重启,释放资源。pve-ha-manager 服务
集群必须运行 HA 管理器,负责监控虚拟机状态并在故障时调度到其他节点。一致的 CPU 架构
在线迁移和 HA 重启要求 CPU 指令集兼容,通常需同一厂商、同一代架构。虚拟机 HA 标记
在 VM 配置中显式启用 HA,集群才会对其进行故障恢复;未启用的 VM 不会自动迁移。
额外注意事项
- 仲裁机制:必须保证多数节点在线,否则 HA 无法正常工作。
- 资源预留:集群需有足够的空闲资源,否则故障节点上的 VM 无法在其他节点启动。
- 测试验证:建议在生产前进行故障模拟,验证 HA 是否能按预期恢复。
创建集群

- 打开Web界面,数据中心-集群 - 创建集群 - 输入集群名字 - 选择集群通信链接

- 创建完成
在shell查看状态
1 | root@pve-S1:~# pvecm status |
加入集群
获取集群加入信息 - 在一个PVE上创建集群后复制加入信息

PS:注意IP地址可互相通信,这个IP地址在 /etc/hosts文件里面读取,可修改重启后再次读取。
在第二台PVE节点加入到已有集群

- 注意,密码是第一台创建集群的PVE root密码。
查看状态 - 在任意集群内节点登录
1 | root@PVE-S2:~# pvecm status |
PS:Ceph + HA最好使用3个以上节点才能支持。
集群统一性配置
- 网卡可三层互通
- 配置统一的NTP和时区
- 统一的apt源,且软件包版本统一。
PVE系列文章:https://songxwn.com/categories/PVE/
运维技术交流群
发送邮件到 ➡️ [email protected]
或者关注WX公众号:网工格物
