福福不服 福福不服
深圳 --°
正在加载音乐 请稍候

从零搭建计算存储分离的 HCI Mesh 架构:两台 Dell R760 的超融合踩坑实录

image-zhn6.png

📖 背景与目标

手头有两台 Dell PowerEdge R760 服务器,配置如下:

  • 存储服务器:2 × Intel Xeon Platinum 8470Q,256GB 内存,8 × 4TB SAS SSD。

  • 计算服务器:2 × Intel Xeon Silver 4514Y,128GB 内存,BOSS-N1 系统盘。

  • 物理网络:1GbE 网络,内网网段 192.168.11.0/24。

核心目标:利用 VMware vSAN 7.0 U3 和 HCI Mesh 技术,搭建一套“计算与存储分离”的架构——计算服务器只提供 CPU 和内存,存储服务器提供 25TB 的 vSAN 共享存储池,实现资源的集中管理与按需分配。

历经几天折腾,从硬件兼容性、ESXi 安装、vCenter 部署,到 vSAN 磁盘组、HCI Mesh 挂载,再到时间同步、证书、DNS 和虚拟机网络踩坑,最终成功跑起虚拟机。本文记录了整个过程的步骤与踩坑经验。


🛠️ 第一阶段:硬件准备与 ESXi 安装

1.1 关键硬件更换

  • 致命陷阱:原配的 PERC H330 阵列卡不被 vSAN 支持。即使配置为 Non-RAID 模式也无法绕过。

  • 解决方案:将存储服务器 H330 更换为 HBA330(或 H730P 并配为直通模式),并在 BIOS 中开启 Non-RAID(直通)模式。

1.2 安装 ESXi

  • 使用 Dell 定制版 ESXi 7.0 U3 A25(Build 24411414)镜像。

  • 安装目标务必选择 BOSS-N1 的 M.2 RAID 1 虚拟盘,切勿将系统盘纳入 vSAN 磁盘组。


🗄️ 第二阶段:配置单节点 vSAN 集群

2.1 部署 vCenter

  • 在计算服务器上部署 vCenter Server Appliance (VCSA) 7.0。

  • 设置静态 IP(如 192.168.11.252)。

2.2 创建磁盘组

  • 创建 Storage-Cluster 集群,开启 vSAN。

  • 磁盘组配置:1块 4TB SAS SSD 作为缓存层,剩余7块作为容量层(驱动类型均选“闪存”)。

  • vSAN 网络:在 vmk0 上勾选 vSAN 服务(忽略 RDMA 不支持的红字警告)。

2.3 单节点致命设置:FTT=0

单节点 vSAN 没有冗余副本,必须手动创建存储策略:

  • 策略名称:vSAN-Single-Node

  • 站点容灾:无 - 标准集群

  • 允许的故障数 (FTT):无数据冗余(即 FTT=0)。

  • 将该策略设为 Storage-Cluster 的默认存储策略。


🔗 第三阶段:HCI Mesh 计算集群配置

  1. 创建 Compute-Cluster 集群(不勾选 vSAN),将计算服务器加入。

  2. 在 Compute-Cluster 的 vSAN 服务中,选择 “vSAN HCI Mesh 计算集群”。

  3. 配置计算服务器的 vSAN VMkernel 端口。

  4. 进入 数据存储共享,点击 挂载远程数据存储,选中 Storage-Cluster 的 vsanDatastore。


💻 第四阶段:虚拟机创建与网络排查

4.1 创建虚拟机

  • 在 Compute-Cluster 中创建。

  • 磁盘位置选择挂载过来的 vsanDatastore。

  • 存储策略务必选择 vSAN-Single-Node(否则报错不合规,无法开机)。

4.2 网络不通的经典坑

  • 现象:虚拟机获取不到 DHCP,手动配静态 IP 也无法 Ping 通。

  • 原因:虚拟机网卡编辑设置里,DirectPath I/O 被勾选了。

  • 解决:关机虚拟机,取消勾选 DirectPath I/O,开机后网络恢复。

  • 后续坑:内网通了,外网不通。

  • 解决:手动修改 /etc/resolv.conf,添加 nameserver 114.114.114.114,并在网卡配置文件中固化 DNS 设置。


⚠️ 第五阶段:核心踩坑与填坑记录(精华)

坑 1:vCenter 使用 IP 作为 FQDN 导致 SSO 登录失败

  • 现象:部署时 FQDN 填了 IP(192.168.11.252),导致登录时报 [400] 处理来自 vCenter Single Sign-On 服务器的身份验证响应时出错。

  • 原因:vCenter 的 SSO 和 STS 服务强依赖 DNS 解析和证书绑定,纯 IP 会引发证书不匹配。

  • 解决:在 vCenter 虚拟机的 /etc/hosts 中绑定 IP 与主机名,并确保所有节点都能解析。最佳实践是部署时使用真实域名(如 vcsa.lab.local)并配置 hosts。

坑 2:时间偏差 7 小时 29 分,Skyline 报黄叹号

  • 现象:主机和 VC 之间的时间已同步 警告,且 Skyline 报错。

  • 原因:主机未配置 NTP,或公网 NTP 无法解析。

  • 解决:通过 SSH 登录 ESXi 主机,执行 ntpdate -u ntp.aliyun.com 强制同步时间,并执行 esxcli system ntp set -s ntp.aliyun.com -e 1 启动 NTP 服务。同时将 vCenter 和所有 ESXi 主机统一为 Asia/Shanghai 时区。

坑 3:HCI Mesh 挂载失败:“无法在 vsanDatastore 中使用默认策略置备对象”

  • 现象:计算集群挂载远程 vSAN 数据存储时,检测不通过。

  • 原因:存储集群的默认策略是 vSAN Default Storage Policy(FTT=1,要求双副本),单节点根本无法满足。

  • 解决:在 Storage-Cluster 的数据存储配置中,将 vSAN Default Storage Policy 改为 vSAN-Single-Node(FTT=0),重新挂载即可成功。

坑 4:浏览器上传 ISO 报错“操作失败(证书不信任)”

  • 现象:向数据存储上传 ISO 时报错。

  • 解决:在浏览器中新开标签页,访问 https://192.168.11.250,手动接受自签名证书,然后回到 vSphere Client 重新上传。

坑 5:vSphere Client 登录与首页加载缓慢

  • 现象:登录卡一会,首页加载卡一会,加载完却流畅。

  • 原因:vCenter 和 ESXi 使用了公网 DNS(202.96.134.133),解析内网主机名超时。

  • 解决:在 vCenter 和两台 ESXi 的 /etc/hosts 中强制绑定所有内网节点的 IP 与主机名,并在个人电脑的 hosts 文件中添加解析。内网环境强烈建议搭建本地 DNS 或统一修改 hosts,绝不依赖公网 DNS 解析内网地址。


💡 最终总结与建议

  1. 关于单节点 vSAN:FTT=0 意味着数据零冗余。一旦 8 块盘中的任何一块损坏,数据将无法恢复。必须建立严格的定期备份机制(如导出 OVF 模板或使用备份软件)。

  2. 关于网络:vSAN 官方强烈推荐 10GbE 网络。虽然测试环境下 1GbE 也能跑,但生产环境务必升级。

  3. 关于许可:ESXi 可使用 vSphere Enterprise Plus 激活;vCenter 需单独使用 vCenter Server Standard 许可;vSAN 需要 vSAN Enterprise 或更高许可(用于 HCI Mesh)。评估期均为 60 天,到期前记得替换正版。

  4. 关于时区与时间:vSphere 体系对时间极其敏感。部署完成后,第一件事就是配置 NTP,统一所有节点的时区与时间,避免 90% 的证书与 SSO 诡异报错。

这套架构成功运行的那一刻,感觉之前踩的所有坑都值了。希望这篇记录能帮到同样在折腾 HCI Mesh 的你!