从采购单到第一个训练任务之间的全部工作
大多数 GPU 项目并不是败在芯片上。它们败在冷却液回路、一根接错的 rail、八个节点之间 不一致的固件,或者根本没有人真正测过这张网络到底跑出了什么。
设计与工程
集群拓扑、机柜立面图、配电方案、冷却液回路设计、重量与楼板承重、布线图与物料清单。
物流与收货
货运协调、报关单证支持、安全收货、资产采集、序列号登记与拆包清运。
上架安装
HGX、DGX、MGX 与 ORv3 系统的机械安装、导轨、CDU 与分水器管路、按扭矩规范紧固,全程静电防护。
供电与散热
由持证电工完成母线与电源接入、A/B 路负载均衡、冷却液灌注与压力测试、漏液检测系统调试。
网络建设
rail-optimized InfiniBand 或 Spectrum-X 布线、按图贴标、光模块安装、链路训练、误码率扫描与拓扑核对。
固件基线
BIOS、BMC、CPLD、网卡、NVSwitch 与 GPU VBIOS 在所有节点上统一到同一验证基线,并提供偏差报告。
软件栈
系统镜像、NVIDIA 驱动、CUDA、Fabric Manager、DCGM、容器运行时、Slurm 或 Kubernetes、存储客户端与监控代理。
烤机与验证
72 小时持续压力、温度浸泡、ECC 与 XID 监控、内存行重映射检查、存储与网络吞吐测试。
验收与交付
书面验收测试结果、竣工图纸、资产台账、运维手册、升级路径与操作人员培训。
Velyrix 的九阶段部署流程
一套可复制的九阶段流程,配有专属项目经理、每周进度报告,以及每个阶段结束时的书面 节点确认。
需求梳理与方案评审
把业务画像、模型规模、token 预算与增长曲线转化为集群拓扑、功率包络与存储容量规划。交付物:设计文档与物料清单。
场地就绪评估
对照设计核查电力容量、楼板承重、冷却液供给、卸货通道、消防与布线路径。交付物:就绪报告与差距清单。
采购与物流支持
跟踪 OEM 交期、制定暂存方案、支持进出口单证,并在受管制硬件发运前完成最终用户筛查。交付物:到货排期表。
机械安装
机柜找平与接地、系统上架、分水器与冷板管路连接、冷却液灌注与压力测试、按图理线。交付物:竣工立面图。
电气调试
由持证电工按书面作业指导书完成回路接入、相位平衡、断路器级联配合与计量校验。交付物:电气验收签字。
网络建设与验证
rail-optimized 布线与贴标、逐条链路满速训练、误码率扫描、拓扑图与设计逐项比对。交付物:链路与拓扑报告。
软件与集群启用
标准镜像部署、强制固件基线、调度器配置、存储挂载、监控与告警对接。交付物:配置基线。
烤机与性能验证
72 小时满载压力、NCCL all-reduce 与 all-gather 基准、存储吞吐,以及目标规模下的参考模型训练任务。交付物:基准测试结果。
验收与运维移交
验收测试报告评审与签署、运维手册与升级路径移交、操作人员培训,并可选择转入 Velyrix 托管运维。交付物:签署版 ATP。
我们凭什么说"做完了"
合格标准在设计阶段就以书面形式确定,并在交付时逐项测试。在固定总价项目中,任何不达标项 都由 Velyrix 自费整改并重测。
| 测试项 | 方法 | 典型合格标准 | 证据 |
|---|---|---|---|
| GPU 清点与健康 | nvidia-smi、DCGM Level 3 诊断 | 100% GPU 被识别,无不可纠正 ECC,无待处理行重映射 | 逐节点 DCGM 报告 |
| 持续烤机 | 72 小时 GPU、CPU、内存与 NVMe 联合压力 | 0 次 XID 错误、0 次温度降频、频率稳定 | 时序遥测数据导出 |
| NVLink / NVSwitch | nvbandwidth、点对点带宽时延测试 | 每一对链路带宽在平台参考值 5% 以内 | 带宽矩阵 |
| 链路质量 | 链路训练、误码率扫描、端口错误计数 | 全部链路满速,符号错误率低于厂商阈值,72 小时无抖动 | 网络健康报告 |
| 集合通信性能 | NCCL all-reduce 与 all-gather,8 MB – 8 GB | 满规模下总线带宽在拓扑参考值 10% 以内 | nccl-tests 输出 |
| 存储吞吐 | 对并行文件系统执行 fio 与 IOR | 达到合同约定的总读写带宽与 checkpoint 时间 | 基准测试日志 |
| 参考训练任务 | 目标节点规模下运行 Llama 级参考模型 | 达到合同约定的 MFU 与单步时间 | 训练日志与 MFU 计算 |
| 故障切换与冗余 | A/B 路断电、拔叶交换机、CDU 水泵切换 | 冗余路径下任务不中断,并记录恢复时间 | 测试见证表 |
| 温度与功耗 | 满载浸泡测试,记录进风、出风与液温遥测 | 设计环境温度下所有部件在原厂规格范围内 | 热分布测量报告 |
| 安全基线 | 安全启动、BMC 加固、凭据轮换、网络分段 | 100% 节点执行基线,无默认凭据 | 配置审计报告 |
经得起 OEM 与保险公司审核
部署工作会碰到别人的保修、别人的机房和带电设备。Velyrix 因此把流程做得非常严格。
- 作业指导书与风险评估在进入带电机房作业前完成签发与审批
- 持证电工负责所有电源接入,遵守当地规范与电弧防护规程
- 静电防护符合 ANSI/ESD S20.20,保护 OEM 保修条件
- 遵循 OEM 安装指南,确保原厂保修与支持权益不受影响
- 全程监管链:从卸货到上架,逐台记录序列号并留存照片
- 变更管理:明确作业窗口、回退方案与客户审批节点
- 投保并经背景审查的工程师,按站点单独授权准入
- 出口管制筛查在受管制硬件发运或安装前完成
合作方式
范围、验收标准与价格都事先约定。全新集群最常用的方式。
按工程师日费计价,适用于扩容、整改、迁移与既有环境的问题排查。
Velyrix 工程师在约定周期内驻扎你的现场,与你的团队并肩工作并完成能力转移。
我们先建,再按可用性与性能 SLA 长期托管运营。
固定总价的部署费用,通常从简单风冷扩容的每节点约 $2,300,到含组网、验证与文档的液冷 整机柜系统的每节点 $4,600–$10,900 不等。每个项目都在设计评审之后单独报价。
我们也是别人项目背后的那支现场工程队
我们的团队本来就是按"为硬件厂商及其合作伙伴交付"来组织的 — 可以挂我们的品牌, 但对你更有用的往往是挂你们自己的品牌。
- 白标交付 — 项目计划与验收报告上是你的品牌
- Dell、Supermicro、GIGABYTE、HPE、Lenovo 与 NVIDIA DGX 平台的验证部署手册
- L1–L3 支持,并有通往原厂的明确升级通道
- 按装机量配置的 RMA 协调与备件库
- 项目报备与书面的渠道中立政策
从施工方式上就不影响保修
我们部署的每一个平台,都有一份基于原厂公开安装指南编写的 Velyrix 部署手册。
- 符合 ANSI/ESD S20.20 的静电防护
- 遵循扭矩规范与导轨安装规程
- 固件基线与厂商验证版本一致
- 保留逐台序列号记录与照片证据
- 按厂商要求的格式整理故障证据
结果是:原厂保修与支持权益完整保留,也不会出现因安装方式引发的 RMA 争议。
第一次建设之后的部署服务
迁移与搬迁
在机房之间或服务商之间搬迁在运行的 GPU 机队,制定分阶段切换方案,把训练中断降到最低,并完成资产核对。
集群健康审计
对既有集群做独立评估:链路错误、固件偏差、散热余量、调度效率与实际 MFU,并给出按优先级排序的整改方案。
生命周期与换代
容量规划、分阶段硬件换代、按 NIST SP 800-88 完成介质擦除的下架,以及合规处置或转售支持。
托管运维
7×24 监控、故障响应、固件与驱动生命周期、备件管理,以及对照 SLA 的容量报告。
常见问题
AI 基础设施验收具体包含什么?
验收是在交付前证明集群达到设计标准的正式流程:固件基线、72 小时烤机、GPU 与 NVLink 健康检查、链路质量扫描、NCCL 集合通信基准、存储吞吐测试、参考训练任务、故障切换测试与热分布测量 —— 全部汇总进一份签署版验收测试报告。
Velyrix 可以在我们自己的机房施工吗?
可以。我们很大一部分工作就是在客户或第三方场地完成的,包括企业机房、政府设施以及其他运营商的托管机房。我们会遵守场地方的准入、安全与变更管理规定;如果这样更省事,我们也可以作为你现有集成商的分包方参与。
全新 GPU 集群交付要多久?
硬件到场后,单个 pod 的建设通常为三到六周。从设计、场地施工、硬件交期到建设与验收的端到端周期,全新 AI 工厂一般为 12 到 20 周,其中 OEM 交期是最大变量。
第三方施工会让原厂硬件保修失效吗?
只要按厂商公开的安装指南施工就不会。Velyrix 工程师遵循 OEM 规程,执行静电防护、扭矩规范与逐台序列号记录,因此原厂保修与支持权益完整保留。
如果集群没有通过验收测试怎么办?
在固定总价项目中,Velyrix 会自费整改并重新测试,直到达到约定标准。若问题源于硬件缺陷,我们会代你向 OEM 走保修流程并全程跟进。
你们支持 GB300 NVL72 这类液冷整机柜系统吗?
支持。液冷项目除标准的计算与网络验收流程外,还包括分水器与冷板安装、冷却液灌注与压力测试、CDU 调试、漏液检测验证与水泵切换测试。