首页/私有大模型

私有大模型部署与优化

你的模型、你的硬件、你的数据边界

Velyrix 在专属 GPU 上为你安装、量化、基准测试并运营开源前沿模型 — 可以在 Velyrix 云、你的托管机房,或完全物理隔离的本地环境。交付的是兼容 OpenAI 接口的端点,并对吞吐、时延与可用性写入合同。

模型家族
支持 10 个
推理引擎
vLLM · SGLang · TensorRT-LLM
首 token 时延
目标低于 250 ms
部署形态
云 · 托管机房 · 完全离线
接口
兼容 OpenAI
为什么自建

公有 API 很方便,直到数据是你自己的

受监管数据、专有源代码、病历、交易头寸与主权类业务,通常不适合排在别人的推理队列里。 如今开源权重模型的质量已经足够接近前沿,自建部署正在成为严肃业务的默认选项。

  • 数据不出边界 — 没有第三方留存,也不会拿你的提示词去训练
  • 成本可预测 — 固定的 GPU 成本,而不是随业务增长而膨胀的按 token 计费
  • 版本稳定 — 你验证过的模型就是你一直在跑的模型,除非你自己决定升级
  • 时延可控 — 端点与应用在同一区域,甚至同一栋楼
  • 深度定制 — LoRA 适配器、领域微调、自定义工具 schema 与护栏
  • 可审计 — 完整请求日志写入你自己的 SIEM,按你的策略保留
drop-in migration
# 迁移前 — 公有 API
client = OpenAI(api_key="sk-...")

# 迁移后 — 你的 Velyrix 私有端点
client = OpenAI(
    base_url="https://llm.internal.acme.com/v1",
    api_key=os.environ["VELYRIX_KEY"],
)

resp = client.chat.completions.create(
    model="qwen3-235b-a22b-fp8",
    messages=[{"role": "user", "content": prompt}],
    tools=tools, stream=True,
)

# 同一个 SDK,同一套接口。你的 VPC、你的日志、你的密钥。
模型清单

十个开源权重模型家族,提供部署与长期支持

每个家族我们都维护经过验证的部署方案、量化配置与基准基线,并随新版本发布持续更新。

DeepSeek

稀疏 MoE 旗舰与推理型模型,另有适合低成本部署的蒸馏稠密版本。

MoE推理型原生 FP88×H200

Qwen

阿里巴巴的稠密与 MoE 系列,从 0.6B 到 235B+,多语言、代码与视觉语言版本都很强。

稠密 + MoE多语言VL代码

Llama

Meta 应用最广的开源权重家族 — 生态工具、适配器与评测体系最完整,最稳妥的默认选择。

8B–405BMoE 版本生态庞大

OpenAI gpt-oss

OpenAI 的开源权重版本,MoE 架构,推理强度可调,在较少 GPU 上也有出色的工具调用能力。

120b / 20bMXFP4智能体

Mistral

欧洲模型,多数版本许可较为宽松 — 覆盖稠密、MoE、代码与小型边缘模型。

Apache 系欧洲来源代码边缘

GLM

智谱的中英双语 MoE 家族,智能体与代码能力突出,另有更轻量的 Air 级版本。

MoE中英双语智能体

Kimi

月之暗面的万亿参数级稀疏 MoE 模型,面向长上下文与工具调用型智能体构建。

万亿级 MoE长上下文智能体

MiniMax

采用高效注意力的 MoE 架构,面向超长上下文窗口,同时保持有竞争力的推理成本。

MoE百万上下文高效注意力

Gemma

Google 的轻量开源模型 — 单卡质量比出色,适合本地部署、边缘与大批量分类任务。

1B–27B多模态边缘可用

NVIDIA Nemotron

NVIDIA 优化过的开源模型家族,针对 NVIDIA 加速卡吞吐与企业智能体流程做过调优。

Nano / Super / UltraTensorRT-LLMNIM

模型名称为各自所有者的商标。Velyrix 是独立的基础设施服务商,与上述模型发布方不存在关联或 背书关系。每个模型都按其自身许可证部署,我们会在部署前与你一同审阅 — 详见 模型许可

容量规划

每一类模型大致需要多少算力

以下是单副本生产部署的参考配置,并为实际并发下的 KV Cache 预留了空间。最终规格取决于你的 上下文长度、并发量与时延目标。

模型类别精度最少 GPU推荐配置参考吞吐基础设施月成本起
小型稠密(1B – 9B)BF16 / FP81× L40S2× L40S / 1× H1002,500 – 6,000 tok/s$1,640
中型稠密(12B – 32B)FP8 / AWQ-INT41× H100 80GB2× H100 / 2× H2001,800 – 4,500 tok/s$3,300
大型稠密(70B – 123B)FP82× H2004× H200 / 8× H1001,400 – 3,200 tok/s$10,400
超大稠密(405B)FP88× H2008× B200900 – 2,100 tok/s$23,900
稀疏 MoE(总参数 100B – 250B)FP84× H2008× H2003,000 – 9,000 tok/s$18,400
稀疏 MoE(总参数 400B – 700B)FP8 / FP48× H2008× B200 / 16× H2004,000 – 14,000 tok/s$23,900
稀疏 MoE(万亿参数级)FP8 / FP416× H2008× B300 / GB300 partition6,000 – 20,000 tok/s$44,800
视觉语言模型(任意规模)BF16 / FP8视觉塔额外 +1 卡独立编码器副本取决于业务负载单独报价

吞吐为并发请求下的总输出 token 每秒,测试环境为 Velyrix 参考硬件并使用贴近生产的提示词。 我们会在签约前用你的真实业务负载实测,并把实测数字写入服务水平目标。

性能优化

"能跑"和"跑得好"之间的差距

在八张卡上直接跑一个默认容器,通常会浪费掉两到五倍的吞吐。Velyrix 的优化项目会从分词器 一路调到网卡。

量化

FP8、NVFP4/MXFP4、AWQ、GPTQ 与 SmoothQuant 方案,上线前先用你自己的评测集做精度回归测试。

并行策略

按模型与 GPU 拓扑选择张量、流水线、专家与数据并行组合,包括 MoE 场景下 NVLink 感知的专家分布。

🔄

连续批处理

PagedAttention、分块 prefill 与调度器调优,在不突破首 token 时延目标的前提下保持 GPU 高占用率。

🔁

Prefill / Decode 分离

把 prefill 与 decode 拆成独立资源池并传输 KV,避免长提示词阻塞交互式解码。

🏃

投机解码

草稿模型、EAGLE 类与 n-gram 投机,按你的接受率调优 — 交互式负载上常见 1.5–2.5 倍加速。

💾

KV Cache 工程

前缀与 radix 缓存、缓存下沉到主机内存或 NVMe、KV 量化,不加卡也能延长上下文。

📈

弹性伸缩与路由

多副本路由、缓存感知负载均衡、按队列深度自动扩缩容,并为交互式与批量流量设置优先级。

🧪

评测流水线

把你的黄金测试集接入 CI,任何模型、量化或引擎升级都必须先过质量关,而不只是看速度。

🔨

引擎选型

vLLM、SGLang、TensorRT-LLM 或 NVIDIA Dynamo,按业务负载选择,并用你的真实流量做横向评测后再定。

部署形态

三种划定数据边界的方式

上线最快

部署在 Velyrix GPU 云

位于 Velyrix 区域的单租户 GPU,通过专线连接你的 VPC,技术栈由 Velyrix 运营。

  • 数天内上线
  • 副本弹性伸缩
  • Velyrix 7×24 运维
  • 符合区域数据驻留要求
最均衡

部署在你的托管机房

硬件是你的、笼位是你的,由 Velyrix 按托管服务协议完成部署与运营。

  • 资产归你
  • 技术栈由我们运营
  • 资本支出模式
  • 完全的物理控制权
最严格

本地与完全离线

完全断网部署,配套离线的模型与容器镜像源,不产生任何对外遥测。

  • 不依赖互联网
  • 离线仓库与更新
  • 适配涉密与强监管场景
  • 现场交付培训
不止于推理

适配、检索与智能体

  • 继续预训练 — 当领域词汇与语言风格比指令跟随更重要时
  • 监督微调与 LoRA — 支持多适配器服务,一个基座可承载数十个任务适配器
  • 偏好优化 — 基于你自己的标注数据做 DPO、GRPO 与奖励模型流程
  • 蒸馏 — 把大教师模型蒸馏成小学生模型,推理成本可降一个数量级
  • 检索增强 — 向量与混合检索、切分策略、重排序与强制引用
  • 智能体基础设施 — 工具 schema、结构化输出、沙箱执行与兼容 MCP 的工具服务
  • 安全护栏 — 输入输出分类、PII 脱敏、越狱检测与完整提示词审计日志

模型许可与治理

开放权重不等于可以随意使用。部署之前,Velyrix 会逐一审阅你打算运行的 每个模型的许可证,并把由此产生的义务写成文档。

  • 许可证分类 — 宽松型、社区型或定制条款
  • 可接受使用范围与领域限制
  • 署名、命名与再分发义务
  • 商用门槛与衍生作品条件
  • 每个模型检查点及其来源的溯源记录

Velyrix 提供基础设施与工程服务,不授予任何第三方模型的权利。客户始终是其所选模型的 被许可方,并负责遵守相应许可证与适用的 AI 监管要求(包括在适用范围内的欧盟 AI 法案)。我们会以 文档与技术手段支持这一过程。

服务套餐

私有大模型项目怎么推进

试点

2–3 周

  • 模型选型工作坊
  • 单副本部署
  • 对照你的评测集做基准
  • 成本与容量模型
  • 是否继续的评估报告

$27,000 起

最常选

生产部署

6–10 周

  • 多副本高可用架构
  • 量化与引擎调优
  • 网关、鉴权、配额与日志
  • 护栏与评测 CI
  • 运维手册与团队培训

$83,500 起

托管大模型服务

长期

  • 7×24 端点运维
  • 吞吐与时延 SLA
  • 模型与引擎升级
  • 容量与成本报告
  • 季度优化评审

$10,500 / 月起

以上为专业服务的参考报价,不含 GPU 基础设施费用与税费。具体范围在需求沟通后确定。

与 AI 基础设施架构师沟通

GPU 归你所有,运营交给我们

从任何一家 OEM 或代理商采购你的 NVIDIA 服务器,直接发到 Velyrix 机房,剩下的交给我们 — 部署、组网、散热、监控与长期支持。当然也可以直接租用我们的机器。无论哪种方式,一个工作日内给你完整方案。

常见问题

Velyrix 可以为我们部署哪些大模型?

我们维护十个开源权重家族的验证部署方案:DeepSeek、Qwen、Llama、OpenAI gpt-oss、Mistral、GLM、Kimi、MiniMax、Gemma 与 NVIDIA Nemotron,包含它们的视觉语言、代码与推理型版本。其他开源权重模型也可按需接入。

跑一个私有大模型需要多少张 GPU?

7B–9B 模型单张 L40S 或 H100 即可稳定服务。70B 稠密模型在 FP8 下通常需要 2 到 4 张 H200。400B–700B 的大型稀疏 MoE 一般需要约 8 张 H200 或 8 张 B200,万亿参数级模型通常部署在 B300 或 GB300 分区上。最终规格取决于上下文长度、并发量与时延目标。

量化会不会损失模型质量?

FP8 在现代检查点上通常接近无损;NVFP4/MXFP4 与 4-bit 权重量化会用少量质量换取显著的吞吐与显存收益。Velyrix 一定会用你自己的评测集测出差异,并在量化版本上线前把结果告诉你。

可以做到完全物理隔离吗?

可以。离线部署会随附离线模型权重、内部容器仓库、离线软件源,并且不产生任何对外遥测。更新以签名校验后的介质形式,通过你的变更管理流程交付。

除了推理,你们也做微调吗?

做。包括继续预训练、监督微调、支持多适配器服务的 LoRA、DPO 与 GRPO 等偏好优化,以及把大教师模型蒸馏成更便宜的小模型。

模型许可证的责任由谁承担?

客户是其所选第三方模型的被许可方。Velyrix 提供基础设施与工程服务,会在部署前与你一起审阅每个模型的许可条款并记录相应义务,但不授予任何第三方模型的权利。

你们承诺什么性能指标?

在用你的真实流量完成基准测试之后,Velyrix 会就总吞吐(tokens/s)、p95 首 token 时延、p95 token 间隔时延与月度端点可用率写入具体数字,并在每次升级后重新验证。