配置与硬件
一个运行配置(profile)确定模型、LoRA 版本、步数和计算方式;默认显存策略取决于所选硬件。选择时,需要让配置、硬件和编译资源相互匹配。
可用配置
Ref2VA 基于参考素材生成视频和音频;T2VA 使用文本条件,不需要参考图片;I2VA 锚定第零帧,L2VA 只锚定尾帧,FL2VA 同时锚定片段两端。Base 与 Ref 权重相互独立。完整链路通过相互匹配的固定配置接收这些输入。下列原生接口接收预编译条件包,其默认驻留策略与完整链路不同。
| 显卡 | 配置 | 步数 | 权重加载方式 |
|---|---|---|---|
| RTX 4090 48 GB | ref2va-turbo4-exact-sm89 | 4 | 常驻显存 |
| RTX 4090 48 GB | ref2va-turbo8-exact-sm89 | 8 | 常驻显存 |
| RTX 3080 20 GB | ref2va-turbo4-exact-sm86 | 4 | 从系统内存分块加载 |
| RTX 4090 48 GB | t2va-turbo4-exact-sm89 | 4 | 常驻显存;见下方验证范围 |
| 双 RTX 3080 20 GB | t2va-turbo4-exact-sm86 | 4 | 分块加载;仅 sequence-head |
| RTX 4090 48 GB | i2va-base16-bf16-sm89 | 16 | 常驻显存 |
| 双 RTX 3080 20 GB | i2va-base16-bf16-sm86 | 16 | 分块加载;sequence-head |
| RTX 4090 48 GB | fl2va-base16-bf16-sm89 | 16 | 常驻显存 |
| 双 RTX 3080 20 GB | fl2va-base16-bf16-sm86 | 16 | 分块加载;sequence-head |
HTTP 服务默认使用 4090 Turbo4。切换配置时,需要同时更换匹配的资源并重启服务。
Base16 与 544p关键帧Turbo成对配置在各自的一对内部共享工件,已加载的 H3Pipeline 可串行接受 I2VA、L2VA 和 FL2VA,无需重启。L2VA 是请求合同而非重复的权重身份;已准备的 profile ID 保留作为来源身份。不能跨 LoRA 版本复用工件,也不适用于 Ref2VA 和 T2VA。
vflash profiles
vflash plan ref2va-turbo8-exact-sm89 --gpu 0文生视频
自 0.2.0 起支持 t2va-turbo4-exact-sm89 的完整文生视频链路。准备 Base4 资产后,生成请求不再需要参考图。
需要 Base4 v1.0 权重工件、Base 辅助张量、video/audio shift 6/3 调度,以及没有参考图的 T2VA 条件包。Ref2VA 工件不能执行这个任务;切换模式需要建立独立会话并加载对应资源。
实际 SM89 T2VA 容器重复执行同一个固定请求,全部 14 个官方条件张量和最终 FP32 音视频 latent 精确一致。两段五秒视频及音轨完整解码,重复请求的画面一致,取消后资源正确释放。官方音频 VAE 的原始输出可能存在微小浮点变化。这些是实现和生命周期验证,不代表广泛的指令遵循或音频质量资格。T2VA Turbo8 和更新的 Base4 适配器仍不在此配置范围内。
0.3.2 新增 t2va-turbo4-exact-sm86,仅使用双 3080 和 sequence-head。应编译独立的 Base SM86 资产,并向原生会话提供匹配的 T2 条件包。应用持有的阶段已完成五秒 928 × 512 和十秒 640 × 352 请求;新配置的独立五秒 H3Pipeline 包装尚未重跑,两个已测形状不能覆盖任意更大输入。详见版本证据。
内存与部署
| 硬件 | 显存策略 | 选择时考虑 |
|---|---|---|
| 单 4090 48 GB | 默认权重常驻 | 多次请求复用权重;为中间结果留出足够显存 |
| 单或双 3080 20 GB | 从系统内存分块加载 | 权重保存在系统内存;双卡共同处理一个请求 |
| 单 4090,显存需要更多余量 | 显式选择 block-ring | 用系统内存换取显存余量,需要单独测量延迟 |
CLI 使用 --weight-residency block-ring,Python 使用同名的会话选项。HTTP 服务使用所选配置的默认策略。
已测的 928 × 512、124 模型帧、4 步负载,建议每个 worker 至少预留 64 GiB 可用系统内存,并为操作系统和其他进程留出余量。使用分块加载时,显存占用不包括系统内存中的完整权重。更大输入和并发 worker 都需要重新检查容量。
完整 Ref4 和 T2VA 链路还需保存编码器和 VAE 的 CPU 权重,采用原生分块加载,为这些阶段留出显存。完整链路验证使用 240 GiB 主机内存上限;这是已测预算,不是最低要求,不能套用去噪器的 64 GiB 建议。SM89 的各阶段轮流使用同一卡;双 SM86 由主卡执行编码和解码、两卡共同去噪。一个三参考图请求的主机 RSS 峰值为 114.67 GiB,整卡占用为 11.05/6.85 GiB;部署时仍须为其他开销留出余量。
原生 Ref4 latent 接口的双 3080 可选择 sequence-head 或 tensor;T2VA 和完整生成必须使用 sequence-head。第二张卡由调用方显式指定。已测拓扑为无 peer access 的 PCIe 3.0 x16 主机桥连接,不需要 NVLink。设置方法见双卡执行,对照范围见实测数据。
上述支持范围只覆盖 20 GB 版 3080 和 48 GB 版 4090。其他显存容量、型号、更大的 GPU 组,以及任意分辨率或帧数组合尚未获得相同验证。
Turbo LoRA 支持
Vflash 可以直接执行固定版本的 LightX2V H3 Turbo LoRA,无需安装 LightX2V 推理框架。配置中的 LoRA、调度方式和步数必须与编译资源一致。
| 适配器 | 已支持硬件 | 上游文件 |
|---|---|---|
| Turbo4 v0.1 | 单/双 3080、单 4090 | minimax_h3_ref2v_turbo_4step_v0.1_bf16.safetensors |
| Turbo8 v1.0 768p | 单 4090 | minimax_h3_ref2v_turbo_8step_v1.0_768p_bf16.safetensors |
| 关键帧 Turbo4 v0.1 544p(预览) | 单4090;有限I2VA/L2VA/FL2VA成片证据 | minimax_h3_fl2v_turbo_4step_v0.1.safetensors |
| 关键帧 Turbo8 v1.0 544p(预览) | 单4090 | minimax_h3_fl2v_turbo_8step_v1.0_bf16.safetensors |
固定修订与来源见运行资源。T2VA 还支持用于 SM89 或双 SM86 T2VA 的 minimax_h3_fl2v_turbo_4step_v1.0_768p_bf16.safetensors,alpha128 / rank128。Base16关键帧不使用LoRA;上述544p Turbo成对配置则为rank128 / alpha8、shift12 / 3。仅支持明确列出的文件和修订;ComfyUI、自定义 LoRA 和未来上游版本需要单独适配。
Turbo4 和 Turbo8 都是蒸馏配置。减少步数可以降低计算量,但不代表输出质量与 50 步基础模型相同。名称中的 exact 描述所用注意力路径和指定 LoRA 的执行方式,不承诺不同 GPU 上的张量完全一致。
双卡模式已执行完整轨迹,并完成一个案例的视频与音频解码对照。它们保留精确注意力,但浮点舍入不同,不承诺输出一致或质量相同。
单卡 3080 配置已检查容量,以及同一显卡上串行加载与传输计算重叠时的结果一致性。独立参考实现对照和更广泛的质量评测仍待完成。
当前版本的边界
完整配置表记录各配置当前的成片验证范围,包括544p关键帧预览配置。单SM86与Ref Turbo8保留条件包到latent的原生接口;544p关键帧Turbo8成对配置另有完整pipeline。未列出的模式、LoRA、量化和时长帧率组合不在这些配置中。HTTP接口一次串行执行一个任务;账号、计费和分布式GPU调度由接入Vflash的应用负责。