跳到正文

配置与硬件 ​

一个运行配置(profile)确定模型、LoRA 版本、步数和计算方式;默认显存策略取决于所选硬件。选择时,需要让配置、硬件和编译资源相互匹配。

可用配置 ​

Ref2VA 基于参考素材生成视频和音频;T2VA 使用文本条件,不需要参考图片;I2VA 锚定第零帧,L2VA 只锚定尾帧,FL2VA 同时锚定片段两端。Base 与 Ref 权重相互独立。完整链路通过相互匹配的固定配置接收这些输入。下列原生接口接收预编译条件包,其默认驻留策略与完整链路不同。

显卡配置步数权重加载方式
RTX 4090 48 GBref2va-turbo4-exact-sm894常驻显存
RTX 4090 48 GBref2va-turbo8-exact-sm898常驻显存
RTX 3080 20 GBref2va-turbo4-exact-sm864从系统内存分块加载
RTX 4090 48 GBt2va-turbo4-exact-sm894常驻显存;见下方验证范围
双 RTX 3080 20 GBt2va-turbo4-exact-sm864分块加载;仅 sequence-head
RTX 4090 48 GBi2va-base16-bf16-sm8916常驻显存
双 RTX 3080 20 GBi2va-base16-bf16-sm8616分块加载;sequence-head
RTX 4090 48 GBfl2va-base16-bf16-sm8916常驻显存
双 RTX 3080 20 GBfl2va-base16-bf16-sm8616分块加载;sequence-head

HTTP 服务默认使用 4090 Turbo4。切换配置时,需要同时更换匹配的资源并重启服务。

Base16 与 544p关键帧Turbo成对配置在各自的一对内部共享工件,已加载的 H3Pipeline 可串行接受 I2VA、L2VA 和 FL2VA,无需重启。L2VA 是请求合同而非重复的权重身份;已准备的 profile ID 保留作为来源身份。不能跨 LoRA 版本复用工件,也不适用于 Ref2VA 和 T2VA。

bash
vflash profiles
vflash plan ref2va-turbo8-exact-sm89 --gpu 0

文生视频 ​

自 0.2.0 起支持 t2va-turbo4-exact-sm89 的完整文生视频链路。准备 Base4 资产后,生成请求不再需要参考图。

需要 Base4 v1.0 权重工件、Base 辅助张量、video/audio shift 6/3 调度,以及没有参考图的 T2VA 条件包。Ref2VA 工件不能执行这个任务;切换模式需要建立独立会话并加载对应资源。

实际 SM89 T2VA 容器重复执行同一个固定请求,全部 14 个官方条件张量和最终 FP32 音视频 latent 精确一致。两段五秒视频及音轨完整解码,重复请求的画面一致,取消后资源正确释放。官方音频 VAE 的原始输出可能存在微小浮点变化。这些是实现和生命周期验证,不代表广泛的指令遵循或音频质量资格。T2VA Turbo8 和更新的 Base4 适配器仍不在此配置范围内。

0.3.2 新增 t2va-turbo4-exact-sm86,仅使用双 3080 和 sequence-head。应编译独立的 Base SM86 资产,并向原生会话提供匹配的 T2 条件包。应用持有的阶段已完成五秒 928 × 512 和十秒 640 × 352 请求;新配置的独立五秒 H3Pipeline 包装尚未重跑,两个已测形状不能覆盖任意更大输入。详见版本证据。

内存与部署 ​

硬件显存策略选择时考虑
单 4090 48 GB默认权重常驻多次请求复用权重;为中间结果留出足够显存
单或双 3080 20 GB从系统内存分块加载权重保存在系统内存;双卡共同处理一个请求
单 4090,显存需要更多余量显式选择 block-ring用系统内存换取显存余量,需要单独测量延迟

CLI 使用 --weight-residency block-ring,Python 使用同名的会话选项。HTTP 服务使用所选配置的默认策略。

已测的 928 × 512、124 模型帧、4 步负载,建议每个 worker 至少预留 64 GiB 可用系统内存,并为操作系统和其他进程留出余量。使用分块加载时,显存占用不包括系统内存中的完整权重。更大输入和并发 worker 都需要重新检查容量。

完整 Ref4 和 T2VA 链路还需保存编码器和 VAE 的 CPU 权重,采用原生分块加载,为这些阶段留出显存。完整链路验证使用 240 GiB 主机内存上限;这是已测预算,不是最低要求,不能套用去噪器的 64 GiB 建议。SM89 的各阶段轮流使用同一卡;双 SM86 由主卡执行编码和解码、两卡共同去噪。一个三参考图请求的主机 RSS 峰值为 114.67 GiB,整卡占用为 11.05/6.85 GiB;部署时仍须为其他开销留出余量。

原生 Ref4 latent 接口的双 3080 可选择 sequence-head 或 tensor;T2VA 和完整生成必须使用 sequence-head。第二张卡由调用方显式指定。已测拓扑为无 peer access 的 PCIe 3.0 x16 主机桥连接,不需要 NVLink。设置方法见双卡执行,对照范围见实测数据。

上述支持范围只覆盖 20 GB 版 3080 和 48 GB 版 4090。其他显存容量、型号、更大的 GPU 组,以及任意分辨率或帧数组合尚未获得相同验证。

Turbo LoRA 支持 ​

Vflash 可以直接执行固定版本的 LightX2V H3 Turbo LoRA,无需安装 LightX2V 推理框架。配置中的 LoRA、调度方式和步数必须与编译资源一致。

适配器已支持硬件上游文件
Turbo4 v0.1单/双 3080、单 4090minimax_h3_ref2v_turbo_4step_v0.1_bf16.safetensors
Turbo8 v1.0 768p单 4090minimax_h3_ref2v_turbo_8step_v1.0_768p_bf16.safetensors
关键帧 Turbo4 v0.1 544p(预览)单4090;有限I2VA/L2VA/FL2VA成片证据minimax_h3_fl2v_turbo_4step_v0.1.safetensors
关键帧 Turbo8 v1.0 544p(预览)单4090minimax_h3_fl2v_turbo_8step_v1.0_bf16.safetensors

固定修订与来源见运行资源。T2VA 还支持用于 SM89 或双 SM86 T2VA 的 minimax_h3_fl2v_turbo_4step_v1.0_768p_bf16.safetensors,alpha128 / rank128。Base16关键帧不使用LoRA;上述544p Turbo成对配置则为rank128 / alpha8、shift12 / 3。仅支持明确列出的文件和修订;ComfyUI、自定义 LoRA 和未来上游版本需要单独适配。

Turbo4 和 Turbo8 都是蒸馏配置。减少步数可以降低计算量,但不代表输出质量与 50 步基础模型相同。名称中的 exact 描述所用注意力路径和指定 LoRA 的执行方式,不承诺不同 GPU 上的张量完全一致。

双卡模式已执行完整轨迹,并完成一个案例的视频与音频解码对照。它们保留精确注意力,但浮点舍入不同,不承诺输出一致或质量相同。

单卡 3080 配置已检查容量,以及同一显卡上串行加载与传输计算重叠时的结果一致性。独立参考实现对照和更广泛的质量评测仍待完成。

当前版本的边界 ​

完整配置表记录各配置当前的成片验证范围,包括544p关键帧预览配置。单SM86与Ref Turbo8保留条件包到latent的原生接口;544p关键帧Turbo8成对配置另有完整pipeline。未列出的模式、LoRA、量化和时长帧率组合不在这些配置中。HTTP接口一次串行执行一个任务;账号、计费和分布式GPU调度由接入Vflash的应用负责。

Vflash · 原生 MiniMax H3 推理