跳到正文

实测数据 ​

每组数据只适用于标明的软件版本、硬件和负载。它们是已公开验证的摘要,保留原始范围,便于复测;不能直接视为当前版本的速度排名。当前运行配置见配置与硬件,新测量的方法见性能与质量。

原生544p训练关键帧 · 有界实测 ​

核心ce23c10、应用实验源码3648270f,在同一张RTX 4090 48 GB上比较。 两臂均为BF16分块驻留、重新编码提示词/图像、768×320、五秒24fps;同场景参考、提示、seed相同, 连续原始解码交付。候选为LightX544八次计算/Torch Flash,对照为官方16步/Sol;这是组合对照, 不能把差异全归因于步数。

场景原16/Sol完整请求原生544/8完整请求原16/Sol采样原生544/8采样
真人群像113.886秒61.953秒89.009秒36.935秒
多人动作107.090秒56.165秒87.044秒36.152秒

请求计入新条件编码、采样、音视频解码和MP4交付,不含进程初始化及外部排队/网络。 两臂各串行运行两例;初始化分别76.873/76.087秒(对照/候选),另计入各自首个结果, 因此首片总耗时为190.759/138.040秒。这是每场景每臂一次观察,非交错控漂移或吞吐基准; 请求降低45.6%–47.6%不能外推更大画布或SM86。

四片完整AV解码通过;每片20全图点、每条真人片12原尺寸脸部点显示主体和动作保持, 未见此前二采彩斑。表情和动作轨迹有变化,后景小脸仍软;精确对白、声音语义和全部指令细节未资格化。 支持保留小画布可选方案,不是普遍等质或人脸修复结论。

同候选pipeline还完成512×512五秒真正尾帧请求,无重初始化60.630秒(采样39.783秒)。 实际输入仅尾帧,不是首帧倒放或交付贴图;无匹配尾帧速度倍率。一次性原生编译278.153秒, 显式元数据验证、不重新哈希大权重,不计入请求。各请求GPU已分配峰值约8.3–8.4GiB, 不是全显存驻留或主机内存用量。

另一次640×352十秒真正FL2VA接收首尾两锚,交付240帧;含75.407秒初始化总178.171秒, 请求102.763秒(采样72.219秒),复用同一编译资产。全片观察保留动画主体从地面到飞行的变化, 外观随两端不同设计演变。这是一条长时执行/视觉观察,不是匹配质量或速度对照。

精确的H3条件编码前缀 ​

固定Diffusers H3编码器 读取Qwen3-VL的hidden_states[50],且原本已绕过词表head。Vflash在安装卸载钩子前保留51层, 不再执行完整64层;只保留50层会错误取得最终归一化状态。 作者的截短模型说明也描述了这个边界; 本实现不采用其低秩或量化权重。

冻结首帧、尾帧两例均为928×512、8秒、BF16条件编码;每个A/B/A2序列在同一物理卡执行, A2恢复64层。SM89基线4910216,SM86基线53d6687,固定Torch 2.11.0、Diffusers 0.40.0、 Transformers 5.9.0。本条件screen不运行去噪。

编码设备 / 功耗上限输入A capture51层captureA2 capture
RTX 4090 48 GB / 350 W首帧16.778秒11.006秒13.444秒
RTX 4090 48 GB / 350 W尾帧11.953秒9.862秒11.963秒
RTX 3080 20 GB / 200 W首帧18.834秒12.695秒15.622秒
RTX 3080 20 GB / 200 W尾帧13.666秒11.184秒13.557秒

候选和A2各自的14个完整条件张量均与同架构A逐位一致。首个A含首次调用开销,对比暖态A2, capture约减少18–19%,不是完整视频或去噪倍率。SM86仅使用所借双卡中的编码卡,不是双卡并行 编码;该组与另一GPU负载共享主机,故仅作有界阶段测量,不作孤立吞吐结论。尾层共 6,338,778,368个BF16参数(张量存储11.81 GiB);移除引用不等于实测进程RSS减少同等大小, 首次官方检查点加载也未改变。私有实验与资源回执保留在应用仓库的73590e21阶段中。

同350 W SM89的完整8秒首帧A/B中,192帧全部RGB(273,678,336个通道值)和512,000个解码 双声道PCM16采样均逐位一致,最后的64层回归对照也保持每个像素和PCM16采样一致。 预加载后的generate为303.798/303.251/305.163秒(A/B/A2),编码18.309/16.443/18.421秒; 去噪仍占主导且算法未改。整片差值很小,不作正式延迟倍率或将阶段百分比套到全片。 这些调用耗时不含预加载、网站排队和网络交付;预加载分别79.601/74.667/72.101秒,也不能 据此宣称冷启动更快。输出一致不意味着已有语义或画质缺陷被修复。

4090 FFN 融合 · 纳入 0.2.2 ​

0.2.2 纳入的实现曾在同一张 RTX 4090 48 GB、默认 450 W 功率下,与 0.1.0a6 原生引擎进行对照。固定负载为 BF16 Ref4 v0.1(rank 128、alpha 8、scale 0.0625),928 × 512、124 模型帧、20,828 个打包 token,全部 50 层执行四次去噪。两侧都使用分块流式权重、相同条件包、cuBLAS GEMM、Torch Flash attention、PyTorch 2.11.0+cu130 与 Triton 3.6.0,仅改变 FFN 适配器合并与 SiLU。编码、VAE 解码、MP4 导出和模型初始化不在本次原生请求计时内。

原生热请求次数中位数范围GPU 已分配显存峰值
分开合并和激活343.033 秒42.994–43.082 秒9,281,030,144 B
融合内核342.569 秒42.539–42.600 秒8,683,849,728 B

中位耗时减少 0.464 秒 / 1.08%,显存分配减少 597,180,416 B。交错执行的原实现请求包围融合请求,对照漂移为 0.204%;最高温度 75°C,热降频计数未增长。全部最终 FP32 音视频 latent 精确一致。这是一项固定原生负载的目标硬件测量,不代表广泛的速度或质量保证。

随后,同一内核在 0.2.1 完整链路上使用另一种打包长度(18,922 token)做集成检查。三参考图按“原实现、融合、原实现”生成,条件、最终 latent 和每帧解码视频一致,取消请求后释放持有存储。该负载的去噪分配峰值由 8,577,681,920 降至 8,035,150,336 B,各阶段观察到的最高值仍为 9,945,532,928 B。三次执行的首次使用缓存不同,每侧仅一个样本,因此不能据其总耗时计算端到端提速。主机 RSS 峰值为 114.38 GiB。具体启用范围和音频限制见 0.2.2 发布说明。

双 3080 · a3 ​

以下对照测于 a3,早于 a4 的分段锁页内存改动。保留原始耗时和内存数字用于追溯,不把它们视为后续每个版本的实测;a5 的读取与生命周期重构没有重新排名这组结果。

目标硬件测量冻结了同一个 Ref2VA Turbo4 请求:928 × 512、124 个模型帧、四次评估、18,175 tokens、BF16 权重和精确注意力。单卡基线与双卡使用同一张主 RTX 3080 20 GB,双卡另加一张相同型号。两张卡均使用默认 320 W 功耗上限,通过没有 peer access 的 PCIe 3.0 x16 主机桥连接。环境为 PyTorch 2.11.0+cu130、Triton 3.6 和八个 CPU 线程。

预热后执行方式重复次数条件包到 latent 中位耗时范围
单卡4 个锚点85.694 s85.539–85.805 s
双卡 sequence-head349.671 s49.599–49.973 s

该负载实测加速 1.725×。三组交错 A/B/A2 的锚点漂移最大 0.227%;采样中没有热降频,热计数器未增长,每次请求前后的 CUDA 探针均通过。对照在同一进程中保留单卡和双卡显存缓冲环,共享主机权重,避免重复加载。下面的内存数字来自另一个独立会话。

当时 a3 的独立序列/头并行会话在文件系统缓存已热的情况下初始化耗时 41.758 s,首请求 51.186 s,第二请求 49.441 s。去噪阶段两卡分配峰值为 4.745 / 4.614 GiB,活跃锁页主机内存 58.009 GiB,进程峰值 RSS 59.90 GiB。初始化、文件缓存、显存分配、预留内存和进程 RAM 是不同口径。

标准权重 tensor 在另一个独立会话中完成三次预热后请求:中位 58.615 s,范围 58.526–58.709 s,约为此前同主卡单卡锚点的 1.462×。初始化 47.899 s,首请求 60.079 s;两卡去噪分配峰值 4.825 / 4.785 GiB,锁页主机内存 58.792 GiB,峰值 RSS 60.70 GiB。这是单独的 TP 筛查,没有重新交错单卡 A/B/A2;一次采样出现瞬时软件热标志,热计数器未增长,也没有对应的时钟降低。三次结果全部保留,不将其与上面的隔离对照混为同一认证等级。

计时止于 latent 文件导出,不包含提示词/参考编码、VAE 解码、MP4 编码、排队和网络传输。双卡协作降低一个请求的延迟;两个独立单卡 worker 的吞吐取舍需要单独测量。

两种并行策略都已执行完整轨迹并完成一个视频与音频解码对照,但不与单卡逐位一致。通信流水线本身与未流水线化的序列/头轨迹逐位一致;分片会改变 GEMM 形状,而标准权重 TP 还会增加归约边界。一个解码样例不构成跨案例质量认证,这里不宣称同质量或通用的提示词到视频加速。

4090 主机内存分配 · a4 ​

单张 RTX 4090 48 GB / SM89 的一次 Ref2VA 对照使用了 3 张参考图、928 × 512 分辨率、124 个模型帧和 24 fps 模型时钟。在 PyTorch 2.11.0+cu130 中比较 0.1.0a3 的分配方式与随 0.1.0a4 发布的分配方式。固定配置为 BF16 Ref Turbo4 v0.1、4 NFE,视频/音频 shift 为 12/3,LoRA strength 为 1、alpha 为 8。权重的活跃锁页内存从约 58.009 GiB 降到 40 GiB。相同输入下,最终视频与音频 latent 和原分配方式逐位一致。预热后的原生去噪耗时由 41.607 s 变为 41.641 s,持平;实测收益是降低主存占用。40 GiB 仅为锁页权重分配量,整个进程仍需额外系统内存。

另一个同卡四步容量对照比较了权重常驻与分块加载。最终 latent 逐位一致,但分块加载耗时更长;这项检查支持的是容量选项,不代表分块加载更快。

Vflash · 原生 MiniMax H3 推理