VDN8 社区采样适配器
vflash.adapters.vdn_h3.VDNEngineSession 是显式启用的 latent 后端,不是当前 H3Pipeline 默认模型的替换。它使用训练后的 VDN 混合注意力权重,不是给原始 H3 随意替换一个 attention 开关。当前固定单 SM89 48GB、逐行 FP8、8步、50层 DiT 驻留, TokenRefiner 独立流式处理。完整 I2VA/真正 FL2VA 已覆盖5–10秒,不外推所有尺寸或其他架构。
安装固定版本、输入字段与可运行 Python 用例见英文接口说明。 FreeVideo 固定 5878b005,VDN 固定 30b6b380,配套 Diffusers 树为 37068ab7; 使用隔离环境,不能就地改写其他应用依赖。代码 Apache 许可和 MiniMax 模型社区许可分别遵守, 没有复制 ComfyUI/GPL 代码。模型获取、官方文本/首尾帧编码、VAE/音频及 MP4 交付由调用方负责。
两阶段模式采用8步低画布生成、latent放大/对齐裁切、原训练时间表的最后2步。 调用方必须将目标RGB参考图通过 first_pass_reference 处理后,重新编码为低画布条件; 缺失时明确拒绝,不退回高画布 latent 插值。这一改进缓解了两个本地案例的首段突变, 不会通过贴首帧或丢帧掩盖错误。真正FL保持首尾顺序和双参考文本编码。
调用方显式提供放大器;本地验证为BF16加额外通道归一化,区别于上游FP16。 同单SM89、1280×704/10秒首尾帧,全画布8步363.397秒,修正后的8+2步240.029秒, 包含首尾编码/初始化/采样/解码,不含已缓存的文本编码和设备交接。冷暖状态未严格配平, 运动轨迹也不同,不能称普适等质倍率或默认上线资格。保留全画布8步作可选对照。
实例串行持有固定画布,拒绝并发调用,异常恢复目标画布,close()释放自身资源。 不得用外层 inference_mode 制造跨线程不可写的预取缓冲区;内部采用 no_grad。 不管理产品账号、积分、机器调度或自动重试。
VDNKeyframePipeline 新增直接接收 VideoRequest、返回完整 MP4/VideoResult 的显式接口, Python 用例见英文页。full8 为默认,pixel8+2 为显式两阶段选项,不伪装为 Base16。 参考图在文本和 VAE 编码前统一居中覆盖到目标画布;支持已有静音和显式端点交付合同, 默认解码模式不贴首帧。只在 MP4 完整编码后原子发布,不覆盖已有文件。 未传复用scope时逐请求加载编码,各候选始终独立采样;CPU媒体解码器保留, 显式scope条件复用见下文。完整接口已在单SM89完成新编码 I2VA 1536×640/5秒195.0秒及FL2VA 1280×704/10秒266.5秒(精确端点与静音交付), 不可把已缓存文本的采样时延冒充这个端到端接口的延迟,也不代表网站默认已经切换。
同请求候选的干净条件复用
在同一个pipeline串行生成不同seed的候选时,可向generate显式传入相同的 ConditioningReuseScope;英文页含用例。每个owner/已接受请求使用独立不透明scope, 不直接接受客户端提供的scope。不传则关闭复用并清空缓存。
仅CPU保留原始文本特征和干净VAE条件,不缓存TokenRefiner、DiT或随机噪声; 提示词、顺序RGB内容、画布、模型路径或采样计划变化均失效,模型资产必须不可变。 最多2项/256MiB,闲置一小时后在下次访问清除;换scope、生成失败及close均清除。 不跨进程共享,因此另一张GPU上的首个候选不会获得此收益。
单RTX 4090 48GB、SelfLift6+2、1536×640/5秒三片对照,条件编码36.954秒降至 0.128/0.114秒,保留约25.3MiB。相同seed的所有解码RGB帧完全相同,新seed产生不同视频。 近静音音频不逐位相等(PCM16最大差6、RMS差0.581),不宣称完整音视频等价。 总耗时231.334/147.019/150.101秒包含首次decoder和冷暖差异,只有约36.8秒编码消除 归因于缓存;丰富音频及其他策略尚无同级GPU对照。公共核心来自集成源码83512f70。
显式 SelfLift-zero 6+2
strategy="selflift6+2" 按论文独立实现免训练修正。 原时间表前6次在半尺寸画布运行,对最新干净预测进行全部帧的浮点像素/VAE往返, 在每个latent时间位置独立按通道平均空间差异选择60%位置做强度1修正,再沿原音视频时钟运行2次高分辨率采样。 总计8NFE,不是完整低分辨率8步再额外加2步;无需学习式放大器。
当前仅支持单SM89 48GB、5秒首帧I2VA、最短边至少640。该策略明确拒绝FL、尾帧、 更小画布及更长时长,其余策略保留自身合同。VAE往返有真实开销,报告单独记录, 往返前释放DiT、之后重建;没有修改模块级全局采样函数。
三例动画、真人、群体动作中,选择性修正显著减少直接nearest升latent的重复轮廓伪影; 真人原尺寸局部比全像素回编码保留更多脸部/服饰细节。不代表相对full8全场景占优, 也没有根治小脸或动作问题,仍需按完整视频选择;论文图像模型的倍率不移植到H3。 没有复制无许可社区节点代码,没有包含私有媒体或新增修复权重。
0.6.5修复周期性清晰度跳变
旧图像式全局时间/空间阈值,把H3不同latent时间相位的幅度差误当成空间风险,导致修正比例 周期变化。原稀疏缩略图漏掉了此问题。新版每个时间位置独立计算空间分位和强度范围,不平均 相邻帧、不加步数、不改权重或时间表。
三例单SM89五秒对照复用同一前六步与像素/VAE中间状态,仅补末两步。17帧相位log边缘能量 跨度由真人1.175→0.119、动作1.172→0.123、动画0.288→0.051;这是诊断量,不是画质评分。 连续原尺寸局部中软硬切换明显减轻,衣纹、背景与角色细节保留。跨时间共享空间mask也有效, 选择逐时间方案以保留随动作调整修正区域的能力。公共核心来自集成源码7855b6b5。
物理/动作、小脸和其他闪烁仍未根治,不保证任意场景。旧稀疏帧“通过”不再作为时序稳定证据, full8仍是独立选项。
后续640×640完整请求虽然技术成功,却在脸部和衣物上出现新的瞬时斑点。因此短边640只是 执行边界,不是自动采用的充分质量依据;上述较干净的控制实际为992×992和1536×640。 更小、尚未取得画质资格的画布保留full8,不把解码成功当视觉质量通过。
显式学习型 latent 放大 6+2
strategy="learned6+2" 保持六低+两高的原八步音视频时钟,但把zero的像素/VAE修正 替换为显式本地BF16 LBH H3 latent upscaler。 必须提供VDNAssets.upscaler_checkpoint,缺失就报错,不自动下载或回退。额外通道归一化、 对齐裁切、原时间表后两步均保留;报告区分rho=0、pixel_vae_roundtrip=False和放大器的 加载/计算成本。这不是十步pixel8+2,也不是VDN与LightX LoRA的组合。
执行范围仍为单SM89 48GB、五秒首帧、短边至少640。保持显式选择,不以技术成功 作为全部画布的自动质量资格。三来源复用前六步预测、演化音频和目标条件的对照, 加载加学习型lift0.832–1.606秒,旧全视频VAE往返39.758–42.212秒;这是阶段成本, 不是无缓存端到端倍率。三条成片均完整解码,全片抽样及真人连续原尺寸裁切中主体和细节保留, 没有重现旧强周期软硬切换;动作/动画的部分边缘时序代理量变差,旧动作物理及小脸缺陷仍在, 音频语义未评审。有限观察支持消除VAE工作的净收益,不宣称普适等质。集成源码9a235f0b。
随后公共完整Python接口在单RTX 4090 48GB完成1536×640、五秒新编码请求, 含首次准备共196.599秒。条件编码36.601秒;两阶段采样、加载及lift共90.295秒 (其中实际采样65.764秒,完整lift1.232秒);最终媒体25.450秒。 其他首次准备开销计入总耗时,没有省略。交付120帧/24fps、完整音视频解码通过; 20全片点及18连续原尺寸脸部保持可见细节,没有重现旧强周期软硬切换。 这是一条完整执行验证,不是严格配平的无缓存提速倍率,丰富音频语义仍未评审。