跳到正文

版本更新 ​

0.6.12 · 时长与参考数量资格扩展 ​

单SM89原始v0.1 hybrid/Veda在组合资源预算内支持最长十五秒图像条件交付和九张有序图像。修复十五秒VAE对齐边界并扩展精确媒体裁切。普通profile、双卡/SM86和视频参考保留原范围;H100未获资格。见完整链路与实测案例。

0.6.11 · 原生高清与激活生命周期优化 ​

增加最长边2048像素、最大2048²的五秒原生采样,需要原始v0.1、单SM89、hybrid及显式Veda。关键帧和图像参考使用原始来源;不是官方尚未公开的Regenerate-2K模型,也不是后处理。普通请求范围和自动注意力选择不变。

缩短注意力与FFN调制张量的存活时间。一个2048×1152完整控制的峰值allocated降低30.69%,120帧RGB一致;音频非逐样本一致。原生高清以更多时间和显存换取局部细节,实测范围见性能页。

0.6.10 · 显式Veda稀疏注意力 ​

单SM89原始LightX v0.1及显式hybrid可选择Veda注意力。 会话持有预测器,请求重置几何,直接接入既有两槽环;条件连接保留密集,首尾各五层使用Torch Flash, 回执声明实际INT8稀疏执行。显式安装器只封装固定上游独立核心和许可,不安装ComfyUI、 不下载权重、不改变auto默认;可显式回退到dense。

0.6.9 新增可选的完整视频FlashVSR空间超分。

0.6.9 · 可选FlashVSR空间超分 ​

新增upscale-video及vflash.flashvsr.FlashVSR,固定官方v1.1权重及RTX适配版本, 实际使用局部稀疏注意力。保留完整帧数、精确输出比例、有理数CFR及原音轨,另存结果; 修正示例的尾帧截断与中心裁切,颜色校正失败明确报错而非静默忽略。

RTX 4090 48GB五条2×/4×原型成片和一条公开接口2×成片通过;公开接口960×544五秒 处理43.19秒,加载另11.18秒。完整测量及限制保留细节重绘、 原有解剖/物理缺陷等边界。增强可选,不改变H3默认、不称无损修复;发布源码/wheel, 外部运行代码及权重必须显式提供,不自动下载或部署。

0.6.8 · 共享主干的hybrid多参考 ​

显式HybridModel仅替换官方Ref第25–49块调制,保留FL主干、条件前缀、输出层和原始v0.1适配器。 单SM89/dense Python实例可连续接受普通关键帧和1–3张真实Ref图片; Ref携带独立模型组合身份并以内存条件交接,不先生成替代首帧。 只增加约55.4 MiB调制表,不加载第二个主干。

公共接口Ref→I2→Ref已在一张RTX 4090 48 GB连续生成,完整AV和有界生命周期检查通过; 身份、异常清理和默认路径有CPU回归。计时、范围及剩余质量限制。 不承诺普遍画质改善,不开放hybrid视频参考或Sol;发布源码/wheel, 不含权重或新版预构建镜像,也不自动切换下游服务。

0.6.7 · 学习型latent放大6+2 ​

完整VDN接口新增strategy="learned6+2",显式提供本地BF16 LBH放大器,替换SelfLift-zero 的全视频VAE往返;保持干净的低/高画布条件、原八步音视频时间表,不增加NFE。 缺少权重明确报错,不自动下载;原selflift6+2、pixel8+2、full8及原生H3均保留。

三来源固定前六步对照显示显著放大阶段成本收益,已观察窗口未见新增重大缺陷; 部分时序诊断变差,动作物理和小脸仍未根治。执行范围、观察及计时边界。 保持显式选项,不自动替换下游默认。发布源码/wheel,不含权重或新版预构建镜像。

0.6.6 · 原始LightX v0.1关键帧 ​

独立预览I2VA/FL2VA配置固定原始544p v0.1四步权重、12/3时间表及rank128/alpha8残差。 同一配套pipeline接受仅首帧、仅尾帧及真正双端点,不把v1.0权重改名为v0.1。 单RTX 4090 48 GB三条960×544五秒dense请求排除初始化后约72–78秒。 这些配置支持显式Sol,但auto保持dense:配对Sol请求反而慢约20%–24%, 抽样未确认足以抵消成本的画质收益。官方Base16默认不变。

详见准确合同、端点执行证据与边界。 不宣称普遍修复人脸/动作或下游默认切换。发布源码/wheel,预构建镜像及应用需明确更新, 不附带权重。

0.6.5 · 时间感知的SelfLift修正 ​

每个latent时间位置独立选择空间修正区域和强度范围,避免H3时间相位幅度差影响筛选。 三例同前六步SM89对照中,周期性软硬切换明显减轻且保留有效细节;不做帧间平均、不增加NFE、 不改权重/时间表。动作与小脸问题仍未根治,见证据及边界。 发布源码/wheel,下游部署需明确更新运行时。

0.6.4 · 有界候选条件复用 ​

VDNKeyframePipeline.generate可接收ConditioningReuseScope,仅在同scope内 CPU复用原始文本和干净关键帧条件,各seed独立采样。未传scope默认关闭, 最多256MiB,换scope、执行失败或关闭时清空;不修改服务默认策略。 单SM89 SelfLift对照消除约36.8秒重复编码,同seed视频RGB一致,近静音PCM不逐位一致。 详见证据与边界。 发布源码/wheel,预构建镜像和下游部署需要明确更新。

0.6.3 · 原生544p关键帧与有界资产准备 ​

可选I2VA/FL2VA Turbo8-544使用独立固定LightX权重、rank/alpha和12/3时间表, 同一原生pipeline可接收仅首帧、仅尾帧和真正双端点。单张RTX 4090 48 GB已完成三条五秒视频; 两条同卡小画布对照比原16/Sol请求耗时降低45.6%–47.6%;另有真正首尾帧十秒请求复用同一编译资产完成。 详见测量边界与剩余质量问题。不修改Base16/VDN默认或外推任意画布和硬件。

Python准备/编译API新增显式verify_content_hashes=False,用于可信不可变本地快照。 仍检查完整张量头、大小和文件身份;上游来源摘要不冒充本地新测校验。 工件schema6和overlay schema3仅在显式关闭内容校验时接受缺失摘要;严格校验仍拒绝, 原内容校验模式继续默认。详见资产合同。源码/wheel与旧预构建镜像分开, 部署需要明确更新固定版本。

0.6.2 · 关键帧预览工件加载 ​

原生工件加载器现接受四个 SM89 Turbo4/Turbo8 预览配置已经声明的固定 I2VA/FL2VA adapter 身份。此前编译器和配置解析接受它们,但后续加载器的旧白名单仍会拒绝。 回归测试覆盖完整工件加载,而不只检查来源元数据。

权重 revision、时间表、NFE、精度及硬件检查继续强制执行。这是 CPU 合同修正, 不是新增 GPU 成片资格或质量/速度结论;没有启用 544p adapter、PDD、仅尾帧 Turbo, 没有修改 Base16/VDN 默认值或替换已部署引擎。发布源码与 wheel,既有预构建容器不变。

0.6.1 · SelfLift-zero 渐进首帧生成 ​

完整 VDN 接口增加 strategy="selflift6+2":6次低分辨率采样、全帧像素/VAE一致性 修正,再运行2次目标分辨率采样。按论文独立实现,无需额外训练权重,不修改全局采样器; 阶段加载及VAE往返成本明确计入。初期范围为单SM89 48GB、5秒I2VA、短边至少640。

三场景对照中,相比直接nearest提升latent,重复轮廓伪影大幅减少;相比纯像素回编码, 选择性修正保留部分脸部/服饰细节。不声称全场景优于full8、不宣称根治小脸,亦不沿用 图像论文的提速倍率。社区指南列出固定依赖和限制。 原full8默认、pixel8+2可选及独立原生H3管线均保留。

0.6.0 · 完整 VDN 关键帧管线 ​

可选的 VDN 接口 接受原始提示和首帧,或有序首尾帧,经官方条件编码 和媒体组件交付 MP4。显式选择全画布八步或像素条件 8+2;两阶段独立编码缩放后的权威 RGB 关键帧,避免直接插值高分辨率关键帧 latent 引发的部分突变,不裁帧、丢帧或混合坏帧。

单张 RTX 4090 48GB 实测完整新编码:1536×640/5秒 195.0秒,1280×704/10秒 266.5秒; 后者也覆盖精确端点和静音交付。它们是有界执行记录,不是严格配平的提速保证;动作、人脸及 尾段停留等问题仍存在。CPU 缓存解码器不表示所有模型常驻 GPU。

按指南安装固定上游运行时;此后端独立于 Sol/Base16 和预览 LightX4/8 合同。 VDN 尚未资格化 SM86、L2VA 或任意上游混搭。包内不带权重,也不隐式下载模型; 来源、模型许可和硬件边界分别列明,原有 Base16 接口保留。

0.5.6 · 完整管线注意力 adapter ​

源码标签 · 用法与范围

完整 Python/CLI 管线现可显式接入与原生上下文相同的 FP32 DiT-only 注意力 adapter。 准备时加载一次,连续请求复用,每条结果记录范围、rank 和倍率;正常结束或异常时先卸载 adapter,再关闭原生核心。CLI 三个 adapter 参数必须同时提供。

支持范围是单 SM89 官方 Base16,不合并底模、不下载权重、不默认启用,也不新增 HTTP adapter 配置。文本 TokenRefiner、SM86 及协同双卡应用不在该 adapter 范围内。 既有 VAE 交叉拼接修正、精确编码器前缀及 Sol 选择策略保持;新增包/运行时版本一致性检查。

单 RTX 4090 48 GB、Base16/Sol、rank8/−1 已完成三次连续 672×384、6秒、24fps 请求, 复用同一运行时,每条144帧并正常关闭。同 seed 的缓存/不缓存控制,其解码 RGB 和 PCM 逐值一致,命中时省去一次条件编码调用。本次有界对照为107.1对115.8秒,不作通用速度保证。 CPU异常清理与最小安装CI也已通过。既有原生质量证据范围不变,残余脸部/动作问题不称根治。 发布源码与wheel,预构建镜像仍为0.3.2。

0.5.5 · H3 空间 VAE 拼接 ​

源码标签

自有媒体解码器先合成横向图块,再混合完整行,保留交叉重叠处的对角贡献。 权重、单块输入、局部位置坐标、精度、时间分块和音频均不变;仅绑定当前实例, 不修改上游类或全局Torch。媒体解码仍使用单设备,去噪可继续使用原有多卡配置。

RTX 4090 48 GB冻结latent检查覆盖5/6秒横屏和864×864十秒,包含可选adapter输出。 像素变化较小,不能根治脸部失真或高速重影;大画布解码与装配仍约56–58秒, 不是端到端提速证明。同类交叉贡献缺陷见 ComfyUI独立修正。 三重重叠采用顺序混合,不冒称归一化全贡献加权。 公开adapter另在SM89完整五秒片复现已验证拼接实现的每个原始RGB像素。 本轮没有新增SM86 GPU实测,也不声称独立音频解码具备位级确定性。 无需新权重、精度配置或解码选项。发布源码/wheel,预构建镜像仍为0.3.2,生产pin不变。

0.5.4 · 可选 FP32 DiT 注意力 LoRA ​

源码标签 · 接口与限制

底层 apply_dit_attention_lora 上下文为独占的单 SM89 Base16 运行时附加调用方提供的 FP32 PEFT 注意力权重。验证完整布局,仅应用 50 个 DiT block,正确绑定环形 slot 的 逻辑层并在退出时恢复方法。倍率需显式传入且包含 alpha/rank,不要重复取负。 底模、条件、调度和生成/增强默认值不变;不新增 CLI、pipeline 或 HTTP 加载选项, 不自动下载或打包模型。

RTX 4090 48 GB 同输入 672×384、6 秒、24fps 对照已完整生成,两版最终 AV latent 分别与旧实现逐值一致。这是迁移证据,不代表普遍画质、加速或完整 adapter 等效。 TokenRefiner 有意不应用,其他架构、多 GPU 和步数不在此接口范围内;人脸和动作 仍可能有缺陷,模型另遵守其许可。发布源码/wheel,预构建镜像仍为 0.3.2,生产 pin 不变。

0.5.3 · 显式增强加速 ​

源码标签 · 实测与限制

可选resident减少反复模型搬移;SM89可显式选择sage-int8-fp16近似注意力,需自行安装ABI匹配的 SageAttention2。CLI/Python记录两项选择;默认仍为原生注意力/CPU卸载,H3生成、增强10步、 原运动分段和原音轨不变。驻留在17帧窗口和两条完整正常片保持解码RGB一致;Sage并非无损, 单条10秒全片观察到恢复计算减少25.4%,新旧总耗时边界不同。选帧对照未见新增明显结构破坏, 但原有模糊/细节改绘仍在;不是普遍画质或服务提速保证。发布源码/wheel,预构建镜像仍为0.3.2。

0.5.2 · 按需视频增强 ​

源码标签 · 使用与证据边界

vflash restore-video 与 vflash.restoration.restore_video 使用调用方提供并明确 信任的本地STCDiT-tiny运行时代码和权重。自有加载器、完整运动分段、分步进度/取消和 原子另存流程保留原视频,原音轨复制到增强版;增强画面的H.264编码不是无损编码。 输入边界为24fps、最长10秒、最多1,048,576像素且宽高32对齐,不代表所有尺寸/显卡的资格证明。

该功能默认关闭,可能软化或改绘细节,不是坏帧根治。H3官方16步、Sol/dense选择、条件编码、 权重及原生成交付保持不变。安装[pipeline,restoration]并显式信任本地运行时代码; 不打包第三方源码、模型权重、产品账号或服务调度。源码/wheel单独发布,预构建镜像仍为0.3.2。

0.5.1 · 精确的H3条件编码前缀 ​

源码标签 · 实测边界

固定H3只读取hidden_states[50],因此保留64层中的51层并跳过无用尾层;不能仅保留50层, 否则会错误返回最终归一化状态。视觉编码器、保留权重、精度、去噪、调度、Sol策略及音视频 交付均不改变。

SM86/SM89各自的首帧和尾帧A/B/A2均保持14个完整条件张量逐位一致;SM89完整8秒A/B/A2的每个 RGB像素及解码PCM16采样也逐位一致。暖态capture约少18–19%,但整片差值很小,去噪仍占主导, 不宣称全片提速18%或修复已有画质问题。尾层共约63.4亿BF16参数,移除引用不等于测得同等RSS 下降,也不减少模型下载体积。

无需新模型或配置开关。发布源码与wheel,预构建仓库镜像仍为0.3.2;生产服务保留各自显式pin。 沿用0.5.0的单SM89近似Sol默认及其质量边界。

默认测试现在隐藏CUDA,硬件测试必须显式启用并指定分配的设备。性能归因测试的人工零初始化 slot存在流顺序竞争,已改为与运行时一致的未初始化slot;不改变生产权重环的算术实现。

0.5.0 · 单SM89默认集成Sol ​

源码标签 · Sol实测与边界

auto现在为单SM89官方Base16选择近似sol-sm89;SM86、协作双卡及Turbo保持dense torch-flash。 Python完整/原生会话、generate、denoise、plan和原生HTTP服务共享选择规则。 显式torch-flash保留dense;Sol使用串行block-ring,报告exact=false、真实调用次数和受保护模态行。 缺依赖不静默回退。

profiles与/v1/profiles将模型dense基线字段命名为baseline_attention,不再与实际选择混淆。 解析后的配置见plan或/readyz的attention_selection,实际执行见已完成任务runtime元数据; 使用旧检查字段的客户端需要同步调整。

标准runtime和pipeline Docker构建包含固定Sol 0.5.0依赖及已核查的四处CUTLASS stream ABI补丁。 Python用户安装GPU/pipeline依赖后执行python -m vflash.install_sol,移除原独立pipeline-sol-sm89 target。 模型权重不变,仍为独立许可的外部输入,不打包产品配置。

Sol内核未改变,复用既有SM89实证:固定十秒736×992 Base16同卡A/B/A的完整本地请求减少19.584%, 去噪减少21.078%,控制漂移0.070%,开启了性能归因。各Sol请求有800次真实调用。这不是新0.5.0测速, 不是普遍加速或同质量承诺;动作/声音语义、无profile合格吞吐及首用编译仍是独立边界。

本版还纳入0.4.0之后的1,048,576像素校验/条件预算与显式silent-v1交付,不代表所有GPU的实测容量同步扩展。 发布源码归档和wheel;历史0.3.2镜像不会改标为0.5.0,当前Docker target请从此tag构建。 既有部署保持固定版本,只有显式升级才变化。

0.4.0 · Base16 关键帧与 Sol-Engine 实测对齐 ​

源码标签 · Sol-Engine 对齐

一个已准备的 Base16 pipeline 现在可以在不重新加载官方 Transformer 的情况下处理 I2VA、L2VA 和 FL2VA。它接受五至十秒的整数时长,固定 24 fps;画布最多 1,032,192 像素,宽高为 32 的倍数,宽高比介于 1:4 和 4:1。条件默认保留在内存中,仍可显式持久化以便重放。精确端点交付和有界音频交付属于引擎持有的媒体阶段。Turbo 和视频参考 profile 保留各自的五秒合同。

两张匹配的 RTX 4090 48 GB 可以显式选择 block streaming 的 sequence-head,用于一个 Base16 请求。在固定的十秒、736 × 992 L2VA 负载上,双卡耗时 484.232 秒,前后两个单卡对照为 774.153 和 773.515 秒,三个 MP4 字节一致。37.4% 的延迟降低以相比双独立 worker 多 25.2% 的总设备时间为代价,因此仅在 peer 原本空闲时适用。其他 SM89 profile 和 tensor 继续被拒绝。

协作路径用精确 Triton destination-major copy 替代 QKV 和返回 attention 的多次布局物化。在代表性 55,413-token shape 上,QKV copy 在 SM86/SM89 上分别快 2.429×/1.952×,返回 head 合并分别快 2.027×/1.932×;QKV 和 head 合并的操作峰值分别少 1,136.4 和 378.8 MiB,所有对照元素均一致。最终未开启 profile 的完整 A/B/A 在双 SM86 和双 SM89 上分别改善 1.503% 和 0.472%,压缩视频流一致。这是有价值的精确内存布局改进,并非完整视频的大幅提速;负载与媒体边界见性能指南。

本版将实现与 NVIDIA Sol-Engine 的固定修订 ca26dbd 对照。Vflash 只在 SM86/SM89 合同中采用精确重排机制;AdaLN 预计算和严格融合操作已在引擎中存在。SOL/BSA attention、跨步 cache、INT8/FP8 通信、SM100 专用 MXFP8 以及四步 FastH3 adapter 都不进入 exact 默认。上游 B300 或 50-step 结果不会被写成 Vflash 的提速数字。

此外,新版还新增了显式启用的去噪阶段归因、内存条件捕获指标、fail-closed ring-copy 预校验和明确关键帧模式来源。实证只限于列出的目标显卡和工作负载,不代表所有时长/画布组合或广泛的语义与音频质量。模型权重仍是单独授权的输入。0.4.0 发布源码与 wheel;在独立通过镜像资格验证和发布清单前,0.3.2 仍是最新的预构建容器镜像。

0.3.2 · 宽索引与双 SM86 文生推理 ​

源码标签 · 镜像与安装包身份

较长序列的 token 与 stride 乘积可能超过有符号 32 位元素偏移。八个融合内核现在按实际形状和 stride 选择 64 位地址计算,并在乘法前转换类型;小输入保留 32 位路径。BF16 舍入、LoRA 计算与调度不变。这修复了一个非法访存原因,不是新增质量或速度承诺。

目标显卡上的 15 项小/宽张量算子核查逐位一致,宽形状使用旧计算的安全分块作为对照。随后,已保存的 243 模型帧条件在单张 RTX 4090 48 GB 完成全部八次 Ref 计算,输出有限 FP32 音视频 latent,并完整解码 1344 × 768 媒体:24 fps、240 帧,含 32 kHz 双声道音轨。资源所有者正常关闭,显卡已释放。这是复用条件的原生核心加媒体核查,不是新编码的 H3Pipeline 请求,也不是整条轨迹的逐位对照。应用集成修订为 6310e023fc31caa4b70bf9a5c64a07c062a4c343。

新增的 t2va-turbo4-exact-sm86 原生配置使用双 RTX 3080 20 GB、sequence-head 和分块加载,固定 Base4 v1.0 LoRA、四次计算及视频/音频 shift 6/3。SM86 编译器通过 52 项同架构官方时间编码/调制对照,并产出完整 50 层资产。不能修改 SM89 或 Ref 资产标签来替代。

实际安装的公开原生会话已在应用持有的编码→核心→媒体链路完成五秒 928 × 512 和十秒 640 × 352 请求,均为 24 fps。每次均返回 14 项有限条件、FP32 音视频输出、完整解码 MP4 及关闭回执。每片 12 个取样帧支持固定案例的可见对象/动作要求;音频语义与未取样运动仍未知。运行中出现热降频,因此不构成干净测速或广泛质量结论。

新增双 SM86 T2 的独立 H3Pipeline 包装尚未重跑 GPU,公开时长合同仍为五秒。上述长 Ref 核查也没有新增十秒包装接口。单 SM86 T2VA、tensor T2VA、T2VA 八步、SM86 视频参考以及任意长时/高分辨率组合仍未获资格;既有五秒链路证据按原范围保留。

两个镜像保留全部 0.3.1 依赖层和入口。安装后的 59 个包文件、CLI、服务构造、可写缓存和固定编码器/媒体导入已通过 CPU 核验;融合模块与目标显卡实测实现字节一致。wheel 及可复现的小增量构建配方见发行附件;模型权重仍是单独的许可输入。

0.3.1 · 降低 4090 的 QKV 临时显存占用 ​

源码标签

RTX 4090 的严格 Ref4 路径在合并 LoRA 投影时使用更少的临时张量,自动启用该优化,现有模型资产和调用方式保持兼容。其他配置继续使用现有实现。

一个完整的 50 层、4 步原生请求已核验最终 FP32 音视频 latent 逐位一致,同卡算子对照也通过。这些检查覆盖数值行为与局部临时内存,本次尚未得到新的提示词到 MP4 整体耗时结论。

0.3.0 · 使用视频作为参考 ​

源码标签

H3Pipeline 和 vflash generate --reference-video 现在可以接收本地 2–5 秒短片。单张 SM89 48 GB 上的同一 Ref4 实例可依次处理图片、视频、图片,无需重载模型。源音轨会被丢弃,结果使用新生成的音频;输出仍为五秒、24 fps。图视频混合、SM86 视频参考和 Ref8 视频参考不在本版范围内。输入限制与示例。

构造与输入校验先在 CPU 完成,然后才加载模型。服务可在接单前调用 prepare() 预加载固定模型,但这不会准备所有输入形状的算子。重复调用复用已有阶段;无效输入不会销毁健康的已加载实例。耗时分别记录输入准备、模型加载、条件编码、去噪和媒体交付。

实际安装的 wheel 完成了同一实例的图片、视频、图片连续请求。视频案例使用五秒、928 × 512 参考:14 个条件张量、两个最终 FP32 latent 与独立对照一致,120 帧交付 RGB 全部一致;最后一次图片请求的条件、latent 与解码画面均与首图一致。随后在首次去噪计算后取消另一个请求,没有发布部分视频,临时目录已删除,三个模型所有者已释放,进程退出后显卡资源也已归还。此前文字生成和双 SM86 图片计算保持不变。

视频参考会增加编码与去噪工作。这个代表案例记录了约 64 秒编码、191 秒原生执行和 19 秒媒体交付,其中包含诊断观察器开销;模型预加载另行计时。单次观察不是延迟承诺或提速对照。对原始要求的审阅支持有用的参考再生成,部分时间节点和姿态细节仍不完整,不代表精准编辑或普遍指令遵循能力已通过验证。重复官方音频解码在编码前仍有微小差异,不承诺音频逐位复现;听觉质量未获本次验证。

容器提供可写的 Jiterator 与 Inductor 缓存,支持任意 UID 使用新挂载的空缓存目录。镜像身份与安装验证将最终软件包绑定到已验实现。

0.2.2 · 降低 4090 的 FFN 显存占用 ​

源码标签

SM89 Ref4 将 FFN 的 LoRA 合并与 SiLU 激活融合为一个内核,保留适配器缩放、加法和激活之后的原有 BF16 舍入,省去一块较大的中间张量。默认严格 Ref4 路径自动选择该实现,模型资产与生成命令保持兼容。SM86、Base4 文生视频和 Ref8 继续使用原来的算子。

同卡原生对照中,两种实现各执行三次热请求,中位耗时从 43.033 秒降至 42.569 秒,减少 0.464 秒(1.08%);该固定负载的去噪显存峰值减少 597 MB。测试负载和计时边界保留具体范围,这不是端到端提速比例。

随后,同一内核在常驻完整链路中按“原实现、融合、原实现”的顺序生成三个结果,使用三张有序参考图和 928 × 512 分辨率。14 个条件张量、最终 FP32 音视频 latent、124 帧原始视频及 120 帧交付 RGB 均精确一致。各 MP4 完整解码并包含五秒双声道音轨;在第一次去噪后取消请求,实例正确关闭、移除部分输出并释放所持存储。三图负载的去噪显存峰值减少 517 MiB,但各阶段中观察到的最高占用不变,因为其他阶段占主导。官方音频解码的重复调用仍可能出现细小差异;这些检查不构成音频逐位复现或广泛的生成质量保证。

公开实现通过普通方法直接调用内核,不依赖实验钩子。安装包与 CPU 分支检查将其绑定到已验证内核,其余原生与完整链路计算保持不变。版本镜像清单记录源码、wheel 和不可变容器身份。

0.2.1 · 双 3080 完整成片 ​

源码标签

Python 与容器完整链路新增双张 RTX 3080 20 GB 的 Ref4 支持。在 SM86 显卡上编译 ref2va-turbo4-exact-sm86 资产,生成时指定两张卡和 sequence-head。一至三张有序参考图可生成五秒、24 fps MP4;编码和解码使用主卡,原生去噪使用双卡。配置流程提供完整命令。单 SM86 或 tensor 完整链路在加载前拒绝,原生 latent 接口保持不变。

实际安装包容器完成了一个 928 × 512 的代表性三参考图请求。全部 14 个条件张量与同一主卡上的独立官方编码一致,最终 FP32 音视频 latent 与同一双卡的独立原生会话一致。124 帧原始视频和原始音频均为有限值;交付的 MP4 完整解码,包含 120 帧和五秒双声道音轨。第二个请求在完成一步去噪后取消,实例关闭并移除临时输出,两张卡均释放持有的资源。

原生实现与 0.2.0 字节相同。本版仅改变配置准入和完整链路的双卡策略约束;SM86 编译数学另通过了与同架构官方模块的 52 项比较。这些证据共同证明已测负载的包装集成、数值绑定和资源生命周期,不是新一轮官方完整 DiT 对照,也不代表广泛的指令质量或速度保证。运行中出现过热降频,耗时不作为独立性能结果。主机 RSS 峰值为 114.67 GiB,容器预算为 240 GiB;整卡占用峰值为 11.05/6.85 GiB,部署时仍须保留额外余量。

SM89 的 Ref4 与 T2VA 沿用既有验证和原始音频交付。本版还修正了“公开包只能输出 latent”的旧文档。模型权重继续按各自许可证单独下载;实际镜像摘要与安装包身份见版本清单。

0.2.0 · 完整文生视频 ​

源码标签

Python 与容器链路现在可以不传参考图,直接生成五秒、24 fps MP4。选择 t2va-turbo4-exact-sm89,准备固定 Base4 v1.0 资产,并省略 --reference。Ref4 继续支持一至三张参考图。每种模式分别持有准备记录和常驻实例,模式不匹配的请求在执行前拒绝。模型配置指南提供完整 T2VA 命令。

官方权重编译器新增 Base4 支持。在 SM89 上,全部 50 个 Base4 层、4 个调度张量和 9 个辅助张量与独立准备的 BF16 资产精确一致。实际安装包容器随后对一个固定的 928 × 512 案例执行两次完整请求:14 个条件张量和最终 FP32 音视频 latent 均与独立对照一致;重复请求的全部原始视频帧一致,两份 MP4 均完整解码,包含 120 帧和五秒双声道音轨。另一请求在完成第一次去噪后取消,移除临时输出并关闭实例。

这些检查证明该负载的实现和资源生命周期,不代表广泛的指令遵循或音频质量。Ref4 沿用 0.1.0 的多参考图验证;官方音频 VAE 重复调用仍可能出现微小浮点差异。两种完整配置均使用 BF16、固定 LoRA 和原始音频交付,不包含 W8、动态 LoRA 或首尾帧生成。SM86 完整生成尚未完成资格化,会明确拒绝;其原生接口继续可用。

镜像为任意用户 ID 提供可写的 Inductor 缓存。最终镜像核查安装包身份、支持配置与 CPU 启动;缓存目录和支持名单的调整保持已通过 GPU 验证的数值实现不变。

已发布 Linux AMD64 镜像:hansimov/vflash:0.2.0-pipeline 用于完整生成,hansimov/vflash:0.2.0 用于原生 HTTP 服务。两者均可匿名拉取,不可变摘要清单记录源码与验证范围。模型权重按各自许可证单独下载。

0.1.0 · 多参考图生成视频 ​

源码标签

在单张 RTX 4090 48 GB 上,通过 vflash generate 或 H3Pipeline,将提示词和一至三张图片生成五秒、24 fps MP4。图片按传入顺序对应 <Picture N>,原有单图 Python 参数保持兼容。vflash prepare-pipeline 在使用前一次性核验模型资产。容器指南提供完整的准备与生成命令。

实际安装包镜像在 928 × 512 下连续完成单图、双图、三图请求。三例的 14 个条件张量和最终 FP32 音视频 latent 均与固定对照逐位一致;第一例的全部原始 FP32 视频帧、第二例的 120 帧交付 RGB 也一致。三份 MP4 均完成全部视频帧与音轨解码,包含 120 帧及五秒双声道音频。三图请求在完成第一次去噪后取消,正确关闭实例、移除临时输出并释放资源。

这些是实现与生命周期验证,不代表广泛的指令质量或速度保证。原生去噪、LoRA 数学及官方媒体解码沿用 a7。官方音频 VAE 的重复调用可能出现微小浮点差异,不承诺音频逐位复现。参考图也不构成严格的关键帧时序约束。

完整镜像面向 SM89 Ref4;Ref8、T2VA Turbo4、单卡与双卡 SM86 保留原生条件包到 latent 的接口。W8、动态 LoRA 和 FL2VA 不在此次发布范围。模型权重按各自许可证单独下载。

已发布 Linux AMD64 镜像:hansimov/vflash:0.1.0-pipeline 用于完整生成,hansimov/vflash:0.1.0 用于原生 HTTP 服务。两者均可匿名拉取,具体镜像见不可变摘要清单。

0.1.0a7 · 提示词与图片生成 MP4 ​

源码标签

单张 RTX 4090 48 GB 可以从提示词和一张图片生成五秒、24 fps 的 MP4。Python 链路管理原生去噪与各阶段生命周期,并显式接入固定版本的官方文本、参考图和 VAE 适配层;支持连续请求复用、进度与取消。开始生成视频。

Ref4 编译器 从固定官方 H3 权重与 Turbo4 v0.1 创建运行资源,无需捕获请求,也不依赖另一个项目。基础权重与 LoRA 身份分别绑定。全部 1,250 个层内张量、4 个调度张量和 9 个辅助张量与已核验 BF16 资源精确一致。

完整链路核查得到精确一致的条件与原生 latent,解码画面也一致。官方音频 VAE 的细小浮点变化仍在排查,本版不承诺音频逐位复现或广泛的生成质量。请求总耗时包含输入准备和清理,并单列权重搬运及阶段调用。

完整链路与编译器首先支持 SM89 Ref4。T2VA Turbo4、Ref8 和 SM86 保留条件包到 latent 的接口;动态 LoRA、FL2VA 和 W8 尚未发布。Docker HTTP 服务也仍使用 latent 接口。模型权重按各自许可证另行下载。

0.1.0a6 · 文生视频 ​

源码标签

SM89 新增 T2VA Turbo4,使用 Base4 v1.0 资源。执行前核查任务、适配器身份与条件包,避免误用 Ref 权重处理纯文字请求。应用可以分别保留 Base 和 Ref 会话,减少逐任务更换模型的等待。

一个解码输出案例与会话重复调用已通过实现核查。验证范围说明具体负载和尚未完成的质量检查。Ref 配置沿用已有权重和计算方式。更新的 Base4 适配器、T2VA Turbo8 和 SM86 T2VA 不包含在本次发布中。

按快速开始安装此源码标签。Docker 指南从源码在本地构建 vflash:0.1.0a6;该历史版本未发布公开的预构建镜像。

0.1.0a5 · 权重读取与资源管理 ​

源码标签

  • 按文件成组读取张量,直接写入最终持有的 CPU 存储,减少重复解析文件头和中间复制。
  • 关闭会话时释放其权重和锁页内存;即使调用方保留已关闭的 Python 对象,这些资源也会释放。
  • 显卡或通信资源清理失败时如实报错。失败会话应关闭;无法确认清理完成时,应停止其 worker 进程。

本次保持模型权重、Turbo LoRA、去噪调度与 BF16 计算方式不变。更新改善的是加载和资源生命周期,不代表所有负载都有新的速度或质量结论。

需要固定源码版本时,从标签安装:

bash
git clone --branch v0.1.0a5 --depth 1 https://github.com/Hansimov/vflash.git
cd vflash
python -m pip install -e .

Docker 指南使用源码在本地构建镜像,该历史版本未发布公开的预构建镜像。继续使用与配置匹配的运行资源;本次更新不会转换权重或条件包。

0.1.0a4 · 降低主机内存占用 ​

源码标签

分块加载把张量放进共享的分段锁页内存,减少分配空余;加载失败时释放已经构建的部分资源。具体数据和数值对照范围见 4090 内存测量。

0.1.0a3 · 显式选择显存策略 ​

源码标签

新增 4090 的显式分块加载选项,以及供应用接入的已完成步数回调。a3 双 3080 数据继续保留原始版本和负载说明,不改写成当前版本的实测。

能力状态 ​

公开包包含列表中的 BF16 Ref2VA Turbo4 / Turbo8、SM89 与双 SM86 T2VA Turbo4 去噪器,以及单 SM89 或双 SM86 的 Ref4、单 SM89 的 T2VA、SM89 或双 SM86 的 Base16 I2VA/L2VA/FL2VA Python 完整链路。匹配的双 SM89 还可显式选择 Base16 协作低延迟路径。官方权重编译器创建 SM86/SM89 的 Ref4 和 Base4 资源;Base16 关键帧 profile 使用其固定官方 Transformer 资产。最新预构建容器仍为 0.3.2,因此保留该版更窄的接口。模型权重不随包提供。

新增模式、适配器和硬件分别完成安装、数值与解码检查后,才会进入支持列表。

Vflash · 原生 MiniMax H3 推理