「首次定义“高稀疏陷阱”」
目录
01 稀疏度从 90% 到 97%,不是简单地再省 7%
02 问题不在某一步,而在整条轨迹
03 解开陷阱的关键:从“逐步监督”转向“终端对齐监督”
04 SparkDiffusion 的关键:把团队两项子方法接成完整链路
05 RoLA:为极高稀疏率保留全局信息
06 CrossDistill:3 步兼顾质量与多样性
07 从算法减法,到真实的 GPU 加速
08 写在最后
一段约5秒、81帧的720P视频,扩散生成时间从4769秒缩短到18秒。
这是 SparkDiffusion 在 Wan2.1-T2V-14B 上给出的结果:单张 RTX 5090,265 倍加速;换到 H100,同一任务从 1757 秒降至 8 秒,加速220 倍。
在 Wan2.1-T2V-1.3B-480P 上,生成同样为 81 帧、约 5 秒的视频,RTX 5090 仅需1.3 秒,H100 仅需0.6 秒。
北京大学、清华大学、阿里巴巴集团等机构联合构建了首个支持稀疏注意力、少步蒸馏与低精度量化一体化部署(含开源权重及训练代码)的视频生成加速框架及代码库。SparkDiffusion打通了从模型训练、轨迹校正到 GPU 部署的完整链路。
随着分辨率提高,视频 token 序列迅速变长,稠密注意力的二次复杂度愈发突出;因此,SparkDiffusion 的稀疏计算优势会在高分辨率场景下更加显著。
图1|SparkDiffusion 覆盖 Wan2.1/Wan2.2、文生视频与图生视频,以及 480P/720P 等多种设置。
但在实现这一加速之前,团队首先发现了一个反常现象:训练损失还在下降,生成的视频却越来越差。
01 稀疏度从 90% 到 97%,不是简单地再省 7%
视频 DiT 需要在长时空序列上反复计算注意力。稀疏注意力只保留重要的 query-key 块,是最直接的降本方式之一。
但从 90% 稀疏提升到 97% 稀疏,保留的注意力块实际上从 10% 降到了 3%,稀疏分支的计算量仅剩前者约 30%。虽然速度空间更大,但是信息损失也骤然加剧。
研究团队在 Wan2.1-T2V-14B-480P 上发现,80% 和 90% 稀疏时,结果仍接近稠密模型;到 95% 和 97%,人物、道路和背景结构开始明显破碎。
图2|生成质量在 95%—97% 稀疏区间显著下降。
这并非“训练还不够”。诊断模型训练到 10000 步、数据扩大到约 30000 个视频后,逐步监督损失仍在下降,最终视频质量却没有恢复;增大补偿分支容量,同样收效甚微。
团队将这种现象称为高稀疏陷阱(high-sparsity trap)。
02 问题不在某一步,而在整条轨迹
扩散模型沿着去噪轨迹逐步生成视频。逐步损失衡量的是当前预测是否准确,最终视频却取决于每一步误差如何传递和累积。
研究者做了一项干预实验:仅在一小段采样区间中,用稠密教师替换稀疏学生的预测。
在 97% 稀疏率下,只修正最高噪声的 5 步,就能移除大部分终点误差;用相同预算修正最低噪声的 5 步,改善却很有限。
图3|相同修正预算下,高噪声阶段对最终结构、时序稳定性和感知质量的影响更大。
03 解开陷阱的关键:从“逐步监督”转向“终端对齐监督”
上述诊断说明监督目标与最终生成质量发生了错位。
Flow Matching 等常规逐步监督,只要求模型在某个噪声时刻预测正确的速度,却不直接约束这一步与后续轨迹组合后,最终会生成什么。极高稀疏率使得速度误差更大、方向更一致,即使每一步的平均损失持续下降,也可能沿轨迹累积为明显的终点偏差。
终端对齐监督(terminal-aligned supervision)正是解决高稀疏陷阱的有力方法。它的监督目标来自当前时刻之后的轨迹状态、教师组合轨迹或最终样本,因此不仅关注“这一步是否准确”,还约束“这一步最终会把生成结果带到哪里”。
论文在六种二维序列分布上进行了受控实验。95% 稀疏模型训练至验证损失收敛后,多步轨迹在临近终点时仍明显偏离数据分布;加入轨迹级终端对齐蒸馏后,少步学生的终点距离重新接近稠密教师。
图4|红色虚线为已完成逐步训练的多步稀疏模型,绿色为加入终端对齐蒸馏的稀疏学生;后者在六种分布上的轨迹末端误差均显著下降。
这说明,继续延长逐步训练并不是最有效的修复方式。更直接的路径是:先用逐步监督让高稀疏模型形成可用的粗略先验,再用终端对齐监督修正最终分布。这一原则并不局限于某一种稀疏结构或蒸馏目标,也是 SparkDiffusion 三阶段设计的核心出发点。
04 SparkDiffusion 的关键:把团队两项子方法接成完整链路
SparkDiffusion 不是从头提出一个孤立模块,而是将团队此前的两项关键方法——RoLA与CrossDistill放入“稀疏预热—少步蒸馏—低精度部署”的统一框架。其中,RoLA 建立高稀疏粗略先验,CrossDistill 则将终端对齐监督落实到完整噪声轨迹上。
图5|SparkDiffusion 依次完成稀疏结构适配、轨迹混合蒸馏和 FP8 部署优化。
05 RoLA:为极高稀疏率保留全局信息
SparkDiffusion 默认采用团队提出的RoLA:Rotary-Positioned Low-Rank Linear Attention for Efficient Diffusion Transformers作为稀疏注意力模块。
RoLA 一边通过块稀疏分支保留高能量 query-key 交互,一边用带旋转位置信息的低秩线性分支补回被稀疏化舍弃的全局上下文。
SparkDiffusion 先对 RoLA 模块进行短暂的稀疏预热,让稠密预训练模型适应 97% 稀疏结构,形成可用于后续蒸馏的粗略生成先验。
不过,RoLA 解决的是“极高稀疏下如何保留信息”,仅靠逐步训练仍无法消除高稀疏陷阱中的终点误差。为此,框架进一步接入团队的另一项工作 CrossDistill。
06 CrossDistill:3 步兼顾质量与多样性
SparkDiffusion 的少步蒸馏采用团队提出的CrossDistill:Balancing Quality and Diversity via Trajectory-Level Hybrid Few-Step Distillation。
CrossDistill 在噪声轨迹上设置交叉点。PCM 一致性目标和 DMD 分布匹配目标都不是只拟合孤立时刻,而是利用后续轨迹或最终输出构造监督,因此都属于终端对齐监督:
- 高噪声阶段使用 1 个 PCM 一致性步骤,跟随教师的粗结构与运动轨迹,并保留不同随机种子带来的多样性;
- 低噪声阶段使用 2 个 DMD 分布匹配步骤,直接修正终点可见误差,增强细节与真实感。
最终得到一个3 步、无 CFG的学生模型。它一方面用终端对齐信号跨过高稀疏陷阱,另一方面通过高低噪声分工平衡生成质量与多样性。
在 97% 稀疏设置下,纯 PCM 的 VBench / VBench-2.0 为 81.94 / 56.41,纯 DMD 为 82.56 / 57.38;CrossDistill 达到83.15 / 58.05。
图6|多步稀疏模型出现结构漂移;接入 CrossDistill 后,3 步学生模型重新接近稠密教师。
07 从算法减法,到真实的 GPU 加速
完成 RoLA 稀疏预热与 CrossDistill 蒸馏后,SparkDiffusion 再将注意力和前馈网络中的线性投影量化为W8A8 FP8 E4M3,并融合激活缩放、类型转换等操作,减少显存访问和 Kernel 启动开销。
因此,最终加速来自三部分:
- RoLA 97% 稀疏,减少每一步的注意力计算;
- CrossDistill 3 步无 CFG,将模型调用次数从 NFE=100 降至 NFE=3;
- FP8 与融合算子,把理论计算收益转化为实际延迟。
团队还将这套训练、蒸馏与部署流程整理为统一 代码库,使稀疏、蒸馏和量化不再是彼此割裂的加速组件,而可以在同一框架中完成训练、组合与硬件落地。
这一设计尤其面向高分辨率生成。分辨率越高、帧数越多,时空 token 越长,稠密注意力成本增长越快;稀疏注意力跳过的冗余计算也随之增加,因此 SparkDiffusion 在更高分辨率下具有更大的潜在加速收益。
图7|所有测试均生成 81 帧视频;480P 对应 480×832,720P 对应 720×1280。
主要结果如下:
- Wan2.1-T2V-14B-720P:RTX 5090 上4769 秒 → 18 秒,265×;
- Wan2.1-T2V-14B-720P:H100 上1757 秒 → 8 秒,220×;
- Wan2.1-T2V-1.3B-480P:RTX 5090 上182 秒 → 1.3 秒,140×;
- Wan2.2-T2V-A14B-720P:RTX 5090 上4545 秒 → 25.1 秒,181×。
在Wan系列模型下,SparkDiffusion与Full Attention的对比
08 写在最后
SparkDiffusion 把注意力稀疏率推到 97%,同时构建了首个将稀疏、蒸馏与量化整合到一体化部署(含开源权重)的视频生成加速后训练框架及代码库。
RoLA 负责在极高稀疏率下保留全局上下文,CrossDistill 负责修正完整生成轨迹并将采样压缩到 3 步,FP8 与融合算子则负责把计算节省兑现为真实速度。
在这套组合下,一段 81 帧、约 5 秒的 720P 视频,可以在单张 RTX 5090 上用 18 秒完成扩散生成。随着生成分辨率和序列长度继续提升,稀疏计算相较稠密注意力的优势还会进一步放大。
接下来,团队将继续把这套方法扩展到高分辨率全模态生成模型与 AR 自回归模型。对于需要处理更长视觉序列、跨模态上下文或分块自回归生成的模型,高噪声结构误差与跨块误差传播同样关键,也为 SparkDiffusion 的统一加速思路提供了更大的应用空间。
高分辨率、全模态与自回归生成的后续进展,敬请期待。
SparkDiffusion 论文:SparkDiffusion: Mitigating the High-Sparsity Trap — A Unified Framework for up to 265× Single-GPU Acceleration of Visual Generation(https://arxiv.org/abs/2609.23153)
RoLA 论文:https://arxiv.org/abs/2609.06712
CrossDistill 论文:https://arxiv.org/abs/2609.14725
项目主页:https://sparkdiffusion.github.io/
代码地址:https://github.com/AlibabaResearch/SparkDiffusion
研究机构:北京大学、清华大学、阿里巴巴、电子科技大学、哈尔滨工业大学