这项由南洋理工大学、Riemann Dynamics与惠灵顿学院联合开展的研究,以预印本形式发布于2026年7月,论文编号为arXiv:2607.26811,研究方向聚焦于实时自动回归视频生成领域中的知识蒸馏问题。

如果你曾经用过AI生成视频的工具,你大概体验过那种奇特的魔法感——只需输入一段文字描述,系统就能输出一段流畅的动态画面。但这背后有一个让工程师们头疼已久的问题:高质量AI视频模型运行起来又慢又贵,根本无法做到实时生成。研究者们的解决思路是"蒸馏"——就好比把一位经验丰富的厨师(大模型)的厨艺,提炼成一本精简食谱,让一位年轻厨师(小模型)也能用少得多的步骤做出差不多水准的菜肴。

这套"蒸馏"流程在学界已有一些成熟做法,但研究团队注意到一个被大家忽视的奇怪现象:有时候给学生换一位资历较浅的老师,反而比换一位资历更深的老师教出更好的学生。这不符合直觉,却在实验中反复出现。研究团队沿着这条线索深挖,最终发现了整个培训流程中隐藏的根本性错误,并提出了一套名为DistillAlign的修正方案。

一、蒸馏流水线的运作方式:从双向扩散到逐帧生成

在理解研究发现之前,需要先了解现有的视频生成蒸馏流程是怎么运作的。现有的高质量视频模型大多采用"双向扩散"的方式工作——它可以在生成视频的任意时刻、往任意方向参考信息,就像一个画家可以随时看整幅画布来调整笔触。这种方式生成质量很高,但速度极慢,无法做到实时输出。

研究者们希望把这种双向模型"蒸馏"成一种"单向、逐帧"的生成器——就像一个只能从左往右写字、不能回头修改的人,但速度极快,可以实现实时输出。这类单向生成器被称为"自回归模型",是构建世界模型和实时交互视频的关键技术。

现有的蒸馏流水线通常分为两到三个阶段。以论文中重点分析的Causal Forcing流水线为例,第一阶段是让小模型学习一个大模型的逐帧生成风格;第二阶段是用"一致性蒸馏"(Consistency Distillation,简称CD)把这个学生压缩成只需少数几步就能生成图像的模型;第三阶段是用"分布匹配蒸馏"(Distribution Matching Distillation,简称DMD)做最后的精细打磨。每个阶段都有各自的"目标老师",而问题恰恰出在这三个阶段的老师是否匹配上。

用一个更具体的比喻:如果你在培训一名厨师学做法式料理,第一阶段让他跟着一位中餐大厨练刀工;第二阶段让他快速记住中式食谱的要点;但第三阶段突然换成法式料理大厨来考核,这位学生就会遇到麻烦——他之前积累的大量中式料理"感觉",在面对法式考核时反而成了负担。

二、被忽视的关键问题:不同阶段的老师其实在教不同的东西

研究团队发现,现有方法几乎无一例外地把"初始化阶段"和"DMD精炼阶段"割裂开来,用不同的目标分布分别训练,却用统一的视觉评分(如VBench)来判断阶段性成果的好坏。这里隐藏着一个根本性误判。

为了验证这个直觉,研究团队做了一个精巧的"换老师实验"。他们采用了两套数据:一套来自Wan-14B(一个参数量140亿的大模型),另一套来自Wan-1.3B(一个参数量13亿的小模型)。在Causal Forcing流水线中,他们系统性地交叉组合初始化阶段和DMD阶段所用的老师,形成四种组合方式。

结果相当耐人寻味。当初始化和DMD用同一套数据时(无论是都用14B还是都用1.3B),最终效果都好于混搭的情况。更关键的是,"初始化用14B数据、DMD用1.3B老师"的组合,反而比"初始化用1.3B数据、DMD用14B老师"的组合表现更好——尽管后者看起来在每个阶段都用了更强的资源。这说明最终效果并不由老师的"档次"决定,而是由两个阶段的目标是否一致决定。

这个发现挑战了领域内一个长期存在的隐性假设:只要每个阶段用更好的数据或更强的老师,最终效果自然更好。事实上,"配对关系"比"绝对质量"更重要。

三、用一把"分布尺子"看清被VBench掩盖的真相

光靠VBench评分无法揭示问题所在,因为两个视觉分数相近的模型,可能在"覆盖老师的哪些场景"这件事上差异极大。为此,研究团队提出了一套专门测量"分布覆盖程度"的评估方案,称为"教师归一化分布评估协议"。

其核心思路可以这样理解:把所有待比较的模型生成的视频,都先经过一道统一的"标准化处理"——用同一个强大的老师对这些视频先做一次轻微的重噪声处理再重新还原,就像把不同厨师做的菜都先经过一道标准化摆盘处理,让外观变得统一,从而更好地比较菜肴本身的"食材多样性",而不是被摆盘的精致程度所干扰。

经过这道处理之后,研究团队把所有视频的特征提取出来,放到一个共享的特征空间中,然后用两个指标来衡量学生模型与目标老师的关系。第一个叫"精确率"(Precision):学生生成的视频,有多少落在了老师视频分布的"领地"范围内——也就是说学生是否只在老师擅长的区域内生成。第二个叫"覆盖率"(Coverage):老师视频分布的所有区域,学生能触及多少——也就是说学生是否能覆盖老师擅长领域的全貌。

用厨艺的比喻来说,精确率高意味着学生做的每道菜都在老师的"专业范围"内,不会做奇怪的菜。覆盖率高则意味着老师会做的各种风格——清淡的、浓郁的、精致的、家常的——学生都能涉猎,而不是只会做老师最拿手的那一两道招牌菜。

这套评估体系的一个关键发现是:ODE蒸馏初始化的模型虽然视频画面很模糊,但它覆盖了老师分布的很多角落;而用Causal DMD做初始化的模型视频看起来更清晰,VBench分数更高,但它只覆盖了老师最擅长的少数几个区域。后续的DMD精炼阶段恰恰无法弥补覆盖率的不足,因为DMD的天性就是在现有覆盖范围内做"锐化",而不是"拓展"。所以覆盖率更广的初始化,往往能在最终精炼后得到更好的成果。

四、五条流水线的横向比较:同一目标,不同路径,差异悬殊

为了全面了解不同初始化方式对最终效果的影响,研究团队构建了五条平行的蒸馏流水线,全部使用Wan-14B作为DMD老师,全部使用从Wan-14B采样的蒸馏数据作为初始化目标。这五条流水线分别是:直接用双向模型做初始化、用自回归扩散做初始化、用自回归扩散加Causal DMD做初始化、用ODE蒸馏做初始化,以及用自回归扩散加Causal CD做初始化。

最后一条流水线(Causal CD初始化)正是现行Causal Forcing流水线所采用的方式。对比结果清晰地呈现了一个规律:在VBench最终得分上,大多数方法相差不大,肉眼看起来差不多好;但在覆盖率和多样性上,差异相当显著。Causal DMD初始化的模型VBench初始分最高,但它最终获得的覆盖率反而低于ODE和Causal CD初始化的模型。而Causal CD初始化的模型虽然在初始化阶段画面更模糊、分数更低,但它覆盖率最高,最终经过DMD精炼后也获得了最广的多样性。

研究团队还通过视觉方式验证了这一点:在同一提示词下用16个不同随机种子生成视频,覆盖率更高的流水线产出的视频在场景构图、运动模式、色彩风格等方面都更加丰富多元;而覆盖率低的流水线,16个视频看起来像是同一个模板的轻微变体。

五、DMD的"晚期病症":即使起点对了,路走长了也会跑偏

研究团队注意到另一个现象:即便初始化阶段和DMD阶段的目标分布已经对齐,如果DMD训练做得太久,效果依然会下滑。具体表现是:VBench分数先升后降,而多样性分数则从头到尾持续下降,从未回升。

这可以用一个直观的比喻来理解。DMD的训练逻辑是"反向KL散度最小化"——它倾向于让学生模型把注意力聚焦在老师最高概率的区域,就像一个原本会做多种料理风格的厨师,被老师的评价反馈引导着越来越专注于那道评价最高的招牌菜,最终几乎不再尝试其他风格。刚开始这样做是好的,菜的质量确实提升了;但训练得太久,这位厨师就只剩下一道拿手菜,其他所有曾经擅长的风格都逐渐生疏。

研究团队用一个可视化实验展示了这种"漂移"现象。他们把所有视频特征投影到一个共享的二维空间(利用V-JEPA2特征提取器和PCA降维),用等高线图表示老师和学生的分布范围。训练初期,学生分布和老师分布大致重合;随着DMD训练步数增加,学生分布的椭圆形轮廓逐渐向老师分布的高密度中心区域收缩,越来越小,越来越集中,与老师的边缘区域逐渐脱离。这就是"分布漂移"。

六、联合蒸馏:同时用两种力量拉住学生

针对这两个问题——初始化和精炼目标不一致、DMD长期训练导致分布坍缩——研究团队提出了一个相对简洁的解决方案:联合蒸馏(Joint Distillation)。

核心思路是在DMD训练阶段加入一个CD损失项作为"锚点",让最终的训练目标变成两部分的加权组合:DMD负责把学生推向老师的高质量区域(精益求精),CD负责确保学生不要完全放弃对老师其他区域的覆盖(保持全面)。两种力量的比例由一个权重系数λ来控制。

回到厨艺比喻:DMD就像一位严苛的米其林评委,只认可最精致、评分最高的那道菜;CD则像一位注重全面发展的导师,提醒学生"你的法式烩菜也要保持水准,别荒废了"。联合训练就是让这两位指导老师同时在场,在保持精进的同时防止偏废。

研究团队对这个权重λ做了细致的消融实验。λ设得很大时,CD的力量占主导,覆盖率最高,但精确率和VBench分数略有下降;λ设得很小或为零时,DMD独占主导,精确率和初期VBench分数较高,但覆盖率和多样性持续下滑;最优平衡点出现在λ=0.01时,此时VBench、精确率、覆盖率三项指标同时达到最佳或接近最佳水平。在弱设置(1.3B老师)和强设置(14B老师)下,这个结论保持一致。

从训练步数的对比数据来看,联合蒸馏方式的VBench分数在整个2500步训练过程中始终高于或持平于纯DMD;而纯DMD的覆盖率从第0步的0.66持续下滑到第2500步的0.53,联合蒸馏则始终维持在0.66到0.69之间。这意味着引入CD锚点确实有效阻止了分布漂移,而不是用质量换来的覆盖率。

七、最终成绩单:1.3B老师训出的学生,胜过14B老师教出的对手

研究团队在标准的VBench文字转视频评测协议下,将DistillAlign与多个开源基准进行了对比。参与比较的方法包括LTX Video、Wan2.1-T2V-1.3B原始模型、SkyReels-DF、CausVid、Self-Forcing和Causal Forcing。

在最终VBench总分上,DistillAlign的"强版本"(使用14B老师)以84.83分居于所有方法之首,超过Causal Forcing的84.38分和Self-Forcing的84.21分。更能说明问题的是"弱版本"的表现:只使用1.3B老师的DistillAlign,以84.54分超越了所有使用14B老师的对比方法。

在覆盖率上,DistillAlign的强版本达到0.69,弱版本达到0.59,而Causal Forcing仅有0.29,Self-Forcing为0.53,CausVid仅有0.21。在多样性(以Vendi分数衡量)上,DistillAlign强版本为1.304,弱版本为1.305,均高于Causal Forcing的1.250和Self-Forcing的1.269。

作为对照,未蒸馏的双向原始模型Wan2.1-T2V-1.3B拥有最高的多样性分数1.334,这是所有蒸馏方法无法轻易触及的天花板。但DistillAlign已经是蒸馏方法中最接近这个天花板的存在。

从定性的视频样本比较来看,DistillAlign生成的视频在物体细节保持、运动连贯性和跨帧一致性上表现更好,同时避免了仅用CD初始化时常见的模糊感,也避免了过度强化DMD时带来的千篇一律感。在相同提示词、不同随机种子下,DistillAlign的输出展现出更丰富的场景变化、色彩风格和运动模式。

说到底,这项研究的核心贡献是把一个"常识性错误"从AI视频蒸馏流程中揪了出来,并配上了切实可行的修复方案。长期以来,研究者们默认"用更好的老师,或者让每个阶段的学生尽可能分高"就等于最终效果更好。DistillAlign的工作告诉我们,流水线中各阶段之间的"分布是否配对"才是更根本的约束。

这对普通人意味着什么?如果你关心AI视频生成工具的质量和多样性,那么这项研究指向的方向是:未来你在同一个提示词下反复生成,得到的视频会更加各不相同、更有创意,而不是每次都像从同一个模板里变出来的。与此同时,弱模型也能被训练得更好用,这对降低算力成本、普及实时视频生成有直接价值。

这项研究目前还停留在技术验证层面,实际落地进用户产品还需要时间,但它明确指出了一条更少被探索、却更有效的路径。感兴趣的读者可以通过arXiv编号2607.26811查阅完整论文,项目主页同样提供了更多视觉对比样本。

Q&A

Q1:DistillAlign是什么,它和普通AI视频生成有什么区别?

A:DistillAlign是一套针对AI视频蒸馏流程的改进方案,核心是让训练流水线中不同阶段的"目标分布"保持一致,并在最后的精炼阶段同时加入覆盖约束和质量精炼约束。它不是一个全新的视频生成模型,而是一套让已有的自回归视频蒸馏方法变得更好的训练策略,最终效果是生成的视频质量更高、多样性更强。

Q2:为什么用更弱的1.3B老师,反而能比用14B老师训出更好的学生?

A:因为训练效果取决于初始化阶段和精炼阶段的目标分布是否匹配,而不仅仅取决于老师的参数量大小。当初始化阶段学的是1.3B老师的分布,DMD精炼阶段也用同一个1.3B老师做目标,两个阶段方向一致,学生能从初始化覆盖的基础上做有效精炼;而若两个阶段老师不同,精炼阶段就相当于在空白地方打磨,效果反而变差。

Q3:联合蒸馏中的CD损失是怎么防止模型"只会做一道菜"的?

A:DMD训练会不断把模型推向老师概率最高的区域,久而久之模型只剩下少数高质量模式,多样性持续下降。CD损失(一致性蒸馏损失)的作用是充当一个"分布锚点",在每一步训练中提醒模型不能偏离老师的整体分布太远,需要维持对老师各个区域的覆盖能力。两个约束共同作用,使模型既能精益求精又不至于以偏概全。