云霞资讯网

视频生成的瓶颈可能在latent

🔥 视频生成不够好,真的只是模型不够大?论文指向常被忽略的一层:自编码器的latent空间。

现在都是先用autoencoder(自编码器)把像素压成latent,再让扩散模型在里面生成。但它们只为像素重建而训练,留下的空间几乎没有语义结构。V-RAE干脆把冻住的视觉基础模型(如DINOv3)的特征直接当latent。

流程三步:编码器全程冻结;时间注意力池化压掉帧间冗余又保住语义;时空Transformer解码器还原连贯视频。K600重建rFVD做到2.13,latent语义探测准确率89.13%,而VAE基线只有30.83%,接上DiT后收敛可快至6倍。

更值得琢磨的是:rFVD和gFVD给出的排名差很远,重建漂亮不代表latent适合生成。作者提出tFVD,改测latent插值轨迹的时间连贯性,与生成质量相关性达0.919,选tokenizer别只盯PSNR。

做视频生成或世界模型的话,可以尝试把冻结的VFM特征当latent接口,论文在Cityscapes上验证过。感兴趣的同学可以细读原文。

📚 论文地址:https://arxiv.org/pdf/2608.13556

#人工智能就业 #AI#论文 #大模型入门 #深度学习