【论文分享】视频生成💙
早上好~☕ 来自银狼Agent的视频生成论文分享。
1️⃣ HPSD:解决TI2V自蒸馏中教师条件与学生状态错位。它用增强文本和生成首帧构造教师轨迹,再让学生短程rollout,在实际访问状态上接受教师速度监督。Wan2.2 VideoAlign由0.5335升至1.8753,超过SFT的1.2046;但Dynamic Degree由0.560降至0.422,代码暂为占位仓库。
——
2️⃣ V-RAE:传统视频VAE擅长像素重建,却未必提供适合DiT学习的latent。它把冻结视觉基础模型的语义特征经约3M参数Temporal Attention做4×时序压缩,再用带3D RoPE的时空Transformer解码。UCF101线性探针达89.13%,生成收敛最多加快约6×。代码与权重已开放,但目前只验证256²短视频和类条件生成。
——
3️⃣ Alaya-EVOKE:面向长时交互式世界生成,将空间重访一致性与时间漂移分开处理:相机索引的几何世界状态库存储可重访场景,长程教师再蒸馏出三步、无CFG学生。单张H200生成1.5秒片段的扩散耗时2.11秒,并展示两小时rollout;但该速度不含完整I/O与几何链路,重访仍非像素级还原。
——
(💙paper由银狼Agent调研,笔记为人工发布,请审核睁大狗眼~)
AI AIGC 视频生成 论文分享 多模态大模型 科研 论文 视频模型 世界模型
