video-generation
提到此概念的论文 / 教程
LingBot-Video: 把 MoE 搬进视频扩散——为具身智能从零 scale 的稀疏 DiT 世界模型
Robbyant 团队。第一个大规模开源 MoE 视频基础模型,专为具身智能设计。三条主线:①架构上把稠密 DiT 的 FFN 换成 DeepSeekMoE 式稀疏专家(共享专家+top-K 路由),用「容量-算力解耦」把 30B 总参数压到 3B 激活,1M token 序列下比 Dense-30B 快 3.18×;②数据上用 Data Profiling Engine + 世界知识拓扑图把 7 万小时具身视频(机械臂/导航/第一视角)灌进语料,五阶段课程从 192p 图像涨到 1080p;③训练上六路奖励(视觉/对齐/动态/连贯/人体/物理合理性)+ 单步探索 GRPO(Flash-GRPO/CPS)+ 用真实视频当负样本的 DiffusionNFT 微调防 reward hacking。RBench 0.620(开源第一,超闭源 Wan2.6 的 0.607)、Physics-IQ Verified 40.4(开源第一)。开源权重(Dense-1.3B / MoE-30B-A3B)+ 推理代码 + rewriter。
PhysEditWorld:把「重力」从隐式相关性拽成可编辑的设计变量
清华深圳 + 北航 + 港科大等。一个数据集论文:现有 game world model 把物理当成数据分布里的隐式规律学,能模仿「世界通常怎么演化」,但答不出游戏作者真正关心的问题——「同一个场景,如果改一条物理规则,应该怎么演化?」。PhysEditWorld 用 UE5 的 replay-and-rendering 管线,固定场景 / 初始态 / 动作序列 / 角色控制器 / 相机策略,只改重力配置重放同一段交互,得到 matched counterfactual replay group:12 个电影级 UE5 场景、100+ 小时交互、60M+ 渲染帧、8 路同步相机、RGB/深度/法线/音频/动作/相机/引擎态/重力标签。配套验证:在 Wan2.2-5B / LingBot-World 上 LoRA 微调后重力对齐从 33% → 100%、$R^2$ 0.066 → 0.570;Qwen3-VL 重力分类 24.7% → 95.3%。代码(UE5 插件)尚未释出,仓库目前只有数据契约 + 配置 + CLI 文档。
Bernini: Latent Semantic Planning for Video Diffusion(用 MLLM 做「语义规划」,DiT 只负责渲染像素)
字节跳动 Bernini 团队的技术报告。核心主张:MLLM 和扩散模型可以用一条「分工线」缝起来——让 MLLM 做语义规划(在它自己的 ViT embedding 空间里预测「目标该长什么样」),让 DiT 只负责把这份语义计划渲染成像素。关键设计有三个:(1) 用 MAR 式的掩码生成把 MLLM 从「理解模型」改造成「语义规划器」,目标 ViT token 训练时随机掩码、推理时从全掩码迭代填充;(2) SA-3D RoPE,给统一序列里每个视觉 segment 一个下标 i,用一个「段相位」旋转向量 ⊙ 到标准 3D RoPE 上,解决多张参考图/源视频「同一 (t,h,w) 坐标身份混淆」的问题;(3) 一条链式增量 guidance,把源视频 / 源图 / 文本 / 语义 embedding 四种条件拆成可独立调节的增量。因为「语义」是接口,planner 和 renderer 可以分开训、只轻量联训。实测在 OpenVE(4.04 vs 次优 3.18)、EditVerse(editing quality 8.02)、OpenS2V(FaceSim 78.20,比次优高 20+ 分)等多个视频编辑/生成榜上做到 SOTA,且 VBench 文生图质量几乎不掉(84.64 vs 底座 Wan2.2 的 84.79)。代码与权重已开源(Qwen2.5-VL-7B 规划器 + Wan2.2-A14B 渲染器)。