video-editing
提到此概念的论文 / 教程
📄 论文
📅 2026-08-24
Bernini: Latent Semantic Planning for Video Diffusion(用 MLLM 做「语义规划」,DiT 只负责渲染像素)
字节跳动 Bernini 团队的技术报告。核心主张:MLLM 和扩散模型可以用一条「分工线」缝起来——让 MLLM 做语义规划(在它自己的 ViT embedding 空间里预测「目标该长什么样」),让 DiT 只负责把这份语义计划渲染成像素。关键设计有三个:(1) 用 MAR 式的掩码生成把 MLLM 从「理解模型」改造成「语义规划器」,目标 ViT token 训练时随机掩码、推理时从全掩码迭代填充;(2) SA-3D RoPE,给统一序列里每个视觉 segment 一个下标 i,用一个「段相位」旋转向量 ⊙ 到标准 3D RoPE 上,解决多张参考图/源视频「同一 (t,h,w) 坐标身份混淆」的问题;(3) 一条链式增量 guidance,把源视频 / 源图 / 文本 / 语义 embedding 四种条件拆成可独立调节的增量。因为「语义」是接口,planner 和 renderer 可以分开训、只轻量联训。实测在 OpenVE(4.04 vs 次优 3.18)、EditVerse(editing quality 8.02)、OpenS2V(FaceSim 78.20,比次优高 20+ 分)等多个视频编辑/生成榜上做到 SOTA,且 VBench 文生图质量几乎不掉(84.64 vs 底座 Wan2.2 的 84.79)。代码与权重已开源(Qwen2.5-VL-7B 规划器 + Wan2.2-A14B 渲染器)。