paper-reading
论文精读、系统化教程与研究调研报告。
PhysEditWorld:把「重力」从隐式相关性拽成可编辑的设计变量
清华深圳 + 北航 + 港科大等。一个数据集论文:现有 game world model 把物理当成数据分布里的隐式规律学,能模仿「世界通常怎么演化」,但答不出游戏作者真正关心的问题——「同一个场景,如果改一条物理规则,应该怎么演化?」。PhysEditWorld 用 UE5 的 replay-and-rendering 管线,固定场景 / 初始态 / 动作序列 / 角色控制器 / 相机策略,只改重力配置重放同一段交互,得到 matched counterfactual replay group:12 个电影级 UE5 场景、100+ 小时交互、60M+ 渲染帧、8 路同步相机、RGB/深度/法线/音频/动作/相机/引擎态/重力标签。配套验证:在 Wan2.2-5B / LingBot-World 上 LoRA 微调后重力对齐从 33% → 100%、$R^2$ 0.066 → 0.570;Qwen3-VL 重力分类 24.7% → 95.3%。代码(UE5 插件)尚未释出,仓库目前只有数据契约 + 配置 + CLI 文档。
OP4KSR:一步、无分块的 4K 超分,外加把 Flux「周期格子伪影」连根拔起
OP4KSR 是第一个「一步 + 无分块」的真实世界 4K 超分框架:靠 UltraFlux 的 F16 极压缩 VAE 把 4096×4096 的显存压到单卡可跑,再借 [[omgsr-2025]] 的中间时刻对齐把 Flux 微调成一步前向(注意:是 GAN 式一步微调,**不是师生蒸馏**),5.75 秒出一张 4K 图。 但一步化会触发周期 32 像素的格子伪影。作者把病因拆成两层——RoPE 相位坍缩让相邻 token 不可分(θ=10000 太大)、以及 2×2 打包后 unpack 把通道当空间用——并对症下两味药:RoPE 基频从 10000 降到 100(RFR)+ 一个基于自相关的周期性损失(L_AP)。
OMGSR:一步超分的关键不是蒸馏,是把低清图喂到「中间时刻」——SNR 算出最佳注入点 + GAN 训练
OMGSR 把一步真实世界超分(Real-ISR)的成败归结为一个「潜空间鸿沟」:以往方法把低清图 latent 注入到扩散调度器的 t=999(纯噪声)或 t=1(干净图),但低清图 latent 既不是噪声也不是干净图——它最接近预训练扩散在某个**中间时刻 t\*** 的带噪 latent。 作者用信噪比 (SNR) 把这个「最佳中间时刻」**算出来**(SD2.1-base 上 t\*=273),再用 LRR 损失(LoRA 微调 VAE 编码器)把低清 latent 进一步拉向 t\* 的带噪 latent,然后在 t\* 处做一步去噪。整套是 **GAN 训练**(生成器=扩散模型本身,判别器=DINOv3-ConvNeXt + 多级头),不是师生蒸馏。这就是 [[op4ksr-2026]] 4K 超分的直接前身。
MAMBO-G:用幅度比 r_t 自适应阻尼 CFG——一个免训练、即插即用的扩散/视频采样加速器
CFG 在采样初期(t→1)对"通用方向"施加了过大的更新,在高维大模型里尤其会 overshoot 出过饱和与结构崩坏。 MAMBO-G 用一个逐实例的幅度比 r_t = ‖Δv‖/‖v∅‖ 当探针:r_t 高就指数级压低 guidance scale,r_t 低才放开。 免训练、几乎零开销,已并入 Diffusers。SD3.5 提速 3×、Lumina 4×、14B 视频模型 Wan2.1 提速 2×。
扩散超分调研:一步化浪潮与 SeedVR 之后的视频超分(2024→2026)
对 2024–2026 扩散超分(图像 + 视频)的研究调研,主线是「把多步随机采样压成一步确定性前向」。逐篇厘清每个工作的核心贡献 / 方法 / 关键结果 / 代码位置,再平行对比、找出一致与矛盾、并把每个有仓库的方法的核心主张与其代码逐一交叉验证。覆盖图像一步化(OSEDiff/OMGSR/OP4KSR/OFTSR/ODTSR/TEASR)与 SeedVR 之后的视频超分(SeedVR2/DOVE/DLoRAL/DUO-VSR/FlashVSR/InfVSR/Stream-DiffVSR/STCDiT)。所有 arxiv 号均联网核实;代码主张对照 OSEDiff/OMGSR/DLoRAL/SeedVR/FlashVSR/StableSR 真实函数验证。
扩散超分全景:从多步先验到一步前向,再到视频流式
8 节螺旋系统讲透扩散超分(Diffusion Super-Resolution)的演化主线:把"多步随机采样的强生成先验"逐步压成"一步确定性前向",再从图像扩展到视频的时序一致性与流式实时。地基是 SR3/StableSR 的"冻结 SD 当先验、只学条件"(§1–§2);其上是三条一步化路线——分数蒸馏(OSEDiff/VSD,§3)、中间时刻注入+GAN 一步(OMGSR/OP4KSR,§4);再转入视频:SeedVR 的 shifted-window 时空 DiT(§5)、视频一步化与时序一致(DLoRAL 双 LoRA / DOVE / DUO-VSR,§6)、流式/长视频/实时(FlashVSR 稀疏注意力 / InfVSR 因果 KV-cache / Stream-DiffVSR,§7),最后收敛到统一视角与选型白地(§8)。代码均 verbatim 引自 StableSR、OSEDiff、OMGSR、SeedVR、DLoRAL、FlashVSR 真实仓库(行号经 sed 核对)。
Krea 2 技术报告精读:一个「为创意探索而生」的开源文生图基础模型,从数据、架构到万卡基建全栈拆解
Krea 2 是 Krea 自研的开源文生图(T2I)基础模型族,定位不是「给你一张最稳的默认图」,而是「让你在广阔的美学空间里探索」——刻意保留风格多样性、并配套 prompt 扩写器 + 风格参考系统两套可控性工具。开源权重 + 推理代码,permissive license,号称登上 Artificial Analysis T2I 榜前 10、独立实验室中第 2。 这是一份「工程配方 + 系统基建」型技术报告(58 分钟阅读),重点不在新公式,而在**全栈决策**:数据策展原则(多样性优先、零 AI 生成图)、从 LLM 生态搬过来的极简 DiT(GQA + 门控 sigmoid 注意力 + SwiGLU + Qwen3-VL + 轻量时间步调制 + 多层特征聚合)、五阶段训练流水线(预训练→midtraining→SFT→偏好优化→RL→时间步蒸馏),以及从零自建的 Kubernetes 训练基建(Kueue 调度、Virtual Kubelet 外溢推理、Weka 文件系统、PostgreSQL「krablet」数据仓库 + FOR UPDATE SKIP LOCKED 队列)。 本文按精读骨架交叉拆解,并补全报告用散文描述、但背后是标准公式的几处方法(rectified-flow v 参数化、DPO/STPO、多奖励 GRPO、DMD→TDM)。
i1 精读:一份「完全开源」的强文生图配方——用 300+ 控制实验把设计空间逐个钉死
i1 是普林斯顿 Zhuang Liu 组放出的 3B 文生图扩散模型,卖点不是新模块,而是**完全开源(权重 + 数据 + 代码 + 配方)** 且**用 300+ 个控制实验**(700K+ TPU v6e 小时)把「文/噪声条件、骨干结构、合成 caption、数据混合」这几个设计维度逐个单变量消融,给出 10 条可复用结论。 最终配方极简:双流 MMDiT + 长跳连接(long skip)+ 砍掉 AdaLN(省 0.23B 参数)+ 单个强文本编码器(T5Gemma-2B)配一个**更大的 transformer adapter**(替代「多文本编码器」)+ 只用长合成 caption 训练、推理时用 LLM 把短 prompt 扩写对齐训练分布 + 各数据集**等权重**混合。 在 GenEval/DPG/PRISM/CVTG-2K/LongText 五个 benchmark 上,i1(3B)平均超过此前最强「完全开源」模型 **29.5 个百分点**,并在多数指标上压过 12B FLUX.1 [Dev]、17B HiDream-I1。本文交叉阅读其 JAX 代码,把每条结论落到 `file:Lnn`。
SeFi-Image:用「语义先行」扩散把 T2I 基础模型的训练成本砍到 1/5(代码精读)
SeFi-Image 是一个文生图(T2I)基础模型族(1B / 2B / 5B),核心是 Semantic-First Diffusion(SFD,语义先行扩散):把一张图拆成「语义 latent」(DINOv2 特征 → Semantic VAE 压缩)和「纹理 latent」(微调版 FLUX.2 VAE),给两路 latent 各自一个时间步,并强制语义时间步「领先」纹理一个固定偏移 Δt,让语义比纹理早一步去噪、从而给纹理生成提供更干净的结构条件。 代价:5B 模型只用了 125K A800 GPU·时(约为 Z-Image 的 10–20%),却在 GenEval / LongTextBench / CVTG-2K / OneIG 等多个基准上追平甚至超过 Qwen-Image 和 Z-Image。论文 + 权重 + 推理代码全部开源。 本文交叉精读:把 SFD 的 4 个核心公式逐一对到 `runner.py` / `flux2_sefi_transformer.py` 的具体实现,指出一处「论文写二值 mask、代码用 sigma 钳位」的等价但更巧妙的工程实现;并**着重梳理完整推理流程与 SemVAE 的设计**——包括一个反直觉的事实:训练时不可或缺的 SemVAE,在推理期完全不参与(编码器/解码器都不出现在推理图里,`s₁` 生成后即丢弃,仓库推理包里甚至没有它的权重),只留下一个整数超参 `semantic_channels`;以及推理端三种并列 guidance(CFG / AutoGuidance / 区间 guidance)与纹理 latent 的 BatchNorm 白化归一化等设计决定。