latent-diffusion
提到此概念的论文 / 教程
扩散/流匹配去模糊调研:从 SD 先验到一步化与残差流(2025→2026)
对 2025 年以来用扩散(diffusion)与流匹配(flow matching)做图像去模糊(image deblurring)的工作做的调研,优先收录有模型与代码的方法。逐篇厘清核心贡献 / 方法 / 关键结果(带数字)/ 代码位置,再平行对比、找一致与矛盾、并对有仓库的方法做代码交叉验证;每篇核心工作都配了从原论文裁剪的架构主图。覆盖两大块:(A) 通用图像去模糊——把预训练 SD 当先验的真实去模糊(DeblurDiff、OSDD)、把去模糊重构成扩散过程本身的一步/少步方法(FideDiff、BlurDM)、非配对/自监督路线(TP-Diff、DeblurSDI)、流匹配残差路线(DeblurFlow);(B) 人脸去模糊 / 盲人脸复原——身份保持与反幻觉为主战场(FaceMe、HonestFace、AuthFace、LAFR、ELIR)。所有 arxiv 号、年份、代码状态均联网核实;DeblurDiff 的 EAC、DeblurSDI 的自扩散、BlurDM/AuthFace/FaceMe 的仓库对照真实代码交叉验证。
SeFi-Image:用「语义先行」扩散把 T2I 基础模型的训练成本砍到 1/5(代码精读)
SeFi-Image 是一个文生图(T2I)基础模型族(1B / 2B / 5B),核心是 Semantic-First Diffusion(SFD,语义先行扩散):把一张图拆成「语义 latent」(DINOv2 特征 → Semantic VAE 压缩)和「纹理 latent」(微调版 FLUX.2 VAE),给两路 latent 各自一个时间步,并强制语义时间步「领先」纹理一个固定偏移 Δt,让语义比纹理早一步去噪、从而给纹理生成提供更干净的结构条件。 代价:5B 模型只用了 125K A800 GPU·时(约为 Z-Image 的 10–20%),却在 GenEval / LongTextBench / CVTG-2K / OneIG 等多个基准上追平甚至超过 Qwen-Image 和 Z-Image。论文 + 权重 + 推理代码全部开源。 本文交叉精读:把 SFD 的 4 个核心公式逐一对到 `runner.py` / `flux2_sefi_transformer.py` 的具体实现,指出一处「论文写二值 mask、代码用 sigma 钳位」的等价但更巧妙的工程实现;并**着重梳理完整推理流程与 SemVAE 的设计**——包括一个反直觉的事实:训练时不可或缺的 SemVAE,在推理期完全不参与(编码器/解码器都不出现在推理图里,`s₁` 生成后即丢弃,仓库推理包里甚至没有它的权重),只留下一个整数超参 `semantic_channels`;以及推理端三种并列 guidance(CFG / AutoGuidance / 区间 guidance)与纹理 latent 的 BatchNorm 白化归一化等设计决定。