论文

共 59 篇论文精读。

📄 论文 📅 2026-06-30

OMGSR:一步超分的关键不是蒸馏,是把低清图喂到「中间时刻」——SNR 算出最佳注入点 + GAN 训练

OMGSR 把一步真实世界超分(Real-ISR)的成败归结为一个「潜空间鸿沟」:以往方法把低清图 latent 注入到扩散调度器的 t=999(纯噪声)或 t=1(干净图),但低清图 latent 既不是噪声也不是干净图——它最接近预训练扩散在某个**中间时刻 t\*** 的带噪 latent。 作者用信噪比 (SNR) 把这个「最佳中间时刻」**算出来**(SD2.1-base 上 t\*=273),再用 LRR 损失(LoRA 微调 VAE 编码器)把低清 latent 进一步拉向 t\* 的带噪 latent,然后在 t\* 处做一步去噪。整套是 **GAN 训练**(生成器=扩散模型本身,判别器=DINOv3-ConvNeXt + 多级头),不是师生蒸馏。这就是 [[op4ksr-2026]] 4K 超分的直接前身。

image-super-resolution real-isr one-step-generation +7 more
📄 论文 📅 2026-06-30

MAMBO-G:用幅度比 r_t 自适应阻尼 CFG——一个免训练、即插即用的扩散/视频采样加速器

CFG 在采样初期(t→1)对"通用方向"施加了过大的更新,在高维大模型里尤其会 overshoot 出过饱和与结构崩坏。 MAMBO-G 用一个逐实例的幅度比 r_t = ‖Δv‖/‖v∅‖ 当探针:r_t 高就指数级压低 guidance scale,r_t 低才放开。 免训练、几乎零开销,已并入 Diffusers。SD3.5 提速 3×、Lumina 4×、14B 视频模型 Wan2.1 提速 2×。

classifier-free-guidance flow-matching diffusion-sampling +3 more
📄 论文 📅 2026-06-25

Krea 2 技术报告精读:一个「为创意探索而生」的开源文生图基础模型,从数据、架构到万卡基建全栈拆解

Krea 2 是 Krea 自研的开源文生图(T2I)基础模型族,定位不是「给你一张最稳的默认图」,而是「让你在广阔的美学空间里探索」——刻意保留风格多样性、并配套 prompt 扩写器 + 风格参考系统两套可控性工具。开源权重 + 推理代码,permissive license,号称登上 Artificial Analysis T2I 榜前 10、独立实验室中第 2。 这是一份「工程配方 + 系统基建」型技术报告(58 分钟阅读),重点不在新公式,而在**全栈决策**:数据策展原则(多样性优先、零 AI 生成图)、从 LLM 生态搬过来的极简 DiT(GQA + 门控 sigmoid 注意力 + SwiGLU + Qwen3-VL + 轻量时间步调制 + 多层特征聚合)、五阶段训练流水线(预训练→midtraining→SFT→偏好优化→RL→时间步蒸馏),以及从零自建的 Kubernetes 训练基建(Kueue 调度、Virtual Kubelet 外溢推理、Weka 文件系统、PostgreSQL「krablet」数据仓库 + FOR UPDATE SKIP LOCKED 队列)。 本文按精读骨架交叉拆解,并补全报告用散文描述、但背后是标准公式的几处方法(rectified-flow v 参数化、DPO/STPO、多奖励 GRPO、DMD→TDM)。

text-to-image diffusion-transformer mmdit +18 more
📄 论文 📅 2026-06-25

i1 精读:一份「完全开源」的强文生图配方——用 300+ 控制实验把设计空间逐个钉死

i1 是普林斯顿 Zhuang Liu 组放出的 3B 文生图扩散模型,卖点不是新模块,而是**完全开源(权重 + 数据 + 代码 + 配方)** 且**用 300+ 个控制实验**(700K+ TPU v6e 小时)把「文/噪声条件、骨干结构、合成 caption、数据混合」这几个设计维度逐个单变量消融,给出 10 条可复用结论。 最终配方极简:双流 MMDiT + 长跳连接(long skip)+ 砍掉 AdaLN(省 0.23B 参数)+ 单个强文本编码器(T5Gemma-2B)配一个**更大的 transformer adapter**(替代「多文本编码器」)+ 只用长合成 caption 训练、推理时用 LLM 把短 prompt 扩写对齐训练分布 + 各数据集**等权重**混合。 在 GenEval/DPG/PRISM/CVTG-2K/LongText 五个 benchmark 上,i1(3B)平均超过此前最强「完全开源」模型 **29.5 个百分点**,并在多数指标上压过 12B FLUX.1 [Dev]、17B HiDream-I1。本文交叉阅读其 JAX 代码,把每条结论落到 `file:Lnn`。

text-to-image diffusion-transformer mmdit +11 more
📄 论文 📅 2026-06-24

SeFi-Image:用「语义先行」扩散把 T2I 基础模型的训练成本砍到 1/5(代码精读)

SeFi-Image 是一个文生图(T2I)基础模型族(1B / 2B / 5B),核心是 Semantic-First Diffusion(SFD,语义先行扩散):把一张图拆成「语义 latent」(DINOv2 特征 → Semantic VAE 压缩)和「纹理 latent」(微调版 FLUX.2 VAE),给两路 latent 各自一个时间步,并强制语义时间步「领先」纹理一个固定偏移 Δt,让语义比纹理早一步去噪、从而给纹理生成提供更干净的结构条件。 代价:5B 模型只用了 125K A800 GPU·时(约为 Z-Image 的 10–20%),却在 GenEval / LongTextBench / CVTG-2K / OneIG 等多个基准上追平甚至超过 Qwen-Image 和 Z-Image。论文 + 权重 + 推理代码全部开源。 本文交叉精读:把 SFD 的 4 个核心公式逐一对到 `runner.py` / `flux2_sefi_transformer.py` 的具体实现,指出一处「论文写二值 mask、代码用 sigma 钳位」的等价但更巧妙的工程实现;并**着重梳理完整推理流程与 SemVAE 的设计**——包括一个反直觉的事实:训练时不可或缺的 SemVAE,在推理期完全不参与(编码器/解码器都不出现在推理图里,`s₁` 生成后即丢弃,仓库推理包里甚至没有它的权重),只留下一个整数超参 `semantic_channels`;以及推理端三种并列 guidance(CFG / AutoGuidance / 区间 guidance)与纹理 latent 的 BatchNorm 白化归一化等设计决定。

text-to-image semantic-first-diffusion latent-diffusion +11 more
📄 论文 📅 2026-06-22

ARGUS:把「身份」从一张参考图变成扩散同步的动态记忆

主体保持的视频生成(让生成视频里的人「还是同一个人」)长期被「点参考」范式卡住——一张参考图把"这个人是谁"和"他这一帧恰好长这样(姿态/配饰/光照/背景)"纠缠在一起,模型要么照抄噪声细节、要么身份漂移。 ARGUS(快手/北大)提出 SMII:用 MLLM 当"身份导演"挑出多视角身份证据,拼成 3×3 马赛克,**和目标视频走同一条 Flow Matching 加噪路径**,再以"负时间、只读记忆"的方式注入 Wan 的原生 token 空间。配合无配对反事实训练 + TIA + ASLG,在 OpenS2V-Eval 拿到 64.38 总分、71.86 FaceSim 的 SOTA,大偏航/首帧遮挡鲁棒性分别再涨 12.6 / 15.1 分。

subject-preserving-video identity-preservation video-diffusion +6 more
📄 论文 📅 2026-06-18

Osprey:把「掩码」喂进 MLLM 的像素级区域理解

Osprey 把 referring 的输入从「框」升级到「掩码」:用 mask-aware visual extractor 在卷积 CLIP(ConvNeXt-L)的多尺度特征图上做 mask-average-pooling 抽语义、再把掩码本身展平投影成 spatial token,两者替换文本里的 <region> 占位符喂给 LLM。配 724K 掩码-文本指令数据(Osprey-724K),在开放词表分割、部件级分类、区域描述上全面超过 box 级方法和 Ferret。 它是 [[ferret-2023|Ferret]]「自由形状区域输入」的掩码精化版,也是 [[lisa-2023|LISA]] 输出侧掩码的输入侧对偶。

referring-grounding region-input mask-pooling +4 more
📄 论文 📅 2026-06-18

OFTSR:一步超分 + 可调「保真度↔真实感」的整条曲线

OFTSR 用两阶段方案做单步图像超分:先训一个「噪声增广的条件 rectified flow」当教师,再蒸馏出一个一步学生网络——蒸馏的约束是「学生从不同时间 t、s 的预测必须落在教师同一条 PF-ODE 轨迹上」。 关键好处:一步推理时只需调一个超参 t,就能在「高 PSNR / 高保真」和「低 LPIPS / 高真实感」之间连续滑动,把感知-失真权衡的整条曲线塞进单步模型,而过去的单步蒸馏只能锁死在曲线上的一个点。

image-super-resolution rectified-flow flow-matching +5 more
📄 论文 📅 2026-06-18

GGT-100K:用多模态大模型「生成」真实世界修复的 Ground Truth

真实世界图像修复(IR)卡在「没有成对训练数据」:合成退化不像真的,真实成对数据又贵又难采。GGT-100K 的思路是——既然没有干净参考图,那就让生成式多模态大模型(MFM)「画」一张出来当 ground truth。 作者系统评测了 9 个 MFM × 4 种提示策略,发现 Nano-Banana-2 + Gemini 自适应提示在「保真 + 感知 + 无幻觉」上最均衡;再用它配合「指标过滤 → VLM 复检改写 → 人工验收」三级质控,构建出 103,707 对 LQ-HQ 训练对 + 500 对测试集。用它训各类 IR 模型都涨点,对生成式修复模型(FLUX/Qwen-Image-Edit)增益尤其大。

image-restoration real-world-restoration dataset-construction +6 more