image-editing
提到此概念的论文 / 教程
FlowInOne:把多模态生成统一成「图进图出」的流匹配
FlowInOne 抛弃「文本编码器条件化视觉」的主流范式,把文本、布局、编辑指令统统渲染进一张输入画布(visual prompt),让单个流匹配模型在一个共享视觉潜空间里学从「指令图」到「目标图」的确定性传输——真正的 image-in / image-out。配套开源 VisPrompt-5M(500 万视觉提示对,含物理力学/轨迹)和 VP-Bench。核心机制是 Dual-Path Spatially-Adaptive Modulation:纯生成时旁路结构分支、编辑时用交叉注意力+token 级 Sigmoid 门控注入源图结构。1.2B 模型在开源阵营 SOTA,部分维度逼近 Nano Banana。
Paint-Anything:把「任意颜色」做成提示词原生能力——用 24-bit hex 统一生成与编辑
字节跳动 Seed 的技术报告。核心主张:让图像模型「听懂十六进制颜色」不需要专用颜色编码器、也不需要推理时优化,而是把 <color>#AABBCC</color> 直接写进提示词、再用物体级颜色监督数据把这套接口喂给模型。三件套:(1) Paint-500K 数据管线——VLM grounding + SAM3 分割 + CIELAB 空间 MeanShift 聚类抽物体主色,把 50 万张真实图变成 hex 标注(40 万 T2I + 10 万编辑);(2) 纯色锚点 (pure-color anchor)——用纯色块给出干净的 hex→RGB 映射,且只在高噪声段 t∈[0.8,1] 激活,因为纯色轨迹里颜色早在 t≈0.8 就稳定了;(3) 显式 color 标签包裹 + 全量微调(冻结 VAE 和文本编码器)。FLUX.2-4B 上 ACBench-T2I +85.3%、ACBench-Edit +28.3%,8B 微调模型在颜色保真上反超 56B 的 FLUX.2-dev。
LLaDA-Image:用完全开源配方从零训一个 6B 强图像生成器(技术报告精读 + 代码交叉验证)
Inclusion AI(蚂蚁 AGI)的开源技术报告。一句话:从零训一个 6B 单流 DiT,靠"图像-only 预训练/中训练"先学视觉先验、再引入语言对齐,把配对 caption 从最耗算力的阶段里拿掉。 三大反常识选择:① 90%+ 训练样本无 caption(用冻结的扩散语言模型 VLM 从"待生成的那块图"自己抠语义当自条件),② 全程 98% 真图、SFT 里真图 >70%(承认真图早期收敛慢,但换来更高的真实感天花板),③ 用**扩散语言模型(dLLM,LLaDA2.0-Mini)**而非自回归 VLM 当理解后端。 工程上:DiT 里所有 Norm 换成**无参数 RMSNorm** + Muon 优化器稳住长训练;编辑走"绕过 VLM 的参考图双通道"(SigLIP-VQ 语义 + 干净 VAE latent 像素);TwinFlow 用一个共享 DiT 的正/负时间双头做 DMD 蒸馏到 2–4 步。 结果:Qwen-Image-Bench EN/CN 综合 53.53 / 53.38,开源第一(超次优 Z-Image Turbo 1.87 / 0.67);GEdit-Bench 编辑 7.336 / 7.294。权重、推理代码、配方全开。
Qwen-Image-Flash:把 4-NFE 蒸馏的胜负手从「目标函数」搬到「训练配方」
Qwen 团队的少步蒸馏技术报告:不再卷 distillation objective,而是系统性消融「数据组成 / 教师引导 / 任务混合」三个配方维度,把 Qwen-Image-2.0 蒸成 4-NFE 的统一生成-编辑模型。三个反直觉结论:(1) 文本中心数据反而蒸不出文本渲染,单类别(landscape/portrait)数据跨类泛化更好;(2) 直接用任务专精教师当唯一引导会让训练崩溃,需要 base 教师做锚 + 专精教师 step-wise 加权;(3) T2I:Edit = 5:5 平衡混合最优,而且编辑监督反过来还能涨 T2I。
Boogu-Image-0.1:用 1/10 数据做开源「统一生成+编辑」大模型(代码精读)
Boogu-Image-0.1 是一个 Apache-2.0 开源的「统一文生图 + 图像编辑」模型族(Base / Edit / Turbo,均 10B),主打照片级真实感和中英双语文字渲染,号称用比同类开源模型少约一个数量级的训练数据做到接近闭源(GPT-Image-2 / Nano-Banana-Pro)的水平。 架构是 Lumina-Image-2 谱系的 DiT(noise/context/ref 三套 refiner + 双流/单流 MMDiT 块),文本条件来自一个 Qwen3-VL 多模态大模型(既当指令编码器、又当 prompt 改写/推理器);Turbo 变体用 Decoupled DMD 蒸馏到 4 步、无 CFG。 ⚠️ 正式技术报告尚未发布(仓库标注 "Coming Soon"),本文是基于 README + 推理代码的交叉精读,非官方报告解读。
MRT: 一个 20B masked region transformer 把分层图生成的三个任务塞进同一个模型
Canva Research (arXiv 2026/05/26, CVPR'26 poster)。多层 RGBA 图生成长期落后于平面图生成,是因为 (1) 缺大规模数据,(2) 缺一个能复用 SOTA 平面图先验的架构。MRT 同时解决两件事:从 Canva 设计平台拿 10M 多语言分层设计样本 + 在 Qwen-Image 20B 上做 full-parameter fine-tune(不再是 LoRA),用一个 masked region transformer 把三个任务(text→layers / image→layers / layers→layers 编辑)塞进同一个模型——核心机制是 adaptive masking 决定每个 region token 是"干净条件"还是"加噪去噪目标"。沿用 ART [38] 的 regional latents(每层独立 VAE 编码,token 数 = O(层面积) 而非 O(全画布)),加一个 overflow-aware canvas layer 让超出边界的元素保持完整。DMD2 蒸馏到 8 步,推理在 20 层时比同期 Qwen-Image-Layered 快 100×、省 50-90% 显存。**注意:论文 5 月 26 日上传,官方代码尚未公开**(Canva GitHub org 无 repo)。