diffusion-transformer
提到此概念的论文 / 教程
Paint-Anything:把「任意颜色」做成提示词原生能力——用 24-bit hex 统一生成与编辑
字节跳动 Seed 的技术报告。核心主张:让图像模型「听懂十六进制颜色」不需要专用颜色编码器、也不需要推理时优化,而是把 <color>#AABBCC</color> 直接写进提示词、再用物体级颜色监督数据把这套接口喂给模型。三件套:(1) Paint-500K 数据管线——VLM grounding + SAM3 分割 + CIELAB 空间 MeanShift 聚类抽物体主色,把 50 万张真实图变成 hex 标注(40 万 T2I + 10 万编辑);(2) 纯色锚点 (pure-color anchor)——用纯色块给出干净的 hex→RGB 映射,且只在高噪声段 t∈[0.8,1] 激活,因为纯色轨迹里颜色早在 t≈0.8 就稳定了;(3) 显式 color 标签包裹 + 全量微调(冻结 VAE 和文本编码器)。FLUX.2-4B 上 ACBench-T2I +85.3%、ACBench-Edit +28.3%,8B 微调模型在颜色保真上反超 56B 的 FLUX.2-dev。
JiT:让去噪模型真的去「噪」——预测干净图,一个朴素 ViT 就能直接在像素上做扩散
何恺明 + 李天弘(MIT)的「回到基本功」。一句话主张:**预测干净数据 x 和预测噪声 ε / 速度 v 是本质不同的两件事**。据流形假设,自然图像躺在高维像素空间里的一张低维流形上,而 ε、v 是「离流形」的、弥散在整个高维空间——所以让网络直接预测 x,一个「欠容量」的小网络也能在极高维空间里工作;反之预测 ε/v 会灾难性失败。 由此得到 **JiT(Just image Transformers)**:一个朴素 ViT 直接吞大像素 patch(16×16×3=768 维,甚至 32×32×3=3072 维)、做 x-预测、配 v-loss。无 tokenizer、无预训练、无感知/对抗/表征对齐损失,自成一体。 三个反直觉证据:① 玩具螺旋实验——把 2D 螺旋埋进 D 维,只有 x-预测能随 D→512 存活,ε/v-预测在 D=16 就崩、D=512 全崩;② ImageNet 256² 上 JiT-B/16 的 x-预测 FID 8.62,同架构 ε-预测 372、v-预测 96 直接爆掉;③ 给 patch embedding 加一个「降维瓶颈」(768→64 维)反而更好(FID 8.62→7.35),呼应经典流形学习。 结果:同一套 base 尺寸、几乎恒定算力,把分辨率从 256 推到 1024(靠 patch 边长成比例放大、token 数固定 256);JiT-G 在 256²/512² 拿到 FID 1.82/1.78。代码极简开源(denoiser.py 就是论文 Algorithm 1)。
f-loss:给像素空间流匹配换一副「频域眼镜」——先学频率、再抠像素
自然图像功率谱按 1/f² 衰减:能量几乎全堆在低频,但人眼在乎的纹理/边缘藏在稀疏的高频。像素空间的 v-loss 对所有空间误差一视同仁 → 低频主导梯度 → 模型迟迟学不会细节。作者把这诊断成「目标函数层面的频谱失衡」。 解法两件套:① **f-loss(Focal Log-Frequency Loss)**——在 2D 傅里叶谱上做「对数压缩 log(1+e) + 逐样本焦点归一化 e/max(e) + 保留 1/(1-t)² 时间步权重」,让每个频率倍频程拿到等量学习信号;② **fv-loss 两段式调度**——训练早期用 f-loss 把所有频率快速拉齐,再用 sigmoid 权重平滑切回标准 v-loss 做像素级相位精修。 纯 drop-in、零架构改动。跨 B/L/XL 三档、256²/512² 两分辨率:收敛最高快 40%(1.13×–1.57×),FID/FDD/IS 全面改善;JiT-XL/16 在 750k 步做到 FID 2.13(v-loss 2.21),叠 REPA 后 750k 的 1.87 反超 DeCo 1.6M 的 1.90,叠感知损失后 500k 追平 PixelGen 800k 的 1.83 且 IS 更高(323.4 vs 293.6)。代码与模型承诺开源(尚未放出)。
LLaDA-Image:用完全开源配方从零训一个 6B 强图像生成器(技术报告精读 + 代码交叉验证)
Inclusion AI(蚂蚁 AGI)的开源技术报告。一句话:从零训一个 6B 单流 DiT,靠"图像-only 预训练/中训练"先学视觉先验、再引入语言对齐,把配对 caption 从最耗算力的阶段里拿掉。 三大反常识选择:① 90%+ 训练样本无 caption(用冻结的扩散语言模型 VLM 从"待生成的那块图"自己抠语义当自条件),② 全程 98% 真图、SFT 里真图 >70%(承认真图早期收敛慢,但换来更高的真实感天花板),③ 用**扩散语言模型(dLLM,LLaDA2.0-Mini)**而非自回归 VLM 当理解后端。 工程上:DiT 里所有 Norm 换成**无参数 RMSNorm** + Muon 优化器稳住长训练;编辑走"绕过 VLM 的参考图双通道"(SigLIP-VQ 语义 + 干净 VAE latent 像素);TwinFlow 用一个共享 DiT 的正/负时间双头做 DMD 蒸馏到 2–4 步。 结果:Qwen-Image-Bench EN/CN 综合 53.53 / 53.38,开源第一(超次优 Z-Image Turbo 1.87 / 0.67);GEdit-Bench 编辑 7.336 / 7.294。权重、推理代码、配方全开。
LingBot-Video: 把 MoE 搬进视频扩散——为具身智能从零 scale 的稀疏 DiT 世界模型
Robbyant 团队。第一个大规模开源 MoE 视频基础模型,专为具身智能设计。三条主线:①架构上把稠密 DiT 的 FFN 换成 DeepSeekMoE 式稀疏专家(共享专家+top-K 路由),用「容量-算力解耦」把 30B 总参数压到 3B 激活,1M token 序列下比 Dense-30B 快 3.18×;②数据上用 Data Profiling Engine + 世界知识拓扑图把 7 万小时具身视频(机械臂/导航/第一视角)灌进语料,五阶段课程从 192p 图像涨到 1080p;③训练上六路奖励(视觉/对齐/动态/连贯/人体/物理合理性)+ 单步探索 GRPO(Flash-GRPO/CPS)+ 用真实视频当负样本的 DiffusionNFT 微调防 reward hacking。RBench 0.620(开源第一,超闭源 Wan2.6 的 0.607)、Physics-IQ Verified 40.4(开源第一)。开源权重(Dense-1.3B / MoE-30B-A3B)+ 推理代码 + rewriter。
Krea 2 技术报告精读:一个「为创意探索而生」的开源文生图基础模型,从数据、架构到万卡基建全栈拆解
Krea 2 是 Krea 自研的开源文生图(T2I)基础模型族,定位不是「给你一张最稳的默认图」,而是「让你在广阔的美学空间里探索」——刻意保留风格多样性、并配套 prompt 扩写器 + 风格参考系统两套可控性工具。开源权重 + 推理代码,permissive license,号称登上 Artificial Analysis T2I 榜前 10、独立实验室中第 2。 这是一份「工程配方 + 系统基建」型技术报告(58 分钟阅读),重点不在新公式,而在**全栈决策**:数据策展原则(多样性优先、零 AI 生成图)、从 LLM 生态搬过来的极简 DiT(GQA + 门控 sigmoid 注意力 + SwiGLU + Qwen3-VL + 轻量时间步调制 + 多层特征聚合)、五阶段训练流水线(预训练→midtraining→SFT→偏好优化→RL→时间步蒸馏),以及从零自建的 Kubernetes 训练基建(Kueue 调度、Virtual Kubelet 外溢推理、Weka 文件系统、PostgreSQL「krablet」数据仓库 + FOR UPDATE SKIP LOCKED 队列)。 本文按精读骨架交叉拆解,并补全报告用散文描述、但背后是标准公式的几处方法(rectified-flow v 参数化、DPO/STPO、多奖励 GRPO、DMD→TDM)。
i1 精读:一份「完全开源」的强文生图配方——用 300+ 控制实验把设计空间逐个钉死
i1 是普林斯顿 Zhuang Liu 组放出的 3B 文生图扩散模型,卖点不是新模块,而是**完全开源(权重 + 数据 + 代码 + 配方)** 且**用 300+ 个控制实验**(700K+ TPU v6e 小时)把「文/噪声条件、骨干结构、合成 caption、数据混合」这几个设计维度逐个单变量消融,给出 10 条可复用结论。 最终配方极简:双流 MMDiT + 长跳连接(long skip)+ 砍掉 AdaLN(省 0.23B 参数)+ 单个强文本编码器(T5Gemma-2B)配一个**更大的 transformer adapter**(替代「多文本编码器」)+ 只用长合成 caption 训练、推理时用 LLM 把短 prompt 扩写对齐训练分布 + 各数据集**等权重**混合。 在 GenEval/DPG/PRISM/CVTG-2K/LongText 五个 benchmark 上,i1(3B)平均超过此前最强「完全开源」模型 **29.5 个百分点**,并在多数指标上压过 12B FLUX.1 [Dev]、17B HiDream-I1。本文交叉阅读其 JAX 代码,把每条结论落到 `file:Lnn`。
SeFi-Image:用「语义先行」扩散把 T2I 基础模型的训练成本砍到 1/5(代码精读)
SeFi-Image 是一个文生图(T2I)基础模型族(1B / 2B / 5B),核心是 Semantic-First Diffusion(SFD,语义先行扩散):把一张图拆成「语义 latent」(DINOv2 特征 → Semantic VAE 压缩)和「纹理 latent」(微调版 FLUX.2 VAE),给两路 latent 各自一个时间步,并强制语义时间步「领先」纹理一个固定偏移 Δt,让语义比纹理早一步去噪、从而给纹理生成提供更干净的结构条件。 代价:5B 模型只用了 125K A800 GPU·时(约为 Z-Image 的 10–20%),却在 GenEval / LongTextBench / CVTG-2K / OneIG 等多个基准上追平甚至超过 Qwen-Image 和 Z-Image。论文 + 权重 + 推理代码全部开源。 本文交叉精读:把 SFD 的 4 个核心公式逐一对到 `runner.py` / `flux2_sefi_transformer.py` 的具体实现,指出一处「论文写二值 mask、代码用 sigma 钳位」的等价但更巧妙的工程实现;并**着重梳理完整推理流程与 SemVAE 的设计**——包括一个反直觉的事实:训练时不可或缺的 SemVAE,在推理期完全不参与(编码器/解码器都不出现在推理图里,`s₁` 生成后即丢弃,仓库推理包里甚至没有它的权重),只留下一个整数超参 `semantic_channels`;以及推理端三种并列 guidance(CFG / AutoGuidance / 区间 guidance)与纹理 latent 的 BatchNorm 白化归一化等设计决定。
Boogu-Image-0.1:用 1/10 数据做开源「统一生成+编辑」大模型(代码精读)
Boogu-Image-0.1 是一个 Apache-2.0 开源的「统一文生图 + 图像编辑」模型族(Base / Edit / Turbo,均 10B),主打照片级真实感和中英双语文字渲染,号称用比同类开源模型少约一个数量级的训练数据做到接近闭源(GPT-Image-2 / Nano-Banana-Pro)的水平。 架构是 Lumina-Image-2 谱系的 DiT(noise/context/ref 三套 refiner + 双流/单流 MMDiT 块),文本条件来自一个 Qwen3-VL 多模态大模型(既当指令编码器、又当 prompt 改写/推理器);Turbo 变体用 Decoupled DMD 蒸馏到 4 步、无 CFG。 ⚠️ 正式技术报告尚未发布(仓库标注 "Coming Soon"),本文是基于 README + 推理代码的交叉精读,非官方报告解读。
ARGUS:把「身份」从一张参考图变成扩散同步的动态记忆
主体保持的视频生成(让生成视频里的人「还是同一个人」)长期被「点参考」范式卡住——一张参考图把"这个人是谁"和"他这一帧恰好长这样(姿态/配饰/光照/背景)"纠缠在一起,模型要么照抄噪声细节、要么身份漂移。 ARGUS(快手/北大)提出 SMII:用 MLLM 当"身份导演"挑出多视角身份证据,拼成 3×3 马赛克,**和目标视频走同一条 Flow Matching 加噪路径**,再以"负时间、只读记忆"的方式注入 Wan 的原生 token 空间。配合无配对反事实训练 + TIA + ASLG,在 OpenS2V-Eval 拿到 64.38 总分、71.86 FaceSim 的 SOTA,大偏航/首帧遮挡鲁棒性分别再涨 12.6 / 15.1 分。
Bernini: Latent Semantic Planning for Video Diffusion(用 MLLM 做「语义规划」,DiT 只负责渲染像素)
字节跳动 Bernini 团队的技术报告。核心主张:MLLM 和扩散模型可以用一条「分工线」缝起来——让 MLLM 做语义规划(在它自己的 ViT embedding 空间里预测「目标该长什么样」),让 DiT 只负责把这份语义计划渲染成像素。关键设计有三个:(1) 用 MAR 式的掩码生成把 MLLM 从「理解模型」改造成「语义规划器」,目标 ViT token 训练时随机掩码、推理时从全掩码迭代填充;(2) SA-3D RoPE,给统一序列里每个视觉 segment 一个下标 i,用一个「段相位」旋转向量 ⊙ 到标准 3D RoPE 上,解决多张参考图/源视频「同一 (t,h,w) 坐标身份混淆」的问题;(3) 一条链式增量 guidance,把源视频 / 源图 / 文本 / 语义 embedding 四种条件拆成可独立调节的增量。因为「语义」是接口,planner 和 renderer 可以分开训、只轻量联训。实测在 OpenVE(4.04 vs 次优 3.18)、EditVerse(editing quality 8.02)、OpenS2V(FaceSim 78.20,比次优高 20+ 分)等多个视频编辑/生成榜上做到 SOTA,且 VBench 文生图质量几乎不掉(84.64 vs 底座 Wan2.2 的 84.79)。代码与权重已开源(Qwen2.5-VL-7B 规划器 + Wan2.2-A14B 渲染器)。