论文

共 59 篇论文精读。

📄 论文 📅 2026-09-24

FlowInOne:把多模态生成统一成「图进图出」的流匹配

FlowInOne 抛弃「文本编码器条件化视觉」的主流范式,把文本、布局、编辑指令统统渲染进一张输入画布(visual prompt),让单个流匹配模型在一个共享视觉潜空间里学从「指令图」到「目标图」的确定性传输——真正的 image-in / image-out。配套开源 VisPrompt-5M(500 万视觉提示对,含物理力学/轨迹)和 VP-Bench。核心机制是 Dual-Path Spatially-Adaptive Modulation:纯生成时旁路结构分支、编辑时用交叉注意力+token 级 Sigmoid 门控注入源图结构。1.2B 模型在开源阵营 SOTA,部分维度逼近 Nano Banana。

flow-matching multimodal-generation image-editing +7 more
📄 论文 📅 2026-09-24

DeepSeek Elastic Compute (DSec): 为大规模 Agentic RL 训练造的沙箱基础设施

DeepSeek 把 agentic RL 训练/评测所需的执行环境做成了一个生产级沙箱平台 DSec:一套 SDK 暴露 FnCall / 容器 / microVM / 全 VM 四种后端,用可组合的 EROFS 分层替代单体镜像,靠 3FS 做按需镜像加载,用 virtio-pmem + DAMON 气球回收把内存超卖压下来,用 SCHED_IDLE + core scheduling 保护延迟敏感任务,并与 RL 框架协同做抢占安全的暂停/恢复。单个 scale unit 约 160 节点,日均 300 万沙箱、峰值并发 38 万、创建速率 5000+/秒。

agentic-rl sandbox microvm +8 more
📄 论文 📅 2026-09-21

Paint-Anything:把「任意颜色」做成提示词原生能力——用 24-bit hex 统一生成与编辑

字节跳动 Seed 的技术报告。核心主张:让图像模型「听懂十六进制颜色」不需要专用颜色编码器、也不需要推理时优化,而是把 <color>#AABBCC</color> 直接写进提示词、再用物体级颜色监督数据把这套接口喂给模型。三件套:(1) Paint-500K 数据管线——VLM grounding + SAM3 分割 + CIELAB 空间 MeanShift 聚类抽物体主色,把 50 万张真实图变成 hex 标注(40 万 T2I + 10 万编辑);(2) 纯色锚点 (pure-color anchor)——用纯色块给出干净的 hex→RGB 映射,且只在高噪声段 t∈[0.8,1] 激活,因为纯色轨迹里颜色早在 t≈0.8 就稳定了;(3) 显式 color 标签包裹 + 全量微调(冻结 VAE 和文本编码器)。FLUX.2-4B 上 ACBench-T2I +85.3%、ACBench-Edit +28.3%,8B 微调模型在颜色保真上反超 56B 的 FLUX.2-dev。

color-control text-to-image image-editing +7 more
📄 论文 📅 2026-09-21

JiT:让去噪模型真的去「噪」——预测干净图,一个朴素 ViT 就能直接在像素上做扩散

何恺明 + 李天弘(MIT)的「回到基本功」。一句话主张:**预测干净数据 x 和预测噪声 ε / 速度 v 是本质不同的两件事**。据流形假设,自然图像躺在高维像素空间里的一张低维流形上,而 ε、v 是「离流形」的、弥散在整个高维空间——所以让网络直接预测 x,一个「欠容量」的小网络也能在极高维空间里工作;反之预测 ε/v 会灾难性失败。 由此得到 **JiT(Just image Transformers)**:一个朴素 ViT 直接吞大像素 patch(16×16×3=768 维,甚至 32×32×3=3072 维)、做 x-预测、配 v-loss。无 tokenizer、无预训练、无感知/对抗/表征对齐损失,自成一体。 三个反直觉证据:① 玩具螺旋实验——把 2D 螺旋埋进 D 维,只有 x-预测能随 D→512 存活,ε/v-预测在 D=16 就崩、D=512 全崩;② ImageNet 256² 上 JiT-B/16 的 x-预测 FID 8.62,同架构 ε-预测 372、v-预测 96 直接爆掉;③ 给 patch embedding 加一个「降维瓶颈」(768→64 维)反而更好(FID 8.62→7.35),呼应经典流形学习。 结果:同一套 base 尺寸、几乎恒定算力,把分辨率从 256 推到 1024(靠 patch 边长成比例放大、token 数固定 256);JiT-G 在 256²/512² 拿到 FID 1.82/1.78。代码极简开源(denoiser.py 就是论文 Algorithm 1)。

diffusion-models flow-matching pixel-space-generation +6 more
📄 论文 📅 2026-09-21

f-loss:给像素空间流匹配换一副「频域眼镜」——先学频率、再抠像素

自然图像功率谱按 1/f² 衰减:能量几乎全堆在低频,但人眼在乎的纹理/边缘藏在稀疏的高频。像素空间的 v-loss 对所有空间误差一视同仁 → 低频主导梯度 → 模型迟迟学不会细节。作者把这诊断成「目标函数层面的频谱失衡」。 解法两件套:① **f-loss(Focal Log-Frequency Loss)**——在 2D 傅里叶谱上做「对数压缩 log(1+e) + 逐样本焦点归一化 e/max(e) + 保留 1/(1-t)² 时间步权重」,让每个频率倍频程拿到等量学习信号;② **fv-loss 两段式调度**——训练早期用 f-loss 把所有频率快速拉齐,再用 sigmoid 权重平滑切回标准 v-loss 做像素级相位精修。 纯 drop-in、零架构改动。跨 B/L/XL 三档、256²/512² 两分辨率:收敛最高快 40%(1.13×–1.57×),FID/FDD/IS 全面改善;JiT-XL/16 在 750k 步做到 FID 2.13(v-loss 2.21),叠 REPA 后 750k 的 1.87 反超 DeCo 1.6M 的 1.90,叠感知损失后 500k 追平 PixelGen 800k 的 1.83 且 IS 更高(323.4 vs 293.6)。代码与模型承诺开源(尚未放出)。

flow-matching pixel-space-generation frequency-domain-loss +5 more
📄 论文 📅 2026-09-05

LLaDA-Image:用完全开源配方从零训一个 6B 强图像生成器(技术报告精读 + 代码交叉验证)

Inclusion AI(蚂蚁 AGI)的开源技术报告。一句话:从零训一个 6B 单流 DiT,靠"图像-only 预训练/中训练"先学视觉先验、再引入语言对齐,把配对 caption 从最耗算力的阶段里拿掉。 三大反常识选择:① 90%+ 训练样本无 caption(用冻结的扩散语言模型 VLM 从"待生成的那块图"自己抠语义当自条件),② 全程 98% 真图、SFT 里真图 >70%(承认真图早期收敛慢,但换来更高的真实感天花板),③ 用**扩散语言模型(dLLM,LLaDA2.0-Mini)**而非自回归 VLM 当理解后端。 工程上:DiT 里所有 Norm 换成**无参数 RMSNorm** + Muon 优化器稳住长训练;编辑走"绕过 VLM 的参考图双通道"(SigLIP-VQ 语义 + 干净 VAE latent 像素);TwinFlow 用一个共享 DiT 的正/负时间双头做 DMD 蒸馏到 2–4 步。 结果:Qwen-Image-Bench EN/CN 综合 53.53 / 53.38,开源第一(超次优 Z-Image Turbo 1.87 / 0.67);GEdit-Bench 编辑 7.336 / 7.294。权重、推理代码、配方全开。

text-to-image image-editing unified-multimodal +9 more
📄 论文 📅 2026-08-24

PixRestore:扔掉 VAE 和 T2I 先验,从零训一个像素空间 DiT 做统一图像修复

港理工 VCLab 的统一图像修复(UIR)工作。核心主张:为 UIR 适配大 T2I 潜空间扩散模型是走了弯路——VAE 会丢掉修复最在意的细节,开放式生成先验会造出与输入不一致的伪影,十亿级骨干 + MLLM + MoE + VAE 编解码则纯属浪费算力。PixRestore 反其道而行:无 VAE、不用 T2I 预训练,直接在 patch 化的 RGB 像素上从零做 flow matching。为了适应不同退化,它用冻结的 DINOv2 多层特征作条件,并训一个「相似度引导的自适应层路由」——用 LQ–HQ 特征相似度当老师,可靠的层融合成 dense 条件(Eq 5),不可靠的层反而加大 HQ 特征监督(Eq 6)。最后把多步模型固定 t=1、配 DINO 特征判别器蒸成一步生成器。结果:约 50M 参数、单步推理、44ms,在 8 类退化上整体保真度/感知质量/退化去除都拿到最优或次优,算力只有 FoundIR-v2 的 1/181、Flux-IR 的 1/1209。

image-restoration unified-image-restoration pixel-diffusion +8 more
📄 论文 📅 2026-08-24

Bernini: Latent Semantic Planning for Video Diffusion(用 MLLM 做「语义规划」,DiT 只负责渲染像素)

字节跳动 Bernini 团队的技术报告。核心主张:MLLM 和扩散模型可以用一条「分工线」缝起来——让 MLLM 做语义规划(在它自己的 ViT embedding 空间里预测「目标该长什么样」),让 DiT 只负责把这份语义计划渲染成像素。关键设计有三个:(1) 用 MAR 式的掩码生成把 MLLM 从「理解模型」改造成「语义规划器」,目标 ViT token 训练时随机掩码、推理时从全掩码迭代填充;(2) SA-3D RoPE,给统一序列里每个视觉 segment 一个下标 i,用一个「段相位」旋转向量 ⊙ 到标准 3D RoPE 上,解决多张参考图/源视频「同一 (t,h,w) 坐标身份混淆」的问题;(3) 一条链式增量 guidance,把源视频 / 源图 / 文本 / 语义 embedding 四种条件拆成可独立调节的增量。因为「语义」是接口,planner 和 renderer 可以分开训、只轻量联训。实测在 OpenVE(4.04 vs 次优 3.18)、EditVerse(editing quality 8.02)、OpenS2V(FaceSim 78.20,比次优高 20+ 分)等多个视频编辑/生成榜上做到 SOTA,且 VBench 文生图质量几乎不掉(84.64 vs 底座 Wan2.2 的 84.79)。代码与权重已开源(Qwen2.5-VL-7B 规划器 + Wan2.2-A14B 渲染器)。

video-editing video-generation unified-multimodal +7 more
📄 论文 📅 2026-08-04

Scaling Properties of Text Conditioning in Visual Generation(文本条件的缩放律:结构化提示词 GPG/ED)

ByteDance Seed 的技术报告。核心发现:文生图扩散模型的收敛 loss 不随提示词 token 数变化,而随提示词里"结构化信息量"变化——用白盒似然指标 GPG 和黑盒属性指标 ED 度量,收敛 MSE 对 GPG 近似线性(r=−0.984)、对 ED 服从幂律(∝ED^−0.207,r=−0.971)。据此把提示词做成带语义+几何标注的 JSON(结构化提示词 SP)来提升 diffusability,再用 SFT→cold-start→验证器门控的 OPSD 训练一个 LLM prompter 来提升 promptability,最后配一个 refine–render–judge 智能体循环。系统在 GenEval2 GM 从 33.8→72.5、CoReBench 从 58.9→85.2,超过所有评测的开源模型。

text-to-image diffusion structured-prompt +7 more