muon-optimizer

提到此概念的论文 / 教程

📄 论文 📅 2026-09-05

LLaDA-Image:用完全开源配方从零训一个 6B 强图像生成器(技术报告精读 + 代码交叉验证)

Inclusion AI(蚂蚁 AGI)的开源技术报告。一句话:从零训一个 6B 单流 DiT,靠"图像-only 预训练/中训练"先学视觉先验、再引入语言对齐,把配对 caption 从最耗算力的阶段里拿掉。 三大反常识选择:① 90%+ 训练样本无 caption(用冻结的扩散语言模型 VLM 从"待生成的那块图"自己抠语义当自条件),② 全程 98% 真图、SFT 里真图 >70%(承认真图早期收敛慢,但换来更高的真实感天花板),③ 用**扩散语言模型(dLLM,LLaDA2.0-Mini)**而非自回归 VLM 当理解后端。 工程上:DiT 里所有 Norm 换成**无参数 RMSNorm** + Muon 优化器稳住长训练;编辑走"绕过 VLM 的参考图双通道"(SigLIP-VQ 语义 + 干净 VAE latent 像素);TwinFlow 用一个共享 DiT 的正/负时间双头做 DMD 蒸馏到 2–4 步。 结果:Qwen-Image-Bench EN/CN 综合 53.53 / 53.38,开源第一(超次优 Z-Image Turbo 1.87 / 0.67);GEdit-Bench 编辑 7.336 / 7.294。权重、推理代码、配方全开。