rmsnorm
提到此概念的论文 / 教程
LLaDA-Image:用完全开源配方从零训一个 6B 强图像生成器(技术报告精读 + 代码交叉验证)
Inclusion AI(蚂蚁 AGI)的开源技术报告。一句话:从零训一个 6B 单流 DiT,靠"图像-only 预训练/中训练"先学视觉先验、再引入语言对齐,把配对 caption 从最耗算力的阶段里拿掉。 三大反常识选择:① 90%+ 训练样本无 caption(用冻结的扩散语言模型 VLM 从"待生成的那块图"自己抠语义当自条件),② 全程 98% 真图、SFT 里真图 >70%(承认真图早期收敛慢,但换来更高的真实感天花板),③ 用**扩散语言模型(dLLM,LLaDA2.0-Mini)**而非自回归 VLM 当理解后端。 工程上:DiT 里所有 Norm 换成**无参数 RMSNorm** + Muon 优化器稳住长训练;编辑走"绕过 VLM 的参考图双通道"(SigLIP-VQ 语义 + 干净 VAE latent 像素);TwinFlow 用一个共享 DiT 的正/负时间双头做 DMD 蒸馏到 2–4 步。 结果:Qwen-Image-Bench EN/CN 综合 53.53 / 53.38,开源第一(超次优 Z-Image Turbo 1.87 / 0.67);GEdit-Bench 编辑 7.336 / 7.294。权重、推理代码、配方全开。
Krea 2 技术报告精读:一个「为创意探索而生」的开源文生图基础模型,从数据、架构到万卡基建全栈拆解
Krea 2 是 Krea 自研的开源文生图(T2I)基础模型族,定位不是「给你一张最稳的默认图」,而是「让你在广阔的美学空间里探索」——刻意保留风格多样性、并配套 prompt 扩写器 + 风格参考系统两套可控性工具。开源权重 + 推理代码,permissive license,号称登上 Artificial Analysis T2I 榜前 10、独立实验室中第 2。 这是一份「工程配方 + 系统基建」型技术报告(58 分钟阅读),重点不在新公式,而在**全栈决策**:数据策展原则(多样性优先、零 AI 生成图)、从 LLM 生态搬过来的极简 DiT(GQA + 门控 sigmoid 注意力 + SwiGLU + Qwen3-VL + 轻量时间步调制 + 多层特征聚合)、五阶段训练流水线(预训练→midtraining→SFT→偏好优化→RL→时间步蒸馏),以及从零自建的 Kubernetes 训练基建(Kueue 调度、Virtual Kubelet 外溢推理、Weka 文件系统、PostgreSQL「krablet」数据仓库 + FOR UPDATE SKIP LOCKED 队列)。 本文按精读骨架交叉拆解,并补全报告用散文描述、但背后是标准公式的几处方法(rectified-flow v 参数化、DPO/STPO、多奖励 GRPO、DMD→TDM)。