fourier-transform
提到此概念的论文 / 教程
📄 论文
📅 2026-09-21
f-loss:给像素空间流匹配换一副「频域眼镜」——先学频率、再抠像素
自然图像功率谱按 1/f² 衰减:能量几乎全堆在低频,但人眼在乎的纹理/边缘藏在稀疏的高频。像素空间的 v-loss 对所有空间误差一视同仁 → 低频主导梯度 → 模型迟迟学不会细节。作者把这诊断成「目标函数层面的频谱失衡」。 解法两件套:① **f-loss(Focal Log-Frequency Loss)**——在 2D 傅里叶谱上做「对数压缩 log(1+e) + 逐样本焦点归一化 e/max(e) + 保留 1/(1-t)² 时间步权重」,让每个频率倍频程拿到等量学习信号;② **fv-loss 两段式调度**——训练早期用 f-loss 把所有频率快速拉齐,再用 sigmoid 权重平滑切回标准 v-loss 做像素级相位精修。 纯 drop-in、零架构改动。跨 B/L/XL 三档、256²/512² 两分辨率:收敛最高快 40%(1.13×–1.57×),FID/FDD/IS 全面改善;JiT-XL/16 在 750k 步做到 FID 2.13(v-loss 2.21),叠 REPA 后 750k 的 1.87 反超 DeCo 1.6M 的 1.90,叠感知损失后 500k 追平 PixelGen 800k 的 1.83 且 IS 更高(323.4 vs 293.6)。代码与模型承诺开源(尚未放出)。