dataset-construction
提到此概念的论文 / 教程
📄 论文
📅 2026-07-13
DataEvolver:把「被拒样本」变成数据构造策略的梯度
中南大学 + 港科大。文字图生成的数据管线一直是 crawl→filter→freeze:采集、过滤一次、冻结,被拒样本直接丢掉。DataEvolver 把数据构造重写成一个「策略演化」闭环——不训练任何模型参数,只在自然语言策略空间里迭代:Retriever 拉候选、Verifier 打分并归因拒绝原因、Critic 把这一轮的拒绝统计蒸馏成一段自然语言反馈去改写下一轮的检索 query / 生成 prompt / 经验库、Generator 针对覆盖空洞做定向合成。核心主张是「拒绝样本里含有可复用的失败信号」。PixArt-α 0.75M 预算下 OCR-F1 相对最强基线涨 85.3% (TextScenesHQ) / 35.3% (LongTextBench),换到 Show-o2 依然涨。但要看清:绝对 OCR-F1 只有 8.45%——图里连 "Ours" 的文字也仍是乱码,涨的是相对量,任务本身远未解决。
📄 论文
📅 2026-06-18
GGT-100K:用多模态大模型「生成」真实世界修复的 Ground Truth
真实世界图像修复(IR)卡在「没有成对训练数据」:合成退化不像真的,真实成对数据又贵又难采。GGT-100K 的思路是——既然没有干净参考图,那就让生成式多模态大模型(MFM)「画」一张出来当 ground truth。 作者系统评测了 9 个 MFM × 4 种提示策略,发现 Nano-Banana-2 + Gemini 自适应提示在「保真 + 感知 + 无幻觉」上最均衡;再用它配合「指标过滤 → VLM 复检改写 → 人工验收」三级质控,构建出 103,707 对 LQ-HQ 训练对 + 500 对测试集。用它训各类 IR 模型都涨点,对生成式修复模型(FLUX/Qwen-Image-Edit)增益尤其大。