paper-reading

论文精读、系统化教程与研究调研报告。

📄 论文 📅 2026-06-22

ARGUS:把「身份」从一张参考图变成扩散同步的动态记忆

主体保持的视频生成(让生成视频里的人「还是同一个人」)长期被「点参考」范式卡住——一张参考图把"这个人是谁"和"他这一帧恰好长这样(姿态/配饰/光照/背景)"纠缠在一起,模型要么照抄噪声细节、要么身份漂移。 ARGUS(快手/北大)提出 SMII:用 MLLM 当"身份导演"挑出多视角身份证据,拼成 3×3 马赛克,**和目标视频走同一条 Flow Matching 加噪路径**,再以"负时间、只读记忆"的方式注入 Wan 的原生 token 空间。配合无配对反事实训练 + TIA + ASLG,在 OpenS2V-Eval 拿到 64.38 总分、71.86 FaceSim 的 SOTA,大偏航/首帧遮挡鲁棒性分别再涨 12.6 / 15.1 分。

subject-preserving-video identity-preservation video-diffusion +6 more
📄 论文 📅 2026-06-18

Osprey:把「掩码」喂进 MLLM 的像素级区域理解

Osprey 把 referring 的输入从「框」升级到「掩码」:用 mask-aware visual extractor 在卷积 CLIP(ConvNeXt-L)的多尺度特征图上做 mask-average-pooling 抽语义、再把掩码本身展平投影成 spatial token,两者替换文本里的 <region> 占位符喂给 LLM。配 724K 掩码-文本指令数据(Osprey-724K),在开放词表分割、部件级分类、区域描述上全面超过 box 级方法和 Ferret。 它是 [[ferret-2023|Ferret]]「自由形状区域输入」的掩码精化版,也是 [[lisa-2023|LISA]] 输出侧掩码的输入侧对偶。

referring-grounding region-input mask-pooling +4 more
📄 论文 📅 2026-06-18

OFTSR:一步超分 + 可调「保真度↔真实感」的整条曲线

OFTSR 用两阶段方案做单步图像超分:先训一个「噪声增广的条件 rectified flow」当教师,再蒸馏出一个一步学生网络——蒸馏的约束是「学生从不同时间 t、s 的预测必须落在教师同一条 PF-ODE 轨迹上」。 关键好处:一步推理时只需调一个超参 t,就能在「高 PSNR / 高保真」和「低 LPIPS / 高真实感」之间连续滑动,把感知-失真权衡的整条曲线塞进单步模型,而过去的单步蒸馏只能锁死在曲线上的一个点。

image-super-resolution rectified-flow flow-matching +5 more
📄 论文 📅 2026-06-18

GGT-100K:用多模态大模型「生成」真实世界修复的 Ground Truth

真实世界图像修复(IR)卡在「没有成对训练数据」:合成退化不像真的,真实成对数据又贵又难采。GGT-100K 的思路是——既然没有干净参考图,那就让生成式多模态大模型(MFM)「画」一张出来当 ground truth。 作者系统评测了 9 个 MFM × 4 种提示策略,发现 Nano-Banana-2 + Gemini 自适应提示在「保真 + 感知 + 无幻觉」上最均衡;再用它配合「指标过滤 → VLM 复检改写 → 人工验收」三级质控,构建出 103,707 对 LQ-HQ 训练对 + 500 对测试集。用它训各类 IR 模型都涨点,对生成式修复模型(FLUX/Qwen-Image-Edit)增益尤其大。

image-restoration real-world-restoration dataset-construction +6 more
📄 论文 📅 2026-06-18

Boogu-Image-0.1:用 1/10 数据做开源「统一生成+编辑」大模型(代码精读)

Boogu-Image-0.1 是一个 Apache-2.0 开源的「统一文生图 + 图像编辑」模型族(Base / Edit / Turbo,均 10B),主打照片级真实感和中英双语文字渲染,号称用比同类开源模型少约一个数量级的训练数据做到接近闭源(GPT-Image-2 / Nano-Banana-Pro)的水平。 架构是 Lumina-Image-2 谱系的 DiT(noise/context/ref 三套 refiner + 双流/单流 MMDiT 块),文本条件来自一个 Qwen3-VL 多模态大模型(既当指令编码器、又当 prompt 改写/推理器);Turbo 变体用 Decoupled DMD 蒸馏到 4 步、无 CFG。 ⚠️ 正式技术报告尚未发布(仓库标注 "Coming Soon"),本文是基于 README + 推理代码的交叉精读,非官方报告解读。

unified-multimodal text-to-image image-editing +7 more
📘 教程 📅 2026-06-14 · 19k 字 · 90–120 分钟

VLM 评测 Benchmark 目录:测什么能力 · 怎么测 · 样题 · 模型如何被打分

业界常见 VLM(视觉语言模型)评测 benchmark 的速查目录,按三层组织:通用能力(MMMU/MMBench/MME/SEED-Bench)、会读图会算(DocVQA/ChartQA/TextVQA/AI2D/MathVista)、幻觉与诚实(POPE/HallusionBench/MMStar)、grounding 定位(RefCOCO/LVIS/ScreenSpot/PixMo-Points)、细节瑕疵(MVTec-AD/VisA/QGround)。每个 benchmark 做成卡片:测什么能力、测试方法、一个样题(题型示意)、模型如何被喂入+生成+提取+打分、用什么指标。§1 先讲清「任何 VLM 被测试的通用流水线」;§8 补一节 2025 发布会评分卡(推理 / agentic / 新多模态:GPQA·HMMT·MMMLU·IFBench·BFCL·BrowseComp·SWE-bench·Terminal-Bench·MMMU-Pro·ERQA·OmniDocBench·Video-MME),并对照「判分从对答案到跑环境」的代际差异。真实评分代码 verbatim 引自 open-compass/VLMEvalKit、openvinotoolkit/anomalib 与 princeton-nlp/SWE-bench。

benchmark vlm evaluation +7 more
📄 论文 📅 2026-06-14

Molmo & PixMo: 把「指」做成一等公民——2.3M 人工 pointing 数据如何点燃开源 VLM 的 grounding 能力

AllenAI + UW (arXiv 2409.17146, 2024/09)。当时最强开源 VLM 几乎都靠蒸馏 GPT-4V 合成数据,等于把闭源模型「偷」进开源。Molmo 反其道:**全程不用任何 VLM 生成训练数据**,核心是一套叫 PixMo 的自采数据集。最大创新是 **PixMo-Points**——让未受训标注员「点」图中物体 (语音描述 + 逐实例点击),收了 **2.3M question-point 对 / 223k 图**。Pointing 在 Molmo 里有三个用途:(1) 按文字指代去**点**物体;(2) **数数靠点**——把点序列当成一条 chain-of-thought,逐个点完再求和,counting 直接屠榜;(3) 把点当**视觉解释**塞进回答。模型把点输出成归一化到 0–100 的纯文本坐标 `<point x="63.5" y="44.5" alt="Mt. Rainier">Mt. Rainier</point>`。架构是标准 ViT + connector + LLM,但有两个干净的工程点:**overlapping multi-crop** 解决裁剪边界丢上下文,**2×2 mean-query attention pooling** 压视觉 token。72B 版本学术 benchmark 第一、人评仅次于 GPT-4o,counting 任务全场最强。本质上,Molmo 是后来 [[locate-anything-2026]] (bbox 作 first-class **输出**) 和 [[thinking-visual-primitives-2026]] (primitives 作 first-class **思维**) 的共同祖先——这两篇 2026 的工作都直接拿 PixMo/Molmo 当 grounding 数据来源。

vlm grounding pointing +5 more
📄 论文 📅 2026-06-14

LISA:用大语言模型做「推理分割」

LISA 给多模态大模型加一个 `<SEG>` token,把这个 token 的最后一层隐藏向量当作 SAM 的「文本提示」直接解码成掩码(embedding-as-mask),端到端用 LoRA 训练。 由此首次让 LLM 能根据「需要推理的隐式指令」输出分割掩码,并开创了一整条 `<SEG>`-token 像素级多模态大模型的研究路线。

reasoning-segmentation embedding-as-mask multimodal-llm +4 more
📄 论文 📅 2026-06-14

Ferret-v2:给「指代+定位」MLLM 装上高分辨率的眼睛

Ferret-v2 是 Ferret 的重大升级,三招破解"固定低分辨率编码器看不清小物体":(1) any-resolution——把大图切成子块各自编码,保住 CLIP 预训练知识;(2) 多粒度双编码器——全局图用 CLIP 抓语义、局部块用 DINOv2 抓细节;(3) 三阶段训练,中间插一个"高分辨率密集对齐"阶段。 它把 [[ferret-2023|Ferret]] 的输入侧 grounding 推到高分辨率密集感知,也是 Ferret-UI 屏幕理解的技术底座。

referring-grounding any-resolution multi-granularity-encoding +4 more