论文

共 59 篇论文精读。

📄 论文 📅 2026-06-18

Boogu-Image-0.1:用 1/10 数据做开源「统一生成+编辑」大模型(代码精读)

Boogu-Image-0.1 是一个 Apache-2.0 开源的「统一文生图 + 图像编辑」模型族(Base / Edit / Turbo,均 10B),主打照片级真实感和中英双语文字渲染,号称用比同类开源模型少约一个数量级的训练数据做到接近闭源(GPT-Image-2 / Nano-Banana-Pro)的水平。 架构是 Lumina-Image-2 谱系的 DiT(noise/context/ref 三套 refiner + 双流/单流 MMDiT 块),文本条件来自一个 Qwen3-VL 多模态大模型(既当指令编码器、又当 prompt 改写/推理器);Turbo 变体用 Decoupled DMD 蒸馏到 4 步、无 CFG。 ⚠️ 正式技术报告尚未发布(仓库标注 "Coming Soon"),本文是基于 README + 推理代码的交叉精读,非官方报告解读。

unified-multimodal text-to-image image-editing +7 more
📄 论文 📅 2026-06-14

Molmo & PixMo: 把「指」做成一等公民——2.3M 人工 pointing 数据如何点燃开源 VLM 的 grounding 能力

AllenAI + UW (arXiv 2409.17146, 2024/09)。当时最强开源 VLM 几乎都靠蒸馏 GPT-4V 合成数据,等于把闭源模型「偷」进开源。Molmo 反其道:**全程不用任何 VLM 生成训练数据**,核心是一套叫 PixMo 的自采数据集。最大创新是 **PixMo-Points**——让未受训标注员「点」图中物体 (语音描述 + 逐实例点击),收了 **2.3M question-point 对 / 223k 图**。Pointing 在 Molmo 里有三个用途:(1) 按文字指代去**点**物体;(2) **数数靠点**——把点序列当成一条 chain-of-thought,逐个点完再求和,counting 直接屠榜;(3) 把点当**视觉解释**塞进回答。模型把点输出成归一化到 0–100 的纯文本坐标 `<point x="63.5" y="44.5" alt="Mt. Rainier">Mt. Rainier</point>`。架构是标准 ViT + connector + LLM,但有两个干净的工程点:**overlapping multi-crop** 解决裁剪边界丢上下文,**2×2 mean-query attention pooling** 压视觉 token。72B 版本学术 benchmark 第一、人评仅次于 GPT-4o,counting 任务全场最强。本质上,Molmo 是后来 [[locate-anything-2026]] (bbox 作 first-class **输出**) 和 [[thinking-visual-primitives-2026]] (primitives 作 first-class **思维**) 的共同祖先——这两篇 2026 的工作都直接拿 PixMo/Molmo 当 grounding 数据来源。

vlm grounding pointing +5 more
📄 论文 📅 2026-06-14

LISA:用大语言模型做「推理分割」

LISA 给多模态大模型加一个 `<SEG>` token,把这个 token 的最后一层隐藏向量当作 SAM 的「文本提示」直接解码成掩码(embedding-as-mask),端到端用 LoRA 训练。 由此首次让 LLM 能根据「需要推理的隐式指令」输出分割掩码,并开创了一整条 `<SEG>`-token 像素级多模态大模型的研究路线。

reasoning-segmentation embedding-as-mask multimodal-llm +4 more
📄 论文 📅 2026-06-14

Ferret-v2:给「指代+定位」MLLM 装上高分辨率的眼睛

Ferret-v2 是 Ferret 的重大升级,三招破解"固定低分辨率编码器看不清小物体":(1) any-resolution——把大图切成子块各自编码,保住 CLIP 预训练知识;(2) 多粒度双编码器——全局图用 CLIP 抓语义、局部块用 DINOv2 抓细节;(3) 三阶段训练,中间插一个"高分辨率密集对齐"阶段。 它把 [[ferret-2023|Ferret]] 的输入侧 grounding 推到高分辨率密集感知,也是 Ferret-UI 屏幕理解的技术底座。

referring-grounding any-resolution multi-granularity-encoding +4 more
📄 论文 📅 2026-06-14

Ferret:任意形状、任意粒度的「指代 + 定位」多模态大模型

Ferret 用「混合区域表示」(离散坐标 + 连续特征)把用户圈的任意形状区域(点/框/涂鸦/自由形状)编码进 LLM 输入,同时在输出端把名词后接坐标实现定位——一个模型统一了 referring(区域→语义)和 grounding(语义→区域)。 它是 LISA「文本→掩码」的**输入侧对偶**:LISA 解决"想哪打哪"的输出,Ferret 解决"圈哪问哪"的输入。

referring-grounding region-input hybrid-region-representation +4 more
📄 论文 📅 2026-06-09

Q-Ground: Image Quality Grounding with Large Multi-modality Models

ACM MM 2024 Oral(南洋理工 + 商汤)。第一个做"细粒度画质 grounding"的工作:不再只给一张图打一个总分/一段评语,而是把**画质缺陷的具体位置**分割出来。核心贡献是 **QGround-100K 数据集** —— 10 万条 (图像, 画质描述文本, 失真分割掩码) 三元组,建在 Q-Instruct/Q-Pathway 之上,锁定 5 种失真(模糊/过曝/噪声/抖动/低光),掩码用固定颜色编码。制作走**双轨标注**:① 15 名人工标注员(SAM 预分割 + 参考画质文本手调边界);② GPT4V 自动标注(Set-of-Mark:SAM 分割 + 编号 → GPT4V 给每个区域判失真类型)。人工 17,963 图 / 52,924 标注 + GPT4V 50,599 图。配套 Q-Ground 模型(PixelLM 式 [SEG] token + 多尺度投影 MSFA)。

iqa image-quality grounding +5 more
📄 论文 📅 2026-06-06

Efficiently Reconstructing Dynamic Scenes One D4RT at a Time

CVPR 2026 最佳论文 (Google DeepMind)。把"重建动态 4D 场景"这件事从"逐帧稠密解码"改成"按需点查询":一个 encoder 把视频压成固定的 Global Scene Representation,一个轻量 cross-attention decoder 接收查询 q=(u,v,t_src,t_tgt,t_cam) 独立吐出该点的 3D 坐标。改一改查询就能统一拿到深度、点云、点轨迹、相机内外参 —— 速度比 VGGT 快 9×、比 MegaSaM 快 100×,且是唯一能稠密重建动态像素的方法。

3d-reconstruction 4d-reconstruction point-tracking +5 more
📄 论文 📅 2026-06-04

Thinking with Visual Primitives: 让 MLLM 在思考时 "用手指点"——points/bboxes 作为最小思维单元穿插进 CoT 推理链

DeepSeek + 北大 + 清华 (技术报告 2026/04/30 release,代码 + 权重未公开)。MLLM 现在解决了 *Perception Gap* (高清 cropping / thinking-with-images),但还堵在 **Reference Gap** ——自然语言对密集空间布局指代太模糊,导致计数 / 拓扑推理时 "逻辑塌方"。提出 **Thinking with Visual Primitives**: 把 points / bboxes 当**思维原子**直接 interleave 进推理 trajectory,模型一边推理一边 "点",把抽象语言概念锚到具体物理坐标。架构: DeepSeek-V4-Flash (284B MoE / 13B active) + DeepSeek-ViT。**视觉 token 压缩**: ViT 输出 3×3 spatial pooling (×9 压缩) + LLM 的 CSA (Compressed Sparse Attention) 把每 4 个 visual token 的 KV cache 压成 1 entry → 756×756 输入 (571,536 pixel) 最终 KV cache 仅 **81 entries**,**总压缩比 7,056×**。Pretraining 用 trillion+ tokens, 自建 40M 高质量 box-grounding 数据 (从 HF / 网络爬,两阶段 LLM 审核过滤)。Post-training 4 阶段: Specialized SFT → Specialized RL (GRPO 配 Format/Quality/Accuracy 3 个 RM) → Unified RFT → On-Policy Distillation。Cold-start 4 个任务: counting (10k), spatial reasoning (9k), maze navigation (460k), path tracing (125k)。结果: 选定子集 benchmark 上跟 **GPT-5.4 / Claude-Sonnet-4.6 / Gemini-3-Flash** 持平或反超,而 token efficiency 是这些 frontier model 的 1/8 到 1/10。本质是把 [[locate-anything-2026]] 的"bbox 是 first-class output" 进一步推进成"bbox 是 first-class **thought**"。

mllm reasoning chain-of-thought +6 more
📄 论文 📅 2026-06-04

LocateAnything: 把 VLM 的 bbox 输出当作不可分割原子,一次 forward 出 4 个坐标,12.7 BPS 跑赢 NTP 5×

NVIDIA + HK PolyU + Princeton + Nanjing + UIUC (arXiv 2026/05/27)。指出主流 VLM (Qwen3-VL / DeepSeek-VL2 / Rex-Omni) 输出 bbox 都把 4 个坐标当 token 序列 (x1, y1, x2, y2) 串行 next-token-predict——这是几何上耦合的 4-tuple 被人为序列化,既损精度又限吞吐。**Parallel Box Decoding (PBD)**: 把整个 bbox (4 坐标 + 2 个 <box>/</box> 结构 token = 长度 L=6 的 atomic block) 一次性并行预测,而非逐 token 输出。block 内 bidirectional attention 让 4 个坐标互相看到,block 间 causal attention 保持自回归语义。**关键 trick**: 训练时把同一 GT 同时塞两种格式 (`x_ntp` + `x_blk`) 让模型 joint 学 NTP + MTP,**通过 attention mask 让两条 stream 互不串话**(都看 shared context 但 MTP block 看不到 NTP token 反之亦然)。推理三模式: Fast (纯 MTP),Slow (纯 NTP),Hybrid (默认 MTP,format 异常或 top-1 prob < 0.7 时回退 NTP 重 decode 该 block)。LocateAnything-Data 138M queries / 12M images / 785M bbox 涵盖 detection + UI + referring + OCR + layout + pointing 6 大任务。结果: LocateAnything-3B 在 LVIS F1@0.95 上 31.1 (vs Qwen3-VL-8B 的 20.2 / Rex-Omni-3B 的 20.7),Throughput 12.7 BPS = **比 Qwen3-VL-8B 快 12.7×、比 Rex-Omni 快 2.5×**。

detection grounding vlm +3 more