visual-prompt

提到此概念的论文 / 教程

📄 论文 📅 2026-09-24

FlowInOne:把多模态生成统一成「图进图出」的流匹配

FlowInOne 抛弃「文本编码器条件化视觉」的主流范式,把文本、布局、编辑指令统统渲染进一张输入画布(visual prompt),让单个流匹配模型在一个共享视觉潜空间里学从「指令图」到「目标图」的确定性传输——真正的 image-in / image-out。配套开源 VisPrompt-5M(500 万视觉提示对,含物理力学/轨迹)和 VP-Bench。核心机制是 Dual-Path Spatially-Adaptive Modulation:纯生成时旁路结构分支、编辑时用交叉注意力+token 级 Sigmoid 门控注入源图结构。1.2B 模型在开源阵营 SOTA,部分维度逼近 Nano Banana。

📄 论文 📅 2026-06-14

Ferret:任意形状、任意粒度的「指代 + 定位」多模态大模型

Ferret 用「混合区域表示」(离散坐标 + 连续特征)把用户圈的任意形状区域(点/框/涂鸦/自由形状)编码进 LLM 输入,同时在输出端把名词后接坐标实现定位——一个模型统一了 referring(区域→语义)和 grounding(语义→区域)。 它是 LISA「文本→掩码」的**输入侧对偶**:LISA 解决"想哪打哪"的输出,Ferret 解决"圈哪问哪"的输入。