首页/新闻资讯/正文详情

GROUNDHOG总体版

发布时间:2026/9/27 6:23:10 来源:云帆数科 栏目:资讯中心
GROUNDHOG总体版
1. 这篇论文到底想解决什么问题GROUNDHOG 想解决的是让 MLLM 的语言能够精确对应到像素区域以前很多 grounded MLLM比如 Shikra、Kosmos-2主要把语言和bounding box对齐但 box 很粗尤其不适合不规则物体天空、草地这类背景区域物体局部比如“狗的尾巴”多个实例图像中的文字区域。所以 GROUNDHOG 希望做到也就是把语言真正 grounding 到像素级。2. 最核心的思想不是直接生成 mask而是“先分割再选择”这是整篇论文最重要的设计。GROUNDHOG 不采用语言 → 直接生成 mask而是Mask Proposal Language-guided Mask Retrieval首先给图像产生很多候选 mask。然后 MLLM 根据语言判断用户说的这个东西对应哪些候选 mask所以整个 grounding 被拆成先找到可能存在的视觉区域 再判断语言对应哪个区域论文把这两部分称为Localization Recognition这种解耦设计也是 GROUNDHOG 和 LISA 一类方法非常明显的区别。3. 第一步生成尽可能全面的候选 mask既然后面只能从已有 mask 中选择那么前面的 mask proposals 就必须尽量全面。GROUNDHOG 希望候选区域覆盖不同语义粒度完整物体 背景区域 物体部件 文字区域例如dog、grass、dogs tail、sign textproposal 覆盖能力决定后续 grounding 的上限因为如果“狗尾巴”从一开始就没有被切成候选区域那么后面的 MLLM 即使知道用户说的是狗尾巴也没有对应的 mask 可以选择。4. 为什么作者要设计 Mask2Former普通 Mask2Former 主要在 COCO Panoptic 上训练因此对于 COCO 常见类别很好但对于物体部件、视觉文字、开放世界中的其他实体 覆盖能力不足。所以作者构建了Mask2Former。他们整合了 COCO、LVIS、Entity-v2、Pascal、PACO、MHP-v2、TextOCR 等数据并在原本的 200 个 entity queries 基础上增加50个 part queries 50个 text queries专门增强物体部件和文字区域的候选 mask 生成能力。Mask2Former 负责“尽可能把图里的有意义区域都切出来”它还没有负责语言理解。5. 第二步把每个候选 mask 变成 MLLM 能理解的视觉表示现在假设已经得到为方便模型解耦GROUNDHOG 只拿 Mask2Former 产生的binary mask并不直接使用 内部的 feature。而是然后整张图分别经过 CLIP 和 DINOv2得到两套 feature maps。对于某个 mask分别做 mask pooling本质上就是利用 mask只保留这个区域相关的视觉特征再进行聚合。然后分别经过 MLP 映射到 MLLM 的 embedding 空间最后相加最终的就是这个候选区域对应的也就是说一个 mask 对应一个视觉实体 token。6. 这时 MLLM 实际上看到的图像是什么经过上一步之后GROUNDHOG 不再只是把图像理解成一堆普通 patch。而是变成一组视觉实体Image → 一组视觉实体如 第一只狗 第二只狗 草地 某个文字区域这些 Visual Entity Tokens 会进入 MLLM后面语言 grounding 的本质就是当前语言描述到底和哪几个 visual entity tokens 最匹配7. 第三步语言如何变成一个 grounding query假设模型生成I see GRD two dogs /GRD on GRD the beach /GRDGRD和/GRD表示中间这段语言需要和图像区域对应。对于GRD two dogs /GRDMLLM 最后一层分别得到和然后相加得到可以直接把q记成“two dogs” 这个需要被定位的语言短语的表示8. 第四步用 q 去选择前面的候选区域现在已经有两类东西语言q视觉拼接经过 MLP得到一个 score代表这个候选区域Mi 和当前语言 phrase 的匹配度如对于 two dogs可能得到模型就知道对应 two dogs。所以这里 GROUNDHOG 的 grounding本质就是9. 为什么它天然支持多个目标因为 GroundHog 不是只能选一个 mask。对于 two dogs两个 dog mask 都可以获得高分。最后模型把高分 mask 合并所以可以一起组成最终结果。因此它天然支持和甚至本质上都统一成从候选 mask 中选择并组合10.PTRGROUNDHOG 还可以反过来让用户“指区域”GROUNDHOG 不只是也支持例如用户指着某个位置What is thatPTR?这里PTR代表用户提供的 point、box 等空间提示。GROUNDHOG 可以先用 SAM然后同样经过前面的再用这个视觉实体 token 替换PTR。因此 MLLM 就能理解用户现在到底指的是哪一个区域。这使得模型可以进行 Referential Dialogue也就是基于空间指示进行交互。11. M3G2 数据集训练模型把各种任务统一成 grounded dialogue作者构建了它把很多已有 grounding、segmentation、VQA 数据重新整理成统一的视觉对话形式。主要包括四类任务Grounded Image Captioning生成 caption同时把里面的 phrase 和 mask 对应起来。Referring Expression Segmentation给一句语言找到对应 mask。Grounded Visual Question Answering回答问题同时给出支持这个答案的像素区域。Referential Dialogue用户通过 point、box、region 等方式和模型交互。前文和表格描述M3G2 大约2.5M text-image pairs、36 个子任务、来源于 27 个数据集。但结论部分又写成了1.9M training text-image pairs12. 这篇论文真正想证明的不是“某一个分割任务做到最好”作者更强调GROUNDHOG 是一个 generalist grounded MLLM即同一套模型参数可以同时处理、、、而不是一个模型只专门做一个 segmentation benchmark。在这些任务上使用的是同一组模型权重没有针对每个数据集单独 fine-tune。在 RefCOCO、RefCOCO、RefCOCOg、gRefCOCO、PhraseCut、ReasonSeg 等任务上它整体表现也比较强。13. 为什么作者强调“可解释”和“可诊断”这种的解耦还有一个很重要的好处。如果最后 grounding 错了可以检查情况一目标区域根本没有被 proposal model 切出来。那么问题在情况二目标区域其实已经存在但 MLLM 给它的 score 很低。那么问题在如图对应区域其实已经被成功 proposal 出来了但 MLLM 没有正确识别 “KWIK”所以没有把对应 mask 选中。所以相比 LLM hidden state → 直接生成 maskGROUNDHOG 更容易知道错在哪一步14. 实验里还有两个比较重要的结论1、 hallucination在 M3G2 中加入 negative QA问题里问到的目标在图像中不存在正确答案应该否定 数据再加上模型要求语言和视觉区域建立明确对应因此在 POPE 上 object hallucination 明显减少。但不是 pixel grounding 彻底解决了 hallucination更准确的是共同改善了 hallucination。2、消融实验作者发现整体优于单独使用其中一个同时整体效果优于只使用其中一个 boundary token 的 hidden state。15. 论文局限本质上仍然是在“选已有的 mask”它的流程是先 proposal → 再 retrieval因此没有 proposal 出来的区域MLLM 很难凭空生成如用户问red brick spire但 Mask2Former 只 proposal 出整个 tower没有单独 proposal 出 spire那么即使 MLLM 完全理解 “spire”也只能从已有 mask 中选择很难得到精确的尖塔区域。所以它的最大优点和最大局限来自同一个设计把 segmentation 和 language grounding 解耦优点是模块化、可替换、可解释缺点是最终 grounding 的上限受到 mask proposal 的限制如果现在把整篇论文最后压缩成一条完整链路你可以记成图像 → Mask2Former 产生候选 mask → CLIP/DINO 提取每个区域特征 → Visual Entity Tokens然后语言这一边最后q {e1, …,eN} → 给候选区域打分 → 选择并合并 mask所以整篇 GROUNDHOG 最核心的一句话它不是让 MLLM 学会“画 mask”而是让 MLLM 学会“理解并选择已有的像素级视觉实体”。

相关推荐

网站主题说明怎么写性能优化
网站主题说明怎么写性能优化

不会代码?图解步骤教你写好网站主题说明 自己不会代码想做网站,最怕的不是写不出页面,而是不知道该怎么跟外包团队、或者未来的维护者解释清楚“我要什么”。很多新手朋友拿着一个模糊的想法,比如“我要个大气的官网”,结果做出来的东西跟想象差了十万八… · 2026/9/27 6:23:10

冰雪重制版正版官方客户端下载指引,忆往游戏正规安全渠道指南
冰雪重制版正版官方客户端下载指引,忆往游戏正规安全渠道指南

《冰雪重制版》由安徽游昕网络科技有限公司联合忆往游戏平台负责运营,是经过正版授权打造的冰雪传奇怀旧手游。现阶段游戏依托专属官方主站面向全网正式开放,高度复刻冰雪端游原版内容,坚持绿色公平长久的运营模式,还原端游时期经… · 2026/9/27 6:23:04

网站建设基础代码哪家强?老鸟揭秘防拖稿的安全底线
网站建设基础代码哪家强?老鸟揭秘防拖稿的安全底线

网站建设基础代码哪家强?老鸟揭秘防拖稿的安全底线 改个需求建站公司拖一周,这不仅是你的噩梦,更是网站安全隐患爆发的温床。很多老板以为代码写得快就是技术好,结果上线三天就被挂马,这时候再问“网站建设基础代码哪家好”已经晚了。真正的行家,看重的… · 2026/9/27 6:23:04

中国网站建设网页设计避坑指南:备案、证书与选型
中国网站建设网页设计避坑指南:备案、证书与选型

中国网站建设网页设计避坑指南:备案、证书与选型 备案号卡了三个月?别慌,先看你材料齐没齐。 很多老板找外包做 中国网站建设 ,钱付了,站没影,备案却在工信部系统里反复驳回。 这篇 避坑指南… · 2026/9/27 7:05:10

甘家口网站建设避坑指南:3步搞定性能优化
甘家口网站建设避坑指南:3步搞定性能优化

甘家口网站建设避坑指南:3步搞定性能优化 别再用那些套模板的网站了!看着丑不说,加载慢得像蜗牛,客户点两下就跑了。很多老板在甘家口这片儿搞业务,觉得找个现成的模板网站挂上去就行,结果呢?页面打开要等三秒,手机上看字挤成一团,这种体验直接把潜… · 2026/9/27 7:05:10

Laravel Lang 本地化补全指南:以 Akan(ak)语言为例解析缺失翻译键
Laravel Lang 本地化补全指南:以 Akan(ak)语言为例解析缺失翻译键

后端 【免费下载链接】lang List of 128 languages for Laravel Framework, Laravel Jetstream, Laravel Fortify, Laravel Breeze, Laravel Cashier, Laravel Nova and Laravel UI. 项目地址: https://gitcode.com/gh_mirrors/la/lang 点击查看 免费下载 本篇技术… · 2026/9/27 7:04:58

Gophercloud:用 Go 语言驱动 OpenStack 云的 SDK 实战指南(含 LinuxKit 集成实例)
Gophercloud:用 Go 语言驱动 OpenStack 云的 SDK 实战指南(含 LinuxKit 集成实例)

操作系统云原生容器运行时 【免费下载链接】linuxkit A toolkit for building secure, portable and lean operating systems for containers 项目地址: https://gitcode.com/gh_mirrors/li/linuxkit 点击查看 免费下载 本指南以 LinuxKit 仓库中内嵌的 Gopherclou… · 2026/9/27 7:04:58

Bootstrap Icons Basket 图标系列解析:SVG 源码、Codepoint 与前端用法全指南
Bootstrap Icons Basket 图标系列解析:SVG 源码、Codepoint 与前端用法全指南

前端 【免费下载链接】icons Official open source SVG icon library for Bootstrap. 项目地址: https://gitcode.com/gh_mirrors/ic/icons 点击查看 免费下载 本文以 Bootstrap Icons 官方开源图标库中 basket(购物篮)系列图标为切入点&… · 2026/9/27 7:04:52

CodeQL C/C++ 静态缓冲区溢出检测:从 `cpp/static-buffer-overflow` 的精度升级看安全查询工程化
CodeQL C/C++ 静态缓冲区溢出检测:从 `cpp/static-buffer-overflow` 的精度升级看安全查询工程化

静态分析SAST应用安全漏洞扫描代码质量 【免费下载链接】codeql CodeQL: the libraries and queries that power security researchers around the world, as well as code scanning in GitHub Advanced Security 项目地址: https://gitcode.com/gh_mirrors/co/code… · 2026/9/27 7:04:52

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现
MATLAB雷达信号脉冲压缩仿真:LFM线性调频、匹配滤波与距离分辨率实现

简介:这套Matlab仿真工具完整呈现雷达信号脉冲压缩过程,从线性调频(LFM)信号生成、目标回波仿真到匹配滤波压缩处理均有可运行代码支撑,面向电子信息工程、计算机、数学等专业学生,适用于课程设计、期末大作… · 2026/9/27 0:00:01

汕头网站建设制作厂家避坑指南:5大注意事项救急
汕头网站建设制作厂家避坑指南:5大注意事项救急

汕头网站建设制作厂家避坑指南:5大注意事项救急 改个需求建站公司拖一周,这种憋屈事我见得太多了。 很多汕头老板找本地建站团队,签合同前看着方案挺美,一上线就变脸。 今天不聊虚的,直接拆解找 汕头网站建设制作厂家 时的5个核心 注意事项… · 2026/9/27 0:00:01

多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习
多模态虚假新闻检测实战:BERT+ResNet双塔与对比学习

简介:基于PyTorch的多模态虚假新闻检测项目完整代码包,面向自然语言处理与计算机视觉交叉方向的开发者、科研人员及毕业设计选题者,解决社交媒体中文本与图像联合识别虚假新闻的问题。系统以BERT预训练模型提取文本语义特征,以Res… · 2026/9/27 0:00:01

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码