首页/新闻资讯/正文详情

LISA

发布时间:2026/9/25 18:08:54 来源:云帆数科 栏目:资讯中心
LISA
1. 提出的新任务Reasoning Segmentation和传统 Referring Segmentation 很像但最大的区别在于 query。普通 referring segmentation用户已经明确告诉模型目标“the trash can”Reasoning Segmentation模型需要自己推理“something that the garbage should be put into”garbage should be put into → trash can所以这个任务实际上要求两个能力理解隐式指令 产生像素级 mask2. 为什么普通多模态 LLM 不够像 LLaVA 这样的模型可以image text → text它能回答“The object is an orange.”LLM 本身并不擅长直接输出 segmentation mask 这种 dense prediction。因此论文的问题变成怎么把 LLM 的语义/推理能力接到 segmentation 上3. LISA 最核心的设计SEGtoken作者在 LLM 的词表里加入一个特殊 tokenSEG比如模型接收到What is the food with the most Vitamin C? Please output segmentation mask.LLM 可能生成It isSEG.真正关键的不是SEG本身而是它在 LLM 最后一层对应的 hidden embedding把这个 embedding 取出来再经过一个 MLP这个可以理解成LLM 对“当前到底要分割什么”的内部语义表示。与此同时图像还会经过一个视觉 backbone得到 dense visual features。最后 decoder 同时接收和生成 mask也就是LLM负责 What Vision Backbone负责视觉信息 Decoder负责 Where这就是论文所谓的Embedding-as-Mask。4. 整个网络可以理解成两条支路第一条推理支路负责“用户究竟想分割什么”第二条视觉支路负责“图像中各个位置、边界、局部特征是什么”然后二者汇合所以本质上并不是让 LLM 自己画 mask而是让 LLM 产生一个指导 segmentation 的语义 query5. 为什么不让 LLM 直接输出 mask前面的 VisionLLM 有一种方案坐标序列然后让 LLM 自己生成这样 mask 就被转换成 token 序列了。但问题是polygon 序列可能很长精细边界很难用有限坐标表示LLM 不擅长精确预测大量空间坐标训练代价很高。LISA 的思路更简单LLM 不需要学“怎么画边界”。LLM 只要告诉 segmentation decoder“要找的是哪个目标”让专业的视觉 decoder 负责精细 mask。6. 训练数据怎么构造作者主要用了三类数据。第一类是Semantic Segmentation例如 ADE20K、COCO-Stuff 等。原始数据可能是Image pixel\ label作者改造成Can you segment the table?回答It isSEG.然后用 table 的真实 mask 做监督。第二类是Referring Segmentation例如 refCOCO、refCOCO、refCOCOg。比如原来的描述“the lady with the blue shirt”转换为Can you segment the lady with the blue shirt?第三类是VQA 数据。VQA 数据本身没有 mask但保留下来主要是为了避免模型在训练 segmentation 后丢失原有的对话能力、图像理解能力、文本生成能力论文的 Figure 4 就是在展示这三类数据的统一训练形式。7. Loss 怎么设计模型有两种输出一种是语言输出所以有即普通 autoregressive cross-entropy。另一种是 mask所以有用最后总 loss因此训练时既保证模型还会说话又保证SEGembedding 能真正用于生成 mask。8. 很有意思的一点最开始甚至没有 Reasoning Segmentation 训练数据这是这篇论文比较重要的发现。模型一开始只用SemanticSeg ReferringSeg VQA 这些数据训练。里面其实没有“维生素 C 最高的食物”这种真正的 reasoning segmentation 样本。但模型仍然能够 zero-shot 做 ReasonSeg。作者想说明LLM 预训练阶段已经具备一定 reasoning / world knowledge 而他们真正要学的是怎么把这种能力连接到 pixel mask。后来再加入只有239 条 ReasonSeg 训练数据性能还能明显进一步提升。9. 还构建了 ReasonSeg benchmark因为之前没有专门评估 reasoning segmentation 的 benchmark所以作者构建了ReasonSeg共1218 个 image-instruction-mask 样本。其中train239、val200、test779query 包含 short query 和 long query两者都要求一定的常识或推理。10. 实验结果说明了什么传统模型OVSeg26.1GRES21.3X-DecoderSEEM24.3Grounded-SAM在 ReasonSeg 上表现都比较差。而 LISA-7B 已经能达到36.8换成更强的 LLaVA1.5 48.7再换 13B 并加入 reasoning fine-tuning61.3 提升非常明显尤其是在 long query 上更明显。7B → 13B这说明这个任务的瓶颈很大程度上不是“mask画不准”而是“问题有没有理解对”所以更强的语言理解 / reasoning 模型会直接提高 segmentation 表现。11. 和“两阶段方法”相比为什么更好一个很自然的方法是也就是说LLM 先输出文字答案然后 segmentation 模型根据文字找目标。论文也做了这个 baselineLLaVA1.5 OVSeg但效果明显不如 LISA。作者认为主要有两个原因第一两阶段方法是完全分开的没有 end-to-end optimization。第二中间只通过文本“orange” 来传递信息会丢掉很多 LLM 内部已经形成的信息。LISA 直接用hidden embedding里面可能保留了更丰富的图像、语言和上下文信息。12. 这篇论文最值得记住的是什么我觉得不是某一个网络细节而是这个思路以前 segmentation 研究更多关心怎么把物体边界分得更准而 LISA 开始关心模型到底有没有理解“我要分割什么”它实际上把问题从pixel perception推进到了reasoning → grounding → pixels整篇论文可以压缩成一句话用 MLLM 理解和推理目标用 segmentation model 把目标落到像素上而SEGhidden embedding就是连接这两个世界的接口。它不是单纯设计了一个更好的 segmentation backbone而是在解决“高层语义/推理能力如何 grounding 到 dense prediction”这个问题。

相关推荐

Opus音频编码器:为互联网而生的实时音质解决方案
Opus音频编码器:为互联网而生的实时音质解决方案

1. 项目概述:一场音频编码技术的公众认知刷新事件“Opus 登顶榜单引质疑”——这八个字背后,不是某款App突然爆火的营销套路,也不是某个网红翻唱引发的流量争议,而是一次底层音频技术标准在大众视野中罕见的高光时刻。Opus&#x… · 2026/9/25 18:08:47

Atlas 300V 24G实战:YOLOv5模型ONNX转OM部署全流程
Atlas 300V 24G实战:YOLOv5模型ONNX转OM部署全流程

最近“Atlas 300V 24G 是运算加速卡吗”这个问题被问得特别多,我几乎每周都要在群里看到一次。答案很明确:是,但它不是大家印象中能直接跑CUDA、甚至拿来玩渲染的通用加速卡,而是华为昇腾生态里一张面向视频解析和AI推理的专用加速… · 2026/9/25 18:08:47

OpenClaw 常用 Skills 全指南:安装、介绍、使用方法与排障(TaoToken 配置篇)
OpenClaw 常用 Skills 全指南:安装、介绍、使用方法与排障(TaoToken 配置篇)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 18:08:47

是时候去问CTO了,咱的AI产品要不要封装MCP?TaoToken统一Key接入前先看这份config.toml骨架
是时候去问CTO了,咱的AI产品要不要封装MCP?TaoToken统一Key接入前先看这份config.toml骨架

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:13:27

UE5多人FPS网络同步实战:客户端预测与服务器回滚机制详解
UE5多人FPS网络同步实战:客户端预测与服务器回滚机制详解

1. 多人FPS网络同步的整体设计思路1.1 为什么FPS游戏的网络同步这么难做UE5的多人FPS网络同步,说白了就是让几个甚至几十个玩家在各自的屏幕上看到大致一样的战场画面,同时保证每个人的操作都能被服务器认可并广播给其他人。这件事听起来简单&#xff0c… · 2026/9/26 0:13:14

TEN Framework 中的 FFmpeg Demuxer 扩展:媒体流解复用与音视频帧输出全解析
TEN Framework 中的 FFmpeg Demuxer 扩展:媒体流解复用与音视频帧输出全解析

人工智能AI Agent多模态语音AI 应用 【免费下载链接】ten-framework Open-source framework for conversational voice AI agents 项目地址: https://gitcode.com/TEN-framework/ten-framework 点击查看 免费下载 导读 ffmpeg_demuxer 是 TEN Framework 提供的一个… · 2026/9/26 0:12:23

上下文为何越聊越长?CANNBot-Sentry上下文增长曲线与/compact标记可视化完整指南
上下文为何越聊越长?CANNBot-Sentry上下文增长曲线与/compact标记可视化完整指南

上下文为何越聊越长?CANNBot-Sentry上下文增长曲线与/compact标记可视化完整指南 【免费下载链接】cannbot-sentry CANN 生态中面向 Agent 工作流的“哨兵”:观测 审计 评测三位一体的质量基础设施 项目地址: https://gitcode.com/cann/cannbot-sent… · 2026/9/26 0:12:23

VSCode 插件 TONGYILingma 配置 TaoToken:settings.json 骨架与连通性验证
VSCode 插件 TONGYILingma 配置 TaoToken:settings.json 骨架与连通性验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:12:03

【干货收藏】AI大模型性能评估指南:用TaoToken统一Key实测延迟、吞吐量与成本
【干货收藏】AI大模型性能评估指南:用TaoToken统一Key实测延迟、吞吐量与成本

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:12:03

数据库课后习题答案别硬背:当测试用例集刷,效率翻倍
数据库课后习题答案别硬背:当测试用例集刷,效率翻倍

简介:万常选版《数据库原理与设计》课后习题答案资源,覆盖第2至6章及第9章,适合正在学习关系模型、数据库建模、关系数据理论与模式求精的本科生、自学者作为复习与自测材料。压缩包共7个文件,含3个doc参考答案、2个sql示例脚本、… · 2026/9/26 0:00:21

OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置
OpenClaw 替代品?Hermes Agent 踩坑实录:macOS 飞书接入 TaoToken 配置

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/26 0:00:40

向下兼容与向上兼容:接口设计中的兼容性策略与工程实践
向下兼容与向上兼容:接口设计中的兼容性策略与工程实践

一次版本升级事故,是很多团队绕不过去的坎。线上环境里,服务端明明已经上线了新版接口,老的移动端还在照着旧文档传参数。请求一到网关,校验直接拒绝,用户操作失败,客服群炸了锅,开发群里开始互… · 2026/9/26 0:00:46

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码