首页/新闻资讯/正文详情

SAM2

发布时间:2026/9/25 18:32:52 来源:云帆数科 栏目:资讯中心
SAM2
最重要的不是把 memory bank、object pointer、temporal position encoding 全部一次吃透而是先建立两个核心认知SAM 2 把 SAM 的 promptable segmentation 从 image 扩展到 video以及原来 SAM 学到的 segmentation prior 仍然被保留只是前面多了一层时序条件化1. promptable segmentation 怎么从 image 扩展到 videoSAM 里的任务是也就是在一张图上给 point / box / mask输出这一张图里的目标 mask。SAM 2 把这个任务定义成Promptable Visual Segmentation, PVS。输入变成Video Prompt on any frame输出不再只是单张 mask而是整个视频里的masklet同一个目标在一段视频中跨多个帧的连续 mask 序列也就是目标物体在一系列视频帧上的时空 segmentation。论文明确说prompt 可以放在视频任意帧上模型要预测目标 segment 的 spatio-temporal mask也就是 masklet。最核心的扩展变成2. Prompt 本身其实没有发生根本变化SAM 2 的 prompt encoder 和 SAM 是相同的。它仍然支持 positive / negative pointboxmask。Sparse prompts 仍然是position encoding learned prompt-type embeddingmask 仍然通过 convolution 编码然后加到 frame embedding 上。也就是说从接口上看它真正扩展的是一个 prompt 的影响范围从当前 image 扩展到了整个 temporal sequence。3. SAM 2 的任务层面变化SAM 中一个 point 只需要回答“这一张图中我点的是哪个 region”SAM 2 中一个 point 要回答“我在 frame 1 点的是这个 object那么这个 object 在 frame 2、frame 3……分别在哪里”所以spatial prompting 扩展成了 spatio-temporal prompting更进一步SAM 2 允许在后面的任意 frame 继续加 prompt 修正。如frame 1: click先确定 object。然后 SAM 2 自动传播假设 frame 3 出错了可以frame 3: another click这个修正不是只改 frame 3而是可以继续影响整个 masklet。Figure 2 展示的就是这个过程第一次 prompt 在 frame 1目标传播到后续帧如果中间丢失目标只需在后续帧再加一个 correction click模型就能利用已有上下文恢复目标。这就是 PVS 比传统 image promptable segmentation 多出来的东西。4. 为什么这比“SAM tracker”更自然传统的一个办法是SAM video tracker视频里的目标跟踪器流程可能是问题是这两个模块是分开的。如果 tracker 在 frame 10 跑偏了你通常得再用 SAM 把 frame 10 重新分出来然后 tracker 从 frame 10 重新开始。SAM 2 则是统一模型prompting segmentation temporal propagation 都在同一套表示中完成。论文也专门指出传统 “SAM tracker” 的问题之一是一旦出错很难利用之前的交互上下文进行自然 refinement而 SAM 2 可以直接基于历史 memory 修正。所以可以把任务升级理解成single-frame interactive segmentation → interactive spatio-temporal segmentation5. segmentation prior 是怎么被复用的这个其实和 CONVERSEG 非常相关。segmentation prior可以理解成SAM 已通过大规模segmentation数据学到了非常强的“什么东西构成一个合理mask”的先验。包括object boundarypart / whole structureforeground continuityshapelocal textureregion groupingpoint / box / mask 到 pixel region 的映射关系。SAM 已经很擅长prompt-conditioned spatial segmentationSAM 2保留原来的 prompt-to-mask decoder 范式 给当前帧特征加入 temporal memory context6. SAM 2 的整体结构可以先压缩成这样先别看复杂 memory 细节只看主干是当前 frame 的视觉表示然后 SAM 2 多加一步得到一个memory-conditioned frame embedding最后论文的描述非常清楚SAM 2 spatially behaves similarly to SAM轻量的 promptable mask decoder 接收 frame embedding 和 prompts然后输出当前 frame mask。区别在于这个 frame embedding 不再直接来自 image encoder而是先被 memory 条件化。7. 所以 segmentation prior 到底藏在哪里主要有两处。第一处是SAM-style prompt encoder第二处更重要SAM-style mask decoderSAM 2 论文明确说decoder design largely follows SAM。依然使用two-way transformer 去更新prompt embeddingsframe embeddings。而且 ambiguous prompt 时依旧预测 multiple masks。所以 SAM 2 的 spatial segmentation 核心没有变成一个纯 tracker。它仍然在做只是现在 visual features 已经是temporal-context-aware 的了。8. 可以把它理解成“先加入时间信息再调用 SAM 的分割能力”SAMSAM 2所以Memory Attention 不负责真正生成 mask它主要负责“当前 frame 里面哪些视觉信息与我们之前追踪的那个 object 有关”然后真正的 pixel-level segmentation仍然交给 SAM-like mask decoder。CONVERSEG 也是前面模块负责提供更高级的语义条件后面的 SAM2 decoder 负责把这个条件落到 pixels。9. 这就是所谓 reuse segmentation prior 的核心你可以用一个非常简化的类比。SAM 已经学会“给我一个好的 condition我很会画 mask。”SAM 2 不重新学习“怎么画 mask”。它重点学习的是“视频中当前 frame 的 condition 应该如何结合之前 frame 的信息。”所以Spatial segmentation knowledge 是被继承的新增的是Temporal object correspondence也就是同一个 object 在不同 frame 中如何持续对应10. Image Encoder 也发生了变化但思想没变SAM 用的是 ViT image encoder。SAM 2 换成了也是 MAE-pretrained。Hiera 是 hierarchical image encoder可以提供 multi-scale features。它为每个 frame 先提供unconditioned tokens。“unconditioned”纯当前 frame 的视觉信息还不知道用户要哪个 object之前 object 长什么样object 上一帧在哪里。之后经过 Memory Attention才变成也就是 object-conditioned / memory-conditioned frame feature。11. Memory Attention 暂时只需要理解成“检索之前目标信息”只需要记比如 frame 1 里用户点了 dog那么 memory 里会保存一些与这个 dog 有关的信息。到 frame 2本来只是frame 2 中所有东西的视觉表示。经过 memory attention相当于模型被提醒“我们现在关心的是之前那个 dog。”然后就可以继续分那个 dog。Memory attention 的作用正是让当前 frame feature 去 cross-attend 之前的 frame memory 和 object information。12. 为什么说这就是“reuse segmentation prior”而不是重新做 video segmentation因为 SAM 2 的思路不是全新 video segmentation network而是它隐含一个假设视频 segmentation 的难点不一定是重新学习“什么是 mask”更主要的是如何让已有强 spatial segmentation 能力在时间轴上保持 object identity。换句话说SAM 已经解决了where are the pixels of this object?SAM 2 新增解决which object in the current frame corresponds to the previous target?然后再调用已有 segmentation 能力。13. 为什么 mask decoder 仍然保留 two-way transformer因为即使到了 video当前 frame 里还是要解决的对齐问题。所以 SAM 2 仍然需要同时进行双向交互。只不过现在frame features 已经经过 memory attention。所以可以写成然后14. SAM 2 保留了 SAM 对 ambiguity 的处理SAM中一个 point 可能对应whole object / part / subpart所以输出多个 masks。SAM 2 里还是一样而且 video 中 ambiguity 更复杂因为 ambiguity 可以跨帧持续存在。因此 SAM 2 依旧 predict multiple masks如果用户后面没有额外 prompt 来消除 ambiguity就传播 predicted IoU 最高的那个。15. 但 video 多了一个 SAM 没有的问题目标可能消失SAM 中如果给了 positive point一定存在一个可以分割的东西但视频中 frame 1 有这个 objectframe 10 可能被完全遮挡所以 SAM 2 新增了一个 headobject present? 判断当前 frame 是否存在目标。这个细节其实很能体现不是单纯“多跑几帧”而是任务定义本身发生了变化。16. 现在再看 segmentation prior 的复用会更清楚可以把 SAM 2 拆成两层能力第一层Temporal reasoning / correspondence负责核心模块Memory Attention第二层Spatial segmentation负责核心模块Prompt Encoder Two-Way Mask Decoder这一层大量继承 SAM。所以SAM 2 temporal association SAM-style spatial decoding虽然这是一个简化总结但对你现在理解架构非常有效。17. 这和 CONVERSEG-NET 的关系其实更直接了之前看 CONVERSEG-NET 时重点是因为 SAM2 已经提供了非常强的segmentation prior所以作者直接复用 SAM2 decoder也就是给定一个合适的高层 condition怎么把它稳定地落到 pixel mask。CONVERSEG 不需要重新学习boundarymask topologylocal detailregion coherence。它主要需要解决抽象语言语义 → SAM2 能理解的 conditioning representation然后SAM2 decoder 负责 condition → pixels18. 现在读 SAM 2建议只记住这张图可以先把整篇论文压缩成然后再最后预测结果又会供下一帧使用。最重要的是当前帧不是直接进入 mask decoder 而是先被历史目标信息条件化然后真正的 spatial segmentation 仍然复用 SAM 的 decoder 范式SAM 提供 prompt-to-mask spatial priorSAM 2 在此基础上加入 memory-conditioned visual representationCONVERSEG 再进一步把 VLM semantic representation 接到这个 segmentation interface 上所以三篇工作的关系可以很简洁地理解为SAM: prompt → pixelsSAM 2: prompt memory → pixelsCONVERSEG: VLM semantics → SAM2-style prompt/conditioning → pixels

相关推荐

山东大学 泰山学堂计算机取向 某蒟蒻的作息规划(我要打ICPC!)
山东大学 泰山学堂计算机取向 某蒟蒻的作息规划(我要打ICPC!)

时间段星期一星期二星期三星期四星期五星期六星期日06:40-07:20起床、洗漱、早饭起床、洗漱、早饭起床、洗漱、早饭起床、洗漱、早饭起床、洗漱、早饭起床、洗漱、早饭起床、洗漱、早饭07:20-07:50背英语单词预习背英语单词作业背英语单词预习背英语单词作业背英语单词预习背英… · 2026/9/25 18:32:52

【共创稿事节】HarmonyOS 7 弱网优化实战:Network Boost Kit 场景加速 + QUIC 长连接 + 弱网直播优化
【共创稿事节】HarmonyOS 7 弱网优化实战:Network Boost Kit 场景加速 + QUIC 长连接 + 弱网直播优化

本文聚焦 HarmonyOS 7(API 26)的通讯能力,拆「冷启网络预建链 / QUIC 长连接 / 弱网直播优化」三件套。文中 API 名与接口来自官方文档,运行表现以真机实测为准。用户坐高铁出隧道、进地下车库的瞬间,网络从 5G 骤降到… · 2026/9/25 18:32:46

【八个月网安课程】第七周·周三:XSS 防御——输入输出编码、CSP 策略与 HttpOnly
【八个月网安课程】第七周·周三:XSS 防御——输入输出编码、CSP 策略与 HttpOnly

以下是第七周周三学习内容的详细展开。今天你将彻底切换到防御者视角,系统学习如何从根源上杜绝 XSS 漏洞。你会亲手加固有漏洞的代码,见证攻击 payload 一一失效,并理解 HttpOnly、CSP 等深度防御手段的威力与局限。 第七周周三:… · 2026/9/25 18:32:40

DeskcommCRM实践复盘:从选型、落地配置到团队效率提升
DeskcommCRM实践复盘:从选型、落地配置到团队效率提升

做CRM这条路上,我前后折腾过好几套系统,从轻量的表格管理到重型定制平台都碰过,最后兜兜转转停在了DeskcommCRM上。先说结论:这套系统不算那种第一眼惊艳的工具,但只要你把团队的实际业务流梳理清楚,它的稳… · 2026/9/25 19:05:59

CRM选型与私有化部署实战:从Excel到DeskcommCRM的落地经验
CRM选型与私有化部署实战:从Excel到DeskcommCRM的落地经验

做CRM选型这件事,我是从去年年中才开始真正想明白的。当时业务团队扩张到三十多人,销售手里各有一份Excel,客户跟进记录一半在微信聊天里,一半在手账本上,周会汇报全靠记忆,客户重不重要全凭感觉&#xff0… · 2026/9/25 19:05:59

DeskcommCRM落地复盘:从Excel到客户管理系统的完整实践
DeskcommCRM落地复盘:从Excel到客户管理系统的完整实践

今年年初,我们团队做了一次在我看来挺大的调整:把销售和客服手里散落的Excel表格、微信聊天记录、邮件往来,全部收进了一套叫DeskcommCRM的系统里。当时团队一共9个人,客户400多个,说多不多,但已经明显感觉… · 2026/9/25 19:05:53

桌面沟通型CRM:让客户管理融入日常沟通的新思路
桌面沟通型CRM:让客户管理融入日常沟通的新思路

1. 内容整体设计与思路拆解1.1 为什么我会盯上DeskcommCRM这个名字说实话,我第一次看到DeskcommCRM这几个字的时候,第一反应是这又是个套壳的客户管理系统。国内叫CRM的产品没有一千也有八百,从Salesforce到纷享销客、销售易,再到… · 2026/9/25 19:05:53

知矩地图下载器拼接大图GIS软件全球高清卫星影像、离线地图加载
知矩地图下载器拼接大图GIS软件全球高清卫星影像、离线地图加载

软件获取地址: 百度网盘 软件获取地址: 百度网盘 知矩地图下 载器是一款面向测绘、规划、科研和工程应用的专业地图浏览与数据获取软件。软件支持天地图、ArcGIS、Google、OpenStreetMap等多种在线地图服务,可进行地图切换、缩放、定位、搜索和多图层叠加显示。内置… · 2026/9/25 19:05:53

桌面通信型CRM实战:从客户数据自动沉淀到高效管理的完整方案
桌面通信型CRM实战:从客户数据自动沉淀到高效管理的完整方案

1. 为什么我最终选定了DeskcommCRM这类桌面通信型CRM大概在半年多前,我们团队在客户管理这件事上彻底扛不住了。销售在微信里聊客户,售后在电话里接反馈,再加上企业邮箱里的往来记录,三套信息互相不打通,经常出现“上午… · 2026/9/25 19:05:53

数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)
数值优化(Numerical Optimization)学习系列-03-共轭梯度方法(Conjugate Gradient)

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31

MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码