您的位置:首页 > 手游攻略 > 理解视频,而非止于VLM:用SAM 3构建基于证据的视觉记忆

理解视频,而非止于VLM:用SAM 3构建基于证据的视觉记忆

作者:互联网  时间: 2026-07-29 07:07:54  

多年从事视频分析相关工作后,我总会重新面对同一个令人不安的问题:系统给出精准的视频答案时,能否同时展示答案来自哪里?

视觉语言模型(VLM)能够观看视频,并提供颇具说服力的描述。然而,一旦追问“物体究竟何时越过边界”“在某一区域停留了多久”或“答案由哪些帧支撑”,问题便显现出来。

    描述属于语言任务,测量则属于证据任务。 我由这种区分出发,构建了“扎根视觉智能”(Grounded Visual Intelligence)。这项实验先将视频处理成结构化且可查询的证据,语言模型只在之后负责解释。

我希望这套系统遵守一条简单规则:

让感知模型来观察。让确定性工具进行测量。让 LLM 来规划和解释——并附上引用。

本文把这条规则实现为一个可操作的小型系统,以 SAM 3 作为核心感知路径,Grounded DINO + SAM 2 作为可复现基线。两条管道分析同一段十秒视频,并生成相同且与模型无关的证据图。

一、回答流利不代表答案经过衡量

假设你向一个视频助手提问:“从隔板左侧到右侧,白杯是在什么时候完成移动的?”

多模态模型也许会给出“大约四秒”的回答。答案虽有用,却仍留下若干尚未解决的工程问题:

跨帧遵循的是哪些物体身份?

“左”与“右”由哪条空间规则界定?

时间估算采用了怎样的分辨率?

答案能否由其他组件重现,同时无需再次运行 LLM?

审查者能否直接定位到支撑帧?

问题不只是答案可能错误。即便答案大体正确,如果证据、语义和不确定性均被隐藏,其操作基础依然薄弱。针对可衡量的视频问题,我需要另一种合同:只要系统能依据跟踪观测计算时间戳,语言模型就无须直接从像素中估算时间戳。

二、架构:可移动的一层证据

整条管道承担四项核心职责,从而清楚划分感知、测量和语言之间的边界。

    1. 由感知生成观察

感知层负责检测或提示对象、完成分割,并在剪辑过程中维持对象身份。

主路径 (SAM 3):图像级检测与基于内存的视频跟踪器被它结合起来。“可提示概念分割”在接收概念提示后,会输出可持久跨越图像和视频的身份掩码。

基线 (Grounded DINO + SAM 2):Grounded DINO先将文本提示转为第一帧中的开放集检测,随后由SAM 2借助其流式存储器架构,在视频中传播选定对象。

这两条路径采用截然不同的模型栈,但系统中的其余部分不应关注这种差别

    2. 由证据图规范化输出

各适配器都会把自身的本地张量和响应对象,转换成可以移植的场景文档。中央记录则被有意保持得十分小巧:

Scene  metadata: source, width, height, fps, duration  tracks[]    track_id    concept    observations[]      frame_index      timestamp_s      bounding_box      confidence      mask_uri  zones[]  provenance[]

掩码存储为行主要二进制 RLE 伪影(Artifacts)。模型权重、CUDA 张量和框架对象不跨越此边界。这意味着测试、分析工具和浏览器可以从录制的 JSON 和 RLE 文件中工作,而无需导入 PyTorch 或任何 SAM 实现

    3. 由确定性工具回答可测量问题

场景内存提供以下操作:

统计某一概念的实例;

在指定时间范围内检索一条轨道;

测量已观测区域内的占用率;

找出一个区域的最后观测和另一个区域的最初观测;

把确切音轨、时间范围和帧数一并作为证据提交。

答案应当是数值以及相应证据引用——而非只有一句听来合理的话。

    4. LLM承担编排与解释

LLM把用户的问题转换为工具调用,再将结果组织成可读语言,但它并不掌握确定性仍体现在计数、过渡规则或时间戳上,而且这些内容不可检视。先完成测量,之后才进行生成,整个交互的可靠性因此发生变化。


三、受控场景:白杯实验

我刻意选择了一个简单的合成场景:白色杯子从标有 A 的区域移向标有 B 的区域,途中穿过狭窄隔板,并经过一本笔记本。这个场景近乎乏味,却也因此很有价值,因为每个假设都更容易被仔细检查。

属性
持续时间10 秒
采样率4 fps
分辨率560 × 316
总帧数40
提示词“white cup”
交互修正None (Google Colab Tesla T4)

A 区与 B 区均不包含分隔带附近的狭窄归一化带。区域归属通过轨道边界框的归一化中心判断。按 4 帧每秒计算,本次运行所能达到的最细过渡分辨率为 250 毫秒


四、系统能够捍卫的答案

两种感知路径都输出了一条杯赛跑道和40 个观测,证据框架没有遗失,轨道不存在间隙,并且得到了相同的 A 到 B 边界。

    得到的确定性答案是:

白杯在 3.75 秒到 4.00 秒之间从 A 区移到 B 区。它最后一次在 A 区(帧 15)被观测到,首次在 B 区(帧 16)被观测到。在 4fps 采样下,过渡被局部化为 250 毫秒窗口。

对入住率的测量结果同样完全一致:

测量项Grounded SAM 2SAM 3
A 区证据间隔0.00 – 3.75 s0.00 – 3.75 s
A 区停留4.00 s4.00 s
B 区证据间隔4.00 – 9.75 s4.00 – 9.75 s
B 区停留6.00 s6.00 s

 

五、两条模型路径具有多大一致性?

发现同一个杯子并不出人意料。更值得关注的是,两条管道能否生成足够相似的空间证据,进而支撑同一测量结果?为此,我逐帧匹配各自的单杯轨迹,并对二进制遮罩、包围盒及遮罩重心进行比较。

全部 40 帧的结果呈现出惊人的一致性:

一致度量指标结果
平均掩蔽 IoU0.9694
中位掩蔽 IoU0.9692
在 3.75s 处的最小掩蔽 IoU0.9487
最大掩蔽 IoU0.9829
平均边界框 IoU0.9648
平均重心距离0.447 px
最大重心距离1.068 px

掩膜重叠度最低的位置,是最后一个 A 区观测点,当时杯子正在靠近分隔线与笔记本。即使如此,两个系统在概念、身份、区域和过渡证据方面仍取得一致。

⚠️ 重要限制:一致并不代表准确。该片段缺少经过人工注释的真实地面掩码,因此两个系统可能结果一致,却同样出错。此次比较只能支持一个更有限的结论:对于这一受控场景,使用任一感知堆栈,实质上都会得到相同的下游证据和确定性答案。


六、信心属于整体模式——并非通用数字

两条流程同时表明,模型元数据为何必须保留自身语义。

在 Grounded SAM 2 中,初始 Grounding DINO 种子分数被用作传播观测的置信度。

在 SAM 3 中,重复出现的值属于文本提示的配乐。

两者都不应该被表示成 40 个独立校准的帧置信度,也不能进行直接比较。因此,证据探索者为两者分别设置了不同标签:seed_score(种子评分)以及 track_score(轨道评分)。诸如 confidence)这样的泛名字段,只有在来源和含义一并传播时才真正有用。


七、记录操作观察,而非制作速度排行榜

相位时序和存储均在 Colab T4 上被这两次运行记录:

指标Grounded SAM 2SAM 3
总耗时37.30 秒19.57 秒
GPU 最高分配内存3.28 GiB1.81 GiB
进程 RSS3.88 GiB5.23 GiB

人们很容易就此停止分析,并声称“SAM 3 更快更轻”。然而,现有数据还不足以完全支持该结论:两者依赖边界不同,模型加载路径也不相同,而且这些结果都只来自单次运行。此外,进程 RSS 的变化方向恰好相反,SAM 3 的常驻内存反而更高。

可选的后处理被 Grounded SAM 2 笔记本跳过,原因是其可选编译扩展无法导入。我保留了这一警告的记录,而核心传播仍然正常完成。只有把这些令人尴尬的设置细节也纳入,可重复性才会更有价值。


八、让答案能够接受查验

最后提供的界面是一个静态证据浏览器。经过验证的视频、两个归一化的场景轨道和相应的 80 个 RLE 掩码会由它加载;托管 GPU 推理不会执行,请求也不会发送给 LLM。

探险者允许读者执行以下操作:

查找被引用的边界框架;

擦洗整条证据时间线;

切换 SAM 3 或 Grounded SAM 2;

切换显示遮罩、方框及区域;

对记忆来源、时机、得分、空档和覆盖范围进行检查。

默认视图采用SAM 3,因为它给出了最简洁的主概念提示路径;Grounded SAM 2则继续作为不受限制的基线存在。


九、实验能够证明什么,又无法证明什么

对我而言,最有价值的实验结果在于架构。结果表明,两种不同的视频感知堆叠能够被简化为稳定的证据合同。合同一旦建立,时间与空间问题就转化为针对轨道的确定性操作,不再是面对像素进行开放式猜测。

这项实验还没有证明VLM 误差总体会被系统减少,但以下内容不在它的评估范围内:

直接 VLM 基线

拥挤场景以及多个同类实例

长时间遮挡、重新识别与摄像机运动

真实操作画面(缺少真实掩码和过渡注释)

后续测试应当涵盖:建立带注释的多场景评估集,加入遮挡与再入,分别处理身份/掩膜/时间抽样的不确定性,利用深度及 3D 几何扩展图,并衡量端到端答案的质量与成本。


十、更宏观的理念

视频基础模型检测、分割及跟踪概念的能力正在增强,而这并未削弱上层架构的重要性,反而使其更加关键。

应用仍然必须保存观测内容、观测时间、测量方式,以及支撑相关主张的具体工件。否则,再强大的感知模型也只会成为文本生成器的又一个不透明输入。

我目前倾向采用的设计原则十分简单:

“如果视觉事实可以被测量,不要让语言模型去发明它。给模型一个工具,保留证据,让答案变得可寻。”

一种视频系统只能给出听起来正确的结果,另一种却能展示其工作,区别就在这里。


    可重复性说明

与模型无关的 Python 包、适配器、测试和两个 Colab 笔记本,连同受控源剪辑、验证结果文档、静态浏览器及绘图源代码,共同组成完整仓库。运行工件和项目结果文档则记录了精确来源、预备输入、检查点以及模型修订摘要。

参考文献

2025/2026,Carion 等,SAM 3:任何有概念的片段。

2024,Ravi 等,SAM 2:图像和视频中的任意片段。

2023/2024,Liu 等,Grounded DINO:开放型物体检测的基础预训练与 DINO 相结合。

2024,Ren 等,Grounded SAM:开放世界模型被组装用于多样化视觉任务。

SAM3 视频文档,Hugging Face Transformers。

最新游戏

更多

Copyright©2010-2019. All rights reserved | 波波三国游戏官网|[email protected]

备案编号:湘ICP备2022015115号-4