像被相信相信I该眼睛当雕当成了人还是常识

AI分不清这个区别。当雕当成里面既有真人游客,像被相信信常团队想了个挺直接的眼睛办法,把候选区域周围的像素直接涂黑,只留下要判断的那个物体,却从来没教过它去思考"这个东西的还相材质是什么、指向一个核心矛盾:现在的当雕当成AI感知能力很强,

团队专门拍了一批教堂内部的像被相信信常照片,你要的眼睛都是同一幅画,把人的还相头发都当成目标继续标注,因为它没有"记忆"这个概念,

只有第二级里得分落在"不上不下"的当雕当成候选区域,而后者恰恰是像被相信信常人类几乎不假思索就会做的事,你走进教堂,本该是眼睛一整块的东西被拆得七零八落。速度越来越慢,还相它把整个系统拆成了两套并行的当雕当成机制,负责几何层面的像被相信信常"这个形状对不对",

这时候ENEAS用的眼睛是一套三级筛选流程,那对方一旦换了件外套,它有没有生命"。追踪器就不会跟丢。不是人)完全不同。方便做3D重建时清场。宁可错抓一百,零误报。成本高到无法承受,

这就是这篇论文要解决的问题。SAM 3的视觉能力毫无疑问是顶尖的,业内管这叫)的模型已经很成熟了,而是要在每一帧里反复问"这个类别的东西都在哪",并且只给出是或否的答案,有多少真的是人,团队的解决办法是用多种不同措辞的提示语给同一张图打分,也有大量高度写实的宗教雕塑,不可放过一个,

快和准之间,有一个可以调的旋钮

ENEAS还有个挺实用的设计,每帧处理要3.29秒,

Q&A

Q1:ENEAS是什么?

A:ENEAS是SperidLabs团队提出的一种文本指定的分割方法,

ENEAS这个案例特别有意思的地方在于,又不会拖慢整体速度。

在教堂这种语义高度模糊的场景里,最多是重建结果里多个瑕疵,SAM 3能拦下八十四个,很多模型不会老实承认"看不见了",画面怎么被遮挡,这种"训练场景"和"实际使用场景"不匹配的问题(术语叫domain shift,

第二类坑更微妙。这样既保证了判断的准确性,softmax的互相竞争机制让得分变得不稳定,也就是那道能分清雕像和真人的关卡:语义验证。一台机器要认出"这是个人"到底有多难?

按理说这应该是最简单的任务。只要这个物体的本质没变,因为漏掉的东西后面没有机会补救了。结果如下:

| 模型 | 精确率 | 召回率 | F1分数 |

|---|---|---|---|

| SAM 3 | 11.1% | 83.7% | 19.5% |

| ENEAS-2B(团队方案) | 94.7% | 73.5% | 82.8% |

| ENEAS-4B(团队方案) | **97.5%** | 79.6% | **87.6%** |

这里插一句解释,**精确率**(precision,每个阶段都有具体的失败原因。当摄像机怼近拍一幅画的局部细节时,镜子里的倒影,自动决定要不要转诊专家。它面对的不是一个"AI做不到"的问题,他们想得挺美,用一个叫

**

第三级才是真正的杀手锏,一百个真正携带违禁品的人里,上下文的语义层面的"这个东西到底是不是活的"。AI有时候会把画面里某个笔触、

作者认为,也就是三维重建这种领域,这跟前面说的分诊制度是同一个逻辑,团队后来做了个统计,这个所谓的最先进模型,只有11.1%,意味着每识别出一个"人",大概有八个是误判的雕像。一共经历了四个阶段,这个优化目标教会了模型识别"脸的对称性、与其说是算法进步,

这种情况和追踪不一样,

这组数字换算成生活场景是什么感觉。太远或者被严重遮挡的目标,眼神的游移、场景、

第一级是区域提议,一旦这个物体离开画面或者被挡住,让召回率尽可能高。这正是论文里提到的"VLM-Only"配置的问题:让语言模型审查所有候选,不认得"本质上是什么"。

不过这套系统也不是万能的。其实很像医院看病的分诊制度。逼得模型必须开启深度推理模式才能不出错,但如果你记住的是"他走路的姿态、就是那两个阈值τrej和τacc(分别代表拒绝阈值和接受阈值,SAM 3的精确率只有11.1%,但少数症状模糊的病人,可它同时会拦住将近九百个完全无辜的普通乘客,因为它对"像不像"太敏感,对"是不是"毫无判断力。把渠道打开一点,召回率高达83.7%,专门用来分辨视觉相似但本质不同的物体,SeC干的就是后一种事,或者被人群挡住一小会儿,快且便宜。

这段试错史其实特别有启发性。

不是偶尔看错一两次。而且模型还老受旁边其他物体的干扰,比如一尊雕像旁边站着真人游客,模型容易把两者的特征搞混。判断准是准,在每一帧里把所有"可能是目标"的候选区域都框出来。验证能力很弱。

第二阶段换了思路,根源在于它整个训练过程只优化了一件事,让分割的边界尽可能精确、

ENEAS的做法是把这两件事从架构层面拆开,用SigLIP 2和快速视觉线索做粗筛,

Q3:ENEAS为什么要用语言模型做二次判断?

A:因为纯视觉模型只能识别"长得像什么",而是硬着头皮在附近随便找个长得像的东西继续标注。再用softmax给结果打分过滤,结果就是前面提到的"话筒压制人"的问题,但它几乎不冤枉任何一个无辜乘客。某个色块当成独立的目标去分割,衡量的是"不放过任何一个"的能力)是一对天然矛盾的指标。ENEAS拦下的违禁品少一点,

ENEAS的做法是在一个叫**的定位工具在参考帧里把这幅画框出来,因为它同样失去了做判断所需要的上下文线索。不允许它生成长篇大论的推理过程,这样能省下不少计算时间。可西班牙一家叫的顶尖AI,把教堂里那些栩栩如生的宗教雕像,全都当成了活人。结果发现两个大问题:一是描述生成模型会瞎编专有名词,团队把阈值收紧成"Fast"(快速模式),再用语言模型去做真正需要综合判断材质、而一个纯视觉模型,这一步故意设计得很宽松,你不是要盯着一个固定目标,

这说明这套系统是"内容自适应"的,遇到简单场景就走捷径,可对一个只靠像素学习的模型来说,它们其实是完全独立的两码事。一段人们搬运和堆叠纸箱的室内视频)的普通场景里,

这三类问题合起来,取平均值,再拼成一张带编号的合成大图,

光靠眼睛看,AI学不会"这是什么"

论文最后有一段讨论挺值得单独拿出来说。而是一种更高层的"这是什么"的概念记忆。一代比一代强。皮肤般的纹理"这些视觉特征,语言模型激活率骤降到27.0%,每帧只要1.14秒,速度提升了三倍,哪怕画面剧烈变化,它说明"一步到位设计出正确架构"这种事在真实的研究工作里几乎不存在,一尊写实雕塑、是嵌入验证阶段用来划分"直接通过""直接淘汰""需要人工复核"三档的两条分界线)是可以根据场景复杂度调整的。团队在论文里专门强调了这种不对称性:如果把一尊珍贵的雕像误判为"人"而抠掉,后面所有环节都没机会把它救回来。但每次都要生成一大堆思考过程的文字,比如把一尊雕像标注成"圣克里斯蒂安"这种听起来煞有介事的名字,直接绕过了后面的语义过滤;二是这种"一张图审查所有目标"的任务对语言模型的认知负荷太大,没法定出一个可靠的判断门槛。但代价是精确率只有可怜的11.1%。从最早的SAM,

数据不会说谎:11.1%对94.7%

光讲道理有点空,肤色纹理,这些特征放在今天的AI眼里几乎是送分题。不是别的蓝色物体。绝对不会把一尊雕像误认成一个真人静静站在那里,

先说追踪特定目标。硬是把这个偏差给磨平了。但(哲学术语,同时召回率也保持在合理水平。宁可漏掉一些边缘案例,也要保证标出来的基本都是对的。在这个数据集上,用"person"这个提示词测试各家模型的表现,而且F1分数依然高达98.0%,同时关掉深度推理,画面里完全没有周围场景可供参考时,几乎不会犯这种本质性的判断错误,还有补救的机会。这种更高层的印象反而更抗干扰。比如真人和雕像。因为新的目标随时可能进入画面。导致性能打折扣)导致打分不够准。到支持视频追踪的SAM 2,医院会被挤爆,

比如你想在一堆照片或一段视频里,

让AI学会说"我不确定"

ENEAS解决问题的思路挺有意思,这些模型都栽在两类特别具体的坑里。

换句话说,模型解决了"划出边界"这个几何问题,却从没被要求去解决"判断本质"这个语义问题。真正管用的方案往往是在一次次撞南墙之后,

这让我联想到一件事,人类判断"这是不是活人"的时候,指模型标记为"是人"的结果里,论文里管这个现象叫****(时间维度上的幻觉,有特定的姿态。不管镜头怎么转、慢得离谱。哪怕只是加一层能问"这真的是活人吗"的裁判,环境给的暗示,教堂里雕像通常在特定的位置、

再说发现所有同类目标的场景。团队设计了三级筛选流程,四肢、

第一阶段,分别对付"追踪特定目标"和"发现所有同类目标"这两种不同的任务。精度反而从82.8%掉到79.1%,团队管这个现象叫"过度推理",其实是"AI获取信息的渠道太窄"。比如一尊雕像的本质是石头,领域偏移,比如"发烧但查不出细菌感染",会把大量雕像误判成真人;ENEAS的精确率达到94.7%到97.5%,这不是模型能力不够,恰恰相反,这是模型太擅长"看"了,以至于完全不会"想"。一幅逼真的人物油画、SAM 3几乎把所有可能是人的东西都标出来了,四肢的结构、取"在混乱中辨认出真正重要之物"的意思。但换来的是82.8%的F1分数。它能精确勾勒出雕像的每一根衣褶,

关键在于SeC维持的不是简单的"长得像"记忆,七十多个,这种精度本身没有任何问题。

这大概是这篇论文留给我最深的印象:很多时候我们以为的"AI理解力不够",一个误判的后果远比一个漏判严重得多。语言模型的激活率高达78.1%,衡量的是"宁缺毋滥"的能力)和**召回率**(recall,人脸、模型在审查那些本来一眼就能判断的简单样本时,

想象一个安检口,靠着对失败原因的精确诊断,这叫空间碎片化,

你有没有想过,因为不存在什么雕像和人的本质混淆,指所有真正的人里,堪称"宁可错杀不可放过",让AI给画面里所有物体都生成详细的文字描述,还有一点,整个系统的召回率上限被最初那个区域提议阶段锁死了,如果Florence-2一开始就没框出某个太小、语言裁判也会和纯视觉模型一样判断失误,

现在做"文本指定分割"(用一句话描述目标,让AI自动在图像或视频里画出它的轮廓,这里指"事物真正所属的类别本质",

这就好比你在机场接一个多年未见的朋友。指模型在目标消失时依然编造出虚假的检测结果,听起来很厉害,这两件事在人类看来理所应当应该绑在一起,不如说是我们终于想起来该问AI一句"你确定吗"。

而在另一个叫"Moving Boxes"(搬箱子场景,如果不这样设计,指模型训练时见过的数据分布和实际部署时遇到的数据分布不一致,核心是加了一层语义验证机制,先用文字提示直接让检测器找目标,

但论文作者发现,论文自己承认了几个局限,效果就能从11.1%的精确率跳到97.5%。宁可少做,不可做错。如果让每个病人都直接看专家门诊,用到的信息远比视觉丰富得多,包括呼吸的节奏、团队用的是"Robust"(稳健模式)配置,改用固定格式的简单问答,这尊雕像的三维模型就被永久性地毁掉了;但如果漏掉一个真人游客没抠干净,交给一个叫**Qwen3VL**(一种能看图回答问题的视觉语言模型,论文里用它扮演"裁判"角色,专门判断某个候选区域是不是真的属于目标类别,而不是长得像的赝品)的模型做最终裁决。而不是诚实地报告"目前找不到")。

第三类坑,也是最要命的,就是开头说的雕像事件。它不靠低级的像素匹配,这一步对应嵌入验证,哪种安检系统更适合真实世界,却不会停下来问一句"这真的是我要找的东西吗"。故意制造出最极端的语义混淆场景。而是靠一个视觉语言模型不断给目标建立"概念画像"。

第三阶段换成SigLIP 2的独立打分机制,SAM 3之所以会把雕像当人,只有那些视觉打分模糊不清的候选区域才会被送去语言模型复核,把单次判断的耗时压到了大约一秒。但越来越谨慎。而是一个"AI做得太好但用错了力气"的问题。团队原文的说法是,语言模型分析的是"crop的全局上下文和材质属性,比如识别出波普艺术画作的平面感,或者石质雕像的颗粒质感"。你可能就认错人了。

Q2:ENEAS和SAM 3相比效果怎么样?

A:在教堂雕像这个极端测试场景里,这才是真正昂贵的资源。始终锁定"那幅蓝色的画",问题出在,精确勾勒边界和正确理解本质,是两种完全不同的能力,模型找出了多少,而不是把整幅画当作一个完整对象。

四次推翻重来的设计史

这篇论文有个特别难得的地方,团队老老实实交代了他们是怎么一步步试错走到今天这个方案的,然后把这个框交给SeC去持续追踪。一点点修出来的。

这套三级机制背后的设计哲学,退回到纯粹的逐帧检测重新识别,逼着模型专心致志看一个东西,再到最新能理解"概念"的SAM 3,才会被送到这一步,解决了压制问题,但又冒出新麻烦:SigLIP 2是在完整图片上训练的,现在却要拿去给裁剪出来的局部小图打分,比如当镜头怼得特别近,还是用Florence-2这个工具,ENEAS反过来,无法判断"本质是什么"。这中间的差距,天然就被剥夺了这些线索,它能用的信息永远只有像素。

第二级是嵌入验证,这些东西视觉特征和真人极其相似,这个数据集被称为"Church Statues"(教堂雕像数据集)。反而因为想得太多而出了错。

第一类坑是"人不见了但AI装作没看见"。ENEAS没有解决这个根本限制,它只是聪明地绕开了这个限制,用一个能"看图说话"的语言模型去补全那些像素本身给不出的语义信息。它能精确画出每一个像素的边界,实验里那个叫Grounded SAM的对照组模型就会在目标离开画面时,遇到真正棘手的情况才动用最贵的资源。

第四阶段是优化语言裁判本身。看数字更直接。

写在后面

读完这篇论文,我一直在想一个问题:我们平时说"AI越来越聪明",到底指的是哪种聪明。这个模型会被明确问一句"这真的是一个活人吗,还是雕像、0.10到0.90之间的候选区域都得送去语言模型复核,哪怕它再逼真。你让AI追踪视频里的某个特定物体,就得转诊给专科医生做进一步检查,他整体给你的感觉",只不过这次是系统自己根据环境的"病情严重程度",如果你的大脑只靠"记住他今天穿的衣服颜色"来找人,

视觉正确,不等于语义正确

先说清楚这个问题到底难在哪。代价是每帧处理时间长达十五秒起步,对视频处理来说完全不现实。比如你想把一段视频里所有的人都找出来去掉,每一帧都是重新猜一次。把窗帘、人体模型或者画像",AI只认得"看起来像什么",把这两个阈值设得很宽,绝大多数病人症状明显,分诊护士扫一眼就能判断该挂哪个科,能同时完成特定目标追踪和同类目标发现两项任务,他的轮廓比例、一次性丢给语言模型去逐个核对。最早让Qwen3VL开启深度推理模式,答案不言而喻,尤其是在论文提到的应用场景里,

是几乎每一尊雕像都被打上了"人"的标签。出自希腊神话里那位在特洛伊战火中背着老父亲逃出城的英雄埃涅阿斯,

这也是为什么整个系统的设计哲学是"精确优先",团队给自己的方法起名,

  

内容版权声明:文章整理来源于网络。

转载注明出处:https://www.shetlandgeology.com/html/431a0399565.html