
怎么配资炒股官网
先说一个实验。
研究者拿了500道图片题,先用一个叫VisionZip的方法把图片的视觉信息砍到只剩10%,然后让模型用贪婪解码(也就是每次都选概率最高的答案,只回答一次)去做题。结果只对了53.2%。
按照常理,这时候大家会说:信息被删掉了,模型看不到关键细节,所以答错了。这个解释听起来很合理,几乎所有做视觉token压缩的论文都是这么讲的。
但研究者没有就此打住。他们让模型在同一份被砍掉90%的视觉信息上,反复采样生成64次答案,也就是Pass@64。结果准确率涨到了79.6%。
这个数字很奇怪。如果视觉信息真的丢了,那不管采样多少次,模型都不该答对,因为它压根没看见那个细节。可现实是,只要给足够多次机会,模型能找到正确答案的比例几乎翻倍。作为对照,研究者还试了完全不给图片、只靠文字瞎蒙的情况,64次采样下来准确率只从2.8%爬到4.2%,几乎没什么变化。
这说明什么?
说明视觉信息其实还在那儿,没有真的丢。模型只是没能稳定地用上它。
这就是这篇论文的核心发现,研究者把它称为**表征-利用差距**。也就是说,压缩后的视觉表征里其实还留着足够回答问题的证据,问题出在语言模型这一侧,它没能可靠地把这些证据调用出来完成推理。
这个发现推翻了一个大家默认的假设
在这篇论文之前,几乎所有做视觉token剪枝的工作都在琢磨一件事:怎么才能更聪明地挑出重要的token,尽量别把关键信息删掉。逻辑很直接,性能掉了,那肯定是删错了东西,所以要设计更好的挑选算法。
**这篇论文说,这个逻辑只对了一半。**
即便挑选算法已经保留了足够的信息,模型依然可能用不好这些信息。换句话说,问题不完全出在"删了什么",也出在"语言模型有没有学会怎么用剩下的东西"。
这个区分很重要,因为它指向了两种完全不同的解决思路。一种是继续钻研更好的剪枝算法,试图让保留下来的token更"精华"。另一种是保持剪枝算法不变,转而去调教语言模型,让它更擅长从稀疏的视觉线索里挖出答案。这篇论文走的是第二条路。
这里可以做一个类比。
想象你是个侦探,去一个凶案现场勘查。原本现场有100件证物,但因为预算有限,你的助手只帮你带回来了10件,这10件里其实已经包含了破案的关键线索,比如凶器上的指纹和一根头发。但你这个侦探平时办案习惯了看100件证物的排列组合来推理,突然只给你10件,你脑子转不过来,还是习惯性地用老套路分析,结果错过了那根头发的线索,破不了案。
如果这时候你的助手继续去挑选"更好的10件证物",可能确实会有帮助,但更直接的办法,是训练你这个侦探重新适应"只有10件证物"这种局面的推理方式。多试几次,你其实是能破案的,只是没有专门练过这种精简版的办案流程。这篇论文做的,正是"训练侦探适应少证物办案"这件事,而不是继续折腾"怎么挑证物"。
推理式VLM*:Reasoning Vision-Language Models,一类会先生成一段思考过程(类似人类解题时打草稿),再给出最终答案的视觉语言模型,通常用``和``标签把思考和结论分开。
视觉token*:图片或视频被视觉编码器处理后,切分成的一个个"信息单元",语言模型就是靠读这些token来理解图像内容的,高分辨率图片或长视频往往会产生成百上千个token。
问题的根源在于,推理式VLM处理图片和视频时,需要把它们编码成一长串视觉token,这串token越长,语言模型处理起来就越贵,推理速度也越慢。于是学界一直在琢磨怎么把这串token压短,常见思路包括剪枝(直接删掉不重要的token)、合并(把相似的token融合成一个)、压缩(用更紧凑的方式表示)。这些方法在压缩比例不高的时候效果还不错,但一旦压得狠了,比如只保留10%甚至5%的token,性能就会断崖式下跌。
SCOPD:让学生在残缺信息里练习推理,老师用完整信息批改
既然问题出在"语言模型不会用稀疏信息",那顺理成章的解法就是:让模型专门针对这种稀疏场景做训练。
具体怎么做?研究者设计了一个叫SCOPD的框架,全称是Sparse-Context On-Policy Self-Distillation(稀疏上下文在线策略自蒸馏)。
自蒸馏*:一种训练方式,不需要外部的更强模型来当老师,而是用同一个模型的不同"状态"或"视角"互相教学,比如这里用能看到完整图片的模型版本,去教只能看到残缺图片的模型版本。
在线策略*:指训练时用的样本,是模型自己当下生成出来的,而不是提前准备好的固定答案,这样能保证训练数据和模型实际推理时遇到的情况高度一致。
SCOPD的运作方式是这样的。先让"学生"模型(也就是只能看到10%视觉token的那个版本)自己生成一段推理过程,包括打草稿的思考和最终答案。这段推理是学生自己"现场发挥"出来的,不是提前写好的标准答案。
然后,拿着学生写出来的这段草稿,交给一个"老师"模型去打分。这个老师和学生其实是同一个模型,唯一的区别是,老师能看到完整的、没被剪枝的100%视觉信息。老师会在学生写的每一步草稿后面,给出"如果是我,接下来会怎么想"的概率分布。
最后,训练目标就是让学生的每一步思考,逐渐向老师的判断靠拢。用的是一种叫KL散度的数学工具,衡量两个概率分布之间差多少,然后通过训练缩小这个差距。
KL散度*:全称Kullback-Leibler divergence,一种衡量两个概率分布"有多不一样"的指标,数值越小说明两个分布越接近。
这里有个巧妙的地方,值得多说两句。学生自己写草稿的时候,用的是残缺信息,这保证了训练场景和它未来实际部署时看到的场景完全一致,不存在"平时练习用完整图片、上场考试却只给残缺图片"这种训练和实测不匹配的问题。而老师打分用的是完整信息,相当于站在"上帝视角"告诉学生,你这一步这么想是对的还是错的,正确方向应该往哪儿偏。
整个过程不需要人工标注的标准答案,也不需要额外改动模型结构,更不需要在实际使用时增加任何计算量,因为老师这个角色只在训练阶段出现,真正部署上线跑推理的时候,只有学生模型自己在工作。
这个设计可以类比成一个学徒厨师的培训方式。
假设你是个厨师学徒,未来要去的餐厅食材供应紧张,很多常见调料和食材都没有,只能用手头有限的几样东西做菜。如果师傅平时教你的时候,永远用食材齐全的后厨来演示,你学到的搭配技巧和判断经验,到了食材紧缺的实战场景里根本用不上,因为你从没练习过"只有这几样东西该怎么搭配"。
更合理的做法是,让你在食材紧缺的条件下亲自尝试做菜,师傅站在旁边,师傅自己手头食材是齐全的,他一边看你紧缺条件下的操作,一边告诉你,这一步如果食材齐全我会这么处理,你现在食材不够,但这个思路你可以保留,那个思路得调整。你练习的场景和未来上岗的场景完全一致,师傅给你的反馈又是基于对这道菜"完整而正确"的理解。这样训练出来的你,才真正适应了资源紧张的厨房。
如果不这样练,会发生什么?论文的数据给出了答案。在13个图像基准测试上,保留10%视觉token时,什么都不做的基础模型(论文里叫Vanilla)只能保住原本满血表现的86.37%。而用了SCOPD训练之后,这个数字涨到了90.49%。差不多4个百分点的提升,全靠让模型重新适应稀疏场景这一件事换来的。
SCOPD+:别对每句话都较真,抓住真正靠视觉才能答对的那几句
SCOPD已经有效果了,但研究者又往前走了一步。
他们发现一个问题:老师和学生在某一步意见分歧很大,并不代表这一步真的是靠视觉信息才能判断对错的。
举个论文里的例子。学生写"这条街道...",老师觉得应该写"这条道路...",两者意思完全一样,只是用词习惯不同,这种分歧跟图片里到底有没有那条路半点关系都没有,纯粹是语言表达上的差异。还有一种情况,学生答案的大小写不同,比如"pupa"和"Pupa",这种分歧同样和视觉证据无关。
如果对每一步分歧都一视同仁地去纠正,那训练资源就会被大量浪费在这些和图像内容毫不相干的琐碎语言习惯上,真正需要视觉信息才能纠正的关键步骤,反而没有获得足够的关注。
**这就好比批改作文,老师如果把力气都花在纠正学生"的地得"用错了、句号打成逗号这种小毛病上,那些真正体现学生逻辑硬伤、论证漏洞的段落反而没时间细看。**
于是研究者设计了SCOPD+,核心思路是先找出哪些位置是"真正依赖视觉信息"的,再集中火力去纠正这些位置。
怎么找?他们设计了一个很直接的探测方法:给学生模型手头的视觉token稍微加一点点,比如从10%加到11%,看看这一丁点儿信息增量,会不会让模型下一步要说的话发生明显变化。如果加了这一点信息之后,模型的判断变化很大,说明这一步确实是靠视觉线索在支撑的。如果加了信息之后模型的判断几乎没变,那这一步大概率只是在按照语言习惯往下写,跟图片里到底有什么关系不大。
这个探测过程用的指标叫JSD(Jensen-Shannon散度)。
Jensen-Shannon散度*:一种对称版本的KL散度,专门用来比较两个概率分布之间的差异,取值范围有明确的上下界,不会因为某个极端小概率事件就被拉得特别大,所以比较适合用来横向对比不同位置的"敏感程度"。
找到这些对视觉信息敏感的位置之后,SCOPD+只在这些位置上,让老师去纠正学生,其余位置就不管了。论文里默认只挑10%最敏感的位置,剩下90%的位置直接跳过,不参与这种精细纠错。
结果如何?还是那13个基准,10%视觉token的场景下,SCOPD+把归一化后的平均表现进一步推高到92.43%,比SCOPD的90.49%又多了近2个百分点,而且只用了10%的反向传播计算量,效率反而更高。
实验数据说了什么
研究团队用Qwen2.5-VL-7B-Instruct作为基础模型,配合VisionZip剪枝方法,在不同的视觉token保留比例下做了系统对比。除了Vanilla(不训练直接用)、SCOPD、SCOPD+,他们还对比了另外三种方法。
一种是SFT,也就是传统的监督微调,直接拿标准答案和推理过程去教模型,属于最朴素的做法。一种是EPIC,一种专门针对视觉压缩场景设计的渐进式一致性蒸馏方法。还有一种是GRPO,一种基于强化学习的方法,靠模型自己采样多个答案、根据对错给奖励来训练。
下面这组数字比较关键。100%视觉token(也就是不压缩)的情况下,几种方法差距不大,SCOPD和SCOPD+的表现分别是100.67%和100.02%,基本和不压缩时打平,这说明这两种方法主要是在"补救"压缩带来的损失,而不是无差别地全面提升模型。
10%保留比例这个更严苛的场景下,差距就拉开了。Vanilla是86.37%,SFT是88.82%,EPIC是86.45%,GRPO反而掉到了85.73%(比Vanilla还差),SCOPD是90.49%,SCOPD+是92.43%。
GRPO这个结果值得多说两句。论文专门做了一组实验去分析原因,发现问题出在训练信号太稀疏了。GRPO每次采样4个答案,如果模型对某道题特别有把握,4个答案全对,那这组样本对训练毫无贡献,因为没有对错之分可以比较。数据显示,训练过程中超过一半的采样组是"全对",只有大约三分之一的组里既有对的又有错的,能提供真正的学习信号。真正能推动模型进步的信号太稀薄了,训练了2500步,模型的准确率几乎纹丝不动。这也从侧面说明,SCOPD和SCOPD+这种每一步都给出密集反馈的方式,比GRPO这种只在最后给一个粗糙对错信号的方式,在这个特定场景下更有效率。
在10%保留比例这个更严苛的条件下,SCOPD+在13个基准里有8个超过了SCOPD,在LogicVista(逻辑推理)、MathVerse(数学视觉推理)、VisOnlyQA(纯视觉感知)、HR4K(高分辨率理解)这几个特别依赖精细视觉理解的任务上,提升尤其明显。这个模式挺说得通的,因为SCOPD+本来就是专门针对"视觉敏感"的位置去加强训练的,那些真正需要看清图片细节才能答对的任务,自然受益最大。
研究者还做了一系列泛化性测试,来验证这套方法不是只在特定条件下管用的"巧合"。
他们换了不同的剪枝算法,包括基于多样性的DivPrune、纯随机剪枝、以及在语言模型内部做剪枝的FastV,结果SCOPD+虽然只用VisionZip训练过,换到其他剪枝方法上依然能带来明显提升,比如FastV场景下从81.47%提升到86.03%。这说明学到的不是"怎么应付VisionZip这一种剪枝方式",而是更通用的"怎么在信息稀疏时做推理"这种能力。
他们还换了模型架构,从Qwen2.5-VL-7B换成Qwen3-VL-4B,10%保留比例下,Vanilla是75.29%,SCOPD+能提到82.92%,说明这套方法不依赖某个特定模型的内部结构。
最有意思的是视频泛化实验。整个训练过程只用了图片数据,没有任何视频专属的训练,但拿去测视频理解基准的时候,SCOPD+依然把归一化表现从90.88%提到了96.60%。这意味着模型学到的"怎么从稀疏视觉信息里挖信息"这件事,是可以跨模态迁移的,图片上学到的本事,视频上也能用。
这些设计选择背后的取舍
论文里还有几处消融实验,挑几个说说。
关于SCOPD+要选多少比例的位置去精细纠错,研究者试了10%、20%、40%、60%、100%这几档,发现10%效果最好,选得越多反而越不好。这个结果乍一看有点反直觉,按理说纠正的位置越多,模型学到的东西应该越全面才对。但仔细想想也合理,如果把那些语言习惯性的分歧也拉进来一起纠正,等于是在稀释真正重要的信号,把宝贵的训练资源花在了不该花的地方。
关于视觉信息增量δ该设多大,测试从10%加到11%(δ=1%)效果最好,加得太多(比如δ=10%)反而不如小幅度增加。这个也说得通,因为部署时模型实际能看到的就是10%,用δ=1%这种小幅探测,测的是模型在10%这个具体工作点附近的敏感程度,这和它实际部署时面对的情况最贴近。加得太多,测出来的敏感度反而和实际部署场景脱节了。
关于老师模型该怎么维护,研究者对比了三种方式:用EMA(指数移动平均)持续缓慢更新的老师、完全固定不变的老师、以及直接用学生当前权重当老师(相当于没有独立的老师)。结果显示,如果直接拿学生自己当老师,训练会整个崩掉,13个基准的平均表现只剩12.35%,几乎是灾难性的。这说明老师必须保持一定的"独立性"和"稳定性",不能和学生实时同步变化,不然整个训练信号会自我坍缩,学生教自己,等于没有外部纠正力量,很容易越学越偏。
这可以理解成一个组织里"审核人"和"执行人"如果是同一个人会出什么问题。
如果一个公司的质检员和生产工人是同一个人,他生产的时候有什么习惯性偏差,质检的时候大概率也会带着同样的偏差视角去看,根本发现不了问题,产品质量只会越来越差。质检员必须是相对独立的第三方视角,哪怕这个视角也在慢慢学习进步,也不能和生产端实时绑死同步,不然监督就失去了意义。
论文还测了训练时用前向KL还是反向KL,差别不大,分别是92.43%和92.39%。用JSD代替KL会稍微差一点,91.55%。这说明具体用哪种散度公式影响不算太大,真正关键的是"有没有一个相对稳定独立的老师在监督"这件事。
写在后面
这篇论文让我重新想了一遍"压缩会损失信息"这句话到底意味着什么。
我们平时讨论模型压缩、剪枝、量化的时候,几乎默认了一个前提:性能下降就等于信息丢失。这个假设太自然了,以至于很少有人去专门验证它。但这篇论文用一个简单到近乎朴素的实验,就把这个假设撬开了一条缝:同一份被砍掉90%信息的输入,反复问64次,答对的比例能从53%涨到近80%。这说明性能下降和信息丢失,压根不是一回事,至少不完全是一回事。
有一个细节我觉得特别值得单独说说。论文里提到,光看KL散度大小去判断"这一步是不是因为视觉信息才产生分歧",是不靠谱的,因为很多高KL散度的位置,其实只是"shows"和"depicts"这种同义词选择,或者答案后面加不加一个换行符这种格式差异。这提醒我,做任何依赖"分歧程度"来判断重要性的系统时,都得先问一句:这个分歧的来源,真的是我关心的那个维度吗?还是掺杂了大量无关的噪声?这个陷阱其实挺容易踩的,因为分歧本身是很容易量化的数字,但分歧的"原因"往往需要额外一步探测才能确认。
还有一点让我意外的是GRPO在这个场景下的失败。强化学习式的训练现在很流行,但这篇论文用非常具体的数字告诉你,当训练信号本身就很稀疏(超过一半的样本组全对,没法提供有效对比)的时候,再花哨的强化学习框架也很难产生实际效果。这是个挺朴素但容易被忽略的教训:方法本身的先进程度,抵不过训练信号是否真正到位。
这篇论文没有解决的问题也很明显。它测试的场景基本都是短篇幅的图片和视频问答,那种需要长时间跨越、多步骤记忆和推理的场景,比如需要机器人在一个复杂环境里连续操作几十步的任务,或者需要理解一部两小时电影情节走向的场景,这套"表征-利用差距"的诊断方式还没被验证过。如果视觉信息要在几十步、几百步的推理链条里持续被调用,这个差距会不会被放大,会不会出现新的失效模式,这是个还没有答案的问题。
Q&A
Q1:SCOPD和SCOPD+是什么?
A:SCOPD是一种让视觉语言模型适应稀疏视觉信息的训练方法,让学生模型在压缩后的图片上自己生成推理过程,再用能看到完整图片的老师模型去纠正。SCOPD+在此基础上,只挑出对视觉信息真正敏感的推理步骤进行重点纠正,效果更好且计算量更省。
Q2:为什么剪掉90%视觉token后模型性能会大幅下降?
A:论文发现这不完全是因为视觉信息真的丢了。研究者用同一份稀疏视觉信息反复采样64次,正确率能从53.2%涨到79.6%,说明关键证据其实还在,只是模型没能稳定地把它用出来,这个现象被称为表征-利用差距。
Q3:SCOPD+训练出来的模型能不能直接用在视频理解任务上?
A:可以。论文只用图片数据训练模型,没做任何视频专属训练,但拿去测视频理解基准时,SCOPD+依然把10%视觉token保留比例下的归一化表现从90.88%提升到了96.60%怎么配资炒股官网,说明学到的能力可以跨模态迁移。
易配网提示:文章来自网络,不代表本站观点。