一个9B参数的模型,在细粒度视觉理解上把Gemini-3.5-Flash、Gemini-3.1-Pro、GPT-5.4、Qwen3.5-397B、和Kimi-K2.6(1T)甩在了身后。
没有外部教师,无需人工标注,推理时也不用任何工具,一次前向搞定。
小红书dots团队提出的Vision-OPD(Vision On-Policy Distillation,视觉在线策略蒸馏)框架,仅用约6.2K条全自动合成数据,便让9B模型在多个细粒度视觉理解基准上取得SOTA。
例如像下面这张图,“图中人物戴的护耳是什么颜色?”,眼神不好的都不一定能看出来,Vision-OPD轻松答对。
这是如何做到的?
团队发现,同一个模型,给它看裁剪放大的局部图,答细粒度问题的准确率比看全图高出18到22个百分点。
既然看局部一向比看全局强,那就让看局部的自己,去教看全局的自己。
多模态大模型(MLLMs)在通用视觉理解上已经很强,但碰到细粒度问题就犯难。图像里一小块不起眼的区域,占全图面积可能不到5%,模型在成千上万个视觉token里很容易把它忽略掉,转而根据全局场景编一个看起来合理的答案。
例如还是上面那张图,问Qwen3.5-9B,“图中那人戴的耳罩是什么颜色?”
给全图,模型答黑色,答案被淹没在了全局上下文里;而把耳罩那块区域裁出来单独给它看,模型答对了。
团队在ZoomBench上做了系统评测,结果很一致。Qwen3.5-4B、Qwen3.5-9B、GLM-4.6V、GPT-5.4、Gemini-3.1-Pro,区域输入的准确率全部高于全局输入,差距在18到22个百分点之间。参数规模从4B堆到上千亿,这道鸿沟纹丝不动。
堆参数解决不了这个问题。
最近流行的Thinking-with-Images(边想边看)方法,给模型配上裁剪、放大的视觉工具,推理时让它主动去抠局部,确实有效。但代价是反复编码图像、反复调用模型,推理开销成倍增长。
能不能把“放大聚焦”的好处,通过训练直接写进模型权重里?
Vision-OPD的做法,拆开看很简洁。
从同一个模型里派生出两个策略,共享同一套参数,只是看的图不一样:
裁剪教师,只看那块对准关键证据的裁剪放大图。这是特权视角,细粒度细节一览无余。
全图学生,看完整大图,和正常推理时的输入一模一样。
训练流程分3步:
学生先在全图上自己生成一段回答。然后,对学生写下的每一个token前缀,分别算出教师和学生的next-token分布。最后,把两者的散度压到最小。
梯度只流过学生。教师是个固定靶,用指数移动平均(EMA)做正则化,防止师生同步漂移导致训练崩溃。
这套组合有两个关键好处。
在线采样,训练时用的前缀就是学生自己生成的序列,和推理时的状态分布对齐。传统离线蒸馏(SFT)在教师生成的轨迹上训练学生,推理时学生走自己的路,前缀对不上,误差越滚越大。
稠密token级监督,每个token都拿到有意义的梯度信号。GRPO、DAPO这类强化学习方法,只有序列级的稀疏奖励,一批样本恰好全对或全错时,训练就停摆了。Vision-OPD不存在这个问题。
整个方法满足5个约束:在线采样、稠密token级监督、无外部教师、无真值标签、无推理时工具调用。
数据从哪来?一条全自动流水线,从无标注图像里合成三元组(全图、裁剪图、问题),总共6.2K条。
对原图做物体识别和分割,只保留面积占比小于阈值的小区域,这些区域最可能藏着细粒度证据。用Qwen3.5-397B给每个区域生成一个光看这块就能答的问题。把区域边界框叠回原图,加一句空间约束(比如“只关注红框里的物体”),作为学生输入。把区域裁出来放大2倍,作为教师输入。
因为裁剪图从无标注图像里自动抽取,这套流水线能适配任意图像语料。
团队把Vision-OPD用在Qwen3.5-4B和Qwen3.5-9B上,在6个细粒度视觉理解基准上评测:V* Bench、ZoomBench、HR-Bench 4K、HR-Bench 8K、MME-RealWorld-EN、MME-RealWorld-CN。
Vision-OPD-9B拿下79.68的平均分,总体第一。超过Gemini-3.1-Pro(79.25)、Gemini-3.5-Flash(79.24)、GPT-5.4(72.77),也超过大参数量的Qwen3.5-397B(77.44)和Kimi-K2.6(72.81)。
Vision-OPD-4B也有77.07,超过GPT-5.4和Kimi-K2.6。
和那些推理时反复裁剪、放大的Thinking-with-Images智能体模型比,Vision-OPD只需一次前向,速度快得多,分数还更高。
和同样数据、同样底座的其他训练策略比呢?
SFT在教师的轨迹上训练,分布对不上,MMStar从83.07掉到73.33,遗忘严重。
GRPO和DAPO也出现不同程度的通用能力退化。
Vision-OPD在细粒度任务上大幅领先的同时,MMVP、CV-Bench、MMStar、POPE这些训练分布外的任务,分数持平甚至微涨。
Vision-OPD到底有没有真的在弥合区域到全局的鸿沟?
团队追踪了训练过程中每个checkpoint的表现:同一道题,分别用全图和裁剪图作答,算两者的准确率差。差值越小说明模型越能从全图里找回裁剪才看得到的证据。
曲线很清晰。随着训练推进,鸿沟稳步收窄。两个Vision-OPD模型最终的鸿沟值,都低于GPT-5.4和Qwen3.5-397B。模型确实学会了在全图里直接锁定细粒度证据,把放大聚焦的本事内化进了权重。
模型看局部比看全局强,这道鸿沟靠堆参数填不上。
Vision-OPD的回答很巧妙,既然你自己看局部就是比看全局强,那就让看局部的你,手把手教看全局的你。不需要更强的外部教师,不需要人工标注,不需要奖励验证器,6.2K条自动合成的数据就够了。
从看个大概到看清细节,有时候差的不是能力,是一个把注意力引向正确位置的训练信号。
参考资料:
https://github.com/VisionOPD/Vision-OPD
https://huggingface.co/collections/yuanqianhao/vision-opd
https://arxiv.org/pdf/2605.18740
免责声明:本文来自算泥客户端,不代表超天才网的观点和立场。文章及图片来源网络,版权归作者所有,如有投诉请联系删除。