VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块
8096点击    2026-08-04 10:33

导读:视觉问答模型的准确率不断提高,但高分未必来自视觉理解 —— 当基准图像与答案已进入训练语料,模型可能只是复现了记忆。浙江大学等团队提出 ReKey:保留原始真实场景,只更新决定答案的那一小块视觉线索,使每轮评测都面向未见过的内容。


一次人工标注之后,系统可在每轮评测中随机生成新的视觉关键线索,并自动构造对应的问题与答案 —— 不重新生成整张图,也不重建整套基准。


VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块


  • 论文:REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation
  • 论文链接:https://arxiv.org/abs/2606.20736
  • 项目主页:https://xxxxxsun.github.io/rekey-vstar/
  • 作者:Tengjie Lin、Yutao Sun、Jingwei Ni、Shuhan Ge、Hao-Xuan Ma、Yanting Miao、Wangyue Lu、Mingshuai Chen、Tiancheng Zhao、Jianwei Yin


不换图,只换问题:高分有多少来自记忆?


V*Bench 是评估细粒度视觉搜索能力的常用基准,包含 191 张高分辨率真实场景图像。它的难点在于,问题往往不指向画面主体,而指向远离图像中心、面积极小、容易被忽略的局部细节 —— 论文把这类真正决定答案的内容称为 visual key(视觉关键线索)。正因为答案只取决于这一小块内容,一旦它长期固定不变,模型就有机会靠记忆而非观察答对。


为了检验这一点,研究者设计了诊断实验 Relabel V*:保留原始图像,只重写问题,让新问题指向图中另一个同样小、同样偏离中心的视觉线索。在全部 191 张图像上,8 个受测 VLM 准确率均下降,降幅 9.5–18.8 个百分点


VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

图像未改动,仅更换问题后,8 个模型的准确率全部落在原始成绩之下,降幅 9.5–18.8 个百分点。


既然图像未变,这一下降只能来自问题与答案组合的更新。它不足以单独证明训练数据污染,但与模型从静态基准中获得记忆收益的假设一致。不过这种做法有个明显的局限:每一轮都要人工重写全部问题,成本无法长期承担。ReKey 要回答的正是这个问题 —— 能否只做一次人工准备,之后让视觉线索自动持续更新?


怎么做到每轮评测都不一样?


ReKey 的思路是把人工投入压缩到一次性的准备工作上,之后交给自动流程反复产出新题。整个流程分四步:先由标注者在图上圈出可以被改动的小块区域(论文称为 edit slot),随后系统随机采样一组新的视觉内容,用图像编辑模型写入该区域,最后依据这次采样的记录直接生成对应的问题和答案。


VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

人工标注只发生在最左侧一次,右侧的采样、编辑与问答构造在每轮评测中自动重复。


标注者需要圈出的区域有两类:Replace slot 指向图中已有的目标,用于改变它的颜色;Add slot 指向一处合理的空白位置,用于插入原图中不存在的小物体。两类区域都要求紧凑、位置合理,并且在图中具有唯一指代。每轮评测开始时,随机种子决定启用哪个 slot,并采样出新的颜色、物体或位置组合。采样记录既指导图像编辑,也直接确定新问题和标准答案。


这样一来,答案在图像生成之前就由采样过程确定,无需再让另一个模型检查生成结果并重新标注,每道题都能追溯到具体的 slot、随机种子和采样内容。图像编辑由 GPT-Image-2 完成,编辑后的局部区域合成回原图。改动区域只占整张图约 0.1%,且标注者选定的区域与 V*Bench 原始问题所问目标的尺度相当,从而锚定了与原基准接近的视觉搜索难度。


VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

同一场景中只有决定答案的帽子颜色被替换,背景杂乱度与小目标尺度保持不变。


更新 visual key,记忆优势是否消失?


如果此前的差距确实源于记忆,那么更新 visual key 之后,成绩应当回落到人工重写问题的水平。研究者用 3 个随机种子各生成一套 ReKey 实例,在 8 个 VLM 上重复评测:原始 V*Bench 平均准确率 82.1%,ReKey 上降至 72.2%,平均下降 9.9 个百分点,所有模型均出现下降。降幅最大的集中在原始高分模型(Qwen3.6-Plus 下降 14.9 个百分点、Gemini 下降 13.0 个百分点),而原始成绩较低的 MiMo 和 Llama 各只下降 4.4 个百分点,与记忆收益越多、更新后失去也越多的预期一致。


VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

ReKey 上 8 个模型成绩均低于原始 V*Bench,平均下降 9.9 个百分点,整体贴近 Relabel V* 的水平。


Relabel V*(66.9%)提供了另一个参照。Qwen 和 GPT-5.5 几乎正好落在这条基线上(分别高 1.4 和 1.2 个百分点),说明 ReKey 恢复出了与人工重写问题相当的难度;其余模型平均高出 5.3 个百分点,研究者归因于 Relabel 只有一套固定题目,而 ReKey 具备采样多样性。那么会不会只是再生的题目更难?研究者用 LLaVA-1.5-13B 做了校准 —— 它是 V*Bench 原始论文中最强的开源基线,锚定了该基准公布的难度,且污染风险较低,若成绩大幅下滑就意味着任务本身变了。结果它只下降 6.1 个百分点,低于多数前沿模型,位置类问题几乎未变,而空间关系恰是对编辑痕迹最敏感的维度。这些证据指向同一结论:准确率的下降来自记忆优势的消除,而非题目难度的变化。


为什么最关键的一步仍由人完成?


既然除标注之外的环节都已自动化,那能否把最后这步人工也交给模型?研究者试着让 GPT-5.5 自动选择 edit slot,结果并不理想:它给出的 Replace 区域只有 33.6% 能准确覆盖目标;Add 区域虽然多数可用,但面积普遍偏大,约为人工标注的 3 倍 —— 模型明显偏好宽敞、显眼、容易下笔的位置。用这些区域生成的题目系统性偏简单,8 个 VLM 的准确率比人工标注版本高出 8.4–18.5 个百分点。


VQA高分是在看图,还是在记答案?ReKey只更新决定答案的那一小块

VLM 选定的区域明显更宽敞显眼,面积约为人工标注的 3 倍,使自动标注版本的准确率高出 8.4–18.5 个百分点。


如果模型已能稳定定位最隐蔽的视觉线索,它可能已具备评测所要测量的感知能力;而让能力不足的模型选题,则容易将自身盲点带入基准。因此 ReKey 只将 slot 选择保留为一次性人工步骤,其余环节均可自动完成。


全部 191 张图像的 slot 标注约需 16 人时,而同一组标注可跨随机种子反复使用。ReKey 的意义不在于发布一次更大的静态数据集,而在于将高质量真实场景转化为可持续更新的评测协议:保留原有视觉搜索环境,只更新真正决定答案的那一小块 —— 只要 visual key 可以持续刷新,靠记忆答对就不再是稳定的策略。


文章来自于"机器之心",作者 "机器之心"。

AI转型,免费服务,就找AITNT